电竞比分网-中国电竞赛事及体育赛事平台

關(guān)于ZAKER Skills 合作
虎嗅APP 22小時(shí)前

AI “大力出奇跡”的時(shí)代,還能走多久

本文來(lái)自微信公眾號(hào): HavenlonLabs ,作者:Havenlon Labs

當(dāng) " 大 " 的定義開(kāi)始改變

AI" 大力出奇跡 " 的時(shí)代,還能走多久

過(guò)去幾年,人工智能產(chǎn)業(yè)最有效、也最昂貴的方法論,可以被概括成一句并不嚴(yán)謹(jǐn)卻頗為傳神的話(huà)——大力出奇跡。

增加參數(shù)、擴(kuò)大數(shù)據(jù)、投入更多算力,模型的語(yǔ)言能力、知識(shí)覆蓋與任務(wù)表現(xiàn)通常會(huì)隨之改善。

這并非單純的行業(yè)信仰。2020 年,OpenAI 研究者發(fā)表的《Scaling Laws for Neural Language Models》顯示,語(yǔ)言模型的損失會(huì)隨著模型規(guī)模、數(shù)據(jù)規(guī)模與訓(xùn)練計(jì)算量的增長(zhǎng),呈現(xiàn)相對(duì)穩(wěn)定的冪律下降。換言之,在一定范圍內(nèi),投入與能力之間存在可被預(yù)測(cè)的關(guān)系。

這種可預(yù)測(cè)性,給產(chǎn)業(yè)帶來(lái)了此前罕見(jiàn)的確定性。一家公司不必先回答 " 智能究竟是什么 ",也不必完整破解人類(lèi)推理的機(jī)制,只需持續(xù)加大投入,然后觀(guān)察曲線(xiàn)是否繼續(xù)向下。

事實(shí)證明,這條路徑在相當(dāng)長(zhǎng)的時(shí)間里是有效的。從語(yǔ)言生成、代碼編寫(xiě),到圖像理解與復(fù)雜推理,越來(lái)越多原本需要分別設(shè)計(jì)的能力,開(kāi)始集中出現(xiàn)在同一類(lèi)基礎(chǔ)模型中。

但當(dāng)模型進(jìn)入萬(wàn)億參數(shù)量級(jí)、數(shù)據(jù)中心投資持續(xù)攀升、推理成本開(kāi)始成為損益表上的固定項(xiàng),一個(gè)問(wèn)題變得越來(lái)越現(xiàn)實(shí):這條路徑還能走多久?

答案可能既不是 " 很快終結(jié) ",也不是 " 永遠(yuǎn)有效 "。更接近事實(shí)的描述是:規(guī)模仍在擴(kuò)張,但擴(kuò)張的對(duì)象正在改變。

Scaling 并沒(méi)有消失。正在退場(chǎng)的,是 " 只把模型做大 " 的那個(gè)版本。

一、" 大 " 從來(lái)不只是參數(shù)

人們通常把大模型中的 " 大 " 理解為參數(shù)數(shù)量。這種理解不算錯(cuò)誤,但容易忽略一個(gè)事實(shí):能力的增長(zhǎng)從來(lái)不是單一變量的結(jié)果。

參數(shù)決定模型能容納多復(fù)雜的模式,數(shù)據(jù)決定模型能觀(guān)察到什么,算力決定模型能從數(shù)據(jù)中學(xué)到什么程度,訓(xùn)練方法則決定有限資源能否被有效利用。真正意義上的 Scaling,是這些變量的同步擴(kuò)大與重新配平——包括模型容量、訓(xùn)練數(shù)據(jù)、計(jì)算資源、訓(xùn)練時(shí)長(zhǎng)、后訓(xùn)練過(guò)程、推理階段投入的算力,以及來(lái)自外部工具與環(huán)境的反饋。

2022 年,DeepMind 的 Chinchilla 研究提供了一個(gè)反直覺(jué)的證據(jù):在相同訓(xùn)練計(jì)算預(yù)算下,700 億參數(shù)、但使用了數(shù)倍數(shù)據(jù)訓(xùn)練的 Chinchilla,整體表現(xiàn)超過(guò)了 2800 億參數(shù)的 Gopher。研究結(jié)論是,當(dāng)計(jì)算預(yù)算固定時(shí),參數(shù)與數(shù)據(jù)應(yīng)當(dāng)更均衡地?cái)U(kuò)大。

這意味著,即便在 " 大力出奇跡 " 最典型的階段,行業(yè)真正學(xué)到的也不是 " 越大越好 "。

規(guī)模是有效的,但規(guī)模必須被正確配置。

這一點(diǎn)在今天更加明顯。在專(zhuān)家混合(MoE)架構(gòu)下,模型可以擁有極為龐大的總參數(shù)量,卻在每次生成時(shí)只激活其中一部分??倕?shù)代表整體容量,并不等于單次推理實(shí)際動(dòng)用的計(jì)算量。參數(shù)依然重要,但它已經(jīng)無(wú)法單獨(dú)說(shuō)明一個(gè)模型有多強(qiáng)、成本有多高,以及能否進(jìn)入商業(yè)場(chǎng)景。

二、冪律本身就寫(xiě)著 " 收益遞減 "

" 大力出奇跡 " 容易讓人產(chǎn)生一種錯(cuò)覺(jué):投入翻倍,能力也會(huì)翻倍。

尺度定律從未作出這樣的承諾。恰恰相反,冪律關(guān)系通常意味著,每獲得同等幅度的性能改善,所需資源會(huì)越來(lái)越多。

因此,Scaling Law 可以同時(shí)支持兩個(gè)看似矛盾的判斷:繼續(xù)擴(kuò)大規(guī)模,模型通常還會(huì)進(jìn)步;而繼續(xù)獲得進(jìn)步,成本會(huì)持續(xù)上升。

在模型能力較弱的早期,一次規(guī)模擴(kuò)張可能帶來(lái)肉眼可見(jiàn)的躍遷——從無(wú)法連貫生成長(zhǎng)文,到能夠完成摘要、翻譯、編程與問(wèn)答,用戶(hù)可以直接感受到代際差異。

當(dāng)基礎(chǔ)能力已經(jīng)具備之后,進(jìn)一步擴(kuò)大規(guī)模所帶來(lái)的改善,往往表現(xiàn)為另一種形態(tài):在少數(shù)高難任務(wù)上提高準(zhǔn)確率、更穩(wěn)定地處理長(zhǎng)任務(wù)、減少部分幻覺(jué)、提高工具調(diào)用成功率、在復(fù)雜代碼與數(shù)學(xué)問(wèn)題上多推進(jìn)幾步,以及把 " 偶爾能做到 " 變成 " 可以依賴(lài) "。

這些改善依然有價(jià)值,甚至可能直接決定模型能否進(jìn)入企業(yè)核心流程。但它們不像早期跨代那樣容易被普通用戶(hù)感知。

所以,行業(yè)面對(duì)的未必是一堵突然出現(xiàn)的 "Scaling 之墻 ",而更像一條越來(lái)越陡的成本曲線(xiàn)。

限制 " 大力出奇跡 " 的,未必是模型不再進(jìn)步,而是每一點(diǎn)進(jìn)步是否還值得對(duì)應(yīng)的代價(jià)。

三、問(wèn)題正在從 " 能不能更強(qiáng) " 轉(zhuǎn)向 " 值不值得更強(qiáng) "

對(duì)前沿實(shí)驗(yàn)室而言,只要能力仍在增長(zhǎng),繼續(xù)投入就具備戰(zhàn)略意義。最強(qiáng)模型不只是產(chǎn)品,也是人才、資本、算力與生態(tài)位的集中體現(xiàn)。

但對(duì)大多數(shù)使用 AI 的企業(yè),判斷標(biāo)準(zhǔn)完全不同。客服系統(tǒng)中的地址確認(rèn)、知識(shí)庫(kù)中的文檔檢索、財(cái)務(wù)流程中的字段提取、固定規(guī)則下的工單分類(lèi),都未必需要?jiǎng)佑贸杀咀罡叩那把啬P汀?/p>

產(chǎn)業(yè)實(shí)踐中,一種分層結(jié)構(gòu)正在成型:簡(jiǎn)單任務(wù)交給更小、更便宜的模型;復(fù)雜任務(wù)才調(diào)用能力更強(qiáng)、成本更高的模型;確定性任務(wù)則盡可能交還給傳統(tǒng)程序、緩存與規(guī)則系統(tǒng)。

需求側(cè)的變化同樣清晰。亞馬遜在重構(gòu) Alexa+ 時(shí)采用了所謂 " 模型無(wú)關(guān) " 的架構(gòu),按查詢(xún)逐條選擇合適的模型;相關(guān)報(bào)道指出,這種 " 模型混合 " 的做法在開(kāi)發(fā)者中日益普遍,動(dòng)機(jī)之一正是控制成本。

這不是對(duì)大模型路線(xiàn)的否定,而是其商業(yè)化的必然階段。云計(jì)算走過(guò)類(lèi)似路徑:企業(yè)最初關(guān)心能否獲得更多計(jì)算資源,后來(lái)才轉(zhuǎn)向?qū)嵗?lèi)型、資源調(diào)度與單位任務(wù)成本。

實(shí)驗(yàn)室追求能力上限,企業(yè)追求單位成本下的可靠結(jié)果。二者并不矛盾,卻會(huì)形成兩套不同的 Scaling 邏輯。

四、算力正在從訓(xùn)練遷移到推理

如果擴(kuò)大參數(shù)與數(shù)據(jù)的邊際收益下降,AI 是否就會(huì)停止進(jìn)步?目前看,答案是否定的。

產(chǎn)業(yè)正在把更多計(jì)算,從訓(xùn)練階段轉(zhuǎn)移到回答問(wèn)題的階段。

傳統(tǒng)語(yǔ)言模型通常一次性生成答案。而推理型模型可以在遇到復(fù)雜問(wèn)題時(shí)消耗更多計(jì)算:嘗試多條路徑、檢查中間結(jié)果、調(diào)用驗(yàn)證器、根據(jù)反饋修正答案。這一方式通常被稱(chēng)為測(cè)試時(shí)計(jì)算(test-time compute)。

它的實(shí)質(zhì),是模型不再對(duì)所有問(wèn)題使用相同資源。簡(jiǎn)單問(wèn)題快速作答;一道復(fù)雜數(shù)學(xué)題、一次大型代碼改動(dòng)或一項(xiàng)多步驟規(guī)劃,則可以獲得更長(zhǎng)的思考時(shí)間與更高的計(jì)算預(yù)算。

已有研究表明,合理增加測(cè)試時(shí)計(jì)算,可以在部分任務(wù)上明顯改善表現(xiàn)。但同一批研究也提醒,這種增益并非無(wú)條件成立——采用何種搜索策略、驗(yàn)證器是否可靠、如何依據(jù)難度分配算力,都會(huì)顯著影響最終收益。并行采樣加評(píng)分模型篩選,是目前較常見(jiàn)的一種實(shí)現(xiàn)路徑。

這代表 " 大力 " 發(fā)生了一次遷移:過(guò)去主要投在訓(xùn)練一個(gè)更大的模型,如今也可以投在讓現(xiàn)有模型對(duì)某個(gè)具體問(wèn)題想得更久。

兩者的商業(yè)含義完全不同。訓(xùn)練投入必須在模型發(fā)布前一次性完成;推理投入則可以按用戶(hù)、任務(wù)與價(jià)值動(dòng)態(tài)分配。

未來(lái)的 AI 產(chǎn)品,可能不只按 " 使用哪個(gè)模型 " 計(jì)價(jià),也會(huì)按 " 這個(gè)問(wèn)題值得思考多久 " 計(jì)價(jià)。

五、數(shù)據(jù)瓶頸不會(huì)終結(jié) Scaling,但會(huì)改變它

以往的模型擴(kuò)張,很大程度上建立在互聯(lián)網(wǎng)既有的文本、圖像與代碼之上。但公開(kāi)互聯(lián)網(wǎng)中的高質(zhì)量數(shù)據(jù)并非無(wú)限。

當(dāng)容易獲取的數(shù)據(jù)已被反復(fù)使用,繼續(xù)擴(kuò)大訓(xùn)練規(guī)模會(huì)遇到幾重約束:新增數(shù)據(jù)質(zhì)量下降、重復(fù)內(nèi)容增加、模型更容易接觸到由其他模型生成的內(nèi)容,以及專(zhuān)業(yè)領(lǐng)域的高質(zhì)量數(shù)據(jù)本就稀缺、昂貴,并受權(quán)限與合規(guī)限制。

Anthropic 關(guān)于重復(fù)數(shù)據(jù)的研究發(fā)現(xiàn),數(shù)據(jù)重復(fù)并非總是無(wú)害——在特定的重復(fù)比例區(qū)間,甚至可能造成明顯的性能退化。

因此,下一階段的數(shù)據(jù)競(jìng)爭(zhēng),很可能不再是 " 誰(shuí)擁有更多文本 ",而是:誰(shuí)能獲得更可靠的數(shù)據(jù),誰(shuí)能組織專(zhuān)家反饋,誰(shuí)能從真實(shí)環(huán)境中拿到任務(wù)結(jié)果,誰(shuí)能生成并篩選高質(zhì)量合成數(shù)據(jù),誰(shuí)能判斷一段數(shù)據(jù)究竟教會(huì)了模型什么,以及誰(shuí)能在數(shù)據(jù)、訓(xùn)練與應(yīng)用反饋之間建立閉環(huán)。

原始互聯(lián)網(wǎng)內(nèi)容是一種存量資源,真實(shí)任務(wù)反饋則是持續(xù)產(chǎn)生的增量資源。但擁有更多用戶(hù),并不自動(dòng)等于擁有更好的模型——只有當(dāng)用戶(hù)行為能夠轉(zhuǎn)化為合法、準(zhǔn)確、有結(jié)構(gòu)的信號(hào),才可能成為改進(jìn)的基礎(chǔ)。

下一階段最稀缺的或許不是數(shù)據(jù)本身,而是能夠證明 " 哪個(gè)答案更好 " 的反饋。

六、最大的模型,未必是參數(shù)最多的模型

當(dāng)模型逐漸學(xué)會(huì)調(diào)用搜索、代碼環(huán)境、數(shù)據(jù)庫(kù)、企業(yè)軟件乃至其他模型," 模型能力 " 與 " 系統(tǒng)能力 " 之間的邊界開(kāi)始模糊。

一個(gè)參數(shù)相對(duì)較小的模型,如果能夠找到正確資料、調(diào)用可靠工具、保存長(zhǎng)期記憶、拆解復(fù)雜任務(wù)、檢查執(zhí)行結(jié)果、在失敗后重新規(guī)劃,其在真實(shí)任務(wù)中的表現(xiàn),可能超過(guò)一個(gè)參數(shù)更大、卻只能獨(dú)立生成文本的模型。

因此,產(chǎn)業(yè)仍會(huì)追求規(guī)模,但規(guī)模的對(duì)象正在變化。它可能不再只是一個(gè)越來(lái)越大的神經(jīng)網(wǎng)絡(luò),而是一套分工明確的系統(tǒng):基礎(chǔ)模型負(fù)責(zé)理解與生成,推理機(jī)制負(fù)責(zé)分配計(jì)算,檢索系統(tǒng)負(fù)責(zé)獲取外部知識(shí),工具層負(fù)責(zé)與數(shù)字世界交互,專(zhuān)業(yè)模型處理特定領(lǐng)域,驗(yàn)證機(jī)制負(fù)責(zé)核查結(jié)果,權(quán)限與控制系統(tǒng)決定哪些動(dòng)作可以真正發(fā)生。

這與計(jì)算產(chǎn)業(yè)從追求單核主頻,轉(zhuǎn)向多核、專(zhuān)用芯片與分布式架構(gòu)的過(guò)程有相似之處。CPU 主頻并未停止提高,只是不再是衡量系統(tǒng)能力的唯一指標(biāo)。

七、三個(gè)階段,而非一個(gè)終點(diǎn)

認(rèn)為 Scaling 即將徹底失效,可能過(guò)于武斷。已有研究仍顯示模型、數(shù)據(jù)、算力與性能之間存在相對(duì)穩(wěn)定的關(guān)系;近年的新工作也在改進(jìn)尺度定律的預(yù)測(cè)方法——對(duì)于耗資巨大的訓(xùn)練項(xiàng)目而言,能否用小規(guī)模實(shí)驗(yàn)預(yù)測(cè)大規(guī)模結(jié)果,本身已是關(guān)鍵基礎(chǔ)設(shè)施。

但認(rèn)為可以永遠(yuǎn)依靠無(wú)限增加參數(shù)獲得同等幅度的驚喜,同樣不現(xiàn)實(shí)。能源、芯片、數(shù)據(jù)、資本與工程復(fù)雜度都會(huì)形成約束,而市場(chǎng)最終衡量的不是參數(shù),而是問(wèn)題是否被解決。

一個(gè)可能的框架是把 " 大力出奇跡 " 看作三個(gè)遞進(jìn)階段:

第一階段,參數(shù)規(guī)模化。通過(guò)擴(kuò)大參數(shù)、數(shù)據(jù)與訓(xùn)練算力,證明通用能力可以從大規(guī)模學(xué)習(xí)中涌現(xiàn)。

第二階段,計(jì)算配置化。重新分配預(yù)訓(xùn)練、后訓(xùn)練與推理之間的資源,借助 MoE、測(cè)試時(shí)計(jì)算、數(shù)據(jù)優(yōu)化與模型壓縮,提高單位計(jì)算的產(chǎn)出。

第三階段,系統(tǒng)規(guī)?;?。模型與檢索、工具、智能體、驗(yàn)證器、專(zhuān)業(yè)模型和真實(shí)執(zhí)行環(huán)境結(jié)合。競(jìng)爭(zhēng)不再只看誰(shuí)訓(xùn)練了最大的模型,而看誰(shuí)能把智能組織成穩(wěn)定、經(jīng)濟(jì)且可控的系統(tǒng)。

下一場(chǎng)規(guī)模競(jìng)賽,不只是把一個(gè)模型做得更大,而是把有限的智能放到最需要它的位置。

結(jié)語(yǔ):終點(diǎn)不是模型停止變大

那么," 大力出奇跡 " 還能走多久?

它可能還會(huì)持續(xù)相當(dāng)長(zhǎng)的時(shí)間。只要增加計(jì)算仍能提高能力,資本與算力就會(huì)繼續(xù)向前沿集中;總參數(shù)可能繼續(xù)增長(zhǎng),數(shù)據(jù)中心仍會(huì)擴(kuò)張,推理階段消耗的算力甚至可能超過(guò)訓(xùn)練階段。

真正接近尾聲的,是把 " 大 " 單純理解為參數(shù)數(shù)量的那個(gè)時(shí)代。

未來(lái)人們會(huì)越來(lái)越少地追問(wèn) " 這個(gè)模型有多少參數(shù) ",轉(zhuǎn)而關(guān)心:它每次實(shí)際激活多少參數(shù)?訓(xùn)練使用了怎樣的數(shù)據(jù)?完成一個(gè)任務(wù)的成本是多少?復(fù)雜問(wèn)題能否通過(guò)追加推理預(yù)算獲得更好結(jié)果?它能否調(diào)用正確的工具、在真實(shí)環(huán)境中穩(wěn)定交付?企業(yè)能否控制它最終產(chǎn)生的影響?

當(dāng)這些問(wèn)題成為主流,Scaling 就不再是一場(chǎng)單純的軍備競(jìng)賽,而更接近一門(mén)資源配置的學(xué)問(wèn)。

參數(shù)仍會(huì)增長(zhǎng),算力仍會(huì)增長(zhǎng),數(shù)據(jù)中心仍會(huì)擴(kuò)張。只是決定競(jìng)爭(zhēng)力的,不再是投入了多少 " 大力 ",而是能否把參數(shù)、數(shù)據(jù)、算力、工具與反饋組織成有效能力。

" 大力出奇跡 " 不會(huì)消失。會(huì)消失的,是 " 只要足夠大,就不必回答效率、可靠性與商業(yè)價(jià)值 " 的那個(gè)時(shí)代。

AI 的發(fā)展不會(huì)從規(guī)模退回小規(guī)模,也不會(huì)簡(jiǎn)單地從大模型退回傳統(tǒng)軟件。它更可能進(jìn)入一個(gè)新階段:模型繼續(xù)變大,但系統(tǒng)比模型更大;算力繼續(xù)增加,但計(jì)算開(kāi)始按任務(wù)分配;能力繼續(xù)提高,而成本、可靠性與可控性擁有同等重要的位置。

Scaling 仍是 AI 進(jìn)步的重要?jiǎng)恿?。只是下一?" 奇跡 ",未必來(lái)自更多參數(shù)本身,而可能來(lái)自人們終于學(xué)會(huì),如何更有效地使用已經(jīng)擁有的規(guī)模。

相關(guān)閱讀

最新評(píng)論

沒(méi)有更多評(píng)論了
虎嗅APP

虎嗅APP

有視角的商業(yè)資訊與交流平臺(tái)

訂閱

覺(jué)得文章不錯(cuò),微信掃描分享好友

掃碼分享

企業(yè)資訊

查看更多內(nèi)容