AI 大模型正在變得越來(lái)越聰明,但承載它們的物理世界正在被推向極限。
花旗在 7 月 24 日發(fā)布的最新報(bào)告中寫道,月之暗面 Kimi K3 以 57 分躋身全球第三,僅落后閉源榜首 Claude Fable 5 三分。與此同時(shí),以 Kimi K3 為代表的中國(guó)前沿模型定價(jià)一周跳漲 45%,Blackwell GPU 租金年初至今漲 27%,甚至有實(shí)驗(yàn)室斥資 10 億美元直接買下發(fā)電機(jī)組。
花旗分析稱,AI 行業(yè)的投資回報(bào)(ROI)正加速向基礎(chǔ)設(shè)施層轉(zhuǎn)移;而下一階段的模型競(jìng)爭(zhēng)護(hù)城河,將從單純的 " 算力獲取 " 徹底轉(zhuǎn)向 " 高效產(chǎn)出與專有數(shù)據(jù) "。
差距只剩 3 分
花旗在研報(bào)中提及,Kimi K3 是目前公開發(fā)布的最大開源模型。幾周前,開源最高分還只有 51 分(Z.ai GLM-5.2),Kimi K3 一步跳到 57 分,僅次于 Claude Fable 5(60 分)和 OpenAI GPT-5.6 Sol(59 分)。
整個(gè)行業(yè)都在加速。前 20 大模型提供商的中位智能得分從六周前的 34 分升至 43 分。開源陣營(yíng)中,DeepSeek V4 Pro(44 分)每百萬(wàn) token 定價(jià),小米(分)更低至 0.03 ——接近前沿的智能水平,價(jià)格卻低了兩個(gè)數(shù)量級(jí)。
閉源陣營(yíng)也沒(méi)有放慢。Google 剛發(fā)布 Gemini 3.6 Flash(7 月 21 日),同時(shí)透露 Gemini 3.5 Pro 仍在測(cè)試中,Gemini 4 的預(yù)訓(xùn)練已經(jīng)啟動(dòng)——三代模型三線并進(jìn)。不過(guò),花旗認(rèn)為,'Flash 先發(fā)、Pro 延后 ' 的發(fā)布節(jié)奏釋放出一個(gè)信號(hào):前沿模型的推進(jìn)正變得更難——這與其他公司在基礎(chǔ)設(shè)施建設(shè)上遭遇的延誤相一致,也折射出行業(yè)希望壓縮交付周期卻難以如愿的現(xiàn)狀。
模型越大、越強(qiáng),跑起來(lái)需要的資源也在急劇膨脹。
瓶頸搬家了
萬(wàn)億參數(shù)模型正在改寫 " 算力 " 的含義。
花旗指出,這些超大模型實(shí)際運(yùn)行時(shí),越來(lái)越多的時(shí)間花在跨 HBM 內(nèi)存和 GPU 互聯(lián)網(wǎng)絡(luò)搬運(yùn)權(quán)重及 KV-cache 數(shù)據(jù)上,而非矩陣運(yùn)算本身。瓶頸已經(jīng)從 " 算得快不快 "(FLOPs)轉(zhuǎn)向了 " 搬得動(dòng)搬不動(dòng) " ——內(nèi)存帶寬、GPU 互聯(lián)和電力供應(yīng)。
GPU 需求依然旺盛,Blackwell 架構(gòu)租金年初至今上漲 27%。但單純堆 GPU 已經(jīng)不夠了。
部分實(shí)驗(yàn)室開始直接切入上游發(fā)電:SpaceX 斥資 10 億美元購(gòu)買 1GW 移動(dòng)渦輪機(jī)組(7 月 15 日),Georgia Power 同周簽署服務(wù)協(xié)議(7 月 22 日)。AI 實(shí)驗(yàn)室買發(fā)電設(shè)備——一年前幾乎不可想象的事情,現(xiàn)在正在發(fā)生。
模型定價(jià)直接反映了產(chǎn)能有多緊。中國(guó)前沿模型的混合定價(jià)從每百萬(wàn) token 跳漲至 0.87,周環(huán)比和月環(huán)比均漲 45%,是兩個(gè)月來(lái)首次大幅波動(dòng)。全球前沿模型均價(jià)周環(huán)比漲 6.8%,月環(huán)比漲 11.3%。美歐相對(duì)穩(wěn)定(周環(huán)比 -0.5%),但月環(huán)比也上升了 4.1%。
花旗判斷,隨著增量基礎(chǔ)設(shè)施陸續(xù)上線,定價(jià)壓力終將緩解。屆時(shí)有價(jià)值的數(shù)據(jù)和任務(wù)特定性能,將比算力獲取構(gòu)成更持久的護(hù)城河。
Agent 逃出沙箱
模型在變強(qiáng)。但跑在模型上的 agent,也在變得更危險(xiǎn)。
花旗報(bào)告用了一個(gè)耐人尋味的表述:自主 AI agent 逃逸沙箱的現(xiàn)實(shí)風(fēng)險(xiǎn),已從 4 月的 " 打斷午餐 " 升級(jí)到 7 月的 " 滲透 Hugging Face 基礎(chǔ)設(shè)施 "。
開源模型越強(qiáng)、越普及,安全風(fēng)險(xiǎn)的擴(kuò)散面就越大。AI 監(jiān)管辯論仍在進(jìn)行——英偉達(dá)(7 月 24 日)和美國(guó)財(cái)長(zhǎng)貝森特(7 月 22 日)近日均有表態(tài)——但短期內(nèi)難有定論。即便監(jiān)管框架尚未落地,維護(hù)自有模型運(yùn)行架構(gòu)的企業(yè)已面臨更高的合規(guī)門檻。
更棘手的是,訓(xùn)練這些模型的提供商自己,仍然無(wú)法完全檢視模型為何如此行動(dòng)。可解釋性問(wèn)題,至今沒(méi)有解決。
但安全隱憂并沒(méi)有減慢 agent 的商業(yè)化進(jìn)程。METR(7 月 21 日)的數(shù)據(jù)顯示,AI agent 與人工之間的經(jīng)濟(jì)性差距正在收窄。當(dāng) agent 更自主、更接近經(jīng)濟(jì)可行性,token 消耗會(huì)持續(xù)加速——這又反過(guò)來(lái)推高基礎(chǔ)設(shè)施需求。
能力越強(qiáng),約束越緊。約束越緊,基礎(chǔ)設(shè)施需求越大。這個(gè)循環(huán),沒(méi)有減速的跡象。