文 | AIX 財(cái)經(jīng)(AIXcaijing),作者 | 雷晶,編輯 | 金玙璠
7 月的模型圈很熱鬧。
25 日凌晨,Anthropic 正式推出了新模型 Claude Opus 5。
這一次,Anthropic 沒有強(qiáng)調(diào) " 最強(qiáng)模型 ",而是給出更務(wù)實(shí)的定位:Opus 5在復(fù)雜任務(wù)上更少遺漏步驟、更傾向主動(dòng)驗(yàn)證中間結(jié)果,在多項(xiàng)評測中兼顧性能與成本,適合日常高頻使用。
定位的變化也直接體現(xiàn)在產(chǎn)品里,目前 Opus 5 成為 Claude Max 的默認(rèn)模型,也是面向個(gè)人訂閱用戶(Max/Pro)可調(diào)用的最強(qiáng)模型;能力更高的 Fable 5 主要面向 API 與企業(yè)客戶,個(gè)人訂閱用戶雖然可用,但額度相當(dāng)有限。
從官方公布的成績來看,Opus 5 重點(diǎn)提升了編程、知識工作和智能體任務(wù)的完成效率,在多項(xiàng)軟件工程、商業(yè)流程和電腦操作評測中位居前列;在最高思考檔位下,部分成績已經(jīng)逼近甚至超過 Fable 5。不過,在進(jìn)攻性網(wǎng)絡(luò)利用和長周期自主生物研究等高風(fēng)險(xiǎn)場景中,受限的 Mythos 5 仍然更強(qiáng)。
Opus 5 提供了可調(diào)節(jié)的 effort(思考檔位),用戶可按任務(wù)難度調(diào)整推理資源投入。檔位越高,處理復(fù)雜問題的能力越強(qiáng),但速度更慢、Token 消耗也更多;調(diào)低則省時(shí)省錢。
目前,Opus 5 已在全平臺上線,API 價(jià)格為每百萬 Token 輸入 5 美元、輸出 25 美元,與 Opus 4.8 持平,約為 Fable 5 的一半;追求速度可開 Fast 模式,以約兩倍價(jià)格換 2.5 倍速度。
Anthropic 同時(shí)上線了兩項(xiàng) Beta 功能:動(dòng)態(tài)調(diào)整工具與自動(dòng)回退,用于降低 Agent 任務(wù)因緩存失效抬升成本、或因安全攔截中斷的風(fēng)險(xiǎn)。
性能逼近、價(jià)格減半,那 Opus 5 能替代 Fable 5 嗎?
01. 登上榜首,但不是斷層領(lǐng)先
我們先來看官方給出的成績單。
為了突出模型的領(lǐng)先性,Opus 5 的對比對象選的是當(dāng)前能力最強(qiáng)的幾款模型:上一代 Opus 4.8、公開旗艦 Fable 5,以及 OpenAI 剛發(fā)布的旗艦?zāi)P?GPT-5.6 Sol。

類似優(yōu)勢也出現(xiàn)在需要模型連續(xù)操作的任務(wù)中。在 Zapier AutomationBench 測試中,按相同的單項(xiàng)任務(wù)成本計(jì)算,Opus 5 通過率約為第二名(Fable 5)的 1.5 倍。在 OSWorld 2.0 測試中,它僅用 Fable 5 單項(xiàng)任務(wù)成本的略多于三分之一,超過了后者最好成績。
這些項(xiàng)目的共同點(diǎn)在于,測試的不只是模型能否答對一道題,還包括它能否調(diào)用工具、跨越多個(gè)步驟、發(fā)現(xiàn)錯(cuò)誤并繼續(xù)推進(jìn)。

不過,Opus 5 并非在所有項(xiàng)目中都領(lǐng)先。在 Anthropic 公布的十余項(xiàng)對比中,有四項(xiàng)落后其他模型。
在 Humanity ’ s Last Exam 測試中,不用工具時(shí),Opus 5 得 56.3%,略低于 Fable 5 的 56.5%;開放工具后 Opus 5 升至 64.7%,反超 Fable 5 的 63.9%。這更能說明兩者差別:Fable 5 仍有更強(qiáng)的純模型能力,Opus 5 更擅長搜索、調(diào)用工具、檢查結(jié)果并持續(xù)推進(jìn)任務(wù)。
Anthropic 披露的案例也符合這一特點(diǎn)。Opus 5 在沒有圖像查看工具的情況下,自行編寫計(jì)算機(jī)視覺程序,從機(jī)械圖紙的原始像素中提取數(shù)據(jù);在缺少實(shí)時(shí)行情的情況下,主動(dòng)搭建測試環(huán)境驗(yàn)證交易所數(shù)據(jù)接口是否正確。
從這些表現(xiàn)來看,Opus 5 此次升級的重點(diǎn),與其說是純模型能力的躍升,不如說是執(zhí)行、驗(yàn)證和糾錯(cuò)能力變得更成熟。
當(dāng)然,官方跑分需要謹(jǐn)慎看待。以 Frontier-Bench 測試為例,結(jié)果是在特定智能體框架下進(jìn)行五次測試后取平均值,觸發(fā)安全分類器時(shí)還會由 Opus 4.8 接管,說明工具配置、提示詞和運(yùn)行環(huán)境發(fā)生變化,結(jié)果也可能變化。
我們再來看看第三方榜單。
截至 7 月 25 日,Artificial Analysis 的智能指數(shù)榜單上,Opus 5 max 以 61 分排在第一位,僅高于第二名的 Fable 5 一分。該榜單綜合 9 項(xiàng)評測,比單看某個(gè)優(yōu)勢項(xiàng)目更能反映綜合能力。

所以,Opus 5 只是當(dāng)前榜單上的領(lǐng)先者。跑分給出了能力上限,真實(shí)使用中的穩(wěn)定性、Token 消耗和最終交付質(zhì)量,才決定性價(jià)比究竟高不高。
02. 跑分更高,不等于活干得更好
模型上線后,評價(jià)很快兩極分化。
正面評價(jià)集中在編程和可交互內(nèi)容生成。有網(wǎng)友在 X 上分享 Opus 5 生成的可交互 3D 黑洞可視化器,還能實(shí)時(shí)合成一段電子音樂,代碼、視覺效果和聲音被整合進(jìn)同一個(gè)成品,說明它快速制作產(chǎn)品原型的能力很強(qiáng)。




李默提到,實(shí)用的是兩個(gè) Beta 功能直接改善了 Agent 開發(fā)體驗(yàn):過去改一次工具列表整段緩存就作廢,現(xiàn)在對話中途換工具也不會失效;API 還可啟用自動(dòng)降級,被安全分類器攔截的請求會自動(dòng)轉(zhuǎn)交其他模型。
綜合來看,Opus 5 目前更像一名執(zhí)行力強(qiáng)、愿意自查,但還需要磨合的同事。它適合生成代碼、修復(fù)問題和完成邊界清楚的工作,但在復(fù)雜規(guī)劃、長周期自主任務(wù)和部分文字表達(dá)上,F(xiàn)able 5 仍有優(yōu)勢。
03.Anthropic 需要一款更日常的旗艦?zāi)P?/b>
Anthropic 最近在加快模型更新速度。
5 月 29 日,發(fā)布 Opus 4.8;6 月 10 日,發(fā)布 Fable 5 和 Mythos 5;7 月 1 日,上線 Sonnet 5;7 月 25 日,發(fā)布 Opus 5,不到兩個(gè)月,Claude 的主要產(chǎn)品線幾乎更新了一遍。
在密集發(fā)布模型的情況下,行業(yè)對模型應(yīng)該如何開放的分歧也在擴(kuò)大。7 月 16 日,月之暗面發(fā)布開放權(quán)重模型 Kimi K3,性能被認(rèn)為已接近前沿。幾天后,OpenAI 戰(zhàn)略負(fù)責(zé)人在 X 上預(yù)測,華盛頓會圍繞中國開放權(quán)重模型制造 " 監(jiān)管風(fēng)險(xiǎn) ",這番話被廣泛解讀為對開源陣營的施壓。
Opus 5 發(fā)布當(dāng)天,英偉達(dá)、Meta、微軟等 25 家公司和機(jī)構(gòu)聯(lián)合發(fā)表公開信,呼吁美國政府不要過早限制開放權(quán)重模型,OpenAI、Anthropic 和 Google 沒有出現(xiàn)在簽署名單中。
缺席不等于明確反對開放權(quán)重,但與開放權(quán)重相比,Anthropic 確實(shí)更強(qiáng)調(diào)閉源、分級開放和風(fēng)險(xiǎn)控制。6 月 12 日,美國政府對 Fable 5 和 Mythos 5 實(shí)施管制,兩款模型一度全面下線。限制解除后,F(xiàn)able 5 恢復(fù)公開服務(wù),安全限制更少的 Mythos 5 仍只向部分獲批機(jī)構(gòu)開放。
Opus 5 的定位,正嵌在 Anthropic 這套 " 模型該如何開放 " 的策略里。它發(fā)現(xiàn)源代碼漏洞的能力接近 Mythos 5,將漏洞轉(zhuǎn)化為實(shí)際攻擊工具的能力卻明顯較弱。對 Anthropic 而言,它不只是更便宜的 Fable 5 替代品,也是一個(gè)更容易在合規(guī)框架下向普通用戶和企業(yè)開放的選項(xiàng)。

從密集發(fā)布模型,到擴(kuò)充芯片供給,再到精簡系統(tǒng)提示詞,Anthropic 做的不僅是提高跑分,而是把模型能力拆分到不同價(jià)格、風(fēng)險(xiǎn)和使用場景中:Fable 5 負(fù)責(zé)更復(fù)雜、更長周期的任務(wù),Sonnet 5 承接成本敏感的普遍需求,Opus 5 則試圖成為開發(fā)者和知識工作者的日常默認(rèn)選擇。
所以,Opus 5 沒有讓 Fable 5 失去意義。后者仍代表 Anthropic 公開可用的模型能力上限,Opus 5 解決的是如何以更低成本,把接近旗艦的能力交給更多用戶。它的競爭力在于能否以更穩(wěn)定的表現(xiàn)、更少的人工接管和可以控制的成本,把一項(xiàng)工作真正完成。
* 題圖來源于 Anthropic 官網(wǎng)。應(yīng)受訪者要求,李默為化名。