电竞比分网-中国电竞赛事及体育赛事平台

關(guān)于ZAKER Skills 合作
鈦媒體 昨天

Opus 5 反超 Fable 5,Anthropic 的定價牌局被打亂了?

7 月 25 日凌晨 1 點,Anthropic 發(fā)布了 Claude Opus 5。如果只看名字,你會以為它是 Opus 4.8 的繼任者,Anthropic 產(chǎn)品線中比 Sonnet 強但比 Fable 弱的中間型號。

但一看數(shù)據(jù)就會發(fā)現(xiàn),這款定價 $5/$25(每百萬輸入 / 輸出 token)的模型,在編程、自主搜索、計算機使用、企業(yè)業(yè)務流程等多個關(guān)鍵基準測試上,把定價 $10/$50 的 Fable 5 給超了。而它的成本,只有 Fable 5 的一半。

Anthropic 在官方公告里表示:"Opus 5 comes close to the frontier intelligence of Claude Fable 5 at half the price",意思是接近 Fable 5 的智能,價格減半。但他們自己發(fā)布的基準測試圖表顯示,Opus 5 在至少四項核心評測中明確領先 Fable 5,而且是在更低的成本下做到的。

被 " 次旗艦 " 反超的 " 旗艦 "

先看編程能力。Frontier-Bench v0.1 是當前最直接映射企業(yè)開發(fā)團隊實際工作的基準測試之一,讓模型自己在終端里寫代碼、跑代碼、調(diào)試多文件變更。Opus 5 拿到了 43.3%,F(xiàn)able 5 是 33.7%。將近 10 個百分點的差距,在編程評測里屬于碾壓級別。Opus 4.8 在這個測試上是 21.1%,Opus 5 直接翻了一倍多。

在 CursorBench 3.2 上,Opus 5 在最高推理強度下達到 Fable 5 峰值成績的 94.5%,單次任務成本只有一半。Anthropic 還宣稱,在 high、xhigh 和 max 三個推理等級上,Opus 5 在同成本下的性能都超過了所有其他模型。Cognition(Devin 背后的公司)CEO Scott Wu 在 FrontierCode 1.1 評測后確認:"Claude Opus 5 在調(diào)試和根因分析方面以一半成本達到了接近 Fable 級別的性能。"

在自主搜索(Agentic Search)上,Opus 5 拿到 90.8%,F(xiàn)able 5 是 87.4%。十次搜索有九次以上能獨立搞定。計算機使用(OSWorld 2.0)上,Opus 5 在約三分之一成本下就超過了 Fable 5 的最優(yōu)成績。企業(yè)業(yè)務流程自動化(Business Workflows)方面,Opus 5 拿到 26%,F(xiàn)able 5 只有 17.4%。

科學領域同樣不弱。Opus 5 在有機化學任務上比 Opus 4.8 高出 10.2 個百分點(包括從光譜數(shù)據(jù)推斷分子結(jié)構(gòu)),在蛋白質(zhì)相關(guān)任務上高出 7.7 個百分點(包括預測序列變異對功能的影響)。在號稱 " 人類最后考試 " 的 Humanity's Last Exam 上,開啟工具后 Opus 5 拿到 64.7%,F(xiàn)able 5 是 63.9%(不開工具時分別為 56.3% 和 56.5%),差距不到一個百分點。

但真正讓整個 AI 研究圈停下滾動的,是 ARC-AGI 3 的成績。

ARC-AGI 3 是 Fran ois Chollet 設計來衡量 " 流體智能 " 的基準。它不是讓模型回憶訓練數(shù)據(jù)里見過的東西,而是把它扔進完全陌生的交互式環(huán)境里,沒有指令、沒有規(guī)則說明、沒有目標提示,靠試錯自己摸索。人類能完成 100% 的任務。今年 3 月 ARC Prize Foundation 發(fā)布這個基準時,最強 AI 模型的得分是 0.37%(Gemini 3.1 Pro)。到 Opus 5 發(fā)布前,公開最強成績是 GPT-5.6 Sol 在最大推理強度下的 7.8%。Opus 4.8 只有 1.5%。

Opus 5 拿到了 30.2%。是 GPT-5.6 Sol 的近四倍,Opus 4.8 的二十倍。

這個數(shù)字的意義遠超任何編程或搜索基準。ARC-AGI 3 獎勵的不是 " 做過類似的事所以能做 ",而是 " 從沒訓練過也能做 "。30.2% 意味著 Opus 5 確實在通過交互來推導陌生的規(guī)則體系,而不只是模式匹配。Vellum AI 的基準分析文章直言:" 這個數(shù)字讓所有人都停下了滾動。"

它不只是分數(shù)高

基準數(shù)字告訴我們 Opus 5 考了多少分。但 Anthropic 公布的案例告訴了我們是它怎么考到這些分的。

Anthropic 公布了一個 3D 建模任務,只給模型一張機械零件的設計圖紙,要求它自主編寫代碼重建完整的 FreeCAD 3D 模型。在 Opus 5 之前,沒有任何模型能完成這個任務,即使人工提前搭好開發(fā)框架、給出詳細方案,模型依然會出錯。Opus 5 不僅完成了全過程自主閉環(huán),還自己搭建了配套的測試工具,逐一校驗代碼的數(shù)據(jù)解析邏輯,反復核查修正問題,直到通過驗證。

在沒有任何人工干預的情況下,自主完成了一個完整的工程驗證循環(huán),設定目標、規(guī)劃步驟、編寫代碼、測試輸出、發(fā)現(xiàn)錯誤、回溯修正、再次測試、通過。

Zapier CEO Wade Foster 透露,團隊用 Opus 5 處理客戶健康度原始表格,要求 AI 獨立完成全套客戶流失預防流程,包括標記高風險賬戶、通知對應負責人、整理運營報告。" 以前的模型沒有能完整跑通這條流程的,"Foster 說,"Opus 5 做到了 100% 完整交付。"

Box CTO Ben Kus 給出了量化對比:Opus 5 在專業(yè)企業(yè)內(nèi)容處理上整體比 Opus 4.8 提升 8%,數(shù)據(jù)分析工作流提升 11%,盡職調(diào)查提升 17%。一家金融建模團隊的評估負責人 Richard Pham 測出了準確率高 9 個百分點,同時周轉(zhuǎn)次數(shù)少三分之一、耗時少 60%。法律 AI 團隊 Applied Research 負責人 Niko Grupen 發(fā)現(xiàn) Opus 5 在保持質(zhì)量的同時,平均比 Opus 4.8 在最高推理強度下少生成了 26% 的 token。

更少的 token、更少的交互輪次、更少的人盯著屏幕。這就是 Opus 5 對 " 性價比 " 的真正定義。

沒人預料到的 30.2%

回到 ARC-AGI 3。這個數(shù)字的沖擊力需要放在時間線上理解。

今年 3 月,Gemini 3.1 Pro 以 0.37% 領先。到 Opus 5 發(fā)布前,公開最強成績是 GPT-5.6 Sol 在最大推理強度下的 7.8%。Opus 4.8 掛在 1.5%。Opus 5 發(fā)布當天直接拉到 30.2%。Anthropic 在公告中說 Opus 5 的成績是 " 次優(yōu)模型的三倍 ",這個表述甚至可能是保守的,因為 GPT-5.6 Sol 的 7.8% 是在最大推理強度設置的極端資源消耗下拿到的,而 Opus 5 在標準推理設置下就做到了 30.2%。

ARC-AGI 3 它測的是遇到完全沒見過的問題時的應變能力,Chollet 設計的邏輯是,把模型扔進一個沒有任何參考框架的新世界,看它能不能靠自己理解規(guī)則、制定策略、達成目標。這才是 " 通用智能 " 的真正含義。不是知識面有多廣,而是面對未知時的適應速度有多快。

30.2% 意味著 Opus 5 在三分之一的情況下能獨立完成人類能完成的任務,而這些任務是它絕對沒有在訓練數(shù)據(jù)里遇到過同類題型的。AI 從 " 超強模式匹配器 " 向 " 自主推理系統(tǒng) " 的轉(zhuǎn)變,正在被量化驗證,而不是停留在口號層面。

但更值得追問的是,為什么 Anthropic 要發(fā)布一款在核心指標上碾壓自家 " 旗艦 " 的模型,還只賣一半的價格?

這需要看一圈 Opus 5 周圍的定價坐標。

再回頭看看 Fable 5 的 $10/$50。這個定價在 2026 年 7 月的市場上像一座孤島,周圍的海平面每天都在上漲。Fable 5 在 6 月 9 日發(fā)布時,它的 " 神話級 "(Mythos-class)性能確實值這個溢價。但僅僅 45 天后,Opus 5 就用不到一半的價格,在用戶最關(guān)心的場景里拿出了更好的成績。

Anthropic 面臨的困境是,F(xiàn)able 5 的定價正在被市場拋棄,而競爭對手,尤其是 Kimi K3 的開源攻勢,正在從下方蠶食。繼續(xù)守著 Fable 5 的高價策略,等于把高頻使用場景(編程、搜索、辦公自動化)的客戶拱手讓人。Anthropic 的選擇是,與其等競爭對手來拆,不如自己先拆。用 Opus 5 把旗艦級能力注入中端產(chǎn)品線,在性價比戰(zhàn)場正面迎戰(zhàn),同時讓 Fable 5 繼續(xù)守住 " 極致推理 " 的利基市場。

Opus 5 的商業(yè)使命可以概括為一句話,證明 Anthropic 還能收前沿溢價。而 Anthropic 給出的回答是,不收了?;蛘哒f,前沿溢價的門檻被自己抬高了。你得先在 $5/$25 這個價格點上拿出比 Fable 5 更強的編程和推理能力,才有資格談 " 溢價 "。

大模型定價的邏輯,已經(jīng)不太一樣了

Opus 5 的發(fā)布,本質(zhì)上宣告了大模型行業(yè) " 越貴越強 " 定價范式的終結(jié)。

過去兩年,行業(yè)默認的邏輯是,更強的模型需要更大的參數(shù)、更多的訓練算力、更高的推理成本,所以必然更貴。Fable 5 的 $10/$50 定價就是這條邏輯鏈的終極產(chǎn)物。我比任何人都強,所以我可以收最貴的錢。但 Opus 5 用數(shù)據(jù)證明了一件事,更強的推理架構(gòu)和更高效的訓練方法,可以讓模型在價格不變甚至更低的情況下,性能跳升一個量級。

Opus 5 的定價和 Opus 4.8 完全相同($5/$25),但 Frontier-Bench 得分從 21.1% 跳到了 43.3%,ARC-AGI 3 從 1.5% 跳到了 30.2%。同樣的價格,推理能力提升了一個量級。這不是邊際改善,是范式躍遷。

" 旗艦 " 這個詞本身的含義正在被重新定義。當一款 $5/$25 的模型能在你每天實際使用的場景里跑贏 $10/$50 的模型," 旗艦 " 就從一個能力標簽變成了一個價格標簽,而價格標簽是最容易被競爭對手撕掉的。

這給整個行業(yè)傳遞了一個清晰的信號:如果你今天的旗艦模型不能在效率上持續(xù)拉開代差,明天就會有一個價格只有你一半的模型在功能上超越你。Anthropic 今天自己動手拆掉了自己的價格金字塔,意味著它已經(jīng)預判到了這個趨勢不可逆轉(zhuǎn),選擇主動引領而不是被動防守。

對于企業(yè)用戶來說,Opus 5 是 2026 年迄今為止最值得認真評估的 AI 投入。在編程輔助(尤其是 Claude Code 和 Cursor 等 IDE 場景)、自動化辦公(Zapier 等平臺)、數(shù)據(jù)分析、科學研究等高頻使用場景中,$5/$25 的定價結(jié)合超越 Fable 5 的性能,構(gòu)成了當前市場上最清晰的性價比錨點。

但真正的變量在 7 月 27 日,Kimi K3 開源全部權(quán)重。當一個 2.8T 參數(shù)的模型可以免費部署、自由修改,且性能已經(jīng)逼近前沿,整個行業(yè)的定價地板將再次被擊穿。Opus 5 證明了 " 可以更便宜地做得更好 ",而 Kimi K3 即將證明 " 可以幾乎免費地做得差不多 "。兩條線同時推進,留給任何一家 AI 公司維持高溢價的窗口期,正在以天為單位收窄。

當一家公司開始用中端型號的價格賣旗艦級別的性能,這表明與其等對手來拆你的定價,不如自己先把牌桌掀了。

(本文首發(fā)鈦媒體 APP,作者 | AGI-Signal,編輯 | 秦聰慧)

相關(guān)閱讀

最新評論

沒有更多評論了

覺得文章不錯,微信掃描分享好友

掃碼分享

企業(yè)資訊

查看更多內(nèi)容