
這項合作在 AMD 首席執(zhí)行官蘇姿豐(Lisa Su)周四發(fā)表的 " 推進 AI" 主題演講中正式公布。此舉填補了 AMD 產品組合中的關鍵空白。此前,英偉達曾花費 200 億美元收購 Groq 相關人才,以彌補其在快速推理領域的短板。
SRAM 技術賦能高效推理
Cerebras 聯(lián)合創(chuàng)始人兼首席執(zhí)行官安德魯 · 費爾德曼(Andrew Feldman)曾批評英偉達僅為 "AI 軍火商 "。與依賴 HBM4 顯存的 GPU 不同,Cerebras 的晶圓級引擎(WSE)采用片上 SRAM 技術,速度比傳統(tǒng)方案高出數(shù)個數(shù)量級。憑借這一優(yōu)勢,Cerebras 已成為全球最快的推理服務提供商之一,輸出速度經常超過每秒 2,000 個 Token。
在該聯(lián)合方案中,AMD Instinct GPU 負責處理計算密集型的提示詞(Prompt)操作,而內存密集型的 Token 生成任務則卸載給 Cerebras 的 WSE 加速器。雙方旨在實現(xiàn)更高交互性,同時不犧牲吞吐量或增加成本。費爾德曼表示,這種組合結合了 Instinct 在性能和內存容量上的優(yōu)勢,以及 WSE 在 SRAM 和內存帶寬上的領先地位,能提供無與倫比的解決方案。
盡管兩家公司未透露具體數(shù)據(jù),但預計該組合將使每瓦特電力消耗所產生的 Token 數(shù)量提升高達 5 倍。
對標 Groq LPU,效率顯著優(yōu)化
Cerebras 加速器在此處的角色,類似于英偉達在 GTC 大會上隨 Vera Rubin 機架系統(tǒng)發(fā)布的 Groq LPU(語言處理單元)。然而,在服務像 Kimi K2.5 這樣的萬億參數(shù)模型時,英偉達方案需要相當于 2,000 顆 Groq LPU 的 SRAM 資源,而 AMD 與 Cerebras 的組合最多只需幾十個加速器即可勝任。
該聯(lián)合解決方案將于今年晚些時候在 Cerebras Cloud 上線。蘇姿豐在隨后的新聞發(fā)布會上表示,Cerebras 的技術與 Helios 配合良好,AMD 開放生態(tài)系統(tǒng)的理念是與擁有有用技術的多家公司合作。她補充道,未來將繼續(xù)進行更多的工作負載解耦嘗試。
【星途科訊 圖文丨略略 首發(fā)于 ZAKER 科技,轉載請注明出處】