全網(wǎng)都在等藍(lán)色大鯨魚(yú)更新 DeepSeek V4 正式版,看看梁文鋒這回到底是梁圣、梁哥還是牢梁的時(shí)候,一個(gè)網(wǎng)傳的閉門(mén)會(huì)記錄刷屏了。
我只能說(shuō),看完這場(chǎng)會(huì)議的文字記錄,我還真想叫一聲梁圣了。。
事情是這樣的,在 DeepSeek 推進(jìn)首輪外部融資期間,梁文鋒開(kāi)了一場(chǎng)三個(gè)多小時(shí)的投資人交流會(huì)。這幾天會(huì)議內(nèi)容在各種群里瘋傳,梁圣語(yǔ)錄被各位弟子們瘋狂記錄,連《黑神話》的馮驥都下場(chǎng)點(diǎn)評(píng) " 蕩氣回腸 "。

>/ TileLang?
據(jù)網(wǎng)傳信息,DeepSeek 正在嘗試脫離英偉達(dá)的生態(tài),而這可能和一個(gè)叫 TileLang 的編程語(yǔ)言有關(guān)。
去年九月,DeepSeek 發(fā)布 V3.2-Exp 時(shí),公告里就有一句不太起眼的話:" 我們使用高級(jí)語(yǔ)言 TileLang 進(jìn)行快速原型開(kāi)發(fā),以支持更深入的探索。"
外行人雖然看不懂吧,但那時(shí)候,行內(nèi)人就可以注意到,V3.2-Exp 沒(méi)用業(yè)界更常見(jiàn)的 Triton 來(lái)公開(kāi)研究原型,而是選了 2025 年 1 月才開(kāi)源的 TileLang。

但這當(dāng)然是有道理的,不好用我肯定不用啊。差友們可能聽(tīng)過(guò)一個(gè)說(shuō)法:芯片可以追,生態(tài)追不上。這里的 " 生態(tài) " 主要就是指英偉達(dá)圍繞 CUDA 搭起來(lái)一系列生態(tài)。
CUDA 是英偉達(dá) 2006 年推出的 GPU 編程平臺(tái)。全世界大量主流 AI 模型,都建立在英偉達(dá) GPU 和 CUDA 生態(tài)上。
你買(mǎi)別家的芯片,硬件跑分可能不差,但一跑真實(shí)的訓(xùn)練任務(wù)就各種拉跨,就是因?yàn)閲@它的編譯器、算子庫(kù)、通信庫(kù)和框架適配,遠(yuǎn)沒(méi)有 CUDA 生態(tài)成熟。這是英偉達(dá)真正的護(hù)城河。
那這和 TileLang 有什么關(guān)系呢?

大模型訓(xùn)練看起來(lái)高深莫測(cè),拆到底層,其實(shí)就是反復(fù)做矩陣乘法等基礎(chǔ)操作。而每一種反復(fù)執(zhí)行的操作,都可以寫(xiě)成一個(gè)專(zhuān)門(mén)在 GPU 上跑的小程序,這玩意就叫算子。
英偉達(dá)二十年積累下來(lái)的 CUDA 生態(tài)里,就有大量已經(jīng)寫(xiě)好、調(diào)好的高性能算子。再加上現(xiàn)成算子未必夠用,很多還得自己手搓。只要這些新算子繼續(xù)直接用 CUDA 寫(xiě),代碼資產(chǎn)越攢越多,和英偉達(dá)的綁定也越來(lái)越深,脫離 CUDA 的成本就非常高。

簡(jiǎn)單講,它在開(kāi)發(fā)者和底層硬件之間,加了一層翻譯器。
工程師可以先用更接近 Python 的方式,告訴它這個(gè)算子要干什么,再由編譯器處理下面那些麻煩活。
在英偉達(dá)的卡上,它最后還是會(huì)走 CUDA。但以后換成別的芯片,雖然仍要重做后端和硬件適配,但上層的數(shù)據(jù)流和部分代碼有機(jī)會(huì)繼續(xù)復(fù)用,不必所有算子都從頭手搓。

等到未來(lái)一聲令下,直接拎包入住,難道不香嗎?
>/ 便宜,真沒(méi)好貨嗎?
DeepSeek 的定價(jià),一直是行業(yè)里最讓人看不懂的事之一。梁圣真的只收個(gè)電費(fèi)嗎?
但根據(jù)網(wǎng)傳的說(shuō)法,DeepSeek 的利潤(rùn)還是有的,而且還不低,基本不到一年就能回本。
而且你可能想不到,DeepSeek 反而是穩(wěn)賺不賠,因?yàn)橛玫娜颂嗔恕?/p>
隔壁知危編輯部告訴我們,他們?cè)谂c高性能計(jì)算相關(guān)的專(zhuān)家交流時(shí)了解到,模型產(chǎn)品的火爆,本身就是能提高性?xún)r(jià)比的,因?yàn)橥瑯拥臋C(jī)器,跑得越滿,利用率肯定就越高,反過(guò)來(lái),沒(méi)流量的玩家,機(jī)器可能經(jīng)常在空轉(zhuǎn),這不就浪費(fèi)卡了嘛。

大伙從 DeepSeek 的架構(gòu)里,就能看出來(lái)。
眾所周知,大模型本質(zhì)上是個(gè)大號(hào)的詞語(yǔ)接龍機(jī)器,你給它一段上文,它根據(jù)概率,猜后面最該接什么。
每次對(duì)話時(shí),系統(tǒng)會(huì)把你前面說(shuō)過(guò)的東西,一起塞進(jìn)上下文里,讓模型看起來(lái)像是有記憶的。
然而,上下文越長(zhǎng),模型要算的東西就越多。尤其現(xiàn)在是 Agent 時(shí)代,情況更夸張了。哥們隨便說(shuō)句 Hi,可能兩萬(wàn) Token 就直接沒(méi)了。


模型讀上下文時(shí) , 會(huì)把讀完的理解產(chǎn)出成一堆中間結(jié)果(術(shù)語(yǔ)叫 KV Cache)保留下來(lái),和打游戲一樣做個(gè)存檔。
這樣在用戶下次提問(wèn)的時(shí)候,就可以在存檔的基礎(chǔ)上,直接開(kāi)始計(jì)算新的輸入,這就是 SL 大法的魅力啊。

當(dāng)然能。就拿 Anthropic 來(lái)說(shuō),觸發(fā)緩存命中后,API 的價(jià)格變成了原來(lái)的 1/10,看著是省了不少,但是人緩存命中只給保留 5 分鐘。。。
想保存更久?那就是另外的價(jià)錢(qián)了。

然而 DeepSeek 這里,則是幾小時(shí)到幾天。

簡(jiǎn)單來(lái)說(shuō),DeepSeek 干了一件事:在存 KV Cache 的時(shí)候,做了一層暴力壓縮。
傳統(tǒng)架構(gòu)存緩存,是把模型讀上下文產(chǎn)生的全部中間數(shù)據(jù)原樣保存,一層不落,所以文件巨大。
MLA 干的事是暴力壓縮 : 把這堆數(shù)據(jù)壓成一個(gè)極小的摘要 , 用時(shí)再還原 , 效果幾乎不損。
這樣一壓縮,緩存體積就降低了不少。
比如我們用 KV Cache 計(jì)算器模擬了下,當(dāng)上下文干到 10 萬(wàn)的時(shí)候,DeepSeek V4 Pro 的緩存文件只有 0.4 個(gè) G。而友商呢,會(huì)直接干到 6 個(gè) G。


而且這玩意,DeepSeek V2 發(fā)布的時(shí)候就已經(jīng)給搞出來(lái)了。。
只能說(shuō)它從架構(gòu)設(shè)計(jì)的第一天就把效率當(dāng)核心目標(biāo)。MLA、MoE、TileLang,這些技術(shù)選擇的出發(fā)點(diǎn)都不是 " 怎么做最強(qiáng)的模型 ",而是 " 怎么用最少的資源 , 做出足夠強(qiáng)的模型 "。
真正的遠(yuǎn)見(jiàn)大師,不得不服。
>/ 以少勝多?
最后,我們來(lái)聊聊 DeepSeek 到底在堅(jiān)持什么。
去年春節(jié)那波潑天流量,擱任何一家公司,劇本都是連夜融資、瘋狂投放,把用戶焊死在自己 App 里。DeepSeek 呢?不買(mǎi)量、不急著變現(xiàn),連留存數(shù)據(jù)都懶得做,甚至你用得太猛了他還想把你踹出去。

這也就解釋了,為啥現(xiàn)在外面一堆人擱那兒狂卷 C 端 Agent、世界模型,DeepSeek 不動(dòng)如山。因?yàn)樵谒麄兊囊暯抢铮@些玩意兒,也就是通往 AGI 大道上順手的事兒。

他們信奉一條極其硬核的底層邏輯:AI 太大了,大到不可能被獨(dú)占。
咱們簡(jiǎn)單算筆賬,如果 AI 未來(lái)能吃掉全人類(lèi)社會(huì) GDP 的 10%,這塊蛋糕哪怕打骨折再打骨折,也絕對(duì)沒(méi)有任何一家科技巨頭能一口吞下去。
而且歷史早就證明了,盤(pán)子越大,想吃獨(dú)食的人死得越慘。你前腳想壟斷,后腳同行就合伙防你,監(jiān)管部門(mén)拿著放大鏡盯你,市場(chǎng)上還會(huì)分分鐘手搓一個(gè)費(fèi)平替版出來(lái)瓦解你。

當(dāng)然了,用愛(ài)發(fā)電也是不可能的,拿太少公司明天就得解散。這場(chǎng)反向拍賣(mài)的最后,一定會(huì)卡在一個(gè)極其精妙的均衡點(diǎn)?,F(xiàn)在知道為什么鯨魚(yú)喜歡降價(jià)了吧。

這,就是 DeepSeek 以少勝多的頂級(jí)陽(yáng)謀。
總之,在這個(gè)大家都在急著做 C 端應(yīng)用套現(xiàn)、卷流量商業(yè)化的時(shí)代,能有這么一家公司,專(zhuān)注于 AGI 的終極天花板,這本身就是一件非常吸引人的事兒。
反正,藍(lán)色大鯨魚(yú)已經(jīng)在水下憋足了勁兒。至于 DeepSeek V4 正式版到底能不能再次刷新大伙的認(rèn)知?咱們拭目以待就完了。
撰文:不咕
編輯:江江 & 面線
美編:煥妍
圖片、資料來(lái)源:
DeepSeek,小紅書(shū),Github,
差評(píng)前沿部,緩存命中率,DeepSeek 的終極殺手锏?
部分圖片由 AI 生成


