從視覺理解到生成世界,這條路他們走了二十多年。
作者|徐珊
編輯|鄭玄
2017 年,微軟亞洲研究院。梅濤帶著姚霆等團隊做出了全球最早的文生視頻模型之一,當時無人問津。
九年后的這個夏天,同一群人創(chuàng)辦的公司三個月融了超 20 億,估值突破 10 億美金,成為獨角獸企業(yè)。
7 月 15 日,智象未來宣布完成 15 億元 C 輪融資,本輪融資由社?;鹚拇ㄕ衽d科創(chuàng)基金、工銀資本、弘頤資管、敦鴻資本聯(lián)合領(lǐng)投,廈門國貿(mào)資本、上影新視野基金、華策影視等多家機構(gòu)跟投。老股東合肥產(chǎn)投、東方富海等科技投資機構(gòu)持續(xù)加注。
智象未來成立于 2023 年,試圖通過自研原生全模態(tài)世界模型,讓 AI 不再只是生成圖像、視頻和 3D 內(nèi)容,而是在統(tǒng)一架構(gòu)中理解空間、時間、運動與物體關(guān)系,讓 AI 從視覺內(nèi)容生成,走向?qū)ΜF(xiàn)實世界的理解、預(yù)測與重構(gòu)。
創(chuàng)始人梅濤是加拿大工程院外籍院士,曾先后在微軟亞洲研究院和京東工作多年,作為創(chuàng)業(yè)家的另一面,他其實也是國際四大學會 Fellow 的知名人工智能學者。
智象所在的視覺模型賽道,是當下競爭最激烈的戰(zhàn)場之一。幾個月前,就連背靠 OpenAI 的 Sora,都在上線兩年后關(guān)停。但 Sora 的失敗并沒有給視覺賽道降溫,近期快手為可靈完成上限 30 億美元的增資,國內(nèi)視頻生成廠商也先后拿到大額融資,產(chǎn)業(yè)明顯開始更關(guān)注多模態(tài)大模型的架構(gòu)創(chuàng)新、工程化能力和商業(yè)落地。
不過,這輪融資中更值得關(guān)注的或許是給錢的人。公開信息顯示 , 這是社?;鹱鳛?LP 首次投資多模態(tài)大模型方向的公司,更是工銀資本第一次出手多模態(tài)大模型企業(yè)。跟投名單里,還站著來自安徽、上海、浙江、福建、湖南多地的國資,以及上影股份和華策影視兩家頭部影視上市公司。
熱錢追風口,慢錢認路線。當最慢的錢不約而同開始為一家大模型公司下注,我們好奇,這些人在智象未來身上看到了什么?
01
「模型把所見的東西都記住,
甚至復(fù)刻出來」
理解智象未來的不同,要先理解一張圖是怎么被生成出來的。想讓 AI 學會生成圖像,得先讓它「看」圖。怎么看,行業(yè)分成了兩派。
主流的行業(yè)做法,相當于讓模型隔著一層毛玻璃看世界:圖片先被壓縮,變小、變糊,再喂給模型;文字則由另一個模塊單獨處理,兩邊各學各的,最后拼在一起出結(jié)果。這么做省算力,訓練快,所以幾乎所有文生圖模型都這么干。但信息一旦被壓縮,細節(jié)也就丟了,補不回來。
智象干脆把毛玻璃拆了,不壓縮,讓模型直接看原圖,圖片和文字也不再分開處理,一起交給同一套自研的原生全模態(tài)架構(gòu)— UiT(Unified Transformer),讓它一邊看、一邊學著畫。模型記住的,是世界本來的樣子。「我希望模型把所見的東西都記住,甚至復(fù)刻出來?!怪窍笪磥?CTO 姚霆對極客公園說道。當然,看得越清楚,學得越費勁,模型更大,更吃數(shù)據(jù),訓練也更慢。

選擇這條路線背后,同樣也離不開智象對「世界模型」的獨特理解。
過去,人們常討論的多模態(tài)模型主要是在語言模型之外掛上圖片理解、再補一個生成模塊,重心仍在文字。而智象說的原生全模態(tài),重心壓在所有模態(tài)從原始信號出發(fā),進行端到端的全模態(tài)對齊:用一個神經(jīng)網(wǎng)絡(luò),同時理解和生成文本、圖像、視頻、3D 以及動作等,各個模態(tài)不單獨編碼,而是統(tǒng)一 tokenization,端到端地在同一套網(wǎng)絡(luò)里完成。
「下一代大模型競爭的關(guān)鍵,不是單一模態(tài)能力的疊加,而是能否從多模態(tài)走向全模態(tài),以原生統(tǒng)一架構(gòu)對真實物理世界進行統(tǒng)一建模,構(gòu)建原生全模態(tài)世界模型,這是我們篤定的路線和方向?!怪窍笪磥韯?chuàng)始人兼 CEO 梅濤說道。他認為通往世界模型尚未收斂,目前主要有三條分岔路:一條路線以 3D 原生模型切入,強調(diào)空間一致性;另外一條從 Sora、Veo、Seedance 等多模態(tài)視頻模型切入,用視頻生成逼近世界模擬;也有人沿著具身智能路線推進,從 JEPA、VLA 到 WAM,試圖解決動作規(guī)劃、物理交互和長程決策。
比如說,谷歌是目前全模態(tài)上走得非常靠前的公司,文本是它最強的地方之一,所以它會沿著 Gemini 的文本架構(gòu)去擴充其他模態(tài);智象則從自己積累最深的視覺像素出發(fā),以此為底座向外生長。「每家公司一定要立足自己的稟賦,去做自己的判斷。兩條路無關(guān)對錯,分出的只是各自能觸到的天花板?!挂f道。
天花板是有價碼的。架構(gòu)切換之前,團隊內(nèi)部有過一場關(guān)鍵討論:到底沿著原來的隱式表達繼續(xù)做,拿個 80 分的效果就知足了,還是換「像素」路線,爭取沖擊 90 分的機會?!缸?90 分是有代價的,這條路本來就不那么容易走通,甚至可能做不成?!挂f道。在模型企業(yè)創(chuàng)業(yè)的早期,團隊往往會遇到很多選擇的問題,幾番糾結(jié)后,在正確而難和容易見效的路線上,他們選了前者。
賭注的第一筆回報落在模型榜單上。采用 UiT 架構(gòu)的 HiDream-O1-Image 開源版本,今年 5 月登頂全球獨立模型評測平臺 Artificial Analysis 文生圖榜單開源模型全球第一,也是該榜單排名前 20 的模型中公開參數(shù)最小的模型版本;6 月,商用版 HiDream-O1-Image-1.5 再次成為該榜單排名最高的中國圖像模型,位列全球前三,在光影、復(fù)雜構(gòu)圖、指令跟隨和中英文字渲染上表現(xiàn)突出。這也是原生全模態(tài)架構(gòu)第一次從「技術(shù)驗證」走到「生產(chǎn)驗證」。

但榜單第一說服不了客戶,架構(gòu)創(chuàng)新是入場券,真正的問題是誰買單 ?
02
模型是底座,Know-How 才是賣點
幾乎所有的創(chuàng)業(yè)團隊都離不開一個究極問題:為什么你能做,但大廠不能做。
智象未來對此的破題思路很清晰。首先,沒有任何企業(yè)能夠做出一個完美的模型;其次,沒有哪家企業(yè)不能做什么模型,不過是時間、資源、金錢投入的力度和選擇的方向。因此,在多模態(tài)視頻賽道,考驗的更多的是認知理解,也是關(guān)鍵選擇。「我們對行業(yè)的認知理解比其他人要領(lǐng)先行業(yè)三到六個月,這就是我們的優(yōu)勢所在?!挂治龅?。
但認知領(lǐng)先無法直接「開發(fā)票」,它必須先變成產(chǎn)品,再變成交付,最后變成客戶愿意續(xù)約的理由。
在智象看來,其針對 OPC 產(chǎn)品的內(nèi)容創(chuàng)作智能體 vivago 是天然的模型驗證場?!窩 端產(chǎn)品就是一個放大器。5000 萬用戶的日常使用,把實驗室里看不見的問題成規(guī)模地暴露出來;解決這些問題的過程,就是理解模型落進產(chǎn)業(yè)會碰到什么的過程?!挂f。這是 vivago 好用的原因,也是這套架構(gòu)能持續(xù)轉(zhuǎn)動的原因。

5 月 17 日,vivago 在全球頂級科技產(chǎn)品首發(fā)平臺、美國硅谷產(chǎn)品風向標 Product Hunt 上,位列日榜第一,如今 vivago 積累了超 5000 萬用戶。在剛剛結(jié)束的 WAIC 2026 上,智象未來將 vivago 升級為全球首個具備無限時長視頻生成與編輯能力的多模態(tài)創(chuàng)作智能體 vivago R1,提高了智能體的長程推理能力。這也說明了 AI 能從輔助生成單點素材的工具,成長為能自主規(guī)劃、調(diào)度并完成長鏈路創(chuàng)作任務(wù)的「AI 搭子」。
以下視頻來源于
HiDream 智象未來
,時長 01:21
vivago |來源:智象未來
「這個數(shù)字的大部分貢獻不僅來自模型能力的本質(zhì)區(qū)別,也來自對影視制作流程的理解能力,比如說,分鏡怎么拆,敘事怎么接,策略怎么寫?!挂J為行業(yè) Know-How 會被沉淀成一個個 Skill,長在模型之上。
不僅如此,智象未來研發(fā)的 AI 創(chuàng)作智能體「幀贊」累計制作短漫劇超過 5000 分鐘,,平臺入駐專業(yè)團隊近千家。
商業(yè)營銷方向上,商業(yè)營銷智能體 HiBurst,已覆蓋跨境電商內(nèi)容營銷、媒體運營和應(yīng)用出海等場景,支持 TikTok、Meta、抖音、小紅書等主流平臺,并成為 TikTok 官方 top 5 服務(wù)商,年生產(chǎn)電商營銷視頻超過百萬條,覆蓋 GMV 已超億元。
這些成果也意味著,如今視覺模型的出路 , 不再是過去語言模型那樣單一賣通用 API,而是「專屬模型 + 工作流 + 結(jié)果交付」,一旦和客戶的素材庫、業(yè)務(wù)系統(tǒng)、協(xié)作流程綁定,遷移成本就立起來了?!?strong>影視公司真正需要的不是單點生成能力,而是能理解鏡頭語言、敘事節(jié)奏,并進入劇本評估、視覺預(yù)演、后期制作等真實流程的協(xié)同系統(tǒng)。這也是 AI 從工具走向產(chǎn)業(yè)工作流的關(guān)鍵。」華策影視副總裁張思拓談及為何投資智象未來時說道。
最直觀的體現(xiàn)是營收增速。從 2025 年開始年商業(yè)化收入持續(xù)快速增長,其中企業(yè)業(yè)務(wù)的占比更高,也說明其訂單來自長期愿意續(xù)約的企業(yè)客戶,更為穩(wěn)定。
如果用一句話概括這門生意:語言模型賣的是 Token,智象賣的是結(jié)果。而能把結(jié)果賣出去,靠的不是這四年,是過去的二十年。
03
視覺理解這件事,他們做了二十余年
中國 AI 創(chuàng)業(yè)公司大多有個「隱疾」,會寫論文的不懂產(chǎn)業(yè),懂產(chǎn)業(yè)的技術(shù)總是靠拿來主義。但想要同時會技術(shù)創(chuàng)新、又能做出好的產(chǎn)品,就要求同一群人先后在最好的實驗室和競爭最激烈的產(chǎn)業(yè)里各泡上幾年。智象未來對視覺產(chǎn)業(yè)的理解,正是這樣泡出來的。
開頭那個 2017 年時刻,只是這群人二十年長跑中的一步。他們是投身中國視覺研究的頭一批人,在微軟亞研院做圖像搜索、支撐 Bing 和小冰,對手常年是谷歌與伯克利。「我們天然的成長基因里,就是希望做全世界最好的視覺模型?!挂f。
2018 年,這群人做了一個學院派中罕見的選擇,加入京東。此后五年是一段學術(shù)和產(chǎn)業(yè)緊密融合的歲月,他們在京東做拍照購項目,實現(xiàn) 10 億級別全圖庫秒級檢索,這個功能至今仍然是京東 APP 首頁上使用量超高的一個用戶入口;讓京東亞洲一號物流倉里兩套 7×24 小時機械臂實現(xiàn)了持續(xù)的穩(wěn)態(tài)運營,支持 10 萬 +SKU 的揀選——只有真正深入過具身工業(yè)應(yīng)用的行業(yè),才知道這意味著什么。
有關(guān)產(chǎn)業(yè)的知識在快速積累。大客戶為什么買單,產(chǎn)線容忍什么誤差,一個模型從驚艷的 Demo 到敢簽合同的產(chǎn)品之間,要填多少坑。中國 AI 行業(yè)后來反復(fù)需要驗證的一課,他們花了五年去學習。最后發(fā)現(xiàn),技術(shù)的價值,最終以交付的形態(tài)存在。
所以 2023 年的創(chuàng)業(yè),是這群人終于等到了自己的時代。「更遠的 AI for Science 我們參與不了,只能見證;而視覺生成,是我們堅持做了二十年的事,應(yīng)該在場?!姑窛崖殬I(yè)生涯再次押進最熟悉的領(lǐng)域。

有意思的是,在智象未來內(nèi)部,學術(shù)氛圍仍然明顯。技術(shù)團隊的專業(yè)交流氛圍仍是師生式的,姚霆、潘博這些核心成員之間,稱呼和做事的方式仍保留實驗室的習慣;企業(yè)背后也站著中科大的產(chǎn)學脈絡(luò),種子輪甚至都是十五位科大校友湊的錢。來到產(chǎn)業(yè)后,他們也沒放棄對創(chuàng)新的研究。
「不過,如果只按純科研的心態(tài)做,很難落地,這個時候我會 push 自己往前走半步。」姚霆談起自己從學界走入產(chǎn)業(yè)界時調(diào)整姿態(tài)的方式。
四年四換架構(gòu)的大膽與創(chuàng)新,和五千分鐘短劇的耐心,體現(xiàn)在這同一群人身上并不矛盾。而現(xiàn)在,有人愿意為這兩面同時下注了。
04
國家隊入場后,下一站瞄準 IPO
回到開頭那個問題:國家隊的慢錢到底看到了什么?
除了常見的企業(yè)敘事,我們發(fā)現(xiàn)這輪融資最強的信號,其實是國家隊的入場姿態(tài)。工銀資本此前從未碰過多模態(tài)大模型,這類資本決策周期以年計,多出現(xiàn)在半導(dǎo)體、存儲、儲能公司的股東名單里,這類資本往往押注的是一個時代的關(guān)鍵判斷。
在產(chǎn)業(yè)上,國資的偏好向來明確:投一家公司,最好能撬動幾條產(chǎn)業(yè)鏈。視覺恰好是大模型里離產(chǎn)業(yè)最近的一層,影視、文旅、營銷、電商都是現(xiàn)成場景;而智象交出的成果,又都經(jīng)得起逐項驗收。錢穿過公司,落進產(chǎn)業(yè),能用一個支點帶起一片規(guī)模。
在路線上,谷歌正把全模態(tài)收進 Gemini 這一張網(wǎng)中,Sora 退場之后,窗口期內(nèi),國內(nèi)需要有從架構(gòu)層就完全自研的公司站上視覺模型主賽道的牌桌。智象砍掉 VAE、把像素與文本統(tǒng)一進一套網(wǎng)絡(luò)的 UiT,成為其核心技術(shù)自研的支點。
對公司自己,這份股東名單也是一份隱形的背書。B 端客戶簽約前掂量的,是一家創(chuàng)業(yè)公司靠不靠得住、能走多遠,國家級資本的入局,本身就是一種市場信任的背書。
隨著賽道整體轉(zhuǎn)入上市競賽。本次融資的同時,智象未來已經(jīng)悄然完成股改,第三方企查查平臺的工商資料顯示,智象未來的合肥主體已經(jīng)正式更名為智象未來(合肥)科技股份有限公司。接下來,它要做的,是將技術(shù)積累與商業(yè)落地轉(zhuǎn)化為持續(xù)穩(wěn)健的增長,在多模態(tài)大模型賽道的資本角逐中,以第一梯隊的姿態(tài)進入下一輪競賽。
* 頭圖來源:智象未來
本文為極客公園原創(chuàng)文章,轉(zhuǎn)載請聯(lián)系極客君微信 geekparkGO