电竞比分网-中国电竞赛事及体育赛事平台

關于ZAKER Skills 合作

為什么現(xiàn)在游戲對 AI 更重要了

劉勁 段磊/文

長期以來,社會公眾和政府監(jiān)管對游戲抱有一種審慎甚至負面的態(tài)度,原因在于游戲行業(yè)確實存在青少年易沉迷、部分內(nèi)容有不良價值觀導向、部分商業(yè)化模式有爭議等問題。但更深層的原因在于產(chǎn)業(yè)定位:游戲長期被視為 " 不創(chuàng)造實體價值 " 的虛擬行業(yè),難以與芯片、能源、人工智能等 " 硬科技 " 相提并論。

然而,人工智能的快速發(fā)展正在從根本上重塑我們理解游戲價值的底層邏輯。游戲過去已經(jīng)為 AI 的算力基礎設施和算法發(fā)展提供了重要助力?,F(xiàn)在伴隨 AI 進入新階段、面對新挑戰(zhàn),游戲很可能在智能體(Agent)訓練、具身智能以及應對數(shù)據(jù)枯竭等方面,提供更為關鍵的基礎設施價值。

游戲對 AI 發(fā)展的歷史貢獻

游戲產(chǎn)業(yè)在多個關鍵節(jié)點上,為 AI 的飛躍提供了不可或缺的條件。

第一次重大推動發(fā)生在算力層面。在 20 世紀 90 年代,游戲玩家對實時渲染、復雜光影和高幀率的需求,催生了一種全新的計算架構——圖形處理器(GPU)。GPU 的本質是大規(guī)模并行計算。

到了 21 世紀初,AI 研究者發(fā)現(xiàn),原本為游戲畫面服務的 GPU 非常適合高效訓練深度神經(jīng)網(wǎng)絡——矩陣乘法這類深度學習的基本運算,在 GPU 上的執(zhí)行速度比傳統(tǒng) CPU 快數(shù)十倍甚至上百倍。

從那一刻起,游戲產(chǎn)業(yè)培育出的算力體系,成為深度學習革命的重要基礎設施??梢哉f,沒有游戲產(chǎn)業(yè)持續(xù)數(shù)十年的圖形計算投入,就沒有今天 AI 大模型訓練所依賴的 GPU 算力集群。

這段歷史在英偉達的財報里留下了清晰的印記。2016 財年,英偉達的游戲業(yè)務收入約 28.2 億美元,數(shù)據(jù)中心業(yè)務只有 3.4 億美元,前者是后者的 8 倍多。到 2025 財年,數(shù)據(jù)中心已占總營收約 88%,游戲只剩 8.7%。這條從游戲引擎到 AI 引擎的曲線,是游戲為 AI 輸送算力的最好注腳。

第二次重大推動則發(fā)生在算法層面。2015 年,DeepMind 在《自然》雜志發(fā)表了 DQN(深度 Q 網(wǎng)絡)研究,第一次大規(guī)模地把深度學習和強化學習成功結合起來——讓 AI 在幾十款雅達利(Atari)游戲中自己摸索操作策略,最終達到接近專業(yè)人類測試員的水平,宣告了 " 深度強化學習 " 時代的到來。

2016 年,AlphaGo 通過學習海量人類職業(yè)棋譜,再輔以強化學習,擊敗圍棋世界冠軍李世石,成為 AI 史上的里程碑。那場對局中著名的 " 第 37 手 ",正是 AI 跳出人類經(jīng)驗、自主創(chuàng)新的經(jīng)典時刻。

2017 年的 AlphaGoZero 更進一步,完全拋棄人類棋譜,僅靠 " 自己和自己下棋 ",在幾天訓練后就達到超越人類的水平,把這種 " 獨立思考 " 的能力推向了極致。這說明,游戲不僅能幫助 AI 模仿人類,還能讓 AI 在規(guī)則清晰、反饋明確的環(huán)境里,發(fā)現(xiàn)連人類都想不到的新策略。

可見過去十來年,游戲賦能 AI 算法發(fā)展的關鍵詞是 " 強化學習 "。原因在于兩者的底層邏輯高度契合:游戲本質上是一個規(guī)則清晰、反饋及時、獎勵明確的環(huán)境系統(tǒng),恰好為強化學習 " 在試錯中根據(jù)獎勵調整行為 " 提供了明確的目標、可重復的交互和清晰的獎勵信號。

隨著大模型、智能體、具身智能乃至世界模型的興起,游戲對 AI 的賦能已經(jīng)無法只用算力和強化學習來定義,這種賦能正在變得更加廣泛和深入。其邏輯可以從兩個維度來理解。

其一是環(huán)境維度:游戲及其引擎技術是一套高質量、低成本的環(huán)境系統(tǒng),為 AI 提供了一個可以反復試錯、快速迭代的訓練場和實驗室,這對智能體、智能駕駛、具身智能的訓練與測試都有高度價值。

其二是數(shù)據(jù)維度:游戲通過人與游戲的互動、玩家之間的博弈、乃至 AI 在其中的自我對弈等各種交互方式,源源不斷地產(chǎn)生海量、高質量、低成本的數(shù)據(jù)。

這兩個維度不是簡單的并列關系,二者猶如工廠與產(chǎn)品:游戲環(huán)境是生產(chǎn)數(shù)據(jù)的系統(tǒng),數(shù)據(jù)則是環(huán)境產(chǎn)出的核心資產(chǎn)。核心價值的最終落點當然是數(shù)據(jù),因為數(shù)據(jù)是驅動 AI 發(fā)展的燃料;但只有從環(huán)境和數(shù)據(jù)兩個維度同時剖析,才能真正看清游戲中數(shù)據(jù)的特點,以及游戲對 AI 的價值。

環(huán)境維度

今天的大模型,主要依靠海量的靜態(tài)數(shù)據(jù)訓練而成——互聯(lián)網(wǎng)上的文本、圖像、視頻等。這類數(shù)據(jù)讓 AI 學會 " 看懂 "" 聽懂 " 這個世界。

但要讓機器智能更進一步,具備 " 能決策、能動手 " 的能力,僅靠靜態(tài)數(shù)據(jù)是不夠的:它必須在與世界的持續(xù)交互中學習。

問題在于,讓 AI 直接在真實世界里交互學習,代價極其高昂。游戲及其引擎技術所構建的虛擬環(huán)境,恰好提供了一個理想的替代方案。相比真實世界,它至少有五個方面的優(yōu)勢。

第一,成本極低。真實世界的試錯,往往既貴又危險。自動駕駛領域一次錯誤的決策,可能就意味著一場真實的事故;在虛擬環(huán)境中,同樣的試錯幾乎不需要付出代價。以理想汽車公開的智能駕駛測試數(shù)據(jù)為例:2023 年該公司實車路測每公里成本約 18.4 元,而到 2025 年上半年,其借助世界模型進行仿真測試,完成約 4000 萬公里仿真里程(實車僅約 2 萬公里),單公里成本降至約 0.53 元,僅為實車路測的約三十五分之一。成本的量級差異,直接決定了訓練能否規(guī)模化。

第二,高度可控、可重復。在真實環(huán)境中做對比實驗,常常受制于不可控的外部變量。比如,要驗證不同天氣對算法的影響,你只能被動等待相應天氣的出現(xiàn);在虛擬環(huán)境里,研究人員只需調整底層參數(shù)(光照強度、車流密度、降水概率等),就能快速生成任意目標場景。AI 訓練由此從 " 被動等待 " 轉向 " 主動生成 ",效率大幅提升。

第三,風險可控,能提前暴露問題。AI 在部署到現(xiàn)實世界之前,需要充分的安全驗證,但真實環(huán)境中的安全測試代價極高——不可能為了測試自動駕駛的碰撞反應而刻意制造事故,也不可能在真實電網(wǎng)中釋放攻擊性代碼來檢測漏洞。游戲沙盒完美繞過了這些限制:研究者可以在虛擬環(huán)境中主動構造極端天氣、傳感器故障、惡意輸入等邊緣場景,零風險地探測 AI 的行為邊界,觀察其是否異?;蛴泻?。這種提前暴露問題、收斂風險的機制,對即將大規(guī)模進入現(xiàn)實的 AI 系統(tǒng)不可或缺。

第四,具備天然的可解釋性。當前 AI 最受詬病的問題之一是 " 黑箱 "。模型輸出一個結果,但人類研究者很難說清它為什么做出這個決定。游戲環(huán)境為破解這一難題提供了獨特條件:在游戲中,每一個狀態(tài)變量都可以被精確記錄、暫停、回放和復現(xiàn),研究者得以逐幀追問 "AI 此刻看到了什么、為何這樣決策 "。這種在真實世界中幾乎無法實現(xiàn)的因果可追溯性,讓游戲成為可解釋性研究的天然實驗室——它不僅讓 AI" 做題 ",還讓人看清 AI 的 " 解題過程 "。

第五,實時交互、有效反饋。與靜態(tài)的圖像或文本數(shù)據(jù)不同,游戲環(huán)境的核心特征是 " 交互性 ":AI 在游戲中不僅 " 看 " 到了什么,更重要的是它能夠 " 做 " 什么,并且立刻看到行動帶來的結果。推一下?lián)u桿,角色就移動;踩下剎車,車輛就減速;選錯策略,比分就落后。這種即時的 " 動作—反饋 " 閉環(huán),是訓練決策智能的必要條件。在反復練習中,AI 得以學會判斷時機、理解空間、制定策略——這些能力在純靜態(tài)數(shù)據(jù)上無法習得。

游戲環(huán)境對 AI 的價值有兩個層面:一是利用現(xiàn)成的商業(yè)游戲作為訓練環(huán)境,二是利用游戲引擎技術構建專用的仿真平臺。前者雖是娛樂產(chǎn)品,物理規(guī)律和社會運行機制可能被夸張?zhí)幚恚ㄈ缳愜囉螒驊騽』呐鲎残Ч?,但依然可用來訓?AI 的通用決策能力。

例如,騰訊 " 絕悟 "AI 最初是為《王者榮耀》這類復雜多人在線對戰(zhàn)游戲研發(fā)的決策智能系統(tǒng)——它需要在實時、不完全信息、多智能體協(xié)作的極高難度環(huán)境中做出最優(yōu)決策。

研究者發(fā)現(xiàn)," 絕悟 " 在游戲中錘煉出的最優(yōu)路徑規(guī)劃能力,可以遷移到病理全片掃描診斷領域:騰訊 AILab 據(jù)此研發(fā)的 RLogist 系統(tǒng)(發(fā)表于 AAAI2023)將病理切片的掃描路徑優(yōu)化,轉化為類似游戲中的 " 探索—決策 " 問題,決策效率相比傳統(tǒng)方式提升約 400%,在保證診斷準確率的同時縮短了病理閱片的等待時間。

后者則是利用游戲引擎技術,搭建高度貼近真實物理世界的專用仿真場景——比如一個與真實施工現(xiàn)場 1:1 還原的礦山、一條與真實城市道路完全一致的街區(qū)。這種方式既保留了游戲環(huán)境低成本、高可控、可交互的核心優(yōu)勢,又通過精密的物理建模彌合了 " 虛擬—現(xiàn)實 " 之間的鴻溝。

以 Unity 和 Unreal 為代表的游戲引擎,為 AI 的產(chǎn)業(yè)級仿真提供了高保真的物理仿真、實時光線追蹤和可編程的環(huán)境參數(shù)系統(tǒng)。例如騰訊推出的自動駕駛仿真平臺 TADSim,就是一個典型的 " 游戲引擎到專用仿真 " 遷移案例:該系統(tǒng)利用游戲引擎的厘米級三維重建、工業(yè)級車輛動力學模型和 AI 驅動的交通流仿真技術,可以在云端支持上千輛自動駕駛主車及上百萬輛交通車同步運行,日均測試能力超過 1000 萬公里,遠遠突破了真實路測的限制。

數(shù)據(jù)維度

環(huán)境的價值最終要通過它產(chǎn)出的數(shù)據(jù)來兌現(xiàn)。游戲數(shù)據(jù)的獨特價值體現(xiàn)在兩個天然屬性和兩個數(shù)據(jù)來源上。

第一個屬性是天然的 " 多模態(tài)對齊 "。要提升 AI 對現(xiàn)實世界的理解,必須依賴多模態(tài)數(shù)據(jù),因為現(xiàn)實世界本身就是多模態(tài)且自動對齊的。人類理解世界,從來是視覺、聲音、動作、物理反饋的綜合,AI 也需建立起不同模態(tài)之間的關聯(lián)。

然而現(xiàn)實中,多模態(tài)數(shù)據(jù)往往來源分散,視覺、聲音、動作很難同時采集,即便采集完成也需大量人工標注對齊,難以規(guī)?;?/p>

游戲則不同:它運行時同時產(chǎn)生畫面、聲音、動作、物理反饋,且天然處于同一時間軸、同一場景中,彼此自動對應。對 AI 而言,這相當于一套圖像、音頻、動作與環(huán)境狀態(tài)完全同步的 " 多模態(tài)教科書 ",正是當下訓練 " 視覺—語言—動作 " 大模型等所急需的關鍵原材料。

第二個屬性是清晰的 " 狀態(tài)—動作—反饋 " 因果結構。AI 要真正理解世界,不能只知道 " 發(fā)生了什么 ",還得理解 " 為什么會發(fā)生 ",即某個行為如何導致某個結果;只有建立起這種因果關聯(lián),AI 才能形成真正的決策與推理能力。

但這種數(shù)據(jù)在現(xiàn)實中極難采集和標注:現(xiàn)實變量高度復雜,一個結果往往受多個行為共同影響,關鍵反饋也容易遺漏。游戲天然具備這種結構,會完整記錄 " 看到什么(狀態(tài))—做了什么(動作)—得到什么結果(反饋)",任何一次失敗都能精確回放。這就好比給 AI 一本帶完整解題步驟和答案的 " 教科書 ",讓它高效學習因果規(guī)律、調整策略。

游戲數(shù)據(jù)的另一個獨特性在于,它既有人類經(jīng)驗的沉淀,又可以有機器智能的探索。

一方面,人類與游戲交互產(chǎn)生的數(shù)據(jù),是人類經(jīng)驗的數(shù)字沉淀,可以支撐 AI 的模仿學習。這就像讓 AI 站在無數(shù)頂尖人類玩家的肩膀上看世界,快速習得那些 " 只可意會、難以言傳 " 的經(jīng)驗性策略。以自由度極高的沙盒游戲《我的世界》(Minecraft)為例,AI 通過 " 看人類怎么玩 " 來模仿,就能學會大量難以用規(guī)則描述的經(jīng)驗。

人類的數(shù)字沉淀還可以幫助 AI 更好地實現(xiàn) " 人類偏好對齊 ",讓決策更貼近人類的價值判斷。早在 2017 年,OpenAI 與 DeepMind 就在雅達利游戲等虛擬環(huán)境中做過一個經(jīng)典實驗:人類只需對 AI 的不同操作片段(比如賽車游戲中的駕駛表現(xiàn))表達 " 這個更好、那個更差 " 的偏好,模型就能逐步調整策略,讓行為越來越符合人類的判斷標準,并最終提升任務表現(xiàn)。無論是模仿學習還是偏好對齊,人類交互數(shù)據(jù)的核心價值,都在于把人類的經(jīng)驗 " 喂 " 給 AI,讓它得以站在人類智慧的肩膀上快速進化。

另一方面,AI 與游戲交互產(chǎn)生的數(shù)據(jù),是機器智能與環(huán)境互動產(chǎn)生的合成數(shù)據(jù),對 AI 發(fā)展同樣重要。利用算法和游戲引擎批量生成的合成數(shù)據(jù),可以覆蓋現(xiàn)實中稀缺的長尾場景——罕見的極端天氣、危險路況都能在虛擬環(huán)境中大量 " 造 " 出來,彌補真實數(shù)據(jù)在邊緣場景上的天然稀缺。

而 AI 在游戲中 " 自我博弈 " 產(chǎn)生的數(shù)據(jù)則可用于強化學習訓練:AI 親自下場,自己和自己對打,每一局的輸贏都轉化為新的經(jīng)驗數(shù)據(jù),驅動模型在無需人類監(jiān)督的情況下持續(xù)自我進化。前文的 AlphaGoZero 正是例證——完全依靠自我博弈,最終突破了人類經(jīng)驗的能力邊界??梢哉f,自我博弈產(chǎn)生的數(shù)據(jù),是 AI 邁向超人類表現(xiàn)的關鍵驅動力。

總結

正如英偉達早已不是一家游戲顯卡公司,游戲產(chǎn)業(yè)的價值坐標也正在越過娛樂產(chǎn)業(yè)的邊界,向科技基礎設施的方向遷移。

在環(huán)境維度,它為 AI 提供了低成本、可交互、有即時反饋的虛擬系統(tǒng),讓智能得以反復試錯、快速成長;在數(shù)據(jù)維度,它持續(xù)產(chǎn)出結構化、多模態(tài)自對齊的海量數(shù)據(jù),為智能提供源源不斷的養(yǎng)料。

當然,虛擬終究不能完全替代現(xiàn)實,游戲環(huán)境更像是真實世界的高效放大器而非替身。但隨著 AI 向具身智能與世界模型演進,游戲承載的這兩重價值會進一步凸顯。

這也提醒我們是時候轉換看待游戲的視角:不再只盯著它的娛樂外殼,而是看清它作為 AI 隱性基礎設施的內(nèi)核。

中國擁有全球最大的游戲市場和最活躍的游戲產(chǎn)業(yè)生態(tài),在移動游戲、電競、游戲 AI 等領域已經(jīng)積累了深厚的技術儲備與人才梯隊。若能超越 " 游戲即娛樂 " 的單一認知,系統(tǒng)性地推動游戲技術向 AI 基礎設施轉化,這很可能成為中國在全球 AI 競爭中一個獨特的優(yōu)勢來源。

(劉勁系長江商學院會計與金融學教授、投資研究部主任,段磊系深之度咨詢合伙人)

相關閱讀

最新評論

沒有更多評論了
經(jīng)濟觀察報

經(jīng)濟觀察報

理性·建設性

訂閱

覺得文章不錯,微信掃描分享好友

掃碼分享

企業(yè)資訊

查看更多內(nèi)容