說話“到“會(huì)理解世界“-Day27)
2024 年大語言模型LLM讓 AI 學(xué)會(huì)了寫作、編程和對話。2026 年Yann LeCun 離開 Meta融資 10.3 億美元?jiǎng)?chuàng)立 AMI Labs宣稱LLM 將在 3-5 年內(nèi)過時(shí)。一、兩個(gè)世界的分野LLM 與世界模型1.1 LLM精通語言的文科生大語言模型如 GPT-5、DeepSeek-V4、Claude 4的核心機(jī)制極其簡單預(yù)測下一個(gè) token。通過在數(shù)萬億文本 token 上訓(xùn)練模型學(xué)會(huì)了語言的語法、風(fēng)格、知識(shí)關(guān)聯(lián)和邏輯結(jié)構(gòu)。LLM 的能力邊界? 寫作、翻譯、代碼生成、知識(shí)問答? 抽象推理、概念組合、數(shù)學(xué)證明配合 CoT? 無法理解杯子掉落會(huì)碎背后的物理因果? 無法區(qū)分客觀現(xiàn)實(shí)與主觀信念? 缺乏對連續(xù)時(shí)空動(dòng)態(tài)的直觀把握正如李飛飛教授所言“大語言模型的核心是 ‘Saying things’而具身世界模型的核心是 ‘Seeing and doing things’。”1.2 世界模型精通物理的理科生世界模型的核心定義來自強(qiáng)化學(xué)習(xí)之父 Richard Sutton1990“一個(gè)黑箱輸入當(dāng)前狀態(tài)和即將執(zhí)行的動(dòng)作輸出對下一個(gè)狀態(tài)的預(yù)測?!庇霉奖磉_(dá)f(觀察, 動(dòng)作) → 下一狀態(tài)。世界模型不預(yù)測下一個(gè)詞而是預(yù)測物理世界的下一個(gè)狀態(tài)。它通過觀察視頻、傳感器數(shù)據(jù)、仿真環(huán)境學(xué)習(xí)重力、摩擦、碰撞等物理規(guī)律物體的時(shí)空連續(xù)性和身份保持因果鏈“如果我推這個(gè)杯子它會(huì)掉下去并碎掉”關(guān)鍵能力想象推演Imagined Rollouts在內(nèi)部做夢模擬未來無需真實(shí)試錯(cuò)模型預(yù)測控制MPC在想象中評估不同動(dòng)作序列的后果選擇最優(yōu)策略驚喜量化當(dāng)預(yù)測與現(xiàn)實(shí)不符時(shí)識(shí)別出分布外OOD場景觸發(fā)安全機(jī)制二、核心差異符號 vs 物理維度LLM大語言模型世界模型World Model核心問題下一個(gè)詞是什么下一個(gè)狀態(tài)是什么訓(xùn)練數(shù)據(jù)文本、代碼、知識(shí)離散符號視頻、傳感器、仿真環(huán)境連續(xù)信號學(xué)習(xí)對象語言的統(tǒng)計(jì)分布和語義關(guān)聯(lián)物理規(guī)律、時(shí)空動(dòng)態(tài)、因果關(guān)系世界表征基于人類創(chuàng)造的抽象符號系統(tǒng)基于客觀連續(xù)的物理現(xiàn)實(shí)典型輸出文字、代碼、結(jié)構(gòu)化答案未來狀態(tài)預(yù)測、仿真場景、機(jī)器人控制信號優(yōu)勢知識(shí)面廣、交互自然、易于操控物理直覺強(qiáng)、可安全內(nèi)部模擬、適合實(shí)體應(yīng)用核心風(fēng)險(xiǎn)幻覺、事實(shí)錯(cuò)誤、缺乏物理常識(shí)物理不一致、仿真到現(xiàn)實(shí)失配、動(dòng)作失敗一個(gè)通俗的類比是LLM 像文科生擅長語言、知識(shí)、溝通和組織概念世界模型像理科生關(guān)心空間、時(shí)間、運(yùn)動(dòng)、光線、聲音、材料和因果變化。三、關(guān)系本質(zhì)互補(bǔ)而非替代3.1 LLM 是世界模型的語言接口世界模型擅長物理模擬但不擅長與人類溝通。LLM 可以將世界模型的內(nèi)部狀態(tài)翻譯成人類可理解的語言或?qū)⑷祟惖淖匀徽Z言指令轉(zhuǎn)化為世界模型可執(zhí)行的動(dòng)作計(jì)劃。在具身智能Embodied AI系統(tǒng)中典型的架構(gòu)是LLM 負(fù)責(zé)高層規(guī)劃理解人類意圖分解任務(wù)步驟世界模型負(fù)責(zé)底層執(zhí)行預(yù)測每個(gè)動(dòng)作的后果選擇最優(yōu)控制信號3.2 世界模型是 LLM 的物理底座當(dāng)前 LLM 的一個(gè)根本缺陷是缺乏 grounding接地。它知道蘋果會(huì)掉下來這句話但從未看到過蘋果掉落的物理過程。世界模型可以為 LLM 提供物理常識(shí)基礎(chǔ)重力、慣性、材料屬性等因果驗(yàn)證機(jī)制LLM 的推理是否違背物理規(guī)律狀態(tài)跟蹤能力在多智能體交互中維護(hù)客觀世界狀態(tài)研究表明LLM 可視為在文本世界中訓(xùn)練出的一個(gè)不完整且不精確的世界模型——它捕捉了語言描述中的世界模式但缺乏對物理現(xiàn)實(shí)、感官體驗(yàn)和真實(shí)因果的直接建模。3.3 融合趨勢從 VLA 到 WAM2026 年具身智能領(lǐng)域正在經(jīng)歷從VLAVision-Language-Action到WAMWorld-Action Model的范式轉(zhuǎn)移。VLA看Vision→ 理解語言Language→ 執(zhí)行動(dòng)作Action但缺乏對動(dòng)作后果的預(yù)測WAM理解物理因果 → 在內(nèi)部模擬動(dòng)作后果 → 選擇最優(yōu)動(dòng)作實(shí)現(xiàn)了真正的知行合一四、DeepSeek 的啟示當(dāng)推理模型遇到世界模型的邊界4.1 DeepSeek-R1 的社會(huì)推理困境DeepSeek-R1 在數(shù)學(xué)和代碼推理上表現(xiàn)卓越但在社會(huì)推理任務(wù)中暴露出深層局限。浙江大學(xué)的研究團(tuán)隊(duì)通過分析 R1 的推理軌跡發(fā)現(xiàn)“LLM 在處理涉及多個(gè)參與者和時(shí)間線的場景時(shí)頻繁遇到推理僵局傾向于輸出’tricky’、confused’等矛盾術(shù)語導(dǎo)致錯(cuò)誤推理或無限循環(huán)。核心問題是它們無法區(qū)分客觀現(xiàn)實(shí)與智能體的主觀信念?!边@正是 LLM 缺乏世界模型的典型癥狀R1 可以完美執(zhí)行數(shù)學(xué)證明但在小明以為小紅知道…這類需要維護(hù)多個(gè)心智狀態(tài)Theory of Mind的任務(wù)中因?yàn)闆]有內(nèi)部的世界狀態(tài)跟蹤器而迷失。4.2 世界模型增強(qiáng) LLM 的解決方案同一研究團(tuán)隊(duì)提出了自適應(yīng)世界模型增強(qiáng)推理機(jī)制構(gòu)建動(dòng)態(tài)文本世界模型跟蹤實(shí)體狀態(tài)和時(shí)間序列監(jiān)控推理軌跡中的困惑指標(biāo)及時(shí)干預(yù)提供清晰的世界狀態(tài)描述實(shí)驗(yàn)結(jié)果顯示該方法在 Hi-ToM 等社會(huì)推理基準(zhǔn)上準(zhǔn)確率提升10%同時(shí) token 消耗降低33.8%。這一發(fā)現(xiàn)意義重大即使對于以文本為載體的推理任務(wù)引入顯式的世界狀態(tài)跟蹤也能顯著提升 LLM 的表現(xiàn)。世界模型不僅是機(jī)器人需要的東西也是 LLM 突破自身瓶頸的鑰匙。這正是世界模型與推理模型融合的想象空間一個(gè)既能進(jìn)行長鏈符號推理又能進(jìn)行物理直覺驗(yàn)證的混合系統(tǒng)。五、行業(yè)格局十億美元賭注與兩條路線5.1 LeCun 的叛逃從 LLM 到世界模型2026 年初圖靈獎(jiǎng)得主 Yann LeCun 離開工作 12 年的 Meta創(chuàng)立AMI Labs融資10.3 億美元估值 35 億美元目標(biāo)只有一個(gè)建造通用世界模型。LeCun 的核心論點(diǎn) blunt 而尖銳“我們永遠(yuǎn)不會(huì)僅僅通過文本訓(xùn)練達(dá)到人類水平的智能。LLM 本質(zhì)上只是模式匹配系統(tǒng)沒有真正的理解能力。它們可以在 3-5 年內(nèi)變得過時(shí)。”他的技術(shù)路線是JEPAJoint Embedding Predictive Architecture——不預(yù)測像素而是預(yù)測潛在表示空間 latent space中的變化。V-JEPA 2 在 100 萬小時(shí)互聯(lián)網(wǎng)視頻上預(yù)訓(xùn)練僅用 62 小時(shí)機(jī)器人交互數(shù)據(jù)微調(diào)就在零樣本機(jī)器人操作任務(wù)上達(dá)到~80% 成功率。5.2 世界模型的兩大陣營2026 年的世界模型領(lǐng)域分裂為兩個(gè)哲學(xué)陣營陣營代表核心思想優(yōu)勢場景壓縮理解派JEPA、Dreamer、V-JEPA 2預(yù)測潛在表示不浪費(fèi)算力在無關(guān)紋理上機(jī)器人規(guī)劃、推理、控制渲染預(yù)測派Genie 2、Sora、Cosmos逐幀生成像素級未來場景交互式世界生成、仿真、創(chuàng)意LeCun 屬于前者他的聯(lián)合創(chuàng)始人 Saining XieDiT 架構(gòu)作者直言“目標(biāo)不是生成漂亮的視頻而是理解世界?!绷?、未來展望從文科生理科生到工科生6.1 三層智能架構(gòu)未來的通用人工智能AGI很可能不是單一的 LLM 或世界模型而是一個(gè)三層架構(gòu)層級角色類比代表技術(shù)感知層理解物理世界理科生世界模型JEPA、Genie認(rèn)知層組織知識(shí)、推理規(guī)劃文科生LLMDeepSeek、GPT執(zhí)行層在真實(shí)環(huán)境中行動(dòng)工科生物理 AI / 具身智能正如科學(xué)網(wǎng)文章所指出的“把大語言模型與世界模型結(jié)合到機(jī)器人、自動(dòng)駕駛和工業(yè)智能體中則更像’工科生’既能理解人的意圖又能預(yù)測物理后果還能在真實(shí)或仿真環(huán)境中執(zhí)行任務(wù)。”6.2 關(guān)鍵挑戰(zhàn)盡管前景光明世界模型與 LLM 的融合仍面臨三大挑戰(zhàn)數(shù)據(jù)稀缺高質(zhì)量物理交互數(shù)據(jù)機(jī)器人動(dòng)作、觸覺、多視角視頻遠(yuǎn)比文本數(shù)據(jù)難獲取長時(shí)程一致性短片段中保持物體身份已不容易多步任務(wù)中的因果鏈更難維持仿真到現(xiàn)實(shí)的鴻溝Sim-to-Real Gap在虛擬世界中學(xué)到的物理規(guī)律能否遷移到真實(shí)世界七、實(shí)踐選型指南場景推薦方案理由文本生成、知識(shí)問答、代碼編寫純 LLMDeepSeek-V4語言能力強(qiáng)成本低生態(tài)成熟數(shù)學(xué)/邏輯推理純符號推理模型DeepSeek-R1CoT 自我驗(yàn)證準(zhǔn)確率最高機(jī)器人操作、自動(dòng)駕駛世界模型 LLM 混合需要物理預(yù)測 語言理解多智能體社會(huì)推理如博弈、談判LLM 顯式世界狀態(tài)跟蹤維護(hù)信念狀態(tài)避免推理混亂創(chuàng)意內(nèi)容生成視頻、3D 場景渲染派世界模型Genie 2生成可交互的虛擬世界工業(yè)仿真、數(shù)字孿生壓縮派世界模型JEPA高效預(yù)測適合控制決策結(jié)語不是取代而是補(bǔ)全LLM 與世界模型的關(guān)系不是誰殺死誰的零和博弈而是智能的兩個(gè)支柱。LLM 讓 AI 掌握了人類文明的符號遺產(chǎn)——語言、知識(shí)、邏輯世界模型讓 AI 獲得了物理世界的因果直覺——空間、時(shí)間、力、運(yùn)動(dòng)