面向逻辑思维的程序设计方法——依托世界模型的类脑大模型知识想象决策子网设计
冯胤清
(河南 三门峡 472000)

摘要:大语言模型(LLM)以文本统计建模为根基,缺乏对物理世界的因果理解、前瞻想象与自主规划能力——LLM"知道"水的沸点,却"想象"不出把杯子推下桌的后果;LeCun明确指出纯LLM路线已触顶,未来AI以JEPA世界模型为核心认知系统,2027年将成为物理世界智能的分水岭[7-8]。世界模型(World Model)作为"智能体理解世界的内部引擎",可在机器内部建立可预测、可想象、可规划的环境模拟器,是通向通用人工智能的核心路线[10,13]。本文基于面向逻辑思维的程序设计方法(LOPD)七层认知分析层次模型与《脑的设计》双脑架构,提出依托世界模型的类脑大模型知识想象决策(世界模型)子网初步设计:以知识(Knowledge)、想象(Imagination)、决策(Decision)三合一为功能组织——知识功能构建"对象-关系-事件-因果"的世界状态表示,想象功能实现"回顾-前瞻-反事实-创造"四类内部模拟,决策功能完成"想象-评估-选择-验证"的规划闭环[17-18];以JEPA潜空间预测+生成式推演+可微物理模拟三层融合为技术路线——JEPA提供高效语义化预测、生成式提供高保真想象、物理模拟提供精确推演[5-7,12];以渲染器-模拟器-规划器为功能形态,与世界模型功能分类学对齐[11]。核心创新是"知识-想象-决策"的统一架构:知识是想象的基础(状态表示支撑内部模拟),想象是决策的引擎(K步后果推演支撑规划),决策是知识想象的出口(推演结果转化为行动)[17-18]。本文进一步给出世界模型与感知、认知推理、情感、反思四子网的耦合机制、"仿真-现实"迁移与训练进化方案、世界模型质量五维评估体系,为类脑大模型从"语言统计"走向"物理世界认知"提供架构参考[17-23]。
关键词:类脑大模型;世界模型;知识想象决策;JEPA;潜空间预测;生成式世界模型;可微物理模拟;因果推理;内部模拟;规划;想象;面向逻辑思维程序设计;七层认知模型
中图分类号:TP18;TP391 文献标志码:A
1 引言
1.1 大语言模型的"世界"缺失
大语言模型(LLM)在语言理解与生成上取得突破[1,16],但存在根本局限:它学习的是文本统计共现,而非物理世界的因果结构[7-8,16]。LLM的"世界"缺失表现为三个层面[7-8,18]:
表征缺失:LLM的世界表征是"语言符号空间"——"杯子"是一个token,而非具有形状、位置、重量的物理实体[7-8]。表征缺失的后果:LLM无法进行空间推理(“杯子在桌沿多危险”)、无法进行物理推理(“推一下会怎样”)[7-8,18]。
因果缺失:LLM理解"相关"而非"因果"——它知道"下雨"与"路滑"常同时出现,却不知道"因为下雨所以路滑"[7-8]。因果缺失的后果:预测不可靠(相关关系在分布外失效)、干预无法推理(“如果关掉水龙头会怎样”)[7-8,18]。
前瞻缺失:LLM难以"想象"未来——它不能内部模拟"如果推杯子,会怎样",无法进行前瞻性规划[7-8,18]。前瞻缺失的后果:只能"反应"不能"预演"、只能"接招"不能"布局"[7-8,18]。
LeCun的论断振聋发聩:纯LLM路线已触顶,LLM只是智能系统的"语言接口层"——未来AI将形成"世界模型负责核心决策、VLA负责感知、LLM仅负责交互"的分层协同架构,2027年将成为AI产业分水岭[8]。世界大模型的理论研究进一步指出:融合大模型表征能力与世界模型动态模拟/预测/规划功能的新范式,标志着AI从静态数据分布学习转向动态世界建模[15]。这一范式跃迁正是本文"知识想象决策子网"设计的理论背景[15,17-18]。
1.2 世界模型的兴起与内涵
世界模型(World Model)指智能体内部的"世界模拟器"——以动作为条件、可预测执行动作后世界状态变化的模型[2,10,13]。其核心能力:内部模拟(在脑中"运行世界")、条件预测(给定动作预测后果)、规划支持(基于模拟的决策)[2,10,13,18]。其思想可追溯至Ha与Schmidhuber的开创性工作:智能体在内部模拟环境中"做梦"学习,提升样本效率[2]。Ha与Schmidhuber的World Models框架由三部分组成:视觉模块(压缩观测)、记忆模块(学习环境动力学)、控制器模块(在想象中决策)——“在梦里学会开车,醒来就能上路”[2]。此后世界模型历经理论奠基、框架提出、潜在空间革命(RSSM/Dreamer)与视频融合(Sora)四个阶段,当前已成为AI产业新焦点——全球创业公司密集涌现、腾讯阿里英伟达等大厂加速布局[9-10,13]。中国信通院将"世界模型"列为人工智能产业的关键技术方向,业界普遍认为世界模型是通向高阶智能的核心路线之一[26]。潜在空间革命的核心是RSSM(循环状态空间模型):将预测拆分为确定性路径(GRU捕捉"至今发生了什么")与随机路径(建模不确定性)——在潜空间预测而非像素空间,大幅降低算力需求[3,13]。
世界模型的三大核心价值[10,13]:提升样本效率(在想象中训练,减少真实交互)、支持规划(先模拟后行动)、保障安全(危险情形先在模拟中预演)[10,13]。产业热度印证了其价值:NVIDIA推出Cosmos世界基础模型平台(2000万小时真实数据训练、40-140亿参数),支持物理AI开发者生成物理感知合成数据、开展虚拟仿真与强化学习[12];特斯拉FSD以神经世界模拟器解决端到端架构的验证难题[13]。
李飞飞提出的世界模型功能分类学将世界模型拆分为三类[11]:渲染器(Renderer)——生成逼真场景;仿真器(Simulator)——推演状态转移;规划器(Planner)——内部搜索与决策[11]。三类各有局限:渲染器存在物理幻觉(生成的场景可能违反物理)、仿真器存在空间细节丢失、规划器存在推理效率不足[11,13]。三类本质上是"同底层世界理解的三种投影"[11,13]。
1.3 本文的定位:知识想象决策三合一的子网设计
在类脑大模型五子网架构中,世界模型子网是"预测-想象-规划引擎",也是大脑的"核心"子网[18]。在五子网分工中,世界模型子网回答"未来会怎样"——感知理解子网提供"世界是什么"、认知推理子网提供"应该怎么做"、情感评估子网提供"哪个更好"、反思机制提供"做得怎么样",世界模型子网为认知推理提供推演依据、为感知提供预测先验[18]。本文将其从"预测模块"升维为知识想象决策三合一的认知子系统[17-18]:
知识功能(Knowledge):构建世界状态表示——对象、关系、事件与因果结构,回答"世界是什么"[17-18]。知识功能的输出与感知理解子网的"对象-关系-事件"三元语义对齐——感知提供观测状态、世界模型提供因果结构(“什么导致什么”)[18,21]。
想象功能(Imagination):内部模拟——回顾式、前瞻式、反事实与创造性想象,回答"如果…会怎样"[17-18]。想象功能的输出是推演序列(状态轨迹)与后果评估——供决策层使用[18]。
决策功能(Decision):规划与选择——在想象空间中搜索行动路径,回答"应该怎么做"[17-18]。决策功能的输出是行动意图(经认知推理确认后下发小脑执行)[18]。
三者的统一:知识是想象的基础(状态表示支撑内部模拟)、想象是决策的引擎(K步后果推演支撑规划)、决策是知识想象的出口(推演结果转化为行动)[17-18]。三合一的架构意义:世界模型不再是孤立的"预测模块",而是"理解-模拟-行动"的完整认知环——这正是"依托世界模型"设计理念的深化[17-18]。
本文的具体贡献包括:①提出"知识-想象-决策"三合一的子网架构;②设计JEPA+生成式+物理模拟三层融合的技术路线;③给出四类想象能力与"想象-验证"规划闭环;④设计世界模型与四子网的耦合机制;⑤建立世界模型质量五维评估体系。与既有世界模型研究相比,本文的差异在于:以"知识-想象-决策三合一"为功能组织(而非单一预测模块)、以"LOPD七层"为组织骨架(嵌入完整认知架构)、以"五子网耦合"为协同方式(预测服务决策)[17-18]。
1.4 论文结构
全文共10章:第2章阐述世界模型的理论基础(认知科学、JEPA理论、技术流派);第3章给出知识想象决策子网总体架构;第4章设计知识功能(世界状态与因果知识);第5章设计想象功能(预测-想象引擎);第6章设计决策功能(规划器与想象-验证闭环);第7章讨论与五子网的耦合;第8章设计训练与进化;第9章给出评估与应用;第10章总结展望。各章构成"为什么(理论)→是什么(架构)→怎么做(知识/想象/决策三功能)→怎么联(耦合)→怎么炼(训练)→怎么验(评估)“的完整论述链[17-18]。全篇以"依托世界模型"为统一立场:知识功能回答"世界是什么”、想象功能回答"未来会怎样"、决策功能回答"应该怎么做"——三者构成类脑大模型认知闭环的"推演中枢"[17-18]。
2 世界模型的理论基础
2.1 认知科学基础:预测编码与心理模拟
世界模型具有深厚的认知科学基础[17,25]:
预测编码(Predictive Coding):大脑持续自上而下地预测感官输入,将预测误差作为学习信号——Rao与Ballard的经典工作表明视觉皮层的层级结构可用预测编码统一解释[25]。预测编码揭示了"理解世界=预测世界"的认知原理[25]。预测编码的工程对应:世界模型的推演即"自上而下的预测",感知误差即"预测误差信号"——世界模型与感知理解子网的预测编码闭环(第7章)正是这一原理的工程实现[18,25]。
心理模拟(Mental Simulation):人类在决策前会在脑中"预演"未来——“想象把手伸进火里会烫伤,于是不伸”[17]。心理模拟是人类前瞻性决策的核心机制,也是世界模型"想象功能"的认知对应[17]。Kahneman的双系统理论进一步揭示:心理模拟是System 2的"慢思考"实现——在脑内构建假设场景并推演[24]。这一对应关系支撑本文"想象功能=慢思考引擎"的设计(第5章)[18,24]。
海马体的角色:海马体不仅是记忆器官,也是"场景构建"(scene construction)的核心——它支持在脑中重建过去场景(回顾)与构建未来场景(前瞻)[17,25]。海马体的工程对应:想象性记忆(第7章)——存储推演场景供回顾式想象复用[18]。类脑大模型的世界模型子网对应"海马体+顶叶"的预测-想象职能[18]。
2.2 JEPA理论:联合嵌入预测架构
JEPA(Joint-Embedding Predictive Architecture)是LeCun提出的世界模型骨干架构[5-7]:核心思想是在学习到的潜在空间中预测未来观测的表征,而非在原始像素/token空间预测[5-7]。JEPA与生成式预测的本质区别:生成式在"像素空间"重建未来(高保真但低效),JEPA在"语义空间"预测未来(高效但不可渲染)[5-7]。JEPA的三大优势[5-7]:计算高效(潜空间维度远低于像素空间)、语义抽象(预测"发生了什么"而非"像素如何变")、符合最小表征原则(忽略不可预测的表面细节)[5-7]。JEPA的局限:不可渲染(预测结果是语义表征而非图像)——与生成式互补[5-7,18]。
JEPA家族[6]:I-JEPA(图像)、MC-JEPA(运动与内容)、V-JEPA(视频)、VL-JEPA(视觉语言)、H-JEPA(分层世界模型)、LeJEPA(理论基础)——各分支在对应任务上表现优于或匹配传统基线[6]。
V-JEPA 2(Meta 2025):12亿参数、基于视频训练,分无动作预训练与动作条件训练两阶段,实现最先进的环境理解与预测,支持零样本规划与机器人控制,在Hugging Face物理推理榜单排名第一[6]。
2.3 世界模型的技术流派
依据世界模型深度技术解析,当前世界模型已形成七大主流流派[13]:生成式视频(Sora、Genie、Cosmos——像素级生成,高保真)、潜空间预测(JEPA——抽象级预测,高效)、强化学习(Dreamer——想象环境训练策略)、对象中心(SlotFormer——对象级建模)、3D重建(3DGS——空间级)、物理模拟(可微物理——物理级)、混合架构(多模型融合)[13]。七大流派的三次跃迁:人工建模(物理方程手工构建)→数据拟合(神经网络学习动力学)→结构化认知(融合知识、因果与想象的认知建模)[13]。
各流派的特点权衡[10,13]:生成式视频物理一致性弱但可渲染;潜空间预测高效但缺乏可渲染性;Dreamer样本效率高但模型误差累积;对象中心结构化但泛化受限[13]。工程选型的核心权衡:物理一致性(预测是否遵守物理规律)与算力效率(预测是否快速)的平衡——JEPA在两者间取得较好折中,故作为主推路线[7,13,18]。五大技术路线(RNN/RSSM、Transformer、Diffusion、JEPA、Embodied WM)各有适用场景[13]。RNN/RSSM适合时序状态建模(Dreamer类)、Transformer适合长程依赖(Sora类)、Diffusion适合高保真生成(视频模型)、JEPA适合高效语义预测(LeCun路线)、Embodied WM适合具身场景(机器人)[13]。
世界模型综述(arXiv 2606.00133)系统梳理了架构、方法论、推理范式与应用,指出"复合预测误差、仿真到现实迁移、碎片化评估实践"是现存三大挑战[10]。该综述提出的多轴分类框架(架构、方法论家族、推理策略、应用领域四个维度)为本文的三合一架构提供了对照基准[10]。
2.4 知识想象决策:世界模型的认知功能统一
本文将世界模型的三重功能——知识、想象、决策——统一为"知识想象决策"认知框架[17-18]:
知识是想象的基础:内部模拟需要世界状态的表示——“想象杯子坠落"需要知道"杯子在桌沿、有重力、桌子支撑着它”[17-18]。知识表示的完备性决定想象的可能性边界——“不知道重力,就想象不出坠落”[18]。
想象是决策的引擎:决策前的后果推演依赖内部模拟——"选择A的K步后果"由想象生成[17-18]。想象的深度决定决策的前瞻性——“想象不到后果,就无法规避风险”[18]。
决策是知识想象的出口:想象的结果转化为行动选择——“推演显示A导致破碎,B安全,选择B”[17-18]。决策的闭环性:行动结果反馈更新知识(“原来B也有隐患”)——知识-想象-决策形成持续进化环[18]。
三合一的认知意义:世界模型不再是"预测模块",而是"知识-想象-决策"的完整认知引擎——这正是"依托世界模型"设计理念的深化[17-18]。
2.5 世界模型与快慢思考
世界模型是AI的"慢思考"进化[13,18]:LLM=快思考(依赖统计规律的快速响应,System 1);世界模型=慢思考(构建与现实同构的虚拟世界进行预测推演,System 2)[13,18]。快慢思考的分工:快思考处理熟练任务(低延迟响应)、慢思考处理复杂决策(推演验证)——世界模型为"慢思考"提供推演引擎[13,18]。
“慢思考"的实现[13,18]:世界模型在潜空间推演多步未来(想象K步)→推演结果供情感评估价值→认知推理选择路径→执行后反馈更新世界模型[18]。这一流程使大模型从"被动反应"走向"主动推演”——“先想后做”[13,18]。
2.6 世界模型与物理AI
世界模型是物理AI(Physical AI)的核心技术[12,14]:物理AI是能感知物理世界、推理物理规律并实时采取行动的智能系统[14]。物理AI的五维能力模型(感知、决策、验证、执行、反馈)与世界模型的知识-想象-决策三合一高度对应——知识对应"理解"、想象对应"验证"、决策对应"行动"[14,18]。2026物理AI白皮书指出:物理AI以"感知-决策-验证-执行-反馈"为闭环核心,核心技术包括策略模型、世界模型、仿真与数字孪生[14]。世界模型在物理AI中的角色:提供"虚拟试验场"——在物理世界行动前先在模型中验证(安全)、在物理世界行动中持续预测(实时性)、从物理世界反馈中学习(进化)[14,18]。NVIDIA Cosmos、特斯拉神经世界模拟器等产业实践验证了世界模型在物理AI中的核心地位[12-13]。NVIDIA Cosmos、特斯拉神经世界模拟器等产业实践验证了世界模型在物理AI中的核心地位[12-13]。
3 知识想象决策子网的总体架构
3.1 设计哲学:知识-想象-决策三合一
世界模型子网的设计遵循三条哲学原则[17-18]:
原则一:世界模型是大脑的"预测-想象-规划"引擎。它不是"视频生成器"(生成好看的画面),也不是"物理模拟器"(精确计算物理)——而是支持决策的认知引擎[17-18]。这一原则区分"世界模型"与"世界模拟器":模拟器只"模拟",引擎还"服务决策"[17-18]。
原则二:知识、想象、决策三合一。知识(状态表示)、想象(内部模拟)、决策(规划选择)三位一体,不可割裂——只有知识没有想象是"死知识库",只有想象没有决策是"白日梦",只有决策没有想象是"盲目行动"[17-18]。三合一的工程意义:统一的状态表征(三层共享)、统一的推演接口(一次建模多次使用)、统一的进化机制(决策反馈驱动知识更新)[18]。
原则三:预测受世界约束。世界模型的推演遵守物理规律(能量守恒、因果律)——“世界模型自带物理约束,是AI安全的根本”[7-8,14]。2026物理AI白皮书指出:物理AI的发展需应对物理世界的连续性、不确定性、安全性等硬约束,世界模型以"感知-决策-验证-执行-反馈"闭环为核心,自带物理约束的安全机制是AI安全的根本保障[14]。
3.2 三重功能架构
知识想象决策子网按功能组织为三层[17-18]:
知识层(Knowledge Layer):世界状态表示——对象(属性、位置)、关系(空间、因果)、事件(时序、状态转移)、因果结构(“什么导致什么”)[17-18]。知识层的职责:维护世界状态的一致性(冲突消解)、完整性(缺失补全)、时效性(更新及时)[18]。知识层的输出是想象与决策的输入[18]。
想象层(Imagination Layer):内部模拟引擎——基于世界状态的"如果…会怎样"推演[17-18]。想象层的职责:提供推演服务(状态转移查询)、维护推演质量(误差监控)、管理想象资源(预算与缓存)[18]。想象层的核心是状态转移模型P(s_{t+1}|s_t, a_t)[2,18]。
决策层(Decision Layer):规划器——在想象空间中搜索行动路径,评估后果,选择最优[11,17-18]。决策层的职责:生成候选计划、评估计划价值、选择最优行动、输出决策意图[18]。决策层的输出是行动意图(下发认知推理/小脑)[18]。
三层的协同:知识层提供状态→想象层推演K步后果→决策层评估选择→执行→反馈更新知识层[18]。协同的时序:知识层持续更新(感知驱动)、想象层按需调用(决策驱动)、决策层周期性输出(任务驱动)——三层以不同频率运行,经GWS协调[18]。
3.3 三层融合技术路线
世界模型的技术实现采用三层融合[5-7,12,18]:
路线A:JEPA潜空间预测(主推)——在抽象潜空间做联合嵌入预测,免像素级重建[5-7]。优点:计算高效、语义抽象;代表:LeCun JEPA、V-JEPA[5-7]。JEPA的预测粒度:预测"发生了什么"(语义事件)而非"像素如何变"(原始信号)——对不可预测的表面细节(树叶晃动、光影变化)自动忽略[5-7]。
路线B:生成式世界模型(辅助)——扩散模型生成高保真未来帧[9,12]。优点:高保真、可渲染;代表:Sora、Genie、Cosmos[9,12]。生成式的局限:物理一致性弱(生成的未来可能违反物理——“物体穿模”“无中生有”)——需物理校验后使用[9,13]。
路线C:可微物理模拟器(特定场景)——物理引擎嵌入网络实现精确推演[12,18]。优点:物理精确;适用:已知动力学模型的任务[12,18]。可微物理的价值:梯度可传播(物理模拟参与端到端训练)、精确可验证(推演结果可复核)[12,18]。
混合策略[12,18]:按时域与精度需求选择——毫秒级快速预测用JEPA、秒级精细推演用生成式、已知动力学用物理模拟器;三层共享统一状态表征[12,18]。混合策略的调度机制:预测任务画像(实时性/精度/可渲染需求)→路线选择→结果融合(多路线预测的一致性校验与加权)[18]。
3.4 渲染器-模拟器-规划器的功能形态
参照李飞飞的世界模型功能分类学[11],世界模型子网的功能形态为三模态[11,17]:
渲染器(Renderer):生成逼真场景——用于训练数据生成、用户可视化、想象具象化[11]。渲染器的技术实现:扩散模型(Sora类视频生成)、3D重建(3DGS)、神经渲染(NeRF)[9,11-12]。
模拟器(Simulator):状态转移推演——回答"如果采取动作a,世界会变成什么状态"——学习环境动力学[11,18]。模拟器的技术实现:潜空间状态转移(JEPA/RSSM)、生成式状态预测(扩散)、物理引擎(可微物理)[2,5-7,11-12]。
规划器(Planner):内部搜索与前瞻决策——在模拟器中展开多条路径,评估后果,择优行动[11,18]。规划器的技术实现:模型预测控制(MPC)、蒙特卡洛树搜索(MCTS)、强化学习策略[11-12,18]。
三模态的统一[11,13]:渲染器、模拟器、规划器本质是"同底层世界理解的三种投影",最终有望融合为统一模型[11,13]。行业预测:世界模型各路线预计在2027-2028年收敛为统一基础模型[13]。统一模型的形态:一个底层世界理解模型(状态转移)+三个输出接口(渲染/模拟/规划)[11,13,18]。
3.5 世界模型子网的接口设计
世界模型子网与大脑其他部分的接口[17-18]:
与感知理解子网:接收世界状态表示(当前状态s_t)[18,21]。
与认知推理子网:输出推演结果(未来状态预测、后果评估)[18,22]。
与情感评估子网:输出"推演场景的情感价值"(供价值判断)[18,23]。
与反思机制:接收预测质量评估(推演误差监控)[18]。
与记忆系统:经验→世界模型更新(上行)、预测→想象性记忆(下行)[18]。记忆-推演的协同:经验检索(相似经验的推演先验)、推演缓存(重复推演的加速)、反事实存储(因果学习的数据积累)[18]。
接口消息格式[18]:
WorldModelInput = {state, action_candidates, horizon}
WorldModelOutput = {predicted_states, consequence_assessment, confidence}
3.6 世界模型子网的实现技术栈
工程实现可采用如下技术栈[6,9,12,13]:潜空间预测——JEPA类模型(V-JEPA开源权重)[6];生成式——视频生成模型(Cosmos世界基础模型、Sora类)[9,12];物理模拟——可微物理引擎(MuJoCo、Isaac Sim)[12,14];统一状态表征——对象-关系-事件图谱[17-18]。技术栈的分层组织:传感接入层(感知状态获取)、状态表示层(对象-关系-事件)、预测引擎层(JEPA/生成式/物理)、规划接口层(推演结果服务决策)——各层接口标准化,支持模块替换[18]。技术栈选型原则:开源优先、按场景组合(高实时用JEPA、高保真用生成式、高精度用物理)、可演进(模块可替换)[12-13,18]。
3.6a 世界模型的实时性设计
世界模型的实时性是具身应用的关键[14,18]:实时推演(预测延迟<10ms支撑实时决策);推演缓存(高频场景的推演结果缓存复用);预推演(提前推演常用场景——“未雨绸缪”);异步推演(后台持续推演与前台按需取用)[14,18]。实时性设计的工程权衡:推演深度(深推演更准但更慢)与实时性(浅推演快但粗)的平衡——按任务实时性要求动态配置[14,18]。
3.6b 世界模型的能耗管理
世界模型的能耗管理[13,18]:潜空间预测的能耗优势(JEPA在潜空间预测,算力需求远低于像素级生成);按需激活(高保真生成式按需启用,默认用高效潜空间);低功耗部署(模型量化+专用芯片加速)[13,18]。能耗管理的目标:在算力预算内提供最佳推演质量——“省着算、精准想”[13,18]。
3.7 世界模型的推理模式
世界模型的推理模式[10,18]:单步预测(一步推演——快速反应);多步推演(K步推演——规划);树状推演(多路径展开——比较);分层推演(多尺度联合——全局+局部)[10,18]。推理模式的选型:实时任务单步预测、规划任务多步推演、复杂决策树状推演、宏观场景分层推演——“按需选模式”[10,18]。推理模式的选型:实时任务单步预测、规划任务多步推演、复杂决策树状推演、宏观场景分层推演[18]。推理模式的动态配置:按任务需求在推理时切换[18]。
3.8 世界模型的置信度管理
世界模型的推演输出携带置信度[18]:预测置信度(推演结果的可靠程度——多模型一致性/历史误差统计);不确定性传播(输入不确定性→推演不确定性);置信度使用(低置信度推演不用于决策——“不确定的预测不打折使用”)[18]。置信度管理支撑"诚实推演"——世界模型明确表达"哪些预测可靠、哪些不可靠"[18]。置信度管理支撑"诚实推演"——世界模型明确表达"哪些预测可靠、哪些不可靠"[18]。
4 知识功能:世界状态与因果知识
4.1 世界状态表示
世界状态是知识功能的核心输出[17-18]:对象(Object)——类别、属性、位姿;关系(Relation)——空间关系、功能关系、因果关系;事件(Event)——类型、参与者、时序、状态转移[18]。
世界状态的形式化:S = (O, R, E, t, Σ)——对象集、关系集、事件集、时间戳、不确定性[18]。状态表示的粒度:按任务需求配置(精细操作需要对象级位姿、宏观规划需要场景级布局)——“状态粒度匹配任务粒度”[18]。状态表示与世界模型的状态转移模型直接对接:S_t →(a_t)→ S_{t+1}[18]。
世界状态的来源[18,21]:感知理解子网的实时感知(当前状态)、记忆系统的历史经验(过去状态)、世界模型自身的推演(未来状态)[18,21]。三源状态的统一:以感知为"基准状态"(实时真值)、以记忆为"经验补充"(历史先验)、以推演为"预期状态"(未来预判)——三者经一致性校验融合为统一世界状态[18,21]。世界状态的版本管理:状态带时间戳与来源标记(感知/记忆/推演),支持状态回滚与冲突追溯[18]。
4.2 因果知识
因果知识是知识功能区别于"统计相关"的关键[7-8,18]:因果结构——“什么导致什么"的有向图(下雨→路滑→事故)[18]。因果图与状态转移模型的关系:因果图提供"为什么”(结构解释),状态转移模型提供"会怎样"(动态推演)——二者互补[18]。
因果发现:从数据中发现因果结构——干预实验(改变一个变量观察影响)、因果推断方法(Pearl的因果图框架)[18]。因果发现的工程实现:从交互数据中学习因果图(结构学习算法)、反事实验证(第5章)、领域知识注入(已知因果规则)——三路并进[18]。因果发现的工程实现:从交互数据中学习因果图(结构学习算法)、反事实验证(第5章)、领域知识注入(已知因果规则)[18]。
因果知识的价值[7-8,18]:预测更可靠(基于因果而非相关——“因为下雨所以路滑"比"下雨和路滑相关"更可预测);泛化更强(因果规律可迁移到新场景);可解释性(因果链解释"为什么”)[18]。因果知识的获取:因果发现(从数据推断因果结构)、因果干预(主动实验验证因果)、因果知识注入(领域因果规则)[18]。
4.3 物理直觉
世界模型的知识功能蕴含"物理直觉"[7-8,17]:物理规律(重力、惯性、碰撞、能量守恒)内化于状态转移模型[7-8]。物理直觉的价值:让预测"天生合理"(无需显式规则检查每个预测——物理规律已内化);让想象"符合物理"(想象中的世界不违反物理)[7-8,17]。物理直觉的价值[7-8,14]:预测遵守物理(从源头减少幻觉);安全预演(危险动作先在模拟中预演,后果不可接受则否决——"事前"安全)[7-8,14]。
物理一致性的工程实现[12-13]:物理约束注入(能量守恒、动量守恒作为正则项);物理一致性校验(推演结果检查违反物理的异常)[12-13]。物理校验的流程:推演结果→物理规则检查(能量、动量、碰撞约束)→违反标记(置信度降低或重新推演)→一致性报告[12-13,18]。
4.4 知识更新与知识版本
世界模型的知识需要持续更新[18]:在线更新(真实交互数据驱动的增量更新——“经验内化为物理直觉”)[18];冲突处理(新知识与旧知识冲突时的消解——新证据优先)[18];版本管理(知识版本化,更新可回滚)[18]。更新的时序:即时更新(关键事件立即更新)、批量更新(周期性重训)、渐进更新(在线学习)——按事件重要性与算力权衡[18]。
知识-想象的联动:知识更新→想象能力提升(状态转移模型更准)[18]。联动的量化:知识更新的频率与想象精度的提升率——“知识更新越及时,想象越贴近现实”[18]。
4.5 知识功能的评估
知识功能的质量评估[18]:状态表示完整性(对象/关系/事件覆盖度)、因果准确性(因果结构与真实因果的一致性)、物理一致性(预测违反物理规律的频率)、知识时效(知识更新滞后度)[18]。知识评估的工程实施:标准场景集的状态重建对比、因果结构的人工核查、物理规则的自动检查[18]。
4.6 知识-想象-决策的衔接机制
知识、想象、决策三者的衔接是世界模型子网的关键[17-18]:知识→想象的接口——世界状态作为想象的输入条件("想象杯子坠落"需要杯子的状态表示);想象→决策的接口——推演后果作为决策的评估输入(“选择A的K步后果”);决策→知识的反馈——执行结果更新世界状态(“实际结果与预测的差异”)[18]。衔接的工程实现:统一的状态表征(三层共享对象-关系-事件表示)、标准化的接口消息(状态/推演/决策消息格式)、闭环的误差回传(预测误差驱动知识更新)——“三环相扣”[18]。衔接的工程实现:统一的状态表征(三层共享对象-关系-事件表示)、标准化的接口消息(状态/推演/决策消息格式)、闭环的误差回传(预测误差驱动知识更新)[18]。
5 想象功能:预测-想象引擎
5.1 想象的定义与类型
"想象"是世界模型子网区别于LLM的关键能力[17-18]:在无外部输入的情况下,内部生成"如果…会怎样"的场景[17-18]。
想象的四类型[17-18]:回顾式想象(重放历史经验——记忆检索);前瞻式想象(推演未来场景——预测);反事实想象(假设性场景——“如果当初…会怎样”);创造性想象(生成新颖场景——创造性规划)[17-18]。四类想象的统一实现:都基于状态转移模型——回顾式沿时间反向推演、前瞻式正向推演、反事实修改初始条件、创造性组合状态片段[18]。
四类想象的功能分工[17-18]:回顾式支撑"经验复用"、前瞻式支撑"决策预演"、反事实支撑"因果学习"、创造性支撑"创新探索"[18]。四类想象的协同:回顾式提供历史场景(经验基础)→前瞻式推演未来(决策支撑)→反事实分析因果(学习机制)→创造性生成新场景(创新源泉)[18]。
5.2 想象引擎:状态转移模型
想象的核心是状态转移模型P(s_{t+1}|s_t, a_t)[2,18]:给定当前状态与动作,预测下一状态[2,18]。状态转移模型的精度决定想象的质量——“模型不准,想象失真”[2,18]。
状态转移模型的实现[2,5-7,13]:潜空间预测(JEPA——在抽象潜空间预测状态表征);生成式预测(扩散模型——生成未来帧/状态);物理模拟(可微物理——精确状态转移)[2,5-7,13]。实现的选型权衡:预测精度(物理模拟最准)、预测速度(JEPA最快)、可渲染性(生成式最好)——按应用需求组合[2,5-7,13,18]。
状态转移模型的训练[2,18]:自监督预测(预测未来状态——损失为预测误差);多步预测(预测K步——损失为K步累积误差);一致性约束(多步预测与单步预测一致)[2,18]。训练的数据效率:JEPA的自监督训练无需标注(预测任务即监督信号)——大幅降低数据标注成本[6,18]。
5.3 想象的深度与时间尺度
想象的深度可配置[18]:浅想象(1-3步)——快速反应;中想象(3-10步)——任务规划;深想象(10+步)——长期规划[18]。深度配置的依据:任务时间尺度(毫秒级反应→浅想象、天级规划→深想象)、算力预算(深想象高算力)、预测误差(误差累积快→浅想象)[18]。
想象的时间尺度[18]:微尺度(毫秒-秒)——动作级动态(抓取、碰撞);中尺度(秒-分钟)——任务级动态(导航、操作流程);宏尺度(分钟-天)——环境级动态(天气、人流)[18]。多尺度想象的协同:微尺度想象支撑动作执行、中尺度想象支撑任务规划、宏尺度想象支撑长期布局——“不同时间尺度的决策用不同尺度的想象”[18]。
多尺度融合[18]:分层世界模型(各尺度独立建模);跨尺度耦合(微尺度变化影响宏尺度);统一表征(多尺度共享状态空间)[18]。多尺度融合的工程实现:分层预测(各尺度独立推演)、跨尺度接口(尺度间状态映射)、联合优化(多尺度损失联合训练)[18]。
5.4 想象的工程实现
想象的工程实现路径[6,9,12,18]:JEPA潜空间推演(抽象场景演化——高效);生成式未来帧(扩散生成——具象化);场景库检索+组合(已有场景的重新组合——灵活)[6,9,12,18]。三条路径的选型:抽象推演(决策预演,潜空间足够)→JEPA;具象想象(可视化、人机交互)→生成式;组合想象(创造性场景)→场景库[6,9,12,18]。三条路径的选型:抽象推演(决策预演,潜空间足够)→JEPA;具象想象(可视化、人机交互)→生成式;组合想象(创造性场景)→场景库[6,9,12,18]。
想象的计算管理[18]:想象预算(K步推演的算力配额);想象缓存(相似场景的推演结果复用);想象并行(多路径并行推演)[18]。想象预算的分配:按任务价值(高价值任务深想象)、按实时约束(紧急任务浅想象)、按算力余量(算力充足深想象)[18]。
5.5 反事实想象与因果学习
反事实想象是因果学习的关键机制[18]:“如果当初没这样做,会怎样”——通过想象反事实场景,分离因果因素[18]。反事实与因果的关系:反事实推演是因果验证的"思想实验"——“假设干预X,结果会不同吗”——若不同则X是原因[18]。
反事实的工程实现[18]:状态修改(修改假设变量——“如果没下雨”);推演后果(在修改状态下推演);对比分析(真实结果vs反事实结果——因果归因)[18]。反事实的工程挑战:修改的合理性(假设变量修改需符合因果约束——"如果没下雨"但"云层仍在"的不一致)、推演的可靠性(反事实推演依赖准确的状态转移模型)[18]。
反事实的价值[18]:因果归因("因为下雨所以路滑"的验证)、经验学习(“下次遇到类似情况怎么做更好”)、决策优化(反事实评估决策改进空间)[18]。反事实的工程价值:错误复盘(“如果当时换种方式会怎样”)、策略对比(多反事实方案的比较)、鲁棒性分析(关键因素扰动的影响评估)[18]。
5.6 想象与"慢思考
想象是"慢思考"的引擎[13,18]:世界模型在潜空间推演多步未来(想象K步)→推演结果供情感评估价值→认知推理选择路径→执行后反馈更新世界模型[18]。
想象-验证闭环[17-18]:1. 世界模型想象K步后果;2. 情感评估后果价值;3. 认知推理选择路径;4. 执行后反馈→更新世界模型[18]。
4.6a 知识表示的层次
世界状态的知识表示分层次[17-18]:物理层(对象属性与位姿——“杯子在桌沿”);关系层(空间与功能关系——“杯子在桌子右上角”);事件层(动态变化——“杯子正在滑向桌沿”);因果层(因果结构——“推力导致杯子滑动”)[17-18]。层次化表示的价值:分层推理(各层独立查询)、跨层推理(物理→关系→事件→因果的推导链)、表示简洁(每层只维护本层信息)[17-18]。
4.6b 知识的一致性与冲突消解
世界状态的一致性维护[18]:感知-预测一致性(感知状态与世界模型预测的一致性检验);多源一致性(感知/记忆/推演三源状态的一致性仲裁);冲突消解(冲突时按置信度裁决——高置信度来源优先)[18]。一致性的工程价值:状态可信(不一致被消解后才可用于决策)、预测可靠(基于一致状态的推演更准)、系统稳定(冲突处理避免状态混乱)[18]。
5.7 想象的计算管理
想象的计算开销随推演深度与宽度增长[18]:想象预算(K步推演的算力配额——按任务价值分配);想象缓存(相似场景的推演结果复用——LRU缓存策略);想象并行(多路径并行推演——多卡/多线程);想象降级(算力不足时降为浅想象——“时间紧时少想几步”)[18]。计算管理的目标:在算力约束下最大化想象的价值——“预算内想得最深”[18]。计算管理的目标:在算力约束下最大化想象的价值[18]。
5.8 想象的评估
想象能力的评估[18]:想象逼真度(生成场景与真实场景的相似度);想象准确性(推演结果与真实结果的匹配度);想象覆盖度(四类想象能力的完备性);想象效率(单位算力的想象产出)[18]。评估的工程实施:标准场景集(已知物理规律的场景)的推演对比、人类评估(生成场景的拟人度评分)[18]。评估的工程实施:标准场景集(已知物理规律的场景)的推演对比[18]。
6 决策功能:规划器与想象-验证闭环
6.1 规划的定义与范式
规划是在想象空间中搜索行动路径,使目标达成概率最大化[11,17-18]。规划的本质:“先想后做”——在行动前于内部模拟中探索多条路径,选择最优[11,17-18]。
规划方法[12,18]:模型预测控制(MPC)——滚动时域优化;树搜索(MCTS)——蒙特卡洛树搜索;图搜索(A*)——状态空间搜索;学习型规划(RL)——策略网络指导搜索[12,18]。规划方法的选型:任务规模小→A*(完备搜索);任务规模大→MCTS(采样搜索);实时控制→MPC(滚动优化);复杂策略→RL(学习规划)[12,18]。
规划的前瞻深度[18]:浅前瞻(1-3步)——快速反应;中前瞻(3-10步)——任务规划;深前瞻(10+步)——长期规划[18]。前瞻深度的配置:按任务时间尺度(毫秒级反应→浅前瞻、天级规划→深前瞻)与算力预算动态选择[18]。
6.2 规划器设计
规划器的组成[11,18]:状态接口(接收当前状态)、动作空间(候选动作集)、推演引擎(调用想象层)、评估函数(后果价值评估)、搜索策略(选择与扩展)[18]。规划器的设计权衡:搜索完备性(找到最优计划)vs搜索效率(快速找到可行计划)——按任务需求配置[18]。
规划器与想象层的协同[18]:规划器在想象空间中展开路径——想象层提供"执行动作a后状态如何"的推演,规划器评估与选择[18]。协同的流程:规划器请求推演(状态+候选动作)→想象层返回K步后果→规划器评估价值→扩展搜索→输出计划[18]。
规划器与评估函数的协同[18]:评估函数综合——逻辑价值(目标达成度)+情感价值(偏好满足度)+安全价值(风险规避)[18,23]。评估函数的实现:加权求和(权重按任务类型配置)+安全否决(危险后果一票否决)[18,23]。
6.3 想象-验证闭环
想象-验证闭环是决策功能的核心流程[17-18]:闭环的本质是"先想后做、做了再想"——决策前用想象预演,执行后用结果验证想象[17-18]。
闭环的迭代:决策→执行→反馈→再想象→再决策——“边做边学”[18]。迭代的收敛:随交互积累,预测误差下降、决策质量提升——世界模型"越用越准"[18]。
6.4 决策的鲁棒性与重规划
现实决策面临不确定性[18]:状态不确定性(感知不完整)、动作不确定性(执行偏差)、环境不确定性(外部变化)[18]。不确定性的建模:状态不确定性(置信度分布)、动作不确定性(执行方差)、环境不确定性(扰动模型)——三类不确定性统一进入期望价值计算[18]。
鲁棒决策策略[18]:鲁棒规划(生成对不确定性不敏感的计划);条件规划(计划分支应对不同情况);概率规划(按概率选择最优期望计划)[18]。鲁棒性的工程权衡:鲁棒性提升(更保守的计划)与效率损失(保守计划可能非最优)的平衡——按风险容忍度配置[18]。不确定性的来源建模:状态不确定性(感知置信度)、动作不确定性(执行方差)、环境不确定性(外部扰动模型)——三类不确定性统一进入规划的期望价值计算[18]。
重规划[18]:执行偏差超过阈值→重新想象与规划[18]。重规划的触发条件:预测-实际偏差超限(执行异常)、环境变化(外部扰动)、目标调整(任务变化)——重规划以"局部修复优先,全局重规划兜底"[18]。
6.5 决策功能的评估
决策功能的质量评估[18]:规划成功率(模拟规划的方案是否可行)、模拟到现实迁移率(Sim-to-Real)、决策时延(从状态到决策的时间)、决策质量(与最优决策的差距)[18]。决策评估的工程实施:标准规划任务集(已知最优解的任务)、仿真环境批量评估、真实环境抽样验证[18]。
6.6 决策与执行的闭环
世界模型的决策功能与小脑执行构成闭环[17-18]:决策输出意图→小脑执行动作→感知反馈结果→世界模型对比预测与结果→更新模型[17-18]。闭环的意义:执行是预测的"试金石"——“预测准不准,执行见分晓”[17-18]。闭环的价值:执行验证预测("预测准不准"的实证检验);误差驱动更新(预测误差回传);经验沉淀(执行经验写入记忆)[17-18]。闭环的时序:决策(分级)→执行(毫秒-秒级)→反馈(感知周期)→再决策[17-18]。
6.7 决策的伦理约束
世界模型的决策功能受伦理约束[14,18]:安全约束(危险预测的强制否决——“预演显示危险则不执行”);伦理约束(预测场景的伦理评估——“这个计划的后果是否符合伦理”);责任约束(决策可追溯——预测链记录)[14,18]。伦理约束的工程实现:安全规则注入(符号约束)、预测审查(高风险预测的伦理检查)、决策日志(预测-决策全记录)——“预测可控、决策可溯”[14,18]。伦理约束的工程实现:安全规则注入(符号约束)、预测审查(高风险预测的伦理检查)、决策日志(预测-决策全记录)[18]。
5.8a 想象与记忆的协同
想象与记忆的协同[18]:想象复用记忆(历史场景作为想象的素材——“旧瓶装新酒”);记忆增强想象(经验先验提升想象准确性——“见多识广想得准”);想象回写记忆(推演结果存入想象性记忆——“想过的都记得”)[18]。协同的工程实现:场景检索(想象前检索相似记忆场景)、先验注入(记忆场景作为推演起点)、缓存管理(高频推演场景的缓存策略)[18]。
5.8b 想象的安全边界
想象的安全边界设计[14,18]:危险想象的受限(“不得想象伤害他人的方案”——安全约束注入想象过程);想象内容的审查(推演场景的安全检查——“预演到危险则停止并告警”);想象误用的防护(创造性想象的伦理边界——“不得用于欺骗性场景设计”)[14,18]。安全边界的工程实现:安全规则库(禁止想象的场景类型)、想象审查器(推演内容的安全检查)、伦理约束(创造性想象的伦理评估)[14,18]。
7 与五子网的耦合
7.1 世界模型与四子网的接口
世界模型子网是大脑五子网的"预测引擎",与其余子网经GWS交互[17-18]:
与感知理解子网:输入世界状态S_t(推演的起点);输出预测先验(调制感知——预测编码)[18,21]。感知-推演的交互频率:感知持续更新状态、世界模型按需推演(决策时启动)——“感知不停,推演按需”[18,21]。
与认知推理子网:输入待验证假设(“计划A是否可行”);输出推演结果(未来状态/后果评估)[18,22]。推演-决策的深度配置:K步推演(短期后果)与长程推演(长期影响)——按决策视界选择[18,22]。
与情感评估子网:输入候选方案(供情感价值评估);输出"推演场景的情感价值"[18,23]。想象-价值的协同:世界模型提供"后果场景"、情感评估"后果感受"——决策的情感成本显式化[18,23]。
与反思机制:输入预测质量(误差监控);输出推演过程(供反思审计)[18]。反思-推演的协同:反思发现预测偏差→触发模型校准→预测质量恢复→反思记录校准日志[18]。
表1给出世界模型子网与四子网的接口消息。
表1 世界模型子网与四子网的接口
| 感知理解 | 预测先验(调制感知) | 当前状态S_t |
| 认知推理 | 推演结果、后果评估 | 待验证假设、候选计划 |
| 情感评估 | 场景情感价值 | 候选方案 |
| 反思机制 | 推演过程、预测质量 | 质量评估、校准指令 |
7.2 预测编码闭环
世界模型与感知理解子网构成预测编码闭环[18,21,25]:预测调制感知——世界模型预测"下一时刻视野中应出现什么"→感知在预测区域精加工[18,25];感知更新预测——感知验证/修正世界模型的预测(误差回传)[18,25]。该闭环的认知对应:人类大脑"预期驱动感知"的预测编码机制(Rao-Ballard框架)——世界模型即工程化的"预测皮层"[18,25]。
预测编码闭环的价值[18,25]:感知效率(只处理意外)、感知鲁棒(预测补全遮挡)、世界模型进化(感知误差驱动更新)[18,25]。闭环的量化指标:预测误差率(预期与实际的差异)、预测对感知的加速比(预测调制后的感知耗时降低)、感知-预测一致性(状态一致性评分)[18,25]。
7.3 推演-决策闭环
世界模型与认知推理子网构成"推演-决策"闭环[18,22]:下行——世界模型推演候选决策的后果(“选择A的K步后果”);上行——认知推理提出待验证假设(“计划A能否到达目标”)[18,22]。该闭环使决策从"基于直觉"走向"基于推演"——认知推理的每个决策都经过世界模型的"物理检验"[18,22]。
闭环流程[18,22]:感知状态→认知推理生成候选决策→世界模型推演后果→情感评估价值→认知推理选择→执行→反馈→世界模型更新→再决策[18,22]。闭环的稳态特征:决策时延(感知到决策的时间)、决策正确率(决策质量评估)、闭环收敛性(多轮迭代后决策稳定)[18,22]。
7.4 世界模型与情感的耦合
世界模型与情感评估子网的耦合[18,23]:下行——世界模型输出"推演场景的情感价值"(“这个后果让我感觉如何”);上行——情感状态调制世界模型的想象偏差(情绪低落想象悲观)[18,23]。耦合的工程实现:情感价值函数(推演场景→情感评分)、想象偏差系数(情感状态→推演偏移量)、情感-推演日志(耦合路径记录)[18,23]。
情感预演[18,23]:在"想象-验证"闭环中,世界模型预演危险场景时,情感子网同步预演情感反应(“预演失败→体验挫败”)——决策的情感成本显式化[18,23]。情感预演对应Damasio躯体标记假说的工程化:世界模型的推演场景触发情感评估(虚拟的"躯体标记"),使系统在真实经历前就具备情感预期[18,23]。
7.5 世界模型与反思的耦合
反思机制监控世界模型质量[18]:预测误差审计(推演误差是否超限)、想象偏差检测(系统性想象错误——“总是乐观想象”)、模型校准(偏差检测后触发模型更新)[18]。反思-推演的协同:反思发现预测偏差→触发模型校准→预测质量恢复→反思记录校准日志——“自我监督的推演质量”[18]。
反思-世界模型交互[18]:反思发现预测偏差→触发模型校准→预测质量恢复→反思记录校准日志[18]。
7.6 世界模型与记忆的耦合
世界模型与记忆系统双向耦合[18]:上行——经验→世界模型更新(真实交互经验内化为预测能力);下行——预测→想象性记忆(推演结果存储,供后续检索)[18]。耦合的工程实现:经验写入通道(交互轨迹→训练样本)、推演缓存(重复场景推演复用)、记忆-推演一致性(记忆场景与推演场景的匹配)[18]。
想象性记忆的价值[18]:经验复用(相似场景的推演结果直接复用);想象加速(缓存推演避免重复计算);反事实学习(存储反事实推演供因果分析)[18]。想象性记忆的存储结构:场景索引(场景特征→推演结果)、时效管理(过期推演降权)、容量管理(高价值推演优先保留)[18]。
8 训练与进化
8.1 训练数据来源
世界模型的训练数据来源[12,14,18]:真实交互数据(机器人操作、自动驾驶路采);仿真数据(Isaac Sim、MuJoCo);视频数据(互联网视频学习物理规律)[12,14,18]。
数据的物理真实性是世界模型商业化的核心壁垒之一[13]——高质量物理数据决定世界模型的物理直觉质量[13,18]。数据获取的路径:真实交互采集(机器人操作、自动驾驶路采——高成本高价值)、仿真合成(Isaac Sim、MuJoCo——低成本大规模)、互联网视频(海量但物理标注弱)[12-14,18]。
8.2 训练范式
世界模型的训练范式[2,6,12,18]:自监督预测(预测未来状态——损失为预测误差);强化学习(在想象中训练策略——Dreamer范式);数据飞轮(真实反馈→模型更新→预测更准→更有效)[2,6,12,18]。Dreamer系列(Dreamer、DreamerV3)证明了"潜在想象中学习"的可行性——DreamerV3在多样化领域(Atari、Minecraft等)展示了世界模型+想象训练的强大能力[3-4]。Dreamer系列(Dreamer、DreamerV3)证明了"潜在想象中学习"的可行性——DreamerV3在多样化领域(Atari、Minecraft等)展示了世界模型+想象训练的强大能力[3-4]。这一范式为世界模型子网的"想象中学习"提供技术基础[3-4,18]。
自监督预测的实现[6,18]:JEPA自监督(潜空间预测——V-JEPA的预训练范式);多任务预测(状态+动作+因果联合预测);一致性正则(多步预测一致性)[6,18]。自监督的优势:无需标注(预测任务即监督信号)、数据利用率高(海量无标注数据可用)、表征质量高(预测目标驱动语义表征学习)[6,18]。
8.3 训练-推理流程
训练流程[18]:输入多模态数据→感知理解子网编码为世界状态→世界模型学习P(s_{t+1}|s_t, a_t)→损失(潜空间MSE+一致性正则)→梯度更新[18]。训练的规模化:数据规模(海量视频+交互数据)、算力规模(分布式训练)、模型规模(参数与数据匹配)——“世界模型是算力密集型的代表”[10,13,18]。
推理流程[18]:输入当前状态+候选动作→推演各动作后果→情感评估价值→认知推理决策→执行→反馈更新[18]。推理的实时性要求:推演时延(单步<10ms满足实时决策)、推演吞吐(多候选并行推演)、推演资源(算力按任务动态分配)[18]。
训练-推理的异步性[18]:训练离线批量(慢、异步);推理在线实时(快、同步);在线学习(预测误差驱动增量更新)[18]。异步性的工程实现:训练流水线(数据积累→定期重训)、推理引擎(实时预测)、在线学习通道(预测误差实时回传)——三线并行[18]。
8.4 仿真-现实迁移
世界模型常基于仿真训练,需解决Sim-to-Real迁移[12,14,18]:迁移鸿沟(仿真与真实的差异——物理参数、传感器噪声);迁移方法(域随机化——仿真中随机化物理参数增强泛化;域适配——真实数据微调;混合训练——仿真+真实联合)[12,14,18]。迁移的最新实践:渐进迁移(仿真→半实物→真实的分阶段迁移)、数据混合(仿真数据+真实数据的比例调度)、模型校准(真实数据驱动的迁移后校准)[14,18]。
迁移的认知意义[18]:世界模型的"物理直觉"必须来自真实世界——仿真只是"预训练",真实交互才是"精调"[18]。迁移的评估:仿真预测误差vs真实预测误差、迁移成功率(仿真训练的模型在真实环境的表现)[18]。迁移的工程实践:领域随机化(随机化摩擦、质量等物理参数增强泛化)、渐进迁移(仿真→半实物→真实)[14,18]。
8.5 世界模型的进化学习
世界模型具备进化能力[18]:在线进化(真实交互驱动的持续更新——“经验越多预测越准”);结构进化(模型架构随需求演进——新增尺度/模态);知识进化(因果知识与物理直觉的积累)[18]。进化的驱动力:预测误差(误差驱动参数更新)、新场景(分布外触发扩展)、新知识(知识库更新触发重训)[18]。
进化的约束[18]:行为一致性校验(进化后预测不退化);版本管理(进化可回滚);进化监控(预测质量指标持续跟踪)[18]。进化的安全边界:物理一致性校验(进化后预测不违反物理)、安全回归测试(危险场景预测不退化)——“进化不越安全线”[14,18]。
8.6 世界模型的部署形态
世界模型子网的部署形态[12-13,18]:云端大模型(大规模预训练——视频级世界模型,高保真想象);边缘轻量模型(端侧推理——JEPA轻量化,实时预测);混合部署(云端想象+边缘预测——按需调用)[12-13,18]。部署的工程挑战:模型压缩(蒸馏/量化)、延迟控制(边缘推理<10ms)、能耗管理(低功耗预测)——"端侧实时想象"是具身智能落地的关键[13,18]。部署的工程挑战:模型压缩(蒸馏/量化)、延迟控制(边缘推理<10ms)、能耗管理(低功耗预测)[13,18]。
7.6a 世界模型与感知的深度协同
世界模型与感知理解子网的深度协同[18,21]:感知提供状态、模型提供预测、误差驱动双方进化——“感知-预测共进化”[18,21]。深度协同的机制:预测辅助感知(预测先验填补感知盲区——“看不见的预测补上”);感知校正预测(感知误差回传修正模型——“看错了改模型”);联合表征(感知特征与预测状态共享编码空间——“看与想同构”)[18,21]。
7.6b 世界模型的并行推演机制
世界模型的并行推演支撑多方案比较[18]:候选并行(多候选动作的并行推演——“同时想象多种可能”);多尺度并行(不同时间尺度的并行推演——“同时想近想远”);多模态并行(多感官场景的并行推演——“同时想看到的和听到的”)[18]。并行推演的工程实现:多卡并行(模型分片)、批量推演(batch处理多候选)、流水线(推演阶段流水化)[18]。
8.7 世界模型的版本与治理
世界模型的版本管理[18]:版本化(模型版本记录——架构/训练数据/评估指标);回滚机制(新版本预测退化时回滚旧版本);A/B评估(新旧版本对比测试)[18]。治理约束[14,18]:物理一致性审计(预测违反物理的监控);安全边界(危险场景预测的强制约束);伦理审查(世界模型应用的伦理评估——“模拟世界不得用于欺骗”)[14,18]。治理约束[14,18]:物理一致性审计(预测违反物理的监控);安全边界(危险场景预测的强制约束);伦理审查(世界模型应用的伦理评估——“模拟世界不得用于欺骗”)[14,18]。
9 评估与应用
9.1 世界模型质量五维评估体系
世界模型子网的评估需覆盖知识-想象-决策全链路,本文提出五维评估体系[10,18]:五维覆盖"预测-物理-想象-决策-知识"完整链路——预测准确性衡量"推得准不准"、物理一致性衡量"合不合物理"、想象质量衡量"想得真不真"、决策有效性衡量"选得好不好"、知识质量衡量"知得全不全"[10,18]。
预测准确性:潜空间预测误差(MSE)、未来状态预测的top-k命中率、长程推演漂移度[18]。预测准确性的评估数据集:标准物理场景集(已知动力学)、真实交互轨迹、多模态预测基准(IntPhys 2、MVPBench)[6,18]。
物理一致性:物理规律违反率(能量不守恒、物体穿模)、因果一致性(推演结果符合因果结构)[10,13,18]。物理一致性的评估方法:物理规则自动检查(能量/动量守恒验证)、长程推演的物理漂移测量(长时间推演是否偏离物理)[10,13,18]。
想象质量:想象场景的逼真度(生成式评估)、想象覆盖度(四类想象能力的完备性)、反事实推演的合理性[18]。想象质量的评估实施:生成场景的人工评分(拟人度)、四类想象能力的任务测试(各类型标准任务)、反事实推演的因果一致性验证[18]。
决策有效性:规划成功率(模拟规划的方案可行性)、模拟到现实迁移率(Sim-to-Real)、决策时延[18]。决策有效性的评估任务:规划基准(PlanBench类)、机器人操作任务(仿真+真实)、实时决策压力测试[18]。
知识质量:状态表示完整性、因果准确性、知识时效[18]。知识质量的评估:状态覆盖度(对象/关系/事件完整性)、因果结构与真实因果的一致性比对、知识更新延迟(新知识入库时延)[18]。
表2给出五维评估的指标与测度方法。五维评估的实施:开发期在标准物理场景集与基准测试(IntPhys 2、MVPBench)迭代评测、部署期在真实场景持续监控、进化期在升级后回归测试——形成"开发-部署-进化"的评估闭环[6,10,18]。
表2 世界模型质量五维评估体系
| 预测准确性 | MSE、top-k命中率 | 未来状态预测评测 |
| 物理一致性 | 物理违反率、因果一致性 | 物理规律检查 |
| 想象质量 | 逼真度、覆盖度 | 生成质量评估 |
| 决策有效性 | 规划成功率、Sim-to-Real | 规划任务评测 |
| 知识质量 | 完整性、因果准确性 | 知识图谱对比 |
9.2 应用场景
世界模型子网的应用场景覆盖类脑大模型的各个落地方向[12-14,18]:
具身机器人:世界模型支撑操作规划——“抓取前先想象抓取后果”(预演成功与失败)[12,14,18,20]。具身场景的世界模型需求:接触动力学建模(抓取、推动)、多模态感知融合(视觉+触觉+本体)、实时推演(毫秒级预测)[12,14,18,20]。
智能驾驶:世界模型推演交通场景——"前方路况的未来演化"支撑安全决策[12,14,18]。特斯拉FSD的端到端架构与"世界模型"理念高度契合,其通过关键token稀疏化、可解释输出层、神经世界模拟器解决了端到端架构落地中的计算、安全验证与评估难题[13]。驾驶场景的世界模型需求:长时序预测(未来数秒路况)、多物体交互建模(车-人-路)、安全关键(预测错误的代价极高——需物理一致性保障)[12-14,18]。特斯拉FSD、蔚来华为等已落地世界模型驱动的高阶智驾[13]。
物理AI:2026物理AI白皮书指出世界模型是物理AI的核心技术,支撑工业制造、移动机器人等规模化落地[14]。物理AI场景的世界模型需求:物理约束硬性(违反物理的预测不可接受)、实时性(工业控制的毫秒级响应)、鲁棒性(工业环境的噪声与干扰)[14,18]。
科学发现:世界模型模拟实验——"AI科学家"在虚拟实验中验证假设[18]。科学场景的世界模型需求:高精度物理模拟(实验的可信度依赖模拟精度)、参数空间探索(大量假设的快速验证)、可解释推演(科学结论需可复现)[18]。
元宇宙与数字人:世界模型生成可交互的虚拟环境——数字孪生与虚拟世界的"物理引擎"[13,18]。元宇宙场景的世界模型需求:实时交互(毫秒级响应)、物理一致性(虚拟世界的物理规律)、多用户协同(共享世界状态)[13,18]。
9.3 与既有方案的对比
表3给出世界模型子网与既有世界模型方案的对比[6,9-13,18]。对比的维度设计:知识(世界表征能力)、想象(内部模拟能力)、决策(规划能力)、认知耦合(与认知系统的接口)、物理约束(预测的物理一致性)——五维覆盖世界模型的完整能力谱[6,9-13,18]。
表3 知识想象决策子网与既有方案对比
| 知识 | 弱(像素表征) | 中(潜空间) | 中(状态) | 对象-关系-事件-因果 |
| 想象 | 高保真 | 高效 | 状态推演 | 四类想象全覆盖 |
| 决策 | 无 | 弱 | 规划(RL) | 想象-验证闭环 |
| 认知耦合 | 无 | 无 | 弱 | 五子网双向 |
| 物理约束 | 弱 | 中 | 中 | 内置+校验 |
生成式视频强于"逼真想象"、JEPA强于"高效预测"、Dreamer强于"想象中学习"——本文知识想象决策子网以"知识-想象-决策三合一"统一三者,并嵌入五子网认知架构[6,9-13,18]。对比的启示:单一路线的局限(生成式的物理弱、JEPA的不可渲染、Dreamer的误差累积)促使"融合路线"成为必然——本文的三层融合与知识想象决策统一是这一趋势的架构化[6,9-13,18]。
9.4 挑战与展望
挑战1:复合预测误差——多步推演的误差累积[10,18]。误差累积的机理:单步误差经K步推演放大(指数增长)——长程推演漂移[10,18]。缓解:多尺度建模(误差分尺度控制)、预测校正(在线误差反馈)、一致性约束[10,18]。进一步缓解:误差校准(预测误差的统计建模与修正)、推演重规划(误差超限时重新推演)、混合精度(关键步骤高精度推演)[10,18]。
缓解:域随机化、真实数据微调、混合训练、渐进迁移(仿真→半实物→真实)——“从虚拟到现实的平滑过渡”[14,18]。缓解:域随机化、真实数据微调、混合训练[14,18]。
挑战3:碎片化评估——缺乏统一评测标准[10]。评测标准缺失的后果:不同世界模型难以横向比较、研究进展难以量化评估[10]。缓解:建设统一基准(IntPhys 2、MVPBench等物理推理基准)[6,10]。
挑战4:算力成本——视频生成式世界模型训练成本高[13]。缓解:潜空间预测为主推(算力高效)、生成式按需启用、模型压缩(蒸馏/量化)[13,18]。缓解:潜空间预测为主推(算力高效)、生成式按需启用[13,18]。
展望1:知识-想象-决策的统一模型——渲染器/模拟器/规划器融合为统一世界基础模型[11,13]。统一模型的实现路径:共享世界理解(一个底层模型)→多输出接口(渲染/模拟/规划)→按需激活(任务驱动接口选择)[11,13,18]。
展望2:因果化认知——世界模型从"相关预测"走向"因果推演"[10,18]。因果化认知的路径:因果结构学习(从数据中发现因果)、因果约束推演(推演遵守因果)、因果解释(推演结果附带因果链)[10,18]。
展望3:多模态世界模型——融合视觉、听觉、触觉的多感官世界建模[6,18]。多模态世界模型的价值:状态表示更完整(多感官信息互补)、想象更真实(多模态场景生成)、物理直觉更丰富(接触/声音等物理线索)[6,18]。
展望4:端侧部署——轻量化世界模型支撑边缘设备实时想象规划[13,18]。端侧部署的路径:模型蒸馏(大模型→小模型)、量化压缩(精度-大小权衡)、专用芯片(NPU加速推演)——"边缘实时想象"是具身智能落地的关键[13,18]。
9.4a 世界模型的产业生态
世界模型产业生态已初步形成[12-13]:基础模型层(NVIDIA Cosmos、V-JEPA等开源/开放模型);平台层(Reactor等世界模型开发者平台——统一SDK与API支撑规模化调用);应用层(自动驾驶、机器人、虚拟世界的垂直应用)[12-13]。产业生态的启示:世界模型子网的工程实现可复用产业基础(Cosmos世界基础模型等),聚焦认知架构集成(五子网耦合)与垂直场景适配[12-13,18]。
9.4b 世界模型与具身智能的融合
世界模型与具身智能深度融合[12-14,18]:具身场景的世界模型需求(接触动力学、多模态感知、实时推演);具身数据的世界模型训练(真实交互+仿真合成);具身部署的世界模型形态(端侧轻量化)[12-14,18]。具身智能三大技术(硬件躯体、控制小脑、智能大脑)中的"智能大脑"以世界模型为认知核心——世界模型支撑具身智能从"预编程"走向"自主认知"[14,18]。
9.5 世界模型子网与LOPD七层的完整映射
世界模型子网在LOPD七层中的完整映射[17-19]:L1物理层——物理规律的载体(能量守恒、因果律内化于状态转移模型);L2肢体层——预测结果的执行端(推演的行动意图经小脑执行);L3感知门户——世界状态的观测输入(感知理解子网提供状态);L4神经层——世界模型子网本体(知识想象决策引擎);L5生存层——安全预演(危险场景先在模型中验证,后果不可接受则否决);L6社会层——社会场景推演(社会交互的世界模拟);L7文明层——文明知识的建模(文化规律的世界表征)[17-19]。七层映射的意义:世界模型子网贯穿"物理-认知-社会"全谱系——从物理规律到社会动态的统一建模[17-19]。
9.6 世界模型的可靠性保障
世界模型的可靠性是安全应用的前提[14,18]:预测可靠性(预测误差的持续监控与告警);物理可靠性(物理一致性的自动检查——违反物理的预测标记);部署可靠性(模型退化的检测与回滚);安全可靠性(危险预测的强制拦截——“预测到危险则触发安全协议”)[14,18]。可靠性保障的工程实现:质量监控面板(五维指标的实时展示)、告警机制(指标超限触发告警)、应急预案(模型失效时的降级方案——回退到保守策略)[14,18]。
9.7 世界模型与多智能体的协同
世界模型可作为多智能体系统的"共享世界模拟器"[18]:共享世界状态(多智能体的统一环境表征);联合推演(多智能体行动的联合后果预测——“如果A和B同时行动会怎样”);冲突预演(智能体间冲突的场景预演与消解)[18]。世界模型-多智能体协同的工程价值:群体决策的推演支持(多方案联合评估)、多智能体训练的想象环境(共享模拟器加速训练)、人机协作的场景预演(人类与智能体行动的联合推演)[18]。
9.8 世界模型与脑机接口的衔接
脑机接口为世界模型提供直接的人机通道[18,21]:意图解码(神经信号→行动意图→世界模型推演——“想到什么就推演什么”);感知增强(世界模型预测经神经刺激反馈给人类——“直接感受预测结果”)[18,21]。这一衔接使世界模型成为"脑-机协同想象"的核心引擎[18,21]。
10 结论
本文基于面向逻辑思维的程序设计方法(LOPD)七层认知分析层次模型,提出依托世界模型的类脑大模型知识想象决策(世界模型)子网初步设计。主要结论如下:
(1)世界模型子网以"知识-想象-决策三合一"为功能组织——知识(世界状态与因果知识)是想象的基础、想象(四类内部模拟)是决策的引擎、决策(规划与选择)是知识想象的出口[17-18]。这一架构使世界模型从"预测模块"升维为"理解-模拟-行动"的完整认知环[17-18]。
(2)以"JEPA潜空间预测+生成式推演+可微物理模拟"三层融合为技术路线,按时域与精度需求动态选择[5-7,12,18]。三层融合兼顾效率(JEPA)、保真(生成式)与精确(物理),以统一状态表征协同[5-7,12,18]。
(3)以"渲染器-模拟器-规划器"为功能形态,与世界模型功能分类学对齐[11,18]。三模态的统一趋势(预计2027-2028年收敛为统一基础模型)为架构演进预留空间[11,13,18]。
(4)想象功能实现回顾式、前瞻式、反事实与创造性四类内部模拟,支撑"慢思考"与因果学习[17-18]。四类想象的统一实现(基于状态转移模型)保证了架构的简洁与可扩展[17-18]。
(5)决策功能以"想象-验证"闭环为核心——想象K步后果→评估价值→选择路径→验证反馈→更新模型[17-18]。闭环使决策"先想后做、做了再想"——预测与执行互相验证,模型持续进化[17-18]。
(6)世界模型与感知(预测编码)、认知推理(推演-决策)、情感(想象-价值)、反思(质量监控)四子网双向耦合,成为大脑的"预测-想象-规划"引擎[17-18]。耦合的完备性:感知提供状态输入、认知提供推演请求、情感提供价值评估、反思提供质量监控——四路耦合覆盖世界模型的全部交互[17-18]。耦合的工程保障:接口消息版本管理(状态/推演/评估消息格式的演进兼容)、接口延迟预算(推演响应时延上限)、接口异常处理(子网故障时的降级推演)[17-18]。
(7)世界模型质量五维评估体系(预测准确性/物理一致性/想象质量/决策有效性/知识质量)为量化评估提供框架[10,18]。五维覆盖"预测-物理-想象-决策-知识"完整链路,支撑世界模型子网的"开发-部署-进化"评估闭环[10,18]。
本文作为"初步设计",与《类脑大模型大脑部分初步设计》《类脑大模型小脑部分初步设计》《类脑大模型情感子网设计》《类脑大模型感知理解子网设计》《类脑大模型认知推理子网设计》共同构成类脑大模型"感知-知识想象-推理-情感-执行"的完整蓝图[17-23]:世界模型子网作为大脑的核心,提供"知识想象决策"的引擎——让类脑大模型"理解世界、想象未来、规划行动"[17-23]。这一引擎使类脑大模型从"语言统计模型"升维为"物理世界认知系统"——正是LeCun所预言的"物理世界智能"的架构基础[7-8,17-23]。后续将在JEPA工程化、知识-想象-决策统一模型与物理世界交互验证中持续推进[6,13,18]。
工程化的优先级建议:先实现"知识功能+JEPA预测"(快速建立世界状态表示与预测能力的基础)、再集成"生成式想象+场景库"(增强想象具象化与创造性)、最后完善"规划器+想象-验证闭环"(实现推演驱动决策)——分阶段建设,边建设边验证[6,13,18]。
世界模型的成长路径:从"单步预测"到"多步推演"到"想象规划"再到"自主进化"——知识想象决策子网随工程验证与物理世界交互持续演进[13,18]。世界模型的终极目标是"知得全、想得真、选得对"——知识完整(状态与因果覆盖)、想象真实(推演符合物理)、决策正确(选择最优路径),这正是面向逻辑思维的程序设计方法赋予世界模型子网的设计基因[17-19]。
作为LOPD系列论文中"依托世界模型"的核心篇目,本文与《类脑大模型大脑部分初步设计》共同回答了"为什么世界模型是大脑的核心"——世界模型不是可选的"预测模块",而是连接感知(世界是什么)、认知(应该怎么做)、情感(哪个更好)的"认知枢纽"[17-23]。知识想象决策三合一的架构,为类脑大模型从"语言统计"走向"物理世界认知"提供了可计算、可评估、可演进的引擎设计[7-8,17-23]。
参考文献
[1] Vaswani A, et al. Attention is all you need[C]//NeurIPS. 2017.
[2] Ha D, Schmidhuber J. World Models[J]. arXiv preprint arXiv:1803.10122, 2018.
[3] Hafner D, et al. Dream to control: Learning behaviors by latent imagination[C]//ICLR. 2020.
[4] Hafner D, et al. Mastering diverse domains through world models[J]. arXiv preprint arXiv:2301.04104, 2023.
[5] Assran M, et al. Self-supervised learning from images with a joint-embedding predictive architecture[C]//CVPR. 2023.
[6] Meta V-JEPA 2: 基于视频训练的世界模型[EB/OL]. 2025.
[7] LeCun Y. A path towards autonomous machine intelligence[R]. 2022.
[8] 杨立昆: 2027年,AI将全面进入物理世界时代[EB/OL]. 2026.
[9] OpenAI Sora: A review on background, technology, limitations[J]. arXiv preprint, 2024.
[10] World models: A comprehensive survey of architectures, methodologies, reasoning paradigms, and applications[J]. arXiv preprint arXiv:2606.00133, 2026.
[11] 李飞飞. 系统阐述"世界模型"功能分类学[EB/OL]. 2025.
[12] NVIDIA Cosmos世界基础模型平台[EB/OL]. 2025.
[13] 世界模型深度技术解析: 原理、范式、分类与核心机制[EB/OL]. 2025.
[14] 2026物理AI白皮书: 迈向可执行的机器智能[R]. 2026.
[15] 世界大模型的理论基础[R]. 2026.
[16] 舒文韬, 李睿潇, 孙天祥, 等. 大型语言模型: 原理、实现与发展[J]. 计算机研究与发展, 2024, 61(2): 351-361.
[17] 冯胤清. 面向逻辑思维的程序设计方法——脑的设计(双脑架构)[J]. 2026.
[18] 冯胤清. 面向逻辑思维的程序设计方法——类脑大模型大脑部分初步设计[J]. 2026.
[19] 冯胤清. 面向逻辑思维的类人机器人程序设计架构: 七层认知层次模型与社会化测试框架[R]. 2026.
[20] 冯胤清. 面向逻辑思维的程序设计方法——分析现阶段具身机器人[J]. 2026.
[21] 冯胤清. 面向逻辑思维的程序设计方法——类脑大模型感知理解子网设计[J]. 2026.
[22] 冯胤清. 面向逻辑思维的程序设计方法——类脑大模型认知推理子网设计[J]. 2026.
[23] 冯胤清. 面向逻辑思维的程序设计方法——类脑大模型情感子网设计[J]. 2026.
[24] Kahneman D. Thinking, fast and slow[M]. New York: Farrar, Straus and Giroux, 2011.
[25] Rao R P N, Ballard D H. Predictive coding in the visual cortex[J]. Nature Neuroscience, 1999, 2(1): 79-87.
[26] 中国信通院. 2025人工智能产业十大关键词[R]. 2025.





