AI系列深度13期:世界模型如何实现?
投资要点
世界模型首先需要进行概念辨析:认知科学、系统动力学与人工智能均使用“世界模型”一词,但其所指对象和技术目标并不完全相同。其思想来源大致可分为三条脉络:一是Craik提出的心智内部“小尺度现实模型”,强调通过内部模拟预演行动并预测结果;二是Forrester以World2为代表的系统动力学传统,侧重通过外部计算模型模拟复杂系统及其长期演化;三是模型式强化学习与神经世界模型传统,Schmidhuber较早探索利用递归神经网络学习环境动态并支持规划,Ha与Schmidhuber进一步将环境压缩表征、动态预测与策略学习相结合。三者并非同一技术谱系,但共同关注对环境状态及其演化规律的建模;在当前人工智能语境下,世界模型通常特指智能体用于预测行动后果,并支持规划与决策的内部环境模型。
我们将世界模型分歧拆解为四个环节。第一,预测空间不同:生成式路线还原未来画面或视频,JEPA等非生成式路线只在抽象表征中预测。第二,输出要求不同:渲染器强调视觉真实,模拟器强调几何、物理和可计算一致性。第三,与动作结合方式不同:可作为数据工厂、闭环训练环境,也可进一步成为架构级融合组件。第四,落地阶段不同:内容型数字AI进展最快,自动驾驶闭环最深,机器人需求强度最高但仍处早期。
生成式与非生成式是当前最核心的路线分歧。LeCun等反对像素级生成,认为其存在容量浪费、画面模糊和误差累积等问题;生成式阵营则认为扩散和潜空间预测已部分化解上述问题,并能直接产出视频、合成数据和仿真环境。纯JEPA路线仍面临训练坍缩、可解释性不足、演示难度高和缺少中间产品等工程问题,因此产业侧目前更偏向生成式或混合式路线。
落地上,自动驾驶是世界模型闭环最完整的场景:车队回传真实数据,云端世界模型重建和生成场景,策略在虚拟环境中训练与评估,再通过OTA回到车端形成数据飞轮。Waymo World Model、NVIDIA Cosmos、Wayve GAIA、小鹏、理想、华为等均体现世界模型从复现样本走向生成未观测场景、制造长尾数据的趋势。
世界模型能否从视觉真实进一步提升至物理一致,仍是其进入物理闭环的关键约束。三大瓶颈最终收敛到物理一致性不足、长时序不稳和评测无公认标准。场景误差容忍度决定世界模型当前可落地的边界;高风险数字场景和自动驾驶、机器人等物理闭环场景,都需要更严格验证。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。