Chinese AI outlet surveys divergent world model definitions from Li, LeCun, Zhu
A Chinese AI outlet surveyed competing definitions of world models from Fei-Fei Li, Yann LeCun, and Jun Zhu, noting the term lacks consensus in 2026. Li's World Labs categorizes models as renderers, simulators, and planners; LeCun advocates learning predictable world structures in abstract latent spaces; Zhu's framework defines core capabilities from first principles and proposes a five-level roadmap.
Coverage timeline
机器之心机器之心
编辑|杨文 2026 年,「世界模型」是 AI 圈最没有共识的词之一。 一段能够连续生成的视频,被叫作世界模型;一个随键鼠操作实时变化的数字环境,也被叫作世界模型;在潜空间预测未来状态的系统,以及直接输出机器人动作的策略,同样使用这个名字。 这些模型都在处理世界的信息,能力边界却相去甚远。生成视频里的画面可以足够逼真,却违背真实的物理规律;机器人能够完成一次抓取,也可能只熟悉实验室里的物体、机位和动作轨迹。一个系统究竟学到了视觉相关性、物理结构,还是行动与结果之间的关系,仅靠 Demo 很难回答。 概念混乱增加了技术判断的难度 。画质、几何精度、预测能力和任务成功率被混在一起比较,不同团队看似争夺同一赛道,实际回答的可能是不同问题。 因此,世界模型研究开始回到一个基本问题,模型需要具备哪些能力,才能从生成内容走向理解并改变世界? 李飞飞和 World Labs 按功能将世界模型分为渲染器、模拟器和规划器,分别输出像素、世界状态与动作。 链接:https://www.worldlabs.ai/blog/taxonomy-of-world-models LeCun 则主张在抽象潜空间中学习可预测的世界结构,让模型保留对理解、推理和规划有用的信息。 链接:https://ai.meta.com/research/vjepa/ 清华大学朱军给出了第三个角度。早在去年 12 月 Motus 发布时,他就公开阐述「通用世界模型」整体构想,今年 3 月,他又将其定位为连接数字世界与物理世界的基础。几个月后,朱军及团队在论文《General World Models from First-Principles》中进一步完善这套框架, 从第一性原理定义核心能力,并给出一张五级进化路线图 。 论文链接:https://www.shengshu.com/assets/gwm-principles-and-roadmap.pdf 技术报告:https://www.shengshu.com/zh/general-world-model/ 论文将通用世界模型的核心能力归纳为 理解、想象和行动 。模型需要从历史观测中形成对当前世界的判断,推演不同选择可能产生的未来,采取行动,再用新观测修正自身。 沿着这一框架,视频生成、实时交互、潜空间预测和机器人控制可被视为同一条能力路线上的不同阶段。 世界模
