世界模型与世界的距离:数据、技术路线和落地预期 文章

36kr 资讯2026-06-15NEWSzh作者: 明亮公司

详细信息

来源站点
36kr 资讯
作者
明亮公司
文章类型
NEWS
语言
zh
发布日期
2026-06-15

摘要

在过去一年里,“世界模型”在AI领域的关注度迅速升温。 而在当下投融资两端火热的具身智能赛道,它被寄予的期待并不低,如果一个模型能够理解物理世界,预测未来状态,并在交互中不断修正自身行为,那么机器人就有可能从当前依赖模仿学习和场景数据的执行系统,走向真正具备规划、试错和持续学习能力的智能体。 然而,目前业界对于“世界模型”似乎仍未有明确的边界。 在第八届“北京智源大会”的演讲中,智源研究院院长王仲远对现有技术路线进行了分类:第一类是以语言为中心的世界模型,包括VLM、VLA等;第二类是以像素为中心的世界模型,例如视频生成类模型,在视觉空间中学习视频或图像;第三类是以三维结构为中心的世界模型,包括3D重建及相关空间模型;第四类是以视觉表征为中心的世界模型,例如JEPA系列模型。 6月13日,在北京智源大会上的一场世界模型的圆桌讨论中,多位来自机器人、大模型、3D生成和具身智能公司的研究者给出了更审慎的判断:世界模型仍处于早期阶段,距离真正进入生产落地环节还有相当长的路。 参与讨论的嘉宾包括极佳视界联合创始人、首席科学家朱政,蚂蚁灵波科技首席科学家沈宇军,自变量机器人联合创始人兼CTO王昊,腾讯混元3D及世界模型负责人郭春超,星源智联合创始人、智源研究院具身交互世界模型实验室负责人孙振国。圆桌由智源研究院研究员于智薇主持。 以下为「明亮公司」整理精编后的论坛内容: 世界模型在真实系统中处于什么阶段? 郭春超首先从互联网和数字内容行业视角判断,世界模型距离严肃生产系统仍有距离。 在他看来,如果以工业生产或游戏管线为参照,世界模型目前更多还处于原型阶段。它可以被用于生成训练数据、快速验证某些设计想法,但距离高度自动化、达到高商业水准的系统仍有不少路要走。 他后续进一步补充,世界模型更容易率先落地的场景需要满足几个条件:容错度高、环境可验证、落地链条短。例如游戏原型验证、交互式娱乐、交互式短视频、交互式影视、营销活动、交互式广告等。这些场景对安全和精确控制的要求没有机器人那么高,因此比物理世界更容易跑通。 朱政从机器人落地角度做了对比。他认为,现在VLA或相关机器人模型在真实落地方面比世界模型更成熟。 原因在于,当前机器人较适合落地的场景主要是工业场景或泛服务场景。