机器人大脑之争进入深水区:为什么物理世界需要从头设计模型 文章

InfoQ 中文2026-08-12BLOGzh作者: 华卫

详细信息

来源站点
InfoQ 中文
作者
华卫
文章类型
BLOG
语言
zh
发布日期
2026-08-12

摘要

作者 | 华卫如果说今年WAIC最直观的变化是什么,具身智能的超强存在感无疑是其中之一。在H3馆内,超过200家具身企业的集中亮相,让这一领域第一次以成体系的方式出现,甚至被抬升至与智算并列的核心赛道之一。与往年相比,一个重要的变化正在发生:“表演型机器人”不再是主角,搬运、巡检、分拣、整理等更贴近真实场景的能力展示显著增多。决定机器人从“可看”走向“可用”的关键变量,是那个不那么直观的部分:“机器人大脑”。今年以来,围绕VLA与世界模型的技术路线讨论持续升温。此前,蚂蚁灵波首席科学家沈宇军提出过一个颇为直接的判断:将数字世界的视频模型通过微调迁移到机器人场景,本质上仍是一种路径依赖,更像阶段性的“捷径”,而非面向物理世界的终局解法。这一判断来自一位生成模型出身的研究者,也让“具身原生”这个概念有了更加具体的技术含义。沈宇军的判断并不只是一句路线主张。本届WAIC前夕,蚂蚁灵波发布了全栈大脑 2.0,一次推出 6 款模型,覆盖从空间智能、灵巧操作到环境反馈的全链路,让机器人看得更清楚、想得更明白、干得更利索。其中,LingBot-VA 2.0 是行业首个具身原生世界动作模型。按照沈宇军的解释,在终局架构尚未确定时,蚂蚁灵波选择先把感知、对齐、预测和行动等能力拆开验证,再寻找融合方式。“全栈”解决的是怎么拆问题,“原生”解决的是从哪里开始——数据、训练目标和模型架构,都要服务于机器人在物理世界中的感知与行动需求。日前,蚂蚁灵波宣布启动融资,首轮拟募资15亿元,并计划于年底完成第二轮融资。消息一出,行业目光随之聚拢。蚂蚁灵波以“全栈大脑”践行“具身原生”的技术路线,也由此迎来更公开的行业检验。下面是我们在WAIC现场与沈宇军展开的一场专访对话,试图追问几个更深层的问题:具身数据的标准为何迟迟没有收敛?VLA 和 VA路线并行探索的终极目标是什么?“具身原生”为何要从头开始?以下是对话的实录整理:具身数据的“新大陆”:难点、标准与数据飞轮InfoQ:过去几年,大语言模型的发展依靠互联网几十年积累的数据红利,而物理世界的数据被您称为“新大陆”。那么要找到这片新大陆,当前最核心的难点是什么?目前行业有没有初步形成一些数据采集标准?沈宇军:在具身智能赛道,数据还没有形成具体的标准。每一家公司想要的数据形式,包括包含哪些模态以及每种模态需要达到什么样的精度,都没有共识。

相关事件

暂无数据

相关公司查看全部 (2)

相关人物

暂无数据