蚂蚁灵波沈宇军:蚂蚁灵波全栈大脑2.0,打造具身原生智能 文章

36kr 文章2026-07-20NEWSzh作者: 时氪分享

详细信息

来源站点
36kr 文章
作者
时氪分享
文章类型
NEWS
语言
zh
发布日期
2026-07-20

摘要

当大模型加速进入物理世界,一个看似顺理成章的技术路径是:把已经在数字世界训练成熟的模型装进机器人,再接上动作控制。但这是否就足以构成机器人的“大脑”? 7月19日,在蚂蚁InclusionAI与PyTorch基金会联合举办的“AGI基础设施与普惠实践”论坛上,蚂蚁灵波科技首席科学家沈宇军以《蚂蚁灵波全栈2.0,打造具身原生的机器人通用大脑》为题发表演讲。他给出的判断是,物理世界不是数字世界的简单延伸,机器人需要一套从感知、预测到行动,都为物理世界重新设计的基础模型体系。 蚂蚁灵波首席科学家沈宇军发表演讲 01. 从数字世界到物理世界,机器人要跨越三道鸿沟 沈宇军把机器人大脑面临的挑战概括为三点:看得更清楚、想得更明白、干得更利索。 第一道鸿沟来自传感器。数字世界的视觉模型擅长识别“这是什么”,机器人还必须知道“它在哪里”“离我多远”“中间能不能通过”。例如,隔着透明玻璃看见一只猫,并不意味着机器人能够直接触碰它。视觉语义上“看见”,不等于物理空间上“可达”。 第二道鸿沟来自高动态交互。数字内容模型可以在相对完整的上下文中生成结果,机器人面对的环境却随时可能被人打断、被物体遮挡,或因一次接触而发生变化。它不能一次规划到底,而是要在行动中持续预测下一刻,并根据反馈实时修正。 第三道鸿沟是泛化与产业落地。机器人不仅要在一台机器、一个任务上表现良好,还要让已经学会的能力迁移到不同构型和真实场景,降低重复采集数据和重新训练的成本。对具身智能而言,能做出一次演示只是起点,能在不同本体上稳定复用才更接近通用能力。 02. 蚂蚁灵波全栈2.0:打造具身原生的机器人通用大脑 针对这三道鸿沟,蚂蚁灵波全栈2.0形成了从空间智能、环境反馈到灵巧操作的大脑能力闭环。 蚂蚁灵波应对数字世界与物理世界鸿沟的解法 在空间感知层,LingBot-Vision从几何结构出发进行视觉预训练,为机器人建立面向空间原生的视觉基座;基于LingBot-Vision,LingBot-Depth 2.0进一步弥补传感器误差,重点处理透明、反光和密集物体等真实环境中的难题。目前,蚂蚁灵波已与奥比中光展开合作,将LingBot-Depth 2.0集成至其相机产品,搭载相关能力的相机已面向全球市场销售。

相关事件

暂无数据

相关公司查看全部 (5)

相关人物

暂无数据