把GPT-4o拉下神坛!星源智联合北大推出RoboAgent,让3B VLM在未知场景跑出94%成功率 文章

InfoQ 中文2026-05-29BLOGzh作者: 华卫

详细信息

来源站点
InfoQ 中文
作者
华卫
文章类型
BLOG
语言
zh
发布日期
2026-05-29

摘要

“把圆餐桌上的脏杯子放进洗碗机。”这句指令对3岁小孩都简单,但对AI机器人,是一场严峻的挑战。它要先搞懂哪个是“圆餐桌”(木质的还是玻璃的?),然后判断杯子可能在桌上、柜子里还是水槽边。走到一半发现视野里根本没有杯子,它懵了:我该往哪儿找?刚才的计划还作数吗?更麻烦的是,就算找到了杯子,洗碗机的门可能是关着的——它得先开门,再放进去,再关门……这不是段子,而是具身任务规划(Embodied Task Planning, ETP) 的真实困境。现在的视觉-语言模型(VLM)通过大规模预训练展示了卓越的多模态理解能力,但一旦被扔进真实的家庭环境,需要多轮交互、长程推理、扩展上下文分析,它们就像理论优异的学生第一次下厨房:理论全能,实操抓瞎。如何解决这一难题?北京大学副教授穆亚东及北京大学与星源智团队共同提出了RoboAgent方案。该方案采用能力驱动的具身路径规划,将复杂的规划任务分解为一系列更简单的视觉语言问题;同时,设计了一个多阶段训练路径,利用中继监督(intermediate supervision)与多样化数据来源,系统性地优化VLM的规划能力。值得一提的是,该核心方案相关论文《RoboAgent: Chaining Basic Capabilities for Embodied Task Planning 》成功入选全球计算机视觉顶会CVPR 2026。本届CVPR投稿量高达16092篇,录用率仅为25.42%,该论文入选亦彰显了团队在具身智能领域前沿创新的硬核实力。为什么VLM自己搞不定?传统做法要么让VLM直接输出动作序列,要么加一段“思维链”(CoT)推理。但在ALFWorld这类需要探索+操作的仿真环境里,问题层层叠加:模型要先理解模糊指令(比如“那个圆圆的、放在厨房岛上的东西”),推测目标可能藏在哪里,导航过去,识别物体,最后执行抓取、放置等动作。任何一个子任务出错,整个任务就崩了。更棘手的是,奖励信号极其稀疏——可能走了20步才判断成败。用纯强化学习(RL)训练,模型往往在无效探索中耗光步数。而单纯模仿专家轨迹,又无法泛化到没见过的新场景。RoboAgent的核心洞察是:把“规划”拆成一系列更小的、VLM本来就擅长的视觉-语言子问题。

相关事件

暂无数据

相关公司查看全部 (2)

相关人物

暂无数据