摘要
7月18日,腾讯Robotics X实验室、福田实验室联合腾讯混元发布具身智能系列新模型和智能体新成果,首次系统性地打通“感知—身体—行动”的闭环,推动具身智能从“离身智能”迈向“具身原生智能”、从实验室迈向真实生产力应用。本次发布的具身基座模型包括Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0 和 Hy-Embodied-VLA-0.5,这三个模型都基于混元大模型打造,其中VLM 模型像“右脑”,负责理解图像、空间和场景;RxBrain模型像具身“大脑”,统一认知、规划和对未来状态的想象;VLA模型连接“小脑”和身体,把高层目标转化成连续的、可纠错的动作。同时发布具身智能体Apexio和智能体框架TairosAgent,它们通过智能体的调度能力,可以把前面的“左右脑”、“大脑”、“小脑”和身体整合成完整的系统,让机器人形成一个持续感知、持续决策、持续行动的整体。 在2026 WAIC 腾讯AI 应用创新论坛上,腾讯首席科学家、腾讯Robotics X实验室、福田实验室主任张正友指出,今天最聪明的人工智能本质上仍是“缸中之脑”——它善于逻辑推理、文本生成和知识问答,却缺乏与物理世界直接互动的闭环:未必真正理解物体的位置、空间关系与可操作性,也难以在持续变化的环境中边行动、边接收反馈、边及时调整。“语言并不等于全部认知,它只是智能向外表达的一个通道。”张正友表示,真正的智能需要让语言、视觉、空间认知、身体控制和环境反馈连通起来,在“感知—身体—行动”的闭环里接受验证。此次发布的五项新成果,正体现了腾讯沿着“从离身走向具身、从分裂的模块走向整体的闭环”探索具身原生智能的基本思路。 三大具身基座模型:看懂世界、会推理且会想象、会行动 虽然大模型已经拥有了强大的语言和图像理解与生成能力,但是让人工智能更好的理解物理世界一直是一个难题。过去一段时间,腾讯Robotics X 实验室一直在探索具身智能基座模型,并将成果开源,与行业共同成长。本次发布并开源的模型有三个,首先是新一代具身VLM(视觉语言)基座模型Hy-Embodied-VLM-1.