腾讯具身智能全栈方案 · 技术原理深度解析

WAIC 2026 腾讯 AI 应用创新论坛 · 首次系统性打通「感知—身体—行动」闭环

资料来源:腾讯官方发布稿、腾讯云开发者社区技术文章、Robotics X 实验室 & 福田实验室 & 腾讯混元联合发布内容(2026-07)

核心理念腾讯首席科学家张正友提出:今天最聪明的人工智能本质是「缸中之脑」——善于逻辑、文本与问答,却缺少与物理世界直接互动的闭环。真正的智能要让语言、视觉、空间认知、身体控制和环境反馈在「感知—身体—行动」闭环里接受验证。

本次发布的五项成果,体现了腾讯「从离身走向具身、从分裂模块走向整体闭环」的探索思路:三个基座模型 + 一个智能体框架 + 一个 Always-on 智能体 + 升级的开源平台 + 云端 EaaS 服务。

一、全栈四层架构总览

整套方案贯穿四个层级,从下到上分别是云底座 → 模型层 → 智能体框架层 → 平台层,最上层是零售导览、养老照护、工厂作业等真实应用,形成「数据/算力 → 模型 → 调度 → 本体 → 反馈」的完整链路。

应用层 · 真实场景落地 零售导览(众擎PM01)· 文旅导览(敦煌·宇树G1)· 养老照护 · 工厂作业(日化产线)· 按摩服务(小六机器人) 平台层 · Tairos(钛螺丝)开放平台(2025 发布,2026 全面升级 + 开源) 开源模型 / 智能体 / 开发工具 · RoboFusion「一线连接」· HAL 硬件抽象层 · 建图语料工具 · Isaac Sim 云端仿真(62类物体/20种动画) 智能体框架层 · TairosAgent 框架 + Apexio(Always-on)智能体 调度「左右脑 / 大脑 / 小脑 / 身体」整合成完整系统 → 持续感知、持续决策、持续行动的闭环整体 模型层 · 混元基座之上的具身模型矩阵(拟人脑映射) VLM-1.0「右脑」 感知/空间/场景理解(1/10 算力达旗舰性能) RxBrain-1.0「大脑」 认知推理 + 视觉想象 · VLA-0.5「小脑+身体」 视觉-语言-动作统一建模 云底座 · EaaS(Embodied-AI-as-a-Service)三层体系 ① 算力底座:GPU/HCC 万卡集群 · 星脉网络 · COS / GooseFS 存储 ② 模型服务:TI-ONE 训练推理 · TokenHub 承载 MaaS 调度 ③ 感知交互:TRTC 实时音视频 · TRRO 远程实时操控 · 视图计算 · MPS · 智能标注 · 语音交互
图 1 · 腾讯具身智能全栈四层架构(自下而上:云底座支撑模型,模型经智能体框架整合,平台层开放给开发者,最终落到真实应用)

二、拟人脑映射:三个模型如何分工协作

三个模型都基于腾讯混元大模型打造,官方形象地将其映射为「左右脑 + 大脑 + 小脑 + 身体」:

拟人角色模型核心职责关键能力 / 数据
右脑 Hy-Embodied-VLM-1.0 感知:看懂图像、空间关系、场景 仅约 1/10 算力即逼近上一代旗舰性能;语言-视觉-空间联合理解,构建层次化信息与具身记忆
大脑 Hy-Embodied-RxBrain-1.0 认知推理 + 对未来状态的想象(goal) 首创「文本推理 × 视觉想象」协同;基于 5w+ 小时具身数据;约 6.2B 参数
小脑+身体 Hy-Embodied-VLA-0.5 把高层目标转成连续、可纠错的动作 视觉-语言-动作统一建模;超 1 万小时人类示教数据;RoboDojo 仿真综合第一
VLM 右脑 看场景/空间 RxBrain 大脑 推理 + 想象目标 VLA 小脑+身体 生成可执行动作 机器人本体 执行 / 接触世界 TairosAgent 框架 + Apexio(Always-on):调度整合「左右脑/大脑/小脑/身体」 环境反馈(视觉/力觉/触觉)→ 持续感知 → 持续决策 → 持续行动
图 2 · 拟人脑分工与「感知—身体—行动」闭环(绿色回路=环境反馈驱动的持续闭环,由 TairosAgent/Apexio 统一调度)
为什么需要三个模型而不是一个?单一 VLA 把「理解、推理、想象、动作」强行塞进一个模型时,目标物理状态往往是隐式的,还需要额外世界模型/价值模型判断结果;而纯 World Model 又难以显式表达任务逻辑。腾讯的分工是让每个部件各司其职、再通过智能体框架闭环整合。

三、模型层技术原理详解

3.1 VLM-1.0「右脑」· 高效感知

3.2 RxBrain-1.0「大脑」· 会推理且会想象(最核心创新)

这是整套方案里最具突破性的模型。机器人进入开放环境后,不仅要知道「下一步做什么」,还要理解「为什么这样做」和「完成后世界应该变成什么样」。RxBrain 把文本推理与视觉想象在一条连续认知序列中协同发生。

RxBrain 架构:以模态为路由的 Mixture-of-Transformers(MoT) 共享统一注意力空间 + 模态专用计算路径;文本通路≈1.5B、视觉理解通路≈1.5B、视觉生成 FFN Expert≈2.4B 文本通路(因果自回归 / NTP) 视觉理解 Token (与生成共享 ViT + QKV) 视觉生成 Token (独立 FFN 专家 · Flow Matching) 共享 Vision Transformer + 共享 QKV:让「看见的世界」与「想象的世界」同空间交互 交错式生成(核心机制) 每一步生成的目标图像 → 转成与观测一致的视觉表示 → 重新加入上下文 后续文本/视觉不是独立调用,而是持续「条件于」已推理/想象出的状态(避免图像与计划脱节、状态漂移) 为下游动作模型(VLA)提供两种条件 ① 语言计划 → 任务理解 / 动作选择 ② 目标图像 → goal-conditioned policy / 逆动力学 / 动作解码器的视觉目标;与实测图差异 → 进度判断 / 失败检测 / 重规划
图 3 · RxBrain-1.0 的 MoT 架构与「文本推理 × 视觉想象」交错协同机制

关键技术细节:

真机验证(DOBOT X-Trainer、方舟无限 A5 机械臂):摆餐具 97%、折叠收纳眼镜 95%、丢垃圾 68%,平均 87%;对比 π0 的 68%、π0.5 的 82%。证明「视觉想象」不是炫技展示,而是能被动作模型实际利用的中间认知表示。

3.3 VLA-0.5「小脑+身体」· 视觉-语言-动作统一建模

诚实的边界:在更严苛的第三方 RoboDojo「珠峰级」评测中,Hy-Embodied-0.5-VLA 虽位列仿真综合第一(均分 13.07 / 成功率 8.80%),但整体仍远低于人类专家(76% / 80.42 分)。泛化、精细控制、长程、开放语义仍是全行业短板——这是行业现状,非腾讯独有。

四、智能体框架层:TairosAgent + Apexio

三个模型各自擅长一块,TairosAgent(具身原生智能体框架)与 Apexio(Always-on 具身智能体)负责把「左右脑、大脑、小脑、身体」调度整合成完整系统,让机器人成为「持续感知 → 持续决策 → 持续行动」的整体。

五、平台层:Tairos(钛螺丝)升级 + 开源

六、云底座层:EaaS(Embodied-AI-as-a-Service)

腾讯云提出业内首个云端 EaaS,并搭建「算力底座 → 模型服务 → 感知交互」三层体系,把具身智能从技术研发推向规模商用:

层级关键组件作用
算力底座GPU/HCC 万卡集群 · 星脉网络 · COS / GooseFS 存储支撑万卡级稳定训练、海量多模态数据存储与高速读取
模型服务TI-ONE 训练推理平台 · TokenHub(MaaS 调度)模型训练/精调/评测,按量推理调度
感知交互TRTC 实时音视频 · TRRO 远程实时操控 · 视图计算 · MPS · 智能标注 · 语音交互覆盖数据采集、传输到理解交互的完整感官链路;远程操控与低延迟实时交互
腾讯云的明确定位:不参与硬件竞争,专注平台能力——一端连接本体/算法/场景方,另一端连接制造、文旅、零售、服务等行业客户,帮企业把精力放在本体能力、应用逻辑与行业 know-how 上,而非重复建设基础设施。

七、端到端:一个任务怎么跑完

① 感知
VLM 右脑读取相机/力觉/触觉,理解场景、空间关系与可操作物
② 推理
RxBrain 大脑接指令,做任务分解、约束与长程决策(语言)
③ 想象
RxBrain 同时生成每步「目标状态图像」(视觉),作为显式 goal
④ 动作
VLA 小脑+身体用 Flow-Matching 动作专家解码出连续、可纠错动作
⑤ 反馈
实测图 vs 目标图 → 进度/失败检测 → 重规划,闭环回到①

整个调度由 TairosAgent + Apexio 驱动,开发与部署跑在 Tairos 平台 + 腾讯云 EaaS 之上。模型持续从真实反馈中回流数据,形成「数据闭环 → 模型迭代 → 性能提升」的正循环。

八、开源地址(可直接获取)