Physical Intelligence与机器人开源革命:“免费大脑”背后的四派力量与博弈
核心观点摘要 (Executive Summary)
- 起点与转折:2024–2026年,具身智能领域出现了开源大模型全方位挑战闭源巨头的现象。以参数量仅 70 亿的 OpenVLA 击败 550 亿参数的谷歌 RT-2-X 为标志,证明了在具身智能领域“大不代表聪明”,良好的数据设计和架构创新能实现“以小博大”。
- 技术四派:开源 VLA(视觉-语言-动作)模型已分化为四大派别:学院派(OpenVLA/OCTO)、巨头生态派(NVIDIA GR00T/Google Gemini Robotics)、创业派/中国力量(小米/蚂蚁/自变量/OpenMind)、技术极致派(Physical Intelligence π0)。
- 开源动因:商业公司开源并非单纯慈善,而是通过“开源模型引流、闭源专有数据/训练 Pipeline 变现”或“用模型绑定自身硬件/计算生态”等策略抢夺行业标准制定权。
- 对抗巨头的武器:开源社区依靠 “数据(Open X-Embodiment) + 工具(LeRobot/Genesis) + 架构” 的三层组合拳,降低了硬件与训练门槛,打破了特斯拉等闭源自研孤岛。
逐章节完整详解
一、 背景与破局:OpenVLA 的“以小博大”
- 打破闭源神话:2024 年 6 月推出的 OpenVLA 仅有 70 亿参数,却在 29 项机器人操作任务中,以 16.5% 的成功率优势击败了谷歌 DeepMind 拥有 550 亿参数的旗舰闭源模型 RT-2-X。
- 架构巧妙设计(“三个臭皮匠”战略):
- 谷歌 RT-2-X 仅使用单视觉编码器,信息处理效率较低。
- OpenVLA 引入双视觉编码器:
DINOv2负责空间物理关系理解;SigLIP负责语义与常识理解。结合 Llama 大语言模型作为决策大脑,将空间与语义信息解耦优化再统一决策,实现了更高的综合性能。
二、 开源 VLA 模型四大派系拆解
| 派别 | 代表模型 / 机构 | 核心特点与技术优势 |
|---|---|---|
| 1. 学院派 | OpenVLA (斯坦福/伯克利) OCTO (伯克利) | • OpenVLA:代码、模型权重、训练脚本全公开。 • OCTO:数千万参数级,基于 Transformer 扩散策略模型,主打轻量化与快部署。不求性能最强,求快速适配合适应不同硬件与观察空间。 |
| 2. 巨头生态派 | NVIDIA GR00T Google Gemini Robotics | • NVIDIA GR00T:双系统架构。System 2(VLM/慢思考,环境规划)+ System 1(Diffusion Transformer/快思考,高频关节控制)。配合 Omniverse、Isaac Sim、Cosmos 提供软硬一体全流程工具链。 • Google:从早期开源 RT-1 到后续闭源,最新推出 Gemini Robotics 打造“机器人界安卓”,并与波士顿动力(Atlas)达成战略合作部署。 |
| 3. 创业公司与中国力量 | 小米 Robotic Zero 蚂蚁 LinkbotVLA 清华/上海实验 XVLA 自变量机器人 OpenMind (OM1) | • 小米 Robotic Zero:47亿参数,采用 MoE 架构分离大脑与小脑,显著降低 VLA 推理延迟,消费级 GPU 即可运行。 • 蚂蚁 LinkbotVLA:跨形态泛化,基于 2 万多小时双臂真机数据训练,追求“一个大脑控制所有硬件”。 • OpenMind:打造跨硬件通用软件层(OM1 平台),打破各厂商封闭格局。 |
| 4. 技术极致派 | Physical Intelligence (π0) | • π0 (P0):数十亿参数级,动作生成采用 Flow Matching(流匹配) 连续控制思路。 • 50Hz 高频控制:每秒更新约 50 次轨迹规划,可完成叠衣服、折纸巾、捉扑克牌等柔性/高精操作。 |
三、 “开源复仇者联盟”:顶尖科学家幕后关系网络
- 具身智能开源与闭源阵营并非冰火不相容,其核心成员具有高度重合与演变背景:
- Chelsea Finn(斯坦福教授):OpenVLA 核心作者、Physical Intelligence 联合创始人,横跨学术界与产业界。
- Sergey Levin(伯克利教授):强化学习泰斗,曾任职 Google Brain,后离职共同创立 Physical Intelligence。
- Corey Lynch / Brian Ichter 等:原 Google DeepMind 标志性大模型 RT-1/RT-2 的核心贡献者,2024 年初集体从谷歌离职创立 Physical Intelligence。
四、 商业逻辑:为什么要把核心技术开源?
- 定义行业标准(抢占生态生态):当全球研究者与企业都在 π0 或 OpenVLA 框架上构建应用,开源方即获得了事实上的行业话语权。
- 引流与变现分离(开源引流,闭源变现):Physical Intelligence 虽然开放了权重与推理代码,但保留了完整训练流水线(Pipeline)与数万小时的高质量自研数据集。
- “伪开源/战略开放”策略:例如 NVIDIA 虽开放了 GR00T 基础模型,但训练过程高度依赖 H100 集群、Omniverse 仿真引擎以及 Jetson Thor 边缘芯片,本质上是为其硬件销售建立护城河。
五、 开源社区三层武器与挑战
1. 开源三层组合拳 (Data + Tools + Infrastructure)
- 数据层(Open X-Embodiment):由 20 多家机构联合组建的公共资源,包含 22 种机器人形态、超 100 万条轨迹、527 种技能。统一了以往极度混乱的数据标准格式。
- 实体工具层(LeRobot):Hugging Face 开发的开源框架,将机器人数据集、常用策略与真机部署统一化;配合百美元级机械臂(如 SO100),大幅降低真机测试门槛。
- 仿真引擎层(Genesis):CMU 等联合推出的物理仿真工具,单张 RTX 4090 显卡上可实现每秒 4300 万帧模拟(实时的 43 万倍),在虚拟世界训练 1 小时相当于现实世界 49 年。
2. 开源面临的现实挑战
- 算力门槛高:顶尖开源模型(如 OpenVLA)依然需要 64 张 A100 训练 15 天。
- 数据噪音大:Open X-Embodiment 数据集标注质量参差不齐,一致性不如特斯拉等自研闭源孤岛。
- Demo 与商用落地间巨大的工程断层。
- 物理世界安全风险:聊天机器人犯错仅限言语,机器人动作失误可能招致物理伤害。(OpenMind 甚至提出用以太坊区块链的不可篡改性来约束机器人行为规约的激进方案)。
未来展望
自变量机器人 CTO 预测:在未来 1~2 年内,具身智能开源/闭源模型将全面达到 GPT-3 级别的跃迁——机器人将从“仅能执行简单确定性指令”,跨越到“能够理解复杂意图、拥有物理常识并在未知开放环境中灵活执行”的全新阶段。