蚂蚁灵波(Robbyant)具身智能深度研究报告

研究对象:上海蚂蚁灵波科技有限公司(Shanghai Ant Lingbo Technology Co., Ltd.),对外品牌 Robbyant,模型系列 LingBot

方法说明:本报告基于公开信息(官网、arXiv、GitHub、工商登记、媒体报道、第三方论文)交叉验证撰写。全文严格区分「已核实事实」「厂商宣传口径」「媒体传闻」三类信息,并在关键处标注冲突口径。


一、核心结论(TL;DR)

  1. 它是一家”模型公司”,不是”机器人公司”——但立场并不纯粹。灵波的战略主张是”不做本体、只做通用大脑”,对标 Physical Intelligence;可它同时推出了自研本体 R1(2025.09)与 R2(2026.07)。官方解释是本体用于”定义参考构型、暴露软硬件问题、支撑数据采集”,但客观上使其处于软件叙事不够纯粹、硬件能力不足以对抗本体厂的中间态。

  2. 技术体系的完整度是国内第一梯队,且明显超出同体量公司。7 个模型家族、11 个已发布版本,覆盖深度补全 → 空间视觉基座 → 3D 重建 → VLA 操作 → 世界模型 → 视频生成 → 世界动作模型。同时押注 VLA 与”世界动作模型(WAM)“双线,在国内属少数派,等价于对两条尚未收敛的技术路线做了对冲。

  3. “具身原生”不只是营销词,有可核验的架构选择。LingBot-VA 2.0 的四项设计(语义视觉-动作 Tokenizer、严格因果预训练、稀疏 MoE、Foresight 异步推理)确实区别于”把视频生成模型改造成动作模型”的主流做法,并有 arXiv 论文与开源代码支撑。

  4. 开源是它最锋利也最脆弱的武器。GitHub 全系列 Star 约 2.95 万(实测 2026-08-05),但结构性偏斜严重:偏 CV 通用工具的 lingbot-map 一个仓库就占 55%,而真正的核心资产 lingbot-vla-v2 仅 711 star。同时 lingbot-world-v2 采用 CC BY-NC-SA 4.0(禁止商用),“全面开源”需打折扣。

  5. 落地的真实成色:1 家门店。截至研究截止日,可确认的真实商业运营场景只有上海浦东东靖路国大药房 1 家门店,机器人 2026 年 7 月”入职”。WAIC 上”三台异构机器人协同”是展台演示;“90 秒完成问诊到取药”是展台链路耗时,不是门店实测(门店实测为单笔订单 3 分钟内)。未查到任何公开的合同金额、订单量或收入数字。

  6. 最大的结构性风险是”数据供给方 = 潜在竞争对手”。灵波的真机数据主要来自宇树、智元、乐聚、星海图等生态伙伴,而这些厂商各自都在自研大脑(UnifoLM、GO-1、AstraBrain)。这与 PI 的伙伴(纯应用商 Weave、Ultra)有本质差异——PI 的燃料供应商不跟它抢生意,灵波的会

  7. 融资量级仍在第二梯队。拟募 15 亿元人民币,对比同期它石智航单轮 4.55 亿美元、自变量投后超 200 亿元、Skild AI 估值 140 亿美元,差距明显。独立融资的动因之一被指为”蚂蚁集团内部算力预算挤压”——这本身说明大厂资源并非无限供给

一句话定位:蚂蚁灵波 ≈ Physical Intelligence(软件优先 + 跨本体)× 阿里通义(全栈开源换生态位),是国内大脑派中唯一由大厂全资、双线押注、全栈开源的玩家;其成败取决于能否在生态伙伴自研大脑成熟之前,把”药房 → 零售 → 物流”跑成能自我造血的数据飞轮。


二、公司事实卡

项目内容
全称上海蚂蚁灵波科技有限公司
英文名Shanghai Ant Lingbo Technology Co., Ltd.
对外品牌Robbyant(官网 robbyant.com,slogan “Building One Brain for All Robots”)
成立时间2024-12-17(工商登记,为准)
注册资本1 亿元人民币
股权蚂蚁集团 100% 全资
注册地中国(上海)自由贸易试验区中科路 1750 号
法定代表人 / CEO朱兴(花名陶斋,1985 年生)
首席科学家沈宇军(Damon,1994 年生)
团队规模工商参保 121 人;2026-07 媒体报道”200 余人”;硕博占比 > 90%
组织定位挂蚂蚁 CTO 线,与百灵大模型团队、支付宝 AI 团队平行
知识产权专利 15 条、著作权 5 条(天眼查)
融资状态2026-08-03 确认启动首轮外部融资,拟募 15 亿元,目标年底完成二轮;领投方与估值均未披露

成立时间的口径冲突:部分报道称”2025 年 2 月成立”或”2025 年 3 月在浦东成立”,均与工商登记 2024-12-17 不符。合理解释是内部立项在 2024 下半年、工商注册在 2024-12、实际挂牌运营在 2025 Q1。


三、发展时间线

时间事件性质
2022.04沈宇军加入蚂蚁,任蚂蚁技术研究院交互智能实验室负责人(CV 方向)——灵波技术班底的源头已证实
2024.11沈宇军出任灵波首席科学家(早于工商注册一个月);同月蚂蚁领投星海图 Pre-A(超 2 亿元)已证实
2024.12.17公司注册成立,注册资本 1 亿元,蚂蚁全资工商登记
2025.02.19猎聘曝出大规模招聘人形机器人软硬件岗(上海+杭州,35–80k×16 薪),蚂蚁首次官方回应灵波存在已证实
2025 上半年内部确定”做大脑”路线;主要工作为团队搭建与数据准备高管自述
2025.09.06 / 09.11Robbyant R1 亮相柏林 IFA、上海外滩大会首发,“机器人厨师”演示已证实
2026.01.25–29开源周:连续开源 LingBot-Depth / VLA / World / VA 四款 1.0 模型已证实
2026.04.15LingBot-Map 1.0(流式 3D 重建)发布arXiv:2604.14141
2026.06.12–13智源大会:朱兴(具身产业 CEO 论坛)、沈宇军(世界模型论坛)双场演讲已证实
2026.07.06–09一周六模型:Vision、Depth 2.0、VLA 2.0、World 2.0、Video、VA 2.0 全部开源,构成”LingBot 2.0 矩阵”已证实
2026.07.17WAIC 2026:「机器人智慧药房」入选十大镇馆之宝;自研本体 R2 全球首发已证实
2026.07.24禾赛科技公告 JT 系列激光雷达上 R2已证实
2026.08.03蓝鲸独家披露启动独立融资,公司确认”确实在跟投资人接触”,首次自我定位为蚂蚁”具身领域的核心布局已证实

四、技术解剖:LingBot 模型矩阵

4.1 模型全景

官网 technology.robbyant.com 共列出 7 个模型家族、11 个已发布版本(媒体口径”10 余款”指版本数,非独立模型数)。

1.0 时代(2026 年 1 月开源周)

模型arXiv定位
LingBot-Depth 1.02601.17895《Masked Depth Modeling for Spatial Perception》深度补全,解决透明/反光物体测距
LingBot-VLA 1.02601.18692《A Pragmatic VLA Foundation Model》跨本体 VLA 操作基座
LingBot-World 1.02601.20540《Advancing Open-source World Models》开源世界模拟器(视频生成路线)
LingBot-VA 1.02601.21998《Causal World Modeling for Robot Control》(RSS 2026)自回归视频-动作世界模型

过渡款:LingBot-Map 1.0(2026-04-15,arXiv:2604.14141《Geometric Context Transformer for Streaming 3D Reconstruction》),流式前馈 3D 重建基座。

2.0 时代(2026 年 7 月 6–9 日)

模型arXiv定位
LingBot-Vision 1.02607.05247空间感知原生视觉基座
LingBot-Depth 2.0无独立论文(结果并入 Vision 报告)深度补全 2.0
LingBot-VLA 2.02607.06403《From Foundation to Application》“一脑多机”VLA 基座
LingBot-World 2.0 (World-Infinity)2607.07534《Infinite Worlds with Versatile Interactions》长时程交互世界模型
LingBot-Video 1.02607.07675《Scaling MoE Video Pretraining for Embodied Intelligence》具身向 MoE 视频生成基座
LingBot-VA 2.02607.08639《Native Video-Action Pretraining for Generalizable Robot Control》“具身原生”世界动作模型(厂商称行业首个)

4.2 核心模型技术细节

LingBot-VLA 2.0(当前旗舰,6B)

  • 底座:Qwen3-VL-4B-Instruct(1.0 版为 Qwen2.5-VL)
  • 架构:Mixture-of-Transformers(MoT)将 VLM 与 action expert 通过共享自注意力耦合;action expert 内引入稀疏 MoE;动作头使用 Flow Matching(非标准 diffusion)
  • 统一动作空间55 维(14 臂关节 + 14 末端位姿 + 2 夹爪 + 12 手关节 + 4 腰 + 2 头 + 3 移动 + 4 保留)——这是”一脑多机”的工程基础
  • 双查询蒸馏(Dual-Query Distillation):教师为 LingBot-Depth(几何先验)+ DINO-Video(时序语义),把”预测未来”设为代理任务
  • 数据6 万小时 = 5 万小时真机(20 构型 / 17 厂商)+ 1 万小时第一视角人类视频;从 9 万 + 2 万小时原始池清洗而来
  • 推理:RTX 4090D 上约 130 ms/次,10 步去噪
  • 下游迁移:官方称新场景仅需 80 条演示数据;物流场景(与乐聚合作)称 150–300 条真机数据、开发周期数天

LingBot-VA 2.0(技术密度最高,“具身原生”的具体承载)

四项核心设计:

  1. 语义视觉-动作 Tokenizer:ViT 自编码器,在重建损失外加语义对齐 + IDM/FDM 自监督,从无标注视频中抽取”隐动作”——不依赖动作标注
  2. 严格因果预训练:因果 DiT 从零训练,刻意不复用双向视频生成模型,规避架构改造带来的灾难性遗忘。这是”具身原生”最实的技术含义
  3. 稀疏 MoE:视频流 top-8 / 128 experts(媒体报道为 MoE-13B-A1.9B,对标 Dense-5B),动作流稠密
  4. Foresight Reasoning 异步推理:预测流与执行流并行,真实观测回来后用 FDM 重锚 KV-cache

加速链路(工程价值最大的部分):927 ms → 一致性蒸馏 466 ms → FP8+TensorRT 369 ms → 分页 KV-cache + FlashInfer 272 ms → 系统层 142 ms;异步控制频率 35 Hz → 225 Hz(端到端 6.5×)。

⚠️ 口径冲突:官网项目页展示加速档位为 30 / 60 / 150 Hz,部分媒体写”单卡 150 Hz”,机器之心与英文媒体写”142 ms / 225 Hz”。二者应为不同测量口径(实际控制回放 vs 理论异步频率)。VA 2.0 官方未公开总参数量;某聚合站称”15.3B / 2.5B 激活”,来源不可靠,不建议引用。

LingBot-Vision(“空间原生视觉基座”)

  • 自监督 ViT 家族:ViT-S/B/L/g(1.1B teacher),小模型由 Giant 蒸馏
  • 预训练目标为 masked boundary modeling(掩码边界建模)——以边界结构而非语义分类/对比学习作为自监督目标,追求亚像素级边界定位。官方称”行业首个”
  • 语料仅 1.6 亿张图像,比 DINOv3 小一个数量级——这是可核验的效率优势

LingBot-Depth 2.0

  • 训练样本 3M → 1.5 亿,编码器换成 LingBot-Vision
  • 16 个深度补全 benchmark 中 12 个第一;室内大面积深度缺失 RMSE 0.132 → 0.062
  • 已由奥比中光深度视觉实验室认证,将集成进 Gemini 330 系列相机 SDK 与年底一体机——这是少数有第三方硬件厂商背书的模型

LingBot-World 2.0

  • 基于 Wan2.2 代码库,已开源 14B causal-fast 权重(causal-pretrain 14B、bidirectional 14B、1.3B 仍标 TODO)
  • 720p / 60fps;核心机制 MoBA(Mixture of Bidirectional and Autoregressive attention)、一致性蒸馏 + DMD、并行推理 / 异步 VAE 解码 / 动态 KV cache
  • Agentic Harness:Pilot Agent 控角色 + Director Agent 生成新事件
  • ⚠️ 协议为 CC BY-NC-SA 4.0,禁止商用,且明确”不计划开源部署代码”

其他

  • LingBot-Video:Dense 1.3B 与 MoE 30B-A3B 两档,配 Qwen3.6-27B 改写器,训练含 7 万+ 小时具身数据
  • LingBot-Map:Geometric Context Transformer + 分页 KV cache,518×378 下可稳定推理 1 万帧以上、约 20 FPS

4.3 “具身原生”到底指什么

沈宇军的论述可归纳为三条:

  1. 感知目标不同:数字模型会”看穿”玻璃识别后方物体,感知不到物理阻隔
  2. 优化目标不同:数字生成追求高清细节,机器人只需快速预判因果——“预判咖啡倾倒,只需得出会洒出的结论”
  3. 交互性不同:数字模型无需与真实环境持续交互

工程上落为三层框架(智源大会):底层空间感知 → 中层动作执行 → 顶层环境反馈,对应”看得更清楚、想得更明白、干得更利索”。

评估:这套主张在 VA 2.0 上有 4 个可验证落点(语义 tokenizer、严格因果预训练、MoE、异步推理),属于真实的架构选择而非纯营销。但”行业首个""全球首创”均为厂商自述,无第三方裁定。


五、性能验证:厂商数据与第三方证据

5.1 厂商自报 Benchmark

基准LingBot 成绩对照
GM-100(上交大真机基准,generalist 设定,AgileX Cobot Magic)VLA 2.0:66.2 / 34.4(进度分 / 成功率)π0.5:59.1 / 32.2;GR00T N1.7:36.3 / 17.8
GM-100(星海图 R1 Pro)VLA 2.0:34.6 / 15.6π0.5:27.4 / 8.9;GR00T N1.7:16.4 / 5.6
RoboTwin 2.0VLA 2.0:Clean 93.52% / Randomized 92.80%;VA 2.0 平均 93.6%(clean→random 仅掉 0.4pt)π0.5:82.74% / 76.76%
LIBEROVA 1.0 平均 98.5%π0.5 96.9%;X-VLA 98.1%;OpenVLA 76.5%

未查到 SimplerEnv、CALVIN、VLABench 的官方成绩。

5.2 第三方独立评测(本报告最有价值的反面证据)

华为加拿大团队论文 《Do World Action Models Generalize Better than VLAs?》(arXiv:2603.22078) 独立评测了 LingBot-VA:

  • 正面:在 RoboTwin 2.0-Plus 扰动基准上,WAM 路线确有优势——LingBot-VA 74.2% vs π0.5 58.6%;噪声扰动下达 80.9%
  • 负面 1|几何泛化弱:相机视角变化仅 28.9%,机器人初始状态变化 36.2%
  • 负面 2|推理极慢:LingBot-VA 每动作块最高 5230 ms,比 π0.5 的 63 ms 慢约 83 倍

这条证据的价值在于:它既独立验证了灵波”世界动作模型鲁棒性更强”的核心主张,也解释了 VA 2.0 为何把 6.5 倍加速当成头号卖点——1.0 的实用性此前受到实证质疑,2.0 是针对性回应

5.3 LingBot 已成为学界基线

多篇第三方论文以 LingBot 为基线或攻击对象:DiM-WAM 称把 LingBot-VA 某基准从 28.4% 提到 69.8%(2606.27677);Next Forcing 称相对提升 93.1%(2606.11187);JailWAM 称对 LingBot-VA 越狱成功率 84.2%(2604.05498);机制可解释性研究指其”可操纵性较弱”(2607.14943);DreamX-World 1.0 称综合得分超过 LingBot-World(2606.16993)。

这些数字来自竞争/攻击方,口径各异不宜横向对比,但足以说明:LingBot 已被学界当作必须对标的基线,同时也在被持续挑战。 这本身是影响力的证明。

5.4 开源资产的真实结构

GitHub 组织为独立组织 github.com/Robbyant(不在 antgroup 下),另有 HuggingFace 与 ModelScope 镜像。2026-08-05 实测 Star:

仓库Star占比
lingbot-map16,18954.9%
lingbot-world4,33414.7%
lingbot-va1,7305.9%
lingbot-vla1,7195.8%
lingbot-depth1,5525.3%
lingbot-world-v21,4745.0%
lingbot-video9053.1%
lingbot-vision8953.0%
lingbot-vla-v27112.4%
合计≈29,509100%

两点必须注明

  1. Star 高度集中且错配lingbot-map 一个仓库占 55%,而它是流式 3D 重建(偏 CV 通用工具,非具身大脑);真正的旗舰 VLA 基座仅 711 star。“全系列近 3 万 Star、为国内第二名 2.7 倍”属实,但结构性偏斜明显,且”第二名”的统计口径来源未公开。
  2. 协议不统一:多数仓库为 Apache-2.0,但 lingbot-world-v2CC BY-NC-SA 4.0(禁商用),多个权重仍是 TODO。“六款模型全面开源”需打折扣。

六、产品与落地:严格按成熟度分级

6.1 Robbyant R1(第一代自研本体)

  • 发布:2025-09-11 上海外滩大会(9-06 已在柏林 IFA 亮相),演示”机器人厨师”,宣称支持 1 万种菜谱、1000 种茶饮
  • 参数(外滩大会现场官方口径):轮式双臂人形,110 kg,身高 1.6–1.75 m,34 自由度,移动速度 < 1.5 m/s
  • 交付:现场工作人员称”已量产并交付客户,包括上海市历史博物馆”;不单卖整机,打包进场景解决方案销售。官方未公布售价
  • 后续巡展:杭州未来生活节、湖北文旅博览会导览、杭州西湖区社区服务中心健康咨询试点(1 台)

6.2 Robbyant R2(第二代,WAIC 2026 首发)

  • 双臂移动操作平台,整机 < 120 kg,单臂额定负载 6 kg,作业范围从地面到 2 米高货架
  • 全向舵轮底盘,设计方称是行业首个可通过 600 mm 超窄通道的室内轮式人形
  • 关节力矩反馈 + 末端六轴力传感 + 柔顺抓取;急停时核心关节抱闸
  • 双电池可换,约 4 小时续航,选配自动回充坞
  • 传感:禾赛 JT 系列迷你超半球 3D 激光雷达 + 奥比中光 Gemini 330 系列深度相机
  • ⚠️ 成熟度冲突:官网产品页标注 “Coming Soon”,而工业设计团队 Behance 页称”已进入量产”。建议按”已发布、量产状态未经公司正式确认”处理

6.3 智慧药房——唯一可确认的真实商业运营

这是全报告最需要精确表述的部分。

  • 地点上海浦东东靖路国大药房门店,1 家(国药控股旗下连锁)
  • 时间:潮新闻记者 2026-07-18 实地探访,店内药师称机器人”这个月刚刚入职”
  • 流程:接收美团/饿了么/国大 App 线上订单 → 识别药品 → 自主导航至货架 → 抓取 → 送回柜台篮筐;药师负责核对、处方审核、追溯码扫描、用药交代
  • 硬件左手吸盘(吸盒装药)+ 右手夹爪(夹瓶装/袋装),可处理 150 种以上不同尺寸材质药盒;门店未做任何货架/通道改造
  • 实测效率:单笔订单从提示音到药品放置全程不到 3 分钟。核心价值场景是夜间单人值班
  • ⚠️ 广泛误传的”90 秒”:指 WAIC 展台演示的”问诊咨询—购药—处方流转—智能取药—打包”完整链路耗时,不是门店实测取药时长,两者不可混用
  • 未查到官方披露的分拣成功率

扩张计划(前瞻表述,非既成事实):记者转述规划为”今年至少 20–50 家门店,明年可能 200–300 家”;但朱兴本人表态”数量方面不会太激进”,因跨门店存在流程改造、店员培训、人机磨合,“需要比较长的部署、交付周期”。两者存在张力。

场景撞车提示:穹彻智能(卢策吾)已在连锁药房完成 3000+ SKU 方案部署验证,宣称无需大规模改造。药房不是蓝海。

6.4 全部场景的成熟度分级

场景合作方成熟度
零售药房国大药房真实门店运营(1 家)
物流分拣乐聚 + 辉羲智能 + OpenLET商业化测试
工业操作钛虎、隆盛商业化测试
博物馆导览上海市历史博物馆已交付(现场员工口径,未见后续验证)
社区健康咨询杭州西湖区社区服务中心试点(1 台)
餐饮/炒菜展会演示
国风文创店、未来实验室WAIC 展台演示
家庭服务愿景(朱兴:“今天的技术确实做不到”)

乐聚物流分拣的关键陷阱:宣传稿中”纸箱拆垛连续 8 小时作业、综合成功率超 95%“明确标注为”乐聚自研解决方案""建立在乐聚自研技术体系之上”,不能归功于 LingBot。LingBot 的贡献是”物流场景适配仅需 150–300 条真机数据、开发周期缩短至数天”。

6.5 WAIC 2026 展台的准确表述

上海世博展览馆 H3-B302 / H1-C701,三台异构机器人由 LingBot-VLA 2.0 驱动,随机接单自主分工,完成订单接收 → 智能分拣 → 商品交付闭环。

⚠️ 第三台机器人品牌存在信源冲突:蚂蚁官方通稿与甲子光年写”星尘智能”,经济日报、潮新闻、21 世纪、中国经营报均写”星海图”。另两台为乐聚与灵波自研 R-2。建议以蚂蚁官方通稿为准并注明分歧。


七、生态与”一脑多机”的真实验证程度

7.1 合作伙伴全景

类别伙伴合作内容
本体乐聚机器人(2026-03-16 战略合作,提供近万小时高质量多模态真机数据;KUAVO 4 Pro 是官网唯一列出的第三方平台)、钛虎机器人模型-本体联合方案
传感器奥比中光(Gemini 330 深度相机供货;共建 EGO RGB-D 无本体数采设备,2026-07-07 发布)、禾赛科技(JT 系列激光雷达上 R2)感知硬件 + 数采
芯片地瓜机器人旭日 S600、NVIDIA Jetson Thor / Orin端侧推理适配
数据简智科技(Genzhi Robotics)标准化数据体系
行业客户国大药房、隆盛场景落地
算力/社区辉羲智能、OpenLET 开源社区(70+ 校企、万名开发者)国产算力 + 生态

7.2 17 个品牌的完整名单

仅见于官方英文技术博客(中文稿从未完整列出):

乐聚 Leju、智元 AgiBot、星尘智能 Stardust、宇树 Unitree、松灵 AgileX、星海图 Galaxea、银河通用 Galbot、睿尔曼 RealMan、Franka、方舟无限 ARX、北京人形机器人创新中心、傅利叶 Fourier、魔法原子 MagicLab、千寻智能 Qianxun、Zerith、非夕 Flexiv、青龙 Qinglong

7.3 关键区分:预训练适配 ≠ 实机验证

官方措辞是”预训练阶段实现适配”——即 20 种构型的数据进入了预训练数据集,不等于 20 种本体都做过实机部署验证

有公开实机对比测试记录的仅两组:

  • GM-100 基准:松灵 Cobot Magic + 星海图 R1 Pro 双臂平台,对比 π0.5、GR00T N1.7
  • 移动操作:方舟机械臂 + 松灵底盘、星尘 S1 绳驱轮式人形,对比 π0.5

第三方质疑(值得保留):有行业长文批评灵波”从未回答跨本体的可验证指标”——新本体接入要几天还是几个月?需要 100 条还是 1 万条数据?是否重训主干?成功率能保留多少?哪些能力可零样本迁移?其结论是:若只能通过上层 SDK 调用,“这不是通用大脑,而是多个定制项目共享了部分模型参数”。

目前未查到第三方开发者公开的复现结果或独立跑分。


八、组织、人才与资本

8.1 两位核心人物

CEO 朱兴(花名陶斋,1985 年生) 2011 年入阿里 → 支付宝资深技术专家 → 口碑首席技术架构师 → 饿了么高级技术副总裁兼蜂鸟物流 CTO → 支付宝广告事业部总经理(2023 年 0→1 建广告商业化)→ 2024 年底筹建灵波。无机器人行业背景,被解读为”产品化 + 商业化”角色。

关键判断:

  • “大脑是制约行业最关键的瓶颈……机器人能唱歌跳舞,但不能干活”
  • 具身智能与自动驾驶类似、长周期,2026 年才会出现特定场景小规模商业试点
  • “数据起不来,无论是规模、质量还是分布,模型架构都是空中楼阁”
  • 成功率优先于速度:“机器人动作再快,若连续失败几次,企业仍需安排人员接管,部署便难以产生经济价值”

首席科学家沈宇军(Damon,1994 年生) 清华电子工程系本科(兼修管理学第二学位)→ 香港中文大学信息工程系博士(HKPFS)→ Google、Facebook Reality Lab 实习 → 字节跳动高级研究员(2021.03–2022.04)→ 2022.04 加入蚂蚁 → 2024.11 任灵波首席科学家,同时仍领导蚂蚁技术研究院交互智能实验室。论文百余篇,引用逾万,h-index 44。

细节冲突:百度百科称师从汤晓鸥;另有报道称在港中文 MMLab 由汤晓鸥与周博磊共同指导。与上海 AI Lab 无公开关联。

公开表述:“具身智能还在 GPT-1 时刻”;“不用太纠结技术路线,现在整个具身大脑非常不成熟,要解决的问题还有很多”;个人预判行业拐点约在 2028 年

未查到除朱兴、沈宇军外的公开高管名单,工商登记主要人员仅朱兴(董事)与李彩丽(财务负责人)。也未查到”外部挖角知名研究员”的具体报道。

8.2 在蚂蚁体系中的位置

蚂蚁把 AGI 战略拆为两半:

  • 数字智能:百灵大模型、AI 支付宝、蚂蚁阿福、AQ
  • 物理智能蚂蚁灵波(核心执行主体)

灵波挂 CTO(何征宇)线下,与百灵、支付宝 AI 平行,并纳入蚂蚁开源品牌 inclusionAI 体系对外亮相。

蚂蚁物理 AI 全景

  • 自研:灵波(LingBot 大脑 + R1/R2 本体)
  • 投资:星海图(2024.11 Pre-A 领投、2025 A 轮参投)、星尘智能(2025.04)、宇树科技(2025.06 C 轮领投之一)、钛虎机器人、灵心巧手(2025.07)、大晓无限机器人(2026.05)、极智嘉(约 4.93%)。英文媒体称累计战略投资 12 家机器人公司(二手汇总,未见逐一名单)
  • 合资:上海造父智能科技(L4 自动驾驶,与哈啰、宁德时代三方首期合计出资超 30 亿元)

注意这层微妙关系:蚂蚁既投资宇树、星海图,灵波又把它们列为”适配的本体品牌” ——资本纽带在一定程度上稳固了数据供给,但并不排他。

8.3 融资:确认的与未确认的

已确认:2026-08-03 蓝鲸独家披露 → 公司统一回应”确实在跟投资人接触,作为蚂蚁在具身领域的核心布局,将持续聚焦通用机器人大脑”。21 世纪经济报道指出,“核心布局”是蚂蚁首次使用该措辞(此前为”关键落子/重要尝试”)。

项目状态
金额拟募 15 亿元(约 2.22 亿美元),目标 2026 年底完成二轮
完成度仅”启动/拟募”,尚未完成(个别英文标题写 “raises” 属表述不准确)
领投方未披露。仅有”融资启动前已有机构主动接触""WAIC 展台有投资人当场表态”等未具名说法
估值传闻”独角兽往上的级别”,无具体数字
蚂蚁累计投入公司口径”已超一线创业公司的融资额”,无数字
股权工商仍为蚂蚁 100% 独资,未见变更登记
员工期权未查到任何报道(可参照蚂蚁数科重组时设员工期权的先例)

分拆动因(各方解释)

  1. 内部算力预算挤压(知情人士,未证实):2025 年蚂蚁研发投入 350.3 亿元、净利约 153 亿元(同比减少 230 亿元);蚂蚁副总裁周俊称万亿参数模型”每运行 15 分钟消耗一辆特斯拉的费用”
  2. 窗口期抢筹:具身赛道正处融资高峰
  3. 对标溢价:媒体以 PI、Skild 的高估值作类比
  4. 市场化机制、外部资源导入、为独立资本运作预留空间

SCMP 报道称灵波是蚂蚁第四个寻求独立融资的单元(前三为 Ant International、OceanBase、蚂蚁数科)。


九、行业坐标

9.1 赛道分层与资金流向

层级逻辑代表2026H1 融资占比*
大脑派模型跨本体复用,赌”机器人操作系统”蚂蚁灵波、千寻智能、自变量、原力灵机;海外 PI / Skild> 50%(约 222 亿)
本体派出货量 + 成本控制宇树、傅利叶、星尘、乐聚12.8%
全栈派软硬协同闭环智元、星海图、银河通用、智平方、它石智航与大脑合计约 70%
零部件派灵巧手、传感器、关节、端侧芯片灵心巧手、仙工智能14.4%
数采仿真派数据即燃料诺亦腾、极佳视界、库帕思大脑内部占 20%

* 量子位口径(截至 2026-06-12,总额 438 亿元)。

⚠️ 口径严重冲突:IT桔子口径为 935 亿元 / 322 起,且称本体企业获 315 亿、具身模型与软件 145 亿——与”大脑派占一半”的结论相反。差异应源于对”全栈公司”的归类。引用时必须双列。

9.2 海外对标

公司代表模型融资/估值商业模式
Physical Intelligenceπ0 → π0.5 → π*0.6 → π0.7(2026-04);MEM 长短期记忆已确认:2025-11 B 轮 6 亿美元 @56 亿美元,累计约 10.7 亿美元。传闻:洽谈 10 亿 @110 亿美元(2026-03 Bloomberg/The Information,截至 7 月无关闭证据纯软件、不做本体。已公开客户:Weave Robotics(叠衣,自主率 92%)、Ultra Robotics(电商打包,96.4% 自主率、165 件/小时)、Robot.com(约 500 台)
Skild AISkild Brain(omni-bodied)已确认:2026-01 C 轮 14 亿美元 @超 140 亿美元,软银领投,英伟达/贝索斯/三星/LG 跟投,累计约 20 亿美元2025 年营收 0 → 数千万美元(自述);客户含 LaGuardia 机场、LG CNS、英伟达休斯顿工厂
Google DeepMindGemini Robotics 1.5/2 + Robotics-ER大厂内部不卖本体只卖大脑;ER 已上 Gemini API 全量开放,VLA 限早期伙伴
NVIDIAGR00T N1.7(开放权重+商业许可)、N2/DreamZero、Cosmos 3大厂模型免费,卖 GPU 与 Physical AI 全栈;同时投资 PI、Skild、Figure
Figure AIHelix(S2 7B + S1 80M@200Hz)→ Helix 02(加 1kHz S0 反射层)2025-09 C 轮超 10 亿美元 @390 亿美元垂直一体化,闭源,只跑自家本体

对灵波的含义:路线与 PI/Skild 最同构,但走了第三条路——PI 用”伙伴部署数据”换飞轮,Skild 用”资本 + 大客户”换规模,灵波用”全栈开源”换生态位。估值量级上仍不在一个数量级。

9.3 国内主要竞争者

公司路线代表模型融资/估值落地
智元机器人全栈(分层)GO-1、WITA Omni、AgiBot World 数据集估值 150–200 亿+,2026-07 启动港股 IPO2025 营收 10.5 亿;累计下线破万台;龙旗近千台代工订单
宇树科技本体UnifoLM 系列科创板过会,发行估值约 420 亿2025 营收 16.99 亿、扣非净利 5.9 亿(行业唯一明确盈利);出货 5500+ 台;但科教客户占人形收入 73.6%
银河通用仿真数据 + 本体GraspVLA、TrackVLA、AstraBrain累计约 70 亿,大基金三期首次出手太空舱 20+ 城超 100 台;进宁德时代 7×24
自变量机器人端到端统一(反分层)WALL-A → WALL-B2 个月四轮,投后超 200 亿;美团/小米/阿里/字节四大厂分别领投叠衣、收纳、外卖最后 100 米
星海图”一脑多形”平台EFM-1、G0 开源 VLA、GOD 数据集2 个月 30 亿,估值 200 亿+R1 系列 19.9 万起,服务 150+ 机构
千寻智能全身力控 + 端到端Spirit v1.53 个多月约 45–50 亿,估值 200 亿Moz1 进宁德时代产线
它石智航反 VLA 统一模型AWE 3.0单轮 4.55 亿美元(中国纪录),投后约 150 亿汽车线束装配,天海电子规模化部署
智平方类脑三层 VLAAlphaBrain、GOVLA一年 12 轮,2026-06 近 50 亿惠科 3 年 1000 台、近 5 亿元订单
穹彻智能力与接触 + 世界模型未查到连锁药房 3000+ SKU 已部署验证(与灵波正面撞车)

9.4 大厂格局

  • 阿里系(灵波之外):达摩院 RynnBrain(含行业首个 30B MoE 具身模型)、通义 Qwen-Robot、高德独立具身业务部(ABot 架构 + 四足”途途”)。至少四条具身线并行,未见统一协同
  • 华为:做大脑 + 基础设施(华为云 CloudRobo),不做本体;投资千寻、极佳视界
  • 腾讯:最明确不做本体,Robotics X 的 Tairos 平台 + 开源混元具身大模型;自称”钛螺丝”
  • 百度:数据 + 模型 + 云;投智平方 10 亿、北京人形创新中心 7 亿
  • 字节自研模型 + 自研本体双线,Seed GR-3(4B MoT)+ ByteMini;2025-07 已累计量产超千台
  • 京东:最重产业押注——80+ RoboBase 基地,5 年采购 300 万台机器人,两年采集 1000 万小时人类视频
  • 美团:纯投资 + 无人配送

9.5 三个关键行业争议

① 大脑 vs 本体谁更值钱——未决

挺大脑:本体门槛快速下降(宇树 R1 降至 2.99 万),大脑边际成本递减、可跨硬件复制。 挺本体:具身是”知行合一、软硬一体”,软件优势无法弥补硬件工程化短板;出货量可验证,模型能力不可观测。 冷水数据:仙工智能招股书显示,控制器 + 软件毛利率虽高,但 2025 年收入仅 0.85 亿(占 19.3%),低毛利整机反占 67.9%——第三方”大脑”厂商的普遍困境是高毛利撑不起营收

② 技术路线远未收敛——三派对峙

  • 分层架构派(阵营最大):Figure Helix、NVIDIA GR00T、Gemini Robotics、智元 GO-1、银河星脑
  • 统一模型派:它石智航 AWE、自变量 WALL、Skild
  • 场景倒推派:只推演 2–3 秒(消融显示推演 2 秒 82.8→87.3,4 秒仅至 87.9,边际收益迅速收窄)

灵波的位置比较特殊:VLA(LingBot-VLA)与世界动作模型(LingBot-VA)双线并行,相当于同时下注两条路线。

③ 数据瓶颈是全行业唯一真共识

  • 一个合格通用大脑至少需千万小时级高质量真实交互数据,而截至 2026 年初全球合规可用机器人数据仅约 50 万小时,缺口超 99%
  • 智元姚卯青(WAIC):互联网视频缺少接触丰富的推拉拧拽、柔性物体、摩擦力、流体交互;可能需”亿小时”量级真实数据
  • 成本参照:OpenVLA 主训练约 23,040 A100 小时,而基于开源底座做场景后训练仅需 192–384 GPU 小时——便宜两个数量级,这正是”大脑满天飞”的成本根源

④ 泡沫论已出现,但未反映在融资数据上

质疑方:光速光合曹巍称”2026 年是投资核心分水岭”,工业客户只看回本周期、系统鲁棒性、任务完成率;机构尽调开始现场临时改变物体位置以验证是否依赖遥操作;高盛预测 2027 年全球人形出货仅约 7.6 万台,慢于市场预期。

反面事实:融资节奏未放缓,头部集中度极高(TOP20 拿走约 59%),百亿估值公司从 2025 年 3 家增至 2026H1 的 20+ 家。

结论:是”结构性泡沫 + 头部虹吸”,而非全面降温。 最被低估的风险是评测标准缺失——没有统一测试环境与披露要求,各家自选本体、自选任务宣称 SOTA,外界无法判断真实人工接管率。


十、独立判断

10.1 真实成立的优势

  1. 开源生态位领先,且是可验证的硬指标——国内大脑派中唯一具备”开发者事实标准”潜质的资产
  2. 跨本体适配广度国内第一:17 品牌 20+ 构型进入预训练,55 维统一动作空间是扎实的工程基础;下游宣称 80 条演示数据即可迁移。PI 和 Skild 都未公开对标数字
  3. 模型体系完整度罕见:从深度补全到世界动作模型的全栈,且 VLA + WAM 双线对冲
  4. 数据工程透明度高于同行:公开”9 万小时清洗出 5 万小时”的比例,这在行业内少见
  5. 场景选得聪明:朱兴自述选药房是因为”操作泛化性、环境复杂度、与人交流的安全性难度都高于工业物流”——用难场景牵引模型,而非用易场景刷收入。且药房/零售天然接支付宝线下商户网络与蚂蚁医疗资源
  6. 有第三方硬件厂商背书:LingBot-Depth 2.0 经奥比中光实验室认证并将进入 Gemini 330 SDK,这是少数”被别人拿去卖”的模型

10.2 真实存在的风险

  1. 数据供给”借鸡生蛋”,结构性脆弱(最致命) 灵波的真机数据主要来自宇树、乐聚、星海图、智元等生态伙伴,而这些厂商各自都在自研大脑(UnifoLM / GO-1 / AstraBrain)。这与 PI 有本质差异:PI 的伙伴是纯应用商,不自研大脑;灵波的伙伴都自研大脑。 一旦本体厂认真做起来,燃料随时可能收紧。

  2. 开源不构成护城河 开源在标准未定型期能最快建生态,但可被复制。Star 数是影响力指标,不是收入指标。若头部本体厂的自研大脑做得更好,没有理由继续用灵波。

  3. 本体立场是模糊的中间态 既没有 PI/Skild 那样纯粹的软件叙事,也没有宇树/智元那样的量产能力。R1 出货有限,更像”验证模型的载体”。在硬件工程、供应链、量产上无法与积累数年的本体厂竞争。

  4. 商业化完全未验证 官方口径是”推进商业化测试”;朱兴自己承认跨门店复制”数量方面不会太激进”。没有任何公开的合同金额、客户数、续约率、单任务毛利数据。 对照 Skild(2025 营收 0→数千万美元)、智平方(惠科近 5 亿元订单),灵波在”可验证收入”这栏是空白。一个旁证:奥比中光在投资者互动平台明确表示”相关合作的商业变现仍处于早期,场景收入及盈利贡献存在不确定性”。

  5. 场景正面撞车:药房不是蓝海,穹彻智能已完成 3000+ SKU 部署验证

  6. 内部与阿里系资源挤压:灵波在蚂蚁内需与百灵、支付宝 AI 争算力;阿里系至少四条具身线各自为战。独立融资的动因之一正是资源挤压,这本身说明大厂资源并非无限

  7. 人才吸引力偏弱:CEO 无机器人行业背景;在与智元(稚晖君)、银河通用(王鹤)、穹彻(卢策吾)、它石(丁文超)这类”技术领袖 IP”型公司抢人时,主要靠蚂蚁的资源与稳定性而非创始人号召力

10.3 定位结论

在国内竞争坐标中:

  • 模型体系完整度与开源影响力:第一梯队
  • 跨本体适配广度:领先
  • 估值/融资量级、可验证收入、数据自主权、量产交付:第二梯队甚至更后

真正决定成败的单一变量:能否在生态伙伴自研大脑成熟之前,把”药房 → 零售 → 物流”跑成一个能自我造血的数据飞轮。若能,蚂蚁的线下商户网络与医疗资源是国内任何创业公司都复制不了的护城河;若不能,近 3 万 Star 会迅速贬值为一项营销资产。

正如业内一句评价:“资本才有可能分辨清楚——哪些是数据飞轮,哪些只是营销飞轮。“


十一、后续观察指标清单

建议按以下六个信号跟踪灵波,它们比任何 benchmark 都更能说明问题:

  1. 门店数:药房从 1 家到 20 家的实际用时,以及是否出现第二个连锁客户
  2. 收入首次披露:任何合同金额、订单量或收入数字的首次公开
  3. 融资落地:15 亿元是否按期关闭、领投方身份(产业资本 vs 财务投资人 vs 地方基金,含义完全不同)
  4. 跨本体的可验证指标:官方是否首次公布”新本体接入耗时 / 所需数据量 / 是否重训主干 / 零样本迁移能力边界”
  5. 数据供给关系变化:宇树、智元、乐聚等是否收紧数据合作,或反向宣布自研大脑替代
  6. lingbot-vla-v2 的 Star 与 fork 增长:这才是核心资产的真实开发者热度,比全系列总 Star 更有信息量

十二、信息可信度提示

本报告在研究过程中发现以下需要读者注意的信息质量问题:

  1. 大量中文报道属同一份蚂蚁官方通稿的转发(经济日报、新华上海、潮新闻、中国经营报措辞高度雷同),独立信源实际很少。真正的独立现场核实只有潮新闻的东靖路门店探班一篇。
  2. 行业融资总额存在两套相互矛盾的口径(量子位 438 亿 vs IT桔子 935 亿),且对”本体派占比”给出相反结论。
  3. Physical Intelligence 110 亿美元估值属”洽谈中”传闻,截至 2026 年 7 月无确认关闭的公开证据,部分数据平台已按已完成轮次记入。
  4. “90 秒问诊到取药""8 小时 95% 拆垛成功率”等广泛传播的数字均存在归属错误,已在正文中逐一澄清。
  5. AI 聚合数据库(robolist.ai、robothub、theresanaiforthat)的 R1/R2 参数与售价多处明显错误,不应作为事实来源。
  6. 所有”全球首个/全球首创/超越 π0.5”类表述均为公司自述——行业目前不存在公认的横向评测标准,这是所有性能宣称的共同折扣项。
  7. WAIC 展台第三台机器人的品牌(星尘 vs 星海图)在官方通稿与主流媒体之间存在冲突,尚未有澄清。

明确未查到的信息:本轮融资领投方与估值数字;蚂蚁累计投入的具体金额;灵波员工持股/期权安排;“灵波/Robbyant”命名的官方释义;灵波对外投资的 2 家企业名称;除朱兴与沈宇军外的高管名单;LingBot-VA 与 LingBot-Map 的官方参数量;灵波的任何收入数据、客户数、R1 出货量。


主要信源

官方

论文

媒体(关键报道)

工商与第三方数据