深度研究 · 综合综述 · 2026 年 7 月

具身智能 Embodied Intelligence
从"会思考"到"能行动"的范式跃迁

具身智能是人工智能通过物理本体与环境实时交互,实现感知、认知、决策与行动一体化的智能系统。它被视为继生成式 AI 之后人工智能走向物理世界的下一个浪潮(NVIDIA 称之为 "Physical AI")。本文系统梳理其定义内核、演进脉络、技术架构、代表模型、产业格局、应用挑战与未来趋势。

📅 整理时间:2026-07-29
🗂 覆盖范围:2018–2026
🌐 数据来源:公开报道 / 研报 / 学术论文
📌 关键词:VLA · 世界模型 · Sim2Real · 人形机器人
00

执行摘要

Executive Summary
2025
被业界公认为
"具身智能元年"
1.7万台
2025 全球人形机器人出货
中国企业占 84.7%
100万台
工信部 2027 年
整机年产量目标
4000亿
2030 年产业规模预测
(2035 年破万亿)
一句话概览:具身智能正从"实验室单点演示"跨入"系统落地与商业化验证"的关键期。技术内核由 VLA(视觉-语言-动作)大模型与世界模型双轮驱动,产业格局呈现 "中国主导量产、海外领跑前沿模型" 的双轨态势——2025 年全球人形机器人出货约 1.7 万台,中国占比超八成;而世界顶级通用机器人基础模型(π₀、Gemini Robotics、GR00T)多源自美欧实验室。核心矛盾已从"有无能力"转向"能否降本增效、安全可量化地规模化"。
01

什么是具身智能

Definition & Core Concepts

具身智能(Embodied Intelligence)是指智能体(机器人、无人机、智能汽车、环境嵌入式系统等)通过物理实体与环境实时交互,实现感知、认知、决策与行动一体化。其核心理念颠覆了传统人工智能的"离身性(disembodiment)"局限——智能的本质必须通过身体与环境的动态互动来塑造和体现。

离身智能 vs 具身智能

以 ChatGPT 为代表的"软件智能体"停留在数字世界,处理文字/图像/代码;具身智能则必须应对连续、嘈杂、不可逆的物理世界——机械臂打翻玻璃无法"撤回重力"。

符号推理感知-行动闭环物理交互

落地问题(Grounding Problem)

大语言模型只在文本统计意义上理解"抓取";具身智能必须把它转译为精确的关节角度、力度与视觉轨迹序列——既不能捏碎、也不能滑落。这只能通过"具身数据"(真实机器人执行真实任务)来弥合。

语义→动作力控具身数据

"大脑 + 小脑"协同架构

当前主流范式分两层:"大脑"(决策/认知)基于 VLM/LLM 负责语义理解、任务分解与规划;"小脑"(控制/执行)负责高频运动控制与力觉柔顺。端到端 VLA 模型则试图把二者合并为一个统一网络。

👁 多模态感知

视觉 / 力觉 / 触觉 / 听觉

🧠 认知与决策

VLM/LLM · 任务分解 · 世界模型推演

💪 运动与执行

全身协同控制 · 灵巧操作 · 柔顺力控

↺

环境反馈(成功/失败、力觉、碰撞)→ 持续在线学习 → 跨场景泛化与自主进化

感知接口 认知决策 运动执行
02

发展脉络与里程碑

Evolution & Milestones

具身智能的思想可追溯到哲学与认知科学,技术落地则经历"行为主义 → 强化学习/仿真 → 大模型开智 → 基础模型 → 规模化"五个阶段。

50
哲学萌芽

1950 图灵提出"机器能否思考"

图灵在《计算机器与智能》中预示智能体可通过物理交互理解世界;1986 年 Rodney Brooks 提出"包容架构(Subsumption)",主张"感知—行动"闭环,成为具身智能奠基理念(成吉思六足机器人即典型)。

12
RL 与仿真

2012–2016 强化学习与仿真平台

MuJoCo(2012)、Atlas 首秀 DARPA 挑战赛(2013)、OpenAI Gym(2016) 相继问世,业界追问"机器如何从与物理世界的交互中自己学会控制自己";但 RL 样本效率极低,真机需数万次试错。

22
大模型开智

2022 语言模型为机器人"还魂"

Google 发布 SayCan(PaLM + 机器人低层技能),让机器人"听懂指令、理解任务分解";年底 ChatGPT 发布,证实 LLM 封装了海量世界常识,正是机器人苦学未得的高层规划能力。

23
基础模型时代

2023 RT-1 / RT-2 —— 首个 VLA 范式

Google DeepMind 于 7 月发布 RT-2(550 亿参数),首次把机器人动作当作语言 token 直接生成,证明 VLM 语义知识可迁移到未见过的操作任务。同年斯坦福 Mobile ALOHA 以低成本遥操作学会炒菜、收拾餐桌。

24
开放与 democratize

2024 OpenVLA / Octo / π₀

斯坦福-伯克利 OpenVLA(75 亿参数,基于 Open X-Embodiment 数据集)以小博大,在 29 项任务上击败 8 倍大的 RT-2-X;Octo 走"普及型通用策略";年底 Physical Intelligence 发布 π₀(flow matching,50Hz 连续控制)。

25
规模化元年

2025 通用基础模型"大厂竞赛"

Google Gemini Robotics(3月,fork Gemini 2.0)、NVIDIA GR00T N1(GTC,双系统架构)、Figure Helix、智元 GO-1、宇树 WVLA 2.0 相继落地;"具身智能"首次写入中国政府工作报告。中国多家人形机器人企业实现千台级量产。

26
商业化闭环

2026 从验证到落地

NVIDIA GR00T N1.6(CES)、π₀.5、Figure 03 / Helix 02(61 个连续动作完成洗碗机装载,替换原 10.9 万行 C++)、Atlas + Google DeepMind 战略合作;1X NEO 开启消费级交付;宇树/智元产能向万台级迈进。行业进入"规模化放量 + 商业化验证"关键年。

"基础模型时代的核心洞见,是停止把机器人当作孤立系统精心调教,而是借用语言与视觉领域一切可用的智识积累,以最小代价对接到物理世界。" —— 据 RT-1/RT-2 作者 Ted Xiao 复盘
03

核心技术栈

Core Technology Stack

3.1 VLA 模型架构(端到端)

📷 视觉编码器

ViT / DINOv2 / SigLIP
理解空间关系与语义

💬 语言编码器

文本 Transformer
跨注意力对齐视觉特征

🎯 动作头

关节角 / 末端位移 /
tokenized 动作块 / flow

→

统一网络:(图像, 语言) → 动作

泛化来自权重而非手写代码;跨物体 / 光照 / 表述均可迁移

动作表征有三种主流路线:离散 token 化(RT-2,复用 LLM 基础设施)、连续扩散/流匹配(π₀,50Hz 平滑轨迹,擅长折纸、玩牌等精细任务)、动作块(action chunking)降低时延与复合误差。

世界模型 World Model

让机器人在"脑内"推演动作后果,实现从"刺激—响应"到"推演式决策"的跃迁。

  • Meta V-JEPA 2:预判行为后果、按目标优劣排序
  • 北京人形 WoW、星动纪元 PAD(2024.9 全球首个视频+动作预测世界模型)
  • 达摩院 RynnWorld-Teleop:用生成式世界模型替代真机做"数字遥操作"

仿真与 Sim2Real

真机数据贵、规模小、泛化弱,是行业瓶颈。仿真合成数据成为共识解法。

  • NVIDIA Isaac Sim / Omniverse、Cosmos、Newton 物理引擎
  • 北京人形 ArtVIP:206 种高精度铰接物体数字资产弥合 Sim2Real
  • 浙江人形"仿真=高教、真机=职教、人类=筑基"三源数据体系

数据与采集飞轮

数据稀缺是最大瓶颈(特斯拉曾雇 40 人数月采集分拣数据)。

  • Open X-Embodiment、AgiBot World(百万级操作数据集开源)
  • 灵初智能:外骨骼手套把采集成本降至 1/10,Psi-W0 动作条件世界模型
  • 蚂蚁 LingBot-VLA:9 种双臂机器人 2 万+ 小时真机预训练

灵巧操作 Dexterous Manipulation

攻坚重点从"精准抓放"转向"复杂铰接物体操作"(抽屉、转椅、冰箱)。高自由度灵巧手、电子皮肤、类肤触觉传感器把本体从"刚性执行末端"推向"智能适应本体"。自修复材料实现损伤检测+定位+自愈。

软硬协同与端云架构

"大脑"上云、"小脑"端侧;大算力芯片(NVIDIA Jetson Thor、国产 DPU/端侧 AI 芯片)解决续航与实时推理。碳纤维/钛合金拓扑优化降重;半固态电池缓解"续航焦虑"。

04

代表模型与开源生态

Representative Models & Open-Source

2025–2026 年,通用机器人基础模型形成"大厂竞赛"格局。开源阵营分为四派:学院派(OpenVLA/Octo)、巨头生态派(GR00T/Gemini)、创业与中国力量(π₀/智元/宇树/星动纪元)、技术极致派。

模型机构规模 / 特点动作表征定位
RT-2Google DeepMind55B,首个大规模 VLA(2023.7)动作 token 化闭源
OpenVLAStanford / Berkeley7.5B,双视觉编码器+LLaMA,Open X-Embodiment动作 token 化开源
OctoBerkeley数千万参数,扩散策略,灵活可微调扩散开源
π₀ / π₀.5Physical Intelligence数十亿参数,50Hz 连续控制,擅长精细任务Flow Matching半开源
GR00T N1 → N1.6NVIDIA22 亿,双系统(VLM 慢思考 + DiT 快思考),全套 Isaac/Cosmos 生态扩散 Transformer开源
Gemini RoboticsGoogle DeepMindfork Gemini 2.0,端到端 VLA,跨本体泛化强端到端 VLA闭源
DOBOT-VLA越疆视+语+控融合,实景强化学习,ATOM 已量产VLA商业
X-VLA清华 AIR + 上海 AI 实验室刷新五大仿真基准,代码/数据/权重全公开VLA开源
Xiaomi-Robotics-0小米4.7 亿参数,MoT 混合架构(脑/小脑分离),消费级 GPU 可跑MoT开源
LingBot-VLA蚂蚁9 种双臂机器人 2 万+ 小时真机,"一脑控多机"跨形态商业
ERA-42 / GO-1 / WALL-A星动纪元 / 智元 / 自变量端到端具身大模型 + 世界模型融合路线VLA+WM商业
💡 "真开源 vs 假开源":π₀ 公开权重与推理代码,但完整训练流程与数万小时专有数据未公开——本质是"开源引流、闭源变现"。NVIDIA 不只给 GR00T 模型,还配套 Omniverse/Isaac Sim/Cosmos/Newton 整套工具链,构筑生态护城河。
05

主要玩家与产品

Key Players & Products
🌍 国际玩家
🇨🇳 中国玩家
📊 部署竞争力排行
公司 / 机器人代表产品技术路线 / 亮點部署进展
Tesla
Optimus
Gen 2 / Gen 3复用 FSD 自动驾驶"大脑",远期百万台产能目标试产→爬坡上海超级工厂产线已用;Gen3 计划 2026 下半年量产
Figure AI
Figure 02/03
Helix / Helix 02单一神经网络,像素输入直驱全身;Helix 02 以 61 连动完成洗碗机装载商用BMW 斯帕坦堡工厂部署约 11 个月;C 轮超 10 亿美元,估值近 400 亿
Boston Dynamics
Atlas (电动)
全电动 Atlas动态平衡与运动控制独步全球;自导航充电、自换电池商用现代 Hyundai Metaplant(2026.2);+Google DeepMind 整合 Gemini
Agility Robotics
Digit
DigitRaaS 模式,仓库"万能工";跨多独立客户同步部署商用Amazon / GXO / Toyota / Mercado Libre;2026.5 扩规模
1X Technologies
NEO
NEO / EVE遥操作→自主,专为家庭设计消费2026.1 首交付;$20,000 或 $499/月(唯一消费级落地)
Apptronik
Apollo
Apollo协作安全,适配标准工装夹具新兴面向区域合约制造商 / 电子装配
XPENG
IRON
IRON复用新能源车制造基础设施量产广州工厂内部部署(2025.1),2026.1 量产
NVIDIA / Google
基础模型
GR00T / Gemini平台化:"机器人界的安卓",提供大脑+工具链生态赋能第三方整机厂
公司代表产品路线 / 优势量产与订单
宇树 UnitreeG1 / H1 / R1极致成本控制,核心部件自研率超 90%全球第一2025 出货 5500+ 台(32.4%);R1-D 起售 2.69 万;进入东京羽田机场
智元 AgiBot远征 A2 / A2-W全栈,"一脑多机";GO-1 已上真机头部2025 出货 4000+ 台;2026.3 第 1 万台、6 月第 1.5 万台下线
银河通用Galbot S1具身重载,全球首个自主打网球机器人头部宁德时代产线连续作业 3 月+;A 轮超 3 亿美元,估值 200 亿
星动纪元ERA-42 / Q5端到端 ERA-42;PAD 世界模型;Q5 轮式服务新兴商场实训;2025 出货约 400 台
优必选 UBTECHWalker S2自主换电 + Co-Agent 群体协同工业比亚迪/吉利/蔚来等实训;2025 订单近 14 亿
傅利叶 FFTGR-3情感化交互,主动陪伴医疗计划交付数千台
越疆 DobotAtom / ATOM IIDOBOT-VLA,行走+动态平衡+精密装配商业深圳 K11 单日连续运营 14 小时
星海图 / 灵初 / 自变量G0 Plus / Psi / WALL-A开源数据 / 世界模型 / VLA+WM 融合模型派冲刺"大脑"软件层
🇨🇳 据赛迪《2025 人形机器人市场研究报告》:全球出货约 1.7 万台,中国企业约 1.44 万台占 84.7%,包揽全球前六。第一梯队(估值超 70 亿):宇树、智元、银河通用、星动纪元、星海图。

综合"部署 / 量产 / AI 成熟度 / 价格可及性"的人形机器人竞争力指数(HCRI,2026.6 快照,Axis Intelligence,仅供参考):

Figure AI
72.9
Agility Digit
70.7
Unitree
67.5
AgiBot 智元
66.0
BD Atlas
65.0
Apptronik
60.5
Tesla Opt.
47.5
1X NEO
47.0
Physical π₀
43.0
⚠️ 该指数显示:Figure AI 部署领先、非 Tesla(媒体报道热度与商业证据常成反比);Agility 媒体声量小但部署扎实;Physical Intelligence 的 π₀ AI 能力最强却是纯软件公司。排名仅反映单一机构口径,不代表绝对优劣。
06

市场与产业数据

Market & Industry Data
1.7万台
2025 全球人形机器人出货
(2024 仅约 3000 台,+508%)
25–40万
2026E 全球出货预测
(BotQ 产能爬坡)
200亿+
2025 中国行业融资额
(远超 2024 全年)
140家+
2025 国内整机企业数
(发布产品超 330 款)

2025 全球出货格局(按厂商)

宇树 Unitree
32.4%
智元 AgiBot
23.5%
乐聚 / 加速进化 / 松延
各≈5.9%
优必选 UBTECH
3.5%
其他 / 海外
≈余量

来源:赛迪《2025 年人形机器人市场研究报告》。中国厂商包揽全球前六。

市场规模预测(口径差异大)

  • 2025 实际硬件收入:约 49 亿美元(最可信的当前口径)
  • 2030:MarketandMarkets 约 153 亿美元
  • 2035:Goldman Sachs 约 380 亿美元(情景分析)
  • 2050:Morgan Stanley 约 5 万亿美元(若达智能手机级普及)
中国政策目标:工信部《人形机器人创新发展指导意见》提出 2027 年整机年产量 100 万台;国务院发展研究中心预判 2030 年产业规模 4000 亿元、2035 年破万亿。"十五五"将其列为六大未来产业之一。
07

应用场景

Application Scenarios

🏭 工业制造

绝对主战场。汽车总装、精密装配、物料搬运、质检。

  • 优必选 Walker S2 进比亚迪/吉利/蔚来
  • 智元远征 A2-W 富临精工近百台搬运
  • 千寻 Moz1 在宁德时代电池 PACK 线插接头

📦 仓储物流

SKU 多变、窄通道场景,人形比固定自动化更灵活。

  • Agility Digit 在 GXO/Toyota 分拣
  • Figure 在 BMW 包裹分拣
  • 银河通用 Galbot S1 重载搬运

🏥 医疗康养

远程手术、康复机器人、养老陪伴。

  • 5G 远程精准手术临床应用增长
  • 日本养老机构康复机器人普及
  • 傅利叶 GR-3 情感化主动陪伴

🛒 商超服务

导购、补货、咖啡制作、清洁。

  • 智平方 AlphaBot 商超咖啡/导购
  • 欧洲酒店服务机器人渗透率提升
  • 星动纪元 Q5 商场实训

🏠 家庭消费

从教育/陪伴走向真正家务。

  • 1X NEO 消费级交付(2026.1)
  • 松延"小布米"9998 元娱乐陪伴
  • 宇树 R1 翻跟头/倒立行走

⚡ 高危特种

电力、消防、巡检、应急救援。

  • 云深处机器狗电网巡检/防汛
  • 亿嘉和电力带电作业机器人
  • 四足机器人田间地头
💡 落地策略共识:不要一步到位追求通用机器人,而以场景为牵引——先从工业制造、物流、巡检等需求刚性、相对结构化的领域切入实现商业闭环,再逐步向复杂的民用/商用场景拓展。"部署即训练",千万次任务执行累积的数据反哺模型。
08

关键挑战

Key Challenges

① 数据稀缺

真机数据采集慢、贵、累。特斯拉曾雇 40 人数月采集分拣数据。缺乏数据是端到端具身大模型首要瓶颈,"有模型无数据也用不起来"。

② 跨域泛化

实验室训练后难直接迁移到真实工况;面对未见物体/光照/姿态的适应能力不足。需自我学习与演化能力。

③ Sim2Real 鸿沟

仿真与现实的校准误差、电缆下垂、夹具公差,使合成数据训练的技能在真机退化。高保真数字资产(ArtVIP)是解法之一。

④ 工业确定性

VLA 采样动作分布,循环间存在微变异;而汽车焊接等要求亚毫米级可重复。经典方法在确定性上仍占优,VLA 需补齐。

⑤ 安全与伦理

自主决策挑战传统责任体系;多模态采集涉及敏感隐私;就业替代压力。需分级分类治理 + 人类监督/主导分级授权。

⑥ 成本与续航

可靠性、能耗与全生命周期成本决定规模化分水岭。需降本(灵巧手已下探至 2999 元)、低功耗芯片、半固态电池缓解续航焦虑。

09

趋势与展望

Trends & Outlook

端到端 VLA 成主流

从"大脑+小脑"分层走向统一端到端网络,凭借广覆盖、低时延、高自主、强协同,向通用泛化演进。Gemini Robotics、DOBOT-VLA 已量产验证。

世界模型内嵌

感知交互从"刺激—响应"跃迁到"推演式决策"。V-JEPA2、WoW、PAD、VLAW(VLA+世界模型协同进化)成为竞争核心。

合成数据 / 数字遥操作

用生成式世界模型替代真机采集(RynnWorld-Teleop 达 40+FPS 实时),把数据从"硬件绑定"变"意图驱动、跨平台复用",破解成本瓶颈。

Scaling Law 进军物理

参数、数据、本体复杂度同时爆发。"当数据和模型都足够大,机器人能学到什么?"成为下一时代命题;但智平方郭彦东警示恐需指数级数据/能源。

开源生态与平台化

"机器人界的安卓"之争:NVIDIA GR00T、Google Gemini、OpenMind OM1、OpenVLA/Octo 共同推动跨硬件兼容与标准共建。

中国:制造+场景双优势

全球最完整产业链 + 海量真实场景。"真实场景落地价值才是关键"——部署即训练,数据飞轮反哺模型。2026 年行业加速洗牌,剩 10–20 家。

🔭 三阶段判断:2025"量产元年" → 2026"商业化闭环验证关键年" → 2027 起"场景深耕"。终局竞争关键在于:谁能率先在真实工况下实现可审计的安全与可量化的 ROI,推动产业从"样板间"走向"商品房",重塑制造业与服务业生产范式。
10

治理与伦理

Governance & Ethics

责任划分

自主决策挑战传统责任体系,高危场景缺乏统一标准。美国部分州与保险公司探索 AI 责任保险。

数据隐私

多模态采集涉大量敏感信息。欧盟《AI 法案》确立"知情同意+动态授权";美国推进机器人数据隐私立法。

分级分类治理

欧盟四档风险分级;美国监管沙盒;决策分"自主执行/人类监督/人类主导"三级。多方协同共治成型。

📜 中国已成立人形机器人与具身智能标准化技术委员会,推进数据格式、测试评价、训练平台标准;2025 世界人工智能大会围绕具身智能治理达成多项共识。治理模式趋向"分级分类、协同共治",实现技术创新与制度规范协同演进。
※

资料来源

References

本综述综合以下公开报道、研报与学术资源(2025–2026),关键事实与数据均标注来源机构;市场排名/指数为第三方机构口径,仅供研究参考。

  • 光明日报《竞合共进 规范先行:全球具身智能的发展与治理》(2026-03-19)
  • 新华网《看见2026|具身智能行业加速演进》(2026-01-16)
  • 人民网《把握全球技术演进态势 抢占具身智能发展先机》(2026-06-23)
  • 新华网《2025人工智能破壁时刻|人形机器人爆发元年》(2025-12-31)
  • 新华网《人工智能加速走进现实这一年》(2026-07)
  • 学习时报《何为"具身智能"》(2025-03-19)
  • CCF《具身智能——从智能感知到生态共生的进化》(通讯专题)
  • 钛媒体/硅谷101《机器人开源革命:"免费大脑"背后的四派力量》(2026-03)
  • Robotics Center《Physical AI in 2026: What It Is, Key Models, and How to Build It》
  • World Model & VLA 论文综述 (2018–2026, song2yu.github.io)
  • 赛迪《2025 年人形机器人市场研究报告》
  • Axis Intelligence《Humanoid Robot Statistics 2026》
  • Humanoid Applications《Deployment Report 2026》
  • 新京报《量产元年之后,中国人形机器人走向"价值战"》(2026-01)
  • 达摩院《RynnWorld-Teleop:数字遥操作》(开源)
  • 北京人形/浙江人形/灵初智能 等技术发布与访谈
⚠️ 说明:具身智能为高速演进领域,本文数据截至 2026 年 7 月。出货量、融资额、排名为各机构估算或企业披露,口径不一,请结合多方信源研判。本页为研究综述,不构成任何投资建议。