10 篇文章带有标签 “vla”

机器人的“安卓时刻”:具身智能爆发背后的5个颠覆性真相

引言:越过“莫拉维克悖论”的物理鸿沟

在硅谷的咖啡馆和波士顿的实验室里,一个共识正在变得震耳欲聋:2025-2026年将是具身智能(Embodied AI)与世界模型的爆发元年。

过去两年,大语言模型(LLM)向世界展示了“数字大脑”的极限。它们能写出惊世骇俗的论文,却在“莫拉维克悖论”(Moravec's Paradox)面前碰了壁——对人类而言极其困难的高智力任务(如微积分),AI手到擒来;但对人类而言本能级的物理感知(如在风中接住一片落叶),AI却举步维艰。

斯坦福教授李飞飞曾精辟地指出:“大语言模型是‘黑暗中的文字匠人’,能言善辩却脱离现实;而世界模型则是‘观察与行动者’。”从“数字脑”进化到“物理体”,这场关于机器人的“安卓时刻”并非简单的硬件改良,而是底层逻辑的彻底重构。以下是隐藏在具身智能浪潮背后的五个颠覆性## 真相。

真相一:“复仇者联盟”的奇袭——开源大脑为何能击败谷歌?

在机器人领域,规模(Scaling)并不是唯一的真理。2024年6月,开源模型 OpenVLA 的问世让业界大跌眼镜:这个仅有 70亿 参数的模型,在29项操作任务中的成功率竟然比拥有 550亿 参数的谷歌 DeepMind 旗舰模型 RT-2-X 高出了 16.5%。

这场胜利源于一种精妙的“三人小团队”架构:

  • DINOv2(眼睛A):负责理解复杂的空间几何关系。
  • SigLIP(眼睛B):专门负责抓取语义信息和物理常识。
  • Llama2(大脑):作为指挥官,将两双眼睛捕捉到的信息融合并进行逻辑推理。

腾讯具身智能全栈技术解析

WAIC 2026 腾讯 AI 应用创新论坛 · 首次系统性打通「感知—身体—行动」闭环

资料来源:腾讯官方发布稿、腾讯云开发者社区技术文章、Robotics X 实验室 & 福田实验室 & 腾讯混元联合发布内容(2026-07)

核心理念

腾讯首席科学家张正友提出:今天最聪明的人工智能本质是「缸中之脑」——善于逻辑、文本与问答,却缺少与物理世界直接互动的闭环。真正的智能要让 语言、视觉、空间认知、身体控制和环境反馈 在「感知—身体—行动」闭环里接受验证。

本次发布的五项成果,体现了腾讯「从离身走向具身、从分裂模块走向整体闭环」的探索思路:三个基座模型 + 一个智能体框架 + 一个 Always-on 智能体 + 升级的开源平台 + 云端 EaaS 服务。

一、全栈四层架构总览

整套方案贯穿四个层级,从下到上分别是 云底座 → 模型层 → 智能体框架层 → 平台层,最上层是零售导览、养老照护、工厂作业等真实应用,形成「数据/算力 → 模型 → 调度 → 本体 → 反馈」的完整链路。

graph TD
  A[应用层 · 真实场景落地<br/>零售导览/文旅导览/养老照护/工厂作业/按摩服务] --> B
  B[平台层 · Tairos 钛螺丝开放平台<br/>开源模型/智能体/工具 · RoboFusion · HAL · Isaac Sim 仿真] --> C
  C[智能体框架层 · TairosAgent + Apexio Always-on<br/>调度左右脑/大脑/小脑/身体 整合为闭环整体] --> D
  D[模型层 · 混元基座之上的具身模型矩阵<br/>VLM-1.0 右脑 / RxBrain-1.0 大脑 / VLA-0.5 小脑+身体] --> E
  E[云底座 · EaaS 三层体系<br/>算力底座 / 模型服务 / 感知交互]

云底座 EaaS 三层体系明细:

蚂蚁灵波(Robbyant)具身智能深度研究报告

研究对象:上海蚂蚁灵波科技有限公司(Shanghai Ant Lingbo Technology Co., Ltd.),对外品牌 Robbyant,模型系列 LingBot

方法说明:本报告基于公开信息(官网、arXiv、GitHub、工商登记、媒体报道、第三方论文)交叉验证撰写。全文严格区分「已核实事实」「厂商宣传口径」「媒体传闻」三类信息,并在关键处标注冲突口径。

一、核心结论(TL;DR)

  1. 它是一家"模型公司",不是"机器人公司"——但立场并不纯粹。灵波的战略主张是"不做本体、只做通用大脑",对标 Physical Intelligence;可它同时推出了自研本体 R1(2025.09)与 R2(2026.07)。官方解释是本体用于"定义参考构型、暴露软硬件问题、支撑数据采集",但客观上使其处于软件叙事不够纯粹、硬件能力不足以对抗本体厂的中间态。
  1. 技术体系的完整度是国内第一梯队,且明显超出同体量公司。7 个模型家族、11 个已发布版本,覆盖深度补全 → 空间视觉基座 → 3D 重建 → VLA 操作 → 世界模型 → 视频生成 → 世界动作模型。同时押注 VLA 与"世界动作模型(WAM)"双线,在国内属少数派,等价于对两条尚未收敛的技术路线做了对冲。

具身智能(Embodied AI)技术综述:从基础理论到工程实践

具身智能(Embodied AI)作为人工智能通往通用人工智能(AGI)的关键路径,近年来取得了突破性进展。本文基于 Every-Embodied 开源项目的丰富实践经验,系统性地综述具身智能领域的技术栈、算法演进、工程实践和前沿复现。全文涵盖:(1)具身智能的基础理论与发展历程;(2)机器人学基础(运动学、动力学、坐标变换);(3)计算机视觉在具身场景中的应用;(4)强化学习与模仿学习;(5)视觉-语言-动作(VLA)大模型全景;(6)视觉语言导航(VLN)技术;(7)世界模型最新进展;(8)无人机控制与规划专题;(9)仿真环境与真机部署;(10)数据集与评估基准。本文强调"理论-实践-复现"三位一体的学习路径,为工程师和从业者提供从入门到前沿复现的完整技术指南。

关键词:具身智能、机器人学习、视觉-语言-动作模型、VLA、视觉语言导航、VLN、世界模型、强化学习、模仿学习、MuJoCo仿真

目录

  1. 引言
  2. 具身智能基础理论
  3. 机器人学基础
  4. 具身场景的计算机视觉
  5. 强化学习与模仿学习
  6. 视觉-语言-动作(VLA)大模型
  7. 视觉语言导航(VLN)
  8. 具身世界模型
  9. 无人机控制与规划专题
  10. 仿真环境与真机部署
  11. 数据集与评估基准
  12. 工程实践指南
  13. 总结与展望

1. 引言

1.1 什么是具身智能?

人工智能的发展历程中,我们见证了从"非具身"(Disembodied)到"

具身智能大脑:VLA 模型架构解析与训练实战

🦞 太空龙虾:基于 OpenVLA、π0、π0.5、π0.6 等核心论文

📋 目录

  1. VLA 模型概述
  2. 架构设计
  3. 数据工程
  4. 预训练策略
  5. 推理与部署
  6. 实战指南

1. VLA 模型概述

1.1 什么是 VLA 模型?

Vision-Language-Action (VLA) 是具身智能领域的核心范式,将三大核心能力端到端集成:

  • Vision:视觉感知(理解机器人看到的环境)
  • Language:语言理解(理解人类指令)
  • Action:动作生成(输出机器人执行的控制指令)

1.2 VLA 的革命性意义

传统机器人范式:

视觉感知 → 状态估计 → 任务规划 → 运动控制 → 执行

问题:各模块独立训练,误差累积,泛化能力弱

VLA 范式:

[图像 + 语言] → VLA 模型 → [动作序列]

优势:端到端训练,全局优化,泛化能力强

2. 架构设计

2.1 核心架构组件

2.1.1 视觉编码器(Vision Encoder)

作用: 将机器人视角的图像转换为特征表示

常用架构:

架构 特点 适用场景
ViT (Vision Transformer) 全局注意力,适合复杂场景 通用机器人操作
CLIP ViT 预训练视觉-语言对齐 开放场景理解
EfficientNet 高效,适合边缘部署 低功耗机器人
DINOv2 自监督预训练 少样本学习

输入维度: 单帧图像:[B, 3, H, W] 多帧历史:[B, T, 3,

Gemini Robotics On-Device

本文档描述了Gemini Robotics On-Device,这是一款先进的视觉-语言-动作 (VLA) 模型,旨在本地设备上高效运行以实现通用机器人操作。该模型能够处理文本、图像和机器人本体感受数据作为输入,并输出机器人动作。训练使用了包含图像、文本以及机器人传感器和动作数据的数据集,并利用Google的Tensor Processing Units (TPUs)进行。评估结果表明,Gemini Robotics On-Device在泛化、指令遵循和快速适应方面表现出色,其性能与旗舰版Gemini Robotics 模型相似,同时超越了之前的最佳设备端VLA模型。该模型主要用于机器人应用的设备端部署,作为核心组件使机器人能够理解并响应视觉和语言指令,并在给定环境中采取行动。

Gemini Robotics On-Device 简介

模型概述与核心功能

Gemini Robotics On-Device 是一款尖端的视觉-语言-动作 (VLA) 模型,其设计宗旨是在本地设备上高效运行,以实现通用机器人操作。该模型能够支持广泛的任务、场景和多种机器人类型。

  • 模型描述: “Gemini Robotics On-Device 是我们基于设备端 Gemma 模型的先进视觉-语言-动作 (VLA) 模型。它专为通用机器人操作而设计,可在本地设备上高效运行。该模型支持广泛的任务、场景和多种机器人类型。”
  • 输入: 接收文本(例如问题或指令)、图像(例如机器人环境视角)和机器人本体感受数据(数值)。
  • 输出: 生成机器人动作的数值。
  • 架构: 基于 Gemini Robotics 技术和设备端 Gemma 模型的设备端 VLA 模型。

华为云具身智能技术探索与实践

幻灯片概述了华为在具身智能领域的积极投入与战略。文件详细阐述了具身智能的发展趋势,包括大模型的应用产业落地以及面临的挑战。华为提出了盘古具身智能大模型作为核心,通过一体化开发平台工具链,旨在解决复杂任务规划与执行问题。此外,幻灯片还展示了具体的行业应用案例,例如智能制造物流分拣,并强调了技术创新产业合作的重要性,以推动具身智能的广泛应用。