AI论文陪读 · 具身智能
Vision-Language-Action Model · Google Robotics · 具身智能
OPC
云与数字化
1 人公司 · LLM 协作 · 工程底座
+ 关注
GPT-4 出现后,大家都在讨论"大模型能不能控制机器人"。Google 的 RT-1 / RT-2(2022~2023)给出了答案:不仅能,而且能做到零样本语义推理——比如指令"把快掉下桌子的东西挪到另一个位置",机器人能理解并执行完全没有见过的任务。
核心结论 · CORE INSIGHT
RT-2 的核心洞察:把动作离散化成 token,和文本 token 一起输入 Transformer——机器人可以用"语言模型的方式"理解和生成动作序列。预训练知识跨模态可迁移,VLM 能教机械臂做零样本推理。
01
传统机器人控制的最大痛点:训练数据和任务一一对应,无法泛化。你训练机器人抓红色方块,它就只会抓红色方块——换个蓝色方块,成功率直接腰斩。
根本原因:每个新任务都需要重新采集大量演示数据(通常需要人工遥操作,效率极低)。130K 条轨迹、17 个月、13 台机器人——这是 RT-1 的投入,但即使这样也只能覆盖 700+ 任务,无法覆盖真实世界的无限多样性。
"
能不能让机器人直接继承大语言模型的世界知识,而不是从零学起?
— RT-2 的核心问题
02
RT-1 是 Google Everyday Robots 2022 年的工作,第一个端到端用 Transformer 做机器人控制的模型。
核心数字
13 台机器人,17 个月,130K 条演示轨迹
700+ 任务,90%+ 训练分布内成功率
输入:视频帧 + 自然语言指令;输出:17 维末端执行器动作
架构:FiLM + EfficientNet + TokenLearner + Transformer
RT-1 架构流程
视频帧 → EfficientNet → TokenLearner(压缩token)→ FiLM 调制
↗
语言指令 → tokenizer → ─────────────────────
↘
Transformer 解码 → 17 维动作
FiLM(Feature-wise Linear Modulation) 是 RT-1 的关键:用语言指令的特征调制视觉特征,实现跨模态对齐。语言指令不只是一个 prompt,而是真正影响视觉特征提取的调制信号。
TokenLearner:将大量视觉 token 压缩到约 8 个,大幅降低 Transformer 计算量,实现实时控制(~3Hz)。
03
RT-2 是 2023 年的工作,把视觉-语言模型(VLM)的预训练知识迁移到机器人控制——这是最关键的突破。
用 PaLM-E(Google 的视觉-语言模型)作为 backbone,训练数据是机器人演示 + Web 规模的 VLM 预训练数据联合微调。动作作为特殊 token,和文本 token 一起输入 Transformer。
"
动作作为语言。和文本 token 一样,机器人动作也可以被离散化成 token 序列,喂进统一的大 Transformer 里训练。
— RT-2 的核心设计哲学
泛化能力测试(最震撼的部分):
RT-1 vs RT-2 泛化能力对比
新物体颜色
~50%
80%
新物体位置
~50%
90%
语义推理(哪个物体最有用)
~10%
60%
干扰物场景
~30%
90%
蓝色:RT-1 深色:RT-2
最震撼的数字:RT-2 可以零样本做语义推理——比如指令"把快掉下桌子的东西挪到另一个位置",完全没见过的任务,RT-2 能理解并执行。这在 RT-1 上几乎不可能。
04
维度 RT-1 RT-2
Backbone 从头训练的 Transformer 复用 PaLM-E 预训练 VLM
泛化方式 数据多样化(130K 轨迹) 预训练知识迁移
视觉语言融合 FiLM 调制(晚融合) 早期融合(统一 Transformer)
动作表示 回归头(连续值) 离散 token(和文本一起)
语义推理能力 弱 强(从 VLM 继承)
· · ·
核心洞察 · CORE INSIGHT
RT-2 的本质是跨模态知识蒸馏:VLM 在互联网数据上学的视觉-语言理解,可以迁移到机器人动作控制。这和 Phi 系列"用高质量数据训练小模型"的逻辑完全一致——把大模型能力迁移到小/窄场景,只是这次跨的是模态边界。
本月
读 OpenVLA / 智元 GO-1(VLA 最新进展,2024~2025)
本月
看 RT-2 真实机器人演示视频,理解 Coarse-to-Fine 动作分解
永远
每篇论文问自己:这和强化学习 DDPG/PPO 有什么联系?
· · ·
END · 完
下一步行动
选 1 个具体动作: ① 搜 "RT-2 robotics transformer demo" 看真实机器人视频 ② 读 OpenVLA 论文(arXiv:2409)③ 思考:1 人公司的 AI 产品能不能用 VLA 思想?
云与数字化 · 立即关注