首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >机器人也能零样本推理:RT-1 / RT-2 如何让机械臂理解"把快掉下去的东西挪开"

机器人也能零样本推理:RT-1 / RT-2 如何让机械臂理解"把快掉下去的东西挪开"

作者头像
heidsoft
发布2026-07-23 20:18:18
发布2026-07-23 20:18:18
1000
举报

AI论文陪读 · 具身智能

机器人也能零样本推理: RT-1 / RT-2 如何让机械臂理解"把快掉下去的东西挪开"

Vision-Language-Action Model · Google Robotics · 具身智能

OPC

云与数字化

1 人公司 · LLM 协作 · 工程底座

+ 关注

GPT-4 出现后,大家都在讨论"大模型能不能控制机器人"。Google 的 RT-1 / RT-2(2022~2023)给出了答案:不仅能,而且能做到零样本语义推理——比如指令"把快掉下桌子的东西挪到另一个位置",机器人能理解并执行完全没有见过的任务。

核心结论 · CORE INSIGHT

RT-2 的核心洞察:把动作离散化成 token,和文本 token 一起输入 Transformer——机器人可以用"语言模型的方式"理解和生成动作序列。预训练知识跨模态可迁移,VLM 能教机械臂做零样本推理。

01

问题:为什么机器人泛化这么难

传统机器人控制的最大痛点:训练数据和任务一一对应,无法泛化。你训练机器人抓红色方块,它就只会抓红色方块——换个蓝色方块,成功率直接腰斩。

根本原因:每个新任务都需要重新采集大量演示数据(通常需要人工遥操作,效率极低)。130K 条轨迹、17 个月、13 台机器人——这是 RT-1 的投入,但即使这样也只能覆盖 700+ 任务,无法覆盖真实世界的无限多样性。

"

能不能让机器人直接继承大语言模型的世界知识,而不是从零学起?

— RT-2 的核心问题

02

RT-1:端到端机器人 Transformer(2022)

RT-1 是 Google Everyday Robots 2022 年的工作,第一个端到端用 Transformer 做机器人控制的模型

核心数字

13 台机器人,17 个月,130K 条演示轨迹

700+ 任务,90%+ 训练分布内成功率

输入:视频帧 + 自然语言指令;输出:17 维末端执行器动作

架构:FiLM + EfficientNet + TokenLearner + Transformer

RT-1 架构流程

视频帧 → EfficientNet → TokenLearner(压缩token)→ FiLM 调制

语言指令 → tokenizer → ─────────────────────

Transformer 解码 → 17 维动作

FiLM(Feature-wise Linear Modulation) 是 RT-1 的关键:用语言指令的特征调制视觉特征,实现跨模态对齐。语言指令不只是一个 prompt,而是真正影响视觉特征提取的调制信号。

TokenLearner:将大量视觉 token 压缩到约 8 个,大幅降低 Transformer 计算量,实现实时控制(~3Hz)。

03

RT-2:视觉-语言-动作模型(VLA)

RT-2 是 2023 年的工作,把视觉-语言模型(VLM)的预训练知识迁移到机器人控制——这是最关键的突破。

PaLM-E(Google 的视觉-语言模型)作为 backbone,训练数据是机器人演示 + Web 规模的 VLM 预训练数据联合微调。动作作为特殊 token,和文本 token 一起输入 Transformer。

"

动作作为语言。和文本 token 一样,机器人动作也可以被离散化成 token 序列,喂进统一的大 Transformer 里训练。

— RT-2 的核心设计哲学

泛化能力测试(最震撼的部分)

RT-1 vs RT-2 泛化能力对比

新物体颜色

~50%

80%

新物体位置

~50%

90%

语义推理(哪个物体最有用)

~10%

60%

干扰物场景

~30%

90%

蓝色:RT-1 深色:RT-2

最震撼的数字:RT-2 可以零样本做语义推理——比如指令"把快掉下桌子的东西挪到另一个位置",完全没见过的任务,RT-2 能理解并执行。这在 RT-1 上几乎不可能。

04

RT-1 vs RT-2:两条技术路线对比

维度 RT-1 RT-2

Backbone 从头训练的 Transformer 复用 PaLM-E 预训练 VLM

泛化方式 数据多样化(130K 轨迹) 预训练知识迁移

视觉语言融合 FiLM 调制(晚融合) 早期融合(统一 Transformer)

动作表示 回归头(连续值) 离散 token(和文本一起)

语义推理能力 弱 强(从 VLM 继承)

· · ·

核心洞察 · CORE INSIGHT

RT-2 的本质是跨模态知识蒸馏:VLM 在互联网数据上学的视觉-语言理解,可以迁移到机器人动作控制。这和 Phi 系列"用高质量数据训练小模型"的逻辑完全一致——把大模型能力迁移到小/窄场景,只是这次跨的是模态边界。

本月

读 OpenVLA / 智元 GO-1(VLA 最新进展,2024~2025)

本月

看 RT-2 真实机器人演示视频,理解 Coarse-to-Fine 动作分解

永远

每篇论文问自己:这和强化学习 DDPG/PPO 有什么联系?

· · ·

END · 完

下一步行动

选 1 个具体动作: ① 搜 "RT-2 robotics transformer demo" 看真实机器人视频 ② 读 OpenVLA 论文(arXiv:2409)③ 思考:1 人公司的 AI 产品能不能用 VLA 思想?

云与数字化 · 立即关注

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-22,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 云与数字化 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 机器人也能零样本推理: RT-1 / RT-2 如何让机械臂理解"把快掉下去的东西挪开"
    • 问题:为什么机器人泛化这么难
    • RT-1:端到端机器人 Transformer(2022)
    • RT-2:视觉-语言-动作模型(VLA)
    • RT-1 vs RT-2:两条技术路线对比
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档