具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

RT-2:将网络知识迁移到机器人控制的视觉-语言-动作模型

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

26 页 PDF · 14.9 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§3.2–3.3 · §4.1–4.4 · §5 · Appendix H Table 4–5

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

RT-2将平移、旋转、夹爪及停止动作编码为离散文本token,以PaLI-X或PaLM-E联合微调机器人示范和原互联网视觉语言任务;动作模式限制合法输出词表,保留语义先验并直接生成闭环控制命令。

实验设置与硬件

主实验使用七自由度移动操作机器人,约6000条评估轨迹,分已见任务、未见物体/背景/环境、符号与推理等设置。机器人数据来自13台设备17个月采集;另以小型PaLI3B在Language-Table仿真评估并展示真实推物。

结果及统计口径

作者附表4显示RT-2两版本未见设置均62%,RT-1为32%、MOO35%;已见任务约91–93%,RT-1为92%。因此优势主要在指定泛化轴,不能说所有任务翻倍;新语义可重新调用已有动作。

局限与风险

网络知识没有自动创造新的物理动作,运动能力仍受机器人数据分布限制。55B模型依赖多TPU云端、约1–3Hz,5B约5Hz,难满足更高频控制;研究不证明长时域安全或任意环境可靠性。

复现建议

复现需明确PaLI-X/PaLM-E版本、机器人与网页共训比例、动作分箱及任务难度,分开主移动机器人和Language-Table分支。主模型与训练资源存在可获取限制,不能把相关开源基准视作RT-2完整公开实现。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Google七自由度移动操作机器人

代码与训练

代码待核实 · 已核官方论文与项目页;未确认可公开使用的官方 RT-2 实现或权重。

原文包含基于 PaLI-X 与 PaLM-E 的 RT-2 变体;大模型通过多 TPU 云端推理。不要把 RT-1 仓库当作 RT-2。

来源与分类证据