原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3.2–3.3 · §4.1–4.4 · §5 · Appendix H Table 4–5
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
RT-2将平移、旋转、夹爪及停止动作编码为离散文本token,以PaLI-X或PaLM-E联合微调机器人示范和原互联网视觉语言任务;动作模式限制合法输出词表,保留语义先验并直接生成闭环控制命令。
实验设置与硬件
主实验使用七自由度移动操作机器人,约6000条评估轨迹,分已见任务、未见物体/背景/环境、符号与推理等设置。机器人数据来自13台设备17个月采集;另以小型PaLI3B在Language-Table仿真评估并展示真实推物。
结果及统计口径
作者附表4显示RT-2两版本未见设置均62%,RT-1为32%、MOO35%;已见任务约91–93%,RT-1为92%。因此优势主要在指定泛化轴,不能说所有任务翻倍;新语义可重新调用已有动作。
局限与风险
网络知识没有自动创造新的物理动作,运动能力仍受机器人数据分布限制。55B模型依赖多TPU云端、约1–3Hz,5B约5Hz,难满足更高频控制;研究不证明长时域安全或任意环境可靠性。
复现建议
复现需明确PaLI-X/PaLM-E版本、机器人与网页共训比例、动作分箱及任务难度,分开主移动机器人和Language-Table分支。主模型与训练资源存在可获取限制,不能把相关开源基准视作RT-2完整公开实现。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Google七自由度移动操作机器人
代码与训练
代码待核实 · 已核官方论文与项目页;未确认可公开使用的官方 RT-2 实现或权重。
原文包含基于 PaLI-X 与 PaLM-E 的 RT-2 变体;大模型通过多 TPU 云端推理。不要把 RT-1 仓库当作 RT-2。
