原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
5.1–5.2 · 6.1–6.5 · 7 · Tables 1–7
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
RT-1用语言嵌入FiLM调制EfficientNet图像特征,TokenLearner把每帧压成8词元,六帧历史送入Transformer。机械臂、底盘与终止模式离散成动作词元,以监督交叉熵学习;压缩及非逐token自回归等优化满足约3Hz真机控制。
实验设置与硬件
13台Everyday Robots移动机械臂、17个月约13万遥操作轨迹,覆盖744条任务指令,约3000次真实评估;分已见、未见组合、干扰物及新背景。再混入仿真和Kuka数据检验数据兼容,结合SayCan做长任务。
结果及统计口径
主表已见97%、未见组合76%、干扰物83%、背景59%;同是语言条件的BC-Z/Gato表现更低。机器人异构数据能补充技能;数据消融表明保留任务多样性比只保留更多同类示范更关键。长流程结果依赖SayCan的上层技能编排。
局限与风险
所谓744技能很多是对象与已有动作的语言组合,未验证任意新运动。行为克隆不能自然超过示范者,任务整体精巧程度有限;大规模采集成本很高,背景变化下仍显著下降。
复现建议
先固定六帧历史、每维256bins、相机预处理和实际延迟预算;按任务/对象/场景而非逐帧划分数据,重现数据量与多样性消融。应分别报告RT-1单技能和接SayCan后的长程成功,不归为同一端到端模型能力。
实验标签与机器人
- 验证范围
- 实物实验
- 机器人型号
- Everyday Robots移动机械臂
代码与训练
有开源代码 · 官方实现、检查点和数据已公开;代码仓库已归档。
Apache-2.0;13 台实机收集约 13 万轨迹。含 KUKA 与仿真数据混训实验,主评测仍在 Everyday Robots 实机。
