具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

RT-1:面向大规模真实世界控制的机器人 Transformer

RT-1: Robotics Transformer for Real-World Control at Scale

实物实验有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

31 页 PDF · 14.0 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

5.1–5.2 · 6.1–6.5 · 7 · Tables 1–7

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

RT-1用语言嵌入FiLM调制EfficientNet图像特征,TokenLearner把每帧压成8词元,六帧历史送入Transformer。机械臂、底盘与终止模式离散成动作词元,以监督交叉熵学习;压缩及非逐token自回归等优化满足约3Hz真机控制。

实验设置与硬件

13台Everyday Robots移动机械臂、17个月约13万遥操作轨迹,覆盖744条任务指令,约3000次真实评估;分已见、未见组合、干扰物及新背景。再混入仿真和Kuka数据检验数据兼容,结合SayCan做长任务。

结果及统计口径

主表已见97%、未见组合76%、干扰物83%、背景59%;同是语言条件的BC-Z/Gato表现更低。机器人异构数据能补充技能;数据消融表明保留任务多样性比只保留更多同类示范更关键。长流程结果依赖SayCan的上层技能编排。

局限与风险

所谓744技能很多是对象与已有动作的语言组合,未验证任意新运动。行为克隆不能自然超过示范者,任务整体精巧程度有限;大规模采集成本很高,背景变化下仍显著下降。

复现建议

先固定六帧历史、每维256bins、相机预处理和实际延迟预算;按任务/对象/场景而非逐帧划分数据,重现数据量与多样性消融。应分别报告RT-1单技能和接SayCan后的长程成功,不归为同一端到端模型能力。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
实物实验
机器人型号
Everyday Robots移动机械臂

代码与训练

有开源代码 · 官方实现、检查点和数据已公开;代码仓库已归档。

Apache-2.0;13 台实机收集约 13 万轨迹。含 KUKA 与仿真数据混训实验,主评测仍在 Everyday Robots 实机。

来源与分类证据