原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
III · IV-A–C · V-A–C · VI · Fig.4(渲染核对); Tables I–II
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
Open X-Embodiment把跨机构机器人轨迹统一为RLDS接口,以RT-1-X及RT-2-X检验跨形态联合训练。图像和语言统一处理,动作粗略归一化但不强制对齐坐标、绝对/相对或速度语义;大模型将动作当离散语言词元与网页视觉语言知识结合。
实验设置与硬件
发布目录覆盖22形态、21机构;论文训练混合实际只取9种机械臂,并在六机器人做3600次真实测试。小数据域研究同任务迁移,大数据域比较模型容量,再在Google Robot上测试原本只出现在WidowX Bridge数据里的技能。
结果及统计口径
图4 RT-1-X小数据域平均63%,原方法41%、单域RT-1为44%,约50%相对提升而非50个百分点。55B RT-2-X新技能75.8%,RT-2为27.3%;但普通对象/背景泛化61%对62%,未提升。小RT-1-X在大数据域可能欠拟合。
局限与风险
未研究完全新机器人零样本迁移,也不覆盖截然不同感知/动作模态;正迁移依赖容量、数据组成及网络预训练。目录有22形态不等于模型训练和评测用了全部22种。
复现建议
先明确9形态训练混合及采样权重,逐数据集核对动作单位和控制频率;对同一架构比较单域与混合,再做移除Bridge消融。分开汇报新技能、常规泛化及小/大数据域,避免合并成通用“提升三倍”。
实验标签与机器人
- 验证范围
- 实物实验
- 机器人型号
- Google Robot、WidowX、UR5、多平台(六种评测形态)
代码与训练
有开源代码 · 数据工具与 RT-1-X 推理代码、检查点公开。
软件 Apache-2.0;各来源数据应单独核许可证。开放 RT-1-X 不代表 RT-2-X 全部训练代码和权重开放。
