原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
III-A–E 架构、数据与训练 · IV-A–C 实验与表I/II · 附录D–F 超参、失败设计、各平台协议与表VII
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
将语言、目标图像和多相机历史编码成分块注意力Transformer输入,以只读取上下文的读出令牌连接扩散动作块解码器。增减传感器或动作头时保留主体权重;从Open X-Embodiment筛选25套数据、约80万条轨迹,统一末端增量及夹爪语义。
实验设置与硬件
四家机构九套真实系统分别检验训练域内零样本控制与新域微调。六个微调域约用100条示范,覆盖力矩输入、关节动作、ViperX和ALOHA;对照从零训练与VC-1。零样本每机器人两任务、每任务10次;微调表I标为每域20次,但双臂附录写10次,原文存在协议差异。
结果及统计口径
作者表I报告微调平均成功率72%,从零训练20%、VC-1为15%;WidowX消融支持扩散头和宽数据混合。表VII中未见物体80%,未见环境40%,未见技能仅5%,不能把训练域内零样本结果当作任意新技能泛化。
局限与风险
样本量有限,跨模型预训练数据量不一致;依赖末端动作筛选的数据配方,未提供通用安全保证。九套系统也不等于九种互不重复的机器人型号。
复现建议
论文给出JAX预训练/微调及27M、93M权重;Base用128芯TPU v4训练14小时,24GB A5000微调约5小时。复现须固定数据混合、动作归一化、相机及逐任务成功判据,不能只加载检查点。
实验标签与机器人
- 验证范围
- 实物实验
- 机器人型号
- Trossen WidowX 250、UR5、RT-1 Robot(专有平台)、Franka、Trossen ViperX、ALOHA(双ViperX)
代码与训练
有开源代码 · MIT 训练、微调与推理代码和预训练权重公开。
约 80 万条 OXE 轨迹;需区分原论文模型与仓库后续 1.5 检查点。模型头适配不等于免示范迁移。
来源与分类证据
首发日期与总体研究范围。
查看一手来源附录 F 列出 9 套实机配置、WidowX/UR5/ViperX/ALOHA 等。
查看一手来源MIT 许可证、训练脚本和模型权重;版本 1.5 更新。
查看一手来源III-B–D:25 datasets/800k episodes; 300k steps, batch 2048; 50k-step full-model finetuning.
查看一手来源表I、附录F-C:Table I says 20 trials/domain; bimanual appendix says 10. Preserve discrepancy.
查看一手来源表VII:In-distribution 85%, novel objects 80%, new environment 40%, new skill 5%.
查看一手来源附录F:Explicit hardware: WidowX 250, UR5, proprietary RT-1 robot, ViperX, ALOHA; CMU setup uses Franka controller.
查看一手来源
