原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3.2–3.4 · §5.2–5.7 · Tables 2–3, 5, 9–11 · §6
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
在共享掩码扩散主干中序列化文字、视觉和量化动作,联合训练策略、下一图像、任务理解与目标图像预测。动作按块并行迭代解码;默认先生成目标,再条件化动作,也研究联合动作—视觉去噪和固定参考的候选重排。
实验设置与硬件
经OXE机器人继续预训练后,在LIBERO、七类LIBERO-Plus扰动和VLABench两任务评测;Franka Research 3测试水果搬运、分类、自由堆叠及指定颜色顺序堆叠。消融分别固定解码器改变训练目标、固定检查点改变推理组合。
结果及统计口径
作者报告LIBERO平均98.1%、LIBERO-Plus73.0%,真实四条件平均78.4%,颜色顺序堆叠68.5%。完整辅助目标使VLABench域外指令成功由33.88%升至47.28%。B200上块并行解码最高29.15倍加速是模型侧吞吐,非完整机器人周期。
局限与风险
已预留语音/力触觉接口但报告的机器人训练和策略解码未启用,不能称多传感器验证。真实仅单平台单工作区;近未来图像全图指标上复制原帧仍更强。任务理解只定性评估,视觉预测收益取决于推理组合。
复现建议
区分已发布220k阶段检查点与后续任务模型,记录量化区间、目标混合比例、去噪步数和完整延迟;分别检验任务成功与视觉变化预测。未运行代码或独立复核作者成绩。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Franka Research 3
实机型号由 §5.1 和 §5.2.4 明确;未把 OXE 预训练数据中的全部机器人当成本论文实机平台。
相关机器人档案
代码与训练
待发布 / 占位 · 占位仓库,待开源
官方项目页写 Model and Code will be released soon;GitHub 目前主要是 README/assets。
