原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§2.2–3.3 · §4.1–4.2 · Tables 1–3 · §6 · Appendix A
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
将动作语言拆为动词和空间关系短语,组合各条件的视频扩散得分来生成未来图像计划;可再加入目标图或草图。执行时用相邻预测帧与当前状态训练逆动力学模型把视频转成动作,因而视频想象与控制是两个模块。
实验设置与硬件
以RT-1约7万真实记录、约500任务训练视频模型,抽取未见语言组合;约128样本由至少三人评估。机器人规划在RLBench仿真Panda上使用前视RGB与宏步动作,表3列六项任务,对照Image-BC、Hiveformer、UniPi。
结果及统计口径
作者报告未见指令生成视频的人评81.3%,HiP50.1%;加草图/目标图达到94.7%/95.8%。六项RLBench任务平均49.3%,Hiveformer44.2%,但堆块18.5%、取鞋10.5%,难任务仍较低。
局限与风险
视频人评是想象计划合理性,不是实机成功率;真实RT-1数据也不构成新实体部署。论文明确单视角、真实新图像泛化不足和移动相机困难,且宏步设置弱化了低层连续控制。
复现建议
复现需保留语言组合拆分、数据划分、生成分辨率和逆动力学训练,区分纯语言与额外目标图条件。附录给出约100张V100、三阶段扩散及逆模型配置;未据RLBench默认硬件推断真实Panda实验。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- Franka Emika Panda
Franka Panda 仅为 RLBench 仿真执行平台;RT-X 真实视频不计作实机部署。
相关机器人档案
代码与训练
代码待核实 · 代码公开,许可未核实
官方仓库含 train_rtx.py、数据管道与配置;统一许可及完整权重发布范围未核实。
