原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
PDF第5页选段(提取文本L377–394) · PDF第6–7页选段(提取文本L450–463) · PDF第8页选段(提取文本L783–800) · PDF第9页选段(提取文本L850–867) · PDF第3–4页选段(提取文本L232–278) · PDF第8–9页选段(提取文本L804–841) · PDF第4页选段(提取文本L279–307)
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
先生成任务视频,用GMFlow估计逐帧稠密光流,再结合初始深度恢复物体或相机的三维刚体运动,由现有操作原语执行并在停滞时重新规划。
实验设置与硬件
评估Meta-World操作、iTHOR导航、人类推物视频迁移及真实Panda;实机Bridge预训练后还用20段本场景人类示范视频微调。
结果及统计口径
完整方法优于文中无重规划与直接光流生成变体;真实Panda结果不是仅凭Bridge零样本部署,必须保留20段微调数据的条件。
局限与风险
遮挡、光照急变和大运动会破坏光流;实机假设可顶抓且无需重定向物体,RGB视频也无法提供接触力信息。
复现建议
核对分割、深度、光流与坐标变换,分别标记源机器人数据和实机微调;保留抓取原语与重规划触发条件。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Franka Emika Panda、Trossen WidowX 250(源数据平台)
代码与训练
有开源代码 · 官方实现已核验
提供 Meta-World、iTHOR、Bridge 的训练和推理脚本。 提供数据目录规范;本次未核实训练全集可公开下载。 作者提供三个实验域的 Hugging Face 检查点。 主仓库的视频预测权重不等于完整动作执行链;迁移真实相机和机械臂需重新校准对应与控制。 本次未运行训练、复现实验或实机控制。
