原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3方法,PDF页4–7 · §4.1–4.2,PDF页8–9 · §5及表3–4,PDF页12–14 · 附录D.2及表D,PDF页23
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
视觉与语言编码后使用两个专用token,分别驱动Flow-as-Flow生成器和Narrative Delta辅助损失。后者对齐大模型依据起始、目标图像生成的多视角变化叙述;推理不需要目标图。DiT预测连续二维速度场,经积分得到运动点轨迹,再条件化操作策略。
实验设置与硬件
离线使用Fractal和Bridge V2,分别留出2000个测试片段,以ADE、FDE、LTDR评价末端区域。实机为11自由度丰田HSR,主要三任务每方法各20次、每任务约30条遥操作示范;附录扩展到13任务、每方法260次。
结果及统计口径
Fractal/Bridge V2的ADE为21.68/30.59,优于两个基线。三项实机任务平均成功率55%,Im2Flow2Act为42%;13任务扩展均值58%对45%。分离token和叙述监督的消融均支持设计贡献。
局限与风险
假设固定相机且初始末端可见;二维流难表达沿视线方向的深度运动。杯堆叠仅20%且真值流上限同为20%,说明下游策略也是瓶颈。物理一致性主要依赖经验结果,不等于三维动力学保证。
复现建议
复现须准备CoTracker3轨迹、经300张末端标注微调的Robot-SAM及离线叙述。原文给出约4.87亿可训练参数、RTX5090约6小时训练及62毫秒推理;实体平台迁移还需另训流条件策略。
实验标签与机器人
- 验证范围
- 实物实验
- 机器人型号
- Toyota HSR(实机)、Google Robot(Fractal数据来源)、WidowX(Bridge V2数据来源)
型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。
相关机器人档案
代码与训练
代码待核实 · 代码状态未核实
复现须准备CoTracker3轨迹、经300张末端标注微调的Robot-SAM及离线叙述。原文给出约4.87亿可训练参数、RTX5090约6小时训练及62毫秒推理;实体平台迁移还需另训流条件策略。 论文许可不代表代码许可,代码实际发布状态仍未知。
