具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

NarrativeFlow:利用机器人速度场的基于流的视觉—语言—动作模型

NarrativeFlow: Flow-Based Vision-Language-Action Model Using Robot Velocity Fields

实物实验代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

24 页 PDF · 4.8 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§3方法,PDF页4–7 · §4.1–4.2,PDF页8–9 · §5及表3–4,PDF页12–14 · 附录D.2及表D,PDF页23

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

视觉与语言编码后使用两个专用token,分别驱动Flow-as-Flow生成器和Narrative Delta辅助损失。后者对齐大模型依据起始、目标图像生成的多视角变化叙述;推理不需要目标图。DiT预测连续二维速度场,经积分得到运动点轨迹,再条件化操作策略。

实验设置与硬件

离线使用Fractal和Bridge V2,分别留出2000个测试片段,以ADE、FDE、LTDR评价末端区域。实机为11自由度丰田HSR,主要三任务每方法各20次、每任务约30条遥操作示范;附录扩展到13任务、每方法260次。

结果及统计口径

Fractal/Bridge V2的ADE为21.68/30.59,优于两个基线。三项实机任务平均成功率55%,Im2Flow2Act为42%;13任务扩展均值58%对45%。分离token和叙述监督的消融均支持设计贡献。

局限与风险

假设固定相机且初始末端可见;二维流难表达沿视线方向的深度运动。杯堆叠仅20%且真值流上限同为20%,说明下游策略也是瓶颈。物理一致性主要依赖经验结果,不等于三维动力学保证。

复现建议

复现须准备CoTracker3轨迹、经300张末端标注微调的Robot-SAM及离线叙述。原文给出约4.87亿可训练参数、RTX5090约6小时训练及62毫秒推理;实体平台迁移还需另训流条件策略。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
实物实验
机器人型号
Toyota HSR(实机)、Google Robot(Fractal数据来源)、WidowX(Bridge V2数据来源)

型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。

相关机器人档案

代码与训练

代码待核实 · 代码状态未核实

复现须准备CoTracker3轨迹、经300张末端标注微调的Robot-SAM及离线叙述。原文给出约4.87亿可训练参数、RTX5090约6小时训练及62毫秒推理;实体平台迁移还需另训流条件策略。 论文许可不代表代码许可,代码实际发布状态仍未知。

来源与分类证据

  • §3.1,PDF页5:明确假设固定相机、初始末端可见,并将主要研究聚焦于流生成。

    查看一手来源
  • 表2,PDF页9;表4,PDF页13:离线ADE及HSR三任务成功率来自原文定量表。

    查看一手来源
  • 附录D.2表D,PDF页23:13任务260次/方法,均值58%与45%;不将数据集采集机器人误当实机评测平台。

    查看一手来源
  • PDF页13(已渲染目视核对):核对该页关键图表的行列对应、实验类别与数值;分析范围仅限sectionsRead所列章节,并非逐页翻译。

    查看一手来源