具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
经典研究

AVDC:通过稠密对应从无动作标签视频学习行为

Learning to Act from Actionless Videos through Dense Correspondences

仿真 + 实物有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

19 页 PDF · 10.7 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

PDF第5页选段(提取文本L377–394) · PDF第6–7页选段(提取文本L450–463) · PDF第8页选段(提取文本L783–800) · PDF第9页选段(提取文本L850–867) · PDF第3–4页选段(提取文本L232–278) · PDF第8–9页选段(提取文本L804–841) · PDF第4页选段(提取文本L279–307)

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

先生成任务视频,用GMFlow估计逐帧稠密光流,再结合初始深度恢复物体或相机的三维刚体运动,由现有操作原语执行并在停滞时重新规划。

实验设置与硬件

评估Meta-World操作、iTHOR导航、人类推物视频迁移及真实Panda;实机Bridge预训练后还用20段本场景人类示范视频微调。

结果及统计口径

完整方法优于文中无重规划与直接光流生成变体;真实Panda结果不是仅凭Bridge零样本部署,必须保留20段微调数据的条件。

局限与风险

遮挡、光照急变和大运动会破坏光流;实机假设可顶抓且无需重定向物体,RGB视频也无法提供接触力信息。

复现建议

核对分割、深度、光流与坐标变换,分别标记源机器人数据和实机微调;保留抓取原语与重规划触发条件。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Franka Emika Panda、Trossen WidowX 250(源数据平台)

代码与训练

有开源代码 · 官方实现已核验

提供 Meta-World、iTHOR、Bridge 的训练和推理脚本。 提供数据目录规范;本次未核实训练全集可公开下载。 作者提供三个实验域的 Hugging Face 检查点。 主仓库的视频预测权重不等于完整动作执行链;迁移真实相机和机械臂需重新校准对应与控制。 本次未运行训练、复现实验或实机控制。

来源与分类证据

  • 原文标题、首发日期和版本已核验;PDF下载哈希已验证。

    查看一手来源
  • 已读范围见原文分析的逐段页码/提取文本行号;方法、实验、结果、局限均以PDF选段核对。

    查看一手来源
  • 已发布实现,非占位仓库;代码、模型和数据条款应分开核实。

    查看一手来源