具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
经典研究

扩散策略:通过动作扩散学习视觉运动策略

Diffusion Policy: Visuomotor Policy Learning via Action Diffusion

仿真 + 实物有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

16 页 PDF · 5.6 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

II–IV · V-A–B · VI-A–B · VIII · Tables I–V

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

Diffusion Policy将视觉条件动作分布表示为逐步去噪的动作序列,使用滚动时域执行部分动作后重新观测。视觉特征只作条件而不与动作共同去噪;比较时序卷积U-Net和Transformer、位置/速度动作与视觉预训练,避免确定性回归平均多个行为模式。

实验设置与硬件

四个模拟基准的12任务覆盖Push-T、Robomimic和Franka Kitchen等;UR5真实Push-T,以及Panda的翻转、酱料倒取/涂抹等动态或多阶段任务。实机Push-T保留停顿动作,以末态IoU和移至结束区共同检验细调及阶段切换。

结果及统计口径

真实Push-T端到端卷积版本95%成功、IoU0.80,人工0.84;LSTM-GMM最佳20%、IBC0%。位置控制和动作块设计共同带来收益,Transformer或预训练视觉编码并不在每项都更优,单看“用了扩散”无法解释全部差异。

局限与风险

行为克隆仍受示范覆盖和质量限制;迭代采样延迟高于简单策略,高频任务可能不足。仿真从多个检查点选择最佳、跨三种子汇报的协议应复核;真实强鲁棒扰动展示有定性成分。

复现建议

从公开基准固定观察/动作窗口、执行段长度、归一化和DDIM步数,先复现位置控制与序列预测消融。真实10Hz指令插值到125Hz,不应把插值频率算成策略推理频率;同时测延迟和闭环成功。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Universal Robots UR5、Franka Emika Panda

相关机器人档案

代码与训练

有开源代码 · 官方仿真与真实机器人代码、数据及训练配置公开。

行为克隆式去噪训练;推理成本随采样步骤变化。

来源与分类证据