具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

DeepMimic:由动作示范引导的物理角色技能深度强化学习

DeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills

仅仿真有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

18 页 PDF · 7.4 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§5–7 · §10 Tables 3–6 · §11

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

以动作示范的姿态、关节速度、末端和质心相似奖励,配合任务奖励训练PPO物理控制器。随机从参考动作状态初始化并在摔倒时提前终止,帮助探索高动态技能;策略输出PD目标,多片段奖励、选择器或价值门控支持技能组合。

实验设置与硬件

Bullet中测试人形、Atlas、霸王龙和龙等虚拟角色,30Hz策略、1.2kHz物理仿真。动作参考多为0.5–5秒捕捉片段;比较单纯模仿、单纯任务及两者结合,消融参考初始化/提前终止,并测推力扰动容忍。

结果及统计口径

作者报告踢击任务联合目标成功99%,仅模仿19%、仅任务55%,各100次。参考初始化缺失时后空翻可能退化成小跳;归一化回报相似也未必意味着复现正确动作。学得步态可随目标调整并在仿真中抗扰动。

局限与风险

全部为物理动画,Atlas不代表实机。多数训练统计来自单次训练,技能常需数天;阶段变量随时间线性推进限制灵活时序,大动作库整合未验证。PD参数与奖励权重需人工选择,部署机器人仍属未来工作。

复现建议

需对齐参考动作重定向、相位、初始化分布、接触终止和低层PD设置,既评任务成功也检查动作形态。把100次评测与训练种子数分开报告,本次未运行Bullet训练。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仅仿真
机器人型号
Atlas(仿真)

Atlas仅为仿真角色;另有人类、恐龙和龙等虚拟角色,不作为实机型号。

代码与训练

有开源代码 · 作者训练与演示代码公开;旧仓库已标注弃用。

使用物理仿真、动作片段和任务回报训练策略;原仓库依赖Bullet与旧版TensorFlow,作者建议新项目参考MimicKit。

来源与分类证据