原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§5–7 · §10 Tables 3–6 · §11
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
以动作示范的姿态、关节速度、末端和质心相似奖励,配合任务奖励训练PPO物理控制器。随机从参考动作状态初始化并在摔倒时提前终止,帮助探索高动态技能;策略输出PD目标,多片段奖励、选择器或价值门控支持技能组合。
实验设置与硬件
Bullet中测试人形、Atlas、霸王龙和龙等虚拟角色,30Hz策略、1.2kHz物理仿真。动作参考多为0.5–5秒捕捉片段;比较单纯模仿、单纯任务及两者结合,消融参考初始化/提前终止,并测推力扰动容忍。
结果及统计口径
作者报告踢击任务联合目标成功99%,仅模仿19%、仅任务55%,各100次。参考初始化缺失时后空翻可能退化成小跳;归一化回报相似也未必意味着复现正确动作。学得步态可随目标调整并在仿真中抗扰动。
局限与风险
全部为物理动画,Atlas不代表实机。多数训练统计来自单次训练,技能常需数天;阶段变量随时间线性推进限制灵活时序,大动作库整合未验证。PD参数与奖励权重需人工选择,部署机器人仍属未来工作。
复现建议
需对齐参考动作重定向、相位、初始化分布、接触终止和低层PD设置,既评任务成功也检查动作形态。把100次评测与训练种子数分开报告,本次未运行Bullet训练。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- Atlas(仿真)
Atlas仅为仿真角色;另有人类、恐龙和龙等虚拟角色,不作为实机型号。
代码与训练
有开源代码 · 作者训练与演示代码公开;旧仓库已标注弃用。
使用物理仿真、动作片段和任务回报训练策略;原仓库依赖Bullet与旧版TensorFlow,作者建议新项目参考MimicKit。
