原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
Method overview / Fig.1 · Command-conditioned locomotion · High-speed locomotion · Recovery from a fall · Discussion · Figs.2–4
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
用刚体接触仿真加由实体执行器数据训练的神经执行器模型,近似串联弹性电机、低层软件延迟和扭矩映射;再在随机化仿真中以强化学习训练读取状态历史的MLP,输出关节位置目标。行走、高速和跌倒恢复分别使用不同奖励训练。
实验设置与硬件
在真实ANYmal比较已有模型控制器的速度跟踪、机械功率和关节扭矩,另测试最高速度及九种跌倒初态;策略在桌面仿真训练后转移,部署单CPU推理约25微秒。研究同时检验不同执行器建模的转移效果。
结果及统计口径
作者报告真实高速1.5米/秒、仿真1.58米/秒;给定命令下平均机械功率78.1瓦,对照97.3瓦。九种恢复初态全部成功,图示恢复少于三秒,体现动态接触策略的价值。
局限与风险
仿真训练不等于零实机数据,执行器网络来自物理测量。恢复最初试验后放宽关节速度约束才得到报告的100%,不能称完全无硬件调试;精确模型、奖励安全成本和硬件约束仍有工程负担。
复现建议
复现需ANYmal刚体/碰撞CAD、扭矩记录、执行器历史窗口、随机化和每项奖励,并保留恢复约束调整。论文仅称ANYmal,不能补成后续B/C型号;公开补充材料与内部仿真器的可用范围需另外核验。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- ANYmal
代码与训练
代码待核实 · 作者公开部分补充源码与数据;许可及完整训练系统未核实。
策略在仿真学习;执行器模型利用真实测量数据。
