原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§III · §IV · Appendix Tables II–IV · Figures 3–7
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
用PPO及非对称观测训练人形行走,策略输入本体历史、速度命令和周期相位,输出关节PD目标。正弦参考、单双支撑掩模与速度/姿态/平滑奖励共同塑造步态;在Isaac Gym大规模随机化训练后先转MuJoCo校验。
实验设置与硬件
附录配置为8192并行环境、15帧策略历史和3帧特权历史,随机化传感噪声、延迟及动力学。用Robot Era XBot-S和XBot-L两尺寸机器人验证迁移;MuJoCo包含平地与不平地,并以真实腿摆正弦响应和相图校准模型。
结果及统计口径
作者展示两平台零样本sim-to-real行走,并报告校准后MuJoCo腿部轨迹与真实系统较接近。结果主要是视频及轨迹对照,没有系统给出多种子学习曲线、跨地形成功率或统计置信区间,不能补造稳定性分数。
局限与风险
零样本是训练后无需真实策略微调,并不排除硬件测量和仿真校准。论文较短,步态奖励和机械参数仍依平台设计;不能把MuJoCo不平地演示直接当作同难度实机场景验证。
复现建议
适合作为开源训练/迁移框架入口,需依附录恢复奖励、随机化与时延,逐级检查站立、关节响应及低速行走。实际复现需安全保护和每平台参数核对,本次未运行训练或硬件。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Robot Era XBot-S、Robot Era XBot-L
代码与训练
有开源代码 · 官方PPO训练、策略导出和sim-to-sim脚本公开。
仓库以XBot-L为主要示例,提供4096环境PPO训练、play导出和MuJoCo检查;依赖Isaac Gym Preview 4。
