具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
经典研究

Humanoid-Gym:实现零样本仿真到现实迁移的人形机器人强化学习框架

Humanoid-Gym: Reinforcement Learning for Humanoid Robot with Zero-Shot Sim2Real Transfer

仿真 + 实物有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

6 页 PDF · 3.7 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§III · §IV · Appendix Tables II–IV · Figures 3–7

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

用PPO及非对称观测训练人形行走,策略输入本体历史、速度命令和周期相位,输出关节PD目标。正弦参考、单双支撑掩模与速度/姿态/平滑奖励共同塑造步态;在Isaac Gym大规模随机化训练后先转MuJoCo校验。

实验设置与硬件

附录配置为8192并行环境、15帧策略历史和3帧特权历史,随机化传感噪声、延迟及动力学。用Robot Era XBot-S和XBot-L两尺寸机器人验证迁移;MuJoCo包含平地与不平地,并以真实腿摆正弦响应和相图校准模型。

结果及统计口径

作者展示两平台零样本sim-to-real行走,并报告校准后MuJoCo腿部轨迹与真实系统较接近。结果主要是视频及轨迹对照,没有系统给出多种子学习曲线、跨地形成功率或统计置信区间,不能补造稳定性分数。

局限与风险

零样本是训练后无需真实策略微调,并不排除硬件测量和仿真校准。论文较短,步态奖励和机械参数仍依平台设计;不能把MuJoCo不平地演示直接当作同难度实机场景验证。

复现建议

适合作为开源训练/迁移框架入口,需依附录恢复奖励、随机化与时延,逐级检查站立、关节响应及低速行走。实际复现需安全保护和每平台参数核对,本次未运行训练或硬件。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Robot Era XBot-S、Robot Era XBot-L

代码与训练

有开源代码 · 官方PPO训练、策略导出和sim-to-sim脚本公开。

仓库以XBot-L为主要示例,提供4096环境PPO训练、play导出和MuJoCo检查;依赖Isaac Gym Preview 4。

来源与分类证据

  • arXiv原始记录:标题、首发日期与方法摘要。

    查看一手来源
  • 官方README明确XBot-S/XBot-L、PPO脚本、导出及MuJoCo流程,区分未来功能。

    查看一手来源
  • §III; Appendix Tables II–IV:PPO、相位奖励、8192环境及历史帧配置。

    查看一手来源
  • §IV; Figures 3–7:两尺寸机器人、MuJoCo校准与定性迁移证据。

    查看一手来源