具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
经典研究

用强化学习实现真实世界人形机器人运动

Real-World Humanoid Locomotion with Reinforcement Learning

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

32 页 PDF · 9.1 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

Results · Indoor and simulation experiments · Materials and Methods · Fig.7–8 · Limitations

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

先在特权状态下训练教师策略,再让因果Transformer根据本体观测和既往动作历史学习学生,以教师模仿加强化学习联合优化。Isaac Gym用虚拟弹簧近似Digit闭链机构,随机化动力学、地形、噪声和延迟,部署前在Agility仿真器筛除不安全策略。

实验设置与硬件

实体Agility Digit约1.6米、45公斤,政策50Hz、关节PD1kHz;室内测试外力、杂物地面、斜坡和五种携带载荷,室外覆盖草地、路面等。另在可控仿真比较公司控制器,并消融网络、上下文长度和训练目标。

结果及统计口径

作者报告一周整日室外测试未观察到跌倒,展示脚部卡住后的恢复和随环境调整步态;三类训练消融支持Transformer、较长历史和联合目标。但不稳定木板的控制器对照只做仿真,未因危险而搬到真机。

局限与风险

无外部视觉感知,依赖接触后的本体反馈;未观测跌倒没有给出统一行走距离分母,不能转成安全概率。作者指出左右不对称、速度跟踪误差以及强拉拽仍可导致跌倒,闭链仿真近似也是转移限制。

复现建议

复现需Digit机械/驱动参数、闭链弹簧子步、随机化和教师学生流程,以及高保真仿真预筛选。所谓零样本实机指策略未实机微调,不意味着无需机器人模型和传感器知识;本轮未独立执行。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Agility Robotics Digit

代码与训练

代码待核实 · 论文与作者项目公开;本次未核实作者完整训练代码。

仿真中进行大规模RL与策略学习,再以高保真仿真检查策略;需要Digit动力学和部署接口。

来源与分类证据

  • arXiv原始记录:标题、首发日期与方法摘要。

    查看一手来源
  • 正文明确Digit机器人、户外部署与仿真评估流程。

    查看一手来源
  • 作者项目说明因果Transformer、训练规模与实机验证;页面未提供代码入口。

    查看一手来源
  • 原始项目题名与同一arXiv编号对应关系。

    查看一手来源
  • Outdoor deployment:作者一周室外未跌倒的观察,不是正式失效率估计。

    查看一手来源
  • Indoor/simulation comparison:不稳定木板未在真机比较。

    查看一手来源
  • Sim-to-real / Limitations:50Hz/1kHz;Agility仿真筛选不更新参数;强扰动仍会跌倒。

    查看一手来源