原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
31 页 PDF · 11.3 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文本次核对范围
§3 · §4.1–4.4 · Tables 1–2,16 · Appendix D.6–D.8 · Appendix E
归档用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
以分阶段奖励、结束条件和可调常数组成程序;语言模型修改结构,CMA-ES校准参数,固定验证器比较并行仿真结果。物体残差加在冻结的身体前向—后向模型上,使奖励映射成潜变量,执行期间不再训练控制器。
实验设置与硬件
在Isaac Lab中使用重定向到G1的OMOMO/GRAB交互数据;四类箱状物各留出50片段。比较参考跟踪、八类目标任务和技能库组合,指标取三次独立评估;真机G1通过胸前RGB-D和LiDAR估计物体。
结果及统计口径
作者表2报告目标任务成功率86.5%,校准后的初始语言模型程序为34.6%;每任务族约2.1 GPU小时、23万token。跟踪成功率72%,但专门跟踪器的轨迹误差更低,不能说全部指标领先。
局限与风险
能力受已有运动库与状态采样库限制;搜索耗时不支持实机实时重规划。机载传感器不等于机载计算:感知和策略在机外GPU执行,真机回放仿真潜变量,并保留状态反馈闭环。
复现建议
复现需固定训练/留出划分、奖励特征、验证器和搜索预算,区分单次回合成功与三次尝试中成功的场景口径;论文列明流程,但本轮未运行代码或重现实验。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Unitree G1
相关机器人档案
代码与训练
代码待核实 · 训练代码待核实
仅核对摘要;官方实现、许可证与训练入口尚待核实。
