MzeeRESEARCH60 分钟更新
具身智能研究工作台阅读原文 · 追踪方法 · 连接实践
近期研究

InterEvolve:面向人形机器人移动操作的测试时奖励程序演化

InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

31 页 PDF · 11.3 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
本次核对范围

§3 · §4.1–4.4 · Tables 1–2,16 · Appendix D.6–D.8 · Appendix E

归档用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

以分阶段奖励、结束条件和可调常数组成程序;语言模型修改结构,CMA-ES校准参数,固定验证器比较并行仿真结果。物体残差加在冻结的身体前向—后向模型上,使奖励映射成潜变量,执行期间不再训练控制器。

实验设置与硬件

在Isaac Lab中使用重定向到G1的OMOMO/GRAB交互数据;四类箱状物各留出50片段。比较参考跟踪、八类目标任务和技能库组合,指标取三次独立评估;真机G1通过胸前RGB-D和LiDAR估计物体。

结果及统计口径

作者表2报告目标任务成功率86.5%,校准后的初始语言模型程序为34.6%;每任务族约2.1 GPU小时、23万token。跟踪成功率72%,但专门跟踪器的轨迹误差更低,不能说全部指标领先。

局限与风险

能力受已有运动库与状态采样库限制;搜索耗时不支持实机实时重规划。机载传感器不等于机载计算:感知和策略在机外GPU执行,真机回放仿真潜变量,并保留状态反馈闭环。

复现建议

复现需固定训练/留出划分、奖励特征、验证器和搜索预算,区分单次回合成功与三次尝试中成功的场景口径;论文列明流程,但本轮未运行代码或重现实验。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Unitree G1

相关机器人档案

代码与训练

代码待核实 · 训练代码待核实

仅核对摘要;官方实现、许可证与训练入口尚待核实。

来源与分类证据