原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
8 页 PDF · 2.9 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文原文依据范围
§IV · §V-A–V-B · Tables I–IV · §VI
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
EF-GAIfO只用状态转移示范,以机器人自身探索训练重建模型;重建误差转换成可行性权重,对专家转移的判别器损失降权,PPO策略、判别器与重建模型共同迭代。它估计与经验相似的运动可行性,不需要专家动作标签。
实验设置与硬件
二维点质量分别混合超速/可行速度及不同路径,20随机种子;Go2任务从30条人类无机器人示范学接近、抓取、抬升,高层控制速度、俯仰和夹爪,低层步态预训练。仿真每设置5策略各100次,真机四目标设置各10次。
结果及统计口径
作者报告仿真随机目标成功85.8±7.4%,WGAIfO/GAIfO为26.4±44.1%/35.4±18.1%。真实Go2四设置成功70–80%,对照10–30%,说明指定抓取任务中筛除不合适示范具有帮助。
局限与风险
误差小仅说明接近已有经验,不是物理可行性证明;早期探索不足时可能抑制可行但未见的动作。目标随机化只在邻近区域,真实样本较少;估计器未充分纳入地形、障碍和接触环境。
复现建议
复现需固定示范可行/不可行混合、阈值分位调度和经验缓冲,单独核验低层步态及夹爪安装。本体型号有明确Go2证据,不能把人类采集状态直接当机器人动作示范;当前未运行实现。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Unitree Go2
代码与训练
代码待核实 · 训练代码待核实
仅核对摘要;官方实现、许可证与训练入口尚待核实。
