具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

形态不匹配条件下,基于经验与可行性感知的观测式生成对抗模仿学习

Experience-Based Feasibility-Aware Generative Adversarial Imitation from Observation under Embodiment Mismatch

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

8 页 PDF · 2.9 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§IV · §V-A–V-B · Tables I–IV · §VI

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

EF-GAIfO只用状态转移示范,以机器人自身探索训练重建模型;重建误差转换成可行性权重,对专家转移的判别器损失降权,PPO策略、判别器与重建模型共同迭代。它估计与经验相似的运动可行性,不需要专家动作标签。

实验设置与硬件

二维点质量分别混合超速/可行速度及不同路径,20随机种子;Go2任务从30条人类无机器人示范学接近、抓取、抬升,高层控制速度、俯仰和夹爪,低层步态预训练。仿真每设置5策略各100次,真机四目标设置各10次。

结果及统计口径

作者报告仿真随机目标成功85.8±7.4%,WGAIfO/GAIfO为26.4±44.1%/35.4±18.1%。真实Go2四设置成功70–80%,对照10–30%,说明指定抓取任务中筛除不合适示范具有帮助。

局限与风险

误差小仅说明接近已有经验,不是物理可行性证明;早期探索不足时可能抑制可行但未见的动作。目标随机化只在邻近区域,真实样本较少;估计器未充分纳入地形、障碍和接触环境。

复现建议

复现需固定示范可行/不可行混合、阈值分位调度和经验缓冲,单独核验低层步态及夹爪安装。本体型号有明确Go2证据,不能把人类采集状态直接当机器人动作示范;当前未运行实现。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Unitree Go2

代码与训练

代码待核实 · 训练代码待核实

仅核对摘要;官方实现、许可证与训练入口尚待核实。

来源与分类证据