原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
4.1–4.3 · 5.1–5.6 · 6 Discussion · Appendix F.4–F.7 · Tables 1,4,5
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
MASkillBlender在冻结的单人形行走、伸手、下蹲技能之上,用共享局部策略输出技能目标和逐关节混合权重。MAPPO集中价值学习、分散执行;同构队员置换产生额外训练样本,并在同构博弈假设下分析其策略梯度合法性。下游主要任务奖励不代表低层技能无需密集奖励。
实验设置与硬件
Isaac Gym测试双机器人搬箱、推箱和三机器人避碰移动,主要为19自由度H1,另评21自由度G1。每任务两次独立训练,取最好策略做50回合;对照中央式SkillBlender和改编TeamHOI,另测延迟定位误差、技能/置换消融及MuJoCo跨模拟器迁移。
结果及统计口径
作者报告H1三任务成功率100%、86%、100%;去掉置换增强后搬箱降至6%,说明这一设置中增强作用显著。含定位和延迟扰动时成功率为92%、74%、98%,推箱仍最难。
局限与风险
所有验证均为仿真,包括名称含deployment的鲁棒性实验;没有H1/G1实机协作证据。取最优检查点及仅两次训练限制变异估计;技能库覆盖、同构假设及状态输入均限制实际泛化。Carry跨仿真前还增加随机化训练。
复现建议
复现需取得各形态低层技能、技能选择与混合规则、全局critic/局部actor观测、任务成功阈值及置换实现。论文给出单5090训练约35–76小时,未计低层技能预训练;Move仍读取最近队友相对位置。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- Unitree H1(仿真)、Unitree G1(仿真)
相关机器人档案
代码与训练
代码待核实 · 训练代码待核实
仅核对摘要;官方实现、许可证与训练入口尚待核实。
