原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
19 页 PDF · 10.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文本次核对范围
2.1–2.3 · 3.1–3.3 · 4.1–4.4 · Tables 1–2
归档用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
每台机器人用Qwen3-VL-4B调度,用微调π0.5执行;上层交换意图、子目标、任务信念及可选不确定性。语言指令被限制在预设可接受集合内,并有停滞后强制推进机制,因此并非完全开放式自主协商。
实验设置与硬件
全部是仿真:ManiSkill3上RoboPoly七任务采用两台Panda;RoboTwin八任务把Aloha-AgileX双臂拆成独立代理。每任务50条双机示范拆成100条单机轨迹,每方法每任务400次评估。
结果及统计口径
RoboPoly的Cook Pot由π0.5单独控制的1.00%升至39.25%,Hang Bag从52.25%至78%;但Prepare Snack仅18%。RoboTwin多数任务改善,Put Object Cabinet反而由46.50%降到43.25%。去通信或换弱动作模型均降低总体效果。
局限与风险
只验证双代理及模拟桌面场景;共享全局相机,不能等同完全局部视觉。上层调用延迟、网络丢包及更大团队未得到实机验证;低成功任务说明规划改善仍受动作模型限制。
复现建议
应保存上层提示词、可接受指令集、推进规则与LoRA配置,复用相同随机初态比较无通信、无调度两类消融,并单列RoboTwin训练高层指令、测试低层指令的分布差异。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- Franka Emika Panda(仿真)、Aloha-AgileX(仿真)
代码与训练
代码待核实 · 训练代码待核实
仅核对摘要;官方实现、许可证与训练入口尚待核实。
