原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
29 页 PDF · 20.2 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文原文依据范围
3 · 4.1–4.3 · 5.1–5.4 · Appendix B–D · Tables 4–6
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
以联合注意力连接Qwen3-VL物理推理、Wan2.2视觉生成及连续动作流匹配三个专家;人类动作被写成统一物理语言,机器人数据再提供精确动作监督。后训练扰动未来视觉潜变量,并从已执行动作历史加噪初始化动作生成。
实验设置与硬件
评测LIBERO、LIBERO-Plus、RoboTwin干净及随机化环境;实机用两台AgileX Piper,四项语言跟随任务及六阶段收桌。各实机任务200条示范,统一训练8万步、8张H100,评估每任务40次。
结果及统计口径
LIBERO99.2%,RoboTwin干净75.14%、随机化68.32%;实机成功率67.5%、指令跟随率82.5%,分别高于π0.5约13.1、21.9个百分点。长任务进度5.0/6,仅略高于π0.5的4.8;历史初始化可用2–4步去噪。
局限与风险
RoboTwin干净条件并非所列方法最高;规模规律仅覆盖250至约5000小时机器人数据,少数据混入人类视频反会下降。t-SNE重叠是表示观察,不能单独证明因果迁移;实机任务规模有限。
复现建议
先复现数据清洗、物理语言模板与动作历史对齐,再分离预训练来源、VLM解冻、未来噪声和历史初始化消融。分开记录指令理解、完整成功和阶段进度,避免把三种指标混用。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- AgileX Piper(双臂实机)
相关机器人档案
代码与训练
代码待核实 · 训练代码待核实
仅核对摘要;官方实现、许可证与训练入口尚待核实。
