原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
9 页 PDF · 3.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文本次核对范围
3.1–3.5 · 4.1–4.4 · Tables 1–4 · 5 Conclusion
归档用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
冻结视觉网络从RGB-D提取物体中心及交互点,正运动学提供机器人节点,组成统一三维骨架。两个Transformer专家以流匹配联合学习动作和未来骨架,后者仅作训练监督。推理省去未来分支,MAC从多条采样轨迹中选距离其他轨迹最近的一条,避免直接平均不兼容动作。
实验设置与硬件
在含10,030变体、七类扰动的完整LIBERO-Plus测试零样本成功率。实机ARX R5配外置及腕部RealSense,相同五任务每方法各20次,对比Fast-WAM、π0.5、Cosmos-Policy;另做骨架、监督和推理消融。
结果及统计口径
作者报告57.1M参数模型仿真85.9%,实机五任务均值89%;删去未来骨架监督降至80.1%,去掉MAC为84.2%。特权仿真状态参照为87.7%,不能混作纯视觉结果。
局限与风险
布局扰动仅66.6%,低于π0.5的84.1%;真机样本有限,未证明复杂空间组合泛化。骨架依赖冻结感知和稳定节点对应,参数量优势不直接等于完整系统延迟优势。
复现建议
论文给出RTX4090训练60K步、有效批48,预测32步动作及八个未来骨架;推理十步积分、执行16步再观测,MAC取三候选前十步。完整复现仍需感知权重、标定与训练数据。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- ARX R5
相关机器人档案
代码与训练
代码待核实 · 训练代码待核实
仅核对摘要;官方实现、许可证与训练入口尚待核实。
