原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
3.1–3.6 · 4.1–4.4 · 5 Limitations · Appendix A · Appendix C.2–C.3 · Appendix D.1–D.3
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
H-VLA用Prismatic-7B视觉语言骨干提取认知特征,先由扩散模块生成末端位姿与夹爪组成的关键动作,再由另一扩散模块生成密集动作段。状态、子目标及动作统一到已标定第三人称相机坐标;关键帧按夹爪变化及轨迹终点自动标注,先重关键动作预训练,再等权联合微调。
实验设置与硬件
混合约18.3万轨迹预训练,分别微调后测Google/WidowX的SimplerEnv。真实双臂Agilex PiPER用三任务共150示范;H-VLA及π系列各228次,分ID、位置OOD和场景/物体OOD,CogACT与MolmoAct2只做较少的ID/位置试验。
结果及统计口径
作者报告仿真三个分割均值91%、84%、81%;真机三类条件的任务宏平均93%、83%、66%。位置OOD比最强所测对照高47点,但场景变化中的LiftPot仍落后π系列,且这些均值不是按所有试次合并的比例。
局限与风险
基线预训练数据、相机输入及评测数量不同,CogACT仅一个视角。关键标签会漏掉中间接触事件;相机外参误差敏感性未系统测,灵巧接触与变形操作仍困难。训练数据中的Franka不能算新增实机验证。
复现建议
复现需保留跨数据集标定、单/双臂掩码和关键动作标签;八H100预训练约三天,真机适配四H100约一天。附录列逐任务试次数、无提前成功终止的仿真协议及PiPER硬件,4090端到端推理约103毫秒。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Agilex PiPER(双臂Cobot Magic式平台)、Google Robot(SimplerEnv仿真)、WidowX(SimplerEnv仿真)
实机为两台 PiPER 从臂,Cobot Magic 风格配置;Google Robot/WidowX 是仿真基准原文名称,未推断更细子型号。
相关机器人档案
代码与训练
代码待核实 · 未核实公开训练代码
已查论文正文/附录和作者相关结果,未发现可核实的官方实现链接。
