原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
III-A–C · IV Experimental Setup · V-A–B · Tables II–III · VI Limitations
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
这是一套行为鲁棒性评估方法,补充二元成功率。它记录成功轨迹的仿真时长、末端/关节路径、均值与高分位加加速度、夹爪累计运动;比较每任务均值相对变化再取任务中位数,用MAD看波动,Mann-Whitney检验配BH多重比较校正。
实验设置与硬件
完整评测π0.5和VLANeXt的四个LIBERO套件,OpenVLA-OFT只测Spatial;选用跨套件联合微调检查点。基线各任务50回合,七类扰动按全部对应LIBERO-Plus变体各两回合,物体扰动例外。行为统计仅纳入成功回合,导数用10Hz仿真频率。
结果及统计口径
作者发现即便任务成功,摄像机、机器人初态及传感扰动仍改变动作质量;Spatial相机扰动下π0.5与OpenVLA-OFT平均末端jerk的任务中位相对增幅为24.1%和35.3%,显著增加分别涉及7/10和10/10任务。
局限与风险
仅统计成功轨迹会产生选择效应:扰动可能先淘汰长而曲折的恢复行为,使剩余成功轨迹显得更稳定。高层指标不能直接诊断掉物或误抓,未研究失败轨迹,也没有实机验证;仿真时长不包含模型推理延迟。
复现建议
论文给出vla-reliability与VLA-eval整合入口。复现应保存逐步轨迹及控制频率、扰动到原任务的映射、成功筛选和多重检验范围,报告样本数与每任务分布,避免只复算一个聚合百分比。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- 未核实
代码与训练
代码待核实 · 训练代码待核实
仅核对摘要;官方实现、许可证与训练入口尚待核实。
