原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3–4 · §5.1–5.4 · Tables 1–2 · §6
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
OpenVLA将DINOv2与SigLIP特征拼接到Llama2/Prismatic7B骨干,把每维连续动作离散为256分箱并自回归预测。用筛选后的Open X-Embodiment约97万轨迹微调全部模块,支持LoRA适配与低比特推理。
实验设置与硬件
直接评估WidowX17任务×10次、Google移动操作平台12任务×5次,按相同初态A/B比较RT-1-X、RT-2-X和Octo。另在两种Panda设置用每任务10–150示范适配七任务,共129测试回合,并测33回合LoRA与80回合量化。
结果及统计口径
作者报告WidowX总体超过RT-2-X,Google平台相近,但语义泛化RT-2-X仍更强。选定微调任务LoRA为68.2±7.5%,全微调69.7±7.2%;四比特示例约7GB显存且表现接近半精度。
局限与风险
原版只用单图、无历史及本体输入,推理频率限制精细高频控制,窄域灵巧任务Diffusion Policy更平滑。LoRA/量化表使用较小训练混合及仅SigLIP变体,不应当全部主模型的无条件保证。
复现建议
完整预训练为64张A100约14天;实际复现宜先验证公开检查点、动作归一化和低成本微调。需匹配控制频率,八比特实验降速会改变闭环动力学;本轮核读论文流程但未训练或实机运行。
实验标签与机器人
- 验证范围
- 实物实验
- 机器人型号
- WidowX、Google移动操作机器人、Franka Emika Panda
代码与训练
有开源代码 · 官方训练、微调、评测代码及模型权重公开。
代码 MIT;权重及基础模型仍有独立许可。预训练约 97 万真实轨迹;LIBERO 是后加的仿真微调评测。
