具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

OpenVLA:开源视觉-语言-动作模型

OpenVLA: An Open-Source Vision-Language-Action Model

实物实验有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

37 页 PDF · 12.6 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§3–4 · §5.1–5.4 · Tables 1–2 · §6

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

OpenVLA将DINOv2与SigLIP特征拼接到Llama2/Prismatic7B骨干,把每维连续动作离散为256分箱并自回归预测。用筛选后的Open X-Embodiment约97万轨迹微调全部模块,支持LoRA适配与低比特推理。

实验设置与硬件

直接评估WidowX17任务×10次、Google移动操作平台12任务×5次,按相同初态A/B比较RT-1-X、RT-2-X和Octo。另在两种Panda设置用每任务10–150示范适配七任务,共129测试回合,并测33回合LoRA与80回合量化。

结果及统计口径

作者报告WidowX总体超过RT-2-X,Google平台相近,但语义泛化RT-2-X仍更强。选定微调任务LoRA为68.2±7.5%,全微调69.7±7.2%;四比特示例约7GB显存且表现接近半精度。

局限与风险

原版只用单图、无历史及本体输入,推理频率限制精细高频控制,窄域灵巧任务Diffusion Policy更平滑。LoRA/量化表使用较小训练混合及仅SigLIP变体,不应当全部主模型的无条件保证。

复现建议

完整预训练为64张A100约14天;实际复现宜先验证公开检查点、动作归一化和低成本微调。需匹配控制频率,八比特实验降速会改变闭环动力学;本轮核读论文流程但未训练或实机运行。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
实物实验
机器人型号
WidowX、Google移动操作机器人、Franka Emika Panda

代码与训练

有开源代码 · 官方训练、微调、评测代码及模型权重公开。

代码 MIT;权重及基础模型仍有独立许可。预训练约 97 万真实轨迹;LIBERO 是后加的仿真微调评测。

来源与分类证据