具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

微调视觉—语言—动作模型:优化速度与成功率

Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success

仿真 + 实物有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

24 页 PDF · 25.7 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§III–V · Table I · §VI · Table III · §VIII

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

系统比较OpenVLA微调的自回归/并行解码、离散/连续动作及L1/扩散目标,形成并行预测动作块和连续L1回归的OFT。增加多视角、本体状态接口,并在双臂OFT+中用FiLM强化语言条件;无需另训练一个执行控制器。

实验设置与硬件

LIBERO四套任务每套500回合,区分过滤数据和不同输入配置。ALOHA四种真实双臂任务按任务独立微调,使用25步动作块;真实评测约10至24次/任务,按预先定义的部分完成分数及语言目标选择评分。

结果及统计口径

作者报告单第三人称输入OFT平均95.3%,含额外输入完整版97.1%,不能混作同配置增益。ALOHA上OFT+报告最高平均任务进度;A100平均100次请求吞吐77.9动作/秒、单块延迟0.321秒,原OpenVLA为1.8动作/秒。

局限与风险

部分外部基准数引用原论文,训练过滤和输入模态不同。真实图中的完成百分比不是全部任务成功率。示范策略较一致,L1可能不保留多峰行为;FiLM的必要性在仿真与实机间不同,原因未明。

复现建议

应复用各表的数据/模态分组、动作块长度及近零动作过滤规则,同时测生成吞吐与重规划频率。真实任务需公开评分细则、语言选择与动作完成分开计数;未执行训练。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
ALOHA

摘要明确 ALOHA 双臂实机;LIBERO 仿真型号本轮未单独核实,未添加。

代码与训练

有开源代码 · 训练代码已开源

官方 MIT 仓库提供 LIBERO/ALOHA 微调与评估说明、检查点;上游基础模型和数据条款应另查。

来源与分类证据