具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

SmolVLA:面向经济高效机器人的视觉—语言—动作模型

SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics

仿真 + 实物有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

24 页 PDF · 8.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

3.1–3.3 · 4.1–4.6 · 5.1 · Tables 2–5

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

SmolVLA冻结紧凑SmolVLM-2,以视觉/语言/状态特征条件化流匹配动作专家;图像压到每帧64词元,只用前16层,并交替交叉注意力和因果自注意力。另提出让动作执行与推理解耦的异步管线,以减少动作块之间等待。

实验设置与硬件

LIBERO40任务与Meta-World50任务各每任务10次;SO100抓放、堆叠、分类及SO101抓放。实机预训练约2.3万社区轨迹,仿真表2的SmolVLA却仅从VLM初始化,需区别训练来源。

结果及统计口径

4.5亿参数版LIBERO87.3%、Meta-World57.3%;SO100平均78.3,对π0的61.7和ACT48.3。预训练把同构多任务版本51.7提升到78.3;SO101分布内90、位置外推50。实机“成功率”实际按抓取/放置各0.5计部分完成。

局限与风险

机器人社区数据形态和任务较集中,长时序能力未确立;不同基线训练数据量不同,不能直接归因参数效率。小模型可单卡训练不意味着全文实验便宜,作者报告整个项目约3万GPU小时。

复现建议

以LeRobot实现固定50步动作块、10步流求解和冻结VLM开始;区分同步主表与异步实验,且仿真每步重观测、实机整块后观测。重跑时同时给完整任务成功率和论文部分得分。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
SO100、SO101、Franka Emika Panda(仿真)、Sawyer(仿真)

SO100、SO101 为实机;Panda 与 Sawyer 分别用于 LIBERO 和 Meta-World 仿真。

相关机器人档案

代码与训练

有开源代码 · 训练代码已开源

LeRobot 提供 SmolVLA 训练和推理代码,Apache-2.0;权重与社区数据应逐项核对许可。

来源与分类证据