原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
3.1–3.3 · 4.1–4.6 · 5.1 · Tables 2–5
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
SmolVLA冻结紧凑SmolVLM-2,以视觉/语言/状态特征条件化流匹配动作专家;图像压到每帧64词元,只用前16层,并交替交叉注意力和因果自注意力。另提出让动作执行与推理解耦的异步管线,以减少动作块之间等待。
实验设置与硬件
LIBERO40任务与Meta-World50任务各每任务10次;SO100抓放、堆叠、分类及SO101抓放。实机预训练约2.3万社区轨迹,仿真表2的SmolVLA却仅从VLM初始化,需区别训练来源。
结果及统计口径
4.5亿参数版LIBERO87.3%、Meta-World57.3%;SO100平均78.3,对π0的61.7和ACT48.3。预训练把同构多任务版本51.7提升到78.3;SO101分布内90、位置外推50。实机“成功率”实际按抓取/放置各0.5计部分完成。
局限与风险
机器人社区数据形态和任务较集中,长时序能力未确立;不同基线训练数据量不同,不能直接归因参数效率。小模型可单卡训练不意味着全文实验便宜,作者报告整个项目约3万GPU小时。
复现建议
以LeRobot实现固定50步动作块、10步流求解和冻结VLM开始;区分同步主表与异步实验,且仿真每步重观测、实机整块后观测。重跑时同时给完整任务成功率和论文部分得分。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- SO100、SO101、Franka Emika Panda(仿真)、Sawyer(仿真)
SO100、SO101 为实机;Panda 与 Sawyer 分别用于 LIBERO 和 Meta-World 仿真。
相关机器人档案
代码与训练
有开源代码 · 训练代码已开源
LeRobot 提供 SmolVLA 训练和推理代码,Apache-2.0;权重与社区数据应逐项核对许可。
