具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

VIMA:利用多模态提示完成通用机器人操作

VIMA: General Robot Manipulation with Multimodal Prompts

仅仿真有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

48 页 PDF · 28.9 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

2–4 · 5.1–5.3 · Appendix A,G · Fig.4

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

VIMA把任务写成文本与对象/场景图像交错的多模态提示,冻结T5编码提示,通过交叉注意力条件化自回归动作解码。观察采用对象检测得到的图像块和位置词元,并保留动作—观察历史,统一表达新概念、视觉目标和视频模仿。

实验设置与硬件

VIMA-Bench是PyBullet UR5桌面仿真,17类任务、60万余脚本专家轨迹,动作是带两个SE(2)目标的抓放或推擦原语。四级评估依次改变摆放、组合、对象和任务,比较改造后的Gato/Flamingo/GPT架构及模型/数据规模。

结果及统计口径

对象词元与交叉注意力的结合在测试容量范围最稳健,少量数据时优势尤其大;最难泛化设定作者报告最高约2.9倍成功,1%数据在部分设定可匹配基线10%数据。模型规模曲线只计控制器,固定111M的T5编码器未计入。

局限与风险

没有本篇实机验证;高层动作原语掩盖低层接触控制难度。依赖独立检测器,遮挡和未见形状会传播误差;简化桌面物理与模板提示不等于开放世界通用机器人语言理解。

复现建议

固定四级留出划分、oracle原语与检测器训练数据,分别测检测错误、对象词元和提示交叉注意力;不要将oracle分割与预测分割混用。比较总参数与预训练成本时补上T5及视觉管线,独立报告各级任务成功。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仅仿真
机器人型号
Universal Robots UR5(仿真)

代码与训练

有开源代码 · MIT 代码、预训练模型、数据与 VIMA-Bench 已公开。

官方仓库提供模型与评测脚本;数据约 60 万条专家轨迹来自仿真。

来源与分类证据