具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

V-JEPA 2:自监督视频模型实现理解、预测与规划

V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning

实物实验有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

48 页 PDF · 19.3 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§3.1–3.2 · §4.1–4.3 · Tables 2–3 · §9

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

先以视频遮挡表征预测学习编码器,再冻结编码器,用DROID视频及末端状态训练动作条件自回归潜在预测器,结合教师强制和两步展开损失。控制时用CEM最小化预测潜在状态与目标图像的L1距离,每次仅执行首动作再规划。

实验设置与硬件

动作条件后训练使用不足62小时DROID片段,不需要任务奖励或成功标签但需要机器人状态。相同模型在两个未见实验室的Franka Panda与RobotiQ夹爪上评测到达、抓取及搬运,每技能条件10次;并比较微调Octo与Cosmos。

结果及统计口径

作者报告两实验室平均杯/盒抓取65%/25%,杯/盒搬运80%/65%;结果依任务明显变化。RTX4090上使用800候选、十轮、一步时域,规划每动作16秒;Cosmos比较为80候选、每动作约4分钟,不能称高频实时控制。

局限与风险

搬运使用中间目标图像,零样本指新实验室部署,不代表未经机器人数据训练。长时域模型误差与搜索成本增加,现有控制目标为图像;小规模物体评测无法证明开放世界操作能力。

复现建议

应固定DROID筛选、状态差分动作、图像目标与子目标切换规则,同时报告候选数、时域和总控制延迟;将视频理解基准与机器人闭环成绩分开。未运行模型或实机。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
实物实验
机器人型号
Franka Emika Panda、RobotiQ夹爪

两个实验室使用 Franka Emika Panda 配 RobotiQ 夹爪;夹爪更细型号未核实。

代码与训练

有开源代码 · 训练代码已开源

官方仓库提供 V-JEPA 2 和 2-AC 代码、配置与模型入口;多数代码 MIT,部分文件 Apache-2.0。

来源与分类证据