原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3.1–3.2 · §4.1–4.3 · Tables 2–3 · §9
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
先以视频遮挡表征预测学习编码器,再冻结编码器,用DROID视频及末端状态训练动作条件自回归潜在预测器,结合教师强制和两步展开损失。控制时用CEM最小化预测潜在状态与目标图像的L1距离,每次仅执行首动作再规划。
实验设置与硬件
动作条件后训练使用不足62小时DROID片段,不需要任务奖励或成功标签但需要机器人状态。相同模型在两个未见实验室的Franka Panda与RobotiQ夹爪上评测到达、抓取及搬运,每技能条件10次;并比较微调Octo与Cosmos。
结果及统计口径
作者报告两实验室平均杯/盒抓取65%/25%,杯/盒搬运80%/65%;结果依任务明显变化。RTX4090上使用800候选、十轮、一步时域,规划每动作16秒;Cosmos比较为80候选、每动作约4分钟,不能称高频实时控制。
局限与风险
搬运使用中间目标图像,零样本指新实验室部署,不代表未经机器人数据训练。长时域模型误差与搜索成本增加,现有控制目标为图像;小规模物体评测无法证明开放世界操作能力。
复现建议
应固定DROID筛选、状态差分动作、图像目标与子目标切换规则,同时报告候选数、时域和总控制延迟;将视频理解基准与机器人闭环成绩分开。未运行模型或实机。
实验标签与机器人
- 验证范围
- 实物实验
- 机器人型号
- Franka Emika Panda、RobotiQ夹爪
两个实验室使用 Franka Emika Panda 配 RobotiQ 夹爪;夹爪更细型号未核实。
代码与训练
有开源代码 · 训练代码已开源
官方仓库提供 V-JEPA 2 和 2-AC 代码、配置与模型入口;多数代码 MIT,部分文件 Apache-2.0。
