原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
18 页 PDF · 23.9 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文原文依据范围
§IV · §V · §VI-A–C · Figs.5,7–12 · §VII
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
Recap用回报分布价值预测估计数据中动作的优势,将二值改进条件加入流匹配VLA;混合原示范、自主执行与专家接管数据,重复收集一批再离线更新。π*0.6以Gemma3 4B及860M动作专家生成动作块,不靠每次任务在线PPO更新。
实验设置与硬件
定量测试衣物折叠、双份浓缩咖啡和纸箱组装,使用两台六自由度机械臂的固定双臂平台和三相机。不同任务分别设200/500/600秒成功时限;叠衣每迭代300自主回合,纸箱600自主加360接管回合。
结果及统计口径
作者报告复杂衣物与咖啡的每小时成功吞吐较离线RL加SFT超过翻倍、失败率约减半;除复杂衣物外最终成功率超过90%。固定橙色T恤特定失败模式用每轮600轨迹、两轮后达97%。
局限与风险
复杂衣物训练含11类,但主要定量指标针对衬衫;咖啡指标也只针对双份浓缩,不能扩成所有饮品。系统依赖人工奖励、接管和场景重置;更新为批式离线,探索较简单,尚非完全自主持续在线学习。
复现建议
复现需明确每版本预训练/任务数据、优势标注、人工评分和超时规则,吞吐必须同时包含速度与成功。论文仅称固定双6DoF平台,不能从照片猜厂商;本轮未核验全量训练数据及端到端复现入口。
实验标签与机器人
- 验证范围
- 实物实验
- 机器人型号
- 固定双臂平台(两台6自由度机械臂,型号未给出)
原文图5仅明确静态双臂、每臂6自由度与平行夹爪;厂商和型号未知。
代码与训练
代码待核实 · 官方代码未核实
论文与模型卡可查;不能把其他 π 系列的 openpi 代码直接当作该版本 RECAP 的完整训练实现,状态保持未知。
