具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

π*0.6:从经验中学习的视觉—语言—动作模型

π*0.6: a VLA That Learns From Experience

实物实验代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

18 页 PDF · 23.9 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§IV · §V · §VI-A–C · Figs.5,7–12 · §VII

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

Recap用回报分布价值预测估计数据中动作的优势,将二值改进条件加入流匹配VLA;混合原示范、自主执行与专家接管数据,重复收集一批再离线更新。π*0.6以Gemma3 4B及860M动作专家生成动作块,不靠每次任务在线PPO更新。

实验设置与硬件

定量测试衣物折叠、双份浓缩咖啡和纸箱组装,使用两台六自由度机械臂的固定双臂平台和三相机。不同任务分别设200/500/600秒成功时限;叠衣每迭代300自主回合,纸箱600自主加360接管回合。

结果及统计口径

作者报告复杂衣物与咖啡的每小时成功吞吐较离线RL加SFT超过翻倍、失败率约减半;除复杂衣物外最终成功率超过90%。固定橙色T恤特定失败模式用每轮600轨迹、两轮后达97%。

局限与风险

复杂衣物训练含11类,但主要定量指标针对衬衫;咖啡指标也只针对双份浓缩,不能扩成所有饮品。系统依赖人工奖励、接管和场景重置;更新为批式离线,探索较简单,尚非完全自主持续在线学习。

复现建议

复现需明确每版本预训练/任务数据、优势标注、人工评分和超时规则,吞吐必须同时包含速度与成功。论文仅称固定双6DoF平台,不能从照片猜厂商;本轮未核验全量训练数据及端到端复现入口。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
实物实验
机器人型号
固定双臂平台(两台6自由度机械臂,型号未给出)

原文图5仅明确静态双臂、每臂6自由度与平行夹爪;厂商和型号未知。

代码与训练

代码待核实 · 官方代码未核实

论文与模型卡可查;不能把其他 π 系列的 openpi 代码直接当作该版本 RECAP 的完整训练实现,状态保持未知。

来源与分类证据