具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

π0.5:具有开放世界泛化能力的视觉-语言-动作模型

π0.5: a Vision-Language-Action Model with Open-World Generalization

实物实验有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

19 页 PDF · 15.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

IV-A–E · V-A–E · Figures 7–13 · VI Discussion · Appendix A-B–D

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

π0.5把多场景移动/固定机械臂、跨形态动作、语言子任务和网络视觉数据共同训练。先以FAST离散动作做自回归预训练,再增加流匹配动作专家;同一模型先预测语义子任务,再条件化生成连续动作段,兼顾语言监督与实时控制。

实验设置与硬件

使用两类自研轮式双臂升降平台,末端/底盘等共18或19维;所有测试场景均未参与训练。三真实住宅的厨房与卧室任务每任务环境十次,另在实体模拟家居场地比较3至104训练地点规模及数据/高层推理消融。约400小时移动示范只是总数据的一部分。

结果及统计口径

作者展示2–5分钟多阶段整理;图7的纵轴是完成进度,实家各任务约65%–95%,不能当作整段二元成功率。增加训练地点及跨形态/跨环境数据提高表现;网络数据在普通整理消融不显著,却帮助新物体指令与高层选择。

局限与风险

陌生把手、难开柜门、遮挡和重复开关抽屉仍失败;短上下文及简单指令限制跨房间记忆与复杂偏好。控制链未加独立规划或碰撞检测,研究展示不意味着适合无人监督家居使用,论文未给可确认的商业整机型号。

复现建议

复现需获得完整混合数据与子任务标注,并区分预训练280K步和后训练80K步;动作专家十步去噪,50Hz指令由分块实现。评估应使用附录进度评分、留出住宅与数据混合消融,不能只引用视频成功片段。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
实物实验
机器人型号
两类轮式双臂移动操作平台(商业型号未明确)

代码与训练

有开源代码 · openpi 已公开 π0.5 模型与实现;公开版本范围有限。

Apache-2.0 与 Gemma 条款;当前实现仅支持 π0.5 流匹配头,公开版本使用 knowledge insulation,不能视为原文全流程原样复现。

来源与分类证据