具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

π0:面向通用机器人控制的视觉-语言-动作流模型

π0: A Vision-Language-Action Flow Model for General Robot Control

实物实验有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

17 页 PDF · 7.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§IV–V · §VI-A–D · Figures 5,11–13 · §VII

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

基于PaliGemma视觉语言主干加入较小动作专家,以条件流匹配生成50步连续动作块,多相机、指令和关节状态共同输入。先在跨机器人广泛数据上预训练,再用质量与策略一致性更高的任务数据后训练,动作维度填充兼容多个平台。

实验设置与硬件

自有约一万小时、七种配置、68任务数据与OXE等混合;评测预训练内直接指令任务、语言遵循、1/5/10小时微调及复杂长程任务。多类实机包括UR5e、Franka、双Trossen/ARX和移动平台,各主评测通常十次。

结果及统计口径

作者报告基础模型在五项直接评测中明显优于所测对照;等计算量版本仍领先。后训练后,叠衣、清桌、装盒等复杂任务平均进度均超过最大分数一半。分数可给部分完成,不能改写成所有复杂任务成功率超过50%。

局限与风险

基础模型的直接评测主要为预训练含有的任务;长任务部分需要高层语言指导,不能全部称自主发现流程。全模型和对照训练预算不一,虽补有计算量匹配控制;十次试验不足以证明长期可靠性。

复现建议

复现要同时控制预训练混合、平台动作定义、后训练示范品质与评分规程,不能只复制流匹配结构。应逐项注明是否预训练见过、是否有高层提示,结果均为作者报告。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
实物实验
机器人型号
UR5e、Franka(正文未在此处细分型号)、Trossen双臂、ARX双臂、Mobile Trossen、Mobile Fibocom

代码与训练

有开源代码 · 官方 openpi 提供模型、检查点与训练/推理实现。

代码 Apache-2.0,另含 Gemma 条款;论文大规模自采数据未全部公开。开放版本与原文内部系统并非完全相同。

来源与分类证据