具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

Octo:开源通用机器人策略

Octo: An Open-Source Generalist Robot Policy

实物实验有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

17 页 PDF · 3.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

III-A–E 架构、数据与训练 · IV-A–C 实验与表I/II · 附录D–F 超参、失败设计、各平台协议与表VII

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

将语言、目标图像和多相机历史编码成分块注意力Transformer输入,以只读取上下文的读出令牌连接扩散动作块解码器。增减传感器或动作头时保留主体权重;从Open X-Embodiment筛选25套数据、约80万条轨迹,统一末端增量及夹爪语义。

实验设置与硬件

四家机构九套真实系统分别检验训练域内零样本控制与新域微调。六个微调域约用100条示范,覆盖力矩输入、关节动作、ViperX和ALOHA;对照从零训练与VC-1。零样本每机器人两任务、每任务10次;微调表I标为每域20次,但双臂附录写10次,原文存在协议差异。

结果及统计口径

作者表I报告微调平均成功率72%,从零训练20%、VC-1为15%;WidowX消融支持扩散头和宽数据混合。表VII中未见物体80%,未见环境40%,未见技能仅5%,不能把训练域内零样本结果当作任意新技能泛化。

局限与风险

样本量有限,跨模型预训练数据量不一致;依赖末端动作筛选的数据配方,未提供通用安全保证。九套系统也不等于九种互不重复的机器人型号。

复现建议

论文给出JAX预训练/微调及27M、93M权重;Base用128芯TPU v4训练14小时,24GB A5000微调约5小时。复现须固定数据混合、动作归一化、相机及逐任务成功判据,不能只加载检查点。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
实物实验
机器人型号
Trossen WidowX 250、UR5、RT-1 Robot(专有平台)、Franka、Trossen ViperX、ALOHA(双ViperX)

代码与训练

有开源代码 · MIT 训练、微调与推理代码和预训练权重公开。

约 80 万条 OXE 轨迹;需区分原论文模型与仓库后续 1.5 检查点。模型头适配不等于免示范迁移。

来源与分类证据

  • 首发日期与总体研究范围。

    查看一手来源
  • 附录 F 列出 9 套实机配置、WidowX/UR5/ViperX/ALOHA 等。

    查看一手来源
  • MIT 许可证、训练脚本和模型权重;版本 1.5 更新。

    查看一手来源
  • III-B–D:25 datasets/800k episodes; 300k steps, batch 2048; 50k-step full-model finetuning.

    查看一手来源
  • 表I、附录F-C:Table I says 20 trials/domain; bimanual appendix says 10. Preserve discrepancy.

    查看一手来源
  • 表VII:In-distribution 85%, novel objects 80%, new environment 40%, new skill 5%.

    查看一手来源
  • 附录F:Explicit hardware: WidowX 250, UR5, proprietary RT-1 robot, ViperX, ALOHA; CMU setup uses Franka controller.

    查看一手来源