原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§2–3 · §4.1–4.5 · Tables 2–3 · Appendix B, E
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
GR00T N1将Eagle-2视觉语言模块与流匹配Diffusion Transformer相连,以本体专用编码/解码适配不同状态动作维度。混合真实遥操作、物理仿真、人类视频和生成视频,借潜在动作或逆动力学伪标签利用无动作视频,再进行任务后训练。
实验设置与硬件
仿真覆盖RoboCasa24、DexMimicGen9及GR-1桌面24任务,每任务30/100/300示范;真实Fourier GR-1涵盖抓放、关节物体、工业和协作任务。多数实机任务10次,Pack Machinery五次并按物体完成数计分,使用阶段性部分得分。
结果及统计口径
作者表3全数据平均76.8%,Diffusion Policy46.4%;仅10%数据为42.6%,基线10.2%。仿真100示范设置平均45.0%,基线33.4%;这是后训练收益,不能当所有新任务零样本成功率。
局限与风险
实机主要桌面操作,不证明行走或开放世界通用性。部分成功计分使百分比并非严格完整回合成功;仿真选择末五检查点最高分。预训练规模、数据混合与模型容量共同变化,不能全归于单一架构。
复现建议
复现应区分预训练两任务测试、后训练及视频增强分支,保留任务权重、部分计分、checkpoint选择和本体接口。论文提供模型/数据/基准入口,但发布资产不等于本轮已验证完整大规模预训练可复现。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Fourier GR-1
代码与训练
有开源代码 · 官方代码与 GR00T-N1-2B 权重公开;主仓库已演进到后续版本。
代码与模型权重许可分开,权重按 NVIDIA 模型条款;复现须固定 N1 对应版本,不能把新主分支当原论文实现。
来源与分类证据
2025-03-18 首发与模型摘要。
查看一手来源第 4 节分别给出 Panda/GR-1 仿真与 GR-1 实机评测。
查看一手来源官方可用代码与独立代码/权重许可;当前主分支为后续版本。
查看一手来源原 N1-2B 权重及 NVIDIA 模型许可入口。
查看一手来源§4.3:实机部分计分;仿真末五检查点取最高。
查看一手来源Table 3:76.8%为后训练真实任务平均;10%数据42.6%。
查看一手来源§4.4:预训练单独两任务,不能与后训练结果混为零样本。
查看一手来源PDF p.15, Tables 2–3 (visual inspection):已核对仿真45.0%与实机76.8%属于不同表及设置;页面明确预训练测试允许0.5部分得分。
查看一手来源
