具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

通过第一人称全身人类数据预训练迈向通用人形机器人运动操作模型

Towards a General Humanoid Loco-Manipulation Model via Egocentric Whole-Body Human Data Pretraining

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

15 页 PDF · 38.0 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

第3节数据采集与重定向,PDF第3–5页 · 第4节策略与训练,PDF第5–6页 · 第5节实验、表1–3及图8–10,PDF第7–10页 · 第6节局限,PDF第10页

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

HumanVerse-500含32993回合、827任务类型及8700万姿态帧,PICO追踪身体、视频恢复手部并做时空对齐。λ0用Qwen3.5-2B及流匹配动作专家共享迁移核心,域专用投影区分人机;SONIC把人体动作重定向为G1运动潜变量并控制全身。

实验设置与硬件

三阶段依次使用七个人类手物数据源、500小时全身数据和机器人遥操作。SIMPLE六任务三级各10回合,真实G1配Revo2双手在四任务各10个固定初始配置测试;消融人类训练阶段并扫描5%至100%全身数据。

结果及统计口径

仿真整体成功率90.0%,高于StarVLA86.1%;真机25/40即62.5%,进度80.4%,π0.5为40.0%成功。去掉全身中间训练真机降至22.5%;机器人未见但人类数据见过对象的平均进度55.8%,机器人单独训练零样本为48.4%。

局限与风险

只验证G1,跨大型人形形态未测;重定向、相机高度与身体比例仍有偏差。每任务仅10次,规模拟合为单次运行且仅描述测量区间;部分仿真基线保留来源协议,不能视作全部同预算重跑。

复现建议

应保留动作域标识、有效性掩码、64维SONIC与双6维手命令接口,并记录不同阶段EMA初始化。比较数据规模要匹配机器人数据、更新预算和检查点选择,明确human-guided不同于完全零样本。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Unitree G1 + BrainCo Revo 2双手(真机)、SIMPLE人形机器人(仿真)

型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。

代码与训练

代码待核实 · 代码状态未核实

应保留动作域标识、有效性掩码、64维SONIC与双6维手命令接口,并记录不同阶段EMA初始化。比较数据规模要匹配机器人数据、更新预算和检查点选择,明确human-guided不同于完全零样本。 论文许可不代表代码许可,代码实际发布状态仍未知。

来源与分类证据

  • PDF第8页表1–2(已渲染核看):真实25/40、仿真90.0%;进度与成功是不同指标,椅子任务进度并非最高。

    查看一手来源
  • PDF第9页表3:去Stage II为22.5%真机成功,去Stage I为50.0%,两个阶段贡献不同。

    查看一手来源
  • PDF第9–10页§5.4及图10:Human-guided对象B只在人的演示出现,不能宣称所有训练均未见。

    查看一手来源