具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

H-VLA:在统一动作空间中结合关键动作推理与运动规划的层级视觉—语言—动作模型

H-VLA: Hierarchical Vision-Language-Action Model with Key-Action Reasoning and Motion Planning in a Unified Action Space

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

27 页 PDF · 21.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

3.1–3.6 · 4.1–4.4 · 5 Limitations · Appendix A · Appendix C.2–C.3 · Appendix D.1–D.3

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

H-VLA用Prismatic-7B视觉语言骨干提取认知特征,先由扩散模块生成末端位姿与夹爪组成的关键动作,再由另一扩散模块生成密集动作段。状态、子目标及动作统一到已标定第三人称相机坐标;关键帧按夹爪变化及轨迹终点自动标注,先重关键动作预训练,再等权联合微调。

实验设置与硬件

混合约18.3万轨迹预训练,分别微调后测Google/WidowX的SimplerEnv。真实双臂Agilex PiPER用三任务共150示范;H-VLA及π系列各228次,分ID、位置OOD和场景/物体OOD,CogACT与MolmoAct2只做较少的ID/位置试验。

结果及统计口径

作者报告仿真三个分割均值91%、84%、81%;真机三类条件的任务宏平均93%、83%、66%。位置OOD比最强所测对照高47点,但场景变化中的LiftPot仍落后π系列,且这些均值不是按所有试次合并的比例。

局限与风险

基线预训练数据、相机输入及评测数量不同,CogACT仅一个视角。关键标签会漏掉中间接触事件;相机外参误差敏感性未系统测,灵巧接触与变形操作仍困难。训练数据中的Franka不能算新增实机验证。

复现建议

复现需保留跨数据集标定、单/双臂掩码和关键动作标签;八H100预训练约三天,真机适配四H100约一天。附录列逐任务试次数、无提前成功终止的仿真协议及PiPER硬件,4090端到端推理约103毫秒。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Agilex PiPER(双臂Cobot Magic式平台)、Google Robot(SimplerEnv仿真)、WidowX(SimplerEnv仿真)

实机为两台 PiPER 从臂,Cobot Magic 风格配置;Google Robot/WidowX 是仿真基准原文名称,未推断更细子型号。

相关机器人档案

代码与训练

代码待核实 · 未核实公开训练代码

已查论文正文/附录和作者相关结果,未发现可核实的官方实现链接。

来源与分类证据

  • 摘要、§4 与附录 C/D:SimplerEnv、Agilex PiPER、Cobot Magic 风格实机及比较协议。

    查看一手来源
  • 3; Appendix A:统一相机坐标依赖标定;单臂七维、模型统一十四维。

    查看一手来源
  • Appendix D.1; D.3; Tables 11–12:PiPER真机;228与80试次配置不同,宏平均。

    查看一手来源
  • 4.3; Table 3:7.7B总参数,4090 103ms含腕相机编码。

    查看一手来源