原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§2 · §3.1–3.3 · Tables 4–5 · Appendices I–J
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
高层VILA以当前图像和历史帧理解语言,输出带距离/角度的自然语言移动指令,解析后交给独立的视觉强化学习步态控制器。训练混合仿真导航、人类游览视频、辅助导航和VQA;高层语义与低层避障的接口便于跨本体组合。
实验设置与硬件
评估R2R/RxR未见场景和ScanQA,并把1077条可通行R2R路线导入Isaac物理仿真,比较Go2/H1的感知和盲控。实机25条指令各重复三次,涵盖工作区、家与室外;另有G1展示。
结果及统计口径
作者报告Go2物理仿真成功率由盲控36.2%升至50.2%,H1由24.4%升至45.3%;真实指令测试汇总88%。说明低层环境感知明显影响结果,不能只凭高层语言模型得分判断机器人可执行性。
局限与风险
实机指令数量有限,存在目标位置误判,历史帧受计算限制。部署把Go2图像传到服务器,动作间等待约一秒;直接机载VLA为未来方向。H1出现在仿真比较,不能和G1实机展示混写。
复现建议
复现要分开经典VLN的理想执行、Isaac接触控制和真实试验,保留路线筛选与成功判定。实机使用8帧记忆,64帧的离线问答收益不能直接套用;量化延迟在RTX4090测量,本轮未复现控制栈。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Unitree Go2、Unitree G1
Unitree H1 为仿真;Unitree Go2 兼有仿真/实机;Booster T1 为实机。
代码与训练
有开源代码 · 实现已开源
高层官方仓库已提供训练脚本、评测和权重入口;低层训练另在 legged-loco 仓库。人类视频仅发布 ID/标注,原始视频受版权限制,复现需自行取得。
来源与分类证据
首版 2024-12-05,2025 修订;核对两级方法与实验范围。
查看一手来源§III-C/D、表 IV/VI 区分 Go2/H1 仿真与 Go2/Booster T1 实机。
查看一手来源作者项目页直链高层/低层代码与基准。
查看一手来源高层 Apache-2.0;训练脚本、数据标注与视频版权限制有明确说明。
查看一手来源低层训练 MIT 仓库,说明 Isaac Lab 中 Go2/H1 训练。
查看一手来源§3.2 / Table 4:Go2/H1是物理仿真;低层感知提升成功率。
查看一手来源§3.3:25指令×3;正文另提G1实机,无需重训高层。
查看一手来源Appendix I:图像传服务器、约1秒间隔;机载VLA尚为未来工作。
查看一手来源
