具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

NaVILA:面向足式机器人导航的视觉语言动作模型

NaVILA: Legged Robot Vision-Language-Action Model for Navigation

仿真 + 实物有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

17 页 PDF · 9.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§2 · §3.1–3.3 · Tables 4–5 · Appendices I–J

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

高层VILA以当前图像和历史帧理解语言,输出带距离/角度的自然语言移动指令,解析后交给独立的视觉强化学习步态控制器。训练混合仿真导航、人类游览视频、辅助导航和VQA;高层语义与低层避障的接口便于跨本体组合。

实验设置与硬件

评估R2R/RxR未见场景和ScanQA,并把1077条可通行R2R路线导入Isaac物理仿真,比较Go2/H1的感知和盲控。实机25条指令各重复三次,涵盖工作区、家与室外;另有G1展示。

结果及统计口径

作者报告Go2物理仿真成功率由盲控36.2%升至50.2%,H1由24.4%升至45.3%;真实指令测试汇总88%。说明低层环境感知明显影响结果,不能只凭高层语言模型得分判断机器人可执行性。

局限与风险

实机指令数量有限,存在目标位置误判,历史帧受计算限制。部署把Go2图像传到服务器,动作间等待约一秒;直接机载VLA为未来方向。H1出现在仿真比较,不能和G1实机展示混写。

复现建议

复现要分开经典VLN的理想执行、Isaac接触控制和真实试验,保留路线筛选与成功判定。实机使用8帧记忆,64帧的离线问答收益不能直接套用;量化延迟在RTX4090测量,本轮未复现控制栈。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Unitree Go2、Unitree G1

Unitree H1 为仿真;Unitree Go2 兼有仿真/实机;Booster T1 为实机。

代码与训练

有开源代码 · 实现已开源

高层官方仓库已提供训练脚本、评测和权重入口;低层训练另在 legged-loco 仓库。人类视频仅发布 ID/标注,原始视频受版权限制,复现需自行取得。

来源与分类证据