原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
11 页 PDF · 6.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文原文依据范围
§III-A–D · §IV-A–E · Tables I–III · §V
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
把冻结LSeg的像素语言特征用RGB-D和相机位姿投影、跨视角融合成空间地图,文本嵌入检索开放词汇地标。语言模型生成调用预定义导航原语的代码,解析相对位置与重复动作;不同机器人可按类别生成不同障碍图。
实验设置与硬件
Habitat/Matterport3D十场景评测91组四目标序列,另七场景21条空间指令;目标容差一米。AI2THOR验证LoCoBot与无人机的不同通行图。真实平台是HSR,374帧建图后测试20个语言目标,使用RTAB-Map定位。
结果及统计口径
作者报告多目标连续达成1至4个的成功率59%、34%、22%、15%,空间指令对应62%、33%、14%、10%;真实HSR完成10/20。跨形态障碍图改善部分路径效率,但四目标链成功仍低,不能概括为可靠长程导航。
局限与风险
依赖先建立环境地图、深度和位姿精度;相似物体歧义、重建噪声和动作漂移会失败,未处理持续动态场景。零样本主要指语言/语义组合,不是完全未知地图下自主探索。
复现建议
需保存图像深度标定、地图栅格、特征融合和LLM原语提示,分别计连续链成功、独立子目标与SPL。不要把LoCoBot/无人机仿真写成实机;本次未部署导航。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Toyota HSR、LoCoBot(仿真)、无人机(仿真,型号未注明)
相关机器人档案
代码与训练
有开源代码 · 实现已开源
官方 MIT 代码提供建图与导航应用;使用预训练视觉语言特征,不要求为地图查询重新采集标签或微调模型。依赖模型/数据需分别授权。
