原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3 · §4.1–4.4 · §5.1–5.3 · Table 1 · §6
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
提出基于Matterport真实全景的离散导航模拟器与R2R语言路线基准。基线用LSTM编码指令,注意力解码器结合当前ResNet图像特征和上一动作;比较教师强制与学生自行采样行动,再用当前位置到目标最短路监督。
实验设置与硬件
数据含21567条指令、平均29词、每路径三描述;61建筑用于训练/已见验证,11未见验证,18测试。智能体六种动作含停止,最终距目标小于3米算成功,另报沿轨迹最佳停止的oracle成功;1390测试指令有人类参照。
结果及统计口径
作者表1学生强制在已见验证38.6%、未见验证21.8%、测试20.4%,测试人类86.4%、随机13.2%。明显的已见/未见差距使环境泛化成为关键问题,而正确停止本身也占据显著难度。
局限与风险
真实图像来源不等于实体机器人;动作沿预定义导航图跳转,弱化避障、动力学和视觉里程计。终点3米指标不检查完整路线遵从,oracle成功更不能视作机器人自行判断完成;没有实机型号。
复现建议
复现须严格按建筑划分、固定视场和30度相机转动、词表与训练策略,测试提交模型使用训练及验证数据的设置应透明。模拟器代码与Matterport场景授权分别处理,本轮未运行基线或重新标注数据。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- 未核实
代码与训练
有开源代码 · 实现已开源
官方仓库提供模拟器、R2R 数据准备和学习基线;场景数据需遵循独立 Matterport3D 使用条款。
