原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§III–IV,PDF页2–4 · §V-A–C及表I–II,PDF页3–5 · §V-D–E及表III,PDF页5–6 · §VI,PDF页6
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
将原POMDP替换成奖励/动作历史输入,MLP-LSTM隐状态送入策略和价值网络。PPO之外加入模仿状态专家的动作损失以缓解探索困难;迁移后可用该策略给目标域访问状态提供DAgger标签,最终学生只读取目标图像。
实验设置与硬件
在Pointmass、DMC Cartpole及2D赛车训练,跨颜色变化、同动力学3D赛车渲染及Habitat-Sim两处HM3D真实建筑扫描测试。奖励由距离与航向密集信号构造;另用10万目标图像样本对比奖励和状态估计。
结果及统计口径
奖励策略达到状态策略约95%、66%、70%表现。3D赛车学生约7万步接近最优;图像Cartpole中奖励估计路线回报735.83,状态估计路线189.41,后者近随机192.78。Habitat示例为仿真Stretch导航。
局限与风险
需要全程信息充分的密集奖励,稀疏奖励无法有效定位;源/目标共享动力学等是假设而非一般迁移保证。历史标量使高维探索更难,6维Pointmass仅约57%最优奖励;实机定位、奖励获取和动态差异未验证。
复现建议
复现需保持奖励定义、动作尺度和动力学一致,明确颜色/渲染变化与真实动力学迁移不同。应计入源域专家及奖励估计数据成本,并测量探索步骤;不要把真实楼宇扫描或Stretch仿真渲染记作实体机器人试验。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- Stretch移动机器人(Habitat-Sim仿真)、DMC Cartpole(仿真)、Pointmass及赛车代理(仿真)
型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。
代码与训练
代码待核实 · 代码状态未核实
复现需保持奖励定义、动作尺度和动力学一致,明确颜色/渲染变化与真实动力学迁移不同。应计入源域专家及奖励估计数据成本,并测量探索步骤;不要把真实楼宇扫描或Stretch仿真渲染记作实体机器人试验。 论文许可不代表代码许可,代码实际发布状态仍未知。
