原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
2.1–2.3 · 3.1–3.3 · 4.1–4.3 · 5 · 7 · Tables 1–2
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
World Models把感知VAE、预测潜状态分布的MDN-RNN和小线性控制器分开训练。先用随机策略采集一万条轨迹训练V/M,再由CMA-ES优化控制器;动作依据潜变量及循环记忆,部分实验把优化过程移到模型生成的潜在环境。
实验设置与硬件
CarRacing-v0检验原游戏环境内训练的控制器,比较仅视觉和加入循环记忆;VizDoom Take Cover则在“梦境”中训练后迁回真实游戏引擎,改变MDN采样温度研究模型漏洞。两者都是游戏模拟,文中real environment不是现实机器人。
结果及统计口径
CarRacing100次随机赛道平均906±21,达到其900分解决标准;Doom温度1.15时原游戏生存1092±556步,而随机策略210±108。过低温度会让策略找到使火球消失等模型漏洞,适度随机性有助减少利用不实动力学。
局限与风险
控制器在CarRacing并非完全在梦境训练;模型由随机探索数据训练,未覆盖的新状态易产生幻觉。较高温度也会使学习过难,潜特征可能重建无关细节而遗漏任务信息;示例无法证明一般世界建模能力。
复现建议
分别复现CarRacing与Doom训练场所、终止模型、采样温度及CMA-ES种群设置;报告原游戏验证而非仅想象奖励。固定历史依赖版本和随机种子,检查游戏步数与真实机器人时间不可互换。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- 未核实
无实机;仿真形态不等同于已验证的商业机器人型号。
代码与训练
代码待核实 · 代码公开,许可未核实
作者提供 TensorFlow 参考实验及复现教程;仓库顶层许可未核实,不能据公开代码推断完整开源授权。
