原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
2 · 3 · 4 · 5 · 7 · Appendix A,D
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
PlaNet从64×64图像学循环状态空间模型RSSM,用确定性记忆保存长期历史、随机潜变量表达未观测因素,同时重建图像和预测奖励。每步在潜空间用交叉熵法CEM反复筛选动作序列,只执行第一项后重规划,并持续收集新经验更新模型。
实验设置与硬件
DeepMind Control六仿真任务含Cartpole、Reacher、Cheetah、Finger、Cup和Walker,涉及接触、遮挡与稀疏奖励;比较A3C/D4PG,消融纯确定/随机模型、随机采集、单次随机射击与多步潜变量目标,通常五种子。
结果及统计口径
作者报告接近强无模型基线的成绩而平均少约200倍回合,单V100训练约10–20小时;在线有目标采集及CEM迭代均重要。附录D明确:latent overshooting帮助DRNN,却略降低RSSM表现,不能把它概括为PlaNet必需的增益。
局限与风险
无实机验证,样本效率比较依赖所选六任务与回合定义;模型误差和有限规划窗口限制控制。随机潜状态不是完整校准的不确定性保证,仍需环境奖励与持续在线交互。
复现建议
先重现RSSM与CEM默认版,分别测超射目标和模型结构,不把两者混为一项改进;固定动作重复、预测窗口、采样候选与奖励处理,同时记录环境步数、墙钟训练时间和规划延迟。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- 未核实
无实机;仿真形态不等同于已验证的商业机器人型号。
代码与训练
有开源代码 · 训练代码已开源
官方训练代码为 Apache-2.0;使用较旧 TensorFlow 1.x 与 DMControl 依赖,复现需固定环境。
