具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

从像素学习潜在动力学以进行规划

Learning Latent Dynamics for Planning from Pixels

仅仿真有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

20 页 PDF · 3.0 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

2 · 3 · 4 · 5 · 7 · Appendix A,D

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

PlaNet从64×64图像学循环状态空间模型RSSM,用确定性记忆保存长期历史、随机潜变量表达未观测因素,同时重建图像和预测奖励。每步在潜空间用交叉熵法CEM反复筛选动作序列,只执行第一项后重规划,并持续收集新经验更新模型。

实验设置与硬件

DeepMind Control六仿真任务含Cartpole、Reacher、Cheetah、Finger、Cup和Walker,涉及接触、遮挡与稀疏奖励;比较A3C/D4PG,消融纯确定/随机模型、随机采集、单次随机射击与多步潜变量目标,通常五种子。

结果及统计口径

作者报告接近强无模型基线的成绩而平均少约200倍回合,单V100训练约10–20小时;在线有目标采集及CEM迭代均重要。附录D明确:latent overshooting帮助DRNN,却略降低RSSM表现,不能把它概括为PlaNet必需的增益。

局限与风险

无实机验证,样本效率比较依赖所选六任务与回合定义;模型误差和有限规划窗口限制控制。随机潜状态不是完整校准的不确定性保证,仍需环境奖励与持续在线交互。

复现建议

先重现RSSM与CEM默认版,分别测超射目标和模型结构,不把两者混为一项改进;固定动作重复、预测窗口、采样候选与奖励处理,同时记录环境步数、墙钟训练时间和规划延迟。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仅仿真
机器人型号
未核实

无实机;仿真形态不等同于已验证的商业机器人型号。

代码与训练

有开源代码 · 训练代码已开源

官方训练代码为 Apache-2.0;使用较旧 TensorFlow 1.x 与 DMControl 依赖,复现需固定环境。

来源与分类证据