具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

世界模型

World Models

仅仿真代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

21 页 PDF · 3.0 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

2.1–2.3 · 3.1–3.3 · 4.1–4.3 · 5 · 7 · Tables 1–2

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

World Models把感知VAE、预测潜状态分布的MDN-RNN和小线性控制器分开训练。先用随机策略采集一万条轨迹训练V/M,再由CMA-ES优化控制器;动作依据潜变量及循环记忆,部分实验把优化过程移到模型生成的潜在环境。

实验设置与硬件

CarRacing-v0检验原游戏环境内训练的控制器,比较仅视觉和加入循环记忆;VizDoom Take Cover则在“梦境”中训练后迁回真实游戏引擎,改变MDN采样温度研究模型漏洞。两者都是游戏模拟,文中real environment不是现实机器人。

结果及统计口径

CarRacing100次随机赛道平均906±21,达到其900分解决标准;Doom温度1.15时原游戏生存1092±556步,而随机策略210±108。过低温度会让策略找到使火球消失等模型漏洞,适度随机性有助减少利用不实动力学。

局限与风险

控制器在CarRacing并非完全在梦境训练;模型由随机探索数据训练,未覆盖的新状态易产生幻觉。较高温度也会使学习过难,潜特征可能重建无关细节而遗漏任务信息;示例无法证明一般世界建模能力。

复现建议

分别复现CarRacing与Doom训练场所、终止模型、采样温度及CMA-ES种群设置;报告原游戏验证而非仅想象奖励。固定历史依赖版本和随机种子,检查游戏步数与真实机器人时间不可互换。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仅仿真
机器人型号
未核实

无实机;仿真形态不等同于已验证的商业机器人型号。

代码与训练

代码待核实 · 代码公开,许可未核实

作者提供 TensorFlow 参考实验及复现教程;仓库顶层许可未核实,不能据公开代码推断完整开源授权。

来源与分类证据