具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

在交叉熵方法中,世界模型也是一种候选提案机制

In CEM, a World Model Is Also a Proposal Mechanism

仅仿真代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

20 页 PDF · 0.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§3–5,PDF页3–7 · §6结果,PDF页8–9 · §7讨论与限制,PDF页10

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

保存各模型生成的候选池,再由四种固定代理模型交叉重评分;所有动作从同一仿真状态执行,获得真实成本和参考精英集。比较精英重合、成对排序,以及提案均值和宽度的不同归一化距离;仅替换首轮精英集并固定后续模型和随机样本,检验更新后果。

实验设置与硬件

DeepMind Control Suite的Walker walk与Cheetah run各训练6个独立Dreamer,共12个任务—种子单位。每单位4个状态,CEM为4轮、256候选、32精英、15步;完整交叉审计执行196608个序列,另留6单位检验预先选定干预。

结果及统计口径

全部单位的预定提案距离都下降,但Walker排序约0.503近随机,Cheetah从0.535降至0.523。环境精英替换在12单位均降低最终所选序列成本;合并归一化改善为Walker −0.329、Cheetah −0.766。

局限与风险

变化受距离定义和搜索宽度影响,不能把收缩误解为排序提高。只覆盖两任务、少量状态及单一规划配置;首轮干预使用部署时不可得的环境真值,且有限时域序列成本不等于闭环回报。

复现建议

复现关键是精确保存/恢复仿真状态、候选ID、共同高斯随机样本及独立训练种子;统计单位是任务—种子而非数十万候选。应同时报告距离组成、精英恢复和真实成本,不能只复制一个聚合指标。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仅仿真
机器人型号
DeepMind Control Suite Walker(仿真)、DeepMind Control Suite Cheetah(仿真)

型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。

代码与训练

代码待核实 · 代码状态未核实

复现关键是精确保存/恢复仿真状态、候选ID、共同高斯随机样本及独立训练种子;统计单位是任务—种子而非数十万候选。应同时报告距离组成、精英恢复和真实成本,不能只复制一个聚合指标。 论文许可不代表代码许可,代码实际发布状态仍未知。

来源与分类证据

  • §4–5,PDF页5–7:四模型交叉评分、12独立单位及196608候选;Identity宽度1280,其余256,非严格容量匹配。

    查看一手来源
  • §6.1–6.3,PDF页8–9:排序不改善;单轮替换最终成本在12单位均下降。

    查看一手来源
  • §7,PDF页10:明确定位为重置环境中的oracle诊断,不证明闭环收益。

    查看一手来源
  • PDF页8(已渲染目视核对):核对该页关键图表的行列对应、实验类别与数值;分析范围仅限sectionsRead所列章节,并非逐页翻译。

    查看一手来源