原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3–5,PDF页3–7 · §6结果,PDF页8–9 · §7讨论与限制,PDF页10
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
保存各模型生成的候选池,再由四种固定代理模型交叉重评分;所有动作从同一仿真状态执行,获得真实成本和参考精英集。比较精英重合、成对排序,以及提案均值和宽度的不同归一化距离;仅替换首轮精英集并固定后续模型和随机样本,检验更新后果。
实验设置与硬件
DeepMind Control Suite的Walker walk与Cheetah run各训练6个独立Dreamer,共12个任务—种子单位。每单位4个状态,CEM为4轮、256候选、32精英、15步;完整交叉审计执行196608个序列,另留6单位检验预先选定干预。
结果及统计口径
全部单位的预定提案距离都下降,但Walker排序约0.503近随机,Cheetah从0.535降至0.523。环境精英替换在12单位均降低最终所选序列成本;合并归一化改善为Walker −0.329、Cheetah −0.766。
局限与风险
变化受距离定义和搜索宽度影响,不能把收缩误解为排序提高。只覆盖两任务、少量状态及单一规划配置;首轮干预使用部署时不可得的环境真值,且有限时域序列成本不等于闭环回报。
复现建议
复现关键是精确保存/恢复仿真状态、候选ID、共同高斯随机样本及独立训练种子;统计单位是任务—种子而非数十万候选。应同时报告距离组成、精英恢复和真实成本,不能只复制一个聚合指标。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- DeepMind Control Suite Walker(仿真)、DeepMind Control Suite Cheetah(仿真)
型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。
代码与训练
代码待核实 · 代码状态未核实
复现关键是精确保存/恢复仿真状态、候选ID、共同高斯随机样本及独立训练种子;统计单位是任务—种子而非数十万候选。应同时报告距离组成、精英恢复和真实成本,不能只复制一个聚合指标。 论文许可不代表代码许可,代码实际发布状态仍未知。
