原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3.1–3.3 · §4 · Figures 4,7 · §5
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
学习不解码图像的控制导向潜在动力学,同时预测奖励和TD终值,再用短时域采样MPC结合终值与策略先验选动作。SimNorm把潜在维度分组归一化,奖励/价值使用对数空间离散回归,多任务借任务嵌入、状态填充和动作掩码共享模型。
实验设置与硬件
在DMControl39、Meta-World50、ManiSkill2五及MyoSuite十任务共104个仿真连续控制任务上,以同组超参数对比SAC、DreamerV3和TD-MPC,主要结果三种子及95%区间;另测试80任务离线数据预训练、模型规模和新任务微调。
结果及统计口径
作者报告总体数据效率与最终表现优于对照,规模实验在80任务上由1M模型约16的归一化分数升至317M模型约70.6。归一化分数并非统一成功率;结果显示模型容量、SimNorm及价值学习稳定化共同影响表现。
局限与风险
主要使用状态输入和仿真,像素结果只在子集验证,没有真实机器人部署证据。MPC仍依赖模型和价值误差,模型变大增加推理/训练成本;跨任务共享需要任务标识,非自然语言开放目标理解。
复现建议
应同时复现奖励尺度处理、Q集成、SimNorm、动作掩码和规划预算,不能只替换骨干后归因容量。需区分单任务在线交互和离线多任务训练的数据预算,本次未运行基准。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- 未核实
无实机;仿真形态不等同于已验证的商业机器人型号。
代码与训练
有开源代码 · 训练代码已开源
官方 MIT 仓库提供训练、模型和数据链接;README 明确第三方代码遵守各自许可。
