具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
经典研究

TD-MPC2:面向连续控制的可扩展、稳健世界模型

TD-MPC2: Scalable, Robust World Models for Continuous Control

仅仿真有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

31 页 PDF · 7.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§3.1–3.3 · §4 · Figures 4,7 · §5

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

学习不解码图像的控制导向潜在动力学,同时预测奖励和TD终值,再用短时域采样MPC结合终值与策略先验选动作。SimNorm把潜在维度分组归一化,奖励/价值使用对数空间离散回归,多任务借任务嵌入、状态填充和动作掩码共享模型。

实验设置与硬件

在DMControl39、Meta-World50、ManiSkill2五及MyoSuite十任务共104个仿真连续控制任务上,以同组超参数对比SAC、DreamerV3和TD-MPC,主要结果三种子及95%区间;另测试80任务离线数据预训练、模型规模和新任务微调。

结果及统计口径

作者报告总体数据效率与最终表现优于对照,规模实验在80任务上由1M模型约16的归一化分数升至317M模型约70.6。归一化分数并非统一成功率;结果显示模型容量、SimNorm及价值学习稳定化共同影响表现。

局限与风险

主要使用状态输入和仿真,像素结果只在子集验证,没有真实机器人部署证据。MPC仍依赖模型和价值误差,模型变大增加推理/训练成本;跨任务共享需要任务标识,非自然语言开放目标理解。

复现建议

应同时复现奖励尺度处理、Q集成、SimNorm、动作掩码和规划预算,不能只替换骨干后归因容量。需区分单任务在线交互和离线多任务训练的数据预算,本次未运行基准。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仅仿真
机器人型号
未核实

无实机;仿真形态不等同于已验证的商业机器人型号。

代码与训练

有开源代码 · 训练代码已开源

官方 MIT 仓库提供训练、模型和数据链接;README 明确第三方代码遵守各自许可。

来源与分类证据