原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
3 MPPI式短程规划与策略引导 · 4 TOLD奖励、TD值与潜状态一致性 · 5 92任务实验、表1/2和图3–6 · 附录F 超参与动作重复
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
TD-MPC联合学习编码器、确定性潜动力学、奖励、Q值和辅助策略,用多步奖励误差、TD目标及潜状态一致性训练,不重建像素。执行时在潜空间采样短动作序列,将预测短期奖励和末端Q值相加,再按高分轨迹更新分布;辅助策略提供部分候选轨迹。
实验设置与硬件
共评估DMControl及Meta-World v2的92项仿真任务,覆盖状态、像素、稀疏奖励、多任务和本体加视觉输入。状态曲线通常五种子,像素100k表为十次;比较SAC、LOOP、像素RL与带真模拟器的MPC,并移除一致性或更换重建/对比目标。
结果及统计口径
作者在单RTX3090上报告Walker Walk达到940回报需0.47小时,LOOP为7.72小时,SAC为0.41小时;因此优势是样本与规划效率的折中,并非每步计算比SAC更少。像素100k中Finger Spin为943±59,但Cheetah Run为222±88,结果有任务差异。
局限与风险
任务相关潜表示不保证对无关新任务通用,确定性模型未显式校准不确定性;在线优化仍有延迟。论文全部为仿真,不应把后续TD-MPC2或真实机器人工作归入本篇;部分基线数字沿用原作者发布结果。
复现建议
标准规划视野5步、512轨迹加5%策略候选、64精英,通常六轮优化;同时固定优先回放、目标网络、动作重复和环境版本。复现需区分环境步与决策步,分别报告样本量、达到阈值时间及单次推理预算。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- 未核实
无实机;仿真形态不等同于已验证的商业机器人型号。
代码与训练
有开源代码 · 训练代码已开源
官方 PyTorch 训练实现与配置公开,MIT 许可;旧仿真依赖需单独处理。
来源与分类证据
首发日期与任务范围。
查看一手来源任务导向潜动力学、TD 学习与仿真实验。
查看一手来源官方原始 PyTorch 代码与 MIT。
查看一手来源3/4 式3、7–11:Short rollouts plus terminal Q; reward/value/latent-consistency training; deterministic latent components.
查看一手来源5 表1:Image-based100k benchmark uses10 runs; task-specific gains, not uniform superiority.
查看一手来源5 表2:Walker solve threshold940;0.47h TD-MPC,7.72h LOOP,0.41h SAC; per500k TD-MPC5.60h vs SAC1.41h.
查看一手来源附录F 表4/7:H5;512 samples+5% policy;64 elites;action repeat task-dependent.
查看一手来源
