具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
经典研究

用于模型预测控制的时序差分学习

Temporal Difference Learning for Model Predictive Control

仅仿真有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

20 页 PDF · 12.0 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

3 MPPI式短程规划与策略引导 · 4 TOLD奖励、TD值与潜状态一致性 · 5 92任务实验、表1/2和图3–6 · 附录F 超参与动作重复

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

TD-MPC联合学习编码器、确定性潜动力学、奖励、Q值和辅助策略,用多步奖励误差、TD目标及潜状态一致性训练,不重建像素。执行时在潜空间采样短动作序列,将预测短期奖励和末端Q值相加,再按高分轨迹更新分布;辅助策略提供部分候选轨迹。

实验设置与硬件

共评估DMControl及Meta-World v2的92项仿真任务,覆盖状态、像素、稀疏奖励、多任务和本体加视觉输入。状态曲线通常五种子,像素100k表为十次;比较SAC、LOOP、像素RL与带真模拟器的MPC,并移除一致性或更换重建/对比目标。

结果及统计口径

作者在单RTX3090上报告Walker Walk达到940回报需0.47小时,LOOP为7.72小时,SAC为0.41小时;因此优势是样本与规划效率的折中,并非每步计算比SAC更少。像素100k中Finger Spin为943±59,但Cheetah Run为222±88,结果有任务差异。

局限与风险

任务相关潜表示不保证对无关新任务通用,确定性模型未显式校准不确定性;在线优化仍有延迟。论文全部为仿真,不应把后续TD-MPC2或真实机器人工作归入本篇;部分基线数字沿用原作者发布结果。

复现建议

标准规划视野5步、512轨迹加5%策略候选、64精英,通常六轮优化;同时固定优先回放、目标网络、动作重复和环境版本。复现需区分环境步与决策步,分别报告样本量、达到阈值时间及单次推理预算。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仅仿真
机器人型号
未核实

无实机;仿真形态不等同于已验证的商业机器人型号。

代码与训练

有开源代码 · 训练代码已开源

官方 PyTorch 训练实现与配置公开,MIT 许可;旧仿真依赖需单独处理。

来源与分类证据