原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
3 最大熵目标 · 4.1/4.2 软策略迭代与SAC · 5.1/5.2 图1–3评测和消融 · 附录C/D 动作压缩与超参
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
原版SAC将奖励与策略熵共同优化,以离策略回放提高利用率。软策略迭代先评估软Q值,再把策略投影到由Q诱导的分布;神经网络版本使用随机重参数化actor、双Q取小值及独立软状态价值网络与目标网络,并用tanh约束连续动作。
实验设置与硬件
论文比较Gym的Hopper、Walker2d、HalfCheetah、Ant、Humanoid以及rllab Humanoid,共六项连续控制仿真。每算法五随机种子,每1000环境步评一次展开;曲线阴影是最小至最大而非置信区间。基线含DDPG、PPO、SQL和同期TD3,另消融确定性策略、奖励缩放及目标更新速度。
结果及统计口径
作者报告简单任务表现可比,困难Humanoid类任务学习更快、跨种子较稳定;确定性变体方差更高。评估用策略均值动作往往提高回报,但曲线只计环境奖励,不包含训练目标中的熵,因此需区分训练目标与测量指标。
局限与风险
收敛证明针对表格化软策略迭代及相应假设,不等于深度网络全局收敛保证。原版对奖励缩放明显敏感,过小会近均匀、过大易过早确定化;本篇没有实体机器人实验,也没有后续版本的自动温度调节验证。
复现建议
复现应锁定2018算法版本、独立V网络、动作对数概率的tanh雅可比修正、百万回放池及256批量。作者奖励缩放在多数任务为5、Gym Humanoid为20、rllab为10;不要无说明替换成现代SAC实现后声称复现原结果。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- 未核实
代码与训练
有开源代码 · 作者TensorFlow实现公开。
回放池训练随机策略与价值网络;此条目对应ICML 2018版本。
来源与分类证据
首发日期、作者与最大熵目标。
查看一手来源原论文连续控制仿真评测。
查看一手来源作者仓库明确对应ICML 2018论文及TensorFlow实现。
查看一手来源4.1:Convergence analysis is tabular soft policy iteration;deep continuous method is approximate.
查看一手来源4.2/附录C:Original implementation uses separate V,dualQ,reparameterized policy,and tanh density correction.
查看一手来源5.1/5.2:5seeds;one evaluation every1000steps;shadingmin/max;mean-action evaluation.
查看一手来源附录D 表1/2:Reward scaling5/20/10 by task;replay1e6,batch256,2×256MLP;no real hardware.
查看一手来源
