原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3 · §4 · Table 1 · §6 · Supplementary architecture
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
DDPG将确定性策略梯度与深度actor-critic结合,actor输出连续动作,critic拟合Bellman目标。经验回放降低时序相关,缓慢软更新的双目标网络稳定训练;低维输入使用batch normalization,探索加入Ornstein-Uhlenbeck相关噪声。
实验设置与硬件
在多种MuJoCo连续控制及TORCS任务测试状态和像素输入,像素为连续三帧64×64RGB、动作重复三次。每环境五次独立运行,最多250万步,周期性无探索噪声评估;以随机策略0和具真实动力学的iLQG规划器1归一化。
结果及统计口径
作者表1显示不少状态任务接近或超过规划参照,例如cheetah平均0.903、hardCheetah1.311;相应像素为0.457/1.204。不是所有像素任务都成功,某些均值低于随机;消融支持目标网络和归一化的重要性。
局限与风险
分数是相对回报,不是成功率;最好种子与五次均值应区分。非线性函数近似没有收敛保证,仍需大量试错回合。全为仿真,论文提及机械臂/人形任务不表示真实平台安全部署。
复现建议
复现需固定原始环境、奖励、动作重复、探索噪声与目标更新率,不能把现代库默认DDPG当原论文配置。比较iLQG时要注明其已知模型优势;本轮只核读原论文,未核验原作者完整训练代码或重新跑种子。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- 未核实
代码与训练
代码待核实 · 本次未核实原作者原始实验代码。
仿真在线采样,回放池复用历史数据;行为策略加入探索噪声。
