具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

引导式策略搜索

Guided Policy Search

仅仿真代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

9 页 PDF · 1.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

3 · 4.1–4.3 · 5 · 6 · Algorithm 1; Figs 2–5

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

2013版GPS先用微分动态规划DDP找到随机反馈轨迹分布,从中采样初始化神经网络策略,再把这些引导样本和策略自身经验放进正则化重要性采样目标。优化和采样交替进行,必要时适应引导分布,使高回报局部解推动更通用策略搜索。

实验设置与硬件

MuJoCo平面游泳、单腿跳、行走及三维人形跑步,输入关节角/速度,输出关节力矩,带电机噪声。比较无正则、只预训练不用后续引导、重启分布、普通策略梯度和模仿DDP的DAgger;有50隐单元、500步时域等受控配置。

结果及统计口径

完整方法学得多个步态并达到初始引导轨迹回报,正则项与搜索期间持续引导均重要;只利用起始样本可能陷入坏局部解。适应指导分布帮助融合多个初始示范并改善策略,展示优化与学习结合的可行性。

局限与风险

依赖可用可微或可数值求导的动力学、奖励和有效DDP初值;重要性权重仍可能高方差,复杂策略目标非凸。仅状态输入仿真控制,没有本篇视觉端到端PR2或真实机器人结果。

复现建议

先复现低维游泳/跳跃的DDP引导采样及LBFGS正则目标,检查概率密度和融合采样分布,记录真实交互样本数。保留本文版本边界,不用后续GPS的局部线性学习动态、BADMM或视觉策略流程替代。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仅仿真
机器人型号
未核实

代码与训练

代码待核实 · 本次未核实2013原始实验的官方代码包。

模型辅助轨迹优化产生引导样本,再迭代优化参数化策略。

来源与分类证据