具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
经典研究

深度视觉运动策略的端到端训练

End-to-End Training of Deep Visuomotor Policies

仿真 + 实物有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

40 页 PDF · 6.0 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§4–5 · §6.1,6.4–6.6 · Figure 9 · Table 4 · §7 · Appendix B footnote 5

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

引导式策略搜索把局部轨迹优化与视觉策略监督学习交替进行,训练时利用完整状态,执行时只用相机与本体。CNN空间softmax把特征图转为可微坐标点,再映射到控制量;先预训练视觉和局部控制器,最后联合端到端优化。

实验设置与硬件

除仿真策略搜索比较外,在PR2测试挂衣架、形状盒插块、锤爪配准和拧瓶盖。评测训练位置、新位置/握姿及视觉杂物,目标位置变化约10–20厘米;各任务使用156–288次五秒控制试验,另有约1000张视觉预训练图。

结果及统计口径

作者报告端到端方式优于冻结位置特征或显式位姿预测。图9中插块新位置成功91.7%、视觉干扰87.5%;瓶盖对应83.3%、62.5%,显示视觉变化仍明显削弱效果。约15分钟实机试验不含全部图像采集和3–4小时计算训练。

局限与风险

训练需要仪器化完整状态及受限任务分布,大幅背景改变或遮挡会失败;不能从端到端推断无预训练或无状态监督。PR2实际为effort接口而非理想闭环力矩控制,硬件接口需区别。

复现建议

保留空间softmax、状态可见性划分、局部控制器约束和视觉预训练,逐项报告试验数与采集成本。本次视觉核对PDF图9后引用成绩,未执行历史训练栈。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
PR2

代码与训练

有开源代码 · 作者团队GPS重实现公开;历史依赖较旧。

训练阶段需要比执行阶段更丰富的状态信息与轨迹控制器。

来源与分类证据