具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
经典研究

学习灵巧的手内操作

Learning Dexterous In-Hand Manipulation

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

27 页 PDF · 4.4 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

2 硬件、MuJoCo/Unity与任务 · 3 随机化和观察 · 4–5 LSTM/PPO与视觉估计 · 6.2–6.6 表3–6、消融、规模 · 归档v5 PDF第10页表3可视复核

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

Dactyl用循环PPO和非对称actor-critic学习Shadow手内物体重定向;训练时随机化动力学、观察与动作噪声及未建模效应,借记忆适应每回合不同参数。控制策略接收指尖位置和物体目标误差,输出分成11档的相对关节目标;视觉网络另用随机化合成图估计物体位置姿态。

实验设置与硬件

任务对象为方块及八棱柱,每成功一次就换目标,掉落、超时或累计50次结束。每策略仿真100次、实机10次,并比较锁腕、视觉/动捕物体估计、随机化组及是否有记忆。Shadow手24自由度、20组驱动,12Hz策略经约1kHz低层执行。

结果及统计口径

作者表3报告实机方块状态输入连续成功均值18.8、中位13,视觉输入均值15.2、中位11.5;仿真状态均值43.4,现实差距仍明显。去全部随机化后实机中位数为0,去物理随机化为2,支持强随机化而非单靠理想仿真。

局限与风险

视觉版仍用PhaseSpace追踪五个指尖,且实验采用白背景并清洁物体;不使用触觉输入。对象有限,十次试验方差大,50次是截断上限;作者还报告硬件损坏影响实验。手从预放物体开始,不是任意抓取与操作。

复现建议

默认训练资源为8GPU优化器加6144个CPU采样核,完全随机化达到相似仿真表现约需百年模拟经验、50小时墙钟。复现需手部校准、追踪、三相机、Unity视觉渲染及低层控制,不可把后续robogym当作完整原实验包。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Shadow Dexterous Hand

代码与训练

代码待核实 · 本次未核实2018原实验的完整官方训练代码。

分布式RL在随机化仿真中训练控制策略,视觉估计器与硬件系统另行构建;后续robogym不能直接视为本篇完整复现包。

来源与分类证据

  • arXiv原始记录:标题、首发日期与方法摘要。

    查看一手来源
  • 原文核对Shadow手、仿真训练与真实实验范围。

    查看一手来源
  • 研究团队的项目说明与实验展示。

    查看一手来源
  • 2.1/3.1:Shadow24DoF/20actuators;PhaseSpace fingertip tracking even in vision object-pose setup;no tactile input.

    查看一手来源
  • 6.2 表3:100sim/10real per policy;cap50;state18.8mean/13median;vision15.2mean/11.5median.

    查看一手来源
  • 6.3 表4:Without all randomization real median0;without physics median2.

    查看一手来源
  • 6.3/6.5:~100years simulated experience≈50h;default8GPU+6144CPU rollout cores.

    查看一手来源
  • v5 PDF p10/Table3 visual check:Confirmed10real/100sim trials,80-second per-goal timeout,50-rotation cap;authors note white background/object cleaning for vision and hardware breakages.

    查看一手来源