原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
2 硬件、MuJoCo/Unity与任务 · 3 随机化和观察 · 4–5 LSTM/PPO与视觉估计 · 6.2–6.6 表3–6、消融、规模 · 归档v5 PDF第10页表3可视复核
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
Dactyl用循环PPO和非对称actor-critic学习Shadow手内物体重定向;训练时随机化动力学、观察与动作噪声及未建模效应,借记忆适应每回合不同参数。控制策略接收指尖位置和物体目标误差,输出分成11档的相对关节目标;视觉网络另用随机化合成图估计物体位置姿态。
实验设置与硬件
任务对象为方块及八棱柱,每成功一次就换目标,掉落、超时或累计50次结束。每策略仿真100次、实机10次,并比较锁腕、视觉/动捕物体估计、随机化组及是否有记忆。Shadow手24自由度、20组驱动,12Hz策略经约1kHz低层执行。
结果及统计口径
作者表3报告实机方块状态输入连续成功均值18.8、中位13,视觉输入均值15.2、中位11.5;仿真状态均值43.4,现实差距仍明显。去全部随机化后实机中位数为0,去物理随机化为2,支持强随机化而非单靠理想仿真。
局限与风险
视觉版仍用PhaseSpace追踪五个指尖,且实验采用白背景并清洁物体;不使用触觉输入。对象有限,十次试验方差大,50次是截断上限;作者还报告硬件损坏影响实验。手从预放物体开始,不是任意抓取与操作。
复现建议
默认训练资源为8GPU优化器加6144个CPU采样核,完全随机化达到相似仿真表现约需百年模拟经验、50小时墙钟。复现需手部校准、追踪、三相机、Unity视觉渲染及低层控制,不可把后续robogym当作完整原实验包。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Shadow Dexterous Hand
代码与训练
代码待核实 · 本次未核实2018原实验的完整官方训练代码。
分布式RL在随机化仿真中训练控制策略,视觉估计器与硬件系统另行构建;后续robogym不能直接视为本篇完整复现包。
来源与分类证据
arXiv原始记录:标题、首发日期与方法摘要。
查看一手来源原文核对Shadow手、仿真训练与真实实验范围。
查看一手来源研究团队的项目说明与实验展示。
查看一手来源2.1/3.1:Shadow24DoF/20actuators;PhaseSpace fingertip tracking even in vision object-pose setup;no tactile input.
查看一手来源6.2 表3:100sim/10real per policy;cap50;state18.8mean/13median;vision15.2mean/11.5median.
查看一手来源6.3 表4:Without all randomization real median0;without physics median2.
查看一手来源6.3/6.5:~100years simulated experience≈50h;default8GPU+6144CPU rollout cores.
查看一手来源v5 PDF p10/Table3 visual check:Confirmed10real/100sim trials,80-second per-goal timeout,50-rotation cap;authors note white background/object cleaning for vision and hardware breakages.
查看一手来源
