原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§III · §IV–V · Tables II–IV · Appendix A
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
保留已训练且可微分的状态控制专家,只学习视觉到其缺失物理状态的估计器。多相机四帧视觉和本体状态经DINOv3-LoRA、时序卷积输出物体及目标相关状态,以状态回归和穿过冻结专家的动作一致性混合监督,逐渐增加动作损失。
实验设置与硬件
在五种MuJoCo操作任务比较状态估计、像素行为克隆和完整状态克隆;相同4万步训练预算,主要条件三种子、每次1000闭环回合。真实Panda仅测PandaCube,以视觉域随机化仿真训练,固定初始位置并改变方块偏航。
结果及统计口径
作者报告混合损失在PandaCube达99.2%,TrayPlate从仅状态监督28.9%升至64.1%;AllegroCube反而77.2%低于仅状态监督79.2%。实机25个完成评测回合成功76%,若把另两次关节限位安全中止计作失败,则19/27为70.4%。
局限与风险
不同任务最优权重不同,单纯动作损失可能崩溃;部分克隆对照仅单种子。优势是在匹配预算下而非所有方法训练收敛后的结论。真实测试规模小,仅一任务,接触动力学失配仍导致失败。
复现建议
需先得到可微冻结专家及其准确状态定义,再固定状态标准化、损失渐变和训练预算。完整报告安全中止与重启,区分Panda实机和Allegro仿真;未独立复现。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Franka Panda、Allegro Hand(仿真)
论文实机称 Panda;Allegro 为仿真中的 16 自由度灵巧手,未核实更细子型号。
代码与训练
代码待核实 · 未核实公开训练代码
已检查论文全文和相关搜索,未核实作者训练仓库。
