具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
经典研究

Transporter网络:为机器人操作重排视觉世界

Transporter Networks: Rearranging the Visual World for Robotic Manipulation

仿真 + 实物有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

23 页 PDF · 3.6 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

3.1–3.3 抓取条件搬运特征、网络与示范学习 · 4.1/表2–4 Ravens和SE(3)实验 · 4.2/5 实机和局限 · 附录6.5/6.14 指标与硬件

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

Transporter先用全卷积网络选抓取点,再裁切该点附近的视觉特征,经平移旋转后与整幅特征互相关,预测条件放置位姿。RGB-D转俯视颜色/高度栅格,把动作与像素坐标对齐;交叉熵拟合示范,利用空间等变性表达多种合法抓放组合,也可用两位姿原语推扫物体。

实验设置与硬件

Ravens含十项PyBullet任务,每任务用1、10、100或1000条脚本示范单独训练,在100个未见测试配置评价最佳验证模型;对照Form2Fit、图像MLP及真状态MLP。真实UR5系列用13名操作者采集8141次抓放和6759次推扫,分别做瓶装配与围棋子清扫。

结果及统计口径

作者报告平面插块一条示范已达100分,但积木金字塔1000条仍为78.2分,6DoF插块1000条为91分。真实装配/清扫测试表现为98.9%/98.3%;须注意任务指标允许部分完成得分,不能把所有百分数一概当整段成功率,且实机测试分母未充分给出。

局限与风险

每个任务单独模型,依赖相机与机器人标定及可执行运动原语;高频力矩/力控制未解决。本文真实模型用实机示范训练,仿真用于受控比较,并非直接sim-to-real。无记忆策略在部分可观测场景可能受限。

复现建议

复现需160×320俯视网格、36个平面角度、统一SE(2)增强、原语及成功度计算。正文和图标UR5e而硬件段也称UR5,应保留系列层级并核查具体配置;训练示范条数和真实动作转移数不可直接对比。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Universal Robots UR5/UR5e

代码与训练

有开源代码 · 官方Ravens训练、评测和环境代码公开;仓库已归档。

示范监督学习;仿真可通过脚本专家生成数据。

来源与分类证据