原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
24 页 PDF · 7.8 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文原文依据范围
§3 · §4.1–4.3 · Tables 1–2 · §5 · Appendix C–E
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
CLIPort融合冻结CLIP的语义通道与Transporter的空间等变通道,从俯视RGB-D和语言生成拾取/放置位置及离散旋转。以示范像素动作交叉熵训练,语义分支回答操作什么,空间分支保持精确几何;多任务按任务均匀采样。
实验设置与硬件
仿真Ravens/PyBullet含十语言任务,UR5e吸盘、三无噪声相机,训练1/10/100/1000示范并各测100实例,划分未见颜色/对象。真实Franka Panda九任务用179个图像动作对训练,每任务5–10测试回合。
结果及统计口径
作者真实实验分任务得分约55–75%,简单积木约70%;语义与空间融合及跨任务数据有助于未见属性。实机少量示范也暴露语言与对象颜色共现偏差,不能仅凭语义预训练宣称正确理解所有指令。
局限与风险
指标采用Ravens部分完成得分,百分比不能都解释成完整回合成功率;环境用oracle判断结束。两阶段拾放原语无法直接覆盖完整6DoF、部分可观测长任务或多指连续控制,真实测试样本有限。
复现建议
复现需一致的俯视重建、动作旋转分箱、颜色/对象划分及验证选点流程;单任务20万更新、多任务60万,训练预算并不相同。真实Panda和仿真UR5e应分清,本轮未执行公开训练代码。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Franka Panda
相关机器人档案
代码与训练
有开源代码 · 官方训练与仿真评测代码公开。
使用预训练CLIP与任务示范训练语言条件策略。
