具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
经典研究

CLIPort:机器人操作的语义与空间双通路

CLIPort: What and Where Pathways for Robotic Manipulation

仿真 + 实物有开源代码原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

24 页 PDF · 7.8 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§3 · §4.1–4.3 · Tables 1–2 · §5 · Appendix C–E

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

CLIPort融合冻结CLIP的语义通道与Transporter的空间等变通道,从俯视RGB-D和语言生成拾取/放置位置及离散旋转。以示范像素动作交叉熵训练,语义分支回答操作什么,空间分支保持精确几何;多任务按任务均匀采样。

实验设置与硬件

仿真Ravens/PyBullet含十语言任务,UR5e吸盘、三无噪声相机,训练1/10/100/1000示范并各测100实例,划分未见颜色/对象。真实Franka Panda九任务用179个图像动作对训练,每任务5–10测试回合。

结果及统计口径

作者真实实验分任务得分约55–75%,简单积木约70%;语义与空间融合及跨任务数据有助于未见属性。实机少量示范也暴露语言与对象颜色共现偏差,不能仅凭语义预训练宣称正确理解所有指令。

局限与风险

指标采用Ravens部分完成得分,百分比不能都解释成完整回合成功率;环境用oracle判断结束。两阶段拾放原语无法直接覆盖完整6DoF、部分可观测长任务或多指连续控制,真实测试样本有限。

复现建议

复现需一致的俯视重建、动作旋转分箱、颜色/对象划分及验证选点流程;单任务20万更新、多任务60万,训练预算并不相同。真实Panda和仿真UR5e应分清,本轮未执行公开训练代码。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Franka Panda

相关机器人档案

代码与训练

有开源代码 · 官方训练与仿真评测代码公开。

使用预训练CLIP与任务示范训练语言条件策略。

来源与分类证据