原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
3 多模态嵌入与高层控制闭环 · 4 状态、ViT、OSRT编码 · 6.2–6.6 TAMP、Language Table、移动操作及表1–5 · 7–8 迁移与遗忘讨论
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
PaLM-E把图像、连续状态或对象中心三维表示映射到语言嵌入维度,插入文本序列,以自回归语言目标共同训练。模型输出文字计划或回答;真实动作由已有语言条件低层控制器执行,再把新图像反馈给高层,不是直接生成关节动作的端到端控制策略。
实验设置与硬件
作者比较TAMP仿真规划、Language Table积木排序、真实桌面与厨房移动操作,并混合通用视觉问答/语言任务。消融预训练、冻结语言模型、输入表示及跨任务数据;TAMP低数据评测每类规划只用320例,桌面规划比较10至80例示范。
结果及统计口径
表1中ViT全混合数据的两类TAMP成功率74.1%/74.6%,仅单机器人数据为30.6%/32.9%,支持正迁移;OSRT为82.5%/76.2%。真实厨房主要是定性长程展示;失败检测0.91为F1,不能当作实机任务成功率。562B模型OK-VQA为66.1。
局限与风险
能力受已有低层技能词汇与执行可靠性约束,生成计划没有硬约束验证。小模型多模态微调会遗忘语言能力;跨域混合有帮助但不能推导任意新机器人零样本控制,原文未单列实机商品型号。
复现建议
复现需PaLM/视觉预训练权重、机器人混合数据、编码器及RT-1等执行器,不能仅复现提示词。应将高层规划、可执行性判断、底层控制与最终任务成功分别计分,固定冻结策略和数据规模,避免把不同模型尺寸结果混合。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- SayCan移动操作平台(实机,商品型号未单列)、Language Table桌面平台(实机与仿真,型号未单列)、TAMP仿真操作机器人
代码与训练
代码待核实 · 已核论文与作者项目页;官方实现和权重公开性未确认。
需预训练 PaLM、视觉编码器及低层技能策略;最大模型为 562B 参数,不能据此认定所有实机实验均用该规模。
来源与分类证据
首发日期、摘要与模型规模。
查看一手来源第 6 节与附录 B.2 明确真实控制回路及 Language-Table 仿真评测。
查看一手来源两个真实机器人平台的闭环规划演示。
查看一手来源3:Text output conditions existing low-level policies; model replans using new observations.
查看一手来源6.2 表1:320 examples/planning task; ViT-4B single-robot vs full-mixture results, frozen LLM.
查看一手来源6.3–6.4:Tabletop language subgoals 1Hz, low-level 5Hz; real mobile manipulation assessed qualitatively using 2912 training sequences.
查看一手来源表4/5:0.91 failure-detection F1, not robot task success; 562B OK-VQA 66.1.
查看一手来源
