具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
基础方法

PaLM-E:具身多模态语言模型

PaLM-E: An Embodied Multimodal Language Model

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

18 页 PDF · 10.2 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

3 多模态嵌入与高层控制闭环 · 4 状态、ViT、OSRT编码 · 6.2–6.6 TAMP、Language Table、移动操作及表1–5 · 7–8 迁移与遗忘讨论

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

PaLM-E把图像、连续状态或对象中心三维表示映射到语言嵌入维度,插入文本序列,以自回归语言目标共同训练。模型输出文字计划或回答;真实动作由已有语言条件低层控制器执行,再把新图像反馈给高层,不是直接生成关节动作的端到端控制策略。

实验设置与硬件

作者比较TAMP仿真规划、Language Table积木排序、真实桌面与厨房移动操作,并混合通用视觉问答/语言任务。消融预训练、冻结语言模型、输入表示及跨任务数据;TAMP低数据评测每类规划只用320例,桌面规划比较10至80例示范。

结果及统计口径

表1中ViT全混合数据的两类TAMP成功率74.1%/74.6%,仅单机器人数据为30.6%/32.9%,支持正迁移;OSRT为82.5%/76.2%。真实厨房主要是定性长程展示;失败检测0.91为F1,不能当作实机任务成功率。562B模型OK-VQA为66.1。

局限与风险

能力受已有低层技能词汇与执行可靠性约束,生成计划没有硬约束验证。小模型多模态微调会遗忘语言能力;跨域混合有帮助但不能推导任意新机器人零样本控制,原文未单列实机商品型号。

复现建议

复现需PaLM/视觉预训练权重、机器人混合数据、编码器及RT-1等执行器,不能仅复现提示词。应将高层规划、可执行性判断、底层控制与最终任务成功分别计分,固定冻结策略和数据规模,避免把不同模型尺寸结果混合。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
SayCan移动操作平台(实机,商品型号未单列)、Language Table桌面平台(实机与仿真,型号未单列)、TAMP仿真操作机器人

代码与训练

代码待核实 · 已核论文与作者项目页;官方实现和权重公开性未确认。

需预训练 PaLM、视觉编码器及低层技能策略;最大模型为 562B 参数,不能据此认定所有实机实验均用该规模。

来源与分类证据

  • 首发日期、摘要与模型规模。

    查看一手来源
  • 第 6 节与附录 B.2 明确真实控制回路及 Language-Table 仿真评测。

    查看一手来源
  • 两个真实机器人平台的闭环规划演示。

    查看一手来源
  • 3:Text output conditions existing low-level policies; model replans using new observations.

    查看一手来源
  • 6.2 表1:320 examples/planning task; ViT-4B single-robot vs full-mixture results, frozen LLM.

    查看一手来源
  • 6.3–6.4:Tabletop language subgoals 1Hz, low-level 5Hz; real mobile manipulation assessed qualitatively using 2912 training sequences.

    查看一手来源
  • 表4/5:0.91 failure-detection F1, not robot task success; 562B OK-VQA 66.1.

    查看一手来源