原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
3–4 · 5.1–5.3 · 8 · Tables 1–3
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
SayCan对有限技能库的自然语言描述计算LLM条件概率,同时用技能价值函数估计当前场景能否成功;两者相乘后选择下一技能,执行后重新打分直至终止。强化学习的价值函数提供可执行性,LLM提供对长指令的语义步骤偏好。
实验设置与硬件
Everyday Robots七自由度移动机械臂,在仿办公厨房及真实办公厨房使用15物体、5个语义位置,101条指令涵盖七族。主要LLM为540B PaLM,分别由人工判规划是否正确与完整真实执行是否完成,并做去可供性、换LLM等消融。
结果及统计口径
仿办公厨房规划84%、执行74%;真实厨房分别下降3和14个百分点,显示低层技能可靠性对端到端结果有明显影响。长指令可通过技能组合完成,LLM升级改善规划,但动作执行仍必须落在既有技能集合内。
局限与风险
这不是LLM直接生成连续控制,也不能凭新语言创造未训练技能;系统受技能范围、价值函数错误及语言偏差共同限制。两厨房及固定对象位置范围有限,人工计划判定与动作成功需要分开阅读。
复现建议
先复现技能描述的概率归一化、终止候选和价值校准,再在固定技能库比较语言-only、可供性-only及乘积选择。保留实际执行后的重规划记录;读者应把技能学习成本与上层零样本指令规划区分。
实验标签与机器人
- 验证范围
- 实物实验
- 机器人型号
- Everyday Robots移动机械臂
代码与训练
有开源代码 · 官方开放桌面仿真版本;不是完整厨房实机系统。
Google Research 仓库 Apache-2.0;实机低层技能包含示范学习与仿真强化学习,完整 PaLM 配置不等同于开源演示。
