原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
25 页 PDF · 10.3 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文原文依据范围
PDF第3页选段(提取文本L169–186) · PDF第5页选段(提取文本L398–415) · PDF第6页选段(提取文本L499–512) · PDF第6页选段(提取文本L513–526) · PDF第9页选段(提取文本L864–881) · PDF第7页选段(提取文本L582–599)
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
把成功检测、物体列表、场景描述或人类反馈持续加入LLM提示,使其从已有短时技能库中重新选取动作,形成闭环计划。
实验设置与硬件
包含Ravens仿真、UR5e真实桌面重排及真实移动操作,比较仅物体反馈、成功反馈和更完整场景反馈。
结果及统计口径
场景反馈支持故障后重试与重新规划,未见长指令表现优于文中无分层基线;结论依赖反馈来源。
局限与风险
部分实验使用脚本或人类作为理想场景描述器;错误成功检测及低层技能不足会限制上层推理,LLM也可能忽略反馈。
复现建议
应标注每种反馈是人工、真值还是学习模块,并保留技能库覆盖范围和重试预算;不能将含人工反馈系统称为全自主。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Universal Robots UR5e、Everyday Robots移动操作平台(未细分型号)
代码与训练
代码待核实 · 官方实现待核实
已核验原文;本轮未独立核实官方实现、训练入口及发布范围,不能据论文声明认定代码已开放。 本次未运行训练、复现实验或实机控制。
