原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
3 · 4.1–4.4 · 5.1–5.2 · 7 · Tables 1–3
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
LIBERO以Ego4D语言行为模板、初始物体分布和PDDL式目标谓词生成操作任务,专门拆分空间、物体、目标和综合知识迁移。三种策略架构配顺序学习、经验回放、EWC、PackNet和多任务训练,研究持续学新技能时的遗忘与前向迁移。
实验设置与硬件
Robosuite仿真共130任务,每任务50条人工遥操作示范;前三套各10任务,LIBERO-100含90短任务预训练及10长任务。主要指标为学习速度FWT、负向后向迁移NBT及综合AUC,三种子,并改变任务顺序及语言嵌入。
结果及统计口径
普通顺序学习前向迁移反而最好,所测持续学习算法都牺牲新任务学习;PackNet擅长抑制遗忘但长任务容量受限,经验回放较稳健,EWC可比朴素顺序学习更差。BERT/CLIP/GPT-2与任务ID未表现显著区别,提醒语言可能仅作为标签。
局限与风险
原论文是持续学习基准,不是后来常见四套静态多任务成功率榜单;只在仿真,真实迁移及自然语言组合理解未得到证明。指标取保存检查点中的最佳表现,需与固定最后检查点评价区分。
复现建议
按任务顺序保存逐任务成功矩阵与回放预算,同时报FWT/NBT/AUC;不应只报最终平均成功。明确LIBERO-90预训练是否使用,固定演示划分和三种子,语言消融应增加语义可组合性测试。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- Franka Panda(仿真,原任务平台)
相关机器人档案
代码与训练
有开源代码 · MIT 基准与训练代码公开;数据为 CC BY 4.0。
130 项任务来自仿真;人类遥操作示范不等于真实机器人采集。后续 VLA 论文常使用其部分套件。
