原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
3.1–3.3 · 4.1–4.6 · 6 · Appendix D · Table 1
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
PlayWorld用VLM提出场景相关且轻微变化的任务,让现有VLA自主玩耍,采集抓空、滑移、碰撞、变形等成功示范较少覆盖的转移。加关节/工作区安全限制与语言重置,在DROID操作配置上持续采集;从DROID预训练多视角SVD模型出发按难度课程微调。
实验设置与硬件
三组对象含碗胡萝卜玩偶、积木和毛巾,累计30小时自主数据,与6小时人类成功示范及人类玩耍比较;500多片段、20多个策略组成六类交互评测。用生成世界评估策略,并以DSRL优化冻结扩散策略的初始噪声后回到实机。
结果及统计口径
课程后滑移LPIPS0.070,对成功示范训练0.090;预测与真实策略成功率Pearson相关0.8766。两项世界模型内微调实验产生真实行为提升及恢复动作;扩大对象多样性改善未见水果和积木预测,而非仅记住场景。
局限与风险
依赖已有可执行VLA,采集仍冗余;视频幻觉、动作控制模式差异和长时误差未消除。长期模型内训练可能利用模型漏洞并降低实机表现,规模规律仅在受控实验室和有限对象内验证;原文只称DROID配置,未据此猜商业臂型号。
复现建议
先按交互类别检查覆盖及等小时数据对照,再校准预测成功率与真实成功率;课程难度来源、三视角同步和复位策略需保留。策略微调应保留真实验证集与保守停止点,防止想象奖励上涨但真机退化。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- DROID操作配置(正文未明确机械臂型号)
论文 §3.2 明确采用无需额外硬件修改的 DROID 操作平台,但已读正文与项目页未直接列出具体机械臂型号,不凭外观补写。
代码与训练
代码待核实 · 训练代码已核实,部分流程未完成
作者项目页指向 open-world;README 列出 bidirectional-SVD、AR-Wan 世界模型训练及多类策略训练。AR-Cosmos 世界模型训练/部分推理仍标 TODO;数据链接名称为 preview。
来源与分类证据
最新 v3(2026-04-06);§3.2 指向 DROID 平台,§4/§10 为模型内训练与实机测试,§6 给出局限。
查看一手来源官方项目页链接 open-world 仓库,展示自主交互、策略评估与模型内微调。
查看一手来源源码目录和训练/评估流程可见;AR-Cosmos 部分功能仍 TODO,未核实项目级许可证。
查看一手来源3.2–3.3; 4.1–4.4:自主数据、DROID配置、交互基准与相关系数。
查看一手来源4.5–4.6; 6; Appendix D:世界内微调后实机验证和长期训练退化。
查看一手来源3.2–3.3; 4.1–4.4:自主数据、DROID配置、交互基准与相关系数。
查看一手来源4.5–4.6; 6; Appendix D:世界内微调后实机验证和长期训练退化。
查看一手来源
