MzeeRESEARCH60 分钟更新
具身智能研究工作台阅读原文 · 追踪方法 · 连接实践
近期研究

重建、练习、走向真实:面向具身智能体的引导式自我改进

Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

17 页 PDF · 8.2 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
本次核对范围

III-A–E · IV-A–E · Tables II–V · Figures 4–6

归档用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

RPG不更新模型权重,而用离线视频构建MuJoCo练习任务。执行智能体与可见特权状态的智能体并行尝试,视频分析定位失败,再修改提示词和共享技能。候选及合并版本须提高跨任务均值,且单任务下降不超过五次中的一次,才可保留。

实验设置与硬件

22项仿真任务以每项五个固定开发种子迭代15轮,冻结后在每项十个留出种子评价。实机YAM双臂做收球关抽屉、折毛巾、转交碗,各十次;共同标定后不按任务调参,每次最多30次模型调用或20分钟,允许自主重试。

结果及统计口径

作者报告仿真209/220成功,实机30/30;五轮消融中完整系统78.2%,去掉视频分析或特权智能体约51%。固定运行时、只改技能库的四任务对照由26/40升至37/40。

局限与风险

改进曲线只有一次开发运行,轮次不等算力预算。仿真11次失败中七次来自折毛巾;实机折叠判据较宽且独立定义。额外零样本任务仅定性展示,小规模30次试验不能证明通用可靠性。

复现建议

复现需保存任务判据、开发/测试种子、完整技能快照、模型版本及调用预算,并实施YAM坐标与夹爪统一标定;论文分析不等于已运行代码或验证硬件安全。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
YAM

相关机器人档案

代码与训练

代码待核实 · 训练代码待核实

仅核对摘要;官方实现、许可证与训练入口尚待核实。

来源与分类证据

  • 依据原文摘要;实验范围与型号待全文复核

    查看一手来源
  • III-D; IV-A:每候选110次开发评测;最终每系统220次留出评测。

    查看一手来源
  • IV-E; Table V:物理YAM三任务各十次,允许试次内自主恢复。

    查看一手来源
  • IV-B; Figure 4:单次改进运行,计算预算不匹配;实机和仿真折叠判据不同。

    查看一手来源