具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

Divide-and-Remember:面向长时程视觉—语言—动作策略的递归动作相关记忆

Divide-and-Remember: Recursive Action-Relevant Memory for Long-Horizon VLA Policies

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

27 页 PDF · 8.2 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§4–5 · §6.1–6.3 · Tables 1–2 · §7 · Appendix B.4

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

保留预训练视觉token本身,以共享轻量选择器递归从2K候选选K,组合长历史;用直通梯度和Gumbel探索训练选择,动作流匹配损失驱动记忆,无额外未来状态预测目标。递归结构使同一历史前缀在离线训练和在线执行中保持一致。

实验设置与硬件

RoboMME含16任务,固定64token预算、每任务50回合、三种子和末三检查点。真机使用Franka Panda加Robotiq2F-140,四任务各100示范、各10测试;前相机生成记忆,腕相机只提供当前观测。

结果及统计口径

作者报告四套件平均成功38.6%,HAMLET32.2%、无记忆17.9%;实体测试35/40,FrameSamp22/40、无记忆3/40。帧式事实收益较大,但时间与动态状态类未全面超过潜在记忆。

局限与风险

真机比较预算不同:D&R1024,FrameSamp2048,不能称真机也固定64token。InsertPeg所有方法最高仅3.3%,记忆不解决接触精度;较大记忆有收敛与冗余问题,四任务小样本也不代表泛化可靠性。

复现建议

复现需固定候选池采样、冻结SigLIP与共同策略入口,并区分套件均值和任务均值;实机动作/相机时间同步及停止判定影响得分。文中指向代码/检查点,但本轮未实训或复现性能。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Franka Emika Panda

代码与训练

代码待核实 · 训练代码待核实

仅核对摘要;官方实现、许可证与训练入口尚待核实。

来源与分类证据