具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

eRLT:通过动作相关词元路由实现高效视觉—语言—动作模型强化学习

eRLT: Efficient VLA Reinforcement Learning via Action-Relevant Token Routing

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

21 页 PDF · 8.5 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§3.2–4,PDF页4–6 · §5及表1–4,PDF页7–9 · §6限制,PDF页10 · 附录C.6、D.1及表9,PDF页19–20

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

向冻结VLM额外追加可学习路由token,在多层读取其隐藏状态,再用任务共享层权重压缩为RL token。先用专家动作块预测监督初始化,移除预测头后通过评论家TD误差周期更新路由;演员梯度断开,基础VLA及其动作生成保持冻结。

实验设置与硬件

仿真覆盖4个LIBERO、3个RoboTwin任务并固定同设置内的算法与交互预算。实机使用RB-Y1左臂和双腕相机,USB及排线分别先微调99和800条示范,再采80和90条在线轨迹;失败会触发人工辅助。

结果及统计口径

七任务平均归一化AUC为0.626,对DSRL表征0.585、RLT表征0.506。USB AUC为0.562对0.269,末10次成功率90%对50%;排线AUC0.710对0.484,两者末窗均100%。

局限与风险

优势主要是样本效率,不能把相对AUC提升当成功率百分点。实机仅两任务、单平台,辅助次数随失败变化,运行间方差和干预敏感性不足;额外VLM前向与周期重算增加显存和计算。

复现建议

复现须使用相同SFT检查点、回放/奖励/预算并保留原始观测以重算token。AUC用未平滑点梯形积分;应分别记自主与辅助轨迹,eRLT USB为66+14,排线70+20,避免把辅助成功计为自主性能。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
RB-Y1左臂(实机)、LIBERO与RoboTwin任务机器人(仿真)

型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。

代码与训练

代码待核实 · 代码状态未核实

复现须使用相同SFT检查点、回放/奖励/预算并保留原始观测以重算token。AUC用未平滑点梯形积分;应分别记自主与辅助轨迹,eRLT USB为66+14,排线70+20,避免把辅助成功计为自主性能。 论文许可不代表代码许可,代码实际发布状态仍未知。

来源与分类证据

  • §4,PDF页5–6:路由前向与原VLA动作生成分离;仅评论家更新路由。

    查看一手来源
  • 表1、4,PDF页8–9:仿真均值与实机AUC、末10回合成功率为不同指标。

    查看一手来源
  • 附录D.1表9,PDF页19–20:不同方法人工辅助数量不同;自主成功单独计数。

    查看一手来源
  • PDF页9(已渲染目视核对):核对该页关键图表的行列对应、实验类别与数值;分析范围仅限sectionsRead所列章节,并非逐页翻译。

    查看一手来源