原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3.2–4,PDF页4–6 · §5及表1–4,PDF页7–9 · §6限制,PDF页10 · 附录C.6、D.1及表9,PDF页19–20
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
向冻结VLM额外追加可学习路由token,在多层读取其隐藏状态,再用任务共享层权重压缩为RL token。先用专家动作块预测监督初始化,移除预测头后通过评论家TD误差周期更新路由;演员梯度断开,基础VLA及其动作生成保持冻结。
实验设置与硬件
仿真覆盖4个LIBERO、3个RoboTwin任务并固定同设置内的算法与交互预算。实机使用RB-Y1左臂和双腕相机,USB及排线分别先微调99和800条示范,再采80和90条在线轨迹;失败会触发人工辅助。
结果及统计口径
七任务平均归一化AUC为0.626,对DSRL表征0.585、RLT表征0.506。USB AUC为0.562对0.269,末10次成功率90%对50%;排线AUC0.710对0.484,两者末窗均100%。
局限与风险
优势主要是样本效率,不能把相对AUC提升当成功率百分点。实机仅两任务、单平台,辅助次数随失败变化,运行间方差和干预敏感性不足;额外VLM前向与周期重算增加显存和计算。
复现建议
复现须使用相同SFT检查点、回放/奖励/预算并保留原始观测以重算token。AUC用未平滑点梯形积分;应分别记自主与辅助轨迹,eRLT USB为66+14,排线70+20,避免把辅助成功计为自主性能。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- RB-Y1左臂(实机)、LIBERO与RoboTwin任务机器人(仿真)
型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。
代码与训练
代码待核实 · 代码状态未核实
复现须使用相同SFT检查点、回放/奖励/预算并保留原始观测以重算token。AUC用未平滑点梯形积分;应分别记自主与辅助轨迹,eRLT USB为66+14,排线70+20,避免把辅助成功计为自主性能。 论文许可不代表代码许可,代码实际发布状态仍未知。
