原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
III · IV-A–C · V-A–D · VI · Tables I–IV; Figs 4–8
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
先对动作块做DCT、量化及按维度展开,再用unigram词表枚举等价分词;训练时从64个候选中采样,而各候选解码后的量化动作完全相同。它改变交叉熵监督的分词边界,不增加示范,也不改变策略架构。
实验设置与硬件
同一PaliGemma-3B管线比较LIBERO五档数据量,并在Franka Research 3上做收桌、装袋、早餐摆放和抽屉收纳;各方法共用示范子集,三训练种子,仿真每种子2000回合,实机每任务每种子30回合。
结果及统计口径
LIBERO全量91.4%,并未超过重建FAST的92.4%;1/16数据时42.8%,比确定性自身高6.8个百分点。四项实机平均50.8%,提高15.8个百分点;分层bootstrap支持实机及低数据差异。采样开销约0.4%。
局限与风险
仅研究Franka形态;不直接适用学习式向量量化,未比较BPE-dropout,词表大小与候选数固定。实机收益不能只归因于示范较少,因为动作表示和任务也不同。
复现建议
优先复现等价解码单测及1/8、1/16数据消融;固定512词表、DCT缩放10、训练3万步,并严格区分外部DROID词表与目标数据词表。实机为20Hz关节动作及1秒开环动作块。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Franka Emika Panda(仿真)、Franka Research 3(实机)
Panda 用于 LIBERO 仿真;Research 3 配 Robotiq 2F-85 夹爪用于实机。
相关机器人档案
代码与训练
待发布 / 占位 · 待开源
作者项目页明确标注 Code (Coming Soon)。
