具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

TOAST:面向自回归视觉—语言—动作模型的随机机器人动作词元化

TOAST: Stochastic Robot Action Tokenization for Autoregressive Vision-Language-Action Models

仿真 + 实物待发布 / 占位原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

10 页 PDF · 5.1 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

III · IV-A–C · V-A–D · VI · Tables I–IV; Figs 4–8

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

先对动作块做DCT、量化及按维度展开,再用unigram词表枚举等价分词;训练时从64个候选中采样,而各候选解码后的量化动作完全相同。它改变交叉熵监督的分词边界,不增加示范,也不改变策略架构。

实验设置与硬件

同一PaliGemma-3B管线比较LIBERO五档数据量,并在Franka Research 3上做收桌、装袋、早餐摆放和抽屉收纳;各方法共用示范子集,三训练种子,仿真每种子2000回合,实机每任务每种子30回合。

结果及统计口径

LIBERO全量91.4%,并未超过重建FAST的92.4%;1/16数据时42.8%,比确定性自身高6.8个百分点。四项实机平均50.8%,提高15.8个百分点;分层bootstrap支持实机及低数据差异。采样开销约0.4%。

局限与风险

仅研究Franka形态;不直接适用学习式向量量化,未比较BPE-dropout,词表大小与候选数固定。实机收益不能只归因于示范较少,因为动作表示和任务也不同。

复现建议

优先复现等价解码单测及1/8、1/16数据消融;固定512词表、DCT缩放10、训练3万步,并严格区分外部DROID词表与目标数据词表。实机为20Hz关节动作及1秒开环动作块。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Franka Emika Panda(仿真)、Franka Research 3(实机)

Panda 用于 LIBERO 仿真;Research 3 配 Robotiq 2F-85 夹爪用于实机。

相关机器人档案

代码与训练

待发布 / 占位 · 待开源

作者项目页明确标注 Code (Coming Soon)。

来源与分类证据

  • 摘要及 §V-A、§V-C 明确仿真/实机、Panda/Research 3 型号;§VI 给出适用边界。

    查看一手来源
  • 官方地址由论文给出;待开源状态来自原清单的项目页核对,本轮页面读取失败。

    查看一手来源
  • IV; V-A:随机等价分词、统一训练设置及硬件。

    查看一手来源
  • Table III; Fig.5; VI:全量非最优、低数据与实机增益及明确限制。

    查看一手来源
  • IV; V-A:随机等价分词、统一训练设置及硬件。

    查看一手来源
  • Table III; Fig.5; VI:全量非最优、低数据与实机增益及明确限制。

    查看一手来源