具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

Dynin-Robotics:全模态统一扩散视觉—语言—动作模型

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

仿真 + 实物待发布 / 占位原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

36 页 PDF · 39.0 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

§3.2–3.4 · §5.2–5.7 · Tables 2–3, 5, 9–11 · §6

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

在共享掩码扩散主干中序列化文字、视觉和量化动作,联合训练策略、下一图像、任务理解与目标图像预测。动作按块并行迭代解码;默认先生成目标,再条件化动作,也研究联合动作—视觉去噪和固定参考的候选重排。

实验设置与硬件

经OXE机器人继续预训练后,在LIBERO、七类LIBERO-Plus扰动和VLABench两任务评测;Franka Research 3测试水果搬运、分类、自由堆叠及指定颜色顺序堆叠。消融分别固定解码器改变训练目标、固定检查点改变推理组合。

结果及统计口径

作者报告LIBERO平均98.1%、LIBERO-Plus73.0%,真实四条件平均78.4%,颜色顺序堆叠68.5%。完整辅助目标使VLABench域外指令成功由33.88%升至47.28%。B200上块并行解码最高29.15倍加速是模型侧吞吐,非完整机器人周期。

局限与风险

已预留语音/力触觉接口但报告的机器人训练和策略解码未启用,不能称多传感器验证。真实仅单平台单工作区;近未来图像全图指标上复制原帧仍更强。任务理解只定性评估,视觉预测收益取决于推理组合。

复现建议

区分已发布220k阶段检查点与后续任务模型,记录量化区间、目标混合比例、去噪步数和完整延迟;分别检验任务成功与视觉变化预测。未运行代码或独立复核作者成绩。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Franka Research 3

实机型号由 §5.1 和 §5.2.4 明确;未把 OXE 预训练数据中的全部机器人当成本论文实机平台。

相关机器人档案

代码与训练

待发布 / 占位 · 占位仓库,待开源

官方项目页写 Model and Code will be released soon;GitHub 目前主要是 README/assets。

来源与分类证据

  • 摘要、§5.1、§5.2.4 和表 5 给出训练规模、仿真/实机、FR3 型号及任务边界。

    查看一手来源
  • 仓库 Notifications 明确代码和模型待发布。

    查看一手来源
  • §3.2.2; §3.4:传感器接口未启用;目标条件和联合去噪不同推理路径。

    查看一手来源
  • Tables 2–3,5,9–11; §6:仿真/实机成绩、模型侧速度及视觉预测限制。

    查看一手来源