具身智能速查
60 分钟更新
具身智能速查阅读原文 · 追踪方法 · 连接实践
近期研究

TacDyn-WAM:在异构视触觉世界动作模型中学习隐式触觉动力学

TacDyn-WAM: Learning Implicit Tactile Dynamics in a Heterogeneous Visuo-Tactile World Action Model

仿真 + 实物代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

21 页 PDF · 4.6 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
原文依据范围

第2节方法,PDF第2–6页 · 第3节实验及表1–4,PDF第7–9页 · 第4节局限,PDF第9页 · 附录D.2与表5–6,PDF第18页

原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

以InternVLA-A1为底座,TacRep用四帧触觉视频作掩码时空预测,并以DINOv2局部关系蒸馏保留空间结构。0.4B触觉专家一次预测5、15、25帧后的表征及增量;AnyTouch2只读记忆补充当前接触,四阶段逐步开放联合注意。

实验设置与硬件

UniVTAC八个仿真任务各100次回合;Franka Research 3搭载双Xense触觉传感器,五个真机任务各60条演示、20次测试。预训练使用6000条OmniViTac轨迹,并在触觉阶段加入300条目标任务演示。

结果及统计口径

仿真平均成功率81.5%,较底座提高25.7个百分点;去掉触觉世界模型或记忆降至67.9%和71.3%。真机无额外预训练为71.0%,预训练后85.0%。单A100上50步动作块延迟484毫秒。

局限与风险

每个配置只覆盖一种触觉传感器类型,跨传感器及非图像触觉泛化未测。HDMI插入仅12%,少量接触变化的数据限制优势;真机每任务20次且部分基线引用公开结果。

复现建议

复现需保存背景差分和触觉归一化、四阶段冻结与注意掩码设置,并区分目标演示参与表征预训练的阶段。附录给出8张H100预训练、4张H100微调及逐阶段超参;本次未独立核实代码发布。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仿真 + 实物
机器人型号
Franka Research 3(真机)、UniVTAC平行夹爪(仿真)

型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。

相关机器人档案

代码与训练

代码待核实 · 代码状态未核实

复现需保存背景差分和触觉归一化、四阶段冻结与注意掩码设置,并区分目标演示参与表征预训练的阶段。附录给出8张H100预训练、4张H100微调及逐阶段超参;本次未独立核实代码发布。 论文许可不代表代码许可,代码实际发布状态仍未知。

来源与分类证据

  • PDF第7页表1:UniVTAC为仿真,81.5%并非超过两个大规模预训练N0模型。

    查看一手来源
  • PDF第9页表3–4(已渲染核看):真机71.0%/85.0%,20次/任务;484 ms是50动作块而非单控制步。

    查看一手来源
  • PDF第8页§3.4:预训练前两阶段加入300条目标真机演示并过采样,不是纯外部数据预训练。

    查看一手来源