原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
第2节方法,PDF第2–6页 · 第3节实验及表1–4,PDF第7–9页 · 第4节局限,PDF第9页 · 附录D.2与表5–6,PDF第18页
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
以InternVLA-A1为底座,TacRep用四帧触觉视频作掩码时空预测,并以DINOv2局部关系蒸馏保留空间结构。0.4B触觉专家一次预测5、15、25帧后的表征及增量;AnyTouch2只读记忆补充当前接触,四阶段逐步开放联合注意。
实验设置与硬件
UniVTAC八个仿真任务各100次回合;Franka Research 3搭载双Xense触觉传感器,五个真机任务各60条演示、20次测试。预训练使用6000条OmniViTac轨迹,并在触觉阶段加入300条目标任务演示。
结果及统计口径
仿真平均成功率81.5%,较底座提高25.7个百分点;去掉触觉世界模型或记忆降至67.9%和71.3%。真机无额外预训练为71.0%,预训练后85.0%。单A100上50步动作块延迟484毫秒。
局限与风险
每个配置只覆盖一种触觉传感器类型,跨传感器及非图像触觉泛化未测。HDMI插入仅12%,少量接触变化的数据限制优势;真机每任务20次且部分基线引用公开结果。
复现建议
复现需保存背景差分和触觉归一化、四阶段冻结与注意掩码设置,并区分目标演示参与表征预训练的阶段。附录给出8张H100预训练、4张H100微调及逐阶段超参;本次未独立核实代码发布。
实验标签与机器人
- 验证范围
- 仿真 + 实物
- 机器人型号
- Franka Research 3(真机)、UniVTAC平行夹爪(仿真)
型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。
相关机器人档案
代码与训练
代码待核实 · 代码状态未核实
复现需保存背景差分和触觉归一化、四阶段冻结与注意掩码设置,并区分目标演示参与表征预训练的阶段。附录给出8张H100预训练、4张H100微调及逐阶段超参;本次未独立核实代码发布。 论文许可不代表代码许可,代码实际发布状态仍未知。
