原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
21 页 PDF · 6.4 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文原文依据范围
§3.1–3.4 · §4.1–4.4 · Tables 2–5 · §5
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
用相同起始图和任务构造可见条件与文本指定隐藏物性配对,分别人工评分物理合理性、任务完成和隐藏属性遵循。诊断器把相机补偿轨迹、光流和物体消失等信号,与针对具体物理错误的VLM问题组合,避免仅询问整体真实感。
实验设置与硬件
80幅起始图来自11个机器人数据集,形成110提示,四种视频模型共生成439段,隐藏属性119段。每提示模型仅一次生成;自动评测采用按场景分组五折验证,十个VLM及不同取帧重复,人工标签不含时间定位。
结果及统计口径
作者发现隐藏条件中47段被评为合理,其中34段不遵循指定物性;反过来28段遵循属性的视频有15段物理不合理。完整评测器合理性/任务完成AUC为0.72/0.81。隐藏条件合理性平均下降0.28分,但p=0.085,不能称显著下降。
局限与风险
结果针对这批生成视频,不估计不同生成种子的方差;覆盖模型、物性及场景有限。自动器能排序并不证明逐例识别了隐藏属性;错误归因较弱,也未评估报告的时间定位,更不代表机器人实机能力。
复现建议
必须保持配对起始图和任务、按场景划分交叉验证,分别报告三类评分;不要以任务完成替代物理合理性,或把机器人原始图像算作部署试验。本次分析未重新生成视频。
实验标签与机器人
- 验证范围
- 真实数据评测
- 机器人型号
- 未核实
代码与训练
代码待核实 · 训练代码待核实
仅核对摘要;官方实现、许可证与训练入口尚待核实。
