原文关键章节已核对
以下分析来自论文原文,保留实验条件与结果适用范围。
原文依据范围
§3,PDF页3–5 · §4.1–4.3及表2,PDF页6–8 · §4.4及表3,PDF页10–11 · §5限制,PDF页11
原文来源与版本用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。
方法机制
整合32个既有来源与新GeoProbe,共1000案例,保留原始观测、动作接口和成功条件。固定输入任务使用持久Python交互,操作遵循原生控制循环;分别计几何误差、接触有效性、规划Pass@1及终态所有目标条件,避免用局部进展替代成功。
实验设置与硬件
比较7种VLM;固定输入每例通常5次,Fable为3次,交互和轨迹采用单次记录。操纵基线含182个二元任务;153共同任务比较基线与逐轮RGB扩展,并用46共同案例检验自审、裁剪审查及工具辅助。
结果及统计口径
Astra空间Pass@1为69.4%,规划80.3%,操纵41.8%;位姿误差17.1度/106.6厘米。RGB扩展后共同任务Astra仍63/153成功,Fable从34升至65;说明总分可隐藏相反任务效应。
局限与风险
并非实体机器人部署,真实照片只用于感知测试;物理迁移仍待验证。公开资产、来源异质辅助工具和不等重试次数限制泛化解释,交互任务重复不足;合成跨域分数不能替代各任务原生指标。
复现建议
复现应锁定模型版本、各来源预算、观测协议和成功分母,缺失记录与无效连续估计需分开处理。重点复查终态条件、动作调用和共同任务子集,不能将不同RGB配置或单次交互波动混成稳定模型排名。
实验标签与机器人
- 验证范围
- 仅仿真
- 机器人型号
- CALVIN、RLBench、RoboTwin等基准机器人(仿真)
型号和使用场景以原文及上列说明为准;训练或离线采集平台不等于所提方法的实机闭环验证。
代码与训练
代码待核实 · 代码状态未核实
复现应锁定模型版本、各来源预算、观测协议和成功分母,缺失记录与无效连续估计需分开处理。重点复查终态条件、动作调用和共同任务子集,不能将不同RGB配置或单次交互波动混成稳定模型排名。 论文许可不代表代码许可,代码实际发布状态仍未知。
