MzeeRESEARCH60 分钟更新
具身智能研究工作台阅读原文 · 追踪方法 · 连接实践
近期研究

观察、推断、协调:推断机器人伙伴的能力约束以实现零样本协作

Watch, Infer, Coordinate: Inferring Robot Partner Constraints for Zero-Shot Coordination

仅仿真代码待核实原文关键章节已核对

原文关键章节已核对

以下分析来自论文原文,保留实验条件与结果适用范围。

17 页 PDF · 5.7 MB归档日期 2026-10-04已核对方法、实验、结果与局限
从官方来源获取原文
本次核对范围

§3–4 · §5 Tables 2–3 · §6

归档用于研究核对。公开可获取不等于允许全文转载;本站提供中文分析和官方原文链接。

基于原文的中文分析

方法机制

把伙伴能力表示为有限候选约束,利用双方联合动作在有界理性行为模型下的似然形成后验;复杂场景以离线学习评分近似计算。部署时将推断约束加入CEM模型预测控制,预测受限伙伴对辅助者动作的响应。

实验设置与硬件

三类实验均为仿真:二维抬杆、固定基座双UR5及移动双UR5。以1、2、4、8段无障碍演示推断约束,再用8段演示在新障碍任务中评测;同一规划器对比未知能力、真值能力、CE-CM-Div及行为克隆,报告三随机种子的均值与标准误。

结果及统计口径

作者报告三场景新任务成功率92.6%、85.2%、63.0%,真值参照为96.3%、88.9%、70.4%。移动双臂约束汉明误差随演示从1段增至8段由0.190降至0.009;联合观察通常优于只看受限机器人。

局限与风险

假定已知目标、动力学及伙伴行为模型,状态动作完全可观测,真实约束属于有限候选集;未验证实机、未知伙伴策略或约束随时间变化。行为克隆失败不代表所有学习型协作方法均无效。

复现建议

复现需同时固定演示任务、候选能力集、行为温度、MPC预算和随机种子;先比较约束误差再比较成功率及SNA。文中承诺发布代码,本分析未运行实现。

这是原文分析,不是逐字全文译本,也不代表本站已复现实验。

实验标签与机器人

验证范围
仅仿真
机器人型号
UR5(仿真)

代码与训练

代码待核实 · 训练代码待核实

仅核对摘要;官方实现、许可证与训练入口尚待核实。

来源与分类证据