重建、练习、走向真实:面向具身智能体的引导式自我改进
RPG不更新模型权重,而用离线视频构建MuJoCo练习任务。执行智能体与可见特权状态的智能体并行尝试,视频分析定位失败,再修改提示词和共享技能。候选及合并版本须提高跨任务均值,且单任务下降不超过五次中的一次,才…
MzeeRESEARCH60 分钟更新检索论文、核对硬件、找到可复现的下一步。
RPG不更新模型权重,而用离线视频构建MuJoCo练习任务。执行智能体与可见特权状态的智能体并行尝试,视频分析定位失败,再修改提示词和共享技能。候选及合并版本须提高跨任务均值,且单任务下降不超过五次中的一次,才…
以分阶段奖励、结束条件和可调常数组成程序;语言模型修改结构,CMA-ES校准参数,固定验证器比较并行仿真结果。物体残差加在冻结的身体前向—后向模型上,使奖励映射成潜变量,执行期间不再训练控制器。
把伙伴能力表示为有限候选约束,利用双方联合动作在有界理性行为模型下的似然形成后验;复杂场景以离线学习评分近似计算。部署时将推断约束加入CEM模型预测控制,预测受限伙伴对辅助者动作的响应。
每台机器人用Qwen3-VL-4B调度,用微调π0.5执行;上层交换意图、子目标、任务信念及可选不确定性。语言指令被限制在预设可接受集合内,并有停滞后强制推进机制,因此并非完全开放式自主协商。
冻结视觉网络从RGB-D提取物体中心及交互点,正运动学提供机器人节点,组成统一三维骨架。两个Transformer专家以流匹配联合学习动作和未来骨架,后者仅作训练监督。推理省去未来分支,MAC从多条采样轨迹中选…
先用裁剪量化的Slim SAM3生成玻璃掩码,再以LiDAR种子和水平/垂直结构构造有限平面。单帧射线几何、多视角重投影及地面证据排除假平面,最后合并全局假设并给规划地图补入占据体素。
基准将工具使用拆为选择拾取、固定站位操作、移动操作三级,以推球、钩球及击碎冰块三种功能配合有无诱饵工具构成18任务。记录首次接触、正确工具抬升、工具接触目标及最终成功,避免只凭最终分数混淆选择与执行。