重建、练习、走向真实:面向具身智能体的引导式自我改进
Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents
RPG不更新模型权重,而用离线视频构建MuJoCo练习任务。执行智能体与可见特权状态的智能体并行尝试,视频分析定位失败,再修改提示词和共享技能。候选及合并版本须提高跨任务均值,且单任务下降不超过五次中的一次,才…
YAM
MzeeRESEARCH60 分钟更新从基础理论到近期进展,以实验、机器人和代码状态交叉筛选。
找到 213 篇论文
第 1 / 18 页Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents
RPG不更新模型权重,而用离线视频构建MuJoCo练习任务。执行智能体与可见特权状态的智能体并行尝试,视频分析定位失败,再修改提示词和共享技能。候选及合并版本须提高跨任务均值,且单任务下降不超过五次中的一次,才…
YAM
InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation
以分阶段奖励、结束条件和可调常数组成程序;语言模型修改结构,CMA-ES校准参数,固定验证器比较并行仿真结果。物体残差加在冻结的身体前向—后向模型上,使奖励映射成潜变量,执行期间不再训练控制器。
Unitree G1
Watch, Infer, Coordinate: Inferring Robot Partner Constraints for Zero-Shot Coordination
把伙伴能力表示为有限候选约束,利用双方联合动作在有界理性行为模型下的似然形成后验;复杂场景以离线学习评分近似计算。部署时将推断约束加入CEM模型预测控制,预测受限伙伴对辅助者动作的响应。
UR5(仿真)
DuoMind: Enabling Distributed Multi-Robot Coordination with Semantic Communication
每台机器人用Qwen3-VL-4B调度,用微调π0.5执行;上层交换意图、子目标、任务信念及可选不确定性。语言指令被限制在预设可接受集合内,并有停滞后强制推进机制,因此并非完全开放式自主协商。
Franka Emika Panda(仿真) / Aloha-AgileX(仿真)
SkeleWAM: Skeleton World-Action Modeling for Efficient Robotic Manipulation
冻结视觉网络从RGB-D提取物体中心及交互点,正运动学提供机器人节点,组成统一三维骨架。两个Transformer专家以流匹配联合学习动作和未来骨架,后者仅作训练监督。推理省去未来分支,MAC从多条采样轨迹中选…
ARX R5
GlassGuard: Verified Glass Plane Mapping for Robot Navigation
先用裁剪量化的Slim SAM3生成玻璃掩码,再以LiDAR种子和水平/垂直结构构造有限平面。单帧射线几何、多视角重投影及地面证据排除假平面,最后合并全局假设并给规划地图补入占据体素。
麦克纳姆轮移动平台(型号未给出)
HumanoidToolBench: Benchmarking Humanoid Tool Use from Selection to Mobile Execution
基准将工具使用拆为选择拾取、固定站位操作、移动操作三级,以推球、钩球及击碎冰块三种功能配合有无诱饵工具构成18任务。记录首次接触、正确工具抬升、工具接触目标及最终成功,避免只凭最终分数混淆选择与执行。
Unitree G1 / Dex3手
UniWAM: Unified World-Action Model
以联合注意力连接Qwen3-VL物理推理、Wan2.2视觉生成及连续动作流匹配三个专家;人类动作被写成统一物理语言,机器人数据再提供精确动作监督。后训练扰动未来视觉潜变量,并从已执行动作历史加噪初始化动作生成。
AgileX Piper(双臂实机)
H-SPAR: Hydrodynamic-aware Simulation for Particle Transport and Autonomous Robots
H-SPAR用离线Firedrake浅水方程流场统一驱动无人艇阻力和拉格朗日粒子输运,ROS2负责规划与水动力模块、Gazebo执行艇体物理。双船体按相对流速计算二次阻力和偏航力矩,采样概率按粒子相对速度偏离泵…
双船体USV仿真模型(未注明商业型号)
Training-Free Diffusion Planning with Analytical Local Scores
将轨迹目标分解为平滑、障碍物、智能体间距和速度四类因子,直接构造局部解析得分,以退火Langevin更新修正粗规划轨迹。方法不学习示范分布,时间局部性只是带噪得分的近似,并非远端路径点严格独立。
未核实
TouchTherm: Building Multimodal Digital Twins of Objects for Tactile and Thermal Rendering
把扫描粗网格与多光照法线图配准,在接触点切空间积分成微高度,叠加接触掩模渲染GelSight纹理。多视角红外视频提供温度观测,用图拉普拉斯物理约束网络识别表面扩散和环境换热系数,运行时直接积分温度场。
未核实
Robot Learning on Discrete Surfaces: Theory and Applications
在多面体网格上定义切锥、最直测地线指数映射、对数映射与平行移动,显式处理边和顶点。DMP把驱动项固定在同一切锥再输运;GP使用测地距离核并检测长度尺度可容许性;流匹配沿原生网格几何积分。
Franka Research 3
中文标题为译名;“中文摘要解读”是对方法、证据和局限的中文整理,不是论文逐字全文翻译。英文原文可从每篇论文的来源链接查看。全文翻译需有相应授权或许可。基础与经典标签是编辑阅读分类,不代表论文等级。
实物、仅仿真和两者都有指已核对的评估证据;仅仿真训练后实机评估会明确备注。模型内滚动预测也会单独说明。真实传感器数据离线评测另作标签,不等同于实机闭环。机器人型号不从图片或相近项目推测。
“有开源代码”不等于完整训练已复现。待发布、占位仓库、许可未核实分别标注;未查到代码不会写成确定没有。本文库未执行模型训练或机器人实验。