MzeeRESEARCH60 分钟更新
具身智能研究工作台阅读原文 · 追踪方法 · 连接实践
03 / 技术时间轴

研究方向时间轴

沿时间阅读不同方向的代表性研究。看方法怎样变化,也看实验如何走向现实。

213篇当前主线研究
全部主线

研究演进总览

按已核实的首次发布年份排列。
时间相邻不表示直接继承或因果关系。

20072 篇
20101 篇
基础方法

将模仿学习与结构化预测归约为无悔在线学习

DAgger迭代执行当前策略或其与专家的混合,在实际访问状态查询专家动作,将样本加入累计数据集后重新监督训练。重点是改变训练状态分布以覆盖学习者自身错误;混合专家比例逐渐降低,最终可部署单一策略。无悔在线学习把训练损失联系到策略诱导分布下的表现。

仅仿真代码待核实

机器人型号待核实或不适用

方法与证据
20132 篇
基础方法

引导式策略搜索

2013版GPS先用微分动态规划DDP找到随机反馈轨迹分布,从中采样初始化神经网络策略,再把这些引导样本和策略自身经验放进正则化重要性采样目标。优化和采样交替进行,必要时适应引导分布,使高回报局部解推动更通用策略搜索。

仅仿真代码待核实

机器人型号待核实或不适用

方法与证据
基础方法

动力学运动基元:学习运动行为的吸引子模型

从稳定弹簧阻尼系统出发,用相位驱动的可学习强迫项编码轨迹形状,分别构造点吸引子和周期吸引子;基函数权重可由示范回归。时间常数、目标和振幅控制执行变化,空间/相位耦合项支持障碍响应、停顿及多关节协调。

仿真 + 实物代码待核实

Sarcos Slave 7-DOF / 30自由度人形机器人(正文未在此命名)

方法与证据
20142 篇
20153 篇
经典研究

深度视觉运动策略的端到端训练

引导式策略搜索把局部轨迹优化与视觉策略监督学习交替进行,训练时利用完整状态,执行时只用相机与本体。CNN空间softmax把特征图转为可微坐标点,再映射到控制量;先预训练视觉和局部控制器,最后联合端到端优化。

仿真 + 实物有开源代码
基础方法

利用深度强化学习进行连续控制

DDPG将确定性策略梯度与深度actor-critic结合,actor输出连续动作,critic拟合Bellman目标。经验回放降低时序相关,缓慢软更新的双目标网络稳定训练;低维输入使用batch normalization,探索加入Ornstein-Uhlenbeck相关噪声。

仅仿真代码待核实

机器人型号待核实或不适用

方法与证据
20164 篇
20174 篇
经典研究

通过域随机化将深度网络从仿真迁移到现实

论文随机化合成场景纹理、灯光、物体位置、干扰物、相机姿态与视场,训练VGG式卷积网络从单幅RGB回归目标中心坐标。已知目标形状尺寸、固定桌高降低了几何难度;无需逼真纹理或真实图像微调,模型学到的是位置估计,不是完整抓取控制。

仿真 + 实物代码待核实
基础方法

近端策略优化算法

PPO收集当前策略批次后,用旧/新动作概率比和优势估计构造替代目标,多轮小批量更新。裁剪版本取原目标与裁剪目标较小者,移除向过大改善方向继续推进的收益;另一版本自适应调节KL惩罚,并结合价值和熵目标。

仅仿真有开源代码

机器人型号待核实或不适用

方法与证据
20186 篇
基础方法

Soft Actor-Critic:带随机策略的离策略最大熵深度强化学习

原版SAC将奖励与策略熵共同优化,以离策略回放提高利用率。软策略迭代先评估软Q值,再把策略投影到由Q诱导的分布;神经网络版本使用随机重参数化actor、双Q取小值及独立软状态价值网络与目标网络,并用tanh约束连续动作。

仅仿真有开源代码

机器人型号待核实或不适用

方法与证据
基础方法

世界模型

2018:以可复现实验普及“学习环境模型、在想象中训练控制器”的现代深度学习范式。

仅仿真代码待核实

机器人型号待核实或不适用

方法与证据
经典研究

QT-Opt:面向视觉机器人操作的可扩展深度强化学习

QT-Opt以连续动作Q学习替代独立actor,通过交叉熵方法随机优化Q值选择动作;双目标网络、裁剪双Q和异步Bellman更新支撑大规模离策略图像数据。闭环反复观察,使抓取前推挪、重抓和失败恢复可由长期奖励学习。

仿真 + 实物有开源代码

KUKA LBR IIWA

方法与证据
20198 篇
经典研究

为足式机器人学习敏捷动态运动技能

用刚体接触仿真加由实体执行器数据训练的神经执行器模型,近似串联弹性电机、低层软件延迟和扭矩映射;再在随机化仿真中以强化学习训练读取状态历史的MLP,输出关节位置目标。行走、高速和跌倒恢复分别使用不同奖励训练。

仿真 + 实物代码待核实
经典研究

用机器人手解魔方

2019:从手内重定向推进到高精度多阶段操作,并把域随机化自动化。

仿真 + 实物有开源代码

Shadow Dexterous Hand

方法与证据
20206 篇
经典研究

Transporter网络:为机器人操作重排视觉世界

Transporter先用全卷积网络选抓取点,再裁切该点附近的视觉特征,经平移旋转后与整幅特征互相关,预测条件放置位姿。RGB-D转俯视颜色/高度栅格,把动作与像素坐标对齐;交叉熵拟合示范,利用空间等变性表达多种合法抓放组合,也可用两位姿原语推扫物体。

仿真 + 实物有开源代码

Universal Robots UR5/UR5e

方法与证据
202112 篇
经典研究

iMAP:实时隐式建图与定位

用单个在线训练的MLP将三维坐标映射到颜色和体密度,跟踪与建图并行运行;关键帧重放和误差引导像素采样缓解遗忘并减少优化成本。

真实数据评测代码待核实

机器人型号待核实或不适用

方法与证据
经典研究

RMA:足式机器人的快速运动适应

先用特权质量、摩擦和电机等参数编码的8维环境潜变量训练基础行走策略,再学习50步历史到潜变量的适应网络。适应器在自身造成的轨迹上监督训练;部署只需本体传感,基础策略100Hz、适应器10Hz异步运行,不进行在线梯度微调。

仿真 + 实物有开源代码

Unitree A1

方法与证据
经典研究

从离线人类示范学习机器人操作:哪些因素最重要

这是一项离线人类示范学习的系统比较,评估BC、带历史的BC-RNN、分层HBC、BCQ、CQL与IRIS,而非单一新策略。数据分机器生成、熟练单人200条、六位不同熟练度操作者共300条;控制数据质量、历史、观察模态、网络结构和检查点选择来分析性能来源。

仿真 + 实物有开源代码

Franka Emika Panda

方法与证据
经典研究

CLIPort:机器人操作的语义与空间双通路

CLIPort融合冻结CLIP的语义通道与Transporter的空间等变通道,从俯视RGB-D和语言生成拾取/放置位置及离散旋转。以示范像素动作交叉熵训练,语义分支回答操作什么,空间分支保持精确几何;多任务按任务均匀采样。

仿真 + 实物有开源代码

Franka Panda

方法与证据
经典研究

通过大规模并行深度强化学习在数分钟内学会行走

把物理仿真、观测、回报、PPO及缓存全部留在GPU,用数千机器人同时采样。地形课程在同一网格上移动机器人切换难度,正确区分超时截断与失败终止;关节目标经学得的执行器模型转力矩,并施加噪声、摩擦和推动随机化。

仿真 + 实物有开源代码

ANYmal C / ANYmal B(仿真)

方法与证据
202217 篇
基础方法

按我能做的来:利用机器人可供性约束语言规划

SayCan对有限技能库的自然语言描述计算LLM条件概率,同时用技能价值函数估计当前场景能否成功;两者相乘后选择下一技能,执行后重新打分直至终止。强化学习的价值函数提供可执行性,LLM提供对长指令的语义步骤偏好。

实物实验有开源代码

Everyday Robots移动机械臂

方法与证据
基础方法

Diffuser:用扩散规划合成灵活行为

把整段状态-动作轨迹建模为扩散去噪过程,以目标条件或引导函数影响采样;通过局部时序卷积多轮去噪生成全局连贯计划。

仅仿真有开源代码

机器人型号待核实或不适用

方法与证据
经典研究

内心独白:通过语言反馈实现具身规划推理

把成功检测、物体列表、场景描述或人类反馈持续加入LLM提示,使其从已有短时技能库中重新选取动作,形成闭环计划。

仿真 + 实物代码待核实

Universal Robots UR5e / Everyday Robots移动操作平台(未细分型号)

方法与证据
基础方法

VIMA:利用多模态提示完成通用机器人操作

VIMA把任务写成文本与对象/场景图像交错的多模态提示,冻结T5编码提示,通过交叉注意力条件化自回归动作解码。观察采用对象检测得到的图像块和位置词元,并保留动作—观察历史,统一表达新概念、视觉目标和视频模仿。

仅仿真有开源代码

Universal Robots UR5(仿真)

方法与证据
经典研究

GNM:跨机器人的通用视觉导航模型

把不同机器人的动作统一为相对航点和偏航变化,用历史图像推断运动特性;联合预测目标距离与动作,并与拓扑地图组合。

实物实验有开源代码

Clearpath Jackal / LoCoBot(Kobuki底盘)

方法与证据
基础方法

RT-1:面向大规模真实世界控制的机器人 Transformer

RT-1用语言嵌入FiLM调制EfficientNet图像特征,TokenLearner把每帧压成8词元,六帧历史送入Transformer。机械臂、底盘与终止模式离散成动作词元,以监督交叉熵学习;压缩及非逐token自回归等优化满足约3Hz真机控制。

实物实验有开源代码

Everyday Robots移动机械臂

方法与证据
202330 篇
基础方法

通过世界模型掌握多样化任务

DreamerV3以离散随机潜变量和循环状态学习可重构观测、预测奖励及终止的世界模型,再在想象轨迹中训练演员和评论家。symlog/双热分类处理跨量级信号,KL平衡、自由比特与均匀概率混合稳定训练;执行时直接采样演员,不做在线树搜索。

仅仿真有开源代码

DeepMind Control Suite 虚拟控制体 / Minecraft、Atari、DMLab 等游戏智能体(非实机机器人)

方法与证据
基础方法

PaLM-E:具身多模态语言模型

PaLM-E把图像、连续状态或对象中心三维表示映射到语言嵌入维度,插入文本序列,以自回归语言目标共同训练。模型输出文字计划或回答;真实动作由已有语言条件低层控制器执行,再把新图像反馈给高层,不是直接生成关节动作的端到端控制策略。

仿真 + 实物代码待核实

SayCan移动操作平台(实机,商品型号未单列) / Language Table桌面平台(实机与仿真,型号未单列)

方法与证据
经典研究

扩散策略:通过动作扩散学习视觉运动策略

Diffusion Policy将视觉条件动作分布表示为逐步去噪的动作序列,使用滚动时域执行部分动作后重新观测。视觉特征只作条件而不与动作共同去噪;比较时序卷积U-Net和Transformer、位置/速度动作与视觉预训练,避免确定性回归平均多个行为模式。

仿真 + 实物有开源代码

Universal Robots UR5 / Franka Emika Panda

方法与证据
经典研究

用低成本硬件学习精细双臂操作

ALOHA以小型WidowX领导臂直接映射关节到ViperX双跟随臂,配四路相机和改装夹爪。ACT使用条件VAE Transformer一次预测动作块,执行时每步重新查询,并对重叠预测做时间集成,缓解误差累积与示范中暂停造成的非马尔可夫性。

仿真 + 实物有开源代码

ALOHA / Trossen ViperX

方法与证据
基础方法

LIBERO:终身机器人学习中的知识迁移基准

LIBERO以Ego4D语言行为模板、初始物体分布和PDDL式目标谓词生成操作任务,专门拆分空间、物体、目标和综合知识迁移。三种策略架构配顺序学习、经验回放、EWC、PackNet和多任务训练,研究持续学新技能时的遗忘与前向迁移。

仅仿真有开源代码

Franka Panda(仿真,原任务平台)

方法与证据
经典研究

ViNT:视觉导航基础模型

用Transformer处理历史观测与目标图像,预测归一化相对航点和到达时间;跨机器人数据训练后,以扩散子目标和拓扑搜索扩展到长距离。

实物实验有开源代码

Clearpath Jackal / LoCoBot(Kobuki底盘)

方法与证据
经典研究

机器人跑酷学习

先在允许障碍穿透的软动力学课程中探索技能,再恢复真实约束微调;用DAgger把爬越、跨跳、匍匐、侧倾及奔跑蒸馏为深度视觉策略。

仿真 + 实物有开源代码

Unitree A1 / Unitree Go1

方法与证据
经典研究

腿式机器人的极限跑酷

用统一内积奖励和地形课程学习多样运动,再双重蒸馏特权策略与朝向估计,让深度图直接驱动关节动作和转向。

仿真 + 实物源码可用 · 有使用限制

Unitree A1

方法与证据
基础方法

Open X-Embodiment:机器人学习数据集与 RT-X 模型

Open X-Embodiment把跨机构机器人轨迹统一为RLDS接口,以RT-1-X及RT-2-X检验跨形态联合训练。图像和语言统一处理,动作粗略归一化但不强制对齐坐标、绝对/相对或速度语义;大模型将动作当离散语言词元与网页视觉语言知识结合。

实物实验有开源代码

Google Robot / WidowX

方法与证据
202419 篇
基础方法

Mobile ALOHA:通过低成本全身遥操作学习双臂移动操作

将ALOHA双臂放在AgileX Tracer差速底盘上,以腰部连接反驱底盘实现手臂/移动同步遥操作。学习时把825条静态ALOHA示范与每任务移动示范等概率混合,静态数据底盘动作补零;ACT等动作块策略联合输出双臂位置与底盘速度,并补偿延迟。

实物实验有开源代码

Mobile ALOHA / AgileX Tracer

方法与证据
经典研究

DexCap:便携式灵巧操作动捕采集系统

便携SLAM与电磁动捕记录手腕、手指和三维场景;以指尖逆运动学重定向到LEAP手,点云扩散策略学习动作,并可加入人在环纠正。

实物实验有开源代码

Franka Emika机械臂(原文未细分型号) / LEAP Hand

方法与证据
基础方法

DROID:大规模自然场景机器人操作数据集

DROID以一致且可推行的数据采集硬件分布到18处,由50人收集不同建筑、任务、视角与场景;Panda加Robotiq 2F-85、三路ZED相机及Quest遥操作,15Hz同步动作。它主要贡献真实数据分布与采集流程,并用标准语言条件扩散策略检验价值。

实物实验有开源代码

Franka Emika Panda / Robotiq 2F-85

方法与证据
基础方法

Octo:开源通用机器人策略

将语言、目标图像和多相机历史编码成分块注意力Transformer输入,以只读取上下文的读出令牌连接扩散动作块解码器。增减传感器或动作头时保留主体权重;从Open X-Embodiment筛选25套数据、约80万条轨迹,统一末端增量及夹爪语义。

实物实验有开源代码

Trossen WidowX 250 / UR5

方法与证据
基础方法

OpenVLA:开源视觉-语言-动作模型

OpenVLA将DINOv2与SigLIP特征拼接到Llama2/Prismatic7B骨干,把每维连续动作离散为256分箱并自回归预测。用筛选后的Open X-Embodiment约97万轨迹微调全部模块,支持LoRA适配与低比特推理。

实物实验有开源代码

WidowX / Google移动操作机器人

方法与证据
基础方法

π0:面向通用机器人控制的视觉-语言-动作流模型

基于PaliGemma视觉语言主干加入较小动作专家,以条件流匹配生成50步连续动作块,多相机、指令和关节状态共同输入。先在跨机器人广泛数据上预训练,再用质量与策略一致性更高的任务数据后训练,动作维度填充兼容多个平台。

实物实验有开源代码

UR5e / Franka(正文未在此处细分型号)

方法与证据
20258 篇
近期研究

GR00T N1:面向通用人形机器人的开放基础模型

GR00T N1将Eagle-2视觉语言模块与流匹配Diffusion Transformer相连,以本体专用编码/解码适配不同状态动作维度。混合真实遥操作、物理仿真、人类视频和生成视频,借潜在动作或逆动力学伪标签利用无动作视频,再进行任务后训练。

仿真 + 实物有开源代码

Fourier GR-1

方法与证据
近期研究

π0.5:具有开放世界泛化能力的视觉-语言-动作模型

π0.5把多场景移动/固定机械臂、跨形态动作、语言子任务和网络视觉数据共同训练。先以FAST离散动作做自回归预训练,再增加流匹配动作专家;同一模型先预测语义子任务,再条件化生成连续动作段,兼顾语言监督与实时控制。

实物实验有开源代码

两类轮式双臂移动操作平台(商业型号未明确)

方法与证据
202689 篇
近期研究

人形机器人操作接口:从无需机器人在场的示范中学习人形机器人全身操作

HuMI用手持感知夹爪与腰脚追踪器收集无需机器人在场的示范,在线逆运动学预览让人主动避开机器人不可达姿态。高层扩散策略生成身体关键点轨迹,仿真训练的低层全身控制器采用速度自适应末端精度和变速增强;动作段以上一目标为参考,腰脚等缺乏视觉锚点处只跟踪段内相对运动。

仿真 + 实物有开源代码

Unitree G1

方法与证据
近期研究

PlayWorld:从自主探索交互中学习机器人世界模型

PlayWorld用VLM提出场景相关且轻微变化的任务,让现有VLA自主玩耍,采集抓空、滑移、碰撞、变形等成功示范较少覆盖的转移。加关节/工作区安全限制与语言重置,在DROID操作配置上持续采集;从DROID预训练多视角SVD模型出发按难度课程微调。

仿真 + 实物代码待核实

DROID操作配置(正文未明确机械臂型号)

方法与证据
近期研究

Dynin-Robotics:全模态统一扩散视觉—语言—动作模型

在共享掩码扩散主干中序列化文字、视觉和量化动作,联合训练策略、下一图像、任务理解与目标图像预测。动作按块并行迭代解码;默认先生成目标,再条件化动作,也研究联合动作—视觉去噪和固定参考的候选重排。

仿真 + 实物待发布 / 占位

Franka Research 3

方法与证据
近期研究

H-VLA:在统一动作空间中结合关键动作推理与运动规划的层级视觉—语言—动作模型

H-VLA用Prismatic-7B视觉语言骨干提取认知特征,先由扩散模块生成末端位姿与夹爪组成的关键动作,再由另一扩散模块生成密集动作段。状态、子目标及动作统一到已标定第三人称相机坐标;关键帧按夹爪变化及轨迹终点自动标注,先重关键动作预训练,再等权联合微调。

仿真 + 实物代码待核实

Agilex PiPER(双臂Cobot Magic式平台) / Google Robot(SimplerEnv仿真)

方法与证据
近期研究

Opt2VLA:面向接触密集型人形机器人全身操作的力感知视觉—语言—动作框架

Opt2VLA把接触力目标显式加入GR00T-N1.7输出,与手脚运动目标一起交给任务专用全身RL控制器。轨迹优化生成满足动力学的动作、接触力及关节力矩参考,力矩参考仅训练时提供;实测力矩历史经独立编码器输入VLA,另预测未来力矩作辅助监督。

仿真 + 实物代码待核实

Agility Robotics Digit

方法与证据
近期研究

形态度量模仿:从形态与接触感知的手部动作重定向,到仿真迁移现实的视觉运动策略

三阶段先用形态计量优化改变MANO掌指比例、恢复人手接触,再映射骨架并联合求臂手逆运动学;随后ManiSkill中的残差PPO修正参考关节轨迹,以物体位姿和接触奖励取得动力学可行性,最后把特权教师蒸馏成点云流匹配策略。桌面避碰贯穿重定向与训练。

仿真 + 实物待发布 / 占位

KUKA iiwa14 + Sharpa Wave / Dex3(仿真)

方法与证据
近期研究

利用世界模型实现可泛化的机器人插入装配

InsertionWM以TD-MPC2学习潜在动力学、奖励、价值与策略先验,用MPPI在潜空间滚动规划。输入腕部96×96深度及24维本体/带噪位姿,输出六维末端增量;多装配共享模型,按各装配成功率调整初始状态课程。

仅仿真代码待核实

Franka Panda

方法与证据
近期研究

估计,而非模仿:复用可微的状态策略实现视觉运动控制

保留已训练且可微分的状态控制专家,只学习视觉到其缺失物理状态的估计器。多相机四帧视觉和本体状态经DINOv3-LoRA、时序卷积输出物体及目标相关状态,以状态回归和穿过冻结专家的动作一致性混合监督,逐渐增加动作损失。

仿真 + 实物代码待核实

Franka Panda / Allegro Hand(仿真)

方法与证据
近期研究

利用学习型稳定性模型实现人形机器人的反应式多接触控制

将满足摩擦、单向接触及关节力矩约束的线性规划结果作为监督,对5类镜像去重的手脚配置各训网络,输出18方向上的压力中心扩展。候选支撑先按平面再按点筛选,滚动预测接触前、碰撞及接触后捕获点,用可恢复控制余量评分并接入逆动力学。

仿真 + 实物代码待核实

Alex人形机器人(仿真与实机)

方法与证据
近期研究

ECoMEM:面向依赖记忆的机器人控制的显式概念记忆

Writer先按指令选择概念和依赖,用OWLv2定位、SAM2跟踪及末端/夹爪状态建立证据,经过确认、去重、计数与前置条件规则更新记忆。Reader对11类离散字段嵌入,以小Transformer逐记录生成token,与π0.5语言主干和动作专家联合训练。

仿真 + 实物代码待核实

YAM右臂(实机) / RoboMME任务机械臂(仿真)

方法与证据
近期研究

DITTO-X:用于灵巧操作与人类干预的正向和反向遥操作

三指主动外骨骼对食指/中指按关节映射,拇指经任务空间重定向,环指/小指跟随中指。利用电流或触觉估计载荷并回映射为关节反馈,Sharpa额外提供触点振动;反向模式投影机器人命令到人手,键盘请求与主动偏离阈值共同触发接管。

实物实验代码待核实

Franka Panda(实机) / Sharpa Wave灵巧手(实机)

方法与证据
近期研究

衡量资产与场景重建对真实到仿真机器人评测的影响

两版本使用相同对象照片与场景视频。定制版结合ChArUco尺度、投影纹理、按物体选碰撞体、VLM估计质量/回弹和类别摩擦表;默认版用TRELLIS、人工目测尺度和PhysX默认参数。运行门禁核对相机、动作块、预算等9项配置。

仿真 + 实物代码待核实

I2RT YAM双臂工作站(实机与Isaac Sim)

方法与证据
近期研究

将奖励作为观测:学习基于奖励的策略以快速适应

将原POMDP替换成奖励/动作历史输入,MLP-LSTM隐状态送入策略和价值网络。PPO之外加入模仿状态专家的动作损失以缓解探索困难;迁移后可用该策略给目标域访问状态提供DAgger标签,最终学生只读取目标图像。

仅仿真代码待核实

Stretch移动机器人(Habitat-Sim仿真) / DMC Cartpole(仿真)

方法与证据
近期研究

CF-JEPA:通过可控性因子分解提高JEPA世界模型的鲁棒性

ViT-Tiny输出192维潜变量,拆为128维可控与64维不可控。两支分别用动作条件/无动作动力学预测,加入可控支逆动力学、不可控支梯度反转动作预测和SIGReg防坍塌;CEM仅最小化可控潜状态到目标图的距离。

仅仿真代码待核实

Reacher(仿真) / OGBench机械臂(仿真)

方法与证据
近期研究

迈向建筑施工中的人形机器人:一项遥操作可行性研究

Quest 3将头部俯仰/偏航映射到两自由度ZED Mini相机颈部,通过WebRTC回传双目视频;Unitree XR框架重定向上肢与手指。GLYDR脚踏控制行走、转向和蹲起,GR00T Whole Body Control产生下肢命令,使双手操作与移动并行。

实物实验代码待核实

Unitree G1(实机) / Inspire五指灵巧手(实机)

方法与证据
近期研究

TacDyn-WAM:在异构视触觉世界动作模型中学习隐式触觉动力学

以InternVLA-A1为底座,TacRep用四帧触觉视频作掩码时空预测,并以DINOv2局部关系蒸馏保留空间结构。0.4B触觉专家一次预测5、15、25帧后的表征及增量;AnyTouch2只读记忆补充当前接触,四阶段逐步开放联合注意。

仿真 + 实物代码待核实

Franka Research 3(真机) / UniVTAC平行夹爪(仿真)

方法与证据
近期研究

同一场景,不同任务:通过技能对齐提升视觉语言动作模型的组合泛化

增加技能与状态查询词元,前者读取图文,后者只读图像。以动作流匹配误差对比同技能/异技能表示,再将反事实技能表示与参考演示状态配对,监督参考动作速度场;分开路由梯度,避免直接拿异场景动作作标签。

仿真 + 实物代码待核实

Piper 6-DoF(真机) / Pick-Place/Press仿真机械臂

方法与证据
近期研究

通过第一人称全身人类数据预训练迈向通用人形机器人运动操作模型

HumanVerse-500含32993回合、827任务类型及8700万姿态帧,PICO追踪身体、视频恢复手部并做时空对齐。λ0用Qwen3.5-2B及流匹配动作专家共享迁移核心,域专用投影区分人机;SONIC把人体动作重定向为G1运动潜变量并控制全身。

仿真 + 实物代码待核实

Unitree G1 + BrainCo Revo 2双手(真机) / SIMPLE人形机器人(仿真)

方法与证据
近期研究

AssemblyWorld:用通用智能体重新思考三维装配

固定部件几何和尺度,随机偏航与散布初始化,通过渲染、单件/组平移旋转工具逐步组合;网格顶点与面不开放。最终全局对齐并用匈牙利匹配处理等价部件,以Chamfer距离、部件准确率及全件正确成功率评估。

仅仿真代码待核实

无实体机器人;MCP三维部件编辑环境

方法与证据
近期研究

Ego4WAM:扩大第一人称人类数据规模用于机器人学习时,什么最重要?

把数据分成任务对齐视频动作、多任务可靠动作与纯视频三层。世界视频分支和动作分支共享注意,双臂32维动作只在人机共同可解释维度监督;依次尝试视频预训练、视频动作中间训练与机器人适配,并比较动作能否读取预测未来视觉。

仿真 + 实物代码待核实

双臂Piper(真机) / RoboDojo仿真机器人

方法与证据
近期研究

DynaHarness:用于自演化机器人智能体的动态物理执行框架

慢脑Qwen3-VL-4B按需输出技能和符号参数;2 Hz快脑以几何条件、预算和租期决定接纳、拒绝、替换或重规划,20 Hz执行并锁存短暂成功事件。解析、恢复技能及冻结π0.5统一记录,失败按有序层级定位,候选修订经配对和全套回归筛选。

仿真 + 实物代码待核实

UR7e(真机) / LIBERO机械臂(仿真)

方法与证据
近期研究

用于自主探索的GPU加速路径相关边际信息增益计算

CPU构树与碰撞检测,将TSDF连续化后传GPU。每节点保存第一占据体素的深度图,候选射线在祖先图像中裁剪并以逆深度插值找重叠区间,再三维射线累积新增未知体素。逐深度处理节点及偏航,同层节点和射线并行。

仿真 + 实物代码待核实

DJI F550(真机) / MRS UAV(Gazebo仿真)

方法与证据
近期研究

STARS:从时空动力学到人机交互中的社会表征

用完整有向图表示同时观察到的代理,边包含相对SE(2)位姿及时间差分。异构版本区分人、机器人与关系类型;消息传递图VAE重建节点有效属性和时序边特征,以KL正则学习每节点潜变量,再冻结编码器作线性探测。

真实数据评测代码待核实

SEAN-T虚拟导航代理 / SNS数据中的机器人与行人(离线轨迹)

方法与证据
近期研究

StreamRig:利用相机组内几何实现流式多相机里程计

冻结MapAnything同时编码已知内外参和同步多视图,Rig-Resampler每相机压成16词元。八层CausalBridge缓存历史键值,各查询拥有独立锚点副本;只训练74.6M后端参数,以相对位姿监督,先分组重定位再因果序列适配。

真实数据评测代码待核实

NCLT Segway(数据采集) / TartanGround地面机器人(仿真数据)

方法与证据
近期研究

DuoMind:通过语义通信实现分布式多机器人协调

每台机器人用Qwen3-VL-4B调度,用微调π0.5执行;上层交换意图、子目标、任务信念及可选不确定性。语言指令被限制在预设可接受集合内,并有停滞后强制推进机制,因此并非完全开放式自主协商。

仅仿真代码待核实

Franka Emika Panda(仿真) / Aloha-AgileX(仿真)

方法与证据
近期研究

SkeleWAM:面向高效机器人操作的骨架世界动作建模

冻结视觉网络从RGB-D提取物体中心及交互点,正运动学提供机器人节点,组成统一三维骨架。两个Transformer专家以流匹配联合学习动作和未来骨架,后者仅作训练监督。推理省去未来分支,MAC从多条采样轨迹中选距离其他轨迹最近的一条,避免直接平均不兼容动作。

仿真 + 实物代码待核实
近期研究

GlassGuard:面向机器人导航的经验证玻璃平面建图

先用裁剪量化的Slim SAM3生成玻璃掩码,再以LiDAR种子和水平/垂直结构构造有限平面。单帧射线几何、多视角重投影及地面证据排除假平面,最后合并全局假设并给规划地图补入占据体素。

真实数据评测代码待核实

麦克纳姆轮移动平台(型号未给出)

方法与证据
近期研究

UniWAM:统一世界动作模型

以联合注意力连接Qwen3-VL物理推理、Wan2.2视觉生成及连续动作流匹配三个专家;人类动作被写成统一物理语言,机器人数据再提供精确动作监督。后训练扰动未来视觉潜变量,并从已执行动作历史加噪初始化动作生成。

仿真 + 实物代码待核实

AgileX Piper(双臂实机)

方法与证据
近期研究

H-SPAR:融合水动力影响的粒子输运与自主机器人仿真

H-SPAR用离线Firedrake浅水方程流场统一驱动无人艇阻力和拉格朗日粒子输运,ROS2负责规划与水动力模块、Gazebo执行艇体物理。双船体按相对流速计算二次阻力和偏航力矩,采样概率按粒子相对速度偏离泵设计流速的程度衰减。

仅仿真代码待核实

双船体USV仿真模型(未注明商业型号)

方法与证据
近期研究

基于解析局部得分的免训练扩散规划

将轨迹目标分解为平滑、障碍物、智能体间距和速度四类因子,直接构造局部解析得分,以退火Langevin更新修正粗规划轨迹。方法不学习示范分布,时间局部性只是带噪得分的近似,并非远端路径点严格独立。

仅仿真代码待核实

机器人型号待核实或不适用

方法与证据
近期研究

TouchTherm:构建用于触觉与热觉渲染的物体多模态数字孪生

把扫描粗网格与多光照法线图配准,在接触点切空间积分成微高度,叠加接触掩模渲染GelSight纹理。多视角红外视频提供温度观测,用图拉普拉斯物理约束网络识别表面扩散和环境换热系数,运行时直接积分温度场。

真实数据评测代码待核实

机器人型号待核实或不适用

方法与证据
近期研究

离散曲面上的机器人学习:理论与应用

在多面体网格上定义切锥、最直测地线指数映射、对数映射与平行移动,显式处理边和顶点。DMP把驱动项固定在同一切锥再输运;GP使用测地距离核并检测长度尺度可容许性;流匹配沿原生网格几何积分。

仿真 + 实物代码待核实

Franka Research 3

方法与证据
近期研究

面向受限空间中水肺潜水员运动的物理水下机器人辅助

RADMCS用气瓶外挂圆筒和两台T200推进器产生转向力觉,不需把执行器缠在潜水员肢体上。侧视相机通过AprilGrid与PnP估计离墙距离,指数滤波、异常跳变拒绝、死区和饱和比例控制把距离误差转为左右推进器PWM。

实物实验代码待核实

RADMCS(自研气瓶外挂水下辅助机器人)

方法与证据
近期研究

FlashDexRetarget:通过多动作重定向加速灵巧操作数据生成

把多条人手—物体参考动作合并训练同一跟踪策略,以未来参考、物体点云和手物距离描述接触;左右手各用独立actor–critic但观察完整双手状态。FlashSAC复用不同参考的经验,并扩展至5000万回放、1024宽critic。

仿真 + 实物代码待核实

XHand(仿真) / Sharpa Wave Hand(仿真)

方法与证据
近期研究

3DROID:具有逐场景可靠性测量的可渲染三维高斯数据集

利用机器人正运动学/CAD表面与经典双目深度的一致性先筛选相机外参,再用位姿条件化的前馈高斯重建生成可渲染场景。将外参可靠性、重建误差和测量覆盖分开公布,避免把图像逼真度直接等同真实几何。

真实数据评测代码待核实

机器人型号待核实或不适用

方法与证据
近期研究

世界运动模型:三维刚体位姿轨迹的灵活序列建模

以带语义、局部几何描述的SE(3)位姿轨迹为共同表示,将机器人连杆、物体、人体和动作目标放入同一令牌网格。逐令牌独立噪声的流匹配及非连续上下文令牌,允许通过更换已知/未知掩模执行未来预测、策略、补帧和重定向。

仅仿真代码待核实

Unitree G1(仿真) / Panda(仿真)

方法与证据
近期研究

基于查询点的单图像关节运动参数估计

QueryArt接收已标定RGB和二维查询点,以冻结DINOv3特征、多尺度金字塔与可变形注意力预测关节类型、方向和相对轴偏移。偏移按查询深度归一化,规避单图绝对尺度不可辨识;测得一点深度后再恢复米制轴位置。

实物实验代码待核实

Boston Dynamics Spot(带机械臂)

方法与证据
近期研究

ActiveWAM:面向世界动作模型的证据感知主动视觉

ActiveWAM将任务相关历史保留与可执行头部取景共同建模。训练时用冻结Wan先验变换已观测历史,约束关键特征和可见动态,原始与变换历史共享动作/未来目标;视角适配器记录相机姿态、时间及有效性,统一生成双臂和云台动作。部署只用原始观察,不做在线反演或候选排序。

仿真 + 实物代码待核实

AirbotPlay(固定基座双臂) / GR1T2(TAVIS仿真)

方法与证据
近期研究

超越排行榜分数:面向行人环境部署的可解释跟踪评测协议

采用相同检测输入固定事件集合,把跟踪拆成初始化延迟、漏检期间连续正确位置/身份、间断后身份恢复和近邻关联,辅以HOTA与负载相关时延。PedRefTrack将发布预测的寿命和隐藏身份保留分开,另设真值辅助诊断版本。

真实数据评测代码待核实

机器人型号待核实或不适用

方法与证据
近期研究

SonarVoxNet:利用三维声呐检测潜水员的三维包围框

将三维声呐点云体素化,经稀疏卷积和中心检测头输出位置、尺寸及连续6D全旋转,而非只预测偏航。声呐专用增强增加稀疏前景覆盖;可选因果时序细化分别修正中心、旋转和尺寸,不提升低置信候选或删除原检测。

真实数据评测代码待核实

机器人型号待核实或不适用

方法与证据
近期研究

面向世界动作模型的任务完成感知引导

CAG研究世界动作模型生成看似合理却不完成关键阶段的问题,如一直持物而不释放。它不重新训练,而汇总视频/动作查询对语言词元的跨注意力,稀疏选中当前重要词元,按有界系数放大其键和值,让短时采样更容易出现完成转移。理想完成奖励仅用于动机推导,采样并没有可用的真实完成指示器。

仅仿真代码待核实

机器人型号待核实或不适用

方法与证据
近期研究

OpenSpace Lab参加IROS 2026室内探索竞赛的方案

单机器人将预训练LaMa/MapEx地图补全用于区域级目标排序,以有限宽度束搜索平衡信息增益、转移和返航代价,局部规划仍检查真实观测。多机器人利用共享地图、队友意图和历史轨迹抑制重复探索,并用通信中继交接和剩余预算决定返航。

仅仿真代码待核实

机器人型号待核实或不适用

方法与证据
近期研究

继续、中止还是跌落:用于安全人形机器人特技动作的可行性感知策略选择VAPS

分别训练完成动作、放弃动作但双脚落地、保护性跌倒三个专家;从相同仿真状态做反事实滚动,学习与候选策略相关的有限窗口存活预测。每步优先保留最有任务价值且仍可行的策略,撤离途中也可再次升级到保护跌倒。

仿真 + 实物代码待核实

Unitree G1(仿真) / LimX Oli(仿真及实机)

方法与证据
近期研究

只看成功就够了吗?研究输入扰动对桌面操作任务中视觉—语言—动作模型行为的影响

这是一套行为鲁棒性评估方法,补充二元成功率。它记录成功轨迹的仿真时长、末端/关节路径、均值与高分位加加速度、夹爪累计运动;比较每任务均值相对变化再取任务中位数,用MAD看波动,Mann-Whitney检验配BH多重比较校正。

仅仿真代码待核实

机器人型号待核实或不适用

方法与证据
近期研究

通过经验与示范实现六自由度抓取生成的持续学习

在几何采样抓取候选之外加入演示回忆,使用局部点云BPS和MLP学习32维归一化嵌入。近邻成败证据以距离权重更新Beta后验并给抓取排序;部署时追加记忆而不重训主网络,演示既新增候选也影响评分。

仿真 + 实物代码待核实

Franka Panda

方法与证据
近期研究

PROMO:面向四足机器人的偏好条件化多目标强化学习

PROMO把速度跟踪、身体稳定、能耗效率分成可调语义目标,将步态与接触正则保持为固定先验。偏好向量同时输入策略和历史编码,三头价值网络分别学习语义回报;特权编码在训练中对齐可部署历史表示,部署只保留本体观测、速度估计与单一策略。

仿真 + 实物代码待核实

Unitree Go2

方法与证据
近期研究

EIDA:面向真实—仿真—真实机器人导航的执行接口动力学适配

EIDA专门拟合高层速度命令经过现有底层控制器和估计器后的执行接口:MLP预测机体坐标位姿增量,独立ARX预测策略实际收到的速度估计。将两者植入快速二维模拟器,以带速度历史的SAC学导航;部署时两拟合模型都不在线运行。

仿真 + 实物代码待核实

Clearpath Jackal(仿真) / Unitree Go2(实机)

方法与证据
近期研究

Recova:智能体引导的自主机器人操作失败恢复

Recova把完成任务与恢复可工作场景拆成两个策略。编码智能体先用真实影像、轨迹和标定搭MuJoCo数字孪生,在失败状态试验纠错程序;上线后视觉语言监控检查进展、选择已登记恢复技能并验证结果,不适用时收集人类示范,按任务/恢复用途分别聚合微调。

仿真 + 实物代码待核实

I2RT YAM(双臂工作站)

方法与证据
近期研究

PhysicsLENS:诊断视频生成模型对物理属性的忽视

用相同起始图和任务构造可见条件与文本指定隐藏物性配对,分别人工评分物理合理性、任务完成和隐藏属性遵循。诊断器把相机补偿轨迹、光流和物体消失等信号,与针对具体物理错误的VLM问题组合,避免仅询问整体真实感。

真实数据评测代码待核实

机器人型号待核实或不适用

方法与证据
近期研究

MASkillBlender:通过技能融合实现多人形机器人移动操作的分散式全身协调

MASkillBlender在冻结的单人形行走、伸手、下蹲技能之上,用共享局部策略输出技能目标和逐关节混合权重。MAPPO集中价值学习、分散执行;同构队员置换产生额外训练样本,并在同构博弈假设下分析其策略梯度合法性。下游主要任务奖励不代表低层技能无需密集奖励。

仅仿真代码待核实

Unitree H1(仿真) / Unitree G1(仿真)

方法与证据
近期研究

FutureWorlds:从多种备选未来中学习机器人世界模型

用离散自回归视觉模型预测固定动作序列下的多个未来;多样化beam search产生候选,每个候选单独保留初始锚点与滚动历史。MemSPO按视频轨迹奖励计算组内优势,生成和概率打分使用同一历史,避免候选分叉后记忆错配。

真实数据评测代码待核实

机器人型号待核实或不适用

方法与证据
近期研究

两种冲击切换策略对双连杆行走与臂行机器人的步态稳定性影响

论文将双连杆被动行走和臂摆统一为连续双摆动力学、瞬时完全塑性碰撞、坐标重标记组成的步间映射。比较足/手碰到表面即触发的状态切换SBS与固定间隔触发的时间切换TBS;两者可拥有相同周期一步轨道,但扰动后的碰撞时刻不同,因此稳定性不必相同。

仅仿真代码待核实

双连杆行走/臂摆数学模型

方法与证据
近期研究

NarrativeFlow:利用机器人速度场的基于流的视觉—语言—动作模型

视觉与语言编码后使用两个专用token,分别驱动Flow-as-Flow生成器和Narrative Delta辅助损失。后者对齐大模型依据起始、目标图像生成的多视角变化叙述;推理不需要目标图。DiT预测连续二维速度场,经积分得到运动点轨迹,再条件化操作策略。

实物实验代码待核实

Toyota HSR(实机) / Google Robot(Fractal数据来源)

方法与证据
近期研究

在交叉熵方法中,世界模型也是一种候选提案机制

保存各模型生成的候选池,再由四种固定代理模型交叉重评分;所有动作从同一仿真状态执行,获得真实成本和参考精英集。比较精英重合、成对排序,以及提案均值和宽度的不同归一化距离;仅替换首轮精英集并固定后续模型和随机样本,检验更新后果。

仅仿真代码待核实

DeepMind Control Suite Walker(仿真) / DeepMind Control Suite Cheetah(仿真)

方法与证据
近期研究

eRLT:通过动作相关词元路由实现高效视觉—语言—动作模型强化学习

向冻结VLM额外追加可学习路由token,在多层读取其隐藏状态,再用任务共享层权重压缩为RL token。先用专家动作块预测监督初始化,移除预测头后通过评论家TD误差周期更新路由;演员梯度断开,基础VLA及其动作生成保持冻结。

仿真 + 实物代码待核实

RB-Y1左臂(实机) / LIBERO与RoboTwin任务机器人(仿真)

方法与证据
近期研究

螺旋注意力:将刚体代数嵌入Transformer

每个token具有标量通道与六维运动/力螺旋通道;消息经真实相对变换传入接收坐标系,注意力只看不变量,学习矩阵仅混合通道。门控修正softmax归一化,使单层包含刚体速度递推;可独立输出动作或作为解析控制器的门控残差。

仅仿真代码待核实

固定基座串联机械臂(仿真) / Franka机械臂/LIBERO(仿真)

方法与证据
近期研究

面向多人多机器人监督的实时人因自适应任务分配

初始容量来自三次2-back测试;随后综合NASA-TLX、疲劳评分、任务完成数和眨眼变化,按时段增减一个监督名额。以视线停留时间估计不同任务的相对难度,贪心分配最紧急任务,并按死锁簇边界优先调度可移动机器人。

仅仿真代码待核实

Unity仓储移动机器人(仿真)

方法与证据
近期研究

运动学MeanFlow:用于机器人基础模型的单步动作生成策略

依据区间平均速度恒等式,将MeanFlow目标中的总时间导数拆成早期、晚期两部分,缓解末期局部加速度突增和样本间尺度扩张。用前向自动微分JVP并行计算两项,比较随机、中点和小MLP学习分割点;推理一次网络评估直接输出动作块。

仅仿真代码待核实

GoogleX(SimplerEnv仿真) / WidowX(SimplerEnv仿真)

方法与证据
近期研究

前沿视觉语言模型智能体准备好成为通用机器人了吗?基于具身智能体竞技场的实证研究

整合32个既有来源与新GeoProbe,共1000案例,保留原始观测、动作接口和成功条件。固定输入任务使用持久Python交互,操作遵循原生控制循环;分别计几何误差、接触有效性、规划Pass@1及终态所有目标条件,避免用局部进展替代成功。

仅仿真代码待核实

CALVIN、RLBench、RoboTwin等基准机器人(仿真)

方法与证据