PTAM:面向小型增强现实工作空间的并行跟踪与建图
将跟踪与建图并行化,形成关键帧优化型视觉 SLAM 的代表性架构。
MzeeRESEARCH60 分钟更新沿时间阅读不同方向的代表性研究。看方法怎样变化,也看实验如何走向现实。
按已核实的首次发布年份排列。
时间相邻不表示直接继承或因果关系。
将跟踪与建图并行化,形成关键帧优化型视觉 SLAM 的代表性架构。
把递推概率 SLAM 落到实时单目视觉,是理解后续关键帧优化路线的重要起点。
DAgger迭代执行当前策略或其与专家的混合,在实际访问状态查询专家动作,将样本加入累计数据集后重新监督训练。重点是改变训练状态分布以覆盖学习者自身错误;混合专家比例逐渐降低,最终可部署单一策略。无悔在线学习把训练损失联系到策略诱导分布下的表现。
2013版GPS先用微分动态规划DDP找到随机反馈轨迹分布,从中采样初始化神经网络策略,再把这些引导样本和策略自身经验放进正则化重要性采样目标。优化和采样交替进行,必要时适应引导分布,使高回报局部解推动更通用策略搜索。
从稳定弹簧阻尼系统出发,用相位驱动的可学习强迫项编码轨迹形状,分别构造点吸引子和周期吸引子;基函数权重可由示范回归。时间常数、目标和振幅控制执行变化,空间/相位耦合项支持障碍响应、停顿及多关节协调。
把半稠密直接法从局部里程计推进到带尺度校正和回环的大范围地图。
以高频里程计、低频精细建图的分工建立了激光 SLAM 的重要工程范式。
以统一特征和完整回环/重定位流程,成为特征型视觉 SLAM 的代表性基线。
引导式策略搜索把局部轨迹优化与视觉策略监督学习交替进行,训练时利用完整状态,执行时只用相机与本体。CNN空间softmax把特征图转为可微坐标点,再映射到控制量;先预训练视觉和局部控制器,最后联合端到端优化。
DDPG将确定性策略梯度与深度actor-critic结合,actor输出连续动作,critic拟合Bellman目标。经验回放降低时序相关,缓慢软更新的双目标网络稳定训练;低维输入使用batch normalization,探索加入Ornstein-Uhlenbeck相关噪声。
以子地图和高效全局匹配把回环计算纳入实时二维激光建图流程。
突出联合光度优化和相机响应建模,深化了直接法视觉里程计路线。
2016:在真实推物任务中展示动作条件视频预测可直接支持闭环控制。
把成熟特征型 SLAM 扩展为可统一运行单目、双目和 RGB-D 的开源基线。
论文随机化合成场景纹理、灯光、物体位置、干扰物、相机姿态与视场,训练VGG式卷积网络从单幅RGB回归目标中心坐标。已知目标形状尺寸、固定桌高降低了几何难度;无需逼真纹理或真实图像微调,模型学到的是位置估计,不是完整抓取控制。
PPO收集当前策略批次后,用旧/新动作概率比和优势估计构造替代目标,多轮小批量更新。裁剪版本取原目标与裁剪目标较小者,移除向过大改善方向继续推进的收益;另一版本自适应调节KL惩罚,并结合价值和熵目标。
将视觉惯性的关键数学模块连成可用于真实闭环飞行的系统化开源方案。
以 R2R 将自然语言路线理解变成具身导航的标准化评测问题。
原版SAC将奖励与策略熵共同优化,以离策略回放提高利用率。软策略迭代先评估软Q值,再把策略投影到由Q诱导的分布;神经网络版本使用随机重参数化actor、双Q取小值及独立软状态价值网络与目标网络,并用tanh约束连续动作。
2018:以可复现实验普及“学习环境模型、在想象中训练控制器”的现代深度学习范式。
2018:示范驱动的物理运动控制成为后续人形模仿学习的重要技术起点。
QT-Opt以连续动作Q学习替代独立actor,通过交叉熵方法随机优化Q值选择动作;双目标网络、裁剪双Q和异步Bellman更新支撑大规模离策略图像数据。闭环反复观察,使抓取前推挪、重抓和失败恢复可由长期奖励学习。
2018:大规模仿真RL跨越到真实灵巧手,推动域随机化的机器人应用。
2018:RSSM 与潜空间 MPC 为后续 Dreamer 系列奠定结构基础。
将长期地图内存管理与视觉/激光多配置评估结合,连接算法研究与机器人集成。
用刚体接触仿真加由实体执行器数据训练的神经执行器模型,近似串联弹性电机、低层软件延迟和扭矩映射;再在随机化仿真中以强化学习训练读取状态历史的MLP,输出关节位置目标。行走、高速和跌倒恢复分别使用不同奖励训练。
以高吞吐仿真与统一任务接口,为具身导航的大规模学习和公平比较提供基础设施。
在统一V-REP/PyRep场景中封装任务变化、传感器、成功判据和示教生成器,支持多任务学习及少样本模仿。
2019:把视觉手部重定向接入真实灵巧操作,为后续人类示范学习铺路。
2019:从手内重定向推进到高精度多阶段操作,并把域随机化自动化。
设计50类共享控制结构但物体和交互不同的桌面任务,区分同任务目标变化、多任务学习以及未见任务的少样本适应。
2019:从模型内动作搜索推进到用想象轨迹学习可直接执行的策略。
把语义空间先验用于目标导向探索,展示学习策略与地图规划结合的导航路线。
用因子图把激光惯性里程计、GPS 与回环放到统一可扩展框架。
把紧耦合惯性估计和多地图恢复整合进成熟特征型 SLAM 系统。
把机器人、末端、底座、物体和场景模块组装成MuJoCo模型,提供多模态传感器、遥操作和任务空间/关节空间控制器。
2020:离散潜状态推动世界模型达到强 Atari 表现,并支持连续控制。
Transporter先用全卷积网络选抓取点,再裁切该点附近的视觉特征,经平移旋转后与整幅特征互相关,预测条件放置位姿。RGB-D转俯视颜色/高度栅格,把动作与像素坐标对齐;交叉熵拟合示范,利用空间等变性表达多种合法抓放组合,也可用两位姿原语推扫物体。
用单个在线训练的MLP将三维坐标映射到颜色和体密度,跟踪与建图并行运行;关键帧重放和误差引导像素采样缓解遗忘并减少优化成本。
2021:运动控制从显式轨迹跟踪扩展到数据驱动的分布式运动先验。
引入可交互ReplicaCAD场景与程序化杂物布局;以局部物理/渲染和交错执行提高速度,构建从抓取到长时序居家重排的基准。
先用特权质量、摩擦和电机等参数编码的8维环境潜变量训练基础行走策略,再学习50步历史到潜变量的适应网络。适应器在自身造成的轨迹上监督训练;部署只需本体传感,基础策略100Hz、适应器10Hz异步运行,不进行在线梯度微调。
以直接配准和增量空间索引提升激光惯性里程计的实时性与扫描模式适应性。
这是一项离线人类示范学习的系统比较,评估BC、带历史的BC-RNN、分层HBC、BCQ、CQL与IRIS,而非单一新策略。数据分机器生成、熟练单人200条、六位不同熟练度操作者共300条;控制数据质量、历史、观察模态、网络结构和检查点选择来分析性能来源。
2021:把人类视频转为灵巧操作学习信号,连接视觉手物理解与机器人训练。
循环网络预测稠密对应修正及置信度,通过可微稠密束调整联合更新相机位姿和逐像素逆深度;单目训练后可接入双目或深度约束。
CLIPort融合冻结CLIP的语义通道与Transporter的空间等变通道,从俯视RGB-D和语言生成拾取/放置位置及离散旋转。以示范像素动作交叉熵训练,语义分支回答操作什么,空间分支保持精确几何;多任务按任务均匀采样。
把物理仿真、观测、回报、PPO及缓存全部留在GPU,用数千机器人同时采样。地形课程在同一网格上移动机器人切换难度,正确区分超时截断与失败终止;关节目标经学得的执行器模型转力矩,并施加噪声、摩擦和推动随机化。
四套视觉布局中的34项操作技能组合成语言指令链,提供多模态观测和自由交互示教,用来测试语言落地与连续控制。
用粗中细多层特征网格及预训练占据解码器表示几何,另建颜色网格,通过可微渲染联合优化场景与相机位姿。
2022:把短时域模型规划与长期 TD 价值结合为实用连续控制基线。
SayCan对有限技能库的自然语言描述计算LLM条件概率,同时用技能价值函数估计当前场景能否成功;两者相乘后选择下一技能,执行后重新打分直至终止。强化学习的价值函数提供可执行性,LLM提供对长指令的语义步骤偏好。
2022:从单任务运动模仿迈向大规模预训练且可复用的技能空间。
把整段状态-动作轨迹建模为扩散去噪过程,以目标条件或引导函数影响采样;通过局部时序卷积多轮去噪生成全局连贯计划。
2022:把潜在想象式学习从游戏和仿真推进到多种真实机器人。
GPT-3从指令提取地标,CLIP将地标关联到先前探索的图像节点,视觉导航模型估计节点连通并执行图搜索所得路线;三个模型权重均冻结。
把成功检测、物体列表、场景描述或人类反馈持续加入LLM提示,使其从已有短时技能库中重新选取动作,形成闭环计划。
2022:展示离散词元 Transformer 可承担高交互效率的世界模型学习。
将多视角RGB-D体素化,用Perceiver潜变量融合语言与三维场景,预测离散末端位置、旋转和夹爪状态,由运动规划器执行关键帧动作。
用少样本提示将自然语言变成Python策略程序,组合感知API和控制原语;遇到未定义函数时递归生成子程序。
VIMA把任务写成文本与对象/场景图像交错的多模态提示,冻结T5编码提示,通过交叉注意力条件化自回归动作解码。观察采用对象检测得到的图像块和位置词元,并保留动作—观察历史,统一表达新概念、视觉目标和视频模仿。
用可微力闭合能量、手姿初始化和几何穿透约束加速优化抓取;再在Isaac Gym中验证不同重力方向下的稳定性。
把不同机器人的动作统一为相对航点和偏航变化,用历史图像推断运动特性;联合预测目标距离与动作,并与拓扑地图组合。
把语言语义嵌入可度量地图,让开放词汇与空间关系能够参与导航规划。
2022:将腿臂分离控制推进为可实机部署的统一足式移动操作策略。
2022:几何观测与身体先验支持灵巧手策略直接跨越仿真和真实对象。
RT-1用语言嵌入FiLM调制EfficientNet图像特征,TokenLearner把每帧压成8词元,六帧历史送入Transformer。机械臂、底盘与终止模式离散成动作词元,以监督交叉熵学习;压缩及非逐token自回归等优化满足约3Hz真机控制。
DreamerV3以离散随机潜变量和循环状态学习可重构观测、预测奖励及终止的世界模型,再在想象轨迹中训练演员和评论家。symlog/双热分类处理跨量级信号,KL平衡、自由比特与均匀概率混合稳定训练;执行时直接采样演员,不做在线树搜索。
上下文辅助估计网络联合学习机体速度与潜在环境表示,用本体感觉历史支撑RL控制;奖励兼顾运动表现及电机功率分布。
把语言目标条件化的未来视频当作通用计划,再由任务相关逆动力学模型映射为动作;用分层时间超分辨生成更细致的轨迹。
在SAPIEN上统一刚体与软体操作、视觉观测及控制器接口;用刚体和MPM双向耦合、异步渲染与共享渲染服务器提高采样效率。
从人类自由交互视频预测未来三维手部轨迹,学习目标条件的高层潜在计划;低层控制器用少量遥操作数据把计划映射成机器人动作。
2023:Transformer历史建模与仿真RL结合,进入全尺寸人形机器人实机行走。
PaLM-E把图像、连续状态或对象中心三维表示映射到语言嵌入维度,插入文本序列,以自回归语言目标共同训练。模型输出文字计划或回答;真实动作由已有语言条件低层控制器执行,再把新图像反馈给高层,不是直接生成关节动作的端到端控制策略。
Diffusion Policy将视觉条件动作分布表示为逐步去噪的动作序列,使用滚动时域执行部分动作后重新观测。视觉特征只作条件而不与动作共同去噪;比较时序卷积U-Net和Transformer、位置/速度动作与视觉预训练,避免确定性回归平均多个行为模式。
ALOHA以小型WidowX领导臂直接映射关节到ViperX双跟随臂,配四路相机和改装夹爪。ACT使用条件VAE Transformer一次预测动作块,执行时每步重新查询,并对重叠预测做时间集成,缓解误差累积与示范中暂停造成的非马尔可夫性。
2023:灵巧操作评估从单物体成功率转向类别级关节物体泛化。
2023:把灵巧控制的扩展重点推向种群探索与高维双臂训练系统。
LIBERO以Ego4D语言行为模板、初始物体分布和PDDL式目标谓词生成操作任务,专门拆分空间、物体、目标和综合知识迁移。三种策略架构配顺序学习、经验回放、EWC、PackNet和多任务训练,研究持续学新技能时的遗忘与前向迁移。
2023:展示多任务、多本体通用策略通过采集自身经验继续改进。
先把RGB-D重建为点云,再从机器人基座周围虚拟视角重渲染;多视图Transformer融合语言并把预测反投影到三维末端动作。
用Transformer处理历史观测与目标图像,预测归一化相对航点和到达时间;跨机器人数据训练后,以扩散子目标和拓扑搜索扩展到长距离。
LLM与视觉语言感知生成三维可供性和约束价值图,再用模型式运动优化合成闭环末端轨迹;接触任务可结合在线动力学学习。
RT-2将平移、旋转、夹爪及停止动作编码为离散文本token,以PaLI-X或PaLM-E联合微调机器人示范和原互联网视觉语言任务;动作模式限制合法输出词表,保留语义先验并直接生成闭环控制命令。
在多种布景、物体和相机位置中采集任务混合轨迹,定期随机化环境,并提供目标图像或语言条件以支持多类离线学习算法。
先在允许障碍穿透的软动力学课程中探索技能,再恢复真实约束微调;用DAgger把爬越、跨跳、匍匐、侧倾及奔跑蒸馏为深度视觉策略。
用统一内积奖励和地形课程学习多样运动,再双重蒸馏特权策略与朝向估计,让深度图直接驱动关节动作和转向。
2023:将生成式视频模型拓展为可用动作交互、用于训练策略的模拟器。
在ViNT式视觉编码中随机遮蔽目标token,用同一个动作扩散模型学习有目标导航与无目标探索,配合拓扑图进行长时序搜索。
先生成任务视频,用GMFlow估计逐帧稠密光流,再结合初始深度恢复物体或相机的三维刚体运动,由现有操作原语执行并在停滞时重新规划。
Open X-Embodiment把跨机构机器人轨迹统一为RLDS接口,以RT-1-X及RT-2-X检验跨形态联合训练。图像和语言统一处理,动作粗略归一化但不强制对齐坐标、绝对/相对或速度语义;大模型将动作当离散语言词元与网页视觉语言知识结合。
将骨架碰撞、蒙皮外观和SMPL-X人体模型集成到仿真,配合行走/伸手行为库和人在环控制工具研究跟随与协作重排。
2023:从单任务模型控制推进到大规模多任务、跨本体潜空间规划。
把示教切成以物体为中心的子任务,再按新场景的物体位姿变换末端轨迹,插值连接片段并过滤未成功的生成轨迹。
用大模型提出任务、检索或生成场景资产并校验尺寸,再生成奖励、分解步骤并选择运动规划或强化学习,形成自动技能学习流程。
把场景表示为各向同性三维高斯,用可微光栅化生成颜色、深度和轮廓;交替优化相机位姿、扩展未建图区域及更新高斯参数。
深度和里程计构建占据地图,视觉语言相似度形成目标相关价值地图;给探索前沿排序,再由低层导航器前往目标。
将ALOHA双臂放在AgileX Tracer差速底盘上,以腰部连接反驱底盘实现手臂/移动同步遥操作。学习时把825条静态ALOHA示范与每任务移动示范等概率混合,静态数据底盘动作补零;ACT等动作块策略联合输出双臂位置与底盘速度,并补偿延迟。
UMI用带鱼眼相机、侧镜和IMU的手持夹爪记录示教,恢复相对末端轨迹;扩散策略配合观测同步与执行延迟匹配,减少人类采集与机器人部署的接口差异。
DP3把稀疏三维点云压缩为紧凑视觉表示,与机器人状态共同条件化扩散动作序列;简单的三维编码避免复杂体素或大规模点云骨干。
2024:大规模人类动作清理与仿真RL连接到全尺寸人形实时跟随。
便携SLAM与电磁动捕记录手腕、手指和三维场景;以指尖逆运动学重定向到LEAP手,点云扩散策略学习动作,并可加入人在环纠正。
把人类家务需求表示为BDDL语义目标,配合场景/物体资产和OmniGibson的刚体、软体、液体仿真,支持长时序活动研究。
DROID以一致且可推行的数据采集硬件分布到18处,由50人收集不同建筑、任务、视角与场景;Panda加Robotiq 2F-85、三路ZED相机及Quest遥操作,15Hz同步动作。它主要贡献真实数据分布与采集流程,并用标准语言条件扩散策略检验价值。
2024:人形Sim2Real研究形成更易上手的开源训练与验证工具链。
2024:通过语言结构组合世界模型,推进未见目标的视频规划。
将语言、目标图像和多相机历史编码成分块注意力Transformer输入,以只读取上下文的读出令牌连接扩散动作块解码器。增减传感器或动作头时保留主体权重;从Open X-Embodiment筛选25套数据、约80万条轨迹,统一末端增量及夹爪语义。
2024:从桌面单任务基准走向多样厨房与可扩展日常操作数据。
OpenVLA将DINOv2与SigLIP特征拼接到Llama2/Prismatic7B骨干,把每维连续动作离散为256分箱并自回归预测。用筛选后的Open X-Embodiment约97万轨迹微调全部模块,支持LoRA适配与低比特推理。
2024:从全身遥操作扩展到统一输入接口和示范驱动的自主技能。
2024:人类动作先验成为人形遥操作采集与自主模仿学习的数据入口。
顺序融合激光雷达、惯性与图像观测,统一体素地图管理几何和图像块;估计曝光变化并按需光线投射弥补雷达近距盲区。
先学带特权地形信息的受约束策略,再用其经验初始化离策略视觉强化学习;让视觉策略适应有限观测,同时保留关节和姿态约束。
2024:将大规模扩散 Transformer 与统一动作空间引入双臂通用策略。
基于PaliGemma视觉语言主干加入较小动作专家,以条件流匹配生成50步连续动作块,多相机、指令和关节状态共同输入。先在跨机器人广泛数据上预训练,再用质量与策略一致性更高的任务数据后训练,动作维度填充兼容多个平台。
以中层语言动作连接 VLA 与足式运动技能,推动语言导航走向物理机器人执行。
2025:以时序压缩缓解自回归 VLA 在高频动作序列上的表示瓶颈。
2025:人形敏捷技能从纯随机化迁移走向真实数据驱动的物理对齐。
2025:把 VLA 微调策略作为独立研究对象,提升部署效率和任务成功率。
GR00T N1将Eagle-2视觉语言模块与流匹配Diffusion Transformer相连,以本体专用编码/解码适配不同状态动作维度。混合真实遥操作、物理仿真、人类视频和生成视频,借潜在动作或逆动力学伪标签利用无动作视频,再进行任务后训练。
π0.5把多场景移动/固定机械臂、跨形态动作、语言子任务和网络视觉数据共同训练。先以FAST离散动作做自回归预训练,再增加流匹配动作专家;同一模型先预测语义子任务,再条件化生成连续动作段,兼顾语言监督与实时控制。
2025:轻量化 VLA 与社区低成本硬件数据降低复现和部署门槛。
2025:大规模自监督视频表征结合小规模机器人动作后训练,实现新环境实机规划。
2025:将真实部署、自主尝试与人工纠错纳入大型 VLA 的迭代强化学习。
HuMI用手持感知夹爪与腰脚追踪器收集无需机器人在场的示范,在线逆运动学预览让人主动避开机器人不可达姿态。高层扩散策略生成身体关键点轨迹,仿真训练的低层全身控制器采用速度自适应末端精度和变速增强;动作段以上一目标为参考,腰脚等缺乏视觉锚点处只跟踪段内相对运动。
PlayWorld用VLM提出场景相关且轻微变化的任务,让现有VLA自主玩耍,采集抓空、滑移、碰撞、变形等成功示范较少覆盖的转移。加关节/工作区安全限制与语言重置,在DROID操作配置上持续采集;从DROID预训练多视角SVD模型出发按难度课程微调。
在共享掩码扩散主干中序列化文字、视觉和量化动作,联合训练策略、下一图像、任务理解与目标图像预测。动作按块并行迭代解码;默认先生成目标,再条件化动作,也研究联合动作—视觉去噪和固定参考的候选重排。
先由现实影像重建工作区与物体,再标注任务关键界面,在保留接触面和孔/头部约束下拉伸、弯曲非功能几何。顶点对应关系同步传递任务位姿和碰撞代理,用具特权状态的脚本专家批量生成示范,视觉策略只读取图像与本体状态。
H-VLA用Prismatic-7B视觉语言骨干提取认知特征,先由扩散模块生成末端位姿与夹爪组成的关键动作,再由另一扩散模块生成密集动作段。状态、子目标及动作统一到已标定第三人称相机坐标;关键帧按夹爪变化及轨迹终点自动标注,先重关键动作预训练,再等权联合微调。
把冻结世界模型的每相机图像令牌均值离线缓存,再用小投影头将0.8B学生VLA的视觉特征与教师做余弦对齐;与流匹配动作损失共同训练。部署移除教师、缓存和投影器,保持原学生一次主干前向与四步流解码。
Opt2VLA把接触力目标显式加入GR00T-N1.7输出,与手脚运动目标一起交给任务专用全身RL控制器。轨迹优化生成满足动力学的动作、接触力及关节力矩参考,力矩参考仅训练时提供;实测力矩历史经独立编码器输入VLA,另预测未来力矩作辅助监督。
三阶段先用形态计量优化改变MANO掌指比例、恢复人手接触,再映射骨架并联合求臂手逆运动学;随后ManiSkill中的残差PPO修正参考关节轨迹,以物体位姿和接触奖励取得动力学可行性,最后把特权教师蒸馏成点云流匹配策略。桌面避碰贯穿重定向与训练。
InsertionWM以TD-MPC2学习潜在动力学、奖励、价值与策略先验,用MPPI在潜空间滚动规划。输入腕部96×96深度及24维本体/带噪位姿,输出六维末端增量;多装配共享模型,按各装配成功率调整初始状态课程。
把足底法向力、压力中心和接触面积压缩成可部署特征,与本体和深度历史共同输入PPO策略。轻量触觉模拟将刚体合力按60个触元间隙与法向分配,再模拟空间扩散;按步态阶段奖励柔和落地及稳固支撑,双critic分担稠密和事件式信号。
保留已训练且可微分的状态控制专家,只学习视觉到其缺失物理状态的估计器。多相机四帧视觉和本体状态经DINOv3-LoRA、时序卷积输出物体及目标相关状态,以状态回归和穿过冻结专家的动作一致性混合监督,逐渐增加动作损失。
将满足摩擦、单向接触及关节力矩约束的线性规划结果作为监督,对5类镜像去重的手脚配置各训网络,输出18方向上的压力中心扩展。候选支撑先按平面再按点筛选,滚动预测接触前、碰撞及接触后捕获点,用可恢复控制余量评分并接入逆动力学。
证明跨地图耦合可归约为高斯前方透射率与后方辐射,两者按射线深度箱分布式求和。各机器人在路径掩码范围交换统计和旋转导数,重建信息增益并在SO(3)优化朝向;无混合分箱时精确,否则由光学深度给出误差界。
Writer先按指令选择概念和依赖,用OWLv2定位、SAM2跟踪及末端/夹爪状态建立证据,经过确认、去重、计数与前置条件规则更新记忆。Reader对11类离散字段嵌入,以小Transformer逐记录生成token,与π0.5语言主干和动作专家联合训练。
三指主动外骨骼对食指/中指按关节映射,拇指经任务空间重定向,环指/小指跟随中指。利用电流或触觉估计载荷并回映射为关节反馈,Sharpa额外提供触点振动;反向模式投影机器人命令到人手,键盘请求与主动偏离阈值共同触发接管。
两版本使用相同对象照片与场景视频。定制版结合ChArUco尺度、投影纹理、按物体选碰撞体、VLM估计质量/回弹和类别摩擦表;默认版用TRELLIS、人工目测尺度和PhysX默认参数。运行门禁核对相机、动作块、预算等9项配置。
将原POMDP替换成奖励/动作历史输入,MLP-LSTM隐状态送入策略和价值网络。PPO之外加入模仿状态专家的动作损失以缓解探索困难;迁移后可用该策略给目标域访问状态提供DAgger标签,最终学生只读取目标图像。
ViT-Tiny输出192维潜变量,拆为128维可控与64维不可控。两支分别用动作条件/无动作动力学预测,加入可控支逆动力学、不可控支梯度反转动作预测和SIGReg防坍塌;CEM仅最小化可控潜状态到目标图的距离。
Quest 3将头部俯仰/偏航映射到两自由度ZED Mini相机颈部,通过WebRTC回传双目视频;Unitree XR框架重定向上肢与手指。GLYDR脚踏控制行走、转向和蹲起,GR00T Whole Body Control产生下肢命令,使双手操作与移动并行。
以InternVLA-A1为底座,TacRep用四帧触觉视频作掩码时空预测,并以DINOv2局部关系蒸馏保留空间结构。0.4B触觉专家一次预测5、15、25帧后的表征及增量;AnyTouch2只读记忆补充当前接触,四阶段逐步开放联合注意。
在ManiSkill 3中构造90项任务、26个家族和十类记忆需求,以线索出现、消失及动作阶段控制信息可用性。动作是10 Hz七维末端增量位姿与夹爪,观测为顶视、腕部图像和本体状态,另给稠密奖励与任务成功谓词。
TRUST根据图像与部分推理前缀预测最终正确概率,用完整轨迹标签训练token级价值头。低于验证集阈值时,对前十个下一词候选做门控价值增广采样;不改VLA权重,也不读取其隐藏态。
冻结Qwen3-VL,将108个2560维视觉词元逐词压成16维,不合并空间位置。独立语义VAE先学重建,后冻结编码解码器;因果时空Transformer结合GRU与滑动窗口,以流匹配及shortcut forcing预测紧凑状态和本体信息。
从任务定义抽取动作、对象、关系、目标、属性五类语义槽,生成同义改写、单槽有效对比与场景冲突请求,随后校验实体和目标谓词。每学习一项任务后冻结评估,结合成功AUC、改写差距、目标切换与旧目标持续率。
增加技能与状态查询词元,前者读取图文,后者只读图像。以动作流匹配误差对比同技能/异技能表示,再将反事实技能表示与参考演示状态配对,监督参考动作速度场;分开路由梯度,避免直接拿异场景动作作标签。
225M自回归Transformer结合Gemma条件编码,级联预测候选位置、形状与概率。SMC并行保留装配序列,二维最小平移修复碰撞、惩罚大位移并重采样,最终优先选最长序列;数据按重心投影支撑条件插入脚手架。
HumanVerse-500含32993回合、827任务类型及8700万姿态帧,PICO追踪身体、视频恢复手部并做时空对齐。λ0用Qwen3.5-2B及流匹配动作专家共享迁移核心,域专用投影区分人机;SONIC把人体动作重定向为G1运动潜变量并控制全身。
固定部件几何和尺度,随机偏航与散布初始化,通过渲染、单件/组平移旋转工具逐步组合;网格顶点与面不开放。最终全局对齐并用匈牙利匹配处理等价部件,以Chamfer距离、部件准确率及全件正确成功率评估。
把数据分成任务对齐视频动作、多任务可靠动作与纯视频三层。世界视频分支和动作分支共享注意,双臂32维动作只在人机共同可解释维度监督;依次尝试视频预训练、视频动作中间训练与机器人适配,并比较动作能否读取预测未来视觉。
慢脑Qwen3-VL-4B按需输出技能和符号参数;2 Hz快脑以几何条件、预算和租期决定接纳、拒绝、替换或重规划,20 Hz执行并锁存短暂成功事件。解析、恢复技能及冻结π0.5统一记录,失败按有序层级定位,候选修订经配对和全套回归筛选。
CPU构树与碰撞检测,将TSDF连续化后传GPU。每节点保存第一占据体素的深度图,候选射线在祖先图像中裁剪并以逆深度插值找重叠区间,再三维射线累积新增未知体素。逐深度处理节点及偏航,同层节点和射线并行。
用完整有向图表示同时观察到的代理,边包含相对SE(2)位姿及时间差分。异构版本区分人、机器人与关系类型;消息传递图VAE重建节点有效属性和时序边特征,以KL正则学习每节点潜变量,再冻结编码器作线性探测。
冻结MapAnything同时编码已知内外参和同步多视图,Rig-Resampler每相机压成16词元。八层CausalBridge缓存历史键值,各查询拥有独立锚点副本;只训练74.6M后端参数,以相对位姿监督,先分组重定位再因果序列适配。
保留RH-NBVP、KRH-NBVP、AEP、KAEP核心采样逻辑,在机端维护局部Voxblox地图并传增量,中央按权重融合TSDF。各规划器访问全局图及活动路径缓存,剔除靠近障碍/同伴路线的候选;点云滤掉其他机体周围球形区域。
RPG不更新模型权重,而用离线视频构建MuJoCo练习任务。执行智能体与可见特权状态的智能体并行尝试,视频分析定位失败,再修改提示词和共享技能。候选及合并版本须提高跨任务均值,且单任务下降不超过五次中的一次,才可保留。
以分阶段奖励、结束条件和可调常数组成程序;语言模型修改结构,CMA-ES校准参数,固定验证器比较并行仿真结果。物体残差加在冻结的身体前向—后向模型上,使奖励映射成潜变量,执行期间不再训练控制器。
把伙伴能力表示为有限候选约束,利用双方联合动作在有界理性行为模型下的似然形成后验;复杂场景以离线学习评分近似计算。部署时将推断约束加入CEM模型预测控制,预测受限伙伴对辅助者动作的响应。
每台机器人用Qwen3-VL-4B调度,用微调π0.5执行;上层交换意图、子目标、任务信念及可选不确定性。语言指令被限制在预设可接受集合内,并有停滞后强制推进机制,因此并非完全开放式自主协商。
冻结视觉网络从RGB-D提取物体中心及交互点,正运动学提供机器人节点,组成统一三维骨架。两个Transformer专家以流匹配联合学习动作和未来骨架,后者仅作训练监督。推理省去未来分支,MAC从多条采样轨迹中选距离其他轨迹最近的一条,避免直接平均不兼容动作。
先用裁剪量化的Slim SAM3生成玻璃掩码,再以LiDAR种子和水平/垂直结构构造有限平面。单帧射线几何、多视角重投影及地面证据排除假平面,最后合并全局假设并给规划地图补入占据体素。
基准将工具使用拆为选择拾取、固定站位操作、移动操作三级,以推球、钩球及击碎冰块三种功能配合有无诱饵工具构成18任务。记录首次接触、正确工具抬升、工具接触目标及最终成功,避免只凭最终分数混淆选择与执行。
以联合注意力连接Qwen3-VL物理推理、Wan2.2视觉生成及连续动作流匹配三个专家;人类动作被写成统一物理语言,机器人数据再提供精确动作监督。后训练扰动未来视觉潜变量,并从已执行动作历史加噪初始化动作生成。
H-SPAR用离线Firedrake浅水方程流场统一驱动无人艇阻力和拉格朗日粒子输运,ROS2负责规划与水动力模块、Gazebo执行艇体物理。双船体按相对流速计算二次阻力和偏航力矩,采样概率按粒子相对速度偏离泵设计流速的程度衰减。
将轨迹目标分解为平滑、障碍物、智能体间距和速度四类因子,直接构造局部解析得分,以退火Langevin更新修正粗规划轨迹。方法不学习示范分布,时间局部性只是带噪得分的近似,并非远端路径点严格独立。
把扫描粗网格与多光照法线图配准,在接触点切空间积分成微高度,叠加接触掩模渲染GelSight纹理。多视角红外视频提供温度观测,用图拉普拉斯物理约束网络识别表面扩散和环境换热系数,运行时直接积分温度场。
在多面体网格上定义切锥、最直测地线指数映射、对数映射与平行移动,显式处理边和顶点。DMP把驱动项固定在同一切锥再输运;GP使用测地距离核并检测长度尺度可容许性;流匹配沿原生网格几何积分。
RADMCS用气瓶外挂圆筒和两台T200推进器产生转向力觉,不需把执行器缠在潜水员肢体上。侧视相机通过AprilGrid与PnP估计离墙距离,指数滤波、异常跳变拒绝、死区和饱和比例控制把距离误差转为左右推进器PWM。
把重建表达为可执行Room.py,代理利用标定图像、深度、点云和RoomPlan布局,按墙面材质、固定装置、小物体、程序资产分阶段编辑。碰撞与支撑检查分离,最后导出具有关节、碰撞体和估计惯性的MuJoCo场景。
在OpenVLA-OFT上以LoRA适配单目RGB、语言和7维笛卡尔增量动作,预测八步动作块;云端推理、机器人端反归一化、平滑、限幅与校验。真实试验每执行完一块才重新观测请求,不是推理和执行并发。
把多条人手—物体参考动作合并训练同一跟踪策略,以未来参考、物体点云和手物距离描述接触;左右手各用独立actor–critic但观察完整双手状态。FlashSAC复用不同参考的经验,并扩展至5000万回放、1024宽critic。
研究把任务描述持续注入语言以外的输入。EC-VLA在SmolVLA本体状态后拼接八通道肌电包络,用腕屈伸及放松指导左右修正和选择;VA-VLA在π0.5图像上用颜色分割掩码标出目标及放置点,两者文字仅给通用操作指令。
利用机器人正运动学/CAD表面与经典双目深度的一致性先筛选相机外参,再用位姿条件化的前馈高斯重建生成可渲染场景。将外参可靠性、重建误差和测量覆盖分开公布,避免把图像逼真度直接等同真实几何。
以带语义、局部几何描述的SE(3)位姿轨迹为共同表示,将机器人连杆、物体、人体和动作目标放入同一令牌网格。逐令牌独立噪声的流匹配及非连续上下文令牌,允许通过更换已知/未知掩模执行未来预测、策略、补帧和重定向。
QueryArt接收已标定RGB和二维查询点,以冻结DINOv3特征、多尺度金字塔与可变形注意力预测关节类型、方向和相对轴偏移。偏移按查询深度归一化,规避单图绝对尺度不可辨识;测得一点深度后再恢复米制轴位置。
ActiveWAM将任务相关历史保留与可执行头部取景共同建模。训练时用冻结Wan先验变换已观测历史,约束关键特征和可见动态,原始与变换历史共享动作/未来目标;视角适配器记录相机姿态、时间及有效性,统一生成双臂和云台动作。部署只用原始观察,不做在线反演或候选排序。
采用相同检测输入固定事件集合,把跟踪拆成初始化延迟、漏检期间连续正确位置/身份、间断后身份恢复和近邻关联,辅以HOTA与负载相关时延。PedRefTrack将发布预测的寿命和隐藏身份保留分开,另设真值辅助诊断版本。
将三维声呐点云体素化,经稀疏卷积和中心检测头输出位置、尺寸及连续6D全旋转,而非只预测偏航。声呐专用增强增加稀疏前景覆盖;可选因果时序细化分别修正中心、旋转和尺寸,不提升低置信候选或删除原检测。
用PPO将腿部策略塑造成对速度、高度、俯仰命令具有一致瞬态和步态周期响应,再辨识策略闭环响应模型。MPC据此联合优化底盘命令与六关节臂速度,预测命令滞后和步态振荡,而不是假设底盘瞬时精确执行。
CAG研究世界动作模型生成看似合理却不完成关键阶段的问题,如一直持物而不释放。它不重新训练,而汇总视频/动作查询对语言词元的跨注意力,稀疏选中当前重要词元,按有界系数放大其键和值,让短时采样更容易出现完成转移。理想完成奖励仅用于动机推导,采样并没有可用的真实完成指示器。
单机器人将预训练LaMa/MapEx地图补全用于区域级目标排序,以有限宽度束搜索平衡信息增益、转移和返航代价,局部规划仍检查真实观测。多机器人利用共享地图、队友意图和历史轨迹抑制重复探索,并用通信中继交接和剩余预算决定返航。
依据长期监测需求迭代四个模块化构型,以AgileX Hunter 2.0底盘、Unitree Z1机械臂及可换传感器组件构成ALFRED。设计同时考量维修、供电、激光视野和机械臂可达空间;用统一机器人碰撞模型比较构型,而非提出新的学习策略。
分别训练完成动作、放弃动作但双脚落地、保护性跌倒三个专家;从相同仿真状态做反事实滚动,学习与候选策略相关的有限窗口存活预测。每步优先保留最有任务价值且仍可行的策略,撤离途中也可再次升级到保护跌倒。
这是一套行为鲁棒性评估方法,补充二元成功率。它记录成功轨迹的仿真时长、末端/关节路径、均值与高分位加加速度、夹爪累计运动;比较每任务均值相对变化再取任务中位数,用MAD看波动,Mann-Whitney检验配BH多重比较校正。
在Kurobot末端安装带双极电极的螺纹钻头,以25Hz读取局部导电信号。最初数毫米估计基线并限制阈值上下界,同时监测最近2毫米内的突变,两路任一触发即停止钻进;阈值由既往离体数据离线调定。
在几何采样抓取候选之外加入演示回忆,使用局部点云BPS和MLP学习32维归一化嵌入。近邻成败证据以距离权重更新Beta后验并给抓取排序;部署时追加记忆而不重训主网络,演示既新增候选也影响评分。
SC-DMP把肌电和人体姿态估计的交互刚度,与跨示范轨迹低方差结合为关键阶段先验;STR-Net仅按先验一致性和时序平滑细化,不依赖外部关键性真值。根据累积关键性重排基函数中心,再坐标搜索带宽,保留DMP结构。
PROMO把速度跟踪、身体稳定、能耗效率分成可调语义目标,将步态与接触正则保持为固定先验。偏好向量同时输入策略和历史编码,三头价值网络分别学习语义回报;特权编码在训练中对齐可部署历史表示,部署只保留本体观测、速度估计与单一策略。
单目RGB由Depth Anything V2产生相对深度,再用梯度生成伪高程,组成五通道输入;改造ResNet-18和ACT的CVAE预测16步线/角速度块,以重叠块均值平滑命令。定制BGER履带与锥齿轮结构降低机械抖动,视频经系绳传到主机。
给潜在世界模型编码器和预测器共享线性读出头,只监督任务成功判据涉及的位置等物理量;原有预测损失保持不变。训练后移除辅助头,CEM仍按潜在终态与目标图像的距离规划,使成功所需精度通过表征进入候选排序。
EIDA专门拟合高层速度命令经过现有底层控制器和估计器后的执行接口:MLP预测机体坐标位姿增量,独立ARX预测策略实际收到的速度估计。将两者植入快速二维模拟器,以带速度历史的SAC学导航;部署时两拟合模型都不在线运行。
Recova把完成任务与恢复可工作场景拆成两个策略。编码智能体先用真实影像、轨迹和标定搭MuJoCo数字孪生,在失败状态试验纠错程序;上线后视觉语言监控检查进展、选择已登记恢复技能并验证结果,不适用时收集人类示范,按任务/恢复用途分别聚合微调。
EF-GAIfO只用状态转移示范,以机器人自身探索训练重建模型;重建误差转换成可行性权重,对专家转移的判别器损失降权,PPO策略、判别器与重建模型共同迭代。它估计与经验相似的运动可行性,不需要专家动作标签。
用相同起始图和任务构造可见条件与文本指定隐藏物性配对,分别人工评分物理合理性、任务完成和隐藏属性遵循。诊断器把相机补偿轨迹、光流和物体消失等信号,与针对具体物理错误的VLM问题组合,避免仅询问整体真实感。
FRANK将四种可学习时间常数的泄漏循环模块、键值记忆、无状态反射通路和抑制混合器结合,所有模块每步同时运行。算法任务版本50.7万参数,与GRU、RIMs、Mamba及删减结构按容量比较,重点检验训练长度外的稳定状态转移。
MASkillBlender在冻结的单人形行走、伸手、下蹲技能之上,用共享局部策略输出技能目标和逐关节混合权重。MAPPO集中价值学习、分散执行;同构队员置换产生额外训练样本,并在同构博弈假设下分析其策略梯度合法性。下游主要任务奖励不代表低层技能无需密集奖励。
将机器人各运动连杆、障碍物和抓取后附着物建成可微Bernstein多项式SDF,以抓取模式切换受保护几何。对冻结π0.5的六维操作空间增量求最小改动CBF二次规划,保留原控制器和夹爪指令,无需重训策略。
在35毫米方形底座上布置四枚倾斜AprilTag,用共享参数同时生成打印几何和PnP角点模型,缓解正视单平面标记的姿态歧义。比较对角、俯仰和反向俯仰三种布置,兼顾可见性及平行夹爪的接触平面。
用离散自回归视觉模型预测固定动作序列下的多个未来;多样化beam search产生候选,每个候选单独保留初始锚点与滚动历史。MemSPO按视频轨迹奖励计算组内优势,生成和概率打分使用同一历史,避免候选分叉后记忆错配。
论文将双连杆被动行走和臂摆统一为连续双摆动力学、瞬时完全塑性碰撞、坐标重标记组成的步间映射。比较足/手碰到表面即触发的状态切换SBS与固定间隔触发的时间切换TBS;两者可拥有相同周期一步轨道,但扰动后的碰撞时刻不同,因此稳定性不必相同。
保留预训练视觉token本身,以共享轻量选择器递归从2K候选选K,组合长历史;用直通梯度和Gumbel探索训练选择,动作流匹配损失驱动记忆,无额外未来状态预测目标。递归结构使同一历史前缀在离线训练和在线执行中保持一致。
视觉与语言编码后使用两个专用token,分别驱动Flow-as-Flow生成器和Narrative Delta辅助损失。后者对齐大模型依据起始、目标图像生成的多视角变化叙述;推理不需要目标图。DiT预测连续二维速度场,经积分得到运动点轨迹,再条件化操作策略。
保存各模型生成的候选池,再由四种固定代理模型交叉重评分;所有动作从同一仿真状态执行,获得真实成本和参考精英集。比较精英重合、成对排序,以及提案均值和宽度的不同归一化距离;仅替换首轮精英集并固定后续模型和随机样本,检验更新后果。
向冻结VLM额外追加可学习路由token,在多层读取其隐藏状态,再用任务共享层权重压缩为RL token。先用专家动作块预测监督初始化,移除预测头后通过评论家TD误差周期更新路由;演员梯度断开,基础VLA及其动作生成保持冻结。
每个token具有标量通道与六维运动/力螺旋通道;消息经真实相对变换传入接收坐标系,注意力只看不变量,学习矩阵仅混合通道。门控修正softmax归一化,使单层包含刚体速度递推;可独立输出动作或作为解析控制器的门控残差。
先对动作块做DCT、量化及按维度展开,再用unigram词表枚举等价分词;训练时从64个候选中采样,而各候选解码后的量化动作完全相同。它改变交叉熵监督的分词边界,不增加示范,也不改变策略架构。
初始容量来自三次2-back测试;随后综合NASA-TLX、疲劳评分、任务完成数和眨眼变化,按时段增减一个监督名额。以视线停留时间估计不同任务的相对难度,贪心分配最紧急任务,并按死锁簇边界优先调度可移动机器人。
PAE将全景投为循环透视视图,冻结DINOv3、SigLIP和Qwen3主干,融合方位和历史时间编码。动作头预测8个累计航点;WAC预测前4步特征,按余弦差阈值决定继续或重新规划,辅助梯度只更新WAC。
依据区间平均速度恒等式,将MeanFlow目标中的总时间导数拆成早期、晚期两部分,缓解末期局部加速度突增和样本间尺度扩张。用前向自动微分JVP并行计算两项,比较随机、中点和小MLP学习分割点;推理一次网络评估直接输出动作块。
整合32个既有来源与新GeoProbe,共1000案例,保留原始观测、动作接口和成功条件。固定输入任务使用持久Python交互,操作遵循原生控制循环;分别计几何误差、接触有效性、规划Pass@1及终态所有目标条件,避免用局部进展替代成功。