具身智能研究工作台阅读原文 · 追踪方法 · 连接实践
04 / 训练与实践训练与复现路线
选择适合硬件与经验的路线,先跑通基线,再挑战更复杂的任务。
03条实践路线
原始来源可追溯 · 许可和可复现性分别核对每 60 分钟检索
01G1 / Go2:先建立运动控制闭环
已有对应机型或准备做真实部署
- 先确认机型、自由度、SDK/控制接口与可用训练硬件。
- 在 Unitree RL Lab 或 RL Mjlab 中选择一条工具链,锁定兼容版本,复现原始平地任务。
- 检查关节顺序、单位、观测归一化、控制周期、PD 参数、执行器限幅与策略输出。
- 按官方流程回放和 sim2sim,检查扰动、延迟、丢包及终止条件。
- 由熟悉机器人的人员,在净空场地、保护措施与可用急停下逐步实机验证。
验收目标先以可重复、低风险的平地跟踪与可靠停止作为验收,再增加地形或高动态动作。
02操作与 VLA:从数据质量到实机
机械臂或 G1 上肢/移动操作研究
- 选一个单一、可重复、安全的操作任务,定义相机、状态、动作和成功标准。
- 先用 LeRobot/robomimic 建立 ACT 或 BC 基线,按 episode/场景隔离训练与测试数据。
- 确认基础闭环可用后,再选择一个 VLA 做目标域微调;按该配置文档估算显存。
- 先在 LIBERO 或机器人仿真中评测,再用目标硬件的数据与控制接口验证。
- G1 使用匹配版本的官方 LeRobot 集成与已验证的运动控制器;检查网络延迟和停止行为。
验收目标保留同数据、同任务的简单基线,报告多次独立实验成功率和失败模式。
03没有机器人:先复现实验
预算有限或准备建立研究基础
- 从 Colab 或小数据集读取开始,确认状态、相机和动作含义。
- 跑通一个离线 BC 任务或 Playground 简单 RL 环境。
- 仅下载需要的数据子集;DROID 可先用官方 100 条轨迹调试包。
- 保持可复现的环境文件、随机种子、训练配置和评测日志。
验收目标在可控资源内完成数据检查、训练、评测和可复现实验记录。
推荐基础阅读顺序
模仿学习与 DAgger → 连续控制与 PPO / SAC → 视觉操作与 Transporter / CLIPort → ACT / Diffusion Policy → RT 系列、OpenVLA 与通用策略 → 世界模型与安全部署。
分类与翻译标准来源、推断、未知,
分别标清楚。
中文标题为译名;“中文摘要解读”是对方法、证据和局限的中文整理,不是论文逐字全文翻译。英文原文可从每篇论文的来源链接查看。全文翻译需有相应授权或许可。基础与经典标签是编辑阅读分类,不代表论文等级。
实物、仅仿真和两者都有指已核对的评估证据;仅仿真训练后实机评估会明确备注。模型内滚动预测也会单独说明。真实传感器数据离线评测另作标签,不等同于实机闭环。机器人型号不从图片或相近项目推测。
“有开源代码”不等于完整训练已复现。待发布、占位仓库、许可未核实分别标注;未查到代码不会写成确定没有。本文库未执行模型训练或机器人实验。
来源与实验说明可追溯 经典、基础、近期分层阅读 归档、去重、运行日志落盘 未确认的信息保留未知