ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何用 HIMLoco 在 1 小时内跑通四足机器人运动控制训练

如何用 HIMLoco 在 1 小时内跑通四足机器人运动控制训练 如何用 HIMLoco 在 1 小时内跑通四足机器人运动控制训练【免费下载链接】HIMLocoLearning-based locomotion control from OpenRobotLab, including Hybrid Internal Model H-Infinity Locomotion Control项目地址: https://gitcode.com/gh_mirrors/hi/HIMLoco如果你在四足机器人运动控制的域随机化里卡过手又担心传感器一坏策略就在真实世界翻车HIMLoco 值得花一个下午它只靠关节编码器和 IMU就能训出跨复杂地形泛化的运动策略。我自己跑了一遍前几次 play 里机器人在楼梯上摔过收敛后的策略在 1 m/s 前进指令下基本不再摔。代价是一次 Isaac Gym 的安装和约 1 小时的训练时间。HIMLoco 是什么混合内模路线的四足控制框架是什么基于学习的四足运动控制代码库谁做的OpenRobotLab上海 AI Lab / 浙大 / 清华核心路线混合内部模型只用 IMU 关节编码器适合谁想做最小传感器多地形步态的开发者具体来说它提供从 Isaac Gym 仿真、训练到 jit 策略导出的完整管线。HIM 方法被 ICLR 2024 接收同团队后续还发表了 H-Infinity 控制论文。如果你的机器人本体只带关节编码器和 IMU这是一条现成可用的运动基线不用先给机器人堆激光雷达。先看能力一套策略覆盖楼梯、斜坡和高台复杂地形默认训练就在课程制地形上进行包含平滑斜坡、粗糙斜坡、上下楼梯、离散障碍 5 类地形一个策略全部覆盖。同一套策略过楼梯、斜坡、高台最小传感器观测里只有 IMU、关节编码器和速度指令没有高程图、没有摩擦系数。策略不是看到了地形而是从机器人自身的姿态响应里推断出来的。最小传感器、无模仿学习、快速收敛收敛速度官方演示口径约 2 亿帧收敛RTX 4090 上约 1 小时。快的关键之一是默认 4096 个并行环境单卡就能喂饱。HIMLoco 环境搭建从 clone 到开训的最短命令序列版本基线是仓库实测过的组合不建议改动项版本操作系统Ubuntu 20.04NVIDIA 驱动525.147.05CUDA12.0Python3.7.16PyTorch1.10.0cu113仿真器Isaac Gym Preview 4先建隔离环境并装固定版本的 PyTorch——Isaac Gym Preview 4 只配这套 torch 编译过装新的大概率起不来conda create -n himloco python3.7.16 conda activate himloco pip3 install torch1.10.0cu113 torchvision0.11.1cu113 torchaudio0.10.0cu113 -f https://download.pytorch.org/whl/cu113/torch_stable.html装仿真器。先从 NVIDIA 官网下载 Isaac Gym Preview 4装完后用它自带的 python 目录注册成包cd isaacgym/python pip install -e .克隆仓库。注意必须用仓库内的 legged_gym 和 rsl_rl两者都带 HIM 所需的修改上游版本不能替代git clone https://gitcode.com/gh_mirrors/hi/HIMLoco cd HIMLoco两个子包都以可编辑模式安装cd rsl_rl pip install -e . cd ../legged_gym pip install -e .先跑一个 20 轮冒烟测试确认环境和显存没问题再决定要不要投入 1 小时的完整训练cd legged_gym/legged_gym/scripts python train.py --max_iterations 20冒烟通过后跑完整训练默认任务 aliengo、4096 并行环境python train.py首次训练你会在终端和 TensorBoard 看到什么训练启动后先打印一行种子之后每轮迭代输出一行指标。TensorBoard 事件文件落在legged_gym/logs/rough_aliengo/时间/下看 reward 曲线比盯终端直观。判断标准成功reward 爬升后走平曲线尾端平稳存疑长期低位震荡换同一--seed复跑对比失败立刻 NaN 或进程崩基本是版本对不上如果做 HIMLoco 训练参数调优最高频的两个参数是--num_envs和--max_iterations都支持命令行直接覆盖。训练结束跑 play 验证并导出策略python play.py它会加载最近一次训练的最新 checkpoint打开一个 50 台机器人的观察者地形 10×8 格课程从第 9 级最高难度开始指令恒定 1 m/s 前进。你能看到机器人排队过楼梯和斜坡。同时脚本把策略导出成 jit 文件到logs/.../exported/policies/policy.pt这是后续上真机的入口。两条技术路线怎么选HIM 与 H-Infinity仓库里有两条路线选型前先确认代码状态HIM训练代码已放出默认解决地形泛化。一个信息提取器经对比学习产出隐式嵌入策略结合速度和嵌入估计环境扰动。H-Infinity论文已放出训练代码未放出解决抗扰动。引入 distrber 网络对抗式地生成外力用 H∞ 范数约束保证训练不发散。README 的 TODO 里明确标注代码尚未公开。选型依据痛点是地形一变策略就失效直接用 HIM痛点是被推一下、一打滑就摔H∞ 是对的方向但要等代码或按论文自己实现。Actor 与 distrber 在 H∞ 约束下联合优化H∞ 的演示里A1 甚至能用后肢双足行走并在楼梯和湿滑地形上抵抗外力。楼梯、高台、斜坡上的抗扰动演示⚠️ 排坑手册5 个高频报错的修法现象根因修复ModuleNotFoundError: isaacgym未安装 Isaac Gym Preview 4下载后cd isaacgym/python pip install -e .能 import 但行为与文档不符装的是上游 legged_gym/rsl_rl改用仓库内副本pip install -e .启动即 CUDA OOM默认 4096 并行环境超显存python train.py --num_envs 1024play.py 找不到 checkpoint没训练过或实验名不匹配先训练或指定--experiment_name rough_aliengo --load_run run名想升 Python 3.8 / torch 2.xPreview 4 锁死 3.7 1.10 组合保持 3.7.16 1.10.0cu113不升级落地场景与前置条件按你现在的阶段挑一个切入仿真内多地形评测指标是成功率与速度跟踪误差真机迁移Unitree A1/Go1关键指标是推理时延新增机器人本体关键是课程地形能否收敛第一种直接把 play.py 当基线脚本用即可。第二种注意论文已在 Unitree 真机验证过但仓库 TODO 显示部署指南尚未放出HIMLoco 部署到真实机器人目前只能参考论文自行搭建策略本身是小 MLP在 Jetson 级平台上推理是毫秒级的。第三种按 legged_gym 约定加一份 config 并task_registry.register之后--task 新名字即可跑。原理 60 秒它凭什么 work开车的老司机不会每一秒都看路面他靠车身晃动和轮胎打滑就能判断路是松是滑。HIM 同理IMU 和关节编码器是体感内部模型用对比学习从机器人自身的响应里摸出当前地形状态产出一个隐式嵌入策略结合速度和嵌入估计外部扰动再输出关节动作。它不需要地形传感器因为它建模的不是环境而是响应。从观测到动作的 HIMLoco 完整框架资源与下一步HIM 方法文档projects/himloco/README.mdH∞ 方法文档projects/h_infinity/README.md核心算法源码rsl_rl/rsl_rl/algorithms/him_ppo.py训练脚本legged_gym/legged_gym/scripts/论文 PDFassets/HIMLocomotion.pdf问题反馈走仓库的 Issues 区建议今晚就先把 20 轮冒烟测试跑起来reward 曲线开始爬升的话直接挂上完整的python train.py明早打开 TensorBoard 看收敛情况。【免费下载链接】HIMLocoLearning-based locomotion control from OpenRobotLab, including Hybrid Internal Model H-Infinity Locomotion Control项目地址: https://gitcode.com/gh_mirrors/hi/HIMLoco创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表