搜索资料
返回教程强化学习 / 进阶 / 15 分钟

训练行走策略:MuJoCo Warp + PPO 快速路径

搭好 microduck_rl,启动 4096 个并行环境,回放 checkpoint 并导出 ONNX。

核验日期 2026-09-013 个章节
01

准备环境

官方训练仓库基于 mjlab、MuJoCo Warp 与 PPO,本地训练需要 CUDA GPU 和 uv。没有 GPU 时可以使用 Hugging Face Jobs。

TERMINAL
git clone https://github.com/pollen-robotics/microduck_rl
cd microduck_rl
uv run list-envs
02

训练与观察

官方 README 给出的起点是 4096 个并行环境。可用步态通常需要约 1–2 小时,但实际时间取决于 GPU、随机种子与奖励修改。

TERMINAL
uv run train Mjlab-Velocity-Flat-MicroDuck \
  --env.scene.num-envs 4096

uv run play Mjlab-Velocity-Flat-MicroDuck \
  --wandb-run-path <entity/project/run_id>
03

导出与 CPU 预演

必须使用官方 export.py,让观测归一化进入 ONNX 图。手工转换 checkpoint 会让真机策略接收到未归一化输入。

TERMINAL
uv run scripts/export.py Mjlab-Velocity-Flat-MicroDuck \
  --wandb-run-path <entity/project/run_id>
uv run scripts/infer_policy.py --walking output.onnx
本文根据官方公开资料整理。命令与接口可能随早期版本变化,操作真机前请核对官方仓库最新 cheatsheet。
下一篇Sim-to-Real:小型双足机器人的真正难点