准备环境
官方训练仓库基于 mjlab、MuJoCo Warp 与 PPO,本地训练需要 CUDA GPU 和 uv。没有 GPU 时可以使用 Hugging Face Jobs。
TERMINAL
git clone https://github.com/pollen-robotics/microduck_rl
cd microduck_rl
uv run list-envs训练与观察
官方 README 给出的起点是 4096 个并行环境。可用步态通常需要约 1–2 小时,但实际时间取决于 GPU、随机种子与奖励修改。
TERMINAL
uv run train Mjlab-Velocity-Flat-MicroDuck \
--env.scene.num-envs 4096
uv run play Mjlab-Velocity-Flat-MicroDuck \
--wandb-run-path <entity/project/run_id>导出与 CPU 预演
必须使用官方 export.py,让观测归一化进入 ONNX 图。手工转换 checkpoint 会让真机策略接收到未归一化输入。
TERMINAL
uv run scripts/export.py Mjlab-Velocity-Flat-MicroDuck \
--wandb-run-path <entity/project/run_id>
uv run scripts/infer_policy.py --walking output.onnx本文根据官方公开资料整理。命令与接口可能随早期版本变化,操作真机前请核对官方仓库最新 cheatsheet。