先定义成功,不要先堆奖励
明确终止条件、目标姿态和允许的接触,再设计密集奖励。每个 reward 要锁定符号约定和 NaN guard,避免训练得到看似高分但不可部署的行为。
保持接口兼容
新策略应沿用 61 维观测布局和既有 action dimension;不用的命令槽补零。这样 runtime 可以在不重启控制循环的情况下切换策略。
部署前预演
先在 CPU MuJoCo 中用 infer_policy.py 同时加载 walking、standing 与新策略,验证切换瞬间是否出现姿态跳变。
TERMINAL
uv run scripts/infer_policy.py \
--walking walk.onnx \
--standing stand.onnx \
--roulade trick.onnx \
--new-cmd-obs --debug --save-csv本文根据官方公开资料整理。命令与接口可能随早期版本变化,操作真机前请核对官方仓库最新 cheatsheet。