搜索资料
返回教程开发 / 进阶 / 16 分钟

开发新动作:从任务定义到策略热切换

创建环境、设计奖励、做回归测试,并接入共享观测契约。

核验日期 2026-09-013 个章节
01

先定义成功,不要先堆奖励

明确终止条件、目标姿态和允许的接触,再设计密集奖励。每个 reward 要锁定符号约定和 NaN guard,避免训练得到看似高分但不可部署的行为。

02

保持接口兼容

新策略应沿用 61 维观测布局和既有 action dimension;不用的命令槽补零。这样 runtime 可以在不重启控制循环的情况下切换策略。

03

部署前预演

先在 CPU MuJoCo 中用 infer_policy.py 同时加载 walking、standing 与新策略,验证切换瞬间是否出现姿态跳变。

TERMINAL
uv run scripts/infer_policy.py \
  --walking walk.onnx \
  --standing stand.onnx \
  --roulade trick.onnx \
  --new-cmd-obs --debug --save-csv
本文根据官方公开资料整理。命令与接口可能随早期版本变化,操作真机前请核对官方仓库最新 cheatsheet。
下一篇升级、回滚与救援:别把鸭刷成砖