贡献:策略¶
策略在 plugrl-server 中实现。
代码放哪里¶
- 实现:
plugrl_server/policy/... - 注册:
plugrl_server.policy.registration
清单¶
- 实现策略与配置 dataclass。
- 注册(UID + variants),并确保模块会被 import。
- 动作形状在推理与训练路径保持一致。
验证¶
用你的策略启动 server。
启动 dummy worker。
常见问题¶
- CLI 找不到 UID:注册模块没有被 import。
- 训练 shape 对不上:动作与
InternalState结构要和 buffer 对齐。