v2.8.1: Fix GRPO crash on first learn() after eval
What's Changed
- Fix GRPO crash on first learn() after eval: restore env batch state on eval_mode exit by @micdoh in #590
- v2.8.1: Fix GRPO post-eval rewards mismatch by @micdoh in #591
Full Changelog: v2.8.0...v2.8.1