v0.8.0
What's Changed
- Feat/support remote browser by @Perry2004 in #235
- docs(models): ship default judge in models.example.yaml (fixes #240) by @reacher-z in #246
- Feat/248 try api before task by @Perry2004 in #249
- feat(prorl): run ClawBench as a ProRL-Agent-Server (Polar) RL environment (closes #219) by @reacher-z in #251
- fix(prorl): green up CI after #251 (pyright typing + Windows bash skip) by @reacher-z in #252
- feat(judge): support Gemini (google-generative-ai) as an LLM judge (closes #247) by @reacher-z in #254
- fix(security): reject path-traversal in extra_info paths by @reacher-z in #238
- docs(README): add one-command corpus run to Human Quick Start by @reacher-z in #260
- docs: update changelog by @Perry2004 in #261
- Track benchmark outreach and improve citation discoverability by @reacher-z in #267
- Show verified merged ClawBench featured lists by @reacher-z in #268
- docs: refresh citation metadata for v0.7.0 by @reacher-z in #266
- Update verified Featured in lists by @reacher-z in #263
- Add Awesome Works using ClawBench by @reacher-z in #262
- feat(judge): answer/rubric judge — primitive for importing rubric benchmarks (re #170/#188/#189/#190) by @reacher-z in #259
- feat(harness): null + random-click baselines — the benchmark floor (closes #245) by @reacher-z in #257
- docs: changelog by @Perry2004 in #270
- feat(edgebench): package ClawBench V2 as an EdgeBench/SForge benchmark by @reacher-z in #253
- build: v0.8.0 release by @Perry2004 in #271
Full Changelog: https://github.com/TIGER-AI-Lab/ClawBench/blob/main/CHANGELOG.md