Skip to content

v0.1.27 - Evals

Choose a tag to compare

@AdityaSaroj AdityaSaroj released this 13 Aug 20:44
· 6 commits to main since this release
e1f3c73
  • evaluate() for offline experiments: platform dataset, inline rows (saved by default), or local-only with persist=False / persist: false
  • Built-in scorers: exact_match, contains, json_valid; platform LLM-as-judge and code scorers via the server
  • Default persist on, max concurrency 10, per-item error isolation, progress N/M, result.summary(), result.url
  • Eval span identity: traccia.experiment., traccia.eval.source, traccia.dataset. (redaction allowlist)