Skip to content

v0.3.0

Choose a tag to compare

@igcodinap igcodinap released this 29 Apr 00:22
· 19 commits to main since this release

Added

  • RunResult.Metadata in JSONL result sinks, copied from Case.Metadata by default.
  • Split token counts (PromptTokens, CompletionTokens) on judge responses, results, and JSONL sink rows.
  • WithCaseFilter runner option for skipping cases by metadata or custom predicates.
  • authoring-go-eval-suites agent skill and Claude /eval command for designing, running, and reviewing eval suites.
  • compare package for baseline-vs-current JSONL result regression diffs.
  • Minimal goeval CLI with test, compare, and version commands.
  • JSON dataset loader (LoadCases, LoadNamedCases, LoadDataset) for external golden cases.
  • Getting Started guide covering local judges, OpenAI, metrics, JSONL results, and benchmarks.
  • Ollama judge adapter (adapters/ollama) for local HTTP API scoring.

Full changelog: https://github.com/igcodinap/go-eval/blob/v0.3.0/CHANGELOG.md