v0.3.0
Added
RunResult.Metadatain JSONL result sinks, copied fromCase.Metadataby default.- Split token counts (
PromptTokens,CompletionTokens) on judge responses, results, and JSONL sink rows. WithCaseFilterrunner option for skipping cases by metadata or custom predicates.authoring-go-eval-suitesagent skill and Claude/evalcommand for designing, running, and reviewing eval suites.comparepackage for baseline-vs-current JSONL result regression diffs.- Minimal
goevalCLI withtest,compare, andversioncommands. - JSON dataset loader (
LoadCases,LoadNamedCases,LoadDataset) for external golden cases. - Getting Started guide covering local judges, OpenAI, metrics, JSONL results, and benchmarks.
- Ollama judge adapter (
adapters/ollama) for local HTTP API scoring.
Full changelog: https://github.com/igcodinap/go-eval/blob/v0.3.0/CHANGELOG.md