proofrag v0.3.0
Point your agent at your docs + your RAG app → golden test set, LLM-as-judge + retrieval scorecard, CI gate. Agent Skill (Claude Code / Codex) + Python CLI.
- Golden-set generation from your own corpus (single/multi-doc/unanswerable tiers)
- LLM-as-judge (groundedness, correctness, completeness, citation quality), pinned + fingerprinted
- Rank-aware retrieval metrics: Recall@k, Precision@k, NDCG@k, MRR
- Shareable self-contained HTML scorecard
- CI gates: absolute floor (
--fail-under) + baseline regression (proofrag diff) - Reusable GitHub Action:
uses: unshDee/proofrag@v0
Install: pipx install "proofrag[anthropic]" · uvx "proofrag[anthropic]" demo