Skip to content

v1.0.0 — Initial release

Latest

Choose a tag to compare

@RedBeret RedBeret released this 09 Jul 06:05

rag-eval-bench v1.0.0

RAG evaluation benchmark for messy industrial parts-catalog data.

Features

  • Corpus loaders: acme-parts-cloud CSV (v1/v2 auto-detect) and JSONL
  • Sentence-boundary chunker with parent-doc chunk tracking
  • SentenceTransformer embedder (all-MiniLM-L6-v2) + MockEmbedder for CI
  • ChromaDB ephemeral/persistent vector store (cosine similarity)
  • Template-based QA generator — deterministic, no LLM required
  • Retrieval metrics: Hit@1/3/5, MRR
  • Ollama generation scoring (gemma:2b default), gracefully skipped when unavailable
  • Faithfulness proxy via keyword overlap
  • Rich terminal report + JSON export
  • 19 passing tests
  • GitHub Actions CI

Quick Start

pip install -e .
rag-eval bench --corpus parts.csv --index-dir .rag-index --qa qa.jsonl

All data is synthetic. No real company, product, or supplier data used.