rag-eval-bench v1.0.0
RAG evaluation benchmark for messy industrial parts-catalog data.
Features
- Corpus loaders: acme-parts-cloud CSV (v1/v2 auto-detect) and JSONL
- Sentence-boundary chunker with parent-doc chunk tracking
- SentenceTransformer embedder (
all-MiniLM-L6-v2) + MockEmbedder for CI - ChromaDB ephemeral/persistent vector store (cosine similarity)
- Template-based QA generator — deterministic, no LLM required
- Retrieval metrics: Hit@1/3/5, MRR
- Ollama generation scoring (gemma:2b default), gracefully skipped when unavailable
- Faithfulness proxy via keyword overlap
- Rich terminal report + JSON export
- 19 passing tests
- GitHub Actions CI
Quick Start
pip install -e .
rag-eval bench --corpus parts.csv --index-dir .rag-index --qa qa.jsonlAll data is synthetic. No real company, product, or supplier data used.