Migration blast-radius artifacts
retrieval-fairness diff can now produce a PR-friendly inventory of every chunk that loses or gains exposure during an embedder or chunking migration.
retrieval-fairness diff --baseline before.json --candidate after.json \
--blast-radius migration-blast-radius.md --blast-corpus corpus.jsonlAdded
- deterministic Markdown and CSV blast-radius artifacts
- newly-dark and rescued chunk lists with baseline/candidate frequency and delta
- optional, output-only corpus text enrichment via
--blast-corpus - 240-character Markdown text bound by default (
--blast-text-limit 0disables it) - lossless CSV output via
--blast-format csv - public Python API:
BlastRadiusEntry,BlastRadiusReport,build_blast_radius, andsave_blast_radius
Real-data validation
On the BEIR NQ lexical → dense migration, the artifact reports:
- 1,155 newly-dark chunks
- 929 rescued chunks
- 2,084 actionable rows
Full verification: 134 tests passed, 3 optional integrations skipped, 87.92% coverage, all Python 3.9–3.13 CI checks, CodeQL, dependency audits, wheel/sdist tests, and the 1M benchmark passed.
Full changelog: v0.2.0...v0.2.1