v0.7.0
Summary
Corpus ingestion release.
Added
- Added
proofrag corpusto inspect corpus loading before generation. - Added source, chunk, character, average chunk, and extension counts.
- Added default skips for noisy directories like
.git,.venv,node_modules,dist,build, and caches. - Added
.gitignoresupport. - Added
--include,--exclude, and--no-gitignorefilters tocorpusandgenerate. - Added HTML text extraction by default.
- Added optional PDF loading through the
proofrag[pdf]extra. - Added
context_metadatato generated golden sets so source path, chunk id, chunk index, character count, and extension are preserved.
Verification
- PR checks passed on Python 3.11, 3.12, and 3.13.