v3.5.0
Bidirectional NLI scores source→summary and summary→source, takes min. Baseline calibration (0.20) shifts expected NLI noise floor to zero. All three task types now production-grade: QA 3-4%, dialogue 4.5%, summarization 10.5%. 2051 tests, 0 failures. Co-Authored-By: Arcane Sapience <protoscience@anulum.li>