v0.3.3
What's Changed
Added
- Benchmark: Evaluated on LongMemEval (ICLR 2025) — 90.2% R@5 retrieval, 38.3% end-to-end QA accuracy with GPT-5 as judge over 470 non-abstention questions
- Benchmark scripts:
scripts/longmemeval_eval.pyandscripts/requirements-benchmark.txtfor reproducing results - Benchmark results: Raw results in
results/directory
Changed
- Dependencies: Updated dev dependencies (ajv, brace-expansion, flatted, js-yaml, minimatch, picomatch, vite) via
npm audit fix
See CHANGELOG.md for full details.