Externer Test-Harness für die Modell-Kompatibilitäts-Matrix von MindGraph Notes. Steht bewusst getrennt vom Produkt-Code, damit Benchmarks nicht versehentlich in einen Release wandern.
Die Ergebnisse hier sind die empirische Grundlage für die Verdicts
(green / yellow / red / untested) in app/src/shared/modelCompatibility.ts
und für die öffentliche Übersicht auf
mindgraph-notes.de/model-quality.html.
Pro Modul werden synthetische deutsche Eingaben gegen lokal verfügbare
Ollama-Modelle gefahren. Der Output wird deterministisch gegen eine Ground
Truth gescort — JSON-Validität, Datums-Treffer, Wikilink-Abdeckung, Score-Bänder,
Verhalten bei Prompt-Injection — nicht „gefühlt". Ergebnisse landen in results/
als JSON (Roh-Daten) und Markdown (Tabelle).
| Datei | Was gemessen wird |
|---|---|
bench-task-extraction.mjs / -v2.mjs |
Aufgaben & Termine aus E-Mails extrahieren (höchstes Schadensrisiko bei Fehlfunktion) |
bench-mail-summary.mjs |
Relevanz-Score, Sentiment, Zusammenfassung, Halluzinations-Quote |
bench-brain-regression.mjs |
Tageszusammenfassung: Sektionsschema, Wikilinks, keine erfundenen Notiztitel |
bench-dashboard.mjs |
Dringlichkeits-Score von Notizen, Verhalten bei Prompt-Injection |
bench-project-status.mjs |
Projekt-Wochenstatus ohne Halluzinationen |
bench-note-agent.mjs |
Tool-Use-Loop des Notiz-Agenten (21 Aufgaben pro Modell) |
- Ollama läuft lokal auf
localhost:11434 - Die zu testenden Modelle sind via
ollama pullinstalliert
node bench-mail-summary.mjs # alle gefundenen Modelle
BENCH_MODELS=qwen3.6:27b-mlx node bench-mail-summary.mjs # gezieltErgebnisse in results/<modul>-YYYY-MM-DD.{json,md}.
Alle Namen, E-Mail-Adressen, Orte und Institutionen in den Testfällen sind
erfunden. Sie sind bewusst realistisch gebaut (deutsche Behörden-, Schul- und
Verlagskorrespondenz), damit unter realitätsnahen Bedingungen gemessen wird —
aber sie bezeichnen keine realen Personen oder Organisationen. Domains laufen
durchgängig auf der reservierten TLD .example (RFC 2606).
Sie ist kein Beweis, dass ein Modell „gut" ist — nur dafür, dass es im definierten Testset einen bestimmten Score erreicht. Reale Eingaben sind variabler.
Und sie misst den Prompt zusammen mit dem Modell: Am 27.07.2026 stellte sich heraus, dass die Modelle der vorgegebenen Relevanz-Skala korrekt folgten und trotzdem außerhalb der Ground Truth lagen — die Skala selbst war falsch geeicht. Ein schlechter Score kann also genauso gut am Messaufbau liegen wie am Modell. Wer hier Zahlen liest, sollte diesen Fall im Kopf behalten.
AGPL-3.0-or-later, wie MindGraph Notes selbst. Siehe LICENSE.