Skip to content

bydb/brain-model-benchmark

Repository files navigation

Brain Model Benchmark

Externer Test-Harness für die Modell-Kompatibilitäts-Matrix von MindGraph Notes. Steht bewusst getrennt vom Produkt-Code, damit Benchmarks nicht versehentlich in einen Release wandern.

Die Ergebnisse hier sind die empirische Grundlage für die Verdicts (green / yellow / red / untested) in app/src/shared/modelCompatibility.ts und für die öffentliche Übersicht auf mindgraph-notes.de/model-quality.html.

Was hier passiert

Pro Modul werden synthetische deutsche Eingaben gegen lokal verfügbare Ollama-Modelle gefahren. Der Output wird deterministisch gegen eine Ground Truth gescort — JSON-Validität, Datums-Treffer, Wikilink-Abdeckung, Score-Bänder, Verhalten bei Prompt-Injection — nicht „gefühlt". Ergebnisse landen in results/ als JSON (Roh-Daten) und Markdown (Tabelle).

Module

Datei Was gemessen wird
bench-task-extraction.mjs / -v2.mjs Aufgaben & Termine aus E-Mails extrahieren (höchstes Schadensrisiko bei Fehlfunktion)
bench-mail-summary.mjs Relevanz-Score, Sentiment, Zusammenfassung, Halluzinations-Quote
bench-brain-regression.mjs Tageszusammenfassung: Sektionsschema, Wikilinks, keine erfundenen Notiztitel
bench-dashboard.mjs Dringlichkeits-Score von Notizen, Verhalten bei Prompt-Injection
bench-project-status.mjs Projekt-Wochenstatus ohne Halluzinationen
bench-note-agent.mjs Tool-Use-Loop des Notiz-Agenten (21 Aufgaben pro Modell)

Voraussetzungen

  • Ollama läuft lokal auf localhost:11434
  • Die zu testenden Modelle sind via ollama pull installiert

Ausführen

node bench-mail-summary.mjs                                # alle gefundenen Modelle
BENCH_MODELS=qwen3.6:27b-mlx node bench-mail-summary.mjs   # gezielt

Ergebnisse in results/<modul>-YYYY-MM-DD.{json,md}.

Hinweis zu den Testdaten

Alle Namen, E-Mail-Adressen, Orte und Institutionen in den Testfällen sind erfunden. Sie sind bewusst realistisch gebaut (deutsche Behörden-, Schul- und Verlagskorrespondenz), damit unter realitätsnahen Bedingungen gemessen wird — aber sie bezeichnen keine realen Personen oder Organisationen. Domains laufen durchgängig auf der reservierten TLD .example (RFC 2606).

Was diese Suite NICHT ist

Sie ist kein Beweis, dass ein Modell „gut" ist — nur dafür, dass es im definierten Testset einen bestimmten Score erreicht. Reale Eingaben sind variabler.

Und sie misst den Prompt zusammen mit dem Modell: Am 27.07.2026 stellte sich heraus, dass die Modelle der vorgegebenen Relevanz-Skala korrekt folgten und trotzdem außerhalb der Ground Truth lagen — die Skala selbst war falsch geeicht. Ein schlechter Score kann also genauso gut am Messaufbau liegen wie am Modell. Wer hier Zahlen liest, sollte diesen Fall im Kopf behalten.

Lizenz

AGPL-3.0-or-later, wie MindGraph Notes selbst. Siehe LICENSE.

About

Test-Harness für die Modell-Kompatibilitäts-Matrix von MindGraph Notes — deterministische Benchmarks lokaler Ollama-Modelle auf deutschen Eingaben

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages