-
Notifications
You must be signed in to change notification settings - Fork 0
Deutsch Echtzeit Transkription
Die Echtzeit-Transkription zeigt bereits während einer laufenden Aufnahme erkannten Text unterhalb der Aufnahmeanzeige an. Aktiviere sie unter Einstellungen → Echtzeit-Transkription und wähle genau einen Modus.
Die Block-Transkription verwendet das ausgewählte Hauptmodell von Whisper oder Parakeet. Während der Aufnahme transkribiert sie überlappende Audiofenster, führt erkannte Wörter anhand ihrer Zeitstempel zusammen und betrachtet Text als stabil, nachdem er für eine bestimmte Zeit unverändert blieb. Nach Aufnahmeende ergänzt Voice2Win das noch fehlende Ende oder führt bei erkannten Lücken eine vollständige Ersatztranskription aus.
Vorteile:
- Verwendet dasselbe Hauptmodell und dieselbe Sprachauswahl wie die endgültige Transkription.
- Macht lange Diktate früher nutzbar, ohne ein zusätzliches Streamingmodell zu laden.
- Kann zusätzliche verschobene Prüfungen an Satzgrenzen ausführen, um frühere Blockergebnisse zu korrigieren.
Voraussetzungen und Nachteile:
- Ist für Grafikkartenbeschleunigung vorgesehen und möglicherweise nicht verfügbar, wenn die Audiotranskription dem Hauptprozessor zugewiesen ist.
- Benötigt ausreichend Grafikspeicher für das gewählte Modell und die überlappende Verarbeitung.
- Häufigere oder größere Fenster erhöhen die Rechenlast.
| Einstellung | Standard | Wirkung |
|---|---|---|
| Fenstergröße | 10 Sekunden | Maximale Audiodauer eines Durchlaufs mit dem Hauptmodell. Größere Fenster liefern mehr Kontext, benötigen aber mehr Zeit. |
| Intervall | 3 Sekunden | Abstand zwischen neuen Momentaufnahmen. Kleinere Werte aktualisieren häufiger und starten mehr Verarbeitungsvorgänge. |
| Überlappung/Kontext | 20 Sekunden | Früheres Audio, das für Kontext und Zusammenführung erneut einbezogen wird. |
| Stabilitätsverzögerung | 6 Sekunden | Zeit, die neuer Text unverändert bleiben muss, bevor er als stabil gilt. |
| Zeitgrenze bei Stille | 1000 Millisekunden | Übernimmt ausstehenden stabilen Text nach dieser Zeit ohne erkannte Sprache. |
| Zusätzliche Prüfungen an Satzgrenzen | 2 | Zusätzliche verschobene Prüfungen je Satzgrenze; null deaktiviert sie. |
| Verschiebungsfaktor | 20 Prozent | Bestimmt, wie weit die zusätzlichen Satzfenster verschoben werden. |
Verwende Standardwerte wiederherstellen, falls eigene Anpassungen die Ausgabe langsamer oder instabiler machen.
Die Stream-Transkription führt parallel zur Aufnahme eine separate Sherpa-ONNX-Online-Erkennung aus. Sie liefert sehr früh vorläufige Sätze, die das Hauptmodell anschließend in überlappenden Gruppen verbessert.
Vorteile:
- Frühestmögliche Anzeige vorläufiger Ergebnisse.
- Kann auf dem Hauptprozessor oder unter Windows mit DirectML-Grafikkartenbeschleunigung ausgeführt werden.
Nachteile:
- Unterstützt nur Sprachen, für die im aktuellen Katalog ein Stream-Modell vorhanden ist.
- Die vorläufige Roherkennung kann ungenauer als das endgültige Ergebnis des Hauptmodells sein.
- Lädt für jede gewählte Sprache oder Modellvariante ein zusätzliches Modell herunter und speichert es zwischen.
- Laufzeitumgebung — Wähle den Hauptprozessor für größtmögliche Kompatibilität oder unter Windows eine Grafikkarte für höhere Geschwindigkeit.
- Stream-Audiomodell — Schneller minimiert Latenz und Ladezeit; Genauer, aber langsamer verwendet mehr Rechenleistung für eine bessere Erkennungsqualität.
- Gemeinsam zu verbessernde Sätze — bestimmt das überlappende Fenster des Hauptmodells zwischen 1 und 8 Sätzen; Standard ist 2.
- Geladene Stream-Audiomodelle — zeigt zwischengespeicherte Modelle an und ermöglicht deren Löschung. Ein gelöschtes Modell wird bei Bedarf erneut heruntergeladen.
Maximale Texthöhe unterhalb der Aufnahmeanzeige begrenzt den Echtzeittext auf 10–90 Prozent der Bildschirmhöhe; Standard sind 50 Prozent. Längerer Text bleibt scrollbar und folgt dem neuesten Ergebnis, bis manuell nach oben gescrollt wird.
- Wähle Block-Transkription, wenn das Verhalten des Hauptmodells gewünscht ist und genügend Grafikkartenleistung sowie Grafikspeicher verfügbar sind.
- Wähle Stream-Transkription, wenn vorläufiger Text möglichst früh erscheinen soll und die Sprache unterstützt wird.
- Deaktiviere die Echtzeit-Transkription für den einfachsten Ablauf, wenn nur das endgültige Ergebnis nach der Aufnahme benötigt wird.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động