Skip to content

Deutsch Echtzeit Transkription

Dan edited this page Aug 21, 2026 · 1 revision

Echtzeit-Transkription

Die Echtzeit-Transkription zeigt bereits während einer laufenden Aufnahme erkannten Text unterhalb der Aufnahmeanzeige an. Aktiviere sie unter Einstellungen → Echtzeit-Transkription und wähle genau einen Modus.

Block-Transkription

Die Block-Transkription verwendet das ausgewählte Hauptmodell von Whisper oder Parakeet. Während der Aufnahme transkribiert sie überlappende Audiofenster, führt erkannte Wörter anhand ihrer Zeitstempel zusammen und betrachtet Text als stabil, nachdem er für eine bestimmte Zeit unverändert blieb. Nach Aufnahmeende ergänzt Voice2Win das noch fehlende Ende oder führt bei erkannten Lücken eine vollständige Ersatztranskription aus.

Vorteile:

  • Verwendet dasselbe Hauptmodell und dieselbe Sprachauswahl wie die endgültige Transkription.
  • Macht lange Diktate früher nutzbar, ohne ein zusätzliches Streamingmodell zu laden.
  • Kann zusätzliche verschobene Prüfungen an Satzgrenzen ausführen, um frühere Blockergebnisse zu korrigieren.

Voraussetzungen und Nachteile:

  • Ist für Grafikkartenbeschleunigung vorgesehen und möglicherweise nicht verfügbar, wenn die Audiotranskription dem Hauptprozessor zugewiesen ist.
  • Benötigt ausreichend Grafikspeicher für das gewählte Modell und die überlappende Verarbeitung.
  • Häufigere oder größere Fenster erhöhen die Rechenlast.

Block-Einstellungen

Einstellung Standard Wirkung
Fenstergröße 10 Sekunden Maximale Audiodauer eines Durchlaufs mit dem Hauptmodell. Größere Fenster liefern mehr Kontext, benötigen aber mehr Zeit.
Intervall 3 Sekunden Abstand zwischen neuen Momentaufnahmen. Kleinere Werte aktualisieren häufiger und starten mehr Verarbeitungsvorgänge.
Überlappung/Kontext 20 Sekunden Früheres Audio, das für Kontext und Zusammenführung erneut einbezogen wird.
Stabilitätsverzögerung 6 Sekunden Zeit, die neuer Text unverändert bleiben muss, bevor er als stabil gilt.
Zeitgrenze bei Stille 1000 Millisekunden Übernimmt ausstehenden stabilen Text nach dieser Zeit ohne erkannte Sprache.
Zusätzliche Prüfungen an Satzgrenzen 2 Zusätzliche verschobene Prüfungen je Satzgrenze; null deaktiviert sie.
Verschiebungsfaktor 20 Prozent Bestimmt, wie weit die zusätzlichen Satzfenster verschoben werden.

Verwende Standardwerte wiederherstellen, falls eigene Anpassungen die Ausgabe langsamer oder instabiler machen.

Stream-Transkription

Die Stream-Transkription führt parallel zur Aufnahme eine separate Sherpa-ONNX-Online-Erkennung aus. Sie liefert sehr früh vorläufige Sätze, die das Hauptmodell anschließend in überlappenden Gruppen verbessert.

Vorteile:

  • Frühestmögliche Anzeige vorläufiger Ergebnisse.
  • Kann auf dem Hauptprozessor oder unter Windows mit DirectML-Grafikkartenbeschleunigung ausgeführt werden.

Nachteile:

  • Unterstützt nur Sprachen, für die im aktuellen Katalog ein Stream-Modell vorhanden ist.
  • Die vorläufige Roherkennung kann ungenauer als das endgültige Ergebnis des Hauptmodells sein.
  • Lädt für jede gewählte Sprache oder Modellvariante ein zusätzliches Modell herunter und speichert es zwischen.

Stream-Einstellungen

  • Laufzeitumgebung — Wähle den Hauptprozessor für größtmögliche Kompatibilität oder unter Windows eine Grafikkarte für höhere Geschwindigkeit.
  • Stream-AudiomodellSchneller minimiert Latenz und Ladezeit; Genauer, aber langsamer verwendet mehr Rechenleistung für eine bessere Erkennungsqualität.
  • Gemeinsam zu verbessernde Sätze — bestimmt das überlappende Fenster des Hauptmodells zwischen 1 und 8 Sätzen; Standard ist 2.
  • Geladene Stream-Audiomodelle — zeigt zwischengespeicherte Modelle an und ermöglicht deren Löschung. Ein gelöschtes Modell wird bei Bedarf erneut heruntergeladen.

Gemeinsame Anzeigeeinstellung

Maximale Texthöhe unterhalb der Aufnahmeanzeige begrenzt den Echtzeittext auf 10–90 Prozent der Bildschirmhöhe; Standard sind 50 Prozent. Längerer Text bleibt scrollbar und folgt dem neuesten Ergebnis, bis manuell nach oben gescrollt wird.

Welcher Modus ist geeignet?

  • Wähle Block-Transkription, wenn das Verhalten des Hauptmodells gewünscht ist und genügend Grafikkartenleistung sowie Grafikspeicher verfügbar sind.
  • Wähle Stream-Transkription, wenn vorläufiger Text möglichst früh erscheinen soll und die Sprache unterstützt wird.
  • Deaktiviere die Echtzeit-Transkription für den einfachsten Ablauf, wenn nur das endgültige Ergebnis nach der Aufnahme benötigt wird.
Languages
English

Features

Configuration

Help

Deutsch

Funktionen

Konfiguration

Hilfe

Español

Funciones

Configuración

Ayuda

Français

Fonctionnalités

Configuration

Aide

Português (Brasil)

Recursos

Configuração

Ajuda

Italiano

Funzionalità

Configurazione

Aiuto

Nederlands

Functies

Configuratie

Help

Polski

Funkcje

Konfiguracja

Pomoc

Svenska

Funktioner

Konfiguration

Hjälp

简体中文

功能

配置

帮助

日本語

機能

設定

ヘルプ

한국어

기능

구성

도움말

हिन्दी

सुविधाएँ

कॉन्फ़िगरेशन

सहायता

繁體中文

功能

設定

說明

Bahasa Indonesia

Fitur

Konfigurasi

Bantuan

Tiếng Việt

Tính năng

Cấu hình

Trợ giúp

ไทย

คุณสมบัติ

การกำหนดค่า

วิธีใช้

العربية

الميزات

الإعداد

المساعدة

Türkçe

Özellikler

Yapılandırma

Yardım

Русский

Возможности

Настройка

Справка

Українська

Функції

Налаштування

Довідка

Clone this wiki locally