Skip to content

Polski Real Time Transcription

Dan edited this page Aug 21, 2026 · 1 revision

Transkrypcja w czasie rzeczywistym

Transkrypcja w czasie rzeczywistym wyświetla rozpoznany tekst poniżej wskaźnika nagrywania, gdy nagrywanie jest nadal w toku. Włącz ją w Ustawienia → Transkrypcja w czasie rzeczywistym, a następnie wybierz dokładnie jeden tryb.

Blokuj transkrypcję

Transkrypcja blokowa ponownie wykorzystuje wybrany główny model szeptu lub papugi. Podczas nagrywania dokonuje transkrypcji nakładających się okien audio, łączy rozpoznane słowa według ich znaczników czasu i traktuje tekst jako stabilny, jeśli pozostaje spójny. Po zakończeniu nagrywania Voice2Win dodaje brakujący koniec lub wykonuje pełną transkrypcję zastępczą, jeśli zostaną wykryte luki.

Zalety:

  • Wykorzystuje ten sam główny model transkrypcji i wybór języka, co w przypadku ostatecznej transkrypcji.
  • Umożliwia wcześniejsze wykorzystanie długich nagrań bez konieczności ładowania osobnego modułu rozpoznawania transmisji strumieniowej.
  • Można przeprowadzić dodatkowe przesunięte kontrole wokół granic zdań, aby naprawić wcześniejsze wyniki bloków.

Wymagania i kompromisy:

  • Przeznaczony do przyspieszania karty graficznej i może być niedostępny, gdy do głównego procesora przypisano transkrypcję audio.
  • Wymaga wystarczającej pamięci graficznej dla wybranego modelu i nakładania się pracy.
  • Częstsze lub większe okna zwiększają wykorzystanie mocy obliczeniowej.

Ustawienia blokowania

Ustawienie Domyślne Efekt
Rozmiar okna 10 sekund Maksymalny czas trwania dźwięku widziany przez jeden przebieg modelu głównego. Większe okna dodają kontekst, ale zajmują więcej czasu.
Interwał przeskoku 3 sekundy Czas pomiędzy nowymi migawkami. Mniejsze wartości odświeżają się częściej i rozpoczynają więcej pracy.
Nakładanie się / kontekst 20 sekund Wcześniejsze nagrania audio zostały ponownie uwzględnione w celu zapewnienia kontekstu i połączenia.
Opóźnienie stabilności 6 sekund Jak długo nowy tekst musi pozostać niezmieniony, zanim stanie się stabilny.
Limit czasu w czasie ciszy 1000 milisekund Akceptuje oczekujący stabilny tekst po tym okresie bez wykrytej mowy.
Dodatkowe kontrole granic zdania 2 Dodatkowe przesunięte kontrole na granicę zdania; zero wyłącza dodatkowe przebiegi.
Współczynnik przesunięcia 20 procent Kontroluje stopień przesunięcia dodatkowych okien zdań.

Użyj opcji Przywróć domyślne, jeśli ręczne strojenie powoduje, że sygnał wyjściowy jest wolniejszy lub mniej stabilny.

Transkrypcja strumieniowa

Transkrypcja strumieniowa uruchamia oddzielny moduł rozpoznawania online Sherpa-ONNX równolegle z nagrywaniem. Tworzy bardzo wczesne zdania tymczasowe, które następnie udoskonala główny model transkrypcji w nakładających się grupach.

Zalety:

  • Najwcześniejsze widoczne wyniki pośrednie.
  • Może działać na głównym procesorze lub, w systemie Windows, z akceleracją karty graficznej DirectML.

Kompromisy:

  • Obsługuje tylko języki, dla których w bieżącym katalogu istnieje model strumieniowy.
  • Wstępne ujęcie tymczasowe może być bardziej przybliżone niż ostateczny wynik modelu głównego.
  • Pobiera i buforuje dodatkowy model dla każdego wybranego języka lub wariantu modelu.

Ustawienia strumienia

  • Środowisko wykonawcze — wybierz główny procesor dla kompatybilności lub kartę graficzną Windows dla szybkości.
  • Model strumieniowego przesyłania dźwiękuSzybszy minimalizuje opóźnienia i czas ładowania; Bardziej dokładny, ale wolniejszy wymaga więcej obliczeń w celu zapewnienia jakości rozpoznawania.
  • Liczba zdań dopracowanych razem — kontroluje nakładające się okno udoskonalania modelu głównego od 1 do 8 zdań; wartość domyślna to 2.
  • Wczytane modele strumieni audio — wyświetla listę modeli zapisanych w pamięci podręcznej i umożliwia ich usunięcie. W razie potrzeby usunięty model zostanie pobrany ponownie.

Ustawienie wspólnego wyświetlania

Maksymalna wysokość tekstu poniżej wskaźnika nagrywania ogranicza tekst w czasie rzeczywistym do 10–90 procent wysokości ekranu; wartość domyślna wynosi 50 procent. Dłuższy tekst można przewijać i podąża za najnowszym wynikiem, dopóki nie przewiniesz ręcznie w górę.

Który tryb mam wybrać?

  • Wybierz Blokuj transkrypcję, jeśli chcesz zachować zachowanie głównego modelu i masz wystarczającą wydajność karty graficznej i pamięci.
  • Wybierz Transkrypcja strumieniowa, jeśli liczy się najwcześniejszy możliwy tekst tymczasowy i obsługiwany jest Twój język.
  • Wyłącz transkrypcję w czasie rzeczywistym, jeśli wolisz najprostszy potok i potrzebujesz tylko końcowego wyniku po nagraniu.
Languages
English

Features

Configuration

Help

Deutsch

Funktionen

Konfiguration

Hilfe

Español

Funciones

Configuración

Ayuda

Français

Fonctionnalités

Configuration

Aide

Português (Brasil)

Recursos

Configuração

Ajuda

Italiano

Funzionalità

Configurazione

Aiuto

Nederlands

Functies

Configuratie

Help

Polski

Funkcje

Konfiguracja

Pomoc

Svenska

Funktioner

Konfiguration

Hjälp

简体中文

功能

配置

帮助

日本語

機能

設定

ヘルプ

한국어

기능

구성

도움말

हिन्दी

सुविधाएँ

कॉन्फ़िगरेशन

सहायता

繁體中文

功能

設定

說明

Bahasa Indonesia

Fitur

Konfigurasi

Bantuan

Tiếng Việt

Tính năng

Cấu hình

Trợ giúp

ไทย

คุณสมบัติ

การกำหนดค่า

วิธีใช้

العربية

الميزات

الإعداد

المساعدة

Türkçe

Özellikler

Yapılandırma

Yardım

Русский

Возможности

Настройка

Справка

Українська

Функції

Налаштування

Довідка

Clone this wiki locally