-
Notifications
You must be signed in to change notification settings - Fork 0
Polski Real Time Transcription
Transkrypcja w czasie rzeczywistym wyświetla rozpoznany tekst poniżej wskaźnika nagrywania, gdy nagrywanie jest nadal w toku. Włącz ją w Ustawienia → Transkrypcja w czasie rzeczywistym, a następnie wybierz dokładnie jeden tryb.
Transkrypcja blokowa ponownie wykorzystuje wybrany główny model szeptu lub papugi. Podczas nagrywania dokonuje transkrypcji nakładających się okien audio, łączy rozpoznane słowa według ich znaczników czasu i traktuje tekst jako stabilny, jeśli pozostaje spójny. Po zakończeniu nagrywania Voice2Win dodaje brakujący koniec lub wykonuje pełną transkrypcję zastępczą, jeśli zostaną wykryte luki.
Zalety:
- Wykorzystuje ten sam główny model transkrypcji i wybór języka, co w przypadku ostatecznej transkrypcji.
- Umożliwia wcześniejsze wykorzystanie długich nagrań bez konieczności ładowania osobnego modułu rozpoznawania transmisji strumieniowej.
- Można przeprowadzić dodatkowe przesunięte kontrole wokół granic zdań, aby naprawić wcześniejsze wyniki bloków.
Wymagania i kompromisy:
- Przeznaczony do przyspieszania karty graficznej i może być niedostępny, gdy do głównego procesora przypisano transkrypcję audio.
- Wymaga wystarczającej pamięci graficznej dla wybranego modelu i nakładania się pracy.
- Częstsze lub większe okna zwiększają wykorzystanie mocy obliczeniowej.
| Ustawienie | Domyślne | Efekt |
|---|---|---|
| Rozmiar okna | 10 sekund | Maksymalny czas trwania dźwięku widziany przez jeden przebieg modelu głównego. Większe okna dodają kontekst, ale zajmują więcej czasu. |
| Interwał przeskoku | 3 sekundy | Czas pomiędzy nowymi migawkami. Mniejsze wartości odświeżają się częściej i rozpoczynają więcej pracy. |
| Nakładanie się / kontekst | 20 sekund | Wcześniejsze nagrania audio zostały ponownie uwzględnione w celu zapewnienia kontekstu i połączenia. |
| Opóźnienie stabilności | 6 sekund | Jak długo nowy tekst musi pozostać niezmieniony, zanim stanie się stabilny. |
| Limit czasu w czasie ciszy | 1000 milisekund | Akceptuje oczekujący stabilny tekst po tym okresie bez wykrytej mowy. |
| Dodatkowe kontrole granic zdania | 2 | Dodatkowe przesunięte kontrole na granicę zdania; zero wyłącza dodatkowe przebiegi. |
| Współczynnik przesunięcia | 20 procent | Kontroluje stopień przesunięcia dodatkowych okien zdań. |
Użyj opcji Przywróć domyślne, jeśli ręczne strojenie powoduje, że sygnał wyjściowy jest wolniejszy lub mniej stabilny.
Transkrypcja strumieniowa uruchamia oddzielny moduł rozpoznawania online Sherpa-ONNX równolegle z nagrywaniem. Tworzy bardzo wczesne zdania tymczasowe, które następnie udoskonala główny model transkrypcji w nakładających się grupach.
Zalety:
- Najwcześniejsze widoczne wyniki pośrednie.
- Może działać na głównym procesorze lub, w systemie Windows, z akceleracją karty graficznej DirectML.
Kompromisy:
- Obsługuje tylko języki, dla których w bieżącym katalogu istnieje model strumieniowy.
- Wstępne ujęcie tymczasowe może być bardziej przybliżone niż ostateczny wynik modelu głównego.
- Pobiera i buforuje dodatkowy model dla każdego wybranego języka lub wariantu modelu.
- Środowisko wykonawcze — wybierz główny procesor dla kompatybilności lub kartę graficzną Windows dla szybkości.
- Model strumieniowego przesyłania dźwięku — Szybszy minimalizuje opóźnienia i czas ładowania; Bardziej dokładny, ale wolniejszy wymaga więcej obliczeń w celu zapewnienia jakości rozpoznawania.
- Liczba zdań dopracowanych razem — kontroluje nakładające się okno udoskonalania modelu głównego od 1 do 8 zdań; wartość domyślna to 2.
- Wczytane modele strumieni audio — wyświetla listę modeli zapisanych w pamięci podręcznej i umożliwia ich usunięcie. W razie potrzeby usunięty model zostanie pobrany ponownie.
Maksymalna wysokość tekstu poniżej wskaźnika nagrywania ogranicza tekst w czasie rzeczywistym do 10–90 procent wysokości ekranu; wartość domyślna wynosi 50 procent. Dłuższy tekst można przewijać i podąża za najnowszym wynikiem, dopóki nie przewiniesz ręcznie w górę.
- Wybierz Blokuj transkrypcję, jeśli chcesz zachować zachowanie głównego modelu i masz wystarczającą wydajność karty graficznej i pamięci.
- Wybierz Transkrypcja strumieniowa, jeśli liczy się najwcześniejszy możliwy tekst tymczasowy i obsługiwany jest Twój język.
- Wyłącz transkrypcję w czasie rzeczywistym, jeśli wolisz najprostszy potok i potrzebujesz tylko końcowego wyniku po nagraniu.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động