-
Notifications
You must be signed in to change notification settings - Fork 0
Polski Settings Reference
Otwórz Ustawienia przyciskiem koła zębatego. OK zapisuje zmiany; Anuluj odrzuca je. Zmiany wpływające na modele, środowiska wykonawcze, lokalizacje przechowywania lub usługi sieciowe mogą chwilę potrwać, zanim zostaną zastosowane, i mogą spowodować ponowne uruchomienie komponentu.
To odniesienie ma służyć jako przewodnik po dopasowywaniu ustawień, a nie tylko jako lista elementów sterujących. Domyślne ustawienia są dobrym punktem wyjścia dla większości lokalnych instalacji Windows. Zmieniaj jedną powiązaną opcję naraz, testuj ją w aplikacji, w której faktycznie dyktujesz, i zachowuj poprzednią wartość, dopóki rezultat nie będzie wyraźnie lepszy.
| Cel | Zalecany punkt wyjścia |
|---|---|
| Niezawodne codzienne dyktowanie w standardowych aplikacjach desktopowych | Stały język transkrypcji, wstawianie przez Schowek, włączone przywracanie schowka, domyślne opóźnienia, włączona normalizacja dźwięku |
| Dyktowanie w terminalu lub na pulpicie zdalnym | Najpierw spróbuj Unicode, jeśli przesyłanie schowka jest niedostępne. W przeciwnym razie zachowaj Schowek i wybierz skrót wklejania akceptowany przez zdalny cel. Użyj Kod skanowania dla aplikacji, które reagują tylko na wejście podobne do fizycznej klawiatury. |
| Długie dokumenty | Stały język, wymowa interpunkcji, łańcuchowe formatowanie, tryb przycisku przytrzymania lub hybrydowy, zapisane nagrania WAV |
| Krótkie pola wyszukiwania, czaty i polecenia | Usuń końcową kropkę; opcjonalnie użyj formatowania z małą literą na początku; tryb przytrzymania przycisku zapobiega przypadkowemu pozostawaniu nagrywania aktywnego |
| Ciche lub wrażliwe na prywatność użycie | Wyłącz zapisywanie nagrań WAV, sprawdź przechowywanie transkrypcji, wyłącz wklejanie do schowka, jeśli istnieją obawy związane z monitorowaniem schowka, i unikaj zdalnych środowisk uruchomieniowych | | Najniższe odczuwalne opóźnienia | Wyłącz podgląd w czasie rzeczywistym, chyba że jest przydatny, używaj szybkiego lokalnego modelu/środowiska transkrypcji, utrzymuj niskie opóźnienia wklejania i nie zbieraj wyników AI przed wklejeniem |
- Język transkrypcji: Wybierz język, którym posługujesz się najczęściej. Ustalony język zwykle startuje szybciej i jest bardziej niezawodny niż Automatyczny, szczególnie przy krótkich dyktandach, nazwiskach i słowach o podobnym brzmieniu. Używaj automatycznego wykrywania tylko wtedy, gdy naprawdę zmieniasz język między nagraniami; wykrywanie języka ma mniej dowodów w krótkiej frazie i może wybrać błędnie.
- Niestandardowe terminy specjalistyczne i nazwy: Dodaj rzadkie nazwy, terminy produktowe, skróty i pisownię, którą chcesz, aby Whisper preferował. Zachowaj listę skoncentrowaną: kieruje rozpoznawaniem, ale nie jest gwarantowaną regułą wyszukiwania i zamiany, a duża lista zwykłych słów może wprowadzać niepożądane zniekształcenia. Te wskazówki są przeznaczone dla Whisper; inny silnik transkrypcyjny może nie używać ich w ten sam sposób.
Najlepsza metoda wstawiania zależy od docelowej aplikacji. Przetestuj ją w najtrudniejszym programie, którego używasz, nie tylko w prostym edytorze.
-
Schowek: Najlepszy ogólny wybór w systemie Windows i zazwyczaj najszybszy dla długiego tekstu, znaków specjalnych i złożonego Unicode. Voice2Win tymczasowo zastępuje schowek, wysyła polecenie wklejenia i może przywrócić wcześniejszą zawartość. Menedżery schowka lub inne aplikacje mogą obserwować tymczasowy tekst, a przekazywanie schowka może być wyłączone w sesji zdalnej.
-
Unicode: Niezależny od układu i dobra pierwsza alternatywa dla sesji zdalnych, systemów innych niż Windows oraz tekstu zawierającego znaki, których nie ma na aktualnym układzie klawiatury. Niektóre gry, terminale, starsze aplikacje i okna z podwyższonymi uprawnieniami nie akceptują symulowanego Unicode niezawodnie.
-
Kod skanowania: Zachowuje się najbardziej jak fizyczne wprowadzanie z klawiatury i może być pomocny w przypadku starszych lub nietypowych aplikacji docelowych. Zależy od aktywnego układu klawiatury; znak, który nie ma odpowiadającego mu klawisza w tym układzie, może być pominięty lub błędny. Zazwyczaj jest wolniejszy niż pojedyncze wklejenie ze schowka w przypadku długiego tekstu.
-
Opóźnienie symulacji klawiatury (0–50 ms): Ustaw je nisko, chyba że wstawianie znaków Unicode lub kodów skanowania powoduje utratę lub zmianę kolejności znaków. Zwiększaj je stopniowo dla wolnych aplikacji, maszyn wirtualnych lub pulpitów zdalnych. To ustawienie spowalnia jedynie symulowane naciśnięcia klawiszy; nie poprawia rozpoznawania mowy.
-
Używaj schowka w problematycznych aplikacjach docelowych: Zachowaj to włączone podczas korzystania z Unicode lub kodu skanowania, chyba że korzystanie ze schowka jest zabronione. Voice2Win może wtedy przejść na znane aplikacje, które nie akceptują symulowanego wejścia w dobry sposób. Wyłącz to tylko wtedy, gdy powodem jest prywatność schowka lub przekazywanie zawartości schowka, co skłania Cię do celowego wyboru symulacji klawiatury.
-
Czas oczekiwania przed wklejeniem (0–2000 ms, domyślnie 40 ms): Czas potrzebny, aby nowa wartość schowka była dostępna przed wysłaniem skrótu wklejania. Zwiększ go, gdy docelowy program czasami wkleja poprzednią wartość schowka lub nic, szczególnie przy synchronizacji schowka zdalnego. Większa wartość dodaje to samo opóźnienie do każdego wklejenia.
-
Kombinacja klawiszy do wklejania: Użyj Ctrl+V w normalnych aplikacjach Windows. Wypróbuj Ctrl+Shift+V lub Shift+Insert, gdy terminal, pulpit zdalny lub narzędzie AI traktuje Ctrl+V jako coś innego niż wklejenie czystego tekstu. Wybierz skrót oczekiwany przez ostateczny cel, niekoniecznie przez lokalne okno pulpitu zdalnego.
-
Zbieraj tekst podczas ulepszania AI i wstaw go w jednym kroku: Włącz to, gdy postępujący wynik AI przesuwa kursor, wywołuje formatowanie lub autouzupełnianie albo tworzy kilka kroków cofania. Wyłącz, gdy ważniejsze jest zobaczenie wyniku jak najwcześniej; zbieranie czeka, aż wynik AI będzie kompletny, zanim cokolwiek zostanie wstawione.
-
Przywróć poprzednią zawartość schowka: Zachowaj włączone w normalnej pracy, aby Voice2Win nie niszczył tego, co skopiowałeś przed dyktowaniem. Wyłącz tylko wtedy, gdy celowo chcesz, aby wynik dyktowania pozostał w schowku lub określony cel odczyta schowek po tym, jak skrót wklejania już się zakończył.
-
Czas oczekiwania przed przywróceniem (0–2000 ms, domyślnie 120 ms): Zwiększ go, gdy docelowy element nic nie wstawia lub wstawia tylko część tekstu, ponieważ poprzednia wartość schowka jest przywracana zbyt szybko. Utrzymuj go tylko tak wysoko, jak jest to konieczne: w tym czasie dyktowany tekst pozostaje dostępny dla aplikacji korzystających ze schowka.
Opcje te modyfikują rozpoznany tekst przed jego wstawieniem. Są najbardziej przydatne, gdy twoje dyktowania mają spójny wzorzec.
-
Mówiona interpunkcja: Włącz ją przy dłuższych tekstach, gdy chcesz, aby wyrażenia takie jak „przecinek”, „znak zapytania” lub ich odpowiedniki w danym języku były zamieniane na znaki interpunkcyjne. Wyłącz ją, gdy te słowa mogą być treścią literalną lub gdy wolisz automatyczną interpunkcję z modelu transkrypcji.
-
Usuń końcową kropkę: Przydatne w polach wyszukiwania, wiadomościach na czacie, formularzach, nazwach plików i poleceniach głosowych, gdy automatycznie dodawana końcowa kropka jest niepożądana. Wyłącz ją dla pełnych zdań w dokumentach i e-mailach.
-
Mała litera na początku: Przydatne, gdy dyktowanie jest zwykle wstawiane w środek istniejącego zdania. Wyłącz ją dla nowych zdań, nagłówków, nazw własnych i samodzielnych wiadomości.
-
Łącz kolejne dyktanda w tej samej aplikacji: Włącz tę opcję, gdy tworzysz jeden akapit z kilku nagrań; Voice2Win może utrzymać odstępy i kontekst zdań między nimi. Wyłącz ją, gdy kolejne nagrania zazwyczaj trafiają do różnych pól lub gdy często ręcznie przestawiasz kursor między dyktandami.
-
Czułość wykrywania mowy (0–100, domyślnie 35%): Niższe wartości akceptują cichsze mówienie, ale mogą też traktować oddychanie, kliknięcia lub szumy w tle jako mowę. Wyższe wartości bardziej agresywnie filtrują szumy, ale mogą odrzucać cichy głos lub końcówki słów. Zacznij od wartości domyślnej i zmieniaj ją małymi krokami, obserwując poziom wejścia; przesunięcie mikrofonu bliżej często jest lepsze niż użycie skrajnej wartości.
-
Czyszczenie początku nagrania (0–500 ms, domyślnie 250 ms): Tłumi kliknięcie skrótu klawiszowego, szum obsługi i początkową ciszę na początku. Zwiększ tę wartość, jeśli pierwsza część nagrań zawiera kliknięcie klawisza; zmniejsz ją, jeśli pierwsza sylaba jest obcięta lub dyktujesz bardzo krótkie słowa zaraz po naciśnięciu skrótu klawiszowego.
-
Normalizuj nagranie (domyślnie włączone, cel 85%): Zalecane dla zwykłych mikrofonów i zmiennej odległości mówcy, ponieważ prezentuje modelowi bardziej jednolity poziom dźwięku. Wyłącz, jeśli używasz już znormalizowanego studia/wirtualnego wejścia lub gdy normalizacja wyraźnie podnosi stały szum tła. Cel nie jest regulacją wzmocnienia mikrofonu i nie może przywrócić przesterowanego dźwięku.
-
Zapisuj nagrania WAV (domyślnie włączone): Zachowaj włączone, gdy chcesz odtwarzania, ponownej transkrypcji, porównania jakości lub dowodów diagnostycznych. Wyłącz, gdy ważniejsza jest oszczędność miejsca lub poufność. Dźwięk zazwyczaj zajmuje znacznie więcej miejsca niż tekst.
-
Usuń zapisane nagrania WAV: Usuwa przechowywany dźwięk, zachowując tekst transkrypcji. Używaj po sprawdzeniu, że nie potrzebujesz już odtwarzania ani ponownej transkrypcji; usunięcie nie odtworzy oryginalnego dźwięku.
- Przytrzymaj: Nagrywanie trwa tylko wtedy, gdy skrót jest przytrzymany. Najlepsze dla krótkich, częstych dyktatów i najbezpieczniejszy tryb, gdy trzeba uniknąć przypadkowego nagrywania tła.
- Blokada: Naciśnij raz, aby rozpocząć, i ponownie, aby zatrzymać. Najlepsze dla długich fragmentów, w zastosowaniach ułatwień dostępu lub mówienia bez użycia rąk, ale wymaga świadomego zatrzymania.
- Tryb hybrydowy / podwójne stuknięcie: Przytrzymaj dla krótkiego nagrania lub podwójnie stuknij, aby zablokować. Jest to najbardziej elastyczny domyślny tryb dla pracy mieszanej. Używaj Przytrzymania, jeśli przypadkowe podwójne stuknięcia czasami pozostawiają nagrywanie aktywne.
-
Przypisz osobne skróty dla Mowy na tekst i Poleceń głosowych. Preferuj kombinacje, które nie są już obsługiwane przez system operacyjny, sterownik klawiatury, pulpit zdalny ani docelową aplikację. Powtarzające się skróty Voice2Win są odrzucane.
-
W systemie Windows Voice2Win zazwyczaj nie może wstrzykiwać do aplikacji uruchomionej z wyższymi uprawnieniami. Uruchamiaj Voice2Win z uprawnieniami administratora tylko wtedy, gdy faktycznie wymagana jest dyktacja w aplikacjach uruchomionych z wyższymi uprawnieniami; podniesiony globalny dostęp wejściowy zwiększa ryzyko skutków jakiegokolwiek błędu aplikacji lub konfiguracji.
-
Wycisz globalne wyjście audio, gdy skrót klawiszowy jest wciśnięty jest przydatne podczas korzystania z głośników, ponieważ dźwięk systemowy nie może wracać do mikrofonu. Wyłącz tę opcję podczas korzystania ze słuchawek lub gdy konieczne jest słyszenie spotkania czy źródła multimedialnego w trakcie nagrywania.
-
Oddzielne sygnały startu i zatrzymania sprawiają, że stan zatrzasku/hybrydowy jest jasny, gdy wskaźnik nie jest widoczny. Zachowaj dźwięki krótkie i ciche podczas używania głośników, aby mikrofon ich nie rejestrował. Zwiększ czas trwania lub głośność dla dostępności, nie aby rozwiązać problem zawodności wykrywania skrótów klawiszowych.
- Język interfejsu zmienia tylko menu i etykiety; nie wybiera języka transkrypcji.
- Ciemny motyw to preferencja wizualna i nie wpływa na rozpoznawanie ani wydajność.
- Styl wskaźnika: prosty wskaźnik poziomu jest najmniej rozpraszający; fala lub słupki ułatwiają ocenę aktywności mowy; wyświetlanie w stylu spektrum pokazuje więcej szczegółów, ale jest bardziej wizualnie zajęte. Wybierz styl, który pomoże Ci potwierdzić aktywność mikrofonu, nie zasłaniając docelowej aplikacji.
- Schemat kolorów, pozycja i rozmiar: użyj schematu o wysokim kontraście i umieść wskaźnik z dala od pasków narzędzi, podpisów i kursora tekstu. Większy wskaźnik pomaga przy dostępności i tekstach w czasie rzeczywistym; mniejszy jest lepszy, gdy liczy się tylko stan nagrywania.
-
Autostart wyłączony jest najlepszy, gdy Voice2Win jest używany okazjonalnie. Autostart w rejestrze jest standardowym wyborem w Windows do uruchamiania po zalogowaniu. Harmonogram zadań jest przydatny, gdy wymagany jest określony porządek uruchamiania lub wykonywanie z uprawnieniami administratora. W systemie Linux aplikacja używa mechanizmu autostartu na poziomie użytkownika.
-
Uruchamiaj z uprawnieniami administratora przy użyciu Harmonogramu zadań powinno pozostać wyłączone, chyba że musisz dyktować do aplikacji wymagających uprawnień administratora. Podwyższenie uprawnień nie jest opcją wydajnościową; zmienia granicę bezpieczeństwa globalnego dostępu do klawiatury.
-
Pokaż okno potwierdzenia autostartu jest przydatne podczas weryfikacji nowego ustawienia autostartu lub na komputerze współdzielonym. Wyłącz to tylko wtedy, gdy autostart jest zaufany i ma działać bez nadzoru.
-
Pokaż ekran powitalny jest pomocny, gdy inicjalizacja modelu/środowiska wykonawczego zajmuje zauważalny czas. Wyłącz go dla cichszego uruchamiania w stylu tray.
-
Gotowy dźwięk potwierdza, że uruchamianie i przygotowanie modelu zostały zakończone, szczególnie gdy Voice2Win uruchamia się w minimalizowanym trybie. Wyłącz go w cichych środowiskach; dostosuj czas trwania i głośność tylko na tyle, aby był rozpoznawalny.
-
Minimalizuj przy zamknięciu (domyślnie włączone) utrzymuje dostępność globalnych skrótów po zamknięciu głównego okna. Wyłącz, gdy przycisk zamknięcia okna powinien zamiast tego zakończyć aplikację.
-
Automatycznie sprawdzaj aktualizacje (domyślnie włączone) jest zalecane w celu uzyskania poprawek, kompatybilności modelu/runtime i aktualizacji bezpieczeństwa. Wyłącz tylko w przypadku celowo zarządzanych lub offline instalacji i sprawdzaj ręcznie.
-
Wyłącz cotygodniowy komunikat informacyjny ukrywa powtarzający się komunikat informacyjny po tym, jak nie jest już potrzebny; nie wyłącza komunikatów funkcjonalnych ani błędów.
-
Status automatyzacji wejścia w systemie Linux to informacje diagnostyczne. Automatyzacja wejścia zgodna z X11 jest obsługiwana; czysta sesja Waylanda może ograniczać globalne skróty i wstrzykiwanie tekstu. Jeśli jest niedostępna, użyj sesji X11 lub trybu zgodności oferowanego przez środowisko graficzne.
-
Ścieżka przechowywania transkrypcji: Wybierz niezawodny lokalny folder. Używaj zaszyfrowanego miejsca dla wrażliwych dyktand i upewnij się, że oprogramowanie do tworzenia kopii zapasowych/synchronizacji nie koliduje z plikami, które są wciąż zapisywane. Wolny lub sporadycznie dostępny dysk sieciowy może opóźniać operacje związane z historią.
-
Usuwanie starych transkrypcji / maksymalny wiek: Włącz automatyczną retencję, gdy liczy się polityka prywatności lub wykorzystanie dysku. Wybierz wiek, który nadal obejmuje realistyczny okres na korektę i ponowną transkrypcję. Zapisane pliki WAV zwykle stanowią największą część historii.
-
Ścieżka przechowywania modeli: Preferuj szybki lokalny dysk SSD z wystarczającą ilością wolnego miejsca. Dyski wymienne i sieciowe sprawiają, że ładowanie modeli jest mniej niezawodne i mogą sprawić, że odłączony dysk będzie wyglądał na brakujący model.
-
Użyj niestandardowego katalogu danych / przenieś wszystkie dane aplikacji: Przydatne w przypadku przenośnych konfiguracji, kontrolowanych kopii zapasowych lub przechowywania dużych danych poza dyskiem systemowym. Wybierz folder z odpowiednimi uprawnieniami i wolnym miejscem, a następnie uruchom ponownie, gdy zostaniesz o to poproszony. To przenosi dane lokalne; nie szyfruje ich ani nie wysyła automatycznie.
Transkrypcja w czasie rzeczywistym jest podglądem, gdy wciąż mówisz. Normalna, ostateczna transkrypcja pozostaje wynikiem autorytatywnym. Wyłącz tryb w czasie rzeczywistym, gdy podgląd nie jest przydatny: minimalizuje to zużycie zasobów i zapobiega zmianom wstępnych słów na ekranie.
- Block wielokrotnie uruchamia główny model transkrypcji Whisper na nakładającym się dźwięku. Wybierz go, gdy chcesz, aby podgląd przypominał ostateczny wynik Whisper i masz obsługiwaną kartę GPU z wystarczającą pamięcią. Zapewnia więcej kontekstu, ale generuje znaczną powtarzaną pracę GPU.
- Stream wykorzystuje osobny model strumieniowy Sherpa-ONNX. Wybierz go, aby uzyskać najszybszą przyrostową informację zwrotną lub gdy tryb blokowy jest niedostępny. Jego podgląd może być mniej precyzyjny i obsługuje tylko języki wymienione w ustawieniach; ostateczna normalna transkrypcja nadal może się różnić.
- Maksymalna wysokość wyświetlania ogranicza, ile ekranu podgląd może zajmować. Zwiększ ją dla długotrwałego dostępu; zmniejsz, gdy wskaźnik zasłania docelową aplikację. Nie zmienia jakości rozpoznawania.
Domyślne ustawienia są zrównoważone i współzależne. Przywróć je przed rozwiązywaniem problemów i zmieniaj tylko jeden parametr na raz.
-
Rozmiar okna (domyślnie 10 s): Zwiększ go, gdy kontekst zdania jest niewystarczający lub długie frazy zmieniają się zbyt dużo między migawkami. Większe okna zajmują więcej czasu i wymagają więcej obliczeń/pamięci. Zmniejsz je dla szybszych pojedynczych aktualizacji na odpowiednim sprzęcie, akceptując mniejszy kontekst.
-
Interwał przeskoku (domyślnie 3 s): Zmniejsz go, aby częściej aktualizować podgląd; zwiększ, gdy obciążenie GPU jest zbyt wysokie. Mniejszy przeskok rozpoczyna więcej procesów transkrypcji i nie przyspiesza każdego z nich.
-
Nakładanie / kontekst (domyślnie 20 s): Zwiększ je, gdy słowa na granicach bloków są powtarzane, pomijane lub źle scala się je z sąsiednimi. Zmniejsz, aby ograniczyć powtarzaną pracę. Zbyt małe nakładanie usuwa dowody potrzebne do pogodzić sąsiednie migawki.
-
Opóźnienie stabilności (domyślnie 6 s): Zwiększ je, gdy słowa są zatwierdzane zbyt wcześnie, a późniejszy kontekst mógłby je poprawić. Zmniejsz je, gdy stabilny tekst pojawia się zbyt wolno, akceptując więcej poprawek.
-
Limit czasu ciszy (domyślnie 1000 ms): Zmniejsz go, gdy tekst powinien się ustabilizować szybko po pauzie. Zwiększ go, gdy naturalne wahania dzielą lub zbyt wcześnie finalizują myśli.
-
Dodatkowe sprawdzanie granic zdań (domyślnie 2): Zwiększ tylko wtedy, gdy przejścia zdań są wielokrotnie błędne i dostępna jest moc GPU. Każda dodatkowo przesunięta transkrypcja kosztuje czas. Ustaw na 0, aby wyłączyć dodatkowe sprawdzenia; główne sprawdzenie granicy pozostaje.
-
Czynnik przesunięcia (domyślnie 20%): Kontroluje, jak daleko dodatkowe okna weryfikacyjne przesuwają się w stosunku do rozmiaru okna. Zwiększ go, gdy sprawdzenie szerszego obszaru wokół granicy jest pomocne; zmniejsz go, gdy wystarczający jest pobliski kontekst. Ma znaczenie tylko w połączeniu z dodatkowymi kontrolami.
- Czas wykonywania: CPU oferuje najszerszą kompatybilność. DirectML może zmniejszyć opóźnienia na obsługiwanych kartach GPU w systemie Windows, ale wykorzystuje zasoby GPU, które mogą być również potrzebne głównemu modelowi.
- Wariant modelu: Wybierz Fast, aby uzyskać niskie opóźnienia i mniejsze zużycie zasobów. Wybierz Accurate, gdy jakość podglądu jest ważniejsza niż jego szybkość.
- Okno udoskonalania zdania (1–8, domyślnie 2): Wartość 1 daje najszybsze sfinalizowanie zdania. Większe wartości zachowują więcej kontekstu zdania do udoskonalenia, ale opóźniają jego ustalenie i zwiększają obciążenie. Domyślna wartość stanowi praktyczny kompromis.
- Buforowane modele: Usunięcie nieużywanego buforowanego modelu zwalnia miejsce na dysku. Jeśli później zostanie wybrana ta kombinacja język/czas wykonywania/model, model musi zostać ponownie pobrany, zanim podgląd będzie gotowy.
Zobacz Transkrypcja w czasie rzeczywistym aby poznać pełny przepływ pracy i wymagania dotyczące dostępności.
- Whisper jest ogólnym wyborem dla szerokiego wsparcia językowego i ustalonych wariantów modelu. Parakeet może być atrakcyjny, gdy obsługiwane języki i dostępny sprzęt odpowiadają Twojemu zastosowaniu. Wybierz w oparciu o faktyczne nagrania; oceny w formie gwiazdek i szacunki prędkości są jedynie wskazówkami, a nie zastępują testowania mikrofonu, języka i słownictwa.
- Większe lub wyższej jakości modele zazwyczaj wymagają więcej pamięci i czasu, ale mogą poprawić trudne nagrania audio. Zacznij od najmniejszego modelu, który jest niezawodnie wystarczająco dokładny. Model, który powoduje przeciążenie pamięci lub długie kolejki, może być mniej użyteczny niż nieco mniejszy model, który zawsze się kończy.
- Menedżer modeli pobiera i usuwa lokalne pliki modeli. Nie usuwaj modelu, który jest nadal potrzebny przez wybrany silnik lub przepływ pracy offline.
-
Przydziel transkrypcję audio i udoskonalenie AI niezależnie. GPU zazwyczaj najlepiej sprawdza się przy powtarzalnej pracy lokalnej; CPU jest kompatybilnym zamiennikiem, ale może być znacznie wolniejszy. Rozdzielenie tych dwóch zadań na różne urządzenia może uniknąć konfliktu pamięci GPU, gdy oba są używane jednocześnie.
-
Dla Ollama lub LM Studio wybierz typ serwera, adres, port i wczytany model. Używaj funkcji wykrywania tylko w zaufanej sieci i upewnij się, że wybrany model jest faktycznie dostępny na serwerze.
-
Zdalny serwer AI lub inny komputer Voice2Win może przenieść pracę z słabszej maszyny, ale wprowadza opóźnienia sieciowe i wysyła do systemu zadanie w postaci audio lub tekstu. Używaj wyłącznie zaufanych hostów i sieci.
-
Udostępniaj lokalny runtime tylko wtedy, gdy inna zaufana instalacja Voice2Win go potrzebuje. Użyj hasła, pozwól na dostęp do portu przez zaporę tylko w zamierzonym profilu sieciowym i wyłącz udostępnianie, gdy nie jest już wymagane. Ostrzeżenia dotyczące podłączonych klientów i wersji pomagają zidentyfikować nieoczekiwanych lub niekompatybilnych klientów.
-
Rozmiar kontekstu (domyślnie 4096): Zwiększ go dla długiego wybranego tekstu, długich instrukcji lub transformacji wymagających szerszego kontekstu. Większy kontekst zużywa więcej pamięci i może działać wolniej. Nie poprawia automatycznie krótkich poprawek.
-
Maksymalna liczba tokenów (domyślnie 512): Zwiększ ją, gdy długie przeredagowania są obcinane. Zmniejsz ją, aby ograniczyć czas reakcji i zapobiec niespodziewanie długim odpowiedziom. Normalna korekta dyktowania rzadko wymaga bardzo dużej wartości.
-
Temperatura (domyślnie 0.2): Niskie wartości są bardziej powtarzalne i najlepiej sprawdzają się przy korekcie, formatowaniu i zachowaniu znaczenia. Zwiększaj ją tylko przy celowym, kreatywnym przepisywaniu; wyższe wartości mogą swobodniej zmieniać słownictwo lub fakty.
-
Minimalna długość transkrypcji dla ulepszenia AI (domyślnie 20 znaków): Obniż ją, gdy nawet bardzo krótkie frazy powinny być przetwarzane. Podnieś ją, aby uniknąć uruchamiania modelu/opóźnień i zaskakujących zmian dla mikroskopijnych danych wejściowych, takich jak „tak” lub imię.
-
Podpowiedź systemowa: Jest to stała instrukcja dla domyślnego ulepszania AI. Określ pożądany język, czy należy zachować znaczenie i ton, oraz że należy zwrócić tylko tekst końcowy. Testuj zmiany w podpowiedziach na tekstach niekrytycznych: zbyt ogólna podpowiedź może odpowiedzieć na dyktando, przetłumaczyć je lub dodać wyjaśnienia zamiast je poprawić.
-
Alternatywne przechowywanie modeli AI: Używaj szybkiego lokalnego dysku o odpowiedniej pojemności. Kopiowanie istniejących modeli zapobiega kolejnemu pobraniu; samo zmienienie folderu nie sprawia, że brakujący ani niekompatybilny model stanie się użyteczny.
Zobacz Modele AI i sprzęt oraz Ulepszenie AI.
-
Jakość modelu rozpoznawania mówcy: Preferuj model wyższej jakości, gdy ważne jest rozdzielenie podobnych głosów, a maszyna ma wystarczającą pamięć/wydajność. Używaj lżejszego modelu podczas długich sesji na ograniczonym sprzęcie. Pobranie modeli sprawia, że stają się one od razu dostępne do wyboru.
-
Czułość rozdzielania mówców: Zacznij od Domyślnej. Zwiększ ją, gdy dwa różne, ale podobne głosy są wielokrotnie łączone; kompromisem jest to, że zmienny głos jednej osoby, odległość lub kąt mikrofonu mogą sprawić, że zostaną wyodrębnieni dodatkowi mówcy. Zmniejsz ją, gdy jedna osoba jest wielokrotnie przedstawiana jako kilku mówców; kompromisem jest to, że naprawdę podobne głosy mogą zostać połączone.
-
Czułość wykrywania mowy: Zwiększ ją, gdy są transkrybowane kliknięcia, hałas w pomieszczeniu lub ciche fragmenty. Zmniejsz ją, gdy cichych mówców pomija się. Ta bramka decyduje, czy blok zostanie wysłany do transkrypcji; blok odrzucony agresywnie nie może zostać odzyskany przez bardziej dokładny model transkrypcji.
-
Przerwa końcowa (domyślnie 10 s, na stronie Nagrywania Rozmowy): Użyj krótszej przerwy, gdy sekcje powinny szybko się zamknąć po zakończeniu mówców. Użyj dłuższej przerwy dla przemyślanych dyskusji z długimi wahaniami; wyniki pojawią się później, ale jedna wypowiedź jest mniej prawdopodobna do podziału.
-
Oczekiwani rozmówcy (Automatycznie domyślnie, na stronie Nagrywania Konwersacji): Pozostaw Automatycznie, gdy uczestnicy mogą dołączać lub opuszczać spotkanie. Ustaw znaną liczbę uczestników dla spotkania stałego, gdy automatyczne grupowanie daje złą liczbę. Błędna stała liczba może zmusić niepowiązane głosy do połączenia lub podzielić jeden głos, aby spełnić wymaganą liczbę.
Rozdzielanie rozmówców jest probabilistyczne. Odległość mikrofonu, nakładanie się głosów, echa i zmieniający się szum tła mają znaczenie; ręczna korekta rozmówcy może być nadal konieczna. Zobacz Nagrywanie Konwersacji.
Ta sekcja tylko dla programistów konfiguruje osobny klient towarzyszący na komputerze, który strumieniuje mikrofon z innego komputera w tej samej sieci lokalnej.
-
Włącz usługę tylko wtedy, gdy potrzebne są mikrofony klienta. Wybierz kartę sieciową, która jest osiągalna z klienta; VPN i wirtualne karty często generują adres parowania, do którego drugi komputer nie może dotrzeć.
-
Zachowaj domyślny port, chyba że koliduje z inną usługą. Jeśli klient nie może się połączyć, sprawdź wybraną kartę, lokalną zaporę oraz czy oba systemy znajdują się w tej samej zaufanej sieci, zanim zmienisz losowe porty.
-
Traktuj URL/token parowania jako tajemnicę. Każdy, kto może dotrzeć do usługi i ma ważny token, może próbować się połączyć. Wygeneruj ponownie lub ponownie rozdystrybuuj URL po zmianie karty, adresu, portu lub tokenu.
-
Status połączonego klienta pokazuje, które klienty są dostępne i jakie mają możliwości. Dźwięk jest przesyłany z klienta wybranego jako urządzenie nagrywające; samo podłączenie klienta nie powoduje, że wszystkie podłączone mikrofony nagrywają jednocześnie.
-
Nie ma pośrednictwa w chmurze. Poprawia to prywatność, ale oznacza, że trasy, zapora sieciowa, tryb uśpienia i jakość Wi-Fi bezpośrednio wpływają na dostępność i opóźnienia.
Zobacz Companion Client.
- Odwzoruj problem w jednej docelowej aplikacji z wyłączonymi ulepszeniami AI i podglądem w czasie rzeczywistym.
- W przypadku błędnych słów, popraw poziom mikrofonu/hałas, wybierz stały język i przetestuj inny model transkrypcji zanim zmienisz ustawienia wstawiania tekstu.
- W przypadku poprawnego tekstu, który jest wstawiany niepoprawnie, najpierw zmień metodę wstawiania, potem skrót wklejania, a następnie zwiększ tylko odpowiednią opóźnienie.
- W przypadku braków cichej mowy, nieznacznie obniż czułość wykrywania mowy; w przypadku hałasu interpretowanego jako mowa, nieznacznie ją podnieś.
- Przy dużym obciążeniu, wyłącz tryb czasu rzeczywistego lub zwiększ jego interwał przeskoku zanim zmniejszysz ostateczną jakość transkrypcji.
- Przywróć ustawienia domyślne w danej sekcji, jeżeli kilka zmian utrudnia interpretację wyniku.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động