-
Notifications
You must be signed in to change notification settings - Fork 0
Polski AI Models and Hardware
Voice2Win rozróżnia trzy rodzaje pracy z modelami. Zrozumienie różnicy znacznie ułatwia model sztucznej inteligencji (AI) i ustawienia sprzętu.
| Obciążenie pracą | Cel | Technologia |
|---|---|---|
| Główna transkrypcja | Normalne dyktowanie, polecenia głosowe, transkrypcja blokowa i retranskrypcja | Szept lub papuga |
| Transkrypcja strumieniowa | Bardzo wczesne wyniki pośrednie w trakcie nagrywania | Oddzielny model online Sherpa-ONNX |
| Ulepszenie AI | Poprawia lub przekształca tekst | Wbudowany model Gemma, Ollama, LM Studio lub współdzielona instancja Voice2Win |
Parakeet to główny silnik transkrypcji, a nie model strumieniowy.
OpenAI Whisper zapewnia bardzo dobre rozpoznawanie offline w wielu językach. Zużywa więcej zasobów i jest zwykle wolniejszy niż Parakeet. Przyspieszenie karty graficznej jest zalecane w przypadku dużych modeli i transkrypcji bloków w czasie rzeczywistym.
NVIDIA Parakeet V3 jest znacznie wydajniejsza i dobrze radzi sobie na głównym procesorze. Może być nieco mniej wolny od błędów niż Whisper i obsługuje mniejszy zestaw języków. Wybierz tę opcję, gdy szybkość i mniejsze wykorzystanie zasobów są ważniejsze niż maksymalny zasięg wielojęzyczny.
Ustawienia Modele AI pokazują tylko modele należące do wybranego silnika. Użyj Zarządzaj modelami, aby pobrać lub usunąć pliki modeli. Następnie na liście Bieżący model w oknie głównym zostaną wybrane spośród pobranych modeli.
Tabela główny procesor (CPU) / karty graficzne (GPU) i przypisanie modelu AI przypisuje niezależnie transkrypcję audio i ulepszenie AI.
- Główny procesor (CPU) to najbardziej zgodny wybór, ale może być wolniejszy.
- Karta graficzna (GPU) przyspiesza obsługiwane obciążenia i wyświetla ostrzeżenie o wydajności, jeśli wybrane obciążenie będzie prawdopodobnie wolne lub będzie brakowało mu wystarczającej ilości pamięci graficznej.
- Ollama lub LM Studio mogą zapewnić ulepszenie AI z lokalnego serwera. Wprowadź hosta i port, w razie potrzeby przeszukaj lokalną sieć protokołu internetowego w wersji 4 (IPv4), odśwież listę modeli i wybierz raportowany model.
- Współdzielona instancja Voice2Win może zapewnić transkrypcję dźwięku, ulepszenie AI lub jedno i drugie z innego komputera.
Zmiana środowiska wykonawczego powoduje ponowne załadowanie odpowiedniego modelu w tle i może zająć trochę czasu.
- Szept i wbudowane ulepszenie AI wykorzystują akcelerację grafiki Vulkan w systemach Windows i Linux; macOS korzysta ze swojej natywnej ścieżki graficznej.
- Transkrypcja strumieni Parakeet i Windows wykorzystuje DirectML do przyspieszania grafiki.
- Główny procesor pozostaje dostępny jako rezerwowy.
Voice2Win celowo unika łączenia środowisk wykonawczych CUDA ze względu na rozmiar ich pakietu. Aktualny sterownik graficzny obsługujący Vulkan lub DirectML jest ważniejszy niż osobna instalacja CUDA.
Modele mowy i sztucznej inteligencji mogą być rezydentne w tym samym czasie. Ich łączne zapotrzebowanie na pamięć ma znaczenie:
- Jeśli dedykowana pamięć graficzna jest niewystarczająca, wybierz mniejsze lub silniej skwantowane modele.
- Przypisz jedno obciążenie do głównego procesora, a drugie do karty graficznej.
- Unikaj ładowania modelu, którego szacunki ostrzegawcze przekraczają dostępną pamięć systemową lub graficzną; intensywne stronicowanie może spowodować, że cały komputer przestanie odpowiadać.
- Użyj alternatywnej lokalizacji przechowywania opartej na modelu AI, gdy ograniczeniem jest pojemność dysku, a nie pamięć.
Ollama domyślnie wybiera port 11434; LM Studio domyślnie korzysta z portu 1234. Voice2Win wysyła zapytania do listy modeli wybranego serwera i wysyła monity o ulepszenia tylko do tego skonfigurowanego serwera. Za dostępność serwera, prywatność i modelowe zachowanie odpowiada instalacja tego serwera.
Jeden komputer Voice2Win może udostępnić aktualnie załadowane modele mowy i sztucznej inteligencji innym instancjom Voice2Win:
- W Ustawienia → Modele AI włącz udostępnianie środowiska wykonawczego.
- Wybierz port i opcjonalnie hasło.
- Na drugim komputerze dodaj udostępnioną instancję Voice2Win, wprowadź jej nazwę komputera lub adres IPv4, port i hasło albo wyszukaj sieć lokalną.
- Przypisz transkrypcję audio i/lub ulepszenie AI do zdalnego wiersza.
Połączeni klienci i informacje o ostatnim użyciu są wyświetlane na komputerze udostępniającym. Zachowaj wyrównanie wersji; niezgodność wersji może powodować problemy ze zgodnością. Instancja, która sama zużywa współdzielone środowisko wykonawcze, nie może dalej udostępniać tego środowiska wykonawczego.
Ta funkcja wysyła dane o obciążeniu przez skonfigurowane połączenie sieciowe. Użyj zaufanej sieci i hasła, gdy inni użytkownicy będą mogli uzyskać dostęp do portu.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động