-
Notifications
You must be signed in to change notification settings - Fork 0
Italiano AI Models and Hardware
Voice2Win separa tre tipi di lavoro modello. Comprendere la differenza rende molto più semplici le impostazioni del modello di intelligenza artificiale (AI) e dell'hardware.
| Carico di lavoro | Scopo | Tecnologia |
|---|---|---|
| Trascrizione principale | Dettatura normale, comandi vocali, trascrizione a blocchi e ritrascrizione | Sussurro o parrocchetto |
| Trascrizione del flusso | Risultati provvisori molto precoci durante la registrazione | Modello online Sherpa-ONNX separato |
| Miglioramento dell'intelligenza artificiale | Rivede o trasforma il testo | Modello Gemma integrato, Ollama, LM Studio o un'istanza Voice2Win condivisa |
Parakeet è un motore di trascrizione principale, non un modello di flusso.
OpenAI Whisper fornisce un ottimo riconoscimento offline in molte lingue. Utilizza più risorse ed è solitamente più lento del Parrocchetto. L'accelerazione della scheda grafica è consigliata per modelli di grandi dimensioni e trascrizione di blocchi in tempo reale.
NVIDIA Parakeet V3 è molto più efficiente e funziona bene con il processore principale. Potrebbe essere leggermente meno privo di errori di Whisper e supportare un set di lingue più piccolo. Selezionalo quando la velocità e il minor utilizzo delle risorse sono più importanti della massima copertura multilingue.
Le impostazioni Modelli AI mostrano solo i modelli appartenenti al motore selezionato. Utilizza Gestisci modelli per scaricare o rimuovere i file dei modelli. L'elenco dei modelli correnti della finestra principale seleziona quindi tra i modelli scaricati.
La tabella processore principale (CPU)/schede grafiche (GPU) e assegnazione del modello AI assegna la trascrizione audio e il miglioramento AI in modo indipendente.
- Il processore principale (CPU) è la scelta più compatibile ma potrebbe essere più lenta.
- Scheda grafica (GPU) accelera i carichi di lavoro supportati e mostra un avviso sulle prestazioni se è probabile che il carico di lavoro scelto sia lento o non abbia memoria grafica sufficiente.
- Ollama o LM Studio possono fornire il miglioramento dell'intelligenza artificiale da un server locale. Inserisci l'host e la porta, cerca la rete locale del protocollo Internet versione 4 (IPv4) se lo desideri, aggiorna l'elenco dei modelli e seleziona un modello segnalato.
- Istanza Voice2Win condivisa può fornire la trascrizione audio, il miglioramento dell'intelligenza artificiale o entrambi da un altro computer.
La modifica di un runtime ricarica il modello interessato in background e può richiedere del tempo.
- Whisper e il miglioramento AI integrato utilizzano l'accelerazione grafica Vulkan su Windows e Linux; macOS utilizza il suo percorso grafico nativo.
- La trascrizione del flusso di Parakeet e Windows utilizza DirectML per l'accelerazione grafica.
- Il processore principale rimane disponibile come fallback.
Voice2Win evita deliberatamente di raggruppare i runtime CUDA a causa delle dimensioni del pacchetto. Un driver grafico attuale con supporto Vulkan o DirectML è più importante dell'installazione separata di CUDA.
I modelli vocali e di intelligenza artificiale possono essere residenti contemporaneamente. Il loro requisito di memoria combinato è importante:
- Se la memoria grafica dedicata non è sufficiente, scegliere modelli più piccoli o maggiormente quantizzati.
- Assegna un carico di lavoro al processore principale e l'altro alla scheda grafica.
- Evitare di caricare un modello le cui stime di avviso superano la memoria disponibile del sistema o della grafica; un paging pesante può far sì che l'intero computer non risponda.
- Utilizzare la posizione di archiviazione alternativa del modello AI quando la limitazione è la capacità del disco, anziché la memoria.
Per impostazione predefinita, Ollama utilizza la porta 11434; Per impostazione predefinita, LM Studio utilizza la porta 1234. Voice2Win interroga l'elenco dei modelli del server selezionato e invia richieste di miglioramento solo a quel server configurato. La disponibilità del server, la privacy e il comportamento del modello sono responsabilità dell'installazione del server.
Un computer Voice2Win può esporre i modelli vocali e di intelligenza artificiale attualmente caricati ad altre istanze di Voice2Win:
- In Impostazioni → Modelli AI, abilitare la condivisione runtime.
- Scegli una porta e facoltativamente una password.
- Sull'altro computer, aggiungi un'istanza Voice2Win condivisa, inserisci il nome del computer o l'indirizzo IPv4, la porta e la password oppure cerca nella rete locale.
- Assegnare la trascrizione audio e/o il miglioramento AI alla riga remota.
I client connessi e le informazioni sull'ultimo utilizzo vengono visualizzati sul computer condiviso. Mantieni le versioni allineate; una mancata corrispondenza della versione può causare problemi di compatibilità. Un'istanza che utilizza essa stessa un runtime condiviso non può condividere quel runtime in seguito.
Questa funzionalità invia i dati del carico di lavoro attraverso la connessione di rete configurata. Utilizza una rete affidabile e una password quando altri utenti possono raggiungere la porta.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động