-
Notifications
You must be signed in to change notification settings - Fork 0
Italiano Real Time Transcription
La trascrizione in tempo reale mostra il testo riconosciuto sotto l'indicatore di registrazione mentre la registrazione è ancora in corso. Abilitalo in Impostazioni → Trascrizione in tempo reale, quindi scegli esattamente una modalità.
La trascrizione a blocchi riutilizza il modello principale Whisper o Parrocchetto selezionato. Durante la registrazione, trascrive finestre audio sovrapposte, unisce le parole riconosciute in base ai relativi timestamp e tratta il testo come stabile dopo che è rimasto coerente. Al termine della registrazione, Voice2Win aggiunge la coda mancante o esegue una trascrizione completa di fallback se vengono rilevate lacune.
Vantaggi:
- Utilizza lo stesso modello di trascrizione principale e la stessa selezione della lingua della trascrizione finale.
- Rende i dettati lunghi utilizzabili in anticipo senza caricare un riconoscitore di streaming separato.
- Può eseguire ulteriori controlli spostati attorno ai limiti della frase per riparare i risultati dei blocchi precedenti.
Requisiti e compromessi:
- Destinato all'accelerazione della scheda grafica e potrebbe non essere disponibile quando la trascrizione audio viene assegnata al processore principale.
- Richiede memoria grafica sufficiente per il modello selezionato e il lavoro sovrapposto.
- Finestre più frequenti o più grandi aumentano l'utilizzo del calcolo.
| Impostazione | Predefinito | Effetto |
|---|---|---|
| Dimensioni della finestra | 10 secondi | Durata massima dell'audio vista da un'esecuzione del modello principale. Le finestre più grandi aggiungono contesto ma richiedono più tempo. |
| Intervallo hop | 3 secondi | Tempo tra le nuove istantanee. I valori più piccoli si aggiornano più spesso e avviano più lavoro. |
| Sovrapposizione / contesto | 20 secondi | L'audio precedente era nuovamente incluso per il contesto e l'unione. |
| Ritardo di stabilità | 6 secondi | Per quanto tempo il nuovo testo deve rimanere invariato prima di diventare stabile. |
| Limite temporale durante il silenzio | 1000 millisecondi | Accetta il testo stabile in attesa dopo questo periodo senza che venga rilevato il parlato. |
| Ulteriori controlli sui limiti della frase | 2 | Controlli spostati extra per confine di frase; zero disabilita le corse extra. |
| Fattore di spostamento | 20 per cento | Controlla quanto vengono spostate le finestre delle frasi aggiuntive. |
Utilizza Ripristina impostazioni predefinite se la regolazione manuale rende l'output più lento o meno stabile.
La trascrizione del flusso esegue un riconoscimento online Sherpa-ONNX separato parallelamente alla registrazione. Produce frasi intermedie molto precoci, che il modello di trascrizione principale poi affina in gruppi sovrapposti.
Vantaggi:
- Primi risultati provvisori visibili.
- Può essere eseguito sul processore principale o, su Windows, con l'accelerazione della scheda grafica DirectML.
Compromessi:
- Supporta solo le lingue per le quali esiste un modello di flusso nel catalogo corrente.
- Il riconoscimento provvisorio grezzo può essere più approssimativo del risultato finale del modello principale.
- Scarica e memorizza nella cache un modello aggiuntivo per ciascuna lingua o variante del modello selezionata.
- Ambiente runtime: scegli il processore principale per la compatibilità o una scheda grafica Windows per la velocità.
- Modello audio streaming: Più veloce riduce al minimo la latenza e il tempo di caricamento; Più accurato ma più lento spende più risorse di calcolo per la qualità del riconoscimento.
- Numero di frasi perfezionate insieme: controlla la finestra di perfezionamento del modello principale sovrapposto da 1 a 8 frasi; il valore predefinito è 2.
- Modelli audio in streaming caricati: elenca i modelli memorizzati nella cache e consente l'eliminazione. Un modello eliminato viene scaricato nuovamente quando necessario.
L'altezza massima del testo sotto l'indicatore di registrazione limita il testo in tempo reale al 10–90% dell'altezza dello schermo; il valore predefinito è 50%. Il testo più lungo rimane scorrevole e segue il risultato più recente finché non si scorre manualmente verso l'alto.
- Scegli Blocca trascrizione quando desideri il comportamento del modello principale e disponi di prestazioni e memoria sufficienti della scheda grafica.
- Scegli Trascrizione in streaming quando è importante il primo testo provvisorio possibile e la tua lingua è supportata.
- Disabilita la trascrizione in tempo reale quando preferisci la pipeline più semplice e hai bisogno solo del risultato finale dopo la registrazione.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động