Skip to content

Italiano Real Time Transcription

Dan edited this page Aug 21, 2026 · 1 revision

Trascrizione in tempo reale

La trascrizione in tempo reale mostra il testo riconosciuto sotto l'indicatore di registrazione mentre la registrazione è ancora in corso. Abilitalo in Impostazioni → Trascrizione in tempo reale, quindi scegli esattamente una modalità.

Trascrizione in blocco

La trascrizione a blocchi riutilizza il modello principale Whisper o Parrocchetto selezionato. Durante la registrazione, trascrive finestre audio sovrapposte, unisce le parole riconosciute in base ai relativi timestamp e tratta il testo come stabile dopo che è rimasto coerente. Al termine della registrazione, Voice2Win aggiunge la coda mancante o esegue una trascrizione completa di fallback se vengono rilevate lacune.

Vantaggi:

  • Utilizza lo stesso modello di trascrizione principale e la stessa selezione della lingua della trascrizione finale.
  • Rende i dettati lunghi utilizzabili in anticipo senza caricare un riconoscitore di streaming separato.
  • Può eseguire ulteriori controlli spostati attorno ai limiti della frase per riparare i risultati dei blocchi precedenti.

Requisiti e compromessi:

  • Destinato all'accelerazione della scheda grafica e potrebbe non essere disponibile quando la trascrizione audio viene assegnata al processore principale.
  • Richiede memoria grafica sufficiente per il modello selezionato e il lavoro sovrapposto.
  • Finestre più frequenti o più grandi aumentano l'utilizzo del calcolo.

Blocca le impostazioni

Impostazione Predefinito Effetto
Dimensioni della finestra 10 secondi Durata massima dell'audio vista da un'esecuzione del modello principale. Le finestre più grandi aggiungono contesto ma richiedono più tempo.
Intervallo hop 3 secondi Tempo tra le nuove istantanee. I valori più piccoli si aggiornano più spesso e avviano più lavoro.
Sovrapposizione / contesto 20 secondi L'audio precedente era nuovamente incluso per il contesto e l'unione.
Ritardo di stabilità 6 secondi Per quanto tempo il nuovo testo deve rimanere invariato prima di diventare stabile.
Limite temporale durante il silenzio 1000 millisecondi Accetta il testo stabile in attesa dopo questo periodo senza che venga rilevato il parlato.
Ulteriori controlli sui limiti della frase 2 Controlli spostati extra per confine di frase; zero disabilita le corse extra.
Fattore di spostamento 20 per cento Controlla quanto vengono spostate le finestre delle frasi aggiuntive.

Utilizza Ripristina impostazioni predefinite se la regolazione manuale rende l'output più lento o meno stabile.

Trascrizione del flusso

La trascrizione del flusso esegue un riconoscimento online Sherpa-ONNX separato parallelamente alla registrazione. Produce frasi intermedie molto precoci, che il modello di trascrizione principale poi affina in gruppi sovrapposti.

Vantaggi:

  • Primi risultati provvisori visibili.
  • Può essere eseguito sul processore principale o, su Windows, con l'accelerazione della scheda grafica DirectML.

Compromessi:

  • Supporta solo le lingue per le quali esiste un modello di flusso nel catalogo corrente.
  • Il riconoscimento provvisorio grezzo può essere più approssimativo del risultato finale del modello principale.
  • Scarica e memorizza nella cache un modello aggiuntivo per ciascuna lingua o variante del modello selezionata.

Impostazioni dello streaming

  • Ambiente runtime: scegli il processore principale per la compatibilità o una scheda grafica Windows per la velocità.
  • Modello audio streaming: Più veloce riduce al minimo la latenza e il tempo di caricamento; Più accurato ma più lento spende più risorse di calcolo per la qualità del riconoscimento.
  • Numero di frasi perfezionate insieme: controlla la finestra di perfezionamento del modello principale sovrapposto da 1 a 8 frasi; il valore predefinito è 2.
  • Modelli audio in streaming caricati: elenca i modelli memorizzati nella cache e consente l'eliminazione. Un modello eliminato viene scaricato nuovamente quando necessario.

Impostazione visualizzazione condivisa

L'altezza massima del testo sotto l'indicatore di registrazione limita il testo in tempo reale al 10–90% dell'altezza dello schermo; il valore predefinito è 50%. Il testo più lungo rimane scorrevole e segue il risultato più recente finché non si scorre manualmente verso l'alto.

Quale modalità dovrei scegliere?

  • Scegli Blocca trascrizione quando desideri il comportamento del modello principale e disponi di prestazioni e memoria sufficienti della scheda grafica.
  • Scegli Trascrizione in streaming quando è importante il primo testo provvisorio possibile e la tua lingua è supportata.
  • Disabilita la trascrizione in tempo reale quando preferisci la pipeline più semplice e hai bisogno solo del risultato finale dopo la registrazione.
Languages
English

Features

Configuration

Help

Deutsch

Funktionen

Konfiguration

Hilfe

Español

Funciones

Configuración

Ayuda

Français

Fonctionnalités

Configuration

Aide

Português (Brasil)

Recursos

Configuração

Ajuda

Italiano

Funzionalità

Configurazione

Aiuto

Nederlands

Functies

Configuratie

Help

Polski

Funkcje

Konfiguracja

Pomoc

Svenska

Funktioner

Konfiguration

Hjälp

简体中文

功能

配置

帮助

日本語

機能

設定

ヘルプ

한국어

기능

구성

도움말

हिन्दी

सुविधाएँ

कॉन्फ़िगरेशन

सहायता

繁體中文

功能

設定

說明

Bahasa Indonesia

Fitur

Konfigurasi

Bantuan

Tiếng Việt

Tính năng

Cấu hình

Trợ giúp

ไทย

คุณสมบัติ

การกำหนดค่า

วิธีใช้

العربية

الميزات

الإعداد

المساعدة

Türkçe

Özellikler

Yapılandırma

Yardım

Русский

Возможности

Настройка

Справка

Українська

Функції

Налаштування

Довідка

Clone this wiki locally