-
Notifications
You must be signed in to change notification settings - Fork 0
Chinese Traditional Real Time Transcription
Dan edited this page Aug 21, 2026
·
1 revision
即時轉錄會在錄音指示器下方顯示已識別的文字,錄音仍在進行中時即可看到。在 設定 → 即時轉錄 中啟用,然後選擇一個模式。
區塊轉錄會重複使用所選的主要 Whisper 或 Parakeet 模型。在錄音期間,它會轉錄重疊的音訊視窗,依時間戳合併識別的文字,並在文字保持一致後視為穩定。錄音結束時,如果檢測到間隙,Voice2Win 會補上缺失的尾端或執行完整的備用轉錄。
優點:
- 使用與最終轉錄相同的主要轉錄模型和語言選擇。
- 使長時間口述能更早使用,無需加載單獨的串流識別器。
- 可以在句子邊界周圍運行額外的偏移檢查,以修復先前的區塊結果。
需求與取捨:
- 旨在使用顯示卡加速,當音訊轉錄指定給主處理器時可能無法使用。
- 需要足夠的顯示記憶體來支援所選模型及重疊工作。
- 更頻繁或更大的窗口會增加計算使用量。
| 設定 | 預設值 | 影響 |
|---|---|---|
| 視窗大小 | 10 秒 | 一次主模型運行可看到的最大音訊長度。較大的視窗增加上下文,但耗時較長。 |
| 跳躍間隔 | 3 秒 | 生成新快照的時間間隔。數值越小,更新越頻繁,工作量越大。 |
| 重疊 / 上下文 | 20 秒 | 為了上下文和合併,再次包含之前的音訊。 |
| 穩定延遲 | 6 秒 | 新文字在變為穩定之前必須保持不變的時間。 |
| 靜默時的時間限制 | 1000 毫秒 | 在此期間未檢測到語音時,接受待定的穩定文字。 |
| 額外句子邊界檢查 | 2 | 每個句子邊界額外進行的偏移檢查次數;設為零則禁用額外運行。 |
| 偏移因子 | 20% | 控制額外句子視窗的偏移程度。 |
如果手動調整使輸出變慢或不穩定,請使用 恢復預設值。
串流轉錄會在錄音的同時平行運行一個獨立的 Sherpa-ONNX 在線識別器。它會生成非常早期的初步句子,然後主要的轉錄模型會以重疊的方式進行精煉。
優勢:
- 最早可見的初步結果。
- 可以在主處理器上運行,或者在 Windows 上使用 DirectML 顯卡加速。
取捨:
- 僅支援當前目錄中存在串流模型的語言。
- 原始的初步識別結果可能比最終的主模型結果粗糙。
- 為每個選定的語言或模型變體下載並緩存額外的模型。
- 運行環境 — 選擇主要處理器以獲得兼容性,或選擇 Windows 顯示卡以提升速度。
- 串流音訊模型 — 更快 可減少延遲和加載時間;更準確但較慢 則花更多計算資源以提高識別品質。
- 同時精煉的句子數量 — 控制重疊的主模型精煉窗口,範圍為 1 到 8 句;預設值為 2。
- 已加載的串流音訊模型 — 列出快取模型並允許刪除。刪除的模型在需要時會再次下載。
錄音指示器下方的最大文字高度 限制即時文字佔螢幕高度的 10–90%;預設值為 50%。較長的文字仍可滾動,並跟隨最新結果,直到你手動向上滾動。
- 當您希望使用主要模型的行為,且擁有足夠的顯示卡性能和記憶體時,選擇 區塊轉錄。
- 當最早的臨時文字很重要,且您的語言受到支援時,選擇 串流轉錄。
- 當您偏好最簡單的流程,且只需要錄音後的最終結果時,請停用即時轉錄。
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động