v2.5.39 — 一般 CPU 的日文 AI 字幕加速
v2.5.39 — 一般 CPU 的日文 AI 字幕加速
這一版新增預設的「自動(建議)」日文辨識模式,針對沒有獨立顯示卡的 Windows 電腦改善字幕產生時間,同時保留既有三種 Whisper 模式供手動選擇。
主要更新
- 新增本機 ReazonSpeech K2 v2+sherpa-onnx CPU 辨識引擎,不需獨立顯示卡,也不會上傳影音或語音。
- 「自動(建議)」成為新安裝與無效舊設定的預設;既有使用者已明確選擇的精準/平衡/快速模式不會被改掉。
- 自動模式的首次辨識包約 178 MiB,只在第一次實際產生字幕時下載。
- 僅在原生執行失敗、逾時、輸出損壞或時間軸結構無效時,才會下載並改用「平衡」Whisper;不會因主觀猜測文字品質而擅自切換。
- 沿用 Silero VAD、28 秒上下文視窗與原始時間軸映射;產生的日文、英文與繁中仍是獨立 SRT,不修改影片。
- 補強模型包逐檔大小與 SHA-256 驗證、精確檔案白名單、原子安裝、跨程序鎖、損壞復原、symlink/junction/reparse point 防護。
- 補強原生程序的總逾時、停滯逾時、取消、磁碟空間與嚴格 JSON/UTF-8/時間軸驗證。
CPU 實測
- 12 段公開日語測試音檔的小型比較中,ReazonSpeech 平均字元錯誤率為 7.24%;相同樣本的 Whisper small 為 17.95%,Whisper base 為 29.61%。
- 本次測試電腦為 Intel Core i7-11700;12 段測試總耗時約 6.1 秒。
- 官方 13.4 秒測試音檔的完整 VAD→辨識→SRT 流程產生 3 段字幕;暖機後約 4.2 秒。
- 20 次連續原生辨識測試後,父程序 private memory 僅增加約 0.2 MB、handle 未增加。
- 20 次本機日翻中 worker 長跑(共 40 個模型程序)後,private memory 僅增加約 68 KB、handle 數不變,沒有殘留暫存 worker。
以上是有限公開樣本與本機測試結果,不保證每台電腦或每種片源相同。低音量、多人重疊語音、強背景音樂與特殊聲音仍可能降低語意辨識品質。
相容性與下載
- 原有「精準」large-v3-turbo q5、「平衡」small q5、「快速」base q5 均保留。
- 繁中翻譯仍使用既有約 147 MiB 的 FuguMT+OPUS-MT 本機模型;日文字幕不會下載翻譯模型。
- 所有模型與翻譯都可在首次下載完成後離線重複使用。
驗證
- 538 項自動測試通過。
- ReazonSpeech pack 為固定來源 revision、可重現建置,並納入
SHA256SUMS.txt與 GitHub build provenance attestation。 - Windows 成品通過可見視窗、原生字幕、連續翻譯、Portable 結構與 Microsoft Defender 掃描後才發布。
模型與授權詳情請見 THIRD_PARTY_NOTICES.md;Windows 下載驗證方式請見 WINDOWS_SECURITY.md。