Skip to content

v2.5.39 — 一般 CPU 的日文 AI 字幕加速

Choose a tag to compare

@Alos21750 Alos21750 released this 30 Jul 10:52

v2.5.39 — 一般 CPU 的日文 AI 字幕加速

這一版新增預設的「自動(建議)」日文辨識模式,針對沒有獨立顯示卡的 Windows 電腦改善字幕產生時間,同時保留既有三種 Whisper 模式供手動選擇。

主要更新

  • 新增本機 ReazonSpeech K2 v2+sherpa-onnx CPU 辨識引擎,不需獨立顯示卡,也不會上傳影音或語音。
  • 「自動(建議)」成為新安裝與無效舊設定的預設;既有使用者已明確選擇的精準/平衡/快速模式不會被改掉。
  • 自動模式的首次辨識包約 178 MiB,只在第一次實際產生字幕時下載。
  • 僅在原生執行失敗、逾時、輸出損壞或時間軸結構無效時,才會下載並改用「平衡」Whisper;不會因主觀猜測文字品質而擅自切換。
  • 沿用 Silero VAD、28 秒上下文視窗與原始時間軸映射;產生的日文、英文與繁中仍是獨立 SRT,不修改影片。
  • 補強模型包逐檔大小與 SHA-256 驗證、精確檔案白名單、原子安裝、跨程序鎖、損壞復原、symlink/junction/reparse point 防護。
  • 補強原生程序的總逾時、停滯逾時、取消、磁碟空間與嚴格 JSON/UTF-8/時間軸驗證。

CPU 實測

  • 12 段公開日語測試音檔的小型比較中,ReazonSpeech 平均字元錯誤率為 7.24%;相同樣本的 Whisper small 為 17.95%,Whisper base 為 29.61%。
  • 本次測試電腦為 Intel Core i7-11700;12 段測試總耗時約 6.1 秒。
  • 官方 13.4 秒測試音檔的完整 VAD→辨識→SRT 流程產生 3 段字幕;暖機後約 4.2 秒。
  • 20 次連續原生辨識測試後,父程序 private memory 僅增加約 0.2 MB、handle 未增加。
  • 20 次本機日翻中 worker 長跑(共 40 個模型程序)後,private memory 僅增加約 68 KB、handle 數不變,沒有殘留暫存 worker。

以上是有限公開樣本與本機測試結果,不保證每台電腦或每種片源相同。低音量、多人重疊語音、強背景音樂與特殊聲音仍可能降低語意辨識品質。

相容性與下載

  • 原有「精準」large-v3-turbo q5、「平衡」small q5、「快速」base q5 均保留。
  • 繁中翻譯仍使用既有約 147 MiB 的 FuguMT+OPUS-MT 本機模型;日文字幕不會下載翻譯模型。
  • 所有模型與翻譯都可在首次下載完成後離線重複使用。

驗證

  • 538 項自動測試通過。
  • ReazonSpeech pack 為固定來源 revision、可重現建置,並納入 SHA256SUMS.txt 與 GitHub build provenance attestation。
  • Windows 成品通過可見視窗、原生字幕、連續翻譯、Portable 結構與 Microsoft Defender 掃描後才發布。

模型與授權詳情請見 THIRD_PARTY_NOTICES.md;Windows 下載驗證方式請見 WINDOWS_SECURITY.md