-
Notifications
You must be signed in to change notification settings - Fork 0
Chinese Traditional Settings Reference
點擊齒輪按鈕打開 設定。確定 保存更改;取消 放棄更改。影響模型、運行環境、儲存位置或網路服務的更改可能需要一些時間才能生效,並可能重新載入某個元件。
此參考資料旨在作為調整指南,而不僅僅是控制項列表。對於大多數本地 Windows 安裝,預設值是很好的起點。每次更改一個相關設定,在實際使用語音輸入的應用程式中測試,並保留先前的值,直到結果明顯更好為止。
| 目標 | 推薦起點 |
|---|---|
| 日常可靠的口述功能 | 固定轉錄語言、剪貼簿插入、啟用剪貼板還原、預設延遲、啟用音訊正規化 |
| 口述至終端機或遠端桌面 | 如果無法使用剪貼板轉發,請先試試 Unicode。否則就保留 Clipboard,並選擇遠端目標接受的貼上捷徑。對於只可靠回應物理金鑰類輸入的應用程式,請使用掃描碼。 |
| 長文件 | 固定語言、口語標點符號、連鎖格式、鎖定或混合快捷鍵模式、儲存的 WAV 錄音 |
| 簡短搜尋欄位、聊天與指令 | 移除拖延時間;可選擇使用小寫首字母格式;長按快捷鍵模式可避免不小心將錄影保持為有效 |
| 安靜或注重隱私的使用 | 禁用已保存的 WAV 錄音,檢視轉錄保存政策,如果擔心剪貼簿監控應用程式則禁用剪貼簿插入,並避免使用遠端運行環境 | | 最低感知延遲 | 除非有用,否則禁用即時預覽,使用快速的本地轉錄模型/運行環境,保持插入延遲低,且在插入前不要收集 AI 輸出 |
- 轉錄語言:選擇你最常使用的語言。固定語言通常比 自動 開啟得更快,也更可靠,特別是對於短錄音、名字以及相似發音的詞語。僅在你確實在不同錄音間切換語言時使用自動檢測;語言檢測在短語中證據不足,可能會選錯。
- 自訂專業術語和名稱:添加不常見的名稱、產品術語、縮寫,以及你希望 Whisper 偏好的拼寫。保持列表專注:它能指導辨識,但並非保證的搜尋替換規則,而過多的普通詞語可能引入不必要的偏差。此指引針對 Whisper;其他轉錄引擎可能不會以相同方式使用。
最佳的插入方法取決於目標應用程式。請在你使用的最困難程式中測試,而不僅僅是在簡單的編輯器中。
-
剪貼簿:在 Windows 上通常是最通用的選擇,也是處理長文本、特殊字符和複雜 Unicode 時最快的方法。Voice2Win 會暫時替換剪貼簿,發送貼上指令,並可以恢復之前的內容。剪貼簿管理器或其他應用程式可能會看到這段暫時的文字,而且在遠端會話中可能會禁用剪貼簿轉發。
-
Unicode:與鍵盤佈局無關,是遠端會話、非 Windows 系統以及包含當前鍵盤佈局中沒有的字符的文本的良好首選。有些遊戲、終端、舊應用程式以及提升權限的視窗無法可靠地接受模擬的 Unicode。
-
掃描碼:行為最接近實體鍵盤輸入,對較舊或不常見的目標應用程式尤其有用。它依賴於當前的鍵盤配置;如果某個字符在該配置中沒有對應的按鍵,可能會缺失或出錯。對於長文本,通常比一次性剪貼簿貼上要慢。
-
鍵盤模擬延遲 (0–50 毫秒):除非 Unicode 或掃描碼插入出現字符丟失或順序錯亂,否則保持較低。對於速度較慢的應用程式、虛擬機或遠端桌面,可逐步增加。此設定僅會減慢模擬按鍵速度;不會改善語音識別。
-
對問題目標應用程式使用剪貼簿:在使用 Unicode 或掃描碼時保持此功能啟用,除非禁止使用剪貼簿。Voice2Win 對於已知不太接受模擬輸入的應用程式可以退回使用剪貼簿。僅在出於剪貼簿隱私或剪貼簿轉發的原因故意選擇鍵盤模擬時才禁用它。
-
插入前的等待時間(0–2000 毫秒,預設 40 毫秒):設定新剪貼簿內容在貼上快捷鍵被發送前可用的時間。當目標偶爾貼上先前的剪貼簿內容或根本沒有貼上時,尤其是在透過遠端剪貼簿同步時,請增加此值。較大的值會對每次插入增加相同的延遲。
-
貼上鍵組合:在一般 Windows 應用程式中使用 Ctrl+V。當終端機、遠端桌面或 AI 工具將 Ctrl+V 視為非純文字貼上時,嘗試 Ctrl+Shift+V 或 Shift+Insert。選擇最終目標預期的快捷鍵,而不一定是本地遠端桌面窗口的快捷鍵。
-
在 AI 增強過程中收集文字並一次性插入:當漸進式 AI 輸出移動游標、觸發格式或自動完成,或創建多個撤銷步驟時,啟用此功能。如果您更在意盡早看到結果,請禁用此功能;收集會等到 AI 結果完成後才插入任何內容。
-
還原先前剪貼簿:一般工作時保持啟用,這樣 Voice2Win 不會破壞您在語音輸入前複製的內容。僅在您故意希望語音輸入結果保留在剪貼簿或特定目標在粘貼快捷鍵返回後讀取剪貼簿時才禁用此功能。
-
恢復前的等待時間 (0–2000 毫秒,預設 120 毫秒):當目標插入的內容為空或僅部分文本時增加此值,因為先前的剪貼簿內容恢復得太快。僅將其設定為所需的最小值:在此期間,口述的文字仍然可供支援剪貼簿的應用程式使用。
這些選項會在插入前修改識別的文字。當你的口述遵循一致的模式時,它們最為有用。
-
口語標點:在希望將“逗號”、“問號”或其語言特定的等價詞轉換為標點符號的較長文章中啟用它。當這些詞可能是字面內容,或當你更喜歡轉錄模型自動添加標點時,請關閉它。
-
移除尾隨句號:對於搜索欄、聊天訊息、表單欄位、檔案名稱和語音指令等自動添加的最後句號不需要的情況非常有用。在文件和電子郵件中的完整句子中請關閉它。
-
小寫首字母:當口述內容通常插入到現有句子的中間時非常有用。對於新句子、標題、名稱以及獨立訊息請關閉它。
-
在同一應用程式中連接連續語音輸入:當你將多個錄音合併成一個段落時啟用此功能;Voice2Win 可以維持它們之間的間隔和句子上下文。當連續的錄音通常輸入到不同欄位時,或你經常手動移動插入點於語音輸入之間時,請停用此功能。
-
語音偵測靈敏度(0–100,預設 35%):較低的數值可以接受較小聲的語音,但也可能將呼吸聲、點擊聲或背景噪音誤判為語音。較高的數值能更積極地過濾噪音,但可能會拒絕輕聲或單詞的結尾。建議從預設值開始,並在觀察輸入音量的情況下逐步調整;將麥克風靠近通常比使用極端數值更有效。
-
清理錄音起始(0–500 毫秒,預設 250 毫秒):抑制熱鍵點擊聲、操作噪音及開頭的靜音。若錄音前段有按鍵點擊聲,建議增加此數值;若首音節被截斷或在按下熱鍵後立即輸入非常短的單詞,則建議減少此數值。
-
正規化錄音(預設開啟,目標 85%):建議對普通麥克風和說話距離變化使用,因為它能向模型呈現較一致的音量水平。對於已經正規化的錄音室或虛擬輸入,或當正規化明顯提高恆定背景噪音時,請將其關閉。目標值並不是麥克風增益控制,也無法恢復失真的音頻。
-
保存 WAV 錄音(預設開啟):當你需要回放、重新轉錄、比較品質或作為診斷證據時保持啟用。當存儲空間或保密性更重要時可關閉。音頻通常比文字佔用更多空間。
-
刪除已保存的 WAV 錄音:在保留轉錄文字的同時刪除已存儲的音頻。確認不再需要回放或重新轉錄後再使用;刪除操作無法恢復原始音頻。
- 按住:錄音僅在按住快捷鍵時進行。最適合短而頻繁的口述,也是避免意外背景錄音時最安全的模式。
- 鎖定:按一次開始,按一次停止。最適合長篇內容、輔助功能使用或免持講話,但需要有意識地停止。
- 混合 / 雙擊:按住以進行短錄音,或雙擊以鎖定。這是對混合工作最靈活的預設。如果有時雙擊意外導致錄音持續,請使用按住模式。
-
為 語音轉文字 與 語音指令 分別指定快捷鍵。建議使用尚未被操作系統、鍵盤驅動程式、遠端桌面或目標應用程式使用的組合。重複的 Voice2Win 快捷鍵會被拒絕。
-
在 Windows 上,Voice2Win 通常無法注入高權限運行的應用程式。僅在確實需要對高權限應用程式進行語音輸入時才以提升權限執行 Voice2Win;全域提升的輸入權限將增加任何應用程式或設定錯誤的影響。
-
按下快捷鍵時靜音全域音訊輸出 對使用喇叭時很有用,因為系統音訊不會回饋到麥克風。在使用耳機或錄音期間需要聽會議或媒體來源時請將其關閉。
-
分開的 啟動和停止信號 使在指示燈不可見時仍能清楚辨識鎖存/混合狀態。使用揚聲器時保持聲音短促且安靜,以免麥克風捕捉到。調整持續時間或音量以增加無障礙性,而不是為了解決不可靠的快捷鍵偵測。
- 介面語言 只會更改選單和標籤;不會選擇轉錄語言。
- 深色主題 是視覺偏好,並不影響識別或效能。
- 指示器樣式:簡單的等級顯示干擾最小;波形或條狀顯示便於判斷語音活動;光譜樣式顯示更多細節,但視覺上較為繁雜。選擇有助於確認麥克風活動且不遮蓋目標應用程式的樣式。
- 配色方案、位置和大小:使用高對比度方案並放置於遠離工具列、標題和文字插入點的位置。較大的指示器有助於可及性和即時文字;當只關心錄音狀態時,較小的指示器更合適。
-
自動啟動已停用 適合偶爾使用 Voice2Win 的情況。登錄檔自動啟動 是 Windows 登入後啟動的常規選擇。工作排程器 在需要啟動順序或以提升的權限執行時很有用。在 Linux 上,應用程式使用每個使用者桌面的自動啟動機制。
-
使用工作排程器以提升權限執行 除非必須對管理員應用程式進行語音輸入,否則應保持關閉。提升權限不是性能選項;它會改變全域鍵盤存取的安全邊界。
-
顯示自動啟動確認對話框 在驗證新的自動啟動設置或共用電腦時很有用。只有在啟動設定可靠並應該無人值守時才停用它。
-
顯示啟動畫面 在模型/執行時初始化需要明顯時間時有幫助。若希望啟動過程更安靜(托盤式啟動),可將其停用。
-
準備完成音效 確認啟動和模型準備已完成,特別是當 Voice2Win 以最小化方式啟動時。在安靜環境中請禁用;只需將持續時間和音量調整到足以識別即可。
-
關閉時最小化(預設開啟) 可在關閉主視窗後保持全域快捷鍵可用。當希望按下視窗關閉按鈕即退出應用程式時,請禁用此選項。
-
自動檢查更新(預設開啟) 建議開啟以獲取修正、模型/運行時相容性和安全性更新。僅在刻意管理或離線安裝時禁用,並改為手動檢查。
-
禁用每週資訊對話框 可隱藏在您不再需要後反覆出現的資訊通知;它不會禁用功能性或錯誤訊息。
-
Linux 輸入自動化狀態 是診斷資訊。支援 X11 相容的輸入自動化;純 Wayland 會話可能會限制全域快捷鍵和文字注入。如果無法使用,請使用 X11 會話或桌面環境提供的相容模式。
-
轉錄存儲路徑:選擇可靠的本地資料夾。對於敏感的口述內容,使用加密位置,並確保備份/同步軟體不會與仍在寫入的文件發生衝突。網速慢或間歇性可用的網路磁碟可能會延遲歷史操作。
-
刪除舊轉錄 / 最長保存時間:當隱私政策或磁碟使用量重要時,啟用自動保留。選擇一個仍符合你實際校正和重轉錄窗口的保存時間。已保存的 WAV 文件通常是歷史記錄中最大的部分。
-
模型存儲路徑:建議使用速度快、空間充足的本地 SSD。可移動磁碟和網路磁碟會降低模型加載的可靠性,並且可能使斷開連接的磁碟看起來像模型缺失。
-
使用自訂資料根目錄 / 移動所有應用程式資料:適用於可攜設置、受控備份,或將大量資料保留在系統磁碟外。選擇具有適當權限和可用空間的資料夾,然後在系統要求時重新啟動。此操作會重新定位本地資料;不會自動加密或上傳資料。
即時轉錄是在你仍然講話時的預覽。正常的最終轉錄結果仍為權威結果。當預覽沒有用時,請保持即時模式關閉:這可最小化資源使用並避免螢幕上的初步文字改變。
- 區塊 會反覆在重疊音訊上運行主要的 Whisper 轉錄模型。當你希望預覽結果接近最終 Whisper 結果,且擁有支援且記憶體足夠的 GPU 時,選擇它。它提供更多上下文,但會產生大量重複的 GPU 運算。
- 串流 使用獨立的 Sherpa-ONNX 串流模型。當你需要最早的增量回饋或區塊模式不可用時,選擇它。它的預覽可能較粗糙,且僅支援設定中列出的語言;最終的正常轉錄結果仍可能不同。
- 最大顯示高度 限制預覽可佔用螢幕的範圍。長篇可及性使用時可增加;當指示器遮住目標應用程式時可減少。它不會改變辨識品質。
預設值是平衡且相互依賴的。在排除故障前先還原它們,並且一次只更改一個參數。
-
視窗大小(預設 10 秒):當句子上下文不足或長語句在快照之間變化過大時,請增加它。較大的視窗需要更長的時間並使用更多計算/記憶體。若硬體能力允許且希望單次更新更快,可以減小它,但接受較少的上下文。
-
跳步間隔(預設 3 秒):若想要更頻繁的預覽更新,請減小它;當 GPU 負載過高時,請增加它。較小的跳步會啟動更多的轉錄運行,但不會使每次運行更快。
-
重疊 / 上下文(預設 20 秒):當區塊邊界的單詞重複、遺漏或合併不佳時,請增加它。減少它可以降低重複工作。重疊過少會移除調和相鄰快照所需的證據。
-
穩定延遲(預設 6 秒):當文字太早確定,而後續語境本可以修正它們時,請增加此值。當穩定文字出現太慢,且接受更多修正時,請減少此值。
-
靜默時間限制(預設 1000 毫秒):當文字應在暫停後快速穩定時,請減少此值。當自然的遲疑拆分或過早完成思維時,請增加此值。
-
額外的句子邊界檢查(預設 2):僅在句子轉換反覆出錯且 GPU 預留空間充足時增加。每次額外的移位轉錄都需時間。設為 0 可禁用額外運行;核心邊界檢查仍然保留。
-
位移因子(預設 20%):控制附加驗證視窗相對於視窗大小的移動距離。當檢查邊界周圍較廣的區域有幫助時,可增加此值;當附近的上下文足夠時,則減少它。此值僅在進行附加檢查時才有意義。
- 運行時:CPU 提供最廣泛的相容性。DirectML 可以在受支援的 Windows GPU 上降低延遲,但會使用可能也需要主模型的 GPU 資源。
- 模型變體:若要低延遲和較低資源使用量,選擇 Fast。若預覽品質比速度更重要,選擇 Accurate。
- 句子精煉視窗(1–8,預設值 2):值為 1 可快速完成句子。較大的值可以保留更多句子上下文以進行精煉,但會延遲定稿並增加工作量。預設值是一個實用的平衡。
- 快取模型:刪除未使用的快取模型可釋放磁碟空間。如果稍後再次選擇該語言/運行時/模型組合,必須重新下載才能準備好預覽。
請參見 即時轉錄 以獲取完整的工作流程和可用性要求。
- Whisper 是廣泛語言支持和已建立模型版本的一般選擇。當 Parakeet 支持的語言和可用硬體符合您的使用情境時,它可能具吸引力。請根據您的實際錄音選擇;星級評分和速度估計僅供參考,不能替代對您的麥克風、語言和詞彙的測試。
- 較大或較高品質的模型通常需要更多記憶體和時間,但可以改善處理困難音訊的效果。從可靠且足夠準確的小模型開始。造成記憶體壓力或長等待隊列的模型,可能不如稍小但能穩定完成的模型實用。
- 模型管理器用於下載和刪除本地模型檔案。請勿刪除仍被選擇的引擎或離線工作流程需要的模型。
-
獨立分配 音頻轉錄 和 AI 增強。對於反覆進行的本地工作,GPU 通常是最佳選擇;CPU 則是兼容性後備,但速度可能慢很多。將兩個任務分配到不同設備可以在同時使用時避免 GPU 記憶體競爭。
-
對於 Ollama 或 LM Studio,選擇伺服器類型、地址、端口和已載入的模型。僅在可信網絡上使用探索功能,並確認所選模型確實可在伺服器上使用。
-
遠程 AI 伺服器 或另一台 Voice2Win 電腦可以將工作從較弱的設備移走,但會引入網絡延遲,並將任務的音頻或文本發送到該系統。僅使用可信的主機和網絡。
-
僅在另一個受信任的 Voice2Win 安裝需要時共享本地執行環境。使用密碼,只允許在指定的網路設定下開放防火牆端口,並在不再需要時停用共享。連線客戶端和版本警告有助於識別意外或不相容的客戶端。
-
上下文大小(預設 4096):對於長選取文字、長指令或需要更多周邊上下文的轉換,請增加此值。較大的上下文會消耗更多記憶體,且可能較慢。它不會自動改善短文修正。
-
最大代幣數(預設 512):當長重寫被截斷時請增加此值。減少它可限制回應時間並防止意外的長輸出。一般的口述校正很少需要非常大的值。
-
溫度(預設 0.2):低值更具可重複性,最適合用於修正、格式化和保持意義。僅在刻意創意重寫時提高;較高值可以更自由地改變用詞或事實。
-
AI 增強的最小轉錄長度(預設 20 個字元):當即使是非常短的片語也需要處理時,可將其調低。為避免模型啟動/延遲以及對像「是」或名字等微小輸入出現意外重寫,可將其調高。
-
系統提示:這是 AI 增強的常規指令。說明所需語言、是否必須保留意思和語氣,以及只返回最終文本。在非關鍵文本上測試提示變更:過於籠統的提示可能會回答聽寫、翻譯或添加解釋,而非進行校正。
-
替代 AI 模型存儲:使用具有足夠空間的快速本地硬碟。複製現有模型可避免重新下載;僅更改資料夾無法使缺失或不兼容的模型可用。
-
說話人識別模型品質:當分離相似聲音很重要且機器具備足夠的記憶體/性能時,請優先使用高品質模型。在硬體有限的長時間會議中,使用輕量模型。已下載的模型可立即選擇。
-
說話人分離敏感度:從 預設 開始。當兩個不同但相似的聲音反覆被合併時,請增加敏感度;這樣的權衡是,一個人聲音變化、距離或麥克風角度可能被分割為額外的說話人。當一個人反覆顯示為多個說話人時,請降低敏感度;這樣的權衡是,真正相似的聲音可能會被合併。
-
語音檢測靈敏度:當點擊聲、環境噪音或靜音段被轉錄時,增加靈敏度。當安靜的講者被遺漏時,降低靈敏度。此閘門決定是否將段落送去轉錄;被積極拒絕的段落無法通過更精確的轉錄模型恢復。
-
完成暫停(預設 10 秒,在對話錄音頁面上):當段落應在講者停止後迅速結束時,使用較短的暫停。對於長時間停頓的深入討論,使用較長的暫停;結果會稍晚出現,但一個貢獻被拆分的可能性較小。
-
預期講者(預設為自動,在對話錄音頁面上):當參與者可以加入或離開時,請保持 自動。當自動分群產生錯誤數量時,針對固定會議設定已知的講者數量。錯誤的固定數量可能會將無關的聲音合併在一起,或將單一聲音拆分以符合所要求的數量。
講者分離是概率性的。麥克風距離、重疊、迴聲和背景噪音變化都會影響結果;手動校正講者仍可能是必要的。詳見 對話錄音。
此僅限開發者的部分用於設定分離的桌面伴侶客戶端,該客戶端可從同一區域網路上的另一台電腦串流麥克風音訊。
-
僅在需要客戶端麥克風時啟用此服務。選擇客戶端可以連接的網路介面;VPN 和虛擬介面通常會產生另一台電腦無法連接的配對地址。
-
除非與其他服務衝突,否則保持預設埠。若客戶端無法連線,請在更改隨機埠前先檢查所選介面、本地防火牆及兩個系統是否在同一受信任網路上。
-
將配對 URL/令牌視為機密。任何能夠連接服務且擁有有效令牌的人都可能嘗試連線。在更改介面、地址、埠或令牌後,請重新生成或重新分發 URL。
-
已連接的客戶端狀態顯示哪些客戶端可用及其功能。音訊會從被選為錄音裝置的客戶端串流;僅僅連接客戶端並不會讓所有連接的麥克風同時錄音。
-
沒有雲端中繼。這提升了隱私,但也意味著路由、防火牆、睡眠模式和 Wi-Fi 品質會直接影響可用性和延遲。
請參閱 Companion Client。
- 在一個目標應用程式中重現問題,並關閉 AI 增強與即時預覽。
- 對於錯誤的文字,調整麥克風音量/噪音,選擇固定語言,並在改變文字插入設定前測試其他轉錄模型。
- 對於插入錯誤的正確文字,先改變插入方式,再改變貼上快捷鍵,之後僅增加相關的延遲。
- 對於缺失的低聲語音,稍微降低語音檢測靈敏度;對於被誤認為語音的噪音,稍微提高靈敏度。
- 在高負載時,先停用即時模式或增加其跳幀間隔,再降低最終轉錄品質。
- 如果多項修改讓結果難以解讀,請恢復受影響部分的預設設定。
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động