-
Notifications
You must be signed in to change notification settings - Fork 0
Chinese Simplified Settings Reference
使用齿轮按钮打开 设置。确定 保存更改;取消 放弃更改。影响模型、运行时、存储位置或网络服务的更改可能需要一些时间才能生效,并可能重新加载某个组件。
此参考旨在作为调优指南,而不仅仅是控件列表。默认设置对于大多数本地 Windows 安装来说是一个良好的起点。每次只更改一个相关设置,在实际使用语音输入的应用中进行测试,并保持之前的值,直到结果明显更好为止。
| 目标 | 推荐起点 |
|---|---|
| 在普通桌面应用程序中可靠的日常听写 | 固定转录语言,启用 剪贴板 插入及剪贴板恢复,默认延迟,启用音频归一化 |
| 向终端或远程桌面听写 | 如果剪贴板转发不可用,首先尝试 Unicode。否则保持 剪贴板 并选择远程目标可接受的粘贴快捷键。对于只对类似物理按键输入可靠响应的应用程序,请使用 扫描码 |
| 长文档 | 固定语言、口述标点、链式格式、锁定或混合热键模式、保存的 WAV 录音 |
| 短搜索字段、聊天和命令 | 去掉尾随句点;可选使用首字母小写格式;保持热键模式可避免意外离开录音状态 |
| 安静或注重隐私的使用 | 禁用已保存的 WAV 录音,审查转录保留情况,如果担心剪贴板监控应用程序,请禁用剪贴板插入,并避免远程运行时环境 | | 感知延迟最低 | 除非有用,否则禁用实时预览,使用快速的本地转录模型/运行时环境,保持插入延迟低,并且在插入之前不要收集 AI 输出 |
- 转录语言:选择您最常使用的语言。固定语言通常比自动模式启动更快且更可靠,尤其适用于短语录、名字及相似发音的词语。只有在录音之间确实切换语言时才使用自动检测;短语中的语言检测证据较少,可能选择错误。
- 自定义专业术语和名称:添加不常见的名称、产品术语、缩写以及您希望 Whisper 优先使用的拼写。保持列表的针对性:它可以引导识别,但不是保证的查找替换规则,而且大量普通词汇可能引入不必要的偏差。此指导适用于 Whisper;其他转录引擎可能不会以相同方式使用它。
最佳的插入方法取决于目标应用程序。在你使用的最复杂的程序中测试它,而不仅仅是在简单的编辑器中。
-
剪贴板:在 Windows 上通常是最好的通用选择,也是处理长文本、特殊字符和复杂 Unicode 最快的方法。Voice2Win 会临时替换剪贴板,发送粘贴命令,并可以恢复之前的内容。剪贴板管理器或其他应用可能会观察到临时文本,并且在远程会话中可能禁用剪贴板转发。
-
Unicode:与布局无关,是远程会话、非 Windows 系统以及包含当前键盘布局中不存在的字符的文本的良好首选替代方案。一些游戏、终端、旧版应用程序和提升权限的窗口可能无法可靠地接受模拟的 Unicode。
-
扫描码:行为最接近物理键盘输入,并且可以帮助处理较旧或不常见的目标应用程序。它依赖于当前的键盘布局;如果字符在该布局上没有匹配的键,可能会丢失或错误。对于长文本,通常比单次粘贴操作慢。
-
键盘模拟延迟 (0–50 毫秒):除非 Unicode 或扫描码插入导致字符丢失或顺序错误,否则保持较低。对于运行缓慢的应用程序、虚拟机或远程桌面,可逐步增加此值。此设置仅会减慢模拟按键速度;不会改善语音识别效果。
-
对有问题的目标应用使用剪贴板:在使用 Unicode 或扫描码时保持启用此功能,除非禁止使用剪贴板。Voice2Win 可以回退到已知不接受模拟输入的应用程序。仅在出于剪贴板隐私或剪贴板转发的原因故意选择键盘模拟时才禁用它。
-
插入前等待时间(0–2000 毫秒,默认 40 毫秒):新剪贴板内容在粘贴快捷键发送之前可用的时间。当目标偶尔粘贴之前的剪贴板内容或根本不粘贴时(尤其是通过远程剪贴板同步),请增加此值。较大的值会在每次插入时增加相同的延迟。
-
粘贴快捷键组合:在普通 Windows 应用程序中使用 Ctrl+V。在终端、远程桌面或 AI 工具将 Ctrl+V 视为非纯文本粘贴时,可尝试 Ctrl+Shift+V 或 Shift+Insert。请选择最终目标期望的快捷键,而不一定是本地远程桌面窗口期望的快捷键。
-
在 AI 增强过程中收集文本并一次性插入:当渐进式 AI 输出会移动光标、触发格式化或自动完成,或创建多个撤销步骤时,启用此功能。当尽早看到结果更重要时,请禁用此功能;收集会等到 AI 输出完成后,才插入任何内容。
-
恢复之前的剪贴板:在正常工作中保持启用此功能,以防 Voice2Win 在听写前破坏你之前复制的内容。只有当你有意希望听写结果保留在剪贴板上,或在粘贴快捷键返回后有特定目标读取剪贴板时,才禁用此功能。
-
恢复前等待时间(0–2000 毫秒,默认 120 毫秒):当目标插入的内容为空或仅部分文本时,请增加此时间,因为先前的剪贴板值恢复得太快。仅保持所需的最高值:在此间隔期间,口述的文本仍可用于支持剪贴板的应用程序。
这些选项会在插入之前修改识别的文本。当你的口述遵循一致的模式时,它们最为有用。
-
口语标点:在希望将“逗号”“问号”或其语言特定等价物转换为标点符号的较长散文中启用此功能。当这些词可能是字面内容,或当你更喜欢转录模型的自动标点时,请关闭此功能。
-
删除末尾句号:适用于搜索字段、聊天消息、表单字段、文件名和不希望自动添加最终句号的语音命令。对于文档和电子邮件中的完整句子,请关闭此功能。
-
首字母小写:在口述内容通常插入到现有句子中间时非常有用。对于新句子、标题、名称和独立消息,请关闭此功能。
-
在同一应用程序中连接连续的口述:当你将多个录音合并成一个段落时启用此功能;Voice2Win 可以在它们之间保持间距和句子上下文。当连续录音通常输入到不同字段,或你经常在口述之间手动移动光标时,请禁用此功能。
-
语音检测灵敏度(0–100,默认 35%):较低的数值可以接受较轻的语音,但也可能将呼吸声、点击声或背景噪音当作语音处理。较高的数值可以更积极地过滤噪音,但可能会拒绝轻声或词尾。建议从默认值开始,并以小幅度调整,同时观察输入电平;将麦克风靠近说话者通常比使用极端数值更有效。
-
录音开始清理(0–500 毫秒,默认 250 毫秒):抑制热键点击、手持噪音和开头的静默。如果录音的前部分包含按键点击声,请增加该值;如果首音节被切掉或者您在按下热键后立即输入非常短的单词,请减小该值。
-
归一化录音(默认开启,目标 85%):建议用于普通麦克风和说话距离变化的情况,因为它能为模型提供更一致的音量水平。对于已归一化的录音棚/虚拟输入,或者归一化明显提高了恒定背景噪音的情况,请禁用它。目标不是麦克风增益控制,无法恢复削波音频。
-
保存 WAV 录音(默认开启):当需要回放、重新转录、质量比较或诊断证据时,请保持开启。若存储空间有限或需要保密,则可以禁用。音频通常比文本占用更多空间。
-
删除已保存的 WAV 录音:在保留转录文本的同时删除已存储的音频。请在确认不再需要回放或重新转录后使用;删除后无法恢复原始音频。
- 按住:只有在按住快捷键时才会录音。最适合简短、频繁的口述,也是避免意外后台录音时最安全的模式。
- 锁定:按一次开始,按一次停止。最适合较长的内容、辅助功能使用或免提讲话,但需要有意的停止操作。
- 混合 / 双击:按住进行短录音或双击锁定。这是最灵活的默认设置,适合混合类型的工作。如果偶尔双击造成录音未停止,可以改用按住模式。
-
为 语音转文字 和 语音命令 分别分配快捷键。优先选择操作系统、键盘驱动程序、远程桌面或目标应用程序未使用的组合。重复的 Voice2Win 快捷键将被拒绝。
-
在 Windows 上,Voice2Win 通常无法注入以更高权限运行的应用程序。只有在确实需要向高权限应用程序进行语音输入时才以提升权限运行 Voice2Win;全局提升输入权限会增加任何应用程序或配置错误的影响。
-
按下快捷键时静音全局音频输出 对使用扬声器时非常有用,因为系统音频不会反馈到麦克风。在使用耳机或在录音期间需要听会议或媒体来源时,请禁用此功能。
-
分开的 启动和停止信号 在指示器不可见时明确锁存/混合状态。使用扬声器时保持声音短而轻,以免麦克风捕捉到。为了无障碍而增加持续时间或音量,而不是为了解决快捷键检测不可靠的问题。
- 界面语言 只会更改菜单和标签;不会选择转录语言。
- 深色主题 是一种视觉偏好,不会影响识别或性能。
- 指示器样式:简单的等级显示最不分散注意力;波形或条状显示可以更容易判断语音活动;频谱样式显示更多细节,但视觉上更复杂。选择适合的样式,以便在不遮挡目标应用程序的情况下确认麦克风活动。
- 配色方案、位置和大小:使用高对比度方案,并将其放置在远离工具栏、标题和文本插入点的位置。较大的指示器有助于无障碍使用和实时文本显示;较小的指示器在只需要关注录音状态时更合适。
-
禁用自动启动 最适合偶尔使用 Voice2Win 的情况。注册表自动启动 是 Windows 登录后启动的常规选择。任务计划程序 在需要控制启动顺序或以管理员权限运行时非常有用。在 Linux 上,该应用使用每用户桌面自动启动机制。
-
通过任务计划程序以管理员权限运行 除非必须向管理员应用程序输入,否则应保持关闭。提升权限不是性能选项;它会改变全局键盘访问的安全边界。
-
显示自动启动确认对话框 在验证新的自动启动设置或共享计算机上非常有用。仅在信任启动且无需干预时禁用它。
-
显示启动画面 当模型/运行时初始化需要明显时间时很有帮助。为更安静的托盘式启动可将其禁用。
-
准备就绪声音 用于确认启动和模型准备完成,尤其是在 Voice2Win 最小化启动时。在安静环境中请禁用;仅将持续时间和音量调整到足够可识别即可。
-
关闭时最小化(默认开启) 可在关闭主窗口后保持全局快捷键可用。当希望点击窗口关闭按钮直接退出应用时请禁用。
-
自动检查更新(默认开启) 推荐启用以获得修复、模型/运行时兼容性和安全更新。仅在有意管理或离线安装时禁用,并手动检查更新。
-
禁用每周信息对话框 可隐藏在不再需要时的定期信息通知;它不会禁用功能性或错误消息。
-
Linux 输入自动化状态 是诊断信息。支持与 X11 兼容的输入自动化;纯 Wayland 会话可能会限制全局快捷键和文本注入。如果不可用,请使用 X11 会话或桌面环境提供的兼容模式。
-
转录存储路径:选择一个可靠的本地文件夹。对于敏感的听写,使用加密的位置,并确保备份/同步软件不会与正在写入的文件冲突。慢速或间歇可用的网络驱动器可能会延迟历史操作。
-
删除旧转录/最大保存期限:当隐私政策或磁盘使用情况重要时,启用自动保留。选择一个仍然覆盖您实际纠正和重新转录时间窗口的期限。已保存的 WAV 文件通常是历史记录中最大的部分。
-
模型存储路径:优先选择具有足够可用空间的快速本地 SSD。可移动和网络驱动器会降低模型加载的可靠性,并可能使断开的驱动器显得模型丢失。
-
使用自定义数据根 / 移动所有应用数据:对于可移植设置、受控备份或将大量数据保存在系统驱动器之外,这非常有用。选择一个具有适当权限和足够空间的文件夹,然后在提示时重启。这会重新定位本地数据;不会加密数据或自动上传。
实时转录是在您仍在讲话时的预览。正常的最终转录才是权威结果。当预览无用时,请保持实时模式关闭:这可以最小化资源使用,并避免屏幕上出现的初步词语被更改。
- 块 重复运行主要的 Whisper 转录模型以处理重叠的音频。当你希望预览结果接近最终的 Whisper 转录结果,并且拥有支持的 GPU 及足够内存时请选择该模式。它提供更多的上下文,但会产生大量重复的 GPU 计算工作。
- 流 使用独立的 Sherpa-ONNX 流式模型。当你需要最早的增量反馈或块模式不可用时请选择该模式。其预览结果可能较粗糙,并且仅支持设置中列出的语言;最终的正常转录结果可能仍会不同。
- 最大显示高度 限制预览可能占据的屏幕区域。对于长篇内容的可访问性使用,可增加此值;当指示器遮挡目标应用时可减小。它不会改变识别质量。
默认设置是平衡且相互依赖的。在排除故障前请恢复默认设置,并且每次仅更改一个参数。
-
窗口大小(默认 10 秒):当句子上下文不足或长短语在快照之间变化过大时,请增大窗口。较大的窗口会需要更长时间并占用更多计算/内存资源。为了在硬件性能足够的情况下更快地进行单次更新,可减小窗口,但会减少上下文信息。
-
跳跃间隔(默认 3 秒):如果希望更频繁地获得预览更新,请减小间隔;当 GPU 负载过高时,请增大间隔。较小的跳跃会启动更多转录运行,但并不会加快每次运行。
-
重叠/上下文(默认 20 秒):当区块边界的单词重复、遗漏或合并不当时,可增大重叠。为了减少重复工作,可减小重叠。重叠过少会去掉调和相邻快照所需的证据。
-
稳定延迟(默认6秒):当词语过早确认,而后续语境本可以纠正它们时,增加延迟。当稳定文本出现过慢,且接受更多修订时,减少延迟。
-
静默时间限制(默认1000毫秒):当文本在暂停后应快速稳定时,减少时间限制。当自然迟疑导致句子分割或提前定型时,增加时间限制。
-
额外句子边界检查(默认2次):仅在句子过渡反复错误且GPU有剩余计算资源时增加。每次额外的转写都会消耗时间。设置为0可禁用额外运行;中央边界检查仍然保留。
-
偏移因子(默认 20%):控制额外验证窗口相对于窗口大小的移动距离。当检查边界周围更宽的区域有帮助时增加它;当附近的上下文足够时减少它。它仅在与额外检查一起使用时才重要。
- 运行时:CPU 提供最广泛的兼容性。DirectML 可以在支持的 Windows GPU 上减少延迟,但会占用可能也被主模型需要的 GPU 资源。
- 模型变体:选择 快速 以获得较低的延迟和较少的资源消耗。当预览质量比速度更重要时,选择 精确。
- 句子优化窗口(1–8,默认值 2):值为 1 可实现最快的句子定稿。较大的值保留更多句子上下文以进行优化,但会延迟定稿并增加工作量。默认值是一个实用的平衡。
- 缓存模型:删除未使用的缓存模型可释放磁盘空间。如果以后再次选择该语言/运行时/模型组合,则必须在预览准备就绪之前重新下载。
请参阅 实时转录 获取完整的工作流程和可用性要求。
- Whisper 是支持广泛语言和已有模型变体的一般选择。当 Parakeet 的支持语言和可用硬件符合您的使用场景时,它可能会很有吸引力。请根据您的实际录音来选择;星级评分和速度估算只能作为参考,而不能替代对您的麦克风、语言和词汇进行测试。
- 更大或更高质量的模型通常需要更多的内存和时间,但可以改善处理困难音频的效果。请从能够可靠达到足够准确性的小型号开始。造成内存压力或长队列的模型,可能不如稍小但能稳定完成任务的模型有用。
- 模型管理器用于下载和删除本地模型文件。不要删除仍被所选引擎或离线工作流需要的模型。
-
单独分配音频转录和AI增强。GPU通常最适合重复的本地工作;CPU是兼容性备用方案,但可能会慢得多。将这两个任务分布到不同设备上可以避免同时使用时的GPU内存争用。
-
对于Ollama或LM Studio,选择服务器类型、地址、端口和加载的模型。仅在受信任的网络上使用发现功能,并确认所选模型确实在服务器上可用。
-
远程AI服务器或另一台Voice2Win计算机可以将工作从较弱的机器上转移,但会引入网络延迟,并将任务的音频或文本发送到该系统。仅使用受信任的主机和网络。
-
仅在其他受信任的 Voice2Win 安装需要时共享本地运行时。使用密码,仅在预期的网络配置文件中通过防火墙开放端口,并在不再需要时禁用共享。已连接客户端和版本警告有助于识别意外或不兼容的客户端。
-
上下文长度(默认 4096):对于较长的选中文本、较长的指令或需要更多周围上下文的转换,可以增加上下文长度。更大的上下文会消耗更多内存,且可能更慢。它不会自动改善短文本的修正效果。
-
最大令牌数(默认 512):当长篇重写内容被截断时可以增加。减少它可以控制响应时间,并防止输出异常过长。常规的口述修正通常不需要非常大的值。
-
温度(默认 0.2):较低的值更可重复,最适合用于修正、格式化和保持意思。只在刻意进行创造性重写时才提高;较高的值可能会更自由地改变措辞或事实。
-
AI增强的最小转录长度(默认20个字符):当即使是非常短的短语也需要处理时,可以降低该值。为了避免模型启动/延迟以及对诸如“是”或名字等微小输入产生意外重写,可以提高该值。
-
系统提示:这是默认AI增强的常规指令。说明所需的语言、是否必须保留意义和语气,以及只返回最终文本。在非关键文本上测试提示更改:过于宽泛的提示可能会进行听写答复、翻译或添加解释,而不是进行纠正。
-
备用AI模型存储:使用具有足够空间的快速本地驱动器。复制现有模型可以避免再次下载;仅更改文件夹无法使缺失或不兼容的模型可用。
-
说话人识别模型质量:当区分相似声音非常重要且机器有足够的内存/性能时,优先使用高质量模型。在硬件有限的情况下进行长时间会话时使用轻量模型。下载的模型会立即可选。
-
说话人分离灵敏度:从 默认 开始。当两个不同但相似的声音经常被合并时,提高灵敏度;其权衡是一个人的声音变化、距离或麦克风角度可能会被拆分为额外的说话人。当一个人经常被显示为多个说话人时,降低灵敏度;其权衡是真正相似的声音可能会被合并。
-
语音检测灵敏度:当点击声、室内噪音或静音片段被转写时,请提高灵敏度。当安静的说话者被漏掉时,请降低灵敏度。此门控决定是否将某个片段发送进行转写;被强烈拒绝的片段无法通过更精确的转写模型恢复。
-
最终化暂停(默认 10 秒,在会话录音页面):当某些片段在说话者停下之后应快速结束时,请使用较短的暂停。对于长时间的思考性讨论或长时间停顿,请使用较长的暂停;结果会稍晚出现,但单个贡献不太可能被拆分。
-
预期说话者(默认自动,在会话录音页面):当参与者可以加入或离开时保持 自动。当自动聚类产生错误数量时,为固定会议设置已知人数。错误的固定人数可能会将无关的声音组合在一起,或者为了满足请求的数量而将一个声音拆分。
说话者分离是概率性的。麦克风距离、重叠、回声和变化的背景噪音都会影响;仍可能需要手动纠正说话者。参见 会话录音。
此仅限开发者的部分用于配置独立的桌面伴侣客户端,从同一局域网内的另一台计算机流式传输麦克风音频。
-
仅在需要客户端麦克风时启用此服务。选择客户端可访问的网络适配器;VPN 和虚拟适配器通常会生成另一台计算机无法访问的配对地址。
-
除非与其他服务冲突,否则保持默认端口。如果客户端无法连接,请在更改随机端口之前检查所选适配器、本地防火墙以及两台系统是否在相同的受信任网络中。
-
将配对 URL/令牌视为机密。任何能够访问该服务并持有有效令牌的人都可能尝试连接。在更换适配器、地址、端口或令牌后,请重新生成或重新分发 URL。
-
已连接客户端状态显示哪些客户端可用及其功能。从选为录音设备的客户端进行音频流传输;仅连接客户端并不会使所有连接的麦克风同时录音。
-
没有云中继。这提高了隐私性,但意味着路由、防火墙、睡眠模式和 Wi-Fi 质量会直接影响可用性和延迟。
请参阅 Companion Client。
- 在一个目标应用中重现问题,同时禁用 AI 增强和实时预览。
- 对于错误的词,调整麦克风音量/噪音,选择固定语言,并在更改文本插入设置之前测试另一种转录模型。
- 对于插入错误的正确文本,先更改插入方法,再更改粘贴快捷键,然后仅增加相关延迟。
- 对于缺失的低声说话,略微降低语音检测灵敏度;对于被误识为语音的噪音,略微提高灵敏度。
- 对于高负载,在降低最终转录质量之前,先禁用实时模式或增加其跳跃间隔。
- 如果多次更改导致结果难以理解,请恢复受影响部分的默认设置。
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động