-
Notifications
You must be signed in to change notification settings - Fork 0
Chinese Simplified Real Time Transcription
Dan edited this page Aug 21, 2026
·
1 revision
实时转录在录音进行时会在录音指示器下显示识别的文本。在 设置 → 实时转录 中启用此功能,然后选择恰好一个模式。
分块转录会重用所选的主要 Whisper 或 Parakeet 模型。在录音过程中,它会转录重叠的音频窗口,通过时间戳合并识别的单词,并在文本保持一致后将其视为稳定。当录音结束时,如果检测到缺失部分,Voice2Win 会添加缺失的尾部或执行完整的回退转录。
优点:
- 使用与最终转录相同的主要转录模型和语言选择。
- 使较长的口述内容更早可用,无需加载单独的流式识别器。
- 可以在句子边界周围运行额外的偏移检查,以修复之前的块结果。
要求和权衡:
- 旨在用于显卡加速,当音频转录分配给主处理器时可能无法使用。
- 所选模型和重叠工作需要足够的显存。
- 更频繁或更大的窗口会增加计算使用量。
| 设置 | 默认值 | 作用 |
|---|---|---|
| 窗口大小 | 10 秒 | 单次主模型运行可见的最大音频时长。较大的窗口可以增加上下文,但处理时间更长。 |
| 跳跃间隔 | 3 秒 | 新快照之间的时间间隔。较小的值会更频繁刷新,并启动更多工作。 |
| 重叠 / 上下文 | 20 秒 | 为提供上下文和合并而再次包含的早期音频。 |
| 稳定延迟 | 6 秒 | 新文本需要保持不变的时间长度,才会被视为稳定。 |
| 静音期间时间限制 | 1000 毫秒 | 在此期间未检测到语音时接受待定稳定文本。 |
| 额外句边界检查 | 2 | 每个句子边界的额外位移检查次数;为零则禁用额外运行。 |
| 位移因子 | 20% | 控制额外句子窗口的位移幅度。 |
如果手动调节导致输出变慢或不稳定,请使用 恢复默认设置。
流式转录会在录音的同时并行运行一个单独的 Sherpa-ONNX 在线识别器。它会生成非常早期的临时句子,然后主转录模型再通过重叠分组进行优化。
优点:
- 最早可见的临时结果。
- 可以在主处理器上运行,或者在 Windows 上使用 DirectML 显卡加速。
权衡:
- 仅支持当前目录中存在流模型的语言。
- 原始临时识别结果可能比最终主模型结果粗糙。
- 每种选定语言或模型变体都需要下载并缓存一个额外的模型。
- 运行环境 — 选择主要处理器以兼容性,或选择 Windows 显卡以提高速度。
- 流式音频模型 — 更快 可最小化延迟和加载时间;更准确但更慢 会消耗更多计算以提高识别质量。
- 同时优化的句子数量 — 控制主模型重叠优化窗口,从 1 到 8 个句子;默认值为 2。
- 已加载的流式音频模型 — 列出缓存的模型并允许删除。已删除的模型在需要时会重新下载。
录音指示器下的最大文本高度 将实时文本限制为屏幕高度的 10%–90%;默认值为 50%。更长的文本可滚动,并会跟随最新结果,直到你手动向上滚动。
- 当您希望获得主要模型的行为并且拥有足够的显卡性能和内存时,选择 块式转录。
- 当尽早获取临时文本很重要并且您的语言受到支持时,选择 流式转录。
- 当您更喜欢最简单的流程并且只需要录音后的最终结果时,请禁用实时转录。
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động