-
Notifications
You must be signed in to change notification settings - Fork 0
Chinese Simplified AI Models and Hardware
Voice2Win 将三种模型工作区分开来。理解它们的区别可以让人工智能(AI)模型和硬件设置变得更容易。
| 工作负载 | 目的 | 技术 |
|---|---|---|
| 主要转录 | 普通口述、语音指令、块状转录和重新转录 | Whisper 或 Parakeet |
| 流式转录 | 录音时的非常早期临时结果 | 独立的 Sherpa-ONNX 在线模型 |
| AI 增强 | 修改或转换文本 | 内置 Gemma 模型、Ollama、LM Studio,或共享的 Voice2Win 实例 |
Parakeet 是主要转录引擎,而不是流式模型。
OpenAI Whisper 在多种语言的离线识别方面表现非常好。它使用更多资源,通常比 Parakeet 更慢。对于大型模型和实时块式转录,建议使用显卡加速。
NVIDIA Parakeet V3 效率更高,在主处理器上表现良好。它的错误率可能略高于 Whisper,并且支持的语言集较小。当速度和较低资源使用比最大多语言覆盖更重要时,请选择它。
AI 模型 设置仅显示属于所选引擎的模型。使用 管理模型 来下载或删除模型文件。主窗口的当前模型列表随后可在已下载的模型中进行选择。
主处理器 (CPU) / 显卡 (GPU) 及 AI 模型分配 表格独立分配音频转录和 AI 增强。
- 主处理器 (CPU) 是最兼容的选择,但可能会比较慢。
- 显卡 (GPU) 可以加速支持的工作负载,如果选择的工作负载可能较慢或显存不足,会显示性能警告。
- Ollama 或 LM Studio 可从本地服务器提供 AI 增强。输入其主机和端口,如需要,可搜索本地 IPv4 网络,刷新模型列表并选择报告的模型。
- 共享 Voice2Win 实例 可从另一台计算机提供音频转录、AI 增强或两者。
更改运行时会在后台重新加载受影响的模型,可能需要一些时间。
- Whisper 和内置 AI 增强在 Windows 和 Linux 上使用 Vulkan 图形加速;macOS 使用其本地图形路径。
- Parakeet 和 Windows 流式转录使用 DirectML 进行图形加速。
- 主处理器仍然可作为备用使用。
Voice2Win 故意避免捆绑 CUDA 运行时,因为它们的包体积较大。拥有支持 Vulkan 或 DirectML 的当前图形驱动,比单独安装 CUDA 更重要。
语音和 AI 模型可以同时驻留。它们的总内存需求很重要:
- 如果专用显存不足,选择更小或量化更强的模型。
- 将一个工作负载分配给主处理器,另一个分配给显卡。
- 避免加载警告估计超过可用系统或显存的模型;大量交换可能会导致整个计算机无响应。
- 当限制是磁盘容量而非内存时,使用替代 AI 模型存储位置。
Ollama 默认使用端口 11434;LM Studio 默认使用端口 1234。Voice2Win 查询所选服务器的模型列表,并仅向该配置服务器发送增强提示。服务器的可用性、隐私和模型行为由该服务器安装负责。
一台 Voice2Win 计算机可以将其当前加载的语音和 AI 模型暴露给其他 Voice2Win 实例:
- 在 设置 → AI 模型 中,启用运行时共享。
- 选择一个端口,并可选择设置密码。
- 在另一台计算机上,添加一个共享的 Voice2Win 实例,输入其计算机名称或 IPv4 地址、端口和密码,或者搜索本地网络。
- 将音频转录和/或 AI 增强分配给远程行。
共享计算机上会显示已连接的客户端及最近使用信息。保持版本一致;版本不匹配可能导致兼容性问题。一个自身正在使用共享运行时的实例,无法将该运行时继续共享出去。
此功能会通过配置的网络连接发送工作负载数据。当其他用户可以访问端口时,请使用受信任的网络和密码。
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động