来自 XnneHangLab 的语音产品仓库
Note
这个仓库现在不再负责桌面启动器本身。
启动器与桌面壳层将放在独立仓库中继续演进; 而当前仓库收敛为语音产品本体,聚焦 TTS 能力、资源组织、后端适配与运行分发。
绘心 Voice 是一个聚焦语音生成与展示体验的产品仓库。
它当前主要负责:
- 多个 TTS 后端的统一接入
- 角色语音资源组织
- provider 适配层
- 运行时依赖与分发方式整理
- 用更轻的方式展示和验证语音能力
启动器、桌面壳层、exe 入口不再作为这个仓库的核心职责。
当前仓库聚焦三件事:
支持并整理这些后端:
- GSV-Lite
- Genie-TTS
- faster-qwen-tts
负责:
- 角色 / 情绪 / 风格资源组织
- provider 参数收敛
- 统一调用入口
- 生成与试听体验
支持三种方式:
uvdockerconda
并逐步明确:
- CPU 版本怎么装
- GPU 版本怎么装
- 模型如何按需下载
Important
语音产品本体和桌面启动器不是一个层级的问题。
把它们拆开后会更清楚:
- 本仓库专心做语音能力
- 启动器仓库专心做桌面入口
- 后续可以分别迭代,不互相拖累
这意味着当前仓库更像:
- Voice product repository
- TTS runtime repository
- provider integration repository
而不是 Launcher 仓库。
- GSV-Lite
- Genie-TTS
- faster-qwen-tts
后续会通过统一的 provider 适配层来组织调用方式,而不是让上层直接耦合到具体实现。
第一阶段先把这些事情做稳:
- provider 适配层
- 基础 voices 资源组织
uv / docker / conda三种运行方式- CPU / GPU 安装策略区分
- 模型下载职责与运行仓库职责划清
uv sync默认配置:Windows → CUDA 12.8(RTX 50 系 / Blackwell),Linux → CPU。
先运行 nvidia-smi,查看右上角的 CUDA Version,选对应命令:
| GPU | CUDA Version | 命令 |
|---|---|---|
| 无独显 / 纯测试 | — | just use-cpu |
| GTX 10xx ~ RTX 20/30 系旧驱动 | ≤ 11.8 | just use-cu118 |
| RTX 20/30/40 系新驱动 | 12.4 | just use-cu124 |
| RTX 50 系 (Blackwell) | ≥ 12.8 | just use-cu128(默认已配置,首次直接 uv sync) |
命令会自动替换配置、清理旧环境并重新安装,无需手动操作。
Note
Windows 文件锁问题:如果提示无法删除 .venv,说明有程序正在占用该目录(常见:VS Code Python 插件、Jupyter、已打开的终端)。
关闭相关程序后重新执行 just use-* 即可。
安装完成后验证:
just torch-check
如果你想使用完整项目,请前往主仓库:
如果你想关注语音产品线本身,那当前仓库就是这个方向。