Repository navigation
Releases: T8mars/breeze-tts
Release list
T8star-Aix Voice Studio v0.3.8 · Whisper + Confucius Q8
Windows 整合包新增 Whisper Large-v3 / Confucius4-R2T2 Q8 双引擎离线转写,在声音克隆生成页和角色音色库均可选择。
- 复用既有 Confucius worker 固定源码,不重写推理;Breeze ComfyUI 节点仍为 0.3.7,Confucius 节点仍为 0.1.2,本次无需更新节点。
- 完整包包含两套 ASR 权重、FireRedVAD、隔离的 Python 3.12 / CUDA worker;无需另装 Python、ComfyUI、vLLM 或 CUDA Toolkit,仍需 NVIDIA 显卡驱动。
- 设置与诊断中分别选择、保存或恢复两个引擎的模型目录;可复用已有模型目录。Confucius 支持热词和上下文,负责识别转写,不是翻译,也不伪造字幕时间戳。
- ASR 与 TTS 串行使用显卡;转录前释放 Breeze,转录后释放 ASR,下次生成自动重载。转写结果仍是草稿,应用后不会自动勾选逐字稿核验,也不会改动参考音频。
- Electron 更新至 43.7.7,打包工具更新至 Forge 8.0.1;完整 npm 安全审计及桌面回归检查通过。
下载所有 .part-### 文件以及同版本 Join-and-Run-*.cmd,放在同一目录后运行 CMD。它会重建完整自解压 EXE、验证 SHA-256 后启动解压。不要单独打开某一个分卷。完整包较大,请预留压缩文件、合并 EXE 及解压目录所需空间。此发布未做 Authenticode 签名。
完整 EXE:8,700,079,019 字节;SHA-256:532da904f00b8618df281ce4f86d43ce4d5a44ef8240e484bc8d60b76885fae5。共有五份分卷;全部下载、重建和解压建议预留至少 35 GB 空间。
Breeze 主权重不内嵌公开包,仍须接受其研究/非商业许可证后下载。Confucius 使用网易有道独立模型许可;所有源码、模型和运行库许可随包保留。抱脸只更新路径说明,没有重复上传权重。
使用说明及模型目录 · Breeze 模型镜像 · Confucius 模型镜像 · 原节点项目
原生 DLL 包含 SM75/80/86/89/90/100/120 的编译目标;本次实际 GPU 验收使用 RTX 5090 Laptop,其他架构仍需对应硬件验证。
T8star-Aix Voice Studio v0.3.6
v0.3.6 修复
- 修复 Voice Clone 在 Fast All、较长文本下触发
backbone prefill CUDA graph (1, 288) was not declared in the warmup profile的错误。 - 为 CFG=1 的 Backbone Prefill 补齐 288–512 token CUDA Graph 预热桶。
- 超出已预热形状时只将 Backbone Prefill 自动回退到 Eager;Backbone Decode、Depth Decoder、Codec 等后续快速阶段继续保持启用,避免整套退回安全模式。
- 生成元数据与桌面状态会显示 Prefill 实际后端、桶大小及自动回退次数,方便诊断。
- 新增长文本 Voice Clone GPU 验收脚本和 256/257/288/512/513 边界回归测试。
Windows 整合包下载
请下载本 Release 的全部 11 个 .part-* 分卷、Join-and-Run-T8star-Aix-Voice-Studio-v0.3.6.cmd 与 SHA256SUMS-GITHUB.txt,放到同一目录后运行 CMD。脚本会拼接、验证 SHA-256,再启动完整自解压包。
完整自解压 EXE SHA-256:f4eeeea9e71ea6e70544fc5fe1d8c7a4142a9fd867ec6511a350e3001f8b0547
整合包内含 PyTorch 2.9.1+cu128、Transformers 4.57.3、Triton 3.5.1、FlashAttention 2.8.3。自动化验证:核心测试 52 passed、主集成测试 110 passed、ComfyUI 节点测试 16 passed、桌面测试 28 passed;分卷流式重组哈希一致。
注意:此 Windows 构建未签名。源码为 Apache-2.0;模型权重及自托管输出受 BreezeBlue Research and Non-Commercial License 约束。克隆声音前请取得充分授权。
RTX 5090 实机验证
- NVIDIA GeForce RTX 5090 Laptop GPU(CUDA
cuda:0)完成 336 个中文字符的 Fast All Voice Clone。 - 本次实际命中 Backbone Prefill CUDA Graph
(branch_batch_size=1, bucket=288),fallback_reason=null,未触发 Eager 回退,也未复现原错误。 - 流式运行时、模型权重与 Audio Codec 均验证位于
cuda:0。 - 输出为有效的 24 kHz 单声道 WAV:122,880 samples、5.12 秒、数值全部有限。
- 实机验收报告:
test_reports/fast-all-long-clone-v0.3.6.json(本地构建记录)。
T8star-Aix Voice Studio v0.3.4
v0.3.4 更新
- 同步 Breeze TTS 2 官方 2026-09-08 推理修复:纯 Voice Clone 使用参考专用模板,不再隐式注入演绎指令;填写指令时明确走 Voice Direction。
- seed 在真实采样边界重置,冷/暖请求生成 token 一致;BF16 Codec 音频通过项目确定性容差。
- Fast All 使用最小可容纳的 CUDA Graph 桶,并加入 batch-4 的 32/64/96/128/160/256 预热桶。
- 标准模式继续让 Breeze 自定义主干/深度解码保持 Eager,仅嵌套 T5Gemma2 文本编码器使用 FlashAttention 2;Fast All 文本编码器使用 SDPA CUDA Graph。
- 修复重复构造运行时可能从 FP32 lm_head 误取缓存 dtype 的问题;缓存 dtype 改从 BF16 语义主干获取。
- 显式禁用不适用于本 Tokenizer 的 Mistral regex 修复。
- 模型固定到
799624c0:权重未变化,仅官方 README 与 BreezeBlue 模型许可升级到 1.1;升级后需在本地重新确认许可。 - 诊断新增原生 BF16 硬件提示,并保留模型、Codec、流式运行时同一 CUDA 设备的硬校验,阻止静默 CPU 生成。
Windows 整合包下载
GitHub 单文件大小有限,请下载本 Release 的全部 11 个 .part-* 分卷、Join-and-Run-T8star-Aix-Voice-Studio-v0.3.4.cmd 和 SHA256SUMS-GITHUB.txt,放在同一目录后运行 CMD。脚本会先拼接并验证 SHA-256,再启动完整自解压包。
完整自解压 EXE SHA-256:c16395df07b1a60a2447db8d5dc974f83ba6401b161bae840d1bbe4343693e28
RTX 5090 Laptop 实测:标准模式 FlashAttention 2 已激活且三种模式均在 cuda:0;Fast All 整套预热成功、无回退,峰值预热显存约 19.4 GiB。CPU 仍会参与逐 token 调度、文件读写和音频封装,但模型推理不会静默退回 CPU。
注意:此构建未签名。源码为 Apache-2.0;开放权重模型及自托管输出仍仅限研究与非商业用途。BreezeBlue 付费托管服务输出按其单独服务条款处理。克隆声音前请取得充分授权。
T8star-Aix Voice Studio v0.3.3
v0.3.3 更新
- 新增分类声音事件预设:8 种 Breeze 官方示例写法、15 种明确标注的实验写法。
- 修复多角色脚本把
[笑]、[抽泣]、[喘息]等声音事件误识别为角色名的问题。 - 启动时强制验证 Breeze 主模型、音频 Codec、流式运行时位于同一 CUDA 设备;验证失败会停止,不再允许 CPU 静默生成。
- 设置诊断与每次生成的 JSON 元数据会显示实际 GPU、
cuda:0、当前及峰值显存。 - 继续内置 PyTorch 2.9.1 CUDA 12.8、FlashAttention 2.8.3、Triton 3.5.1.post24 与 Whisper Large-v3。
Windows 整合包下载
GitHub 单文件大小有限,请下载本 Release 的全部 3 个 .part-* 分卷、Join-and-Run-T8star-Aix-Voice-Studio-v0.3.3.cmd 和 SHA256SUMS-GITHUB.txt,放在同一目录后运行 CMD。脚本会先拼接并验证 SHA-256,再启动完整自解压包。
完整自解压 EXE SHA-256:df96cc0d5283f1babb6068f13d983219565e67d764ca650028cf131fe7feaf83
标准流式建议 12 GB NVIDIA 显存;Fast All 实验模式建议 24 GB。Windows 任务管理器默认常显示 3D 图表,观察推理请切换到 CUDA / Compute 图表,或直接查看应用内“实际推理设备”。CPU 仍会参与逐 token 调度和 WAV 写入。
注意:此构建未签名。源码为 Apache-2.0;Breeze TTS 2 模型及自托管输出仅限研究与非商业用途,克隆声音前请取得充分授权。
T8star-Aix Voice Studio v0.3.2 · FlashAttention
T8star-Aix Voice Studio v0.3.2
本版本把 FlashAttention 2.8.3 直接包含在 Windows 私有运行时中,无需用户安装或本地编译。
- Python 3.10.20
- PyTorch 2.9.1 + CUDA 12.8
- FlashAttention 2.8.3(T5Gemma2 文本编码器)
- SHA256 固定的 GitHub 预编译 Windows wheel
- 打包后环境已执行导入、版本、CUDA 内核和完整语音生成验证
- Breeze 自定义 backbone/depth decoder 保持 Eager;Fast All 保持 SDPA CUDA Graph
下载与安装
下载本 Release 的全部 .part-### 文件、Join-and-Run-*.cmd 和 SHA256SUMS-GITHUB.txt,放在同一个目录,然后运行 CMD。脚本会合并自解压 EXE、校验整包 SHA-256,校验成功后才启动安装包。
注意:本次 Windows EXE 未配置 Authenticode 生产证书,因此为未签名版本。Breeze 模型权重仍需首次运行时接受许可证后下载,不包含在公开整合包内。
T8star-Aix Voice Studio v0.2.9
本版为创作者入口与分发说明更新,同时保留 v0.2.8 的全部功能。
主要更新:
- 桌面整合包新增 T8star-Aix 的 GitHub、Hugging Face、B站和 YouTube 入口,并与 BreezeBlue 官方项目链接分组显示。
- 主项目和 ComfyUI 节点 README 同步四个入口。
- Hugging Face 模型仓库现已包含完整
comfyui-breeze-tts-T8/节点目录和四份可拖入 ComfyUI 的工作流。 - 继续内置
faster-whisper1.2.1 与 Whisper Small,默认转写可离线使用。 - 保留参考音频音色库、批量示例、多角色音色选择、可编辑时间轴、单句重跑回填、逐句演绎、行内声音事件和自动重混音。
Windows 下载:
- 下载两个
.part-###文件、Join-and-Run-T8star-Aix-Voice-Studio-v0.2.9.cmd和SHA256SUMS-GITHUB.txt到同一目录。 - 双击 CMD;它会合并分卷、校验 SHA-256,然后启动自解压整合包。
- 当前 EXE 未做 Authenticode 签名;如 SmartScreen 拦截,请先核对校验文件。
路径说明:
- 桌面 Breeze 主模型:
%APPDATA%\T8star-Aix Voice Studio\models\Breeze-TTS-2 - 桌面内置 Whisper Small:应用内部
resources\backend\models\faster-whisper-small - ComfyUI 节点:
ComfyUI\custom_nodes\comfyui-breeze-tts-T8 - ComfyUI Breeze 主模型:
ComfyUI\models\breeze_tts\BreezeBlue_Breeze-TTS-2
Breeze 模型仍受 BreezeBlue Research and Non-Commercial License 约束;请确保拥有参考声音的合法授权。
T8star-Aix Voice Studio v0.2.8
本版修复用户实测问题,并完成默认离线转写能力。
主要更新:
- Whisper Small 模型与 faster-whisper 1.2.1 已内置;默认 Small 可离线转写,不再要求首次安装。
- 修复便携 Python 受管环境导致的 Whisper 修复安装失败。
- 批量文本默认带可运行示例,五种格式均可一键载入;首页 SRT/多人对白模板会加载匹配示例。
- 修复删除音色后再次新建无反应;新增明确的“开始新建”状态重置入口。
- 多角色页“默认角色”支持从已保存音色库下拉选择,自动回填角色名并在解析后绑定音色。
- 修复 [笑]、[咳嗽]、[清嗓子]、[叹气] 被误识别为角色名的问题。
- 保留参考音频上传/试听/替换、可编辑时间轴、单句重跑回填、逐句演绎与自动重混音。
Windows 下载:
- 下载两个
.part-###文件和Join-and-Run-....cmd到同一目录。 - 双击 CMD;它会合并、校验 SHA-256,然后启动自解压包。
- 当前 EXE 未做 Authenticode 签名;如 SmartScreen 拦截,请先核对
SHA256SUMS-GITHUB.txt。
模型路径说明(互不共用):
- 桌面 Breeze 主模型:
%APPDATA%\T8star-Aix Voice Studio\models\Breeze-TTS-2 - 桌面内置 Whisper Small:应用内部
resources\backend\models\faster-whisper-small - 桌面其他 Whisper 规格缓存:
%APPDATA%\T8star-Aix Voice Studio\models\whisper - ComfyUI Breeze 主模型:
ComfyUI\models\breeze_tts\BreezeBlue_Breeze-TTS-2
Breeze 模型仍受 BreezeBlue Research and Non-Commercial License 约束;请确保拥有参考声音的授权。
T8star-Aix Voice Studio v0.2.4
本版重点
- 完成与 IndexTTS 2.5 整合包相近的时间轴单句重跑闭环:重跑前自动保存,生成后回填目标句,并在音频齐全时自动重混完整时间轴。
- 时间轴逐句显示等待、生成中、完成和失败状态,支持试听与下载最新结果;失败时保留并明确标注上次成功音频。
- 工程 revision 全链路并发保护,防止把旧文本生成的音频写入已修改台词;缺少 revision 或 line_id 的旧请求安全降级为 one-shot。
- 完整工程只生成缺失、失败或生成参数已变化的台词;仅修改时间点时直接重混,不重复推理。
- 生成期间锁定时间轴编辑与工程操作,避免前后端状态漂移。
Windows 下载方法
下载两个 .part-### 分卷、Join-and-Run-T8star-Aix-Voice-Studio-v0.2.4.cmd 和 SHA256SUMS-GITHUB.txt 到同一目录,然后运行 CMD。脚本会合并、校验 SHA-256,再启动自解压包。模型权重仍在首次使用并接受 BreezeBlue 非商业许可后下载,不包含在安装包中。
本构建未使用 Authenticode 商业证书,Windows 可能显示 SmartScreen 提示。
ComfyUI 节点
comfyui-breeze-tts-T8-v0.2.4.zip 保持 8 个节点及标准 AUDIO 契约。不会安装、升级或降级宿主的 Torch、Torchaudio、Transformers、Tokenizers 或 NumPy;兼容范围保持 transformers>=4.57,<6。
验证
- Python:71 passed
- Desktop UI:13/13 passed
- Electron 主进程与 Forge 分发配置:通过
- GitHub Actions:通过
- Windows 便携包、7-Zip 自解压包、发布清单与分卷重组 SHA-256:通过
T8star-Aix Voice Studio v0.2.3
Breeze TTS 2 Voice Studio v0.2.3
本次版本重点优化“从创作目标到开始生成”的路径,并修复 Windows 正式打包时锁文件哈希受换行符影响的问题。
新功能与体验优化
- 新增短视频旁白、多人对白、有声书、广告口播和 SRT 配音快速模板。
- 新增平静、温暖、兴奋、紧张、悲伤、低声、纪录片等 Breeze 原生自然语言演绎配方。
- 单句与批量任务增加跨分页全局进度、快速返回和取消入口。
- 启动配置收进高级区域;模板启动时持续显示模型加载进度和可操作错误。
- 窄窗口导航自动换行,补齐方向键、Home/End 和 ARIA 分页语义。
- 修复 Windows CRLF/LF 导致运行时锁文件校验误报的问题。
Windows 整合包下载
GitHub 限制单个 Release 文件必须小于 2 GiB,因此整合包分为两个经过校验的分卷:
- 下载两个
.part-###文件和Join-and-Run-T8star-Aix-Voice-Studio-v0.2.3.cmd,放在同一目录。 - 双击 CMD;它会合并出原始自解压 EXE,并在启动前验证 SHA-256。
- 建议至少预留 12 GiB 磁盘空间。模型权重不包含在整合包中,接受 BreezeBlue 模型许可证后由应用下载。
本 Windows 构建未配置正式 Authenticode 证书,因此会显示为未签名。可使用 SHA256SUMS-GITHUB.txt 独立核对;合并后 EXE 的 SHA-256 为:
eb35aace9776cbac2445cd73d6c2685f9e252ef315881f6718717a4c6534b9bc
ComfyUI 节点
下载 comfyui-breeze-tts-T8-v0.2.3.zip,解压后确保目录名为 comfyui-breeze-tts-T8。受保护的 Torch、Transformers、Tokenizers 和 NumPy 继续由 ComfyUI 宿主环境管理;兼容范围保持 transformers>=4.57,<6。
验证结果
- 后端自动化测试:61 项通过。
- 桌面 UI / 主进程回归:11 项通过。
- npm 全量审计:0 个漏洞。
- Python 运行时:CPython 3.10.20、PyTorch 2.9.1+cu128、Transformers 4.57.3。
- 自解压包通过 7-Zip 全量测试,分卷串联合并哈希与原始 EXE 完全一致。
Breeze TTS 2 模型权重及相关用途受 BreezeBlue Research and Non-Commercial License 约束。本项目为非官方整合。