Skip to content

Releases: T8mars/breeze-tts

T8star-Aix Voice Studio v0.3.8 · Whisper + Confucius Q8

Choose a tag to compare

@T8mars T8mars released this 04 Oct 17:38

Windows 整合包新增 Whisper Large-v3 / Confucius4-R2T2 Q8 双引擎离线转写,在声音克隆生成页和角色音色库均可选择。

  • 复用既有 Confucius worker 固定源码,不重写推理;Breeze ComfyUI 节点仍为 0.3.7,Confucius 节点仍为 0.1.2,本次无需更新节点。
  • 完整包包含两套 ASR 权重、FireRedVAD、隔离的 Python 3.12 / CUDA worker;无需另装 Python、ComfyUI、vLLM 或 CUDA Toolkit,仍需 NVIDIA 显卡驱动。
  • 设置与诊断中分别选择、保存或恢复两个引擎的模型目录;可复用已有模型目录。Confucius 支持热词和上下文,负责识别转写,不是翻译,也不伪造字幕时间戳。
  • ASR 与 TTS 串行使用显卡;转录前释放 Breeze,转录后释放 ASR,下次生成自动重载。转写结果仍是草稿,应用后不会自动勾选逐字稿核验,也不会改动参考音频。
  • Electron 更新至 43.7.7,打包工具更新至 Forge 8.0.1;完整 npm 安全审计及桌面回归检查通过。

下载所有 .part-### 文件以及同版本 Join-and-Run-*.cmd,放在同一目录后运行 CMD。它会重建完整自解压 EXE、验证 SHA-256 后启动解压。不要单独打开某一个分卷。完整包较大,请预留压缩文件、合并 EXE 及解压目录所需空间。此发布未做 Authenticode 签名。

完整 EXE:8,700,079,019 字节;SHA-256:532da904f00b8618df281ce4f86d43ce4d5a44ef8240e484bc8d60b76885fae5。共有五份分卷;全部下载、重建和解压建议预留至少 35 GB 空间。

Breeze 主权重不内嵌公开包,仍须接受其研究/非商业许可证后下载。Confucius 使用网易有道独立模型许可;所有源码、模型和运行库许可随包保留。抱脸只更新路径说明,没有重复上传权重。

使用说明及模型目录 · Breeze 模型镜像 · Confucius 模型镜像 · 原节点项目

原生 DLL 包含 SM75/80/86/89/90/100/120 的编译目标;本次实际 GPU 验收使用 RTX 5090 Laptop,其他架构仍需对应硬件验证。

T8star-Aix Voice Studio v0.3.6

Choose a tag to compare

@T8mars T8mars released this 11 Sep 22:07

v0.3.6 修复

  • 修复 Voice Clone 在 Fast All、较长文本下触发 backbone prefill CUDA graph (1, 288) was not declared in the warmup profile 的错误。
  • 为 CFG=1 的 Backbone Prefill 补齐 288–512 token CUDA Graph 预热桶。
  • 超出已预热形状时只将 Backbone Prefill 自动回退到 Eager;Backbone Decode、Depth Decoder、Codec 等后续快速阶段继续保持启用,避免整套退回安全模式。
  • 生成元数据与桌面状态会显示 Prefill 实际后端、桶大小及自动回退次数,方便诊断。
  • 新增长文本 Voice Clone GPU 验收脚本和 256/257/288/512/513 边界回归测试。

Windows 整合包下载

请下载本 Release 的全部 11 个 .part-* 分卷、Join-and-Run-T8star-Aix-Voice-Studio-v0.3.6.cmd 与 SHA256SUMS-GITHUB.txt,放到同一目录后运行 CMD。脚本会拼接、验证 SHA-256,再启动完整自解压包。

完整自解压 EXE SHA-256:f4eeeea9e71ea6e70544fc5fe1d8c7a4142a9fd867ec6511a350e3001f8b0547

整合包内含 PyTorch 2.9.1+cu128、Transformers 4.57.3、Triton 3.5.1、FlashAttention 2.8.3。自动化验证:核心测试 52 passed、主集成测试 110 passed、ComfyUI 节点测试 16 passed、桌面测试 28 passed;分卷流式重组哈希一致。

注意:此 Windows 构建未签名。源码为 Apache-2.0;模型权重及自托管输出受 BreezeBlue Research and Non-Commercial License 约束。克隆声音前请取得充分授权。

RTX 5090 实机验证

  • NVIDIA GeForce RTX 5090 Laptop GPU(CUDA cuda:0)完成 336 个中文字符的 Fast All Voice Clone。
  • 本次实际命中 Backbone Prefill CUDA Graph (branch_batch_size=1, bucket=288),fallback_reason=null,未触发 Eager 回退,也未复现原错误。
  • 流式运行时、模型权重与 Audio Codec 均验证位于 cuda:0。
  • 输出为有效的 24 kHz 单声道 WAV:122,880 samples、5.12 秒、数值全部有限。
  • 实机验收报告:test_reports/fast-all-long-clone-v0.3.6.json(本地构建记录)。

T8star-Aix Voice Studio v0.3.4

Choose a tag to compare

@T8mars T8mars released this 09 Sep 09:57

v0.3.4 更新

  • 同步 Breeze TTS 2 官方 2026-09-08 推理修复:纯 Voice Clone 使用参考专用模板,不再隐式注入演绎指令;填写指令时明确走 Voice Direction。
  • seed 在真实采样边界重置,冷/暖请求生成 token 一致;BF16 Codec 音频通过项目确定性容差。
  • Fast All 使用最小可容纳的 CUDA Graph 桶,并加入 batch-4 的 32/64/96/128/160/256 预热桶。
  • 标准模式继续让 Breeze 自定义主干/深度解码保持 Eager,仅嵌套 T5Gemma2 文本编码器使用 FlashAttention 2;Fast All 文本编码器使用 SDPA CUDA Graph。
  • 修复重复构造运行时可能从 FP32 lm_head 误取缓存 dtype 的问题;缓存 dtype 改从 BF16 语义主干获取。
  • 显式禁用不适用于本 Tokenizer 的 Mistral regex 修复。
  • 模型固定到 799624c0:权重未变化,仅官方 README 与 BreezeBlue 模型许可升级到 1.1;升级后需在本地重新确认许可。
  • 诊断新增原生 BF16 硬件提示,并保留模型、Codec、流式运行时同一 CUDA 设备的硬校验,阻止静默 CPU 生成。

Windows 整合包下载

GitHub 单文件大小有限,请下载本 Release 的全部 11 个 .part-* 分卷、Join-and-Run-T8star-Aix-Voice-Studio-v0.3.4.cmd 和 SHA256SUMS-GITHUB.txt,放在同一目录后运行 CMD。脚本会先拼接并验证 SHA-256,再启动完整自解压包。

完整自解压 EXE SHA-256:c16395df07b1a60a2447db8d5dc974f83ba6401b161bae840d1bbe4343693e28

RTX 5090 Laptop 实测:标准模式 FlashAttention 2 已激活且三种模式均在 cuda:0;Fast All 整套预热成功、无回退,峰值预热显存约 19.4 GiB。CPU 仍会参与逐 token 调度、文件读写和音频封装,但模型推理不会静默退回 CPU。

注意:此构建未签名。源码为 Apache-2.0;开放权重模型及自托管输出仍仅限研究与非商业用途。BreezeBlue 付费托管服务输出按其单独服务条款处理。克隆声音前请取得充分授权。

T8star-Aix Voice Studio v0.3.3

Choose a tag to compare

@T8mars T8mars released this 04 Sep 13:04

v0.3.3 更新

  • 新增分类声音事件预设:8 种 Breeze 官方示例写法、15 种明确标注的实验写法。
  • 修复多角色脚本把 [笑]、[抽泣]、[喘息] 等声音事件误识别为角色名的问题。
  • 启动时强制验证 Breeze 主模型、音频 Codec、流式运行时位于同一 CUDA 设备;验证失败会停止,不再允许 CPU 静默生成。
  • 设置诊断与每次生成的 JSON 元数据会显示实际 GPU、cuda:0、当前及峰值显存。
  • 继续内置 PyTorch 2.9.1 CUDA 12.8、FlashAttention 2.8.3、Triton 3.5.1.post24 与 Whisper Large-v3。

Windows 整合包下载

GitHub 单文件大小有限,请下载本 Release 的全部 3 个 .part-* 分卷、Join-and-Run-T8star-Aix-Voice-Studio-v0.3.3.cmd 和 SHA256SUMS-GITHUB.txt,放在同一目录后运行 CMD。脚本会先拼接并验证 SHA-256,再启动完整自解压包。

完整自解压 EXE SHA-256:df96cc0d5283f1babb6068f13d983219565e67d764ca650028cf131fe7feaf83

标准流式建议 12 GB NVIDIA 显存;Fast All 实验模式建议 24 GB。Windows 任务管理器默认常显示 3D 图表,观察推理请切换到 CUDA / Compute 图表,或直接查看应用内“实际推理设备”。CPU 仍会参与逐 token 调度和 WAV 写入。

注意:此构建未签名。源码为 Apache-2.0;Breeze TTS 2 模型及自托管输出仅限研究与非商业用途,克隆声音前请取得充分授权。

T8star-Aix Voice Studio v0.3.2 · FlashAttention

Choose a tag to compare

@T8mars T8mars released this 04 Sep 05:09

T8star-Aix Voice Studio v0.3.2

本版本把 FlashAttention 2.8.3 直接包含在 Windows 私有运行时中,无需用户安装或本地编译。

  • Python 3.10.20
  • PyTorch 2.9.1 + CUDA 12.8
  • FlashAttention 2.8.3(T5Gemma2 文本编码器)
  • SHA256 固定的 GitHub 预编译 Windows wheel
  • 打包后环境已执行导入、版本、CUDA 内核和完整语音生成验证
  • Breeze 自定义 backbone/depth decoder 保持 Eager;Fast All 保持 SDPA CUDA Graph

下载与安装

下载本 Release 的全部 .part-### 文件、Join-and-Run-*.cmd 和 SHA256SUMS-GITHUB.txt,放在同一个目录,然后运行 CMD。脚本会合并自解压 EXE、校验整包 SHA-256,校验成功后才启动安装包。

注意:本次 Windows EXE 未配置 Authenticode 生产证书,因此为未签名版本。Breeze 模型权重仍需首次运行时接受许可证后下载,不包含在公开整合包内。

T8star-Aix Voice Studio v0.2.9

Choose a tag to compare

@T8mars T8mars released this 03 Sep 10:26

本版为创作者入口与分发说明更新,同时保留 v0.2.8 的全部功能。

主要更新:

  • 桌面整合包新增 T8star-Aix 的 GitHub、Hugging Face、B站和 YouTube 入口,并与 BreezeBlue 官方项目链接分组显示。
  • 主项目和 ComfyUI 节点 README 同步四个入口。
  • Hugging Face 模型仓库现已包含完整 comfyui-breeze-tts-T8/ 节点目录和四份可拖入 ComfyUI 的工作流。
  • 继续内置 faster-whisper 1.2.1 与 Whisper Small,默认转写可离线使用。
  • 保留参考音频音色库、批量示例、多角色音色选择、可编辑时间轴、单句重跑回填、逐句演绎、行内声音事件和自动重混音。

Windows 下载:

  1. 下载两个 .part-### 文件、Join-and-Run-T8star-Aix-Voice-Studio-v0.2.9.cmd 和 SHA256SUMS-GITHUB.txt 到同一目录。
  2. 双击 CMD;它会合并分卷、校验 SHA-256,然后启动自解压整合包。
  3. 当前 EXE 未做 Authenticode 签名;如 SmartScreen 拦截,请先核对校验文件。

路径说明:

  • 桌面 Breeze 主模型:%APPDATA%\T8star-Aix Voice Studio\models\Breeze-TTS-2
  • 桌面内置 Whisper Small:应用内部 resources\backend\models\faster-whisper-small
  • ComfyUI 节点:ComfyUI\custom_nodes\comfyui-breeze-tts-T8
  • ComfyUI Breeze 主模型:ComfyUI\models\breeze_tts\BreezeBlue_Breeze-TTS-2

Breeze 模型仍受 BreezeBlue Research and Non-Commercial License 约束;请确保拥有参考声音的合法授权。

T8star-Aix Voice Studio v0.2.8

Choose a tag to compare

@T8mars T8mars released this 03 Sep 09:45

本版修复用户实测问题,并完成默认离线转写能力。

主要更新:

  • Whisper Small 模型与 faster-whisper 1.2.1 已内置;默认 Small 可离线转写,不再要求首次安装。
  • 修复便携 Python 受管环境导致的 Whisper 修复安装失败。
  • 批量文本默认带可运行示例,五种格式均可一键载入;首页 SRT/多人对白模板会加载匹配示例。
  • 修复删除音色后再次新建无反应;新增明确的“开始新建”状态重置入口。
  • 多角色页“默认角色”支持从已保存音色库下拉选择,自动回填角色名并在解析后绑定音色。
  • 修复 [笑]、[咳嗽]、[清嗓子]、[叹气] 被误识别为角色名的问题。
  • 保留参考音频上传/试听/替换、可编辑时间轴、单句重跑回填、逐句演绎与自动重混音。

Windows 下载:

  1. 下载两个 .part-### 文件和 Join-and-Run-....cmd 到同一目录。
  2. 双击 CMD;它会合并、校验 SHA-256,然后启动自解压包。
  3. 当前 EXE 未做 Authenticode 签名;如 SmartScreen 拦截,请先核对 SHA256SUMS-GITHUB.txt。

模型路径说明(互不共用):

  • 桌面 Breeze 主模型:%APPDATA%\T8star-Aix Voice Studio\models\Breeze-TTS-2
  • 桌面内置 Whisper Small:应用内部 resources\backend\models\faster-whisper-small
  • 桌面其他 Whisper 规格缓存:%APPDATA%\T8star-Aix Voice Studio\models\whisper
  • ComfyUI Breeze 主模型:ComfyUI\models\breeze_tts\BreezeBlue_Breeze-TTS-2

Breeze 模型仍受 BreezeBlue Research and Non-Commercial License 约束;请确保拥有参考声音的授权。

T8star-Aix Voice Studio v0.2.4

Choose a tag to compare

@T8mars T8mars released this 02 Sep 16:43

本版重点

  • 完成与 IndexTTS 2.5 整合包相近的时间轴单句重跑闭环:重跑前自动保存,生成后回填目标句,并在音频齐全时自动重混完整时间轴。
  • 时间轴逐句显示等待、生成中、完成和失败状态,支持试听与下载最新结果;失败时保留并明确标注上次成功音频。
  • 工程 revision 全链路并发保护,防止把旧文本生成的音频写入已修改台词;缺少 revision 或 line_id 的旧请求安全降级为 one-shot。
  • 完整工程只生成缺失、失败或生成参数已变化的台词;仅修改时间点时直接重混,不重复推理。
  • 生成期间锁定时间轴编辑与工程操作,避免前后端状态漂移。

Windows 下载方法

下载两个 .part-### 分卷、Join-and-Run-T8star-Aix-Voice-Studio-v0.2.4.cmd 和 SHA256SUMS-GITHUB.txt 到同一目录,然后运行 CMD。脚本会合并、校验 SHA-256,再启动自解压包。模型权重仍在首次使用并接受 BreezeBlue 非商业许可后下载,不包含在安装包中。

本构建未使用 Authenticode 商业证书,Windows 可能显示 SmartScreen 提示。

ComfyUI 节点

comfyui-breeze-tts-T8-v0.2.4.zip 保持 8 个节点及标准 AUDIO 契约。不会安装、升级或降级宿主的 Torch、Torchaudio、Transformers、Tokenizers 或 NumPy;兼容范围保持 transformers>=4.57,<6。

验证

  • Python:71 passed
  • Desktop UI:13/13 passed
  • Electron 主进程与 Forge 分发配置:通过
  • GitHub Actions:通过
  • Windows 便携包、7-Zip 自解压包、发布清单与分卷重组 SHA-256:通过

T8star-Aix Voice Studio v0.2.3

Choose a tag to compare

@T8mars T8mars released this 01 Sep 10:30

Breeze TTS 2 Voice Studio v0.2.3

本次版本重点优化“从创作目标到开始生成”的路径,并修复 Windows 正式打包时锁文件哈希受换行符影响的问题。

新功能与体验优化

  • 新增短视频旁白、多人对白、有声书、广告口播和 SRT 配音快速模板。
  • 新增平静、温暖、兴奋、紧张、悲伤、低声、纪录片等 Breeze 原生自然语言演绎配方。
  • 单句与批量任务增加跨分页全局进度、快速返回和取消入口。
  • 启动配置收进高级区域;模板启动时持续显示模型加载进度和可操作错误。
  • 窄窗口导航自动换行,补齐方向键、Home/End 和 ARIA 分页语义。
  • 修复 Windows CRLF/LF 导致运行时锁文件校验误报的问题。

Windows 整合包下载

GitHub 限制单个 Release 文件必须小于 2 GiB,因此整合包分为两个经过校验的分卷:

  1. 下载两个 .part-### 文件和 Join-and-Run-T8star-Aix-Voice-Studio-v0.2.3.cmd,放在同一目录。
  2. 双击 CMD;它会合并出原始自解压 EXE,并在启动前验证 SHA-256。
  3. 建议至少预留 12 GiB 磁盘空间。模型权重不包含在整合包中,接受 BreezeBlue 模型许可证后由应用下载。

本 Windows 构建未配置正式 Authenticode 证书,因此会显示为未签名。可使用 SHA256SUMS-GITHUB.txt 独立核对;合并后 EXE 的 SHA-256 为:

eb35aace9776cbac2445cd73d6c2685f9e252ef315881f6718717a4c6534b9bc

ComfyUI 节点

下载 comfyui-breeze-tts-T8-v0.2.3.zip,解压后确保目录名为 comfyui-breeze-tts-T8。受保护的 Torch、Transformers、Tokenizers 和 NumPy 继续由 ComfyUI 宿主环境管理;兼容范围保持 transformers>=4.57,<6。

验证结果

  • 后端自动化测试:61 项通过。
  • 桌面 UI / 主进程回归:11 项通过。
  • npm 全量审计:0 个漏洞。
  • Python 运行时:CPython 3.10.20、PyTorch 2.9.1+cu128、Transformers 4.57.3。
  • 自解压包通过 7-Zip 全量测试,分卷串联合并哈希与原始 EXE 完全一致。

Breeze TTS 2 模型权重及相关用途受 BreezeBlue Research and Non-Commercial License 约束。本项目为非官方整合。