Skip to content

Releases: Goldloli/asrbox

ASRbox v0.1.3

Choose a tag to compare

@github-actions github-actions released this 26 Jul 08:37

ASRbox demo

ASRbox v0.1.3v0.1.1 之后的首个稳定版,包含 0.1.2-rc.1 / 0.1.2-rc.2 的全部内容:新增端到端说话人分离模型 MOSS-Transcribe-Diarize、模型页详细介绍、模型存储迁移与打包修复,以及设置页布局与文档改进。

中文 README · English README

当前 DMG 未签名、未公证,仅支持 Apple Silicon Mac。首次打开如提示"ASRbox.app 已损坏",在终端执行一次 xattr -cr /Applications/ASRbox.app 即可,详见 README。

下载

下载后建议校验:

shasum -a 256 -c SHA256SUMS.txt

本版本变化

AI 字幕核对

  • 新增 MOSS-Transcribe-Diarize 0.9B(Apache 2.0):OpenMOSS 端到端音频理解模型,单次推理同时产出转写文本、段级时间戳和 [S01]/[S02] 说话人标签,支持 50+ 语言、单次约 90 分钟音频。无需配置 HF_TOKEN,不再依赖 pyannote 两段式分离;任务链路保留模型原生说话人标签并自动跳过 pyannote 后处理。INTERSPEECH 2026 MLC-SLM Challenge 第一名。
  • 模型页详细介绍:每张模型卡片新增"模型介绍"展开区,展示能力、语言覆盖、适用场景与已知限制(中英文),覆盖全部 15 个已注册模型;新增"说话人分离"分类。
  • 模型存储迁移修复:迁移模型存储后,Qwen3-ASR / FunASR 记录的绝对快照路径会重新锚定到新根目录,不再出现 "Unrecognized processing class" 加载失败。
  • 打包稳定性:冻结后端完整内置 FunASR 模块注册表并启动时预导入;卡死的本地转写 worker 会在可配置的无进展窗口(默认 20 分钟)后终止,任务以 LOCAL_WORKER_STALLED 失败且已完成分片可重试,不再永久卡住队列。
  • 设置页"存储与诊断"布局修复:恢复双栏网格(健康中心 | 模型存储位置、媒体存储 | 数据路径),消除右栏空白;"最近错误"卡片截断为 3 行,完整内容悬停可见。
  • 安装指引:README 补充未签名应用"已损坏"提示的说明与 xattr -cr 修复命令(中英文,含截图)。
  • 隐私与仓库卫生.beads/interactions.jsonl(agent 交互记录)移出版本控制;审计截图输出目录不再纳入跟踪;OpenSpec 五个已上线 change 全部归档,17 个 spec 职责说明补齐。
  • 全部变化见 CHANGELOG

验证情况

  • MOSS-Transcribe-Diarize 在 Apple Silicon 上完成真实双人采访 MP4(6.8 分钟)转写:161 个带时间戳分段,原生输出 3 个说话人标签,SRT/TXT 导出均携带 [Sxx] 标签。
  • 冻结二进制冒烟在 CI macOS runner 上通过,包含 moss_transcribe_diarize_available 运行时探测。
  • GitHub Actions CI 与 Release 流程(typecheck、后端 pytest、Rust check/test、Playwright 冒烟、Docker 部署冒烟、DMG 构建)全部通过。

已知限制

  • 仅支持 macOS Apple Silicon;Docker 为 Linux CPU(不含 MLX),默认绑定回环地址。
  • MOSS-Transcribe-Diarize 无词级时间戳、不支持流式,CPU 上长音频较慢;说话人标签为录音内的匿名相对标签,不代表真实身份。
  • 引用模式下移动或删除源文件会使相关任务的播放与重转写失败,需通过"重新链接"修复。
  • Provider 密钥在数据库中明文存储;模型需单独下载,可能占用较多磁盘与内存。

ASRbox v0.1.2-rc.2

ASRbox v0.1.2-rc.2 Pre-release
Pre-release

Choose a tag to compare

@github-actions github-actions released this 25 Jul 19:17

ASRbox demo

ASRbox v0.1.2-rc.2v0.1.2-rc.1 之后的功能候选版:新增端到端说话人分离模型 MOSS-Transcribe-Diarize,模型页为全部 15 个本地模型提供详细介绍,并把 agent 交互记录移出版本控制。

中文 README · English README

这是预发布版本,不是稳定版。当前 DMG 尚未签名或公证,仅支持 Apple Silicon Mac。

下载

下载后建议校验:

shasum -a 256 -c SHA256SUMS.txt

本版本变化

AI 字幕核对

  • 新增 MOSS-Transcribe-Diarize 0.9B(Apache 2.0):OpenMOSS 端到端音频理解模型,单次推理同时产出转写文本、段级时间戳和 [S01]/[S02] 说话人标签,支持 50+ 语言、单次约 90 分钟音频。无需配置 HF_TOKEN,不再依赖 pyannote 两段式分离;任务链路会保留模型原生说话人标签并自动跳过 pyannote 后处理。INTERSPEECH 2026 MLC-SLM Challenge 第一名。
  • 模型页详细介绍:每张模型卡片新增"模型介绍"展开区,展示能力、语言覆盖、适用场景与已知限制(中英文),覆盖全部 15 个已注册模型;新增"说话人分离"分类。
  • 隐私清理.beads/interactions.jsonl(agent 交互/活动记录)从版本控制移除并加入忽略清单。
  • 全部变化见 CHANGELOG

验证情况

  • MOSS-Transcribe-Diarize 在 Apple Silicon 上完成真实双人采访 MP4(6.8 分钟)转写:161 个带时间戳分段,原生输出 3 个说话人标签,SRT/TXT 导出均携带 [Sxx] 标签。
  • 新增聚焦测试:引擎分段解析、兼容性检查、原生说话人标签跳过 pyannote、max_new_tokens 时长缩放、模型详情展开区 e2e。
  • GitHub Actions CI 与 Release 流程(typecheck、后端 pytest、Rust check/test、Playwright 冒烟、Docker 部署冒烟、DMG 构建与冻结二进制冒烟)全部通过。

已知限制

  • 仅支持 macOS Apple Silicon;Docker 为 Linux CPU(不含 MLX),默认绑定回环地址。
  • MOSS-Transcribe-Diarize 无词级时间戳、不支持流式,CPU 上长音频较慢;说话人标签为录音内的匿名相对标签,不代表真实身份。
  • 引用模式下移动或删除源文件会使相关任务的播放与重转写失败,需通过"重新链接"修复。
  • Provider 密钥在数据库中明文存储;模型需单独下载,可能占用较多磁盘与内存。

ASRbox v0.1.2-rc.1

ASRbox v0.1.2-rc.1 Pre-release
Pre-release

Choose a tag to compare

@github-actions github-actions released this 25 Jul 16:14

ASRbox demo

ASRbox v0.1.2-rc.1v0.1.1 之后的修复候选版:修复迁移模型存储后多个本地模型无法加载的问题,以及本地转写 worker 卡死导致任务永不结束的问题。

中文 README · English README

这是预发布版本,不是稳定版。当前 DMG 尚未签名或公证,仅支持 Apple Silicon Mac。

下载

下载后建议校验:

shasum -a 256 -c SHA256SUMS.txt

本版本修复

AI 字幕核对

  • 迁移模型存储后模型加载失败model.json 记录的绝对 snapshot 路径在迁移后失效,导致 Qwen3-ASR 报 "Unrecognized processing class"、SenseVoice(FunASR)拿到无法加载的路径。现在会在当前存储根下重新定位 snapshot。
  • 打包应用内 SenseVoice 无法使用:FunASR 的模型注册表在冻结环境中为空。冻结后端现在打包并在启动时预导入全部 funasr 子模块,注册恢复正常。
  • 本地转写卡死:本地 worker 推理挂死时,任务曾永远停在"转写中"并阻塞后续排队任务。现在超过 20 分钟无进展(可用 ASRBOX_LOCAL_WORKER_STALL_SECONDS 调整)会强制终止 worker,任务以 LOCAL_WORKER_STALLED 失败,已完成分块可重试。
  • 全部变化见 CHANGELOG

验证情况

  • 14 个本地模型在 Apple Silicon 上逐一完成加载与真实音频转写(含 Qwen3-ASR、SenseVoice、whisper、faster-whisper、MLX 全系)。
  • 冻结后端二进制逐项验证:sensevoice-small 与 qwen3-asr-1.7b 端到端转写通过;worker 卡死看门狗有聚焦测试。
  • GitHub Actions CI 与 Release 流程(typecheck、后端 pytest、Rust check/test、Playwright 冒烟、Docker 部署冒烟、DMG 构建与冻结二进制冒烟)全部通过。

已知限制

  • 仅支持 macOS Apple Silicon;Docker 为 Linux CPU(不含 MLX),默认绑定回环地址。
  • 引用模式下移动或删除源文件会使相关任务的播放与重转写失败,需通过"重新链接"修复。
  • Provider 密钥在数据库中明文存储;模型需单独下载,可能占用较多磁盘与内存。

ASRbox v0.1.1

Choose a tag to compare

@github-actions github-actions released this 25 Jul 13:54

ASRbox demo

ASRbox v0.1.1 是一个面向 macOS Apple Silicon 的本地优先音视频转写工具箱,并提供 Linux CPU Docker 部署与 AI 字幕核对工作区。本版本的主题是媒体文件不再强制复制:桌面端默认直接引用原文件,存储位置全面可配置。

中文 README · English README

当前 DMG 尚未签名或公证,仅支持 Apple Silicon Mac。Docker 镜像需从源码构建。

下载

下载后建议校验:

shasum -a 256 -c SHA256SUMS.txt

本版本亮点

AI 字幕核对

  • 桌面端默认引用原文件:导入音视频不再复制到应用目录,没有 importing 等待,大文件零额外占用;设置中可切回"复制到上传文件夹"模式。浏览器与 Docker 上传仍为托管复制。
  • 删除绝对安全:任务按 managed/external 记录媒体所有权,删除任务、批量删除与存储清理只移除 ASRbox 托管文件,绝不触碰你的原始文件。
  • 存储位置可配置:上传目录与派生音频目录均可在设置中修改(支持外置硬盘),仅对新任务生效;Docker 端通过 Compose 注释掉的 /data/uploads bind mount 挂载外置盘(含 macOS 与 Windows 示例)。
  • 拖拽导入一致化:桌面端拖拽改用原生系统事件,与文件选择器一样遵循引用/复制模式。
  • 源文件失踪可修复:源文件被移动或删除后,可在任务中"重新链接"到新路径。
  • 可选自动清理:转写成功后自动删除派生音频(规范化 WAV 与分片),进一步省空间。
  • 全部变化见 CHANGELOG

首次使用

  1. 下载 DMG,将 ASRbox.app 拖入"应用程序"。
  2. 因当前版本未签名,首次启动请右键应用并选择"打开",或在"系统设置 → 隐私与安全性"中允许打开。
  3. 等待界面显示后端在线。
  4. 在"模型"页先下载一个模型;快速验证可使用 faster-whisper-base,Apple Silicon 推荐尝试 mlx-whisper-turbo
  5. 新建任务,拖入或选择音频或视频——默认不再复制原文件;完成转写后导出所需字幕格式。

验证情况

  • GitHub Actions CI:TypeScript typecheck、Web UI 构建、后端 pytest(182 项,含媒体摄取/删除守卫/重新链接覆盖)、Rust check/test 与 Playwright 浏览器冒烟全部通过。
  • Docker 构建与部署冒烟(健康检查、持久化、token、模型存储迁移)在 CI 与 Release 流程中通过。
  • Release 资产经过校验脚本核对。

已知限制

  • 仅支持 macOS Apple Silicon;Docker 为 Linux CPU(不含 MLX),默认绑定回环地址,不是公网网关。
  • 引用模式下移动或删除源文件会使相关任务的播放与重转写失败,需通过"重新链接"修复。
  • 备份仅覆盖应用数据目录内的托管数据;被引用的原始媒体不在备份范围内。
  • Provider 密钥在数据库中明文存储;模型需单独下载,可能占用较多磁盘与内存。

ASRbox v0.1.0-rc.2

ASRbox v0.1.0-rc.2 Pre-release
Pre-release

Choose a tag to compare

@github-actions github-actions released this 22 Jul 14:35

ASRbox demo

ASRbox v0.1.0-rc.2 是一个面向 macOS Apple Silicon 的本地优先音视频转写工具箱,并新增 Linux CPU Docker 部署与 AI 字幕核对工作区。它支持 14 个本地 ASR 模型、在线 Provider、模型下载管理、字幕编辑与多格式导出。

中文 README · English README

这是发布候选版本,不是稳定版。当前 DMG 尚未签名或公证,仅支持 Apple Silicon Mac。

下载

下载后建议校验:

shasum -a 256 -c SHA256SUMS.txt

本版本亮点

  • 相比 v0.1.0-beta.1 的全部变化见 CHANGELOG
  • 新增源码构建的 Linux CPU Docker 部署:多阶段非 root 镜像、同源 Web UI/API、内置 ffmpeg、健康检查与持久化 /data 卷。
  • Compose 默认仅绑定回环地址,主机端口、绑定地址、API token 与宿主机 Ollama 连接均可配置。
  • 新增独立 AI 工作区:LLM 字幕核对、Provider 预设与连通性测试、有序建议、可折叠的纠错区间,以及显式生成新版本的应用方式。
  • 模型存储位置可在设置中迁移,支持选择目标目录、接管已有数据、共享缓存处理与进度轮询。
  • Docker 与 AI 核对均提供中文和英文文档。

首次使用

  1. 下载 DMG,将 ASRbox.app 拖入“应用程序”。
  2. 因当前版本未签名,首次启动请右键应用并选择“打开”,或在“系统设置 → 隐私与安全性”中允许打开。
  3. 等待界面显示后端在线。
  4. 在“模型”页先下载一个模型;快速验证可使用 faster-whisper-base,Apple Silicon 推荐尝试 mlx-whisper-turbo
  5. 新建任务,选择音频或视频,完成转写后导出所需字幕格式。

验证情况

  • GitHub Actions CI:TypeScript typecheck、Web UI 构建、后端 pytest、Rust check/test 与 Playwright 浏览器冒烟全部通过。
  • Docker 构建与部署冒烟(健康检查、持久化、token、模型存储迁移)在 CI 与 Release 流程中通过。
  • Release 资产经过校验脚本核对。

ASRbox v0.1.0-beta.1

ASRbox v0.1.0-beta.1 Pre-release
Pre-release

Choose a tag to compare

@github-actions github-actions released this 13 Jul 12:52

ASRbox demo

ASRbox v0.1.0-beta.1 是一个面向 macOS Apple Silicon 的本地优先音视频转写工具箱。它支持 14 个本地 ASR 模型、在线 Provider、模型下载管理、字幕编辑与多格式导出。

中文 README · English README

这是公开 Beta,不是稳定版。当前 DMG 尚未签名或公证,仅支持 Apple Silicon Mac。

下载

下载后建议校验:

shasum -a 256 -c SHA256SUMS.txt

本版本亮点

  • 14 个本地模型:Whisper、Faster Whisper、MLX Whisper、SenseVoice 和 Qwen3-ASR。
  • 模型下载支持暂停、继续、停止和失败重试,并显示真实目录与磁盘占用。
  • 修复 Transformers Whisper / Qwen3-ASR 的 TorchCodec 加载失败,冻结后端不再依赖 TorchCodec。
  • 支持音频和视频预检、任务恢复、字幕编辑、版本历史与诊断信息。
  • 支持 TXT、SRT、VTT、ASS、JSON 和 Markdown 导出。
  • 桌面端内置 FastAPI sidecar、ffmpeg 和 ffprobe;模型权重按需单独下载。

首次使用

  1. 下载 DMG,将 ASRbox.app 拖入“应用程序”。
  2. 因当前版本未签名,首次启动请右键应用并选择“打开”,或在“系统设置 → 隐私与安全性”中允许打开。
  3. 等待界面显示后端在线。
  4. 在“模型”页先下载一个模型;快速验证可使用 faster-whisper-base,Apple Silicon 推荐尝试 mlx-whisper-turbo
  5. 新建任务,选择音频或视频,完成转写后导出所需字幕格式。

验证情况

  • Release workflow 的依赖审计、版本检查、后端测试、TypeScript、Web 构建、Cargo 和 Playwright smoke 均通过。
  • 冻结后端 smoke test 通过。
  • 14/14 本地模型在维护者的 Apple Silicon 环境中使用真实 MP4 片段完成非空转写。
  • 发布的 DMG、FFmpeg 源码包和 SHA256SUMS.txt 已独立重新下载并校验。

已知限制

  • 仅发布 macOS Apple Silicon 安装包。
  • DMG 尚未签名和 Apple notarization。
  • 暂无自动更新、Windows/Linux 安装包和 Intel Mac 构建。
  • Provider API 密钥目前以明文保存在本机 asrbox.db 和应用备份中。
  • 模型不会包含在 DMG 中;下载全部模型可能占用数十 GB 空间。

本地数据

默认数据与模型目录:

~/Library/Application Support/com.goldloli.asrbox/
~/Library/Application Support/com.goldloli.asrbox/models/

删除应用不会自动删除模型、任务、备份或已经导出的字幕。

完整变更: v0.1.0-rc.1...v0.1.0-beta.1

ASRbox v0.1.0-rc.1

ASRbox v0.1.0-rc.1 Pre-release
Pre-release

Choose a tag to compare

@github-actions github-actions released this 08 Jul 06:19