Skip to content

ASRbox v0.1.2-rc.2

Pre-release
Pre-release

Choose a tag to compare

@github-actions github-actions released this 25 Jul 19:17

ASRbox demo

ASRbox v0.1.2-rc.2v0.1.2-rc.1 之后的功能候选版:新增端到端说话人分离模型 MOSS-Transcribe-Diarize,模型页为全部 15 个本地模型提供详细介绍,并把 agent 交互记录移出版本控制。

中文 README · English README

这是预发布版本,不是稳定版。当前 DMG 尚未签名或公证,仅支持 Apple Silicon Mac。

下载

下载后建议校验:

shasum -a 256 -c SHA256SUMS.txt

本版本变化

AI 字幕核对

  • 新增 MOSS-Transcribe-Diarize 0.9B(Apache 2.0):OpenMOSS 端到端音频理解模型,单次推理同时产出转写文本、段级时间戳和 [S01]/[S02] 说话人标签,支持 50+ 语言、单次约 90 分钟音频。无需配置 HF_TOKEN,不再依赖 pyannote 两段式分离;任务链路会保留模型原生说话人标签并自动跳过 pyannote 后处理。INTERSPEECH 2026 MLC-SLM Challenge 第一名。
  • 模型页详细介绍:每张模型卡片新增"模型介绍"展开区,展示能力、语言覆盖、适用场景与已知限制(中英文),覆盖全部 15 个已注册模型;新增"说话人分离"分类。
  • 隐私清理.beads/interactions.jsonl(agent 交互/活动记录)从版本控制移除并加入忽略清单。
  • 全部变化见 CHANGELOG

验证情况

  • MOSS-Transcribe-Diarize 在 Apple Silicon 上完成真实双人采访 MP4(6.8 分钟)转写:161 个带时间戳分段,原生输出 3 个说话人标签,SRT/TXT 导出均携带 [Sxx] 标签。
  • 新增聚焦测试:引擎分段解析、兼容性检查、原生说话人标签跳过 pyannote、max_new_tokens 时长缩放、模型详情展开区 e2e。
  • GitHub Actions CI 与 Release 流程(typecheck、后端 pytest、Rust check/test、Playwright 冒烟、Docker 部署冒烟、DMG 构建与冻结二进制冒烟)全部通过。

已知限制

  • 仅支持 macOS Apple Silicon;Docker 为 Linux CPU(不含 MLX),默认绑定回环地址。
  • MOSS-Transcribe-Diarize 无词级时间戳、不支持流式,CPU 上长音频较慢;说话人标签为录音内的匿名相对标签,不代表真实身份。
  • 引用模式下移动或删除源文件会使相关任务的播放与重转写失败,需通过"重新链接"修复。
  • Provider 密钥在数据库中明文存储;模型需单独下载,可能占用较多磁盘与内存。