ASRbox v0.1.2-rc.2
Pre-release
Pre-release
ASRbox v0.1.2-rc.2 是 v0.1.2-rc.1 之后的功能候选版:新增端到端说话人分离模型 MOSS-Transcribe-Diarize,模型页为全部 15 个本地模型提供详细介绍,并把 agent 交互记录移出版本控制。
这是预发布版本,不是稳定版。当前 DMG 尚未签名或公证,仅支持 Apple Silicon Mac。
下载
- ASRbox_0.1.2-rc.2_aarch64.dmg — macOS Apple Silicon 安装包
- SHA256SUMS.txt — DMG 与源码包校验值
- ASRbox-ffmpeg-source-8.1.2.tar.gz — 内置 FFmpeg 对应源码与构建材料
下载后建议校验:
shasum -a 256 -c SHA256SUMS.txt本版本变化
- 新增 MOSS-Transcribe-Diarize 0.9B(Apache 2.0):OpenMOSS 端到端音频理解模型,单次推理同时产出转写文本、段级时间戳和
[S01]/[S02]说话人标签,支持 50+ 语言、单次约 90 分钟音频。无需配置HF_TOKEN,不再依赖 pyannote 两段式分离;任务链路会保留模型原生说话人标签并自动跳过 pyannote 后处理。INTERSPEECH 2026 MLC-SLM Challenge 第一名。 - 模型页详细介绍:每张模型卡片新增"模型介绍"展开区,展示能力、语言覆盖、适用场景与已知限制(中英文),覆盖全部 15 个已注册模型;新增"说话人分离"分类。
- 隐私清理:
.beads/interactions.jsonl(agent 交互/活动记录)从版本控制移除并加入忽略清单。 - 全部变化见 CHANGELOG。
验证情况
- MOSS-Transcribe-Diarize 在 Apple Silicon 上完成真实双人采访 MP4(6.8 分钟)转写:161 个带时间戳分段,原生输出 3 个说话人标签,SRT/TXT 导出均携带
[Sxx]标签。 - 新增聚焦测试:引擎分段解析、兼容性检查、原生说话人标签跳过 pyannote、
max_new_tokens时长缩放、模型详情展开区 e2e。 - GitHub Actions CI 与 Release 流程(typecheck、后端 pytest、Rust check/test、Playwright 冒烟、Docker 部署冒烟、DMG 构建与冻结二进制冒烟)全部通过。
已知限制
- 仅支持 macOS Apple Silicon;Docker 为 Linux CPU(不含 MLX),默认绑定回环地址。
- MOSS-Transcribe-Diarize 无词级时间戳、不支持流式,CPU 上长音频较慢;说话人标签为录音内的匿名相对标签,不代表真实身份。
- 引用模式下移动或删除源文件会使相关任务的播放与重转写失败,需通过"重新链接"修复。
- Provider 密钥在数据库中明文存储;模型需单独下载,可能占用较多磁盘与内存。

