ASRbox v0.1.3 是 v0.1.1 之后的首个稳定版,包含 0.1.2-rc.1 / 0.1.2-rc.2 的全部内容:新增端到端说话人分离模型 MOSS-Transcribe-Diarize、模型页详细介绍、模型存储迁移与打包修复,以及设置页布局与文档改进。
当前 DMG 未签名、未公证,仅支持 Apple Silicon Mac。首次打开如提示"ASRbox.app 已损坏",在终端执行一次
xattr -cr /Applications/ASRbox.app即可,详见 README。
下载
- ASRbox_0.1.3_aarch64.dmg — macOS Apple Silicon 安装包
- SHA256SUMS.txt — DMG 与源码包校验值
- ASRbox-ffmpeg-source-8.1.2.tar.gz — 内置 FFmpeg 对应源码与构建材料
下载后建议校验:
shasum -a 256 -c SHA256SUMS.txt本版本变化
- 新增 MOSS-Transcribe-Diarize 0.9B(Apache 2.0):OpenMOSS 端到端音频理解模型,单次推理同时产出转写文本、段级时间戳和
[S01]/[S02]说话人标签,支持 50+ 语言、单次约 90 分钟音频。无需配置HF_TOKEN,不再依赖 pyannote 两段式分离;任务链路保留模型原生说话人标签并自动跳过 pyannote 后处理。INTERSPEECH 2026 MLC-SLM Challenge 第一名。 - 模型页详细介绍:每张模型卡片新增"模型介绍"展开区,展示能力、语言覆盖、适用场景与已知限制(中英文),覆盖全部 15 个已注册模型;新增"说话人分离"分类。
- 模型存储迁移修复:迁移模型存储后,Qwen3-ASR / FunASR 记录的绝对快照路径会重新锚定到新根目录,不再出现 "Unrecognized processing class" 加载失败。
- 打包稳定性:冻结后端完整内置 FunASR 模块注册表并启动时预导入;卡死的本地转写 worker 会在可配置的无进展窗口(默认 20 分钟)后终止,任务以
LOCAL_WORKER_STALLED失败且已完成分片可重试,不再永久卡住队列。 - 设置页"存储与诊断"布局修复:恢复双栏网格(健康中心 | 模型存储位置、媒体存储 | 数据路径),消除右栏空白;"最近错误"卡片截断为 3 行,完整内容悬停可见。
- 安装指引:README 补充未签名应用"已损坏"提示的说明与
xattr -cr修复命令(中英文,含截图)。 - 隐私与仓库卫生:
.beads/interactions.jsonl(agent 交互记录)移出版本控制;审计截图输出目录不再纳入跟踪;OpenSpec 五个已上线 change 全部归档,17 个 spec 职责说明补齐。 - 全部变化见 CHANGELOG。
验证情况
- MOSS-Transcribe-Diarize 在 Apple Silicon 上完成真实双人采访 MP4(6.8 分钟)转写:161 个带时间戳分段,原生输出 3 个说话人标签,SRT/TXT 导出均携带
[Sxx]标签。 - 冻结二进制冒烟在 CI macOS runner 上通过,包含
moss_transcribe_diarize_available运行时探测。 - GitHub Actions CI 与 Release 流程(typecheck、后端 pytest、Rust check/test、Playwright 冒烟、Docker 部署冒烟、DMG 构建)全部通过。
已知限制
- 仅支持 macOS Apple Silicon;Docker 为 Linux CPU(不含 MLX),默认绑定回环地址。
- MOSS-Transcribe-Diarize 无词级时间戳、不支持流式,CPU 上长音频较慢;说话人标签为录音内的匿名相对标签,不代表真实身份。
- 引用模式下移动或删除源文件会使相关任务的播放与重转写失败,需通过"重新链接"修复。
- Provider 密钥在数据库中明文存储;模型需单独下载,可能占用较多磁盘与内存。

