Skip to content

ASR Model Comparison

LeonXu edited this page Mar 24, 2026 · 3 revisions

ASR 模型对比与推荐

测试日期: 2026-03-24 测试环境: MacBook Pro (Apple Silicon), macOS 26, SpeakOut v1.5.20 测试方式: 对着电脑麦克风正常语速说话,每个模型 2-3 次录音,取典型结果

推荐等级

等级 含义
⭐⭐⭐ 推荐日常使用
⭐⭐ 可用,有明显短板
不推荐

离线模型(推荐)

离线模型在录音结束后一次性识别,准确率通常高于流式模型。

SenseVoice 2024 ⭐⭐⭐ (默认推荐)

项目 数据
来源 阿里达摩院
大小 ~228MB
解码速度 55x 实时(20s 音频 → 0.4s 解码)
内置标点 ✅ 是
支持语言 中/英/日/韩/粤

优点: 速度极快、中文质量好、内置标点免配置 缺点: 英文专有词偶尔出错 测试样例:

输入 (20s): "好,现在用SenseVoice测试一下,我们接下来认真地要去做下一件事儿,就是这个基于客户个性化的离线ASR,看看效果怎么样吧。"
输出: "好,现在用sense files测试一下,我们接下来肯恳的要去做一万一件事儿,就是这个基于客户个性化的离线S啊,看看效果怎么样吧。"

Paraformer Offline ⭐⭐⭐

项目 数据
来源 阿里达摩院 (FunASR)
大小 ~217MB
解码速度 70x 实时(11s 音频 → 0.16s 解码)
内置标点 ❌ 需配合标点模型
支持语言 中/英

优点: 所有模型中最快、中文质量好、成熟稳定 缺点: 无内置标点(需另下载标点模型)、英文专有词弱 测试样例:

输入 (11s): "现在测试的是Paraformer离线版总共两百兆试试看速度效果质量"
输出: "现在测试的是 platformer 离线版总共两百兆试试看速度效果质量"

Paraformer Dialect 2025 ⭐⭐⭐

项目 数据
来源 阿里达摩院
大小 ~218MB
解码速度 66x 实时
内置标点 ❌ 需配合标点模型
支持语言 中/英 + 四川/重庆方言

优点: 速度与标准版持平、方言支持 缺点: 英文处理倾向逐字母拆解、无内置标点 测试样例:

输入: "现在测试一下Paraformer方言2025版也是两百兆左右看看效果怎么样"
输出: "那现在测试一下 p a r l o f r r m e r 方言二零二五版也是两百兆左右看看效果怎么样"

SenseVoice 2025 ⭐⭐

项目 数据
来源 阿里达摩院
大小 ~158MB
解码速度 55x 实时
内置标点 ❌ (2024 版有,2025 版移除了)
支持语言 中/英/日/韩/粤(粤语增强)

优点: 体积更小、粤语增强 缺点: 失去了内置标点、英文专有词同样弱 备注: 如果不需要粤语增强,建议用 2024 版

FireRedASR Large ⭐⭐

项目 数据
来源 小红书 FireRedTeam
大小 ~1.4GB
解码速度 3.4x 实时(12s 音频 → 3.7s 解码)
内置标点 ❌ 需配合标点模型
支持语言 中/英 + 四川/河南方言

优点: 中文质量好、支持方言 缺点: 体积大、解码速度较慢(是 SenseVoice 的 1/16) 测试样例:

输入 (12s): "测试一下纯语音的纯离线的语音识别模型看看效果怎么样因为之前出现了音频断裂的情况"
输出: "测试一下纯语音的纯离线的语音识别模型看看效果怎么样因为中之前出现了音频断裂的情况"

Whisper Large-v3 ⭐

项目 数据
来源 OpenAI
大小 ~1.0GB
解码速度 1.5x 实时(27s 音频 → 17s 解码)
内置标点 ✅ 是
支持语言 99 种语言

优点: 语言覆盖最广、有内置标点 缺点: 中文识别质量差(大量丢字)、解码极慢、简繁体不可控 不推荐中文场景使用 测试样例:

输入 (28s): "Whisper Large V3这个模型怎么给它设置语言呢它现在这个语言自动识别为繁体了..."
输出: "Vespa Large V3这个模型怎么给它置言呢它现在这个言自动别为体了..."

流式模型

流式模型在录音过程中实时识别,悬浮窗可看到逐字输出。适合需要实时反馈的场景。

Paraformer Bilingual (Streaming) ⭐⭐⭐

项目 数据
来源 阿里达摩院
大小 ~1GB
内置标点 ❌ 需配合标点模型
支持语言 中/英

优点: 流式中质量最好、无重复问题 缺点: 体积较大、无标点 测试样例:

输入 (20s): "测试另外一个流式模型Paraformer双语模型,大概1GB的大小看看效果。我估计这个怎么说呢?主要取决于对不同切片之间的重复的处理..."
输出: "测试另外一个流式模型 paliforma 双引模型大概依 g b 的大小看看效果我估计这个怎么说呢主要取决于对不同切片之间的重复的处理可能和模型本身关系没那么大但是我现在看这个悬浮窗的字幕我觉得效果是还行"

Zipformer Bilingual ⛔ 已隐藏

项目 数据
来源 k2-fsa / Next-gen Kaldi
大小 ~490MB
架构 Transducer

严重问题: 字符级重复无法消除(Transducer 架构固有缺陷) 已从模型列表中隐藏,不建议使用 测试样例:

输出: "现在在这个切切切换到到柳柳柳柳柳刘刘士士...效果效果果的吧"

标点模型

项目 数据
名称 CT-Transformer 中英标点
大小 ~70MB
用途 为无内置标点的模型补充标点符号

适用模型: Paraformer (离线/流式)、SenseVoice 2025、FireRedASR 不需要: SenseVoice 2024、Whisper(已内置标点) 注意: 切换到无标点模型时,SpeakOut 会自动提示下载


综合推荐

日常使用

SenseVoice 2024 — 速度快、质量好、有标点、零配置

需要实时字幕

Paraformer Bilingual (Streaming) — 唯一推荐的流式模型

追求极致速度

Paraformer Offline — 最快(70x 实时),需配标点模型

粤语场景

SenseVoice 2025 — 粤语增强版,需配标点模型

方言场景

Paraformer Dialect 2025 — 支持四川/重庆方言

多语言(非中文为主)

暂无推荐。Whisper 虽支持 99 语言但中文太差,等未来有更好的多语言模型


共性问题

所有离线模型都存在 英文专有词识别差 的问题(如 "Paraformer" → "platformer"、"SenseVoice" → "sense files")。这是当前离线 ASR 的普遍短板,可通过以下方式缓解:

  1. LLM 润色(智能模式)— AI 后处理修正专有词
  2. 专业词汇表 — 手动添加常用专有词映射
  3. 未来方向 — 个性化 ASR 适配(研究中)

Clone this wiki locally