-
Notifications
You must be signed in to change notification settings - Fork 1
LLM Performance
LeonXu edited this page Mar 21, 2026
·
4 revisions
最后更新:2026-03-21 测试环境:macOS, 中国大陆网络(无代理) 测试方法:非流式 API 调用,同一条语音纠错请求(约 20 字中文输入,期望输出 ~20 字)
| 排名 | 服务商 | 模型 | 总延迟 | 输入→输出 tokens | 纠错质量 | 备注 |
|---|---|---|---|---|---|---|
| 1 | DeepSeek | deepseek-chat | 126ms | 42→16 | ✅ 正确 | 国内最快,价格最低 |
| 2 | 阿里云百炼 | qwen-turbo | 469ms | 56→16 | ✅ 正确 | 稳定,推荐日常使用 |
| 3 | 智谱 | glm-4-flash | 922ms | 45→19 | ✅ 正确 | 免费额度充足 |
| 4 | 火山引擎 | doubao-seed-2-0-mini | 1367ms | 73→96 | ✅ 正确 | 输出 token 偏多(含思考过程) |
| 5 | Kimi | moonshot-v1-auto | 2822ms | 49→16 | ✅ 正确 | 延迟偏高 |
| 6 | MiniMax | MiniMax-M2.5 | 8271ms | 49→101 | 输出包含 <think> 标签 |
|
| — | 讯飞 | spark-lite | — | — | — | 鉴权未通过 |
| — | Groq | llama-3.3-70b | — | — | — | 需海外网络 |
原文:今天天气不措,我想去公远散步,顺便买点东西回家做反。
期望:今天天气不错,我想去公园散步,顺便买点东西回家做饭。
| 场景 | 推荐 | 理由 |
|---|---|---|
| 日常使用(推荐) | 阿里云百炼 qwen-turbo | 延迟低、稳定、质量好 |
| 极致速度 | DeepSeek | 126ms 最快,但高峰期可能波动 |
| 免费试用 | 智谱 glm-4-flash | 免费额度多,质量不错 |
| 海外用户 | Groq | 自研硬件极快,需海外网络 |
- 延迟会因网络、时段、负载波动,以上数据为单次测试,仅供参考
- DeepSeek 在高峰期(北京时间晚 8-11 点)延迟可能升至 5-10 秒
- 火山引擎 输出 token 多是因为模型自带思考过程,可通过调整 prompt 缓解
-
MiniMax 的
<think>标签说明模型在做推理,实际输出需要后处理过滤 - 所有测试基于非流式调用,流式(打字机模式)的首 token 延迟会更短
- Groq 需要海外网络访问,国内直连会 403