Skip to content

LLM Performance

LeonXu edited this page Mar 21, 2026 · 4 revisions

LLM 服务商性能对比

最后更新:2026-03-21 测试环境:macOS, 中国大陆网络(无代理) 测试方法:非流式 API 调用,同一条语音纠错请求(约 20 字中文输入,期望输出 ~20 字)

实测结果

排名 服务商 模型 总延迟 输入→输出 tokens 纠错质量 备注
1 DeepSeek deepseek-chat 126ms 42→16 ✅ 正确 国内最快,价格最低
2 阿里云百炼 qwen-turbo 469ms 56→16 ✅ 正确 稳定,推荐日常使用
3 智谱 glm-4-flash 922ms 45→19 ✅ 正确 免费额度充足
4 火山引擎 doubao-seed-2-0-mini 1367ms 73→96 ✅ 正确 输出 token 偏多(含思考过程)
5 Kimi moonshot-v1-auto 2822ms 49→16 ✅ 正确 延迟偏高
6 MiniMax MiniMax-M2.5 8271ms 49→101 ⚠️ 含思考 输出包含 <think> 标签
讯飞 spark-lite 鉴权未通过
Groq llama-3.3-70b 需海外网络

测试输入

原文:今天天气不措,我想去公远散步,顺便买点东西回家做反。
期望:今天天气不错,我想去公园散步,顺便买点东西回家做饭。

选择建议

场景 推荐 理由
日常使用(推荐) 阿里云百炼 qwen-turbo 延迟低、稳定、质量好
极致速度 DeepSeek 126ms 最快,但高峰期可能波动
免费试用 智谱 glm-4-flash 免费额度多,质量不错
海外用户 Groq 自研硬件极快,需海外网络

注意事项

  • 延迟会因网络、时段、负载波动,以上数据为单次测试,仅供参考
  • DeepSeek 在高峰期(北京时间晚 8-11 点)延迟可能升至 5-10 秒
  • 火山引擎 输出 token 多是因为模型自带思考过程,可通过调整 prompt 缓解
  • MiniMax<think> 标签说明模型在做推理,实际输出需要后处理过滤
  • 所有测试基于非流式调用,流式(打字机模式)的首 token 延迟会更短
  • Groq 需要海外网络访问,国内直连会 403

Clone this wiki locally