Skip to content

LLM Performance

LeonXu edited this page Mar 21, 2026 · 4 revisions

LLM 服务商性能对比

最后更新:2026-03-21 测试环境:macOS, 中国大陆网络(无代理) 测试方法:非流式 API 调用,10 次不同语音纠错输入(约 15-20 字中文),统计延迟分布

实测结果(10 次取统计值)

排名 服务商 模型 最小 平均 中位数 最大 成功率
1 DeepSeek deepseek-chat 113ms 197ms 188ms 417ms 10/10
2 阿里云百炼 qwen-turbo 395ms 512ms 531ms 651ms 10/10
3 Kimi moonshot-v1-auto 681ms 867ms 871ms 1076ms 10/10
4 智谱 glm-4-flash 509ms 1058ms 813ms 2214ms 10/10
5 火山引擎 doubao-seed-2-0-mini 773ms 2458ms 1042ms 13310ms 10/10
6 MiniMax MiniMax-M2.5 2402ms 7827ms 7085ms 17815ms 10/10
讯飞 spark-lite 鉴权未通过
Groq llama-3.3-70b 需海外网络

测试用例(10 条不同输入)

1. 今天天气不措,我想去公远散步。
2. 我们公四的产品经理说这个需球很紧记。
3. 请帮我定一下名天上午十点的会议室。
4. 这个方案的可行性还需要近一步验政。
5. 他在比赛中拿到了第一明,非常棒。
6. 周末我打算去超市买一些生活用品和水国。
7. 麻烦你把这份文件发到我的邮相里。
8. 我觉得这个价格还可以在优会一点。
9. 新来的同事人很好,很快就和大家打成一片了。
10. 最近工做压力比较大,需要好好修息一下。

选择建议

场景 推荐 理由
日常使用(首选) DeepSeek 平均 197ms,最快且稳定
稳定优先 阿里云百炼 qwen-turbo 波动最小(395~651ms),质量好
免费试用 智谱 glm-4-flash 免费额度多,但延迟波动较大
海外用户 Groq 自研 LPU 硬件极快,需海外网络

观察与注意

  • DeepSeek 在本次测试中表现最优(平均 197ms),但高峰期(晚 8-11 点)可能升至数秒
  • 阿里云百炼 延迟波动最小,是最稳定的选择
  • Kimi 表现意外地好(平均 867ms),优于智谱和火山
  • 火山引擎 中位数 1042ms 尚可,但有一次异常值 13.3 秒(可能是冷启动)
  • MiniMax 延迟过高(平均 7.8 秒),且输出包含推理标签,不推荐用于实时场景
  • 所有测试基于非流式调用,流式(打字机模式)首 token 延迟会更短
  • 延迟受网络、时段、服务器负载影响,以上数据仅供参考

Clone this wiki locally