Skip to content

LLM Performance

LeonXu edited this page Mar 21, 2026 · 4 revisions

LLM 服务商性能对比

最后更新:2026-03-21 测试环境:macOS, 中国大陆网络(无代理) 测试方法:非流式 API 调用,10 条不同语音纠错输入,统计延迟分布

实测结果(15 个模型,每个 10 次)

排名 服务商 模型 最小 平均 中位数 最大 成功率
1 DeepSeek deepseek-chat 93ms 129ms 120ms 221ms 10/10
2 DeepSeek deepseek-reasoner 105ms 175ms 186ms 235ms 8/10
3 阿里云百炼 qwen-turbo 457ms 573ms 566ms 716ms 10/10
4 智谱 glm-4-plus 394ms 594ms 511ms 1346ms 10/10
5 Kimi moonshot-v1-auto 499ms 640ms 657ms 754ms 10/10
6 Kimi moonshot-v1-8k 538ms 754ms 652ms 1712ms 10/10
7 阿里云百炼 qwen-max 607ms 855ms 802ms 1364ms 10/10
8 阿里云百炼 qwen-plus 633ms 865ms 761ms 1614ms 10/10
9 火山引擎 doubao-1.5-lite-32k 676ms 966ms 1032ms 1178ms 10/10
10 智谱 glm-4-flash 584ms 1072ms 883ms 2109ms 10/10
11 火山引擎 doubao-1.5-pro-32k 908ms 1140ms 1110ms 1515ms 10/10
12 火山引擎 doubao-seed-2.0-mini 779ms 1296ms 929ms 3518ms 9/10
13 MiniMax MiniMax-M2.5 1845ms 4132ms 3452ms 8314ms 10/10
14 智谱 glm-z1-flash 3016ms 6953ms 7137ms 10143ms 10/10
15 MiniMax MiniMax-M1 2720ms 7659ms 5716ms 16701ms 10/10
讯飞 spark-lite 鉴权复杂*
Groq llama-3.3-70b 需海外网络

* 讯飞星火鉴权需要在控制台获取 APPID + APIKey + APISecret 三个值,然后用 APIKey:APISecret 拼接为 Bearer Token。控制台操作较复杂。

测试用例(10 条不同输入)

1. 今天天气不措,我想去公远散步。
2. 我们公四的产品经理说这个需球很紧记。
3. 请帮我定一下名天上午十点的会议室。
4. 这个方案的可行性还需要近一步验政。
5. 他在比赛中拿到了第一明,非常棒。
6. 周末我打算去超市买一些生活用品和水国。
7. 麻烦你把这份文件发到我的邮相里。
8. 我觉得这个价格还可以在优会一点。
9. 新来的同事人很好,很快就和大家打成一片了。
10. 最近工做压力比较大,需要好好修息一下。

选择建议

场景 推荐模型 平均延迟 理由
极致速度 DeepSeek deepseek-chat 129ms 最快,但高峰期可能波动
稳定首选 阿里云百炼 qwen-turbo 573ms 波动最小,质量稳定
高质量 智谱 glm-4-plus 594ms 智谱最快的高质量模型
免费 智谱 glm-4-flash 1072ms 免费额度多
海外用户 Groq llama-3.3-70b ~500ms* 自研 LPU 极快,需海外网络

* Groq 延迟为公开基准数据,非本次实测。

注意事项

  • DeepSeek 高峰期(晚 8-11 点)延迟可能升至数秒
  • 智谱 glm-z1-flash 是推理模型(含思考过程),延迟 7 秒不适合实时纠错
  • MiniMax 输出包含 <think> 推理标签,app 已自动清洗
  • 火山引擎 偶发高延迟(3-13 秒),可能是冷启动
  • 流式(打字机模式)首 token 延迟会更短
  • 延迟受网络、时段、服务器负载影响,以上数据仅供参考

Clone this wiki locally