Skip to content

LLM Performance

LeonXu edited this page Mar 21, 2026 · 4 revisions

LLM 服务商性能对比

最后更新:2026-03-21 测试环境:macOS, 中国大陆网络(无代理) 测试方法:非流式 API 调用,10 条不同语音纠错输入,统计延迟分布

实测结果(15 个模型,每个 10 次)

排名 服务商 模型 最小 平均 中位数 最大 成功率
1 DeepSeek deepseek-chat 93ms 129ms 120ms 221ms 10/10
2 DeepSeek deepseek-reasoner 105ms 175ms 186ms 235ms 8/10
3 阿里云百炼 qwen-turbo 457ms 573ms 566ms 716ms 10/10
4 智谱 glm-4-plus 394ms 594ms 511ms 1346ms 10/10
5 Kimi moonshot-v1-auto 499ms 640ms 657ms 754ms 10/10
6 Kimi moonshot-v1-8k 538ms 754ms 652ms 1712ms 10/10
7 阿里云百炼 qwen-max 607ms 855ms 802ms 1364ms 10/10
8 阿里云百炼 qwen-plus 633ms 865ms 761ms 1614ms 10/10
9 火山引擎 doubao-1.5-lite-32k 676ms 966ms 1032ms 1178ms 10/10
10 智谱 glm-4-flash 584ms 1072ms 883ms 2109ms 10/10
11 火山引擎 doubao-1.5-pro-32k 908ms 1140ms 1110ms 1515ms 10/10
12 火山引擎 doubao-seed-2.0-mini 779ms 1296ms 929ms 3518ms 9/10
13 MiniMax MiniMax-M2.5 1845ms 4132ms 3452ms 8314ms 10/10
14 智谱 glm-z1-flash 3016ms 6953ms 7137ms 10143ms 10/10
15 MiniMax MiniMax-M1 2720ms 7659ms 5716ms 16701ms 10/10
讯飞 spark-lite 鉴权复杂*
Groq llama-3.3-70b 需海外网络

* 讯飞开放平台控制台设计复杂,产品线众多且页面分散,用户体验不友好,测试者未能在控制台中找到所需的鉴权参数。

测试用例(10 条不同输入)

1. 今天天气不措,我想去公远散步。
2. 我们公四的产品经理说这个需球很紧记。
3. 请帮我定一下名天上午十点的会议室。
4. 这个方案的可行性还需要近一步验政。
5. 他在比赛中拿到了第一明,非常棒。
6. 周末我打算去超市买一些生活用品和水国。
7. 麻烦你把这份文件发到我的邮相里。
8. 我觉得这个价格还可以在优会一点。
9. 新来的同事人很好,很快就和大家打成一片了。
10. 最近工做压力比较大,需要好好修息一下。

选择建议

场景 推荐模型 平均延迟 理由
极致速度 DeepSeek deepseek-chat 129ms 最快,但高峰期可能波动
稳定首选 阿里云百炼 qwen-turbo 573ms 波动最小,质量稳定
高质量 智谱 glm-4-plus 594ms 智谱最快的高质量模型
免费 智谱 glm-4-flash 1072ms 免费额度多
海外用户 Groq llama-3.3-70b ~500ms* 自研 LPU 极快,需海外网络

* Groq 延迟为公开基准数据,非本次实测。

注意事项

  • DeepSeek 高峰期(晚 8-11 点)延迟可能升至数秒
  • 智谱 glm-z1-flash 是推理模型(含思考过程),延迟 7 秒不适合实时纠错
  • MiniMax 输出包含 <think> 推理标签,app 已自动清洗
  • 火山引擎 偶发高延迟(3-13 秒),可能是冷启动
  • 流式(打字机模式)首 token 延迟会更短
  • 延迟受网络、时段、服务器负载影响,以上数据仅供参考

Clone this wiki locally