-
Notifications
You must be signed in to change notification settings - Fork 1
LLM Performance
LeonXu edited this page Mar 21, 2026
·
4 revisions
最后更新:2026-03-21 测试环境:macOS, 中国大陆网络(无代理) 测试方法:非流式 API 调用,10 条不同语音纠错输入,统计延迟分布
| 排名 | 服务商 | 模型 | 最小 | 平均 | 中位数 | 最大 | 成功率 |
|---|---|---|---|---|---|---|---|
| 1 | DeepSeek | deepseek-chat | 93ms | 129ms | 120ms | 221ms | 10/10 |
| 2 | DeepSeek | deepseek-reasoner | 105ms | 175ms | 186ms | 235ms | 8/10 |
| 3 | 阿里云百炼 | qwen-turbo | 457ms | 573ms | 566ms | 716ms | 10/10 |
| 4 | 智谱 | glm-4-plus | 394ms | 594ms | 511ms | 1346ms | 10/10 |
| 5 | Kimi | moonshot-v1-auto | 499ms | 640ms | 657ms | 754ms | 10/10 |
| 6 | Kimi | moonshot-v1-8k | 538ms | 754ms | 652ms | 1712ms | 10/10 |
| 7 | 阿里云百炼 | qwen-max | 607ms | 855ms | 802ms | 1364ms | 10/10 |
| 8 | 阿里云百炼 | qwen-plus | 633ms | 865ms | 761ms | 1614ms | 10/10 |
| 9 | 火山引擎 | doubao-1.5-lite-32k | 676ms | 966ms | 1032ms | 1178ms | 10/10 |
| 10 | 智谱 | glm-4-flash | 584ms | 1072ms | 883ms | 2109ms | 10/10 |
| 11 | 火山引擎 | doubao-1.5-pro-32k | 908ms | 1140ms | 1110ms | 1515ms | 10/10 |
| 12 | 火山引擎 | doubao-seed-2.0-mini | 779ms | 1296ms | 929ms | 3518ms | 9/10 |
| 13 | MiniMax | MiniMax-M2.5 | 1845ms | 4132ms | 3452ms | 8314ms | 10/10 |
| 14 | 智谱 | glm-z1-flash | 3016ms | 6953ms | 7137ms | 10143ms | 10/10 |
| 15 | MiniMax | MiniMax-M1 | 2720ms | 7659ms | 5716ms | 16701ms | 10/10 |
| — | 讯飞 | spark-lite | — | — | — | — | 鉴权复杂* |
| — | Groq | llama-3.3-70b | — | — | — | — | 需海外网络 |
* 讯飞开放平台控制台设计复杂,产品线众多且页面分散,用户体验不友好,测试者未能在控制台中找到所需的鉴权参数。
1. 今天天气不措,我想去公远散步。
2. 我们公四的产品经理说这个需球很紧记。
3. 请帮我定一下名天上午十点的会议室。
4. 这个方案的可行性还需要近一步验政。
5. 他在比赛中拿到了第一明,非常棒。
6. 周末我打算去超市买一些生活用品和水国。
7. 麻烦你把这份文件发到我的邮相里。
8. 我觉得这个价格还可以在优会一点。
9. 新来的同事人很好,很快就和大家打成一片了。
10. 最近工做压力比较大,需要好好修息一下。
| 场景 | 推荐模型 | 平均延迟 | 理由 |
|---|---|---|---|
| 极致速度 | DeepSeek deepseek-chat | 129ms | 最快,但高峰期可能波动 |
| 稳定首选 | 阿里云百炼 qwen-turbo | 573ms | 波动最小,质量稳定 |
| 高质量 | 智谱 glm-4-plus | 594ms | 智谱最快的高质量模型 |
| 免费 | 智谱 glm-4-flash | 1072ms | 免费额度多 |
| 海外用户 | Groq llama-3.3-70b | ~500ms* | 自研 LPU 极快,需海外网络 |
* Groq 延迟为公开基准数据,非本次实测。
- DeepSeek 高峰期(晚 8-11 点)延迟可能升至数秒
- 智谱 glm-z1-flash 是推理模型(含思考过程),延迟 7 秒不适合实时纠错
-
MiniMax 输出包含
<think>推理标签,app 已自动清洗 - 火山引擎 偶发高延迟(3-13 秒),可能是冷启动
- 流式(打字机模式)首 token 延迟会更短
- 延迟受网络、时段、服务器负载影响,以上数据仅供参考