-
Notifications
You must be signed in to change notification settings - Fork 1
ASR Model Comparison
测试日期: 2026-03-25 测试环境: MacBook Pro (Apple Silicon), macOS 26, SpeakOut v1.5.21 测试方式: 对着电脑麦克风正常语速说话,每个模型 2-3 次录音,取典型结果 sherpa-onnx SDK: v1.12.33
| 等级 | 含义 |
|---|---|
| ⭐⭐⭐ | 推荐日常使用 |
| ⭐⭐ | 可用,有明显短板 |
| ⭐ | 不推荐 |
| ⛔ | 已隐藏(质量差或不兼容) |
非流式模型在录音结束后一次性识别,准确率通常高于流式模型。
| 项目 | 数据 |
|---|---|
| 来源 | 阿里达摩院 |
| 大小 | ~228MB |
| 解码速度 | 55x 实时(20s 音频 → 0.4s 解码) |
| 内置标点 | ✅ 是 |
| 支持语言 | 中/英/日/韩/粤 |
优点: 速度极快、中文质量好、内置标点免配置 缺点: 英文专有词偶尔出错 测试样例:
输入: "好,现在用SenseVoice测试一下,我们接下来认真地要去做下一件事儿"
输出: "好,现在用sense files测试一下,我们接下来肯恳的要去做一万一件事儿"
| 项目 | 数据 |
|---|---|
| 来源 | 阿里达摩院 (FunASR) |
| 大小 | ~217MB |
| 解码速度 | 70x 实时(11s 音频 → 0.16s 解码) |
| 内置标点 | ❌ 需配合标点模型 |
| 支持语言 | 中/英 |
优点: 所有模型中最快、中文质量好、成熟稳定 缺点: 无内置标点(需另下载标点模型)、英文专有词弱
| 项目 | 数据 |
|---|---|
| 来源 | 小红书 FireRedTeam |
| 大小 | ~496MB |
| 解码速度 | 8x 实时(14s 音频 → 1.8s 解码) |
| 内置标点 | ❌ 需配合标点模型 |
| 支持语言 | 中/英 + 方言 |
优点: 中文质量好、支持方言、v1 体积的 1/3 缺点: 速度中等、无标点 注: 完全取代 FireRedASR v1(1.4GB → 496MB,速度快一倍)
| 项目 | 数据 |
|---|---|
| 来源 | 阿里达摩院 |
| 大小 | ~179MB |
| 解码速度 | 54x 实时 |
| 内置标点 | ❌ 需配合标点模型 |
| 支持语言 | 中/英/日 |
优点: 轻量、速度与 SenseVoice 2024 持平、中文质量好 缺点: 无标点
| 项目 | 数据 |
|---|---|
| 来源 | 阿里达摩院 |
| 大小 | ~158MB |
| 解码速度 | 55x 实时 |
| 内置标点 | ❌ (2024 版有,2025 版移除了) |
| 支持语言 | 中/英/日/韩/粤(粤语增强) |
优点: 体积最小的 SenseVoice、粤语增强 缺点: 失去了内置标点 备注: 如果不需要粤语增强,建议用 2024 版
| 项目 | 数据 |
|---|---|
| 来源 | 阿里达摩院 |
| 大小 | ~218MB |
| 解码速度 | 66x 实时 |
| 内置标点 | ❌ 需配合标点模型 |
| 支持语言 | 中/英 + 四川/重庆方言 |
优点: 速度与标准版持平、方言支持 缺点: 英文处理倾向逐字母拆解、无内置标点
| 项目 | 数据 |
|---|---|
| 来源 | OpenAI |
| 大小 | ~538MB |
| 解码速度 | 3.4x 实时 |
| 内置标点 | ✅ 是 |
| 支持语言 | 99 种语言 |
优点: 语言覆盖最广、有内置标点、中文基本可用 缺点: 速度较慢、英文专有词弱("Whisper" → "VSPR") 注: Whisper 家族中唯一推荐的版本
| 项目 | 数据 |
|---|---|
| 来源 | DataOcean AI |
| 大小 | ~77MB |
| 解码速度 | 45x 实时 |
| 内置标点 | ❌ |
| 支持语言 | 多语言 |
优点: 极度轻量(77MB)、速度快、中文基础识别过得去 缺点: 英文拆成单字母、精度不如 SenseVoice 适合: 需要最小下载体积的场景
流式模型在录音过程中实时识别,悬浮窗可看到逐字输出。
| 项目 | 数据 |
|---|---|
| 来源 | 阿里达摩院 |
| 大小 | ~1GB |
| 内置标点 | ❌ 需配合标点模型 |
| 支持语言 | 中/英 |
优点: 流式中质量最好、无重复问题(CTC 架构) 缺点: 体积较大、无标点
以下模型因质量差或兼容性问题已从列表中隐藏:
| 模型 | 大小 | 隐藏原因 |
|---|---|---|
| Zipformer Bilingual (流式) | 490MB | Transducer 架构严重字符重复 |
| TeleSpeech CTC | 175MB | 中文识别极差(中国电信 TeleAI) |
| Whisper Large-v3 | 1.0GB | 中文大量丢字、解码极慢(1.5x 实时) |
| Whisper Distil Large-v3.5 | 504MB | 中文被翻译成英文而非转写 |
| Whisper Medium AISHELL | 655MB | 中文微调版仍质量差(英文音译成乱码) |
| FireRedASR v1 | 1.4GB | 已被 v2 CTC 取代(体积 1/3、速度 2x) |
| FunASR Nano | 716MB | sherpa-onnx SDK 不兼容,无法初始化 |
| Moonshine Base 中文 | 95MB | 解码返回空字符串,SDK 不兼容 |
| 项目 | 数据 |
|---|---|
| 名称 | CT-Transformer 中英标点 |
| 大小 | ~70MB |
| 用途 | 为无内置标点的模型补充标点符号 |
适用模型: Paraformer (离线/流式)、SenseVoice 2025、SenseVoice+Nano、FireRedASR v2、Dolphin 不需要: SenseVoice 2024、Whisper Turbo(已内置标点) 注意: 切换到无标点模型时,SpeakOut 会自动提示下载
SenseVoice 2024 — 速度快、质量好、有标点、零配置
Paraformer Bilingual (Streaming) — 唯一推荐的流式模型
Paraformer Offline — 最快(70x 实时),需配标点模型
SenseVoice 2025 — 粤语增强版,需配标点模型
Paraformer Dialect 2025 或 FireRedASR v2 CTC — 支持四川/重庆/河南方言
Whisper Turbo — 99 种语言,但中文不如 SenseVoice
Dolphin Base — 仅 77MB,中文基础可用
所有离线模型都存在 英文专有词识别差 的问题(如 "Paraformer" → "platformer"、"SenseVoice" → "sense files")。可通过以下方式缓解:
- LLM 润色(独立开关)— AI 后处理修正专有词
- 专业词汇表 — 手动添加常用专有词映射
- 未来方向 — 个性化 ASR 适配(研究文档)
| 模型 | 解码倍速 | 备注 |
|---|---|---|
| Paraformer Offline | 70x | 最快 |
| SenseVoice 2024 | 55x | |
| SenseVoice+Nano | 54x | |
| Dolphin Base | 45x | 77MB 超轻量 |
| FireRedASR v2 CTC | 8x | |
| Whisper Turbo | 3.4x | |
| 已隐藏 |