Skip to content

ASR Model Comparison

LeonXu edited this page Aug 18, 2026 · 3 revisions

ASR 模型对比与推荐

测试日期: 2026-03-25 测试环境: MacBook Pro (Apple Silicon), macOS 26, SpeakOut v1.5.21 测试方式: 对着电脑麦克风正常语速说话,每个模型 2-3 次录音,取典型结果 sherpa-onnx SDK: v1.12.33

推荐等级

等级 含义
⭐⭐⭐ 推荐日常使用
⭐⭐ 可用,有明显短板
不推荐
已隐藏(质量差或不兼容)

非流式模型(推荐)

非流式模型在录音结束后一次性识别,准确率通常高于流式模型。

SenseVoice 2024 ⭐⭐⭐ (默认推荐)

项目 数据
来源 阿里达摩院
大小 ~228MB
解码速度 55x 实时(20s 音频 → 0.4s 解码)
内置标点 ✅ 是
支持语言 中/英/日/韩/粤

优点: 速度极快、中文质量好、内置标点免配置 缺点: 英文专有词偶尔出错 测试样例:

输入: "好,现在用SenseVoice测试一下,我们接下来认真地要去做下一件事儿"
输出: "好,现在用sense files测试一下,我们接下来肯恳的要去做一万一件事儿"

Paraformer Offline ⭐⭐⭐

项目 数据
来源 阿里达摩院 (FunASR)
大小 ~217MB
解码速度 70x 实时(11s 音频 → 0.16s 解码)
内置标点 ❌ 需配合标点模型
支持语言 中/英

优点: 所有模型中最快、中文质量好、成熟稳定 缺点: 无内置标点(需另下载标点模型)、英文专有词弱

FireRedASR v2 CTC ⭐⭐⭐

项目 数据
来源 小红书 FireRedTeam
大小 ~496MB
解码速度 8x 实时(14s 音频 → 1.8s 解码)
内置标点 ❌ 需配合标点模型
支持语言 中/英 + 方言

优点: 中文质量好、支持方言、v1 体积的 1/3 缺点: 速度中等、无标点 : 完全取代 FireRedASR v1(1.4GB → 496MB,速度快一倍)

SenseVoice + FunASR Nano ⭐⭐⭐

项目 数据
来源 阿里达摩院
大小 ~179MB
解码速度 54x 实时
内置标点 ❌ 需配合标点模型
支持语言 中/英/日

优点: 轻量、速度与 SenseVoice 2024 持平、中文质量好 缺点: 无标点


SenseVoice 2025 ⭐⭐

项目 数据
来源 阿里达摩院
大小 ~158MB
解码速度 55x 实时
内置标点 ❌ (2024 版有,2025 版移除了)
支持语言 中/英/日/韩/粤(粤语增强)

优点: 体积最小的 SenseVoice、粤语增强 缺点: 失去了内置标点 备注: 如果不需要粤语增强,建议用 2024 版

Paraformer Dialect 2025 ⭐⭐

项目 数据
来源 阿里达摩院
大小 ~218MB
解码速度 66x 实时
内置标点 ❌ 需配合标点模型
支持语言 中/英 + 四川/重庆方言

优点: 速度与标准版持平、方言支持 缺点: 英文处理倾向逐字母拆解、无内置标点

Whisper Turbo ⭐⭐

项目 数据
来源 OpenAI
大小 ~538MB
解码速度 3.4x 实时
内置标点 ✅ 是
支持语言 99 种语言

优点: 语言覆盖最广、有内置标点、中文基本可用 缺点: 速度较慢、英文专有词弱("Whisper" → "VSPR") : Whisper 家族中唯一推荐的版本

Dolphin Base ⭐⭐

项目 数据
来源 DataOcean AI
大小 ~77MB
解码速度 45x 实时
内置标点
支持语言 多语言

优点: 极度轻量(77MB)、速度快、中文基础识别过得去 缺点: 英文拆成单字母、精度不如 SenseVoice 适合: 需要最小下载体积的场景


流式模型

流式模型在录音过程中实时识别,悬浮窗可看到逐字输出。

Paraformer Bilingual (Streaming) ⭐⭐⭐

项目 数据
来源 阿里达摩院
大小 ~1GB
内置标点 ❌ 需配合标点模型
支持语言 中/英

优点: 流式中质量最好、无重复问题(CTC 架构) 缺点: 体积较大、无标点


已隐藏模型

以下模型因质量差或兼容性问题已从列表中隐藏:

模型 大小 隐藏原因
Zipformer Bilingual (流式) 490MB Transducer 架构严重字符重复
TeleSpeech CTC 175MB 中文识别极差(中国电信 TeleAI)
Whisper Large-v3 1.0GB 中文大量丢字、解码极慢(1.5x 实时)
Whisper Distil Large-v3.5 504MB 中文被翻译成英文而非转写
Whisper Medium AISHELL 655MB 中文微调版仍质量差(英文音译成乱码)
FireRedASR v1 1.4GB 已被 v2 CTC 取代(体积 1/3、速度 2x)
FunASR Nano 716MB sherpa-onnx SDK 不兼容,无法初始化
Moonshine Base 中文 95MB 解码返回空字符串,SDK 不兼容

标点模型

项目 数据
名称 CT-Transformer 中英标点
大小 ~70MB
用途 为无内置标点的模型补充标点符号

适用模型: Paraformer (离线/流式)、SenseVoice 2025、SenseVoice+Nano、FireRedASR v2、Dolphin 不需要: SenseVoice 2024、Whisper Turbo(已内置标点) 注意: 切换到无标点模型时,SpeakOut 会自动提示下载


综合推荐

日常使用(首选)

SenseVoice 2024 — 速度快、质量好、有标点、零配置

需要实时字幕

Paraformer Bilingual (Streaming) — 唯一推荐的流式模型

追求极致速度

Paraformer Offline — 最快(70x 实时),需配标点模型

粤语场景

SenseVoice 2025 — 粤语增强版,需配标点模型

方言场景

Paraformer Dialect 2025FireRedASR v2 CTC — 支持四川/重庆/河南方言

多语言(非中文为主)

Whisper Turbo — 99 种语言,但中文不如 SenseVoice

最小体积

Dolphin Base — 仅 77MB,中文基础可用


共性问题

所有离线模型都存在 英文专有词识别差 的问题(如 "Paraformer" → "platformer"、"SenseVoice" → "sense files")。可通过以下方式缓解:

  1. LLM 润色(独立开关)— AI 后处理修正专有词
  2. 专业词汇表 — 手动添加常用专有词映射
  3. 未来方向 — 个性化 ASR 适配(研究文档

速度对比

模型 解码倍速 备注
Paraformer Offline 70x 最快
SenseVoice 2024 55x
SenseVoice+Nano 54x
Dolphin Base 45x 77MB 超轻量
FireRedASR v2 CTC 8x
Whisper Turbo 3.4x
Whisper Large-v3 1.5x 已隐藏

Clone this wiki locally