Demo展示链接:https://www.bilibili.com/video/BV1L2Go6HEzv/?spm_id_from=333.337.search-card.all.click&vd_source=3ef43f37582e737625b89d0fb3ea606d
本项目三档 ASR(FunASR 2pass / SenseVoice / Fun-ASR-Nano)均部署在自有服务器与本地 GPU 环境,不调用云端 ASR 按量 API,语音识别部分为 0 成本。
仅 AI 纠错 / 润色 / 改写 走 DeepSeek 接口,按 Token 计费;未使用 AI 功能时不产生该项费用。
如需现场操作、查看实际效果,请联系作者:17849001850
VoxWare 包含 Web 语音工作台 与 Windows 桌面助手,共用同一套账号与后端。
- Web:登录注册、工作台内语音输入与文本编辑、热词、历史、VIP、连接桌面助手
- 桌面:全局热键语音输入,定稿写入微信、QQ、记事本等任意前台输入框
浏览器无法向其他应用写文字;要在系统里随便哪个输入框说话,请用桌面助手。
| 目录 | 说明 |
|---|---|
VoxWare-backend/ |
后端:REST、WebSocket ASR、鉴权、热词、AI、VIP |
VoxWare_frontend/ |
Web 前端 |
VoxWare-desktop/ |
Windows 桌面助手 |
技术栈:后端 Spring Boot + MyBatis-Plus(MySQL、Redis);前端 Vue 3 + Vite;桌面 Electron。
对外依赖(ASR 均为自部署 / 本地推理,无按次 API 费用;仅 DeepSeek 按 Token 计费):
| 服务 | 用途 | 部署方式 | 费用 |
|---|---|---|---|
| FunASR 2pass | 基础版 ASR | 自有服务器 WebSocket(:10096) |
0 成本 |
| SenseVoice | 进阶版 ASR | 本地 GPU HTTP(:8088) |
0 成本 |
| Fun-ASR-Nano | 旗舰版 ASR | 本地 GPU HTTP(:8089) |
0 成本 |
| DeepSeek API | AI 纠错 / 润色 / 改写 | 云端 OpenAI 兼容接口 | 按 Token 计费 |
后端通过 Spring AI 调用 DeepSeek(模型 deepseek-chat);未配置 api-key 时 AI 接口不可用,不影响 ASR 语音识别。Key 写在 application-local.yaml。
接口:REST 前缀 /api/v1(auth、user、hotwords、history、ai、vip);实时识别走 WebSocket ws://{host}:8081/ws/asr?token={JWT},客户端发 start(含 asrTier)→ 二进制音频帧 → stop。
本地配置:复制 VoxWare-backend/src/main/resources/application-local.yaml.example 为 application-local.yaml,填写 MySQL、Redis、JWT Secret、DeepSeek Key。前端在 VoxWare_frontend/.env 配置 VITE_SERVER_HOST、VITE_SERVER_PORT(默认后端 8081)。
集成细节见 VoxWare-backend/docs/(含 Postman 集合 VoxWare-API.postman_collection.json)。
本项目语音识别不自研模型,三档引擎均基于 FunASR(ModelScope 开源工业级语音工具包,MIT 协议)在自有服务器 / 本地 GPU 自部署,不调用按量云端 ASR API。
| 档位 | 模型 | VoxWare 对接方式 | 部署参考 |
|---|---|---|---|
| 基础版 | Paraformer 2pass 流式 | WebSocket :10096 |
FunASR runtime 流式服务(2pass online + offline) |
| 进阶版 | SenseVoiceSmall | HTTP :8088 |
pip install funasr 后 AutoModel(model="iic/SenseVoiceSmall") 或 funasr-server --model sensevoice |
| 旗舰版 | Fun-ASR-Nano-2512 | HTTP :8089 |
AutoModel(model="FunAudioLLM/Fun-ASR-Nano-2512") 自建 HTTP 推理 |
基础版示例(FunASR 官方 Docker 流式 SDK,具体版本与命令以仓库文档为准):
# 安装与完整步骤见 https://github.com/modelscope/FunASR
pip install funasr
# 流式 WebSocket 服务(runtime 目录,默认对接端口 10096)
# 详见 FunASR 仓库 runtime/ 与 https://modelscope.github.io/FunASR/部署完成后,在 application-local.yaml 中配置 asr.funasr.host/port(及 SenseVoice、Nano 的 base-url),VoxWare 后端通过 /ws/asr 统一编排转发。
Web 工作台(/workspace):麦克风录音转文字,可选三档识别模型;支持清空、复制、查看历史;提供 AI 纠错、AI 润色。另有热词页、历史列表、VIP 页、桌面连接页。
桌面助手:默认热键 Alt+Shift+Space;partial 在浮窗预览,final 定稿写入目标输入框;识别模型与 Web 一致。
| 档位 | 引擎 | 权限 | 说明 |
|---|---|---|---|
基础版 basic |
FunASR 2pass(:10096) |
所有用户 | 中英;在线 partial + 离线 final;支持热词 |
进阶版 advanced |
SenseVoice(:8088) |
VIP | 中英日韩粤;情绪识别;可有 refined 复核 |
旗舰版 premium |
Fun-ASR-Nano(:8089) |
VIP | 多方言与口音;自动语言检测;歌词/说唱 |
非 VIP 仅基础版;VIP 三档可选,进阶/旗舰需对应服务已启动。Web 端 partial 进编辑器;桌面端 partial 仅浮窗,final 才注入输入框。
辅助纠错:个人热词库;工作台 AI 纠错/润色;进阶档可有 refined 复核(桌面为避免叠字暂不自动替换)。
邮箱 + 密码注册登录,JWT 鉴权,Web 与桌面同一账号。
- Web:
/register、/login,token 存 localStorage - 桌面:设置页登录,或跳转 Web 登录
- Web → 桌面:登录后
/desktop/connect通过voxware://auth?token=...回传 token - VIP:
GET /api/v1/user/me;桌面聚焦/轮询自动刷新;非 VIP 选进阶/旗舰会引导/vip
私密配置(数据库、JWT、DeepSeek Key)见 application-local.yaml。
| 项目 | 非 VIP | VIP |
|---|---|---|
| ASR | 3600 秒/天 | 不限 |
| AI 纠错/润色 | 5 次/天 | 不限 |
| 热词 | 20 条 | 500 条 |
| 历史 | 30 天内 | 不限 |
| ASR 档位 | 基础版 | 三档 |
依赖:JDK 21、Node 18+、MySQL、Redis、自部署 FunASR;进阶/旗舰需本地 SenseVoice、Nano(均为 0 成本)。AI 纠错/润色另需 DeepSeek Key(唯一按 Token 计费项)。
# 后端
cd VoxWare-backend
# 复制 application-local.yaml.example → application-local.yaml 并填写配置
./mvnw spring-boot:run # http://127.0.0.1:8081
# Web
cd VoxWare_frontend && npm install && npm run dev # http://localhost:5173
# 桌面(Windows)
cd VoxWare-desktop && npm install && npm start桌面 webHost 建议用 localhost(勿用 127.0.0.1)。更多细节见 VoxWare-desktop/README.md 与 VoxWare-backend/docs/ 集成文档。
本项目语音识别能力建立在 FunASR 开源项目之上,感谢 ModelScope / FunASR 团队及全体贡献者 提供工业级 ASR 工具链与模型生态。部署与用法请参考其官方仓库与文档:https://modelscope.github.io/FunASR/。
- 本项目为 七牛云参赛 作品,无任何盈利目的。
- 与 FunASR、DeepSeek 等第三方项目/服务商 不存在商业合作或授权关系;相关名称与商标归各自权利人所有。 <<<<<<< HEAD
- 语音识别部分为自部署开源模型推理(0 成本);AI 润色等功能按需调用 DeepSeek 接口,Token 费用自理。 =======
- 语音识别部分为自部署开源模型推理(0 成本);AI 润色等功能按需调用 DeepSeek 接口,Token 费用自理。
a89511e499336fe1a7c52eb72b17eb0606e33ab5
