Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

38 Commits
 
 
 
 
 
 
 
 
 
 

Repository files navigation

VoxWare AI语音输入法


💰 成本说明(重要)

本项目三档 ASR(FunASR 2pass / SenseVoice / Fun-ASR-Nano)均部署在自有服务器与本地 GPU 环境,不调用云端 ASR 按量 API,语音识别部分为 0 成本。

仅 AI 纠错 / 润色 / 改写DeepSeek 接口,按 Token 计费;未使用 AI 功能时不产生该项费用。

📞 评委体验

如需现场操作、查看实际效果,请联系作者:17849001850


VoxWare 包含 Web 语音工作台Windows 桌面助手,共用同一套账号与后端。

  • Web:登录注册、工作台内语音输入与文本编辑、热词、历史、VIP、连接桌面助手
  • 桌面:全局热键语音输入,定稿写入微信、QQ、记事本等任意前台输入框

浏览器无法向其他应用写文字;要在系统里随便哪个输入框说话,请用桌面助手。

image-20260525230335910

项目结构

目录 说明
VoxWare-backend/ 后端:REST、WebSocket ASR、鉴权、热词、AI、VIP
VoxWare_frontend/ Web 前端
VoxWare-desktop/ Windows 桌面助手

开发者说明

技术栈:后端 Spring Boot + MyBatis-Plus(MySQL、Redis);前端 Vue 3 + Vite;桌面 Electron。

对外依赖(ASR 均为自部署 / 本地推理,无按次 API 费用;仅 DeepSeek 按 Token 计费):

服务 用途 部署方式 费用
FunASR 2pass 基础版 ASR 自有服务器 WebSocket(:10096 0 成本
SenseVoice 进阶版 ASR 本地 GPU HTTP(:8088 0 成本
Fun-ASR-Nano 旗舰版 ASR 本地 GPU HTTP(:8089 0 成本
DeepSeek API AI 纠错 / 润色 / 改写 云端 OpenAI 兼容接口 按 Token 计费

后端通过 Spring AI 调用 DeepSeek(模型 deepseek-chat);未配置 api-key 时 AI 接口不可用,不影响 ASR 语音识别。Key 写在 application-local.yaml

接口:REST 前缀 /api/v1(auth、user、hotwords、history、ai、vip);实时识别走 WebSocket ws://{host}:8081/ws/asr?token={JWT},客户端发 start(含 asrTier)→ 二进制音频帧 → stop

本地配置:复制 VoxWare-backend/src/main/resources/application-local.yaml.exampleapplication-local.yaml,填写 MySQL、Redis、JWT Secret、DeepSeek Key。前端在 VoxWare_frontend/.env 配置 VITE_SERVER_HOSTVITE_SERVER_PORT(默认后端 8081)。

集成细节见 VoxWare-backend/docs/(含 Postman 集合 VoxWare-API.postman_collection.json)。

ASR 部署

本项目语音识别不自研模型,三档引擎均基于 FunASR(ModelScope 开源工业级语音工具包,MIT 协议)在自有服务器 / 本地 GPU 自部署,不调用按量云端 ASR API。

档位 模型 VoxWare 对接方式 部署参考
基础版 Paraformer 2pass 流式 WebSocket :10096 FunASR runtime 流式服务(2pass online + offline)
进阶版 SenseVoiceSmall HTTP :8088 pip install funasrAutoModel(model="iic/SenseVoiceSmall")funasr-server --model sensevoice
旗舰版 Fun-ASR-Nano-2512 HTTP :8089 AutoModel(model="FunAudioLLM/Fun-ASR-Nano-2512") 自建 HTTP 推理

基础版示例(FunASR 官方 Docker 流式 SDK,具体版本与命令以仓库文档为准):

# 安装与完整步骤见 https://github.com/modelscope/FunASR
pip install funasr

# 流式 WebSocket 服务(runtime 目录,默认对接端口 10096)
# 详见 FunASR 仓库 runtime/ 与 https://modelscope.github.io/FunASR/

部署完成后,在 application-local.yaml 中配置 asr.funasr.host/port(及 SenseVoice、Nano 的 base-url),VoxWare 后端通过 /ws/asr 统一编排转发。

功能概览

Web 工作台/workspace):麦克风录音转文字,可选三档识别模型;支持清空、复制、查看历史;提供 AI 纠错、AI 润色。另有热词页、历史列表、VIP 页、桌面连接页。

桌面助手:默认热键 Alt+Shift+Space;partial 在浮窗预览,final 定稿写入目标输入框;识别模型与 Web 一致。

三档 ASR

档位 引擎 权限 说明
基础版 basic FunASR 2pass(:10096 所有用户 中英;在线 partial + 离线 final;支持热词
进阶版 advanced SenseVoice(:8088 VIP 中英日韩粤;情绪识别;可有 refined 复核
旗舰版 premium Fun-ASR-Nano(:8089 VIP 多方言与口音;自动语言检测;歌词/说唱

非 VIP 仅基础版;VIP 三档可选,进阶/旗舰需对应服务已启动。Web 端 partial 进编辑器;桌面端 partial 仅浮窗,final 才注入输入框。

辅助纠错:个人热词库;工作台 AI 纠错/润色;进阶档可有 refined 复核(桌面为避免叠字暂不自动替换)。

用户鉴权

邮箱 + 密码注册登录,JWT 鉴权,Web 与桌面同一账号。

  • Web/register/login,token 存 localStorage
  • 桌面:设置页登录,或跳转 Web 登录
  • Web → 桌面:登录后 /desktop/connect 通过 voxware://auth?token=... 回传 token
  • VIPGET /api/v1/user/me;桌面聚焦/轮询自动刷新;非 VIP 选进阶/旗舰会引导 /vip

私密配置(数据库、JWT、DeepSeek Key)见 application-local.yaml

VIP 配额(概要)

项目 非 VIP VIP
ASR 3600 秒/天 不限
AI 纠错/润色 5 次/天 不限
热词 20 条 500 条
历史 30 天内 不限
ASR 档位 基础版 三档

快速开始

依赖:JDK 21、Node 18+、MySQL、Redis、自部署 FunASR;进阶/旗舰需本地 SenseVoice、Nano(均为 0 成本)。AI 纠错/润色另需 DeepSeek Key(唯一按 Token 计费项)。

# 后端
cd VoxWare-backend
# 复制 application-local.yaml.example → application-local.yaml 并填写配置
./mvnw spring-boot:run          # http://127.0.0.1:8081

# Web
cd VoxWare_frontend && npm install && npm run dev   # http://localhost:5173

# 桌面(Windows)
cd VoxWare-desktop && npm install && npm start

桌面 webHost 建议用 localhost(勿用 127.0.0.1)。更多细节见 VoxWare-desktop/README.mdVoxWare-backend/docs/ 集成文档。


致谢

本项目语音识别能力建立在 FunASR 开源项目之上,感谢 ModelScope / FunASR 团队及全体贡献者 提供工业级 ASR 工具链与模型生态。部署与用法请参考其官方仓库与文档:https://modelscope.github.io/FunASR/

声明

  • 本项目为 七牛云参赛 作品,无任何盈利目的
  • 与 FunASR、DeepSeek 等第三方项目/服务商 不存在商业合作或授权关系;相关名称与商标归各自权利人所有。 <<<<<<< HEAD
  • 语音识别部分为自部署开源模型推理(0 成本);AI 润色等功能按需调用 DeepSeek 接口,Token 费用自理。 =======
  • 语音识别部分为自部署开源模型推理(0 成本);AI 润色等功能按需调用 DeepSeek 接口,Token 费用自理。

a89511e499336fe1a7c52eb72b17eb0606e33ab5

About

基于 FunASR 的 AI 智能语音输入法,支持实时语音识别、多语言/方言转写、热词纠错、AI 润色、场景化改写与文本优化,全局热键语音输入。

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages