Skip to content

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 

Repository files navigation

Chen Yuxuan

主要使用 Python、NumPy 和 PyTorch,研究从音频输入、模型训练到解码与评测的完整流程。

项目

项目 研究方向 已实现内容
hanstream-asr 语音识别 声学特征、CTC 束搜索与强制对齐、中文英文评测、可训练 GRU 基线
speechloom 端到端语音模型 可微音频编码器、因果解码器、文本/音频联合损失、流式协议与检查点

两个项目都包含命令行工具、可运行示例、输入契约测试和 CPU 模型测试。

当前关注

  • 中文与英文转写的规范化、识别错误分析和可复现评测。
  • 文本 token 与音频 token 的统一训练、模态权重和因果掩码。
  • 有界音频缓冲、UTF-8 增量解码、背压与取消语义。
  • 使用公开接口契约与自动化测试记录实现边界。

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors