主要使用 Python、NumPy 和 PyTorch,研究从音频输入、模型训练到解码与评测的完整流程。
| 项目 | 研究方向 | 已实现内容 |
|---|---|---|
| hanstream-asr | 语音识别 | 声学特征、CTC 束搜索与强制对齐、中文英文评测、可训练 GRU 基线 |
| speechloom | 端到端语音模型 | 可微音频编码器、因果解码器、文本/音频联合损失、流式协议与检查点 |
两个项目都包含命令行工具、可运行示例、输入契约测试和 CPU 模型测试。
- 中文与英文转写的规范化、识别错误分析和可复现评测。
- 文本 token 与音频 token 的统一训练、模态权重和因果掩码。
- 有界音频缓冲、UTF-8 增量解码、背压与取消语义。
- 使用公开接口契约与自动化测试记录实现边界。
