背景
当前输入主要依赖键盘。需要支持类似豆包的全局流式语音输入:用户在任意输入场景按快捷键即可开始说话,语音实时转文本并插入当前 Composer,提高长提示词和移动办公效率。
目标
- 新增全局语音输入能力,支持快捷键唤起、悬浮状态提示、实时转写和一键提交/取消。
- 支持 Agent、Pipeline、旧 Chat 回退输入框等主要输入场景。
- 支持用户选择语音识别 Provider、语言、自动标点、热词/术语和是否保留音频。
- 语音流式转写过程要低延迟、可中断,并在失败时保留已识别文本。
验收标准
- 全局快捷键可在应用前台任意页面唤起语音输入,并将转写文本写入当前可用 Composer。
- 录音时有清晰状态:正在听、识别中、网络异常、已暂停、已取消。
- 支持实时增量转写,用户可继续编辑最终文本后再提交。
- 无麦克风权限、Provider 未配置、网络失败、无焦点输入目标等场景有明确降级。
- 补充 BDD/E2E 测试覆盖:快捷键唤起、权限失败、流式增量、取消、跨页面输入目标。
技术备注
- 需要评估 Electron 麦克风权限、系统快捷键、音频流采集和可选本地/云端 ASR Provider。
- 状态管理继续使用 Jotai;语音输入状态应全局唯一,避免多个会话并发录音。
- 默认不持久化原始音频;如需保存必须有明确用户开关和隐私说明。
背景
当前输入主要依赖键盘。需要支持类似豆包的全局流式语音输入:用户在任意输入场景按快捷键即可开始说话,语音实时转文本并插入当前 Composer,提高长提示词和移动办公效率。
目标
验收标准
技术备注