Skip to content

feat: 支持全局流式语音输入(参考豆包) #9

Description

@zcxGGmu

背景

当前输入主要依赖键盘。需要支持类似豆包的全局流式语音输入:用户在任意输入场景按快捷键即可开始说话,语音实时转文本并插入当前 Composer,提高长提示词和移动办公效率。

目标

  • 新增全局语音输入能力,支持快捷键唤起、悬浮状态提示、实时转写和一键提交/取消。
  • 支持 Agent、Pipeline、旧 Chat 回退输入框等主要输入场景。
  • 支持用户选择语音识别 Provider、语言、自动标点、热词/术语和是否保留音频。
  • 语音流式转写过程要低延迟、可中断,并在失败时保留已识别文本。

验收标准

  • 全局快捷键可在应用前台任意页面唤起语音输入,并将转写文本写入当前可用 Composer。
  • 录音时有清晰状态:正在听、识别中、网络异常、已暂停、已取消。
  • 支持实时增量转写,用户可继续编辑最终文本后再提交。
  • 无麦克风权限、Provider 未配置、网络失败、无焦点输入目标等场景有明确降级。
  • 补充 BDD/E2E 测试覆盖:快捷键唤起、权限失败、流式增量、取消、跨页面输入目标。

技术备注

  • 需要评估 Electron 麦克风权限、系统快捷键、音频流采集和可选本地/云端 ASR Provider。
  • 状态管理继续使用 Jotai;语音输入状态应全局唯一,避免多个会话并发录音。
  • 默认不持久化原始音频;如需保存必须有明确用户开关和隐私说明。

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions