Skip to content

Latest commit

 

History

70 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

VoiceSwitch

VoiceSwitch — локальная диктовка для macOS

Локальная диктовка и редактура текста для macOS.

CI Latest release Downloads License: MIT

VoiceSwitch записывает речь по глобальной горячей клавише, распознаёт её полностью локально и вставляет текст в активное приложение.

VoiceSwitch: запись, локальная расшифровка, режим «Кратко» и автоматическая вставка

В демонстрации GigaAM распознаёт русскую фразу, локальная Qwen3-4B сокращает её, а готовое сообщение автоматически появляется в поле. Версия со звуком.

  • GigaAM v3 E2E RNNT — основной режим для русской речи;
  • Whisper Large V3 Turbo (MLX) — для смешанной русско-английской речи;
  • Qwen3-ASR 1.7B (MLX) — точный многоязычный режим;
  • Apple SpeechAnalyzer — системная локальная диктовка на macOS 26+;
  • Qwen3-4B (MLX) — локально исправляет или сокращает расшифровку;
  • режимы текста Дословно, Исправить и Кратко;
  • fn + ⌥ Option — начать или остановить запись;
  • HUD показывает запись, расшифровку, локальную редактуру и результат;
  • аудио и текст не отправляются во внешние API;
  • журнал сравнения помогает выбрать модель под собственную речь.

Important

Это beta-релиз для Mac с Apple Silicon. Приложение пока подписано ad-hoc и не нотарифицировано Apple. Подробно о различиях и плане выпуска: подпись и нотарификация.

Системные требования

  • Mac с Apple Silicon (M1 или новее);
  • macOS 14 Sonoma или новее;
  • рекомендуется 16 ГБ оперативной памяти;
  • около 2,5 ГБ для рекомендуемой установки с GigaAM или около 10 ГБ для всех моделей;
  • интернет только во время первоначальной установки моделей.

Установка

  1. Откройте GitHub Releases, выберите самый новый релиз и скачайте VoiceSwitch-…-macos-arm64.dmg.
  2. Откройте DMG и обязательно перетащите VoiceSwitch.app на ярлык «Программы». Не запускайте приложение прямо из DMG.
  3. Откройте папку «Программы», щёлкните VoiceSwitch правой кнопкой и выберите Открыть. Затем ещё раз подтвердите Открыть в предупреждении macOS.
  4. В мастере выберите стартовый комплект. Для первой проверки рекомендуется «Русская диктовка»: только GigaAM, около 2,5 ГБ. Остальные модели и локальный редактор можно добавить позже.
  5. Разрешите микрофон и включите VoiceSwitch в разделе Системные настройки → Конфиденциальность и безопасность → Универсальный доступ. Это необходимо для fn + Option и автоматической вставки.
  6. Поставьте курсор в любое поле ввода, нажмите fn + Option, произнесите фразу и нажмите сочетание повторно. Дождитесь зелёного индикатора.

Подробности и решение типовых проблем приведены в INSTALL.md.

Обновление без повторной загрузки моделей

Завершите VoiceSwitch, замените старый /Applications/VoiceSwitch.app новой версией и снова откройте приложение правой кнопкой. Модели, настройки и журнал хранятся отдельно в ~/Library/Application Support/VoiceSwitch, поэтому скачивать их заново не требуется.

Публичная beta не подписана Apple Developer ID. После замены приложения macOS иногда отключает универсальный доступ. Если распознавание работает, но текст только копируется в буфер обмена, выключите и снова включите VoiceSwitch в разделе Универсальный доступ, затем перезапустите приложение. Полная инструкция восстановления приведена в INSTALL.md.

Если этап установки прервётся, нажмите Продолжить установку: VoiceSwitch восстановит недостающие зависимости и использует уже загруженные файлы. Причина сбоя показывается в меню, а полный журнал сохраняется в ~/Library/Application Support/VoiceSwitch/Runtime/install.log.

Использование

  1. Выберите GigaAM, Whisper, Qwen или Apple в меню VoiceSwitch.
  2. Выберите режим текста: Дословно, Исправить или Кратко.
  3. Нажмите fn + ⌥ Option, чтобы начать запись.
  4. Отпустите клавиши и нажмите сочетание ещё раз, чтобы остановить запись.
  5. Дождитесь завершения расшифровки и, если выбран соответствующий режим, локальной редактуры. Текст будет вставлен в ранее активное окно или останется в буфере обмена, если универсальный доступ отключён.

Во время записи отображается красный пульсирующий индикатор с таймером. Во время распознавания он сменяется индикатором модели и времени ожидания. При обработке Qwen появляется отдельный фиолетовый индикатор «Редактирую текст». HUD не перехватывает клики.

Режим Исправить сохраняет содержательные детали, но убирает слова-паразиты, повторы и ошибки пунктуации. Режим Кратко превращает расшифровку в компактное сообщение для переписки. Если редактор вернёт ошибку, VoiceSwitch автоматически вставит исходную расшифровку.

Модель загружается лениво. Если выбранный движок ещё не установлен, VoiceSwitch покажет его размер и предложит загрузить только этот компонент. При переключении предыдущая загруженная модель выгружается, чтобы не занимать память. Apple использует системные ресурсы распознавания и может отдельно запросить разрешение «Распознавание речи».

Где хранятся данные

Runtime и веса моделей:

~/Library/Application Support/VoiceSwitch/Runtime

Журнал сравнительных тестов:

~/Library/Application Support/VoiceSwitch/comparison.jsonl

В журнале сохраняются модель, длительность записи, время распознавания, RTF, определённый язык, исходная расшифровка, результат локальной редактуры, её режим и ваша оценка. Журнал остаётся на Mac. Временные аудиофайлы удаляются после обработки.

Результаты сравнительного теста

27 июля 2026 года четыре движка были проверены на восьми одинаковых аудиофрагментах общей продолжительностью 209,5 секунды. В набор вошли многоголосые рассказы, быстрый диалог, одиночный диктор, русский рок, женский вокал, смешанный русско-английский трек и быстрый речитатив.

Модель Средняя задержка Наблюдение Рекомендуемая роль
GigaAM v3 E2E RNNT 0,77 с Самый ровный и полный русский результат Основная модель для русского
Whisper Large V3 Turbo 2,52 с Быстрый, но хуже переносит музыку и сложный вокал Запасной режим для смешанной речи
Qwen3-ASR 1.7B 19,00 с Иногда точнее в отдельных фразах, но может переключаться на английский Экспериментальный режим
Apple SpeechAnalyzer 0,42 с Минимальная задержка, но сильное обрезание сложного звука Сравнение на чистой речи

Высокая скорость Apple в этом тесте не означает высокую точность: движок вернул только 25 слов на четырёх речевых файлах и пустой результат на всех музыкальных примерах. Максимальная задержка Qwen достигла 36,24 секунды.

Итоговая практическая рекомендация — GigaAM для русской диктовки и Whisper для настоящей смешанной русско-английской речи. Это сравнительный тест без эталонной ручной разметки, поэтому цифры нельзя считать универсальным WER.

Подробная методика, результаты по сценариям и ограничения описаны в полном отчёте.

Как выбрать модель

Проверьте модели на одинаковом наборе из 10–20 фраз:

  • обычная русская диктовка;
  • имена, названия продуктов и профессиональные термины;
  • числа, даты и адреса;
  • переключения русского и английского внутри одной фразы;
  • короткие и длинные голосовые сообщения.

Публичный тест выше помогает выбрать отправную точку, но окончательную модель лучше определять на своей речи, микрофоне, именах и рабочих терминах.

Сборка из исходников

git clone https://github.com/mitimaicode/VoiceSwitch.git
cd VoiceSwitch
chmod +x scripts/*.sh Resources/install_runtime.sh
./scripts/build_app.sh

Установка четырёх загружаемых моделей для разработки:

./scripts/setup_models.sh

Создание компактного release-архива без весов моделей:

./scripts/package_release.sh 0.3.3-beta

Публичный release-скрипт по умолчанию использует ad-hoc подпись. Для стабильной локальной подписи разработки можно передать имя собственной code-signing identity через VOICESWITCH_CODESIGN_IDENTITY.

Обратная связь

  • воспроизводимые ошибки — Issues;
  • вопросы, идеи и результаты сравнения моделей — Discussions;
  • правила участия — CONTRIBUTING.md;
  • сообщения об уязвимостях — SECURITY.md.

История публичных показателей проекта сохраняется в metrics/github-stats.json. GitHub также показывает владельцу просмотры, источники переходов и клоны за последние 14 дней в разделе Insights → Traffic.

Зависимости и лицензии

Код VoiceSwitch распространяется по лицензии MIT. Модели и движки загружаются отдельно из исходных проектов:

VoiceSwitch не связан с авторами перечисленных проектов.


English summary

VoiceSwitch is a local macOS dictation menu-bar app for Apple Silicon. It switches between GigaAM, Whisper Large V3 Turbo, Qwen3-ASR 1.7B, and Apple SpeechAnalyzer. A local Qwen3-4B model can clean up or shorten the transcript. Press fn + Option to start or stop recording. Audio and transcripts stay on the Mac. Apple SpeechAnalyzer requires macOS 26 or newer. See INSTALL.md for installation details and use GitHub Issues or Discussions for feedback.

About

Local macOS dictation with GigaAM, Whisper, Qwen and Apple Speech — offline transcription and local text cleanup

Topics

Resources

Code of conduct

Contributing

Security policy

Stars

5 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages