Локальная диктовка и редактура текста для macOS.
VoiceSwitch записывает речь по глобальной горячей клавише, распознаёт её полностью локально и вставляет текст в активное приложение.
В демонстрации GigaAM распознаёт русскую фразу, локальная Qwen3-4B сокращает её, а готовое сообщение автоматически появляется в поле. Версия со звуком.
- GigaAM v3 E2E RNNT — основной режим для русской речи;
- Whisper Large V3 Turbo (MLX) — для смешанной русско-английской речи;
- Qwen3-ASR 1.7B (MLX) — точный многоязычный режим;
- Apple SpeechAnalyzer — системная локальная диктовка на macOS 26+;
- Qwen3-4B (MLX) — локально исправляет или сокращает расшифровку;
- режимы текста Дословно, Исправить и Кратко;
fn + ⌥ Option— начать или остановить запись;- HUD показывает запись, расшифровку, локальную редактуру и результат;
- аудио и текст не отправляются во внешние API;
- журнал сравнения помогает выбрать модель под собственную речь.
Important
Это beta-релиз для Mac с Apple Silicon. Приложение пока подписано ad-hoc и не нотарифицировано Apple. Подробно о различиях и плане выпуска: подпись и нотарификация.
- Mac с Apple Silicon (
M1или новее); - macOS 14 Sonoma или новее;
- рекомендуется 16 ГБ оперативной памяти;
- около 2,5 ГБ для рекомендуемой установки с GigaAM или около 10 ГБ для всех моделей;
- интернет только во время первоначальной установки моделей.
- Откройте GitHub Releases,
выберите самый новый релиз и скачайте
VoiceSwitch-…-macos-arm64.dmg. - Откройте DMG и обязательно перетащите
VoiceSwitch.appна ярлык «Программы». Не запускайте приложение прямо из DMG. - Откройте папку «Программы», щёлкните VoiceSwitch правой кнопкой и выберите Открыть. Затем ещё раз подтвердите Открыть в предупреждении macOS.
- В мастере выберите стартовый комплект. Для первой проверки рекомендуется «Русская диктовка»: только GigaAM, около 2,5 ГБ. Остальные модели и локальный редактор можно добавить позже.
- Разрешите микрофон и включите VoiceSwitch в разделе
Системные настройки → Конфиденциальность и безопасность →
Универсальный доступ. Это необходимо для
fn + Optionи автоматической вставки. - Поставьте курсор в любое поле ввода, нажмите
fn + Option, произнесите фразу и нажмите сочетание повторно. Дождитесь зелёного индикатора.
Подробности и решение типовых проблем приведены в INSTALL.md.
Завершите VoiceSwitch, замените старый /Applications/VoiceSwitch.app новой
версией и снова откройте приложение правой кнопкой. Модели, настройки и журнал
хранятся отдельно в ~/Library/Application Support/VoiceSwitch, поэтому
скачивать их заново не требуется.
Публичная beta не подписана Apple Developer ID. После замены приложения macOS иногда отключает универсальный доступ. Если распознавание работает, но текст только копируется в буфер обмена, выключите и снова включите VoiceSwitch в разделе Универсальный доступ, затем перезапустите приложение. Полная инструкция восстановления приведена в INSTALL.md.
Если этап установки прервётся, нажмите Продолжить установку: VoiceSwitch
восстановит недостающие зависимости и использует уже загруженные файлы.
Причина сбоя показывается в меню, а полный журнал сохраняется в
~/Library/Application Support/VoiceSwitch/Runtime/install.log.
- Выберите GigaAM, Whisper, Qwen или Apple в меню VoiceSwitch.
- Выберите режим текста: Дословно, Исправить или Кратко.
- Нажмите
fn + ⌥ Option, чтобы начать запись. - Отпустите клавиши и нажмите сочетание ещё раз, чтобы остановить запись.
- Дождитесь завершения расшифровки и, если выбран соответствующий режим, локальной редактуры. Текст будет вставлен в ранее активное окно или останется в буфере обмена, если универсальный доступ отключён.
Во время записи отображается красный пульсирующий индикатор с таймером. Во время распознавания он сменяется индикатором модели и времени ожидания. При обработке Qwen появляется отдельный фиолетовый индикатор «Редактирую текст». HUD не перехватывает клики.
Режим Исправить сохраняет содержательные детали, но убирает слова-паразиты, повторы и ошибки пунктуации. Режим Кратко превращает расшифровку в компактное сообщение для переписки. Если редактор вернёт ошибку, VoiceSwitch автоматически вставит исходную расшифровку.
Модель загружается лениво. Если выбранный движок ещё не установлен, VoiceSwitch покажет его размер и предложит загрузить только этот компонент. При переключении предыдущая загруженная модель выгружается, чтобы не занимать память. Apple использует системные ресурсы распознавания и может отдельно запросить разрешение «Распознавание речи».
Runtime и веса моделей:
~/Library/Application Support/VoiceSwitch/Runtime
Журнал сравнительных тестов:
~/Library/Application Support/VoiceSwitch/comparison.jsonl
В журнале сохраняются модель, длительность записи, время распознавания, RTF, определённый язык, исходная расшифровка, результат локальной редактуры, её режим и ваша оценка. Журнал остаётся на Mac. Временные аудиофайлы удаляются после обработки.
27 июля 2026 года четыре движка были проверены на восьми одинаковых аудиофрагментах общей продолжительностью 209,5 секунды. В набор вошли многоголосые рассказы, быстрый диалог, одиночный диктор, русский рок, женский вокал, смешанный русско-английский трек и быстрый речитатив.
| Модель | Средняя задержка | Наблюдение | Рекомендуемая роль |
|---|---|---|---|
| GigaAM v3 E2E RNNT | 0,77 с | Самый ровный и полный русский результат | Основная модель для русского |
| Whisper Large V3 Turbo | 2,52 с | Быстрый, но хуже переносит музыку и сложный вокал | Запасной режим для смешанной речи |
| Qwen3-ASR 1.7B | 19,00 с | Иногда точнее в отдельных фразах, но может переключаться на английский | Экспериментальный режим |
| Apple SpeechAnalyzer | 0,42 с | Минимальная задержка, но сильное обрезание сложного звука | Сравнение на чистой речи |
Высокая скорость Apple в этом тесте не означает высокую точность: движок вернул только 25 слов на четырёх речевых файлах и пустой результат на всех музыкальных примерах. Максимальная задержка Qwen достигла 36,24 секунды.
Итоговая практическая рекомендация — GigaAM для русской диктовки и Whisper для настоящей смешанной русско-английской речи. Это сравнительный тест без эталонной ручной разметки, поэтому цифры нельзя считать универсальным WER.
Подробная методика, результаты по сценариям и ограничения описаны в полном отчёте.
Проверьте модели на одинаковом наборе из 10–20 фраз:
- обычная русская диктовка;
- имена, названия продуктов и профессиональные термины;
- числа, даты и адреса;
- переключения русского и английского внутри одной фразы;
- короткие и длинные голосовые сообщения.
Публичный тест выше помогает выбрать отправную точку, но окончательную модель лучше определять на своей речи, микрофоне, именах и рабочих терминах.
git clone https://github.com/mitimaicode/VoiceSwitch.git
cd VoiceSwitch
chmod +x scripts/*.sh Resources/install_runtime.sh
./scripts/build_app.shУстановка четырёх загружаемых моделей для разработки:
./scripts/setup_models.shСоздание компактного release-архива без весов моделей:
./scripts/package_release.sh 0.3.3-betaПубличный release-скрипт по умолчанию использует ad-hoc подпись. Для стабильной
локальной подписи разработки можно передать имя собственной code-signing
identity через VOICESWITCH_CODESIGN_IDENTITY.
- воспроизводимые ошибки — Issues;
- вопросы, идеи и результаты сравнения моделей — Discussions;
- правила участия — CONTRIBUTING.md;
- сообщения об уязвимостях — SECURITY.md.
История публичных показателей проекта сохраняется в
metrics/github-stats.json. GitHub также
показывает владельцу просмотры, источники переходов и клоны за последние
14 дней в разделе Insights → Traffic.
Код VoiceSwitch распространяется по лицензии MIT. Модели и движки загружаются отдельно из исходных проектов:
- GigaAM — MIT;
- OpenAI Whisper — MIT;
- MLX Whisper;
- Qwen3-ASR — Apache-2.0;
- mlx-qwen3-asr — Apache-2.0;
- Qwen3-4B — Apache-2.0;
- MLX LM — MIT;
- Apple Speech framework — системный компонент macOS;
- uv — Apache-2.0 / MIT.
VoiceSwitch не связан с авторами перечисленных проектов.
English summary
VoiceSwitch is a local macOS dictation menu-bar app for Apple Silicon. It
switches between GigaAM, Whisper Large V3 Turbo, Qwen3-ASR 1.7B, and Apple
SpeechAnalyzer. A local Qwen3-4B model can clean up or shorten the transcript.
Press fn + Option to start or stop recording. Audio and transcripts stay on
the Mac. Apple SpeechAnalyzer requires macOS 26 or newer.
See INSTALL.md for installation details and use GitHub Issues or
Discussions for feedback.