Releases: mitimaicode/VoiceSwitch
Release list
VoiceSwitch v0.3.0-beta
VoiceSwitch v0.3.0-beta
VoiceSwitch теперь умеет не только локально распознавать речь, но и сразу
превращать расшифровку в готовое сообщение. Аудио и текст по-прежнему не
отправляются во внешние API.
Что появилось
- три режима текста:
- Дословно — вставляет исходную расшифровку;
- Исправить — убирает слова-паразиты и повторы, исправляет пунктуацию,
сохраняя содержательные детали; - Кратко — локально превращает диктовку в компактное сообщение;
- локальный текстовый редактор Qwen3-4B через MLX;
- отдельный фиолетовый HUD «Редактирую текст» во время обработки;
- исходная и отредактированная версии сохраняются в локальном журнале
сравнения; - если редактор не ответит или вернёт ошибку, VoiceSwitch автоматически
вставит исходную расшифровку.
Режимы доступны с каждым движком распознавания: GigaAM, Whisper Large V3
Turbo, Qwen3-ASR 1.7B и Apple SpeechAnalyzer.
Результат локальной проверки
Релиз проверен на реальной русской диктовке в режимах Исправить и
Кратко. В двух контрольных сообщениях Qwen3-4B убрал ложные старты,
междометия и повторы, сохранив просьбы и смысл. Обработка текста после
распознавания заняла около 4,2–4,8 секунды.
Изменения не затрагивают сами движки распознавания. Результаты их предыдущего
сравнения остаются актуальной отправной точкой:
| Модель | Средняя задержка в тесте v0.2.0 | Рекомендация |
|---|---|---|
| GigaAM | 0,77 с | Основной режим для русского языка |
| Whisper | 2,52 с | Смешанная русско-английская речь |
| Qwen3-ASR | 19,00 с | Экспериментальный режим |
| Apple SpeechAnalyzer | 0,42 с | Быстрый системный режим, macOS 26+ |
Подробности находятся в
отчёте о сравнении.
Установка
- Скачайте
VoiceSwitch-0.3.0-beta-macos-arm64.zip. - Распакуйте архив и перенесите
VoiceSwitch.appв/Applications. - При первом запуске щёлкните приложение правой кнопкой и выберите
Открыть. - В меню VoiceSwitch выберите Установить модели.
- Разрешите микрофон и включите VoiceSwitch в
Системные настройки → Конфиденциальность и безопасность →
Универсальный доступ.
Первоначальная установка загружает GigaAM, Whisper, Qwen3-ASR и Qwen3-4B и
требует около 12 ГБ свободного места.
Если текст распознаётся, но не вставляется
После замены ad-hoc сборки macOS может сохранить разрешение для старой подписи.
Сбросьте только запись VoiceSwitch:
tccutil reset Accessibility io.github.mitimaicode.VoiceSwitchЗатем заново добавьте установленный VoiceSwitch.app в раздел
Универсальный доступ и перезапустите приложение. Распознанный текст при
ошибке автоподстановки остаётся в буфере обмена.
Ограничения beta
- только Mac с Apple Silicon и macOS 14 или новее;
- приложение подписано ad-hoc и пока не нотарифицировано;
- Apple SpeechAnalyzer требует macOS 26 или новее;
- модели загружаются отдельно при первой установке;
- после обновления сборки может потребоваться повторно включить разрешение
«Универсальный доступ».
Пожалуйста, сообщайте о проблемах в
GitHub Issues и
публикуйте собственные результаты в
GitHub Discussions.
VoiceSwitch v0.2.0-beta
VoiceSwitch v0.2.0-beta
VoiceSwitch — локальное приложение для диктовки на Mac с Apple Silicon.
Запись запускается глобальным сочетанием fn + Option, распознаётся на самом
Mac и автоматически вставляется в ранее активное окно.
Что появилось
- четыре переключаемых движка:
- GigaAM v3 E2E RNNT;
- Whisper Large V3 Turbo через MLX;
- Qwen3-ASR 1.7B через MLX;
- Apple SpeechAnalyzer на macOS 26+;
- HUD с отдельными состояниями записи и длительной расшифровки;
- сохранение текста в буфер обмена, если автоматическая вставка недоступна;
- локальный журнал сравнения моделей;
- встроенная установка Python, ffmpeg, зависимостей и весов моделей;
- обновлённая документация по разрешениям macOS.
Результаты тестирования
Четыре модели были проверены на восьми одинаковых фрагментах общей
продолжительностью 209,5 секунды: рассказы, диалоги, дикторская речь, русский
рок, женский вокал, смешанный трек и быстрый речитатив.
| Модель | Средняя задержка | Результат |
|---|---|---|
| GigaAM | 0,77 с | Лучший общий баланс для русского языка |
| Whisper | 2,52 с | Практичный запасной режим для смешанной речи |
| Qwen3-ASR | 19,00 с | Экспериментальный: медленный и иногда меняет язык |
| Apple SpeechAnalyzer | 0,42 с | Очень быстрый, но обрезает сложный звук |
Рекомендация текущей beta: GigaAM по умолчанию для русского, Whisper для
русско-английской речи. Подробности находятся в
отчёте о тестировании.
Установка
- Скачайте
VoiceSwitch-0.2.0-beta-macos-arm64.zip. - Распакуйте архив и перенесите
VoiceSwitch.appв/Applications. - При первом запуске щёлкните приложение правой кнопкой и выберите
Открыть. - В меню VoiceSwitch выберите Установить модели.
- Разрешите микрофон и включите VoiceSwitch в
Системные настройки → Конфиденциальность и безопасность →
Универсальный доступ.
Если после обновления текст распознаётся, но не вставляется, сбросьте старую
запись разрешения и добавьте установленный VoiceSwitch.app заново:
tccutil reset Accessibility io.github.mitimaicode.VoiceSwitchЗатем откройте Системные настройки → Конфиденциальность и безопасность →
Универсальный доступ, нажмите +, выберите VoiceSwitch и перезапустите
приложение. Текст при этом не теряется — он остаётся в буфере обмена.
Ограничения beta
- только Mac с Apple Silicon;
- приложение подписано ad-hoc и пока не нотарифицировано;
- модели занимают около 9 ГБ и загружаются после установки;
- Apple SpeechAnalyzer требует macOS 26 или новее;
- Qwen3-ASR может работать дольше длительности записи;
- после замены ad-hoc сборки macOS может потребовать повторно включить
разрешение «Универсальный доступ».
Пожалуйста, сообщайте о проблемах в
GitHub Issues и
публикуйте собственные результаты сравнения в
GitHub Discussions.
VoiceSwitch v0.1.0-beta.2
VoiceSwitch v0.1.0-beta.1 (superseded)
Эта промежуточная сборка заменена проверенным релизом v0.1.0-beta.2. Пожалуйста, скачивайте актуальную версию: https://github.com/mitimaicode/VoiceSwitch/releases/tag/v0.1.0-beta.2