Skip to content

VoiceSwitch v0.3.0-beta

Pre-release
Pre-release

Choose a tag to compare

@github-actions github-actions released this 27 Jul 18:26

VoiceSwitch v0.3.0-beta

VoiceSwitch теперь умеет не только локально распознавать речь, но и сразу
превращать расшифровку в готовое сообщение. Аудио и текст по-прежнему не
отправляются во внешние API.

Что появилось

  • три режима текста:
    • Дословно — вставляет исходную расшифровку;
    • Исправить — убирает слова-паразиты и повторы, исправляет пунктуацию,
      сохраняя содержательные детали;
    • Кратко — локально превращает диктовку в компактное сообщение;
  • локальный текстовый редактор Qwen3-4B через MLX;
  • отдельный фиолетовый HUD «Редактирую текст» во время обработки;
  • исходная и отредактированная версии сохраняются в локальном журнале
    сравнения;
  • если редактор не ответит или вернёт ошибку, VoiceSwitch автоматически
    вставит исходную расшифровку.

Режимы доступны с каждым движком распознавания: GigaAM, Whisper Large V3
Turbo, Qwen3-ASR 1.7B и Apple SpeechAnalyzer.

Результат локальной проверки

Релиз проверен на реальной русской диктовке в режимах Исправить и
Кратко. В двух контрольных сообщениях Qwen3-4B убрал ложные старты,
междометия и повторы, сохранив просьбы и смысл. Обработка текста после
распознавания заняла около 4,2–4,8 секунды.

Изменения не затрагивают сами движки распознавания. Результаты их предыдущего
сравнения остаются актуальной отправной точкой:

Модель Средняя задержка в тесте v0.2.0 Рекомендация
GigaAM 0,77 с Основной режим для русского языка
Whisper 2,52 с Смешанная русско-английская речь
Qwen3-ASR 19,00 с Экспериментальный режим
Apple SpeechAnalyzer 0,42 с Быстрый системный режим, macOS 26+

Подробности находятся в
отчёте о сравнении.

Установка

  1. Скачайте VoiceSwitch-0.3.0-beta-macos-arm64.zip.
  2. Распакуйте архив и перенесите VoiceSwitch.app в /Applications.
  3. При первом запуске щёлкните приложение правой кнопкой и выберите
    Открыть.
  4. В меню VoiceSwitch выберите Установить модели.
  5. Разрешите микрофон и включите VoiceSwitch в
    Системные настройки → Конфиденциальность и безопасность →
    Универсальный доступ
    .

Первоначальная установка загружает GigaAM, Whisper, Qwen3-ASR и Qwen3-4B и
требует около 12 ГБ свободного места.

Если текст распознаётся, но не вставляется

После замены ad-hoc сборки macOS может сохранить разрешение для старой подписи.
Сбросьте только запись VoiceSwitch:

tccutil reset Accessibility io.github.mitimaicode.VoiceSwitch

Затем заново добавьте установленный VoiceSwitch.app в раздел
Универсальный доступ и перезапустите приложение. Распознанный текст при
ошибке автоподстановки остаётся в буфере обмена.

Ограничения beta

  • только Mac с Apple Silicon и macOS 14 или новее;
  • приложение подписано ad-hoc и пока не нотарифицировано;
  • Apple SpeechAnalyzer требует macOS 26 или новее;
  • модели загружаются отдельно при первой установке;
  • после обновления сборки может потребоваться повторно включить разрешение
    «Универсальный доступ».

Пожалуйста, сообщайте о проблемах в
GitHub Issues и
публикуйте собственные результаты в
GitHub Discussions.