Высокоточное приложение для голосового ввода текста, оптимизированное для русского языка. Работает полностью локально с использованием модели OpenAI Whisper, имитируя поведение системного инструмента Win+H, но с расширенными возможностями.
- Локальное распознавание: Используется модель
ggml-large-v3-turbo, которая обеспечивает флагманскую точность без отправки данных в облако. - Поддержка GPU: Аппаратное ускорение через DirectML/Clblast для мгновенной обработки текста.
- Мультиязычность: Поддержка русского (RU), английского (EN) и узбекского (UZ) языков.
- Глобальная активация: Вызов записи из любого окна по нажатию
Ctrl + Space. - Умная вставка: Программа автоматически печатает текст в активное текстовое поле сразу после завершения фразы.
- Детекция тишины (VAD): Автоматическая обработка фрагментов речи при паузах (1.5 сек) и полная остановка при долгой тишине (4 сек).
- Продвинутый звук: Программное усиление (Gain), шумоподавление (Noise Gate) и автоматическое выравнивание громкости (AGC).
- Архив записей: Каждая сессия сохраняется в формате
.wavв папкуRecordings.
- Запуск: Откройте приложение. Оно появится в нижней части экрана поверх всех окон.
- Выбор языка: Выберите нужный язык в верхнем меню (RU/EN/UZ).
- Активация: Нажмите центральную кнопку с микрофоном или используйте хоткей
Ctrl + Space. - Диктовка: Говорите. Когда вы сделаете паузу, текст автоматически появится в месте расположения курсора.
- Завершение: Программа сама перейдет в режим
Readyчерез 4 секунды тишины, либо вы можете нажать на кнопку повторно.
- ОС: Windows 10/11 (x64)
- Runtime: .NET 10
- Видеокарта: Рекомендуется GPU с поддержкой DirectML для быстрой работы (NVIDIA, AMD или Intel).
src/VoiceInputApp: Основной проект на C# (WPF).src/Services: Сервисы захвата звука, работы с нейросетью и эмуляции клавиатуры.model/: Директория для модели Whisper (ggml-large-v3-turbo-q8_0.bin).Recordings/: Папка для сохранения аудиофайлов сессий.
Разработано для обеспечения максимальной приватности и скорости ввода.
