-
Notifications
You must be signed in to change notification settings - Fork 0
Russian Real Time Transcription
Транскрипция в реальном времени отображает распознанный текст под индикатором записи, пока запись всё ещё продолжается. Включите её в Настройки → Транскрипция в реальном времени, затем выберите ровно один режим.
Построчная транскрипция повторно использует выбранную основную модель Whisper или Parakeet. Во время записи она транскрибирует перекрывающиеся аудиоокна, объединяет распознанные слова по временным меткам и считает текст стабильным после того, как он остаётся неизменным. Когда запись заканчивается, Voice2Win добавляет недостающий хвост или выполняет полную резервную транскрипцию, если были обнаружены пропуски.
Преимущества:
- Использует ту же основную модель транскрипции и выбор языка, что и финальная транскрипция.
- Делает длинные диктовки доступными раньше, без загрузки отдельного потокового распознавателя.
- Может выполнять дополнительные смещённые проверки на границах предложений, чтобы исправлять результаты предыдущих блоков.
Требования и компромиссы:
- Предназначено для ускорения на графическом процессоре и может быть недоступно, когда аудиотранскрипция назначена на основной процессор.
- Требуется достаточный объём графической памяти для выбранной модели и параллельной работы.
- Более частые или большие окна увеличивают использование вычислительных ресурсов.
| Настройка | По умолчанию | Эффект |
|---|---|---|
| Размер окна | 10 секунд | Максимальная продолжительность аудио, обрабатываемая одной основной моделью за раз. Большие окна дают больше контекста, но требуют больше времени. |
| Интервал между срезами | 3 секунды | Время между новыми снимками. Меньшие значения обновляют чаще и запускают больше работы. |
| Перекрытие / контекст | 20 секунд | Ранее записанное аудио включается снова для контекста и объединения. |
| Задержка стабильности | 6 секунд | Как долго новый текст должен оставаться без изменений, прежде чем он станет стабильным. |
| Лимит времени при тишине | 1000 миллисекунд | Принимает ожидающий стабильный текст после этого периода без обнаруженной речи. |
| Дополнительные проверки границ предложений | 2 | Дополнительные смещённые проверки на каждую границу предложения; ноль отключает дополнительные прогонки. |
| Фактор смещения | 20 процентов | Контролирует, насколько смещаются дополнительные окна предложений. |
Используйте Восстановить настройки по умолчанию, если ручная настройка делает вывод медленнее или менее стабильным.
Транскрипция потока запускает отдельный онлайн-распознаватель Sherpa-ONNX параллельно с записью. Он генерирует очень ранние промежуточные предложения, которые затем основная модель транскрипции уточняет в перекрывающихся группах.
Преимущества:
- Самые ранние видимые промежуточные результаты.
- Может работать на основном процессоре или, в Windows, с ускорением на графической карте через DirectML.
Недостатки:
- Поддерживает только языки, для которых существует потоковая модель в текущем каталоге.
- Промежуточное распознавание может быть грубее, чем итоговый результат основной модели.
- Загружает и кэширует дополнительную модель для каждого выбранного языка или варианта модели.
- Среда выполнения — выберите основной процессор для совместимости или графическую карту Windows для скорости.
- Потоковая аудиомодель — Быстрее минимизирует задержку и время загрузки; Более точная, но медленнее тратит больше вычислительных ресурсов на качество распознавания.
- Количество предложений, обрабатываемых вместе — управляет перекрывающимся окном доработки основной модели от 1 до 8 предложений; по умолчанию 2.
- Загруженные потоковые аудиомодели — показывает закэшированные модели и позволяет их удалять. Удалённая модель будет загружена снова при необходимости.
Максимальная высота текста под индикатором записи ограничивает текст в реальном времени от 10 до 90 процентов высоты экрана; по умолчанию 50 процентов. Более длинный текст остаётся прокручиваемым и следует за последним результатом до тех пор, пока вы вручную не прокрутите вверх.
- Выберите Блочную транскрипцию, когда вам необходимо поведение основного модуля и у вас достаточно производительности графического процессора и памяти.
- Выберите Потоковую транскрипцию, когда важен самый ранний промежуточный текст и ваш язык поддерживается.
- Отключите реальную транскрипцию, если вы предпочитаете самый простой процесс и вам нужен только конечный результат после записи.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động