-
Notifications
You must be signed in to change notification settings - Fork 0
Ukrainian Real Time Transcription
Транскрипція в режимі реального часу показує розпізнаний текст під індикатором запису, поки запис все ще триває. Увімкніть її в розділі Налаштування → Транскрипція в режимі реального часу, а потім виберіть точно один режим.
Блочна транскрипція повторно використовує обрану основну модель Whisper або Parakeet. Під час запису вона транскрибує перекриваючі вікна аудіо, об’єднує розпізнані слова за їх часовими мітками і вважає текст стабільним після того, як він залишався незмінним. Коли запис закінчується, Voice2Win додає відсутній кінець або виконує повну резервну транскрипцію, якщо були виявлені прогалини.
Переваги:
- Використовує ту ж основну модель транскрипції та вибір мови, що й остаточна транскрипція.
- Дозволяє довгі диктування використовувати раніше без завантаження окремого потокового розпізнавача.
- Може виконувати додаткові зміщені перевірки навколо меж речень для виправлення результатів попередніх блоків.
Вимоги та компроміси:
- Призначено для прискорення на графічній карті і може бути недоступним, коли аудіотранскрипція призначена для основного процесора.
- Вимагає достатньої графічної пам'яті для обраної моделі та накладених завдань.
- Частіші або більші вікна збільшують використання обчислювальних ресурсів.
| Налаштування | Значення за замовчуванням | Ефект |
|---|---|---|
| Розмір вікна | 10 секунд | Максимальна тривалість аудіо, яку бачить один запуск основної моделі. Великі вікна додають контекст, але потребують більше часу. |
| Інтервал переміщення | 3 секунди | Час між новими знімками. Менші значення оновлюються частіше і запускають більше роботи. |
| Перекриття / контекст | 20 секунд | Раніше записане аудіо додається для контексту та об'єднання. |
| Затримка стабільності | 6 секунд | Як довго новий текст повинен залишатися незмінним, перш ніж він стане стабільним. |
| Ліміт часу під час тиші | 1000 мілісекунд | Приймає очікуваний стабільний текст після цього періоду без виявленої мови. |
| Додаткові перевірки меж речень | 2 | Додаткові зміщені перевірки для кожної межі речення; нуль вимикає додаткові запуски. |
| Фактор зсуву | 20 відсотків | Контролює наскільки зміщені додаткові вікна речень. |
Використовуйте Відновити налаштування за замовчуванням, якщо ручне налаштування робить вихідні дані повільнішими або менш стабільними.
Потокова транскрипція запускає окремий потоковий розпізнавач Sherpa-ONNX паралельно із записом. Він дуже швидко створює проміжні речення, які потім основна модель транскрипції уточнює групами з перекриттям.
Переваги:
- Найраніше видимі проміжні результати.
- Може працювати на основному процесорі або, на Windows, з прискоренням через DirectML на графічній карті.
Недоліки:
- Підтримуються лише мови, для яких у поточному каталозі є потокова модель.
- Сире проміжне розпізнавання може бути грубішим, ніж фінальний результат основної моделі.
- Завантажує й кешує додаткову модель для кожної обраної мови або варіанту моделі.
- Середовище виконання — оберіть основний процесор для сумісності або графічну карту Windows для швидкості.
- Модель потокового аудіо — Швидша мінімізує затримку та час завантаження; Більш точна, але повільніша витрачає більше обчислювальних ресурсів для якості розпізнавання.
- Кількість речень, що уточнюються разом — контролює вікно уточнення основної моделі від 1 до 8 речень; за замовчуванням — 2.
- Завантажені моделі потокового аудіо — показує кешовані моделі та дозволяє видалення. Видалена модель буде завантажена знову, коли знадобиться.
Максимальна висота тексту під індикатором запису обмежує текст у реальному часі до 10–90 відсотків висоти екрана; за замовчуванням — 50 відсотків. Довший текст можна прокручувати; перегляд автоматично переходить до нових результатів, доки ви не прокрутите його вгору вручну.
- Виберіть Блочну транскрипцію, коли ви хочете поведінку основної моделі і маєте достатню продуктивність графічної карти та пам'ять.
- Виберіть Потокову транскрипцію, коли важливий якнайшвидший проміжний текст і ваша мова підтримується.
- Вимкніть транскрипцію в реальному часі, коли вам потрібен найпростіший конвеєр і результат потрібен лише після запису.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động