-
Notifications
You must be signed in to change notification settings - Fork 0
Indonesian Real Time Transcription
Transkripsi Waktu Nyata menampilkan teks yang dikenali di bawah indikator rekaman saat rekaman masih berlangsung. Aktifkan di Pengaturan → Transkripsi Waktu Nyata, lalu pilih tepat satu mode.
Transkripsi Blok menggunakan kembali model Whisper atau Parakeet utama yang dipilih. Selama rekaman, ia menyalin jendela audio yang saling tumpang tindih, menggabungkan kata-kata yang dikenali berdasarkan timestamp mereka, dan menganggap teks stabil setelah tetap konsisten. Ketika rekaman berakhir, Voice2Win menambahkan ekor yang hilang atau melakukan transkripsi fallback penuh jika terdeteksi celah.
Keuntungan:
- Menggunakan model transkripsi utama dan pemilihan bahasa yang sama seperti transkripsi akhir.
- Membuat diktasi panjang dapat digunakan lebih awal tanpa memuat pengenal streaming terpisah.
- Dapat menjalankan pemeriksaan tambahan yang digeser di sekitar batas kalimat untuk memperbaiki hasil blok sebelumnya.
Persyaratan dan pertukaran:
- Dirancang untuk percepatan kartu grafis dan mungkin tidak tersedia ketika transkripsi audio dialokasikan ke prosesor utama.
- Memerlukan memori grafis yang cukup untuk model yang dipilih dan pekerjaan yang tumpang tindih.
- Jendela yang lebih sering atau lebih besar meningkatkan penggunaan komputasi.
| Pengaturan | Default | Efek |
|---|---|---|
| Ukuran jendela | 10 detik | Durasi audio maksimum yang terlihat oleh satu kali jalannya model utama. Jendela yang lebih besar menambah konteks tetapi memakan waktu lebih lama. |
| Interval loncatan | 3 detik | Waktu antara snapshot baru. Nilai yang lebih kecil memperbarui lebih sering dan memulai lebih banyak pekerjaan. |
| Tumpang tindih / konteks | 20 detik | Audio sebelumnya disertakan lagi untuk konteks dan penggabungan. |
| Penundaan stabilitas | 6 detik | Berapa lama teks baru harus tetap tidak berubah sebelum menjadi stabil. |
| Batas waktu saat diam | 1000 milidetik | Menerima teks stabil yang tertunda setelah periode ini tanpa terdeteksi ucapan. |
| Pemeriksaan batas kalimat tambahan | 2 | Pemeriksaan tambahan yang digeser per batas kalimat; nol menonaktifkan jalannya pemeriksaan ekstra. |
| Faktor geser | 20 persen | Mengontrol sejauh mana jendela kalimat tambahan digeser. |
Gunakan Restore Defaults jika penyesuaian manual membuat output lebih lambat atau kurang stabil.
Transkripsi Aliran menjalankan pengenal online Sherpa-ONNX terpisah secara paralel dengan perekaman. Ini menghasilkan kalimat interim sangat awal, yang kemudian disempurnakan oleh model transkripsi utama dalam kelompok yang saling tumpang tindih.
Keunggulan:
- Hasil interim yang terlihat paling awal.
- Dapat dijalankan di prosesor utama atau, di Windows, dengan akselerasi kartu grafis DirectML.
Kompromi:
- Hanya mendukung bahasa yang memiliki model aliran dalam katalog saat ini.
- Pengakuan interim mentah bisa lebih kasar dibandingkan hasil model utama akhir.
- Mengunduh dan menyimpan model tambahan untuk setiap bahasa atau varian model yang dipilih.
- Lingkungan runtime — pilih prosesor utama untuk kompatibilitas atau kartu grafis Windows untuk kecepatan.
- Model audio streaming — Lebih cepat meminimalkan latensi dan waktu pemuatan; Lebih akurat tetapi lebih lambat menggunakan lebih banyak komputasi untuk kualitas pengenalan.
- Jumlah kalimat yang disempurnakan bersama — mengontrol jendela penyempurnaan model utama yang tumpang tindih dari 1 hingga 8 kalimat; default adalah 2.
- Model audio streaming yang dimuat — menampilkan model yang tersimpan di cache dan memungkinkan penghapusan. Model yang dihapus akan diunduh kembali saat dibutuhkan.
Tinggi teks maksimum di bawah indikator perekaman membatasi teks real-time hingga 10–90 persen dari tinggi layar; default adalah 50 persen. Teks yang lebih panjang tetap dapat digulir dan mengikuti hasil terbaru hingga Anda menggulir ke atas secara manual.
- Pilih Transkripsi Blok ketika Anda menginginkan perilaku model utama dan memiliki performa kartu grafis serta memori yang cukup.
- Pilih Transkripsi Aliran ketika teks sementara secepat mungkin penting dan bahasa Anda didukung.
- Nonaktifkan transkripsi waktu nyata ketika Anda lebih memilih jalur paling sederhana dan hanya membutuhkan hasil akhir setelah perekaman.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động