-
Notifications
You must be signed in to change notification settings - Fork 0
Thai Real Time Transcription
การถอดเสียงแบบเรียลไทม์จะแสดงข้อความที่ถูกจดจำใต้ตัวบ่งชี้การบันทึกขณะบันทึกยังดำเนินอยู่ เปิดใช้งานได้ที่ การตั้งค่า → การถอดเสียงแบบเรียลไทม์ จากนั้นเลือกโหมดเพียงโหมดเดียว
การถอดเสียงแบบเป็นบล็อกใช้โมเดลหลักของ Whisper หรือ Parakeet ที่เลือกไว้ ในระหว่างการบันทึก จะถอดเสียงหน้าต่างเสียงที่ทับซ้อนกัน รวมคำที่จดจำตามเวลาของพวกมัน และถือว่าข้อความมีความเสถียรหลังจากที่ข้อความคงที่ ต่อเมื่อการบันทึกสิ้นสุด Voice2Win จะเพิ่มส่วนหางที่หายไปหรือทำการถอดเสียงเต็มรูปแบบหากพบช่องว่าง
ข้อดี:
- ใช้โมเดลถอดความหลักและการเลือกภาษาตามการถอดความสุดท้ายเหมือนกัน
- ทำให้การบันทึกเสียงยาวสามารถใช้งานได้เร็วขึ้นโดยไม่ต้องโหลดตัวจดจำเสียงแบบสตรีมแยกต่างหาก
- สามารถทำการตรวจสอบเพิ่มเติมรอบ ๆ ขอบเขตประโยคเพื่อซ่อมแซมผลลัพธ์ของบล็อกก่อนหน้า
ข้อกำหนดและข้อแลกเปลี่ยน:
- ออกแบบมาเพื่อเร่งความเร็วด้วยการ์ดกราฟิกและอาจไม่สามารถใช้ได้เมื่อการถอดความเสียงถูกกำหนดให้กับหน่วยประมวลผลหลัก
- ต้องการหน่วยความจำกราฟิกเพียงพอสำหรับโมเดลที่เลือกและงานที่ทำซ้อนกัน
- หน้าต่างที่บ่อยขึ้นหรือใหญ่ขึ้นจะเพิ่มการใช้งานการประมวลผล
| การตั้งค่า | ค่าเริ่มต้น | ผลกระทบ |
|---|---|---|
| ขนาดหน้าต่าง | 10 วินาที | ระยะเวลาสูงสุดของเสียงที่เห็นโดยการทำงานหลักครั้งเดียว หน้าต่างขนาดใหญ่ช่วยเพิ่มบริบทแต่ใช้เวลานานขึ้น |
| ช่วงระยะก้าว | 3 วินาที | เวลาระหว่างภาพใหม่ ค่าเล็กลงทำให้รีเฟรชมากขึ้นและเริ่มงานมากขึ้น |
| การทับซ้อน / บริบท | 20 วินาที | รวมเสียงก่อนหน้านี้อีกครั้งเพื่อบริบทและการรวม |
| ความล่าช้าเสถียรภาพ | 6 วินาที | ระยะเวลาที่ข้อความใหม่ต้องไม่เปลี่ยนแปลงก่อนที่จะถือว่าเสถียร |
| ขีดจำกัดเวลาในช่วงเงียบ | 1000 มิลลิวินาที | รับข้อความที่เสถียรรออยู่หลังช่วงเวลานี้หากไม่มีการตรวจจับเสียงพูด |
| การตรวจสอบขอบเขตประโยคเพิ่มเติม | 2 | การตรวจสอบเพิ่มเติมต่อขอบเขตประโยค; ใส่ค่าเป็นศูนย์เพื่อปิดการทำงานเสริม |
| ตัวคูณการเลื่อน | 20 เปอร์เซ็นต์ | ควบคุมความไกลที่หน้าต่างประโยคพิเศษจะถูกเลื่อน |
ใช้ กู้คืนค่าเริ่มต้น หากการปรับจูนด้วยตนเองทำให้เอาต์พุตช้าลงหรือน้อยเสถียรภาพลง
การถอดเสียงสตรีมจะรันตัวจำแนก Sherpa-ONNX ออนไลน์แยกต่างหากไปพร้อมกับการบันทึก มันสร้างประโยคชั่วคราวตั้งแต่เนิ่น ๆ ซึ่งโมเดลการถอดเสียงหลักจะปรับแต่งในกลุ่มที่ทับซ้อนกัน
ข้อดี:
- ผลลัพธ์ชั่วคราวที่มองเห็นได้เร็วที่สุด
- สามารถรันบนโปรเซสเซอร์หลักหรือ บน Windows ด้วยการเร่งฮาร์ดแวร์ DirectML ของการ์ดกราฟิก
ข้อแลกเปลี่ยน:
- รองรับเฉพาะภาษาที่มีโมเดลสตรีมในแค็ตตาล็อกปัจจุบัน
- การจดจำชั่วคราวดิบ ๆ อาจหยาบกว่าผลลัพธ์ของโมเดลหลักสุดท้าย
- ดาวน์โหลดและแคชโมเดลเพิ่มเติมสำหรับแต่ละภาษาหรือรูปแบบโมเดลที่เลือก
- สภาพแวดล้อมรันไทม์ — เลือกโปรเซสเซอร์หลักเพื่อความเข้ากันได้ หรือเลือกการ์ดกราฟิกของ Windows เพื่อความเร็ว
- โมเดลสตรีมเสียง — เร็วกว่า ลดความหน่วงเวลาและเวลาการโหลด; แม่นยำกว่าแต่ช้า ใช้การประมวลผลมากขึ้นเพื่อคุณภาพการจดจำ
- จำนวนประโยคที่ปรับปรุงพร้อมกัน — ควบคุมหน้าต่างการปรับปรุงโมเดลหลักซ้อนกันจาก 1 ถึง 8 ประโยค; ค่าปริยายคือ 2
- โมเดลสตรีมเสียงที่โหลดแล้ว — แสดงรายการโมเดลที่เก็บไว้ในแคชและอนุญาตให้ลบ โมเดลที่ถูกลบจะดาวน์โหลดใหม่เมื่อจำเป็น
ความสูงข้อความสูงสุดใต้ตัวบ่งชี้การบันทึก จำกัดข้อความแบบเรียลไทม์ให้สูงสุด 10–90 เปอร์เซ็นต์ของความสูงหน้าจอ; ค่าปริยายคือ 50 เปอร์เซ็นต์ ข้อความที่ยาวกว่ายังคงเลื่อนได้และติดตามผลลัพธ์ล่าสุดจนกว่าคุณจะเลื่อนขึ้นเอง
- เลือก การถอดความแบบบล็อก เมื่อคุณต้องการพฤติกรรมของโมเดลหลักและมีประสิทธิภาพการ์ดกราฟิกและหน่วยความจำเพียงพอ
- เลือก การถอดความแบบสตรีม เมื่อข้อความระหว่างการบันทึกที่เร็วที่สุดมีความสำคัญและภาษาของคุณได้รับการรองรับ
- ปิดการถอดความเรียลไทม์เมื่อคุณต้องการกระบวนการที่ง่ายที่สุดและต้องการเพียงผลลัพธ์สุดท้ายหลังการบันทึก
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động