-
Notifications
You must be signed in to change notification settings - Fork 0
Thai Settings Reference
เปิด การตั้งค่า ด้วยปุ่มรูปเกียร์ ตกลง เพื่อบันทึกการเปลี่ยนแปลง; ยกเลิก เพื่อยกเลิกการเปลี่ยนแปลง การเปลี่ยนแปลงที่ส่งผลต่อโมเดล, เวลารัน, ตำแหน่งจัดเก็บ, หรือบริการเครือข่าย อาจใช้เวลาสักครู่ในการนำไปใช้และอาจโหลดส่วนประกอบใหม่
เอกสารอ้างอิงนี้มีไว้เป็นคู่มือการปรับแต่ง ไม่ได้เป็นเพียงรายการควบคุมค่าเริ่มต้น ค่าตั้งต้นเป็นจุดเริ่มต้นที่ดีสำหรับการติดตั้ง Windows ในเครื่องส่วนใหญ่ เปลี่ยนการตั้งค่าที่เกี่ยวข้องทีละรายการ ทดสอบในแอปพลิเคชันที่คุณใช้สั่งงานเสียงจริง และเก็บค่าก่อนหน้าจนกว่าผลลัพธ์จะดีขึ้นอย่างชัดเจน
| เป้าหมาย | จุดเริ่มต้นที่แนะนำ |
|---|---|
| การพิพากษาคำพูดที่เชื่อถือได้ในแอปพลิเคชันเดสก์ท็อปปกติ | กำหนดภาษาการถอดคำ คงที่, เปิดใช้งานการแทรก คลิปบอร์ด, การกู้คืนคลิปบอร์ด, ดีเลย์ค่าเริ่มต้น, เปิดใช้งานการปรับมาตรฐานเสียง |
| การพิพากษาคำพูดเข้าเทอร์มินัลหรือเดสก์ท็อประยะไกล | ลองใช้ Unicode ก่อนหากไม่สามารถส่งคลิปบอร์ดได้ มิฉะนั้นให้เก็บ คลิปบอร์ด และเลือกทางลัดวางที่เป้าหมายระยะไกลยอมรับ ใช้ Scan Code สำหรับแอปพลิเคชันที่ตอบสนองได้เชื่อถือได้เฉพาะการป้อนเหมือนกดปุ่มจริง |
| เอกสารยาว | กำหนดภาษา, เครื่องหมายวรรคตอนที่พูด, การจัดรูปแบบต่อเนื่อง, โหมดปุ่มลัดแบบล็อคหรือไฮบริด, บันทึกไฟล์ WAV |
| ฟิลด์ค้นหาสั้น แชท และคำสั่ง | ลบจุดท้าย; ตัวเลือกการใช้ตัวอักษรเล็กตัวแรก; โหมดปุ่มลัดกดค้างช่วยป้องกันไม่ให้การบันทึกยังคงทำงานโดยไม่ตั้งใจ |
| การใช้งานที่ต้องการความเงียบหรือความเป็นส่วนตัว | ปิดการบันทึกไฟล์ WAV ที่บันทึกไว้, ตรวจสอบระยะเวลาการเก็บข้อความถอดเสียง, ปิดการแทรกจากคลิปบอร์ดหากเป็นกังวลเกี่ยวกับแอปพลิเคชันที่ตรวจสอบคลิปบอร์ด, และหลีกเลี่ยงการรันระยะไกล | | ความหน่วงรับรู้ต่ำที่สุด | ปิดการแสดงตัวอย่างแบบเรียลไทม์เว้นแต่จะมีประโยชน์, ใช้โมเดล/รันไทม์การถอดเสียงท้องถิ่นที่รวดเร็ว, รักษาความล่าช้าในการแทรกต่ำ, และไม่เก็บข้อมูลผลลัพธ์ AI ก่อนการแทรก |
- ภาษาสำหรับการถอดเสียง: เลือกภาษาที่คุณใช้พูดบ่อยที่สุด ภาษาแบบกำหนดจะเริ่มทำงานเร็วกว่าและเชื่อถือได้มากกว่า อัตโนมัติ โดยเฉพาะสำหรับการบันทึกสั้น ชื่อ และคำที่มีเสียงคล้ายกัน ใช้การตรวจสอบภาษาอัตโนมัติเพียงเมื่อคุณเปลี่ยนภาษาจริงระหว่างการบันทึก การตรวจจับภาษามีหลักฐานน้อยในวลีสั้น ๆ และอาจเลือกผิด
- คำเฉพาะด้านและชื่อเฉพาะที่กำหนดเอง: เพิ่มชื่อที่ไม่ค่อยใช้ คำของผลิตภัณฑ์ อักษรย่อ และการสะกดที่คุณต้องการให้ Whisper ให้ความสำคัญ รักษารายการให้เป็นจุดรวม: มันช่วยในการจดจำแต่ไม่ใช่กฎการค้นหา-แทนที่ที่รับประกัน และรายการใหญ่ของคำทั่วไปอาจสร้างอคติที่ไม่ต้องการ คำแนะนำนี้มีไว้สำหรับ Whisper; เครื่องถอดเสียงอื่นอาจไม่ใช้เหมือนกัน
วิธีการแทรกที่ดีที่สุดขึ้นอยู่กับแอปพลิเคชันเป้าหมาย ทดสอบในโปรแกรมที่คุณใช้ยากที่สุด ไม่ใช่แค่ในตัวแก้ไขข้อความง่าย ๆ
-
คลิปบอร์ด: ตัวเลือกทั่วไปที่ดีที่สุดบน Windows และมักจะเร็วที่สุดสำหรับข้อความยาว ตัวอักษรพิเศษ และยูนิโค้ดที่ซับซ้อน Voice2Win จะทำการแทนที่คลิปบอร์ดชั่วคราว ส่งคำสั่งวาง และสามารถกู้คืนเนื้อหาก่อนหน้า ผู้จัดการคลิปบอร์ดหรือแอปพลิเคชันอื่นอาจสังเกตข้อความชั่วคราว และการส่งต่อคลิปบอร์ดอาจถูกปิดใช้งานในเซสชันระยะไกล
-
ยูนิโค้ด: ไม่ขึ้นอยู่กับรูปแบบแป้นพิมพ์และเป็นตัวเลือกแรกที่ดีสำหรับเซสชันระยะไกล ระบบที่ไม่ใช่ Windows และข้อความที่มีตัวอักษรที่ไม่มีในแป้นพิมพ์ปัจจุบัน เกมบางเกม เทอร์มินัล แอปพลิเคชันเก่า และหน้าต่างที่ยกระดับสิทธิ์ไม่สามารถรับยูนิโค้ดที่จำลองได้อย่างเชื่อถือ
-
สแกนโค้ด: ทำงานคล้ายกับการพิมพ์จากคีย์บอร์ดจริงและสามารถช่วยกับแอปพลิเคชันเป้าหมายเก่าหรือผิดปกติได้ ขึ้นอยู่กับเค้าโครงคีย์บอร์ดที่ใช้งานอยู่; ตัวอักษรที่ไม่มีปุ่มตรงกับเค้าโครงนั้นอาจหายไปหรือตัวอักษรผิดพลาด ปกติจะช้ากว่าการวางข้อความจากคลิปบอร์ดเพียงครั้งเดียวสำหรับข้อความยาว ๆ
-
ดีเลย์การจำลองคีย์บอร์ด (0–50 มิลลิวินาที): ปล่อยไว้ต่ำ ๆ เว้นแต่การแทรก Unicode หรือ Scan Code จะทำตัวอักษรหายไปหรือสลับลำดับ เพิ่มขึ้นทีละน้อยสำหรับแอปพลิเคชันช้า, เครื่องเสมือน หรือเดสก์ท็อประยะไกล การตั้งค่านี้เพียงทำให้การจำลองการกดปุ่มช้าลง; ไม่ได้ช่วยปรับปรุงการรู้จำเสียง
-
ใช้คลิปบอร์ดสำหรับแอปพลิเคชันเป้าหมายที่มีปัญหา: ให้เปิดใช้งานนี้เมื่อใช้ Unicode หรือ Scan Code เว้นแต่การใช้คลิปบอร์ดถูกห้าม Voice2Win สามารถกลับไปใช้กับแอปพลิเคชันที่ทราบว่าไม่รองรับการป้อนข้อมูลจำลองได้ดี ปิดใช้งานเฉพาะเมื่อความเป็นส่วนตัวของคลิปบอร์ดหรือการส่งต่อคลิปบอร์ดเป็นสาเหตุที่คุณตั้งใจเลือกการจำลองคีย์บอร์ดเท่านั้น
-
เวลาในการรอก่อนแทรก (0–2000 มิลลิวินาที ค่าเริ่มต้น 40 มิลลิวินาที): เวลาที่ใช้ให้ค่าคลิปบอร์ดใหม่พร้อมใช้งานก่อนที่จะส่งทางลัดวาง เพิ่มเวลานี้เมื่อเป้าหมายบางครั้งวางค่าคลิปบอร์ดเก่าหรือไม่วางอะไรเลย โดยเฉพาะเมื่อผ่านการซิงค์คลิปบอร์ดจากระยะไกล ค่าที่มากขึ้นจะเพิ่มความล่าช้าเดียวกันสำหรับทุกการแทรก
-
ชุดปุ่มวาง: ใช้ Ctrl+V สำหรับโปรแกรม Windows ปกติ ลองใช้ Ctrl+Shift+V หรือ Shift+Insert เมื่อเทอร์มินัล เดสก์ท็อประยะไกล หรือเครื่องมือ AI จัดการ Ctrl+V เป็นอย่างอื่นที่ไม่ใช่การวางข้อความธรรมดา เลือกทางลัดที่คาดหวังโดยเป้าหมายสุดท้าย ไม่จำเป็นต้องตรงกับหน้าต่างเดสก์ท็อประยะไกลภายในเครื่อง
-
รวบรวมข้อความระหว่างการปรับปรุง AI และแทรกในขั้นตอนเดียว: เปิดใช้งานเมื่อผลลัพธ์ AI แบบก้าวหน้าขยับเคอร์เซอร์ กระตุ้นการจัดรูปแบบหรือการเติมข้อความอัตโนมัติ หรือสร้างหลายขั้นตอนการเลิกทำ ปิดใช้งานเมื่อการเห็นผลลัพธ์โดยเร็วเป็นสิ่งที่สำคัญกว่า; การรวบรวมจะรอจนกว่าผลลัพธ์ AI จะสมบูรณ์ก่อนที่จะมีการแทรกใดๆ
-
กู้คืนคลิปบอร์ดก่อนหน้า: ให้เปิดใช้งานสำหรับงานปกติเพื่อที่ Voice2Win จะไม่ทำลายสิ่งที่คุณคัดลอกก่อนการถอดคำ พิจารณาปิดใช้งานเฉพาะเมื่อคุณตั้งใจให้ผลลัพธ์ที่ถอดคำยังคงอยู่ในคลิปบอร์ด หรือเป้าหมายเฉพาะอ่านคลิปบอร์ดหลังจากที่ทางลัดวางข้อมูลได้ทำงานแล้ว
-
เวลารอ ก่อนการกู้คืน (0–2000 มิลลิวินาที, ค่าเริ่มต้น 120 มิลลิวินาที): เพิ่มเวลานี้เมื่อเป้าหมายไม่แทรกข้อความเลยหรือแทรกเพียงบางส่วนเท่านั้น เพราะค่าก่อนหน้าของคลิปบอร์ดถูกกู้คืนเร็วเกินไป รักษาเวลาให้สูงเท่าที่จำเป็นเท่านั้น: ในช่วงเวลานี้ ข้อความที่สั่งด้วยเสียงยังคงสามารถใช้กับแอปพลิเคชันที่รับทราบคลิปบอร์ดได้
ตัวเลือกเหล่านี้ปรับเปลี่ยนข้อความที่รู้จำก่อนการแทรก โดยมีประโยชน์มากที่สุดเมื่อการสั่งด้วยเสียงของคุณมีรูปแบบที่สม่ำเสมอ
-
วรรคตอนที่พูดออกเสียง: เปิดใช้งานสำหรับงานเขียนยาวเมื่อคุณต้องการให้วลีเช่น “เครื่องหมายจุลภาค”, “เครื่องหมายคำถาม” หรือคำเทียบเท่าในภาษาของพวกเขาถูกแปลงเป็นวรรคตอน ปิดใช้งานเมื่อคำเหล่านั้นอาจเป็นเนื้อหาตามตัวอักษร หรือเมื่อคุณต้องการให้โมเดลถอดเสียงจัดวรรคตอนอัตโนมัติ
-
ลบจุดท้าย: มีประโยชน์สำหรับช่องค้นหา ข้อความแชท ช่องฟอร์ม ชื่อไฟล์ และคำสั่งเสียงที่ไม่ต้องการจุดสุดท้ายที่เพิ่มโดยอัตโนมัติ ปิดใช้งานสำหรับประโยคสมบูรณ์ในเอกสารและอีเมล
-
ตัวอักษรตัวแรกเป็นตัวพิมพ์เล็ก: มีประโยชน์เมื่อการสารภาพคำพูดถูกแทรกปกติในประโยคที่มีอยู่แล้ว ปิดใช้งานสำหรับประโยคใหม่ หัวข้อ ชื่อ และข้อความเดี่ยว
-
เชื่อมต่อการถอดความติดต่อกันในแอปพลิเคชันเดียวกัน: เปิดใช้งานเมื่อคุณสร้างย่อหน้าเดียวจากหลายการบันทึก; Voice2Win สามารถรักษาช่องว่างและบริบทของประโยคระหว่างกันได้ ปิดใช้งานเมื่อการบันทึกต่อเนื่องมักจะไปยังช่องต่าง ๆ หรือเมื่อคุณมักย้ายเคอร์เซอร์ด้วยตนเองระหว่างการถอดความ
-
ความไวในการตรวจจับเสียงพูด (0–100, ค่าเริ่มต้น 35%): ค่าต่ำจะรับเสียงพูดที่เบากว่าได้ แต่ก็อาจทำให้เสียงหายใจ คลิก หรือเสียงรบกวนรอบข้างถูกมองว่าเป็นเสียงพูดด้วย ค่าสูงจะกรองเสียงรบกวนได้เข้มข้นกว่า แต่ก็อาจปฏิเสธเสียงเบาหรือส่วนท้ายของคำ เริ่มต้นที่ค่าปกติแล้วปรับทีละเล็กน้อยโดยสังเกตระดับสัญญาณอินพุต การเลื่อนไมโครโฟนให้ใกล้มักดีกว่าการใช้ค่าสุดโต่ง
-
ลบเสียงเริ่มต้นของการบันทึก (0–500 มิลลิวินาที, ค่าเริ่มต้น 250 มิลลิวินาที): ลดเสียงคลิกของปุ่มลัด, เสียงรบกวน, และช่วงเงียบที่ขึ้นต้น เพิ่มค่านี้ถ้าส่วนแรกของการบันทึกมีเสียงคลิกของปุ่มลัด; ลดค่านี้ถ้าพยางค์แรกถูกตัดออกหรือคุณกำลังพูดคำสั้นๆ ทันทีหลังจากกดปุ่มลัด
-
ปรับระดับการบันทึกให้อยู่ในระดับปกติ (เปิดค่าเริ่มต้น, เป้าหมาย 85%): แนะนำสำหรับไมโครโฟนทั่วไปและเมื่อระยะห่างจากผู้พูดเปลี่ยนแปลง เพราะจะช่วยให้ระดับเสียงต่อเนื่องและสม่ำเสมอมากขึ้นสำหรับโมเดล ปิดฟังก์ชันนี้หากใช้สตูดิโอ/อินพุตเสมือนที่ปรับระดับไว้แล้ว หรือเมื่อการปรับระดับเสียงทำให้เสียงรบกวนพื้นหลังสูงขึ้นอย่างชัดเจน เป้าหมายนี้ไม่ใช่การควบคุมเกนของไมโครโฟนและไม่สามารถกู้เสียงที่ถูกตัด (clipped) ได้
-
บันทึกไฟล์ WAV (เปิดค่าเริ่มต้น): ควรเปิดไว้เมื่อคุณต้องการเล่นซ้ำ, ถอดความซ้ำ, เปรียบเทียบคุณภาพ หรือใช้เป็นหลักฐานวินิจฉัย ปิดฟังก์ชันนี้เมื่อพื้นที่จัดเก็บหรือความลับมีความสำคัญมากกว่า เสียงปกติมักใช้พื้นที่มากกว่าข้อความ
-
ลบไฟล์ WAV ที่บันทึกไว้: ลบไฟล์เสียงที่บันทึกไว้แต่เก็บข้อความถอดความไว้ ใช้เมื่อคุณตรวจสอบแล้วว่าไม่ต้องการเล่นซ้ำหรือถอดความซ้ำอีก; การลบไม่สามารถสร้างไฟล์เสียงต้นฉบับคืนได้
- กดค้าง: การบันทึกจะเกิดขึ้นเฉพาะตอนที่กดชอร์ตคัทเท่านั้น เหมาะที่สุดสำหรับการบันทึกสั้น ๆ บ่อย ๆ และเป็นโหมดที่ปลอดภัยที่สุดเมื่อไม่ต้องการให้เกิดการบันทึกพื้นหลังโดยไม่ได้ตั้งใจ
- ล็อค: กดครั้งเดียวเพื่อเริ่มและกดอีกครั้งเพื่อหยุด เหมาะที่สุดสำหรับการบันทึกเนื้อหายาว การใช้งานเพื่อความสะดวก หรือการพูดแบบไม่ใช้มือ แต่ต้องมีการหยุดการบันทึกด้วยการกระทำที่ตั้งใจ
- ไฮบริด / แตะสองครั้ง: กดค้างเพื่อบันทึกสั้น ๆ หรือแตะสองครั้งเพื่อล็อค นี่คือค่าเริ่มต้นที่ยืดหยุ่นที่สุดสำหรับงานแบบผสม ใช้การกดค้างแทนหากบางครั้งการแตะสองครั้งโดยไม่ตั้งใจทำให้การบันทึกยังคงทำงานอยู่
-
กำหนดทางลัดแยกต่างหากสำหรับ แปลงเสียงเป็นข้อความ และ คำสั่งเสียง ควรใช้การรวมปุ่มที่ยังไม่ได้ถูกใช้งานโดยระบบปฏิบัติการ ไดรเวอร์คีย์บอร์ด เดสก์ท็อประยะไกล หรือแอปพลิเคชันเป้าหมาย หากมีทางลัด Voice2Win ซ้ำ จะถูกปฏิเสธ
-
บน Windows ปกติแล้ว Voice2Win ไม่สามารถแทรกตัวเข้าไปในแอปพลิเคชันที่รันด้วยสิทธิพิเศษสูงกว่าได้ รัน Voice2Win ด้วยสิทธิพิเศษสูงเฉพาะเมื่อจำเป็นต้องพิมพ์โดยตรงในแอปพลิเคชันที่รันด้วยสิทธิ์สูง การเข้าถึงอินพุตระบบอย่างสูงจะเพิ่มผลกระทบจากข้อผิดพลาดของแอปพลิเคชันหรือการตั้งค่าใดๆ
-
ปิดเสียงเอาต์พุตทั่วระบบขณะกดปุ่มลัด มีประโยชน์กับลำโพงเพราะเสียงจากระบบจะไม่ย้อนกลับเข้ามาในไมโครโฟน ปิดใช้งานเมื่อต้องใช้หูฟังหรือเมื่อจำเป็นต้องฟังการประชุมหรือแหล่งสื่อขณะบันทึก
-
สัญญาณ เริ่มต้นและหยุด แยกกัน ทำให้สถานะ latch/hybrid ชัดเจนเมื่อไม่สามารถมองเห็นตัวบ่งชี้ได้ ควรรักษาเสียงให้สั้นและเงียบเมื่อใช้ลำโพงเพื่อไม่ให้ไมโครโฟนจับเสียงได้ เพิ่มระยะเวลา หรือความดังเพื่อความสามารถในการเข้าถึง ไม่ใช่เพื่อแก้ปัญหาการตรวจจับปุ่มลัดที่ไม่เชื่อถือได้
- ภาษาของอินเทอร์เฟซ เปลี่ยนเฉพาะเมนูและป้ายกำกับเท่านั้น; จะไม่ได้เลือกภาษาการถอดเสียง
- ธีมมืด เป็นความชอบด้านภาพและจะไม่ส่งผลต่อการจดจำเสียงหรือประสิทธิภาพ
- สไตล์ตัวชี้วัด: การแสดงระดับง่ายๆ น้อยรบกวนสายตาที่สุด; คลื่นหรือแถบช่วยให้ประเมินการพูดได้ง่ายขึ้น; การแสดงแบบสเปกตรัมแสดงรายละเอียดมากขึ้นแต่ดูยุ่งตา เลือกสไตล์ที่ช่วยให้คุณยืนยันการทำงานของไมโครโฟนโดยไม่บังโปรแกรมเป้าหมาย
- ธีมสี, ตำแหน่ง และขนาด: ใช้ธีมที่มีความคอนทราสต์สูงและวางห่างจากแถบเครื่องมือ คำบรรยาย และเคอร์เซอร์ ขนาดตัวชี้วัดใหญ่ช่วยเรื่องการเข้าถึงและการแสดงข้อความแบบเรียลไทม์ ขนาดเล็กจะเหมาะเมื่อสนใจเพียงสถานะการบันทึกเท่านั้น
-
ปิดการเริ่มต้นอัตโนมัติ เหมาะที่สุดเมื่อใช้ Voice2Win เป็นบางโอกาส การเริ่มต้นอัตโนมัติด้วย Registry เป็นตัวเลือกปกติของ Windows สำหรับเริ่มหลังจากเข้าสู่ระบบ Task Scheduler มีประโยชน์เมื่อจำเป็นต้องกำหนดลำดับการเริ่มต้นหรือการรันในระดับสูง บน Linux แอปจะใช้กลไกการเริ่มต้นอัตโนมัติของเดสก์ท็อปแบบต่อผู้ใช้
-
รันในระดับสูงด้วย Task Scheduler ควรปิดไว้นอกจากคุณจำเป็นต้องป้อนข้อมูลในแอปของผู้ดูแลระบบ การรันในระดับสูงไม่ใช่ตัวเลือกด้านประสิทธิภาพ; มันเปลี่ยนขอบเขตความปลอดภัยของการเข้าถึงคีย์บอร์ดทั่วโลก
-
แสดงกล่องยืนยันการเริ่มต้นอัตโนมัติ มีประโยชน์ขณะตรวจสอบการตั้งค่าเริ่มต้นอัตโนมัติใหม่หรือบนคอมพิวเตอร์ที่ใช้ร่วมกัน ปิดเฉพาะเมื่อการเริ่มต้นเป็นที่เชื่อถือและควรทำงานโดยไม่ต้องดูแล
-
แสดงหน้าจอต้อนรับ มีประโยชน์เมื่อการเริ่มต้นโมเดล/รันไทม์ใช้เวลานานพอสมควร ปิดเมื่อต้องการเริ่มเงียบแบบ tray
-
เสียงพร้อมใช้งาน ยืนยันว่าการเริ่มต้นและการเตรียมโมเดลเสร็จสมบูรณ์ โดยเฉพาะเมื่อ Voice2Win เริ่มทำงานในโหมดย่อหน้าต่าง ปิดเสียงนี้ในสภาพแวดล้อมที่เงียบ ปรับระยะเวลาและระดับเสียงเพียงพอที่จะจดจำได้
-
ย่อหน้าต่างเมื่อปิด (เปิดโดยค่าเริ่มต้น) ทำให้ทางลัดทั่วโลกยังคงใช้งานได้หลังจากปิดหน้าต่างหลัก ปิดการใช้งานหากคุณต้องการให้ปุ่มปิดหน้าต่างออกจากแอปแทน
-
ตรวจสอบการอัปเดตโดยอัตโนมัติ (เปิดโดยค่าเริ่มต้น) แนะนำสำหรับการแก้ไข ปรับความเข้ากันได้ของโมเดล/รันไทม์ และการอัปเดตด้านความปลอดภัย ปิดใช้งานเฉพาะในกรณีที่ติดตั้งแบบจัดการเองหรือติดตั้งแบบออฟไลน์ และตรวจสอบด้วยตัวเองแทน
-
ปิดการแจ้งเตือนข้อมูลรายสัปดาห์ ซ่อนการแจ้งเตือนข้อมูลซ้ำหลังจากที่คุณไม่ต้องการใช้งานอีกต่อไป; ไม่ได้ปิดการแจ้งเตือนฟังก์ชันหรือข้อผิดพลาด
-
สถานะอัตโนมัติการป้อนข้อมูลของ Linux เป็นข้อมูลวินิจฉัย รองรับการอัตโนมัติการป้อนข้อมูลที่เข้ากันได้กับ X11; เซสชัน Wayland แบบบริสุทธิ์สามารถจำกัดทางลัดทั่วโลกและการแทรกข้อความ หากไม่สามารถใช้ได้ ให้ใช้เซสชัน X11 หรือโหมดความเข้ากันได้ที่สภาพแวดล้อมเดสก์ท็อปเสนอให้
-
เส้นทางการเก็บการถอดเสียง: เลือกโฟลเดอร์ในเครื่องที่เชื่อถือได้ ใช้ตำแหน่งที่เข้ารหัสสำหรับการบันทึกเสียงที่ละเอียดอ่อน และตรวจสอบให้แน่ใจว่าโปรแกรมสำรองข้อมูล/ซิงโครไนซ์ไม่ขัดแย้งกับไฟล์ที่กำลังเขียนอยู่ ดิสก์เครือข่ายที่ช้า หรือไม่พร้อมใช้งานเป็นระยะ อาจทำให้การทำงานของประวัติการถอดเสียงล่าช้าได้
-
ลบการถอดเสียงเก่า / อายุสูงสุด: เปิดใช้งานการเก็บรักษาอัตโนมัติเมื่อมีนโยบายความเป็นส่วนตัว หรือเรื่องการใช้งานดิสก์ เลือกอายุที่ยังครอบคลุมช่วงเวลาที่สมเหตุสมผลสำหรับการแก้ไขและถอดเสียงซ้ำ ไฟล์ WAV ที่บันทึกไว้เป็นส่วนใหญ่ของประวัติการถอดเสียง
-
เส้นทางการเก็บโมเดล: ควรใช้ SSD ในเครื่องที่เร็วและมีพื้นที่ว่างเพียงพอ ดิสก์แบบถอดได้และดิสก์เครือข่ายทำให้การโหลดโมเดลมีความน่าเชื่อถือน้อยลง และอาจทำให้ดิสก์ที่ถูกตัดการเชื่อมต่อดูเหมือนว่าขาดโมเดลไป
-
ใช้รากข้อมูลแบบกำหนดเอง / ย้ายข้อมูลแอปพลิเคชันทั้งหมด: มีประโยชน์สำหรับการตั้งค่าพกพา การสำรองข้อมูลที่ควบคุมได้ หรือการเก็บข้อมูลขนาดใหญ่ให้นอกไดรฟ์ระบบ เลือกโฟลเดอร์ที่มีสิทธิ์เหมาะสมและพื้นที่ว่าง แล้วทำการรีสตาร์ทเมื่อระบบขอ การย้ายข้อมูลในเครื่องนี้จะย้ายข้อมูล แต่จะไม่เข้ารหัสหรืออัปโหลดโดยอัตโนมัติ
การถอดเสียงแบบเรียลไทม์เป็นการพรีวิวในขณะที่คุณยังพูดอยู่ การถอดเสียงสุดท้ายปกติถือเป็นผลลัพธ์ที่เป็นทางการ ทิ้งโหมดเรียลไทม์ไว้ในสถานะปิดเมื่อพรีวิวไม่จำเป็น: สิ่งนี้จะช่วยลดการใช้ทรัพยากรและหลีกเลี่ยงคำเบื้องต้นที่เปลี่ยนไปบนหน้าจอ
- บล็อก ทำงานกับโมเดลการถอดเสียงหลักของ Whisper ซ้ำ ๆ บนเสียงที่ทับซ้อนกัน เลือกโหมดนี้เมื่อคุณต้องการให้ตัวอย่างใกล้เคียงกับผลลัพธ์ Whisper สุดท้ายและมี GPU ที่รองรับพร้อมหน่วยความจำเพียงพอ มันให้บริบทมากขึ้นแต่สร้างงาน GPU ที่ซ้ำซ้อนอย่างมีนัยสำคัญ
- สตรีม ใช้โมเดลสตรีมมิง Sherpa-ONNX แยกต่างหาก เลือกโหมดนี้เพื่อรับคำติชมแบบขั้นบันดาลใจเร็วที่สุด หรือเมื่อโหมดบล็อกไม่สามารถใช้งานได้ ตัวอย่างของมันอาจหยาบกว่าและรองรับเฉพาะภาษาที่ระบุในค่าการตั้งค่า; การถอดเสียงปกติสุดท้ายอาจแตกต่างออกไป
- ความสูงในการแสดงผลสูงสุด จำกัดว่าตัวอย่างสามารถครอบครองหน้าจอได้มากเพียงใด เพิ่มความสูงนี้เพื่อการใช้งานในรูปแบบยาว; ลดความสูงเมื่อดัชนีบ่งชี้บดบังแอปเป้าหมาย ซึ่งไม่ทำให้คุณภาพการรู้จำเปลี่ยนแปลง
ค่าเริ่มต้นมีความสมดุลและพึ่งพาอาศัยกัน ควรคืนค่าเหล่านี้ก่อนการแก้ไขปัญหาและเปลี่ยนเพียงพารามิเตอร์เดียวในแต่ละครั้ง
-
ขนาดหน้าต่าง (ค่าเริ่มต้น 10 วินาที): เพิ่มขนาดเมื่อบริบทของประโยคไม่เพียงพอหรือวลียาวเปลี่ยนแปลงมากระหว่างสแนปช็อต หน้าต่างที่ใหญ่กว่าจะใช้เวลานานขึ้นและใช้ทรัพยากรคอมพิวเตอร์/หน่วยความจำมากขึ้น ลดขนาดสำหรับการอัปเดตแต่ละรายการที่รวดเร็วขึ้นบนฮาร์ดแวร์ที่รองรับ โดยยอมรับบริบทที่น้อยลง
-
ช่วงกระโดด (ค่าเริ่มต้น 3 วินาที): ลดช่วงเพื่อให้การอัปเดตก่อนชมบ่อยขึ้น; เพิ่มช่วงเมื่อตัวประมวลผลกราฟิกทำงานหนักเกินไป การกระโดดเล็กๆ จะเริ่มกระบวนการถอดความบ่อยขึ้น และไม่ได้ทำให้แต่ละครั้งเร็วขึ้น
-
การซ้อนทับ / บริบท (ค่าเริ่มต้น 20 วินาที): เพิ่มการซ้อนทับเมื่อคำที่ขอบของบล็อกซ้ำหายหรือรวมกันไม่ดี ลดการซ้อนทับเพื่อลดงานที่ทำซ้ำ การซ้อนทับน้อยเกินไปจะเอาหลักฐานที่จำเป็นในการประสานสแนปช็อตที่อยู่ติดกันออกไป
-
ความล่าช้าในการคงตัว (ค่าเริ่มต้น 6 วินาที): เพิ่มค่าหากคำถูกยืนยันเร็วเกินไปและบริบทภายหลังสามารถแก้ไขคำเหล่านั้นได้ ลดค่าหากข้อความที่คงตัวปรากฏช้าเกินไป โดยยอมรับการแก้ไขมากขึ้น
-
ขีดจำกัดเวลาความเงียบ (ค่าเริ่มต้น 1000 มิลลิวินาที): ลดค่าหากข้อความควรคงตัวอย่างรวดเร็วหลังจากหยุดชั่วคราว เพิ่มค่าหากความลังเลตามธรรมชาติแบ่งหรือยืนยันความคิดเร็วเกินไป
-
การตรวจสอบขอบเขตประโยคเพิ่มเติม (ค่าเริ่มต้น 2): เพิ่มค่าเฉพาะเมื่อการเปลี่ยนประโยคผิดซ้ำ ๆ และมีทรัพยากร GPU เหลืออยู่ การถอดความเพิ่มเติมแต่ละครั้งเสียเวลา ตั้งค่าเป็น 0 เพื่อปิดการทำงานเพิ่มเติม การตรวจสอบขอบเขตหลักยังคงอยู่
-
ตัวปรับอัตราเลื่อน (ค่าเริ่มต้น 20%): ควบคุมระยะที่หน้าต่างการตรวจสอบเพิ่มเติมเคลื่อนที่เมื่อเทียบกับขนาดหน้าต่าง เพิ่มค่านี้เมื่อการตรวจสอบพื้นที่กว้างรอบขอบช่วยได้; ลดค่านี้เมื่อบริบทใกล้เคียงเพียงพอ สิ่งนี้สำคัญเฉพาะเมื่อใช้ร่วมกับการตรวจสอบเพิ่มเติมเท่านั้น
- รันไทม์: CPU ให้ความเข้ากันได้กว้างที่สุด DirectML สามารถลดความหน่วงบน GPU ของ Windows ที่รองรับ แต่จะใช้ทรัพยากร GPU ซึ่งอาจจำเป็นสำหรับโมเดลหลักด้วย
- ตัวแปรของโมเดล: เลือก เร็ว (Fast) เพื่อความหน่วงต่ำและใช้ทรัพยากรน้อยกว่า เลือก แม่นยำ (Accurate) เมื่อคุณภาพตัวอย่างสำคัญกว่าความเร็ว
- หน้าต่างปรับปรุงประโยค (1–8, ค่าเริ่มต้น 2): ค่าของ 1 จะให้การสรุปประโยคที่เร็วที่สุด ค่าที่มากกว่าจะเก็บบริบทของประโยคมากขึ้นเพื่อปรับปรุง แต่จะทำให้ช้าลงและเพิ่มงาน ค่าเริ่มต้นเป็นสมดุลที่ใช้งานได้จริง
- โมเดลที่เก็บไว้ในแคช: การลบโมเดลที่เก็บไว้แต่ไม่ได้ใช้จะช่วยเพิ่มพื้นที่ดิสก์ หากชุดภาษา/รันไทม์/โมเดลนั้นถูกเลือกในภายหลัง จะต้องดาวน์โหลดอีกครั้งก่อนที่ตัวอย่างจะพร้อมใช้งาน
ดู การถอดเสียงแบบเรียลไทม์ สำหรับเวิร์กโฟลว์เต็มรูปแบบและข้อกำหนดความพร้อมใช้งาน
- Whisper เป็นตัวเลือกทั่วไปสำหรับการรองรับภาษาที่กว้างและมีรุ่นโมเดลที่ได้รับการจัดตั้งแล้ว Parakeet อาจน่าสนใจเมื่อภาษาที่รองรับและฮาร์ดแวร์ที่ใช้งานเข้ากับกรณีการใช้งานของคุณ เลือกตามการบันทึกจริงของคุณ; การให้คะแนนดาวและการประเมินความเร็วเป็นเพียงแนวทาง ไม่ใช่ทดแทนการทดสอบไมโครโฟน ภาษา และคำศัพท์ของคุณ
- โมเดลที่ใหญ่หรือคุณภาพสูงมักต้องการหน่วยความจำและเวลาเพิ่มขึ้น แต่สามารถปรับปรุงเสียงที่ยากได้ เริ่มต้นด้วยโมเดลที่เล็กที่สุดซึ่งมีความแม่นยำเพียงพออย่างสม่ำเสมอ โมเดลที่ทำให้เกิดความกดดันของหน่วยความจำหรือคิวยาวอาจใช้งานได้น้อยกว่าโมเดลที่เล็กลงเล็กน้อยแต่ทำงานเสร็จสม่ำเสมอ
- ตัวจัดการโมเดลจะดาวน์โหลดและลบไฟล์โมเดลท้องถิ่น อย่าลบโมเดลที่ยังจำเป็นสำหรับเครื่องมือที่เลือกหรือเวิร์กโฟลว์แบบออฟไลน์
-
มอบหมาย การถอดเสียงเสียง และ การปรับปรุงด้วย AI อย่างอิสระกัน โดยทั่วไป GPU จะเหมาะที่สุดสำหรับงานในเครื่องที่ทำซ้ำบ่อย ๆ; CPU เป็นตัวเลือกสำรองด้านความเข้ากันได้ แต่ช้ากว่ามาก การแบ่งงานทั้งสองไปยังอุปกรณ์ต่างกันสามารถหลีกเลี่ยงปัญหาการใช้หน่วยความจำของ GPU พร้อมกันเมื่อใช้งานทั้งสองงานในเวลาเดียวกัน
-
สำหรับ Ollama หรือ LM Studio ให้เลือกประเภทเซิร์ฟเวอร์, ที่อยู่, พอร์ต, และโมเดลที่โหลดมา ใช้การค้นหาเฉพาะในเครือข่ายที่เชื่อถือได้และตรวจสอบว่าโมเดลที่เลือกนั้นสามารถใช้ได้จริงบนเซิร์ฟเวอร์
-
เซิร์ฟเวอร์ AI ระยะไกล หรือคอมพิวเตอร์ Voice2Win เครื่องอื่นสามารถย้ายงานออกจากเครื่องที่ทรงพลังน้อยกว่า แต่จะมีความล่าช้าของเครือข่ายและส่งเสียงหรือข้อความของงานไปยังระบบนั้น ใช้เฉพาะโฮสต์และเครือข่ายที่เชื่อถือได้เท่านั้น
-
แชร์รันไทม์ท้องถิ่น เฉพาะเมื่อการติดตั้ง Voice2Win ที่เชื่อถือได้อื่นๆ ต้องการ ใช้รหัสผ่าน อนุญาตพอร์ตผ่านไฟร์วอลล์เฉพาะบนโปรไฟล์เครือข่ายที่ตั้งใจ และปิดการแชร์เมื่อไม่จำเป็นอีกต่อไป การแจ้งเตือนไคลเอนต์ที่เชื่อมต่อและเวอร์ชันช่วยระบุไคลเอนต์ที่ไม่คาดคิดหรือไม่เข้ากันได้
-
ขนาดบริบท (ค่าเริ่มต้น 4096): เพิ่มขนาดนี้สำหรับข้อความที่เลือกยาว คำสั่งยาว หรือการแปลงที่ต้องใช้บริบทรอบข้างมากขึ้น บริบทที่ใหญ่ขึ้นจะใช้หน่วยความจำมากขึ้นและอาจช้าลง ไม่ปรับปรุงการแก้ไขสั้นโดยอัตโนมัติ
-
จำนวนโทเค็นสูงสุด (ค่าเริ่มต้น 512): เพิ่มเมื่อการเขียนใหม่ยาว ๆ ถูกตัดออก ลดเพื่อจำกัดเวลาในการตอบและป้องกันผลลัพธ์ที่ยาวโดยไม่คาดคิด การแก้ไขการเขียนคำพูดปกติไม่จำเป็นต้องใช้ค่ามาก
-
อุณหภูมิ (ค่าเริ่มต้น 0.2): ค่าต่ำจะได้ผลซ้ำได้มากกว่าและดีที่สุดสำหรับการแก้ไข การจัดรูปแบบ และการรักษาความหมาย เพิ่มค่าเฉพาะเมื่อต้องการการเขียนใหม่ที่สร้างสรรค์โดยตั้งใจ; ค่าสูงสามารถเปลี่ยนคำหรือข้อเท็จจริงได้อย่างเสรีมากขึ้น
-
ความยาวการถอดความขั้นต่ำสำหรับการปรับปรุง AI (ค่าเริ่มต้น 20 ตัวอักษร): ลดค่าลงเมื่อแม้แต่ประโยคสั้น ๆ ก็ต้องการให้ประมวลผล เพิ่มค่าเพื่อหลีกเลี่ยงการเริ่มต้นโมเดล/ความล่าช้า และการเขียนใหม่ที่น่าประหลาดใจสำหรับข้อความสั้น ๆ เช่น “ใช่” หรือชื่อ
-
คำสั่งระบบ: นี่คือคำสั่งมาตรฐานสำหรับการปรับปรุง AI ค่าเริ่มต้น ระบุภาษาที่ต้องการ ว่าจะต้องรักษาความหมายและน้ำเสียงหรือไม่ และว่าควรส่งคืนเฉพาะข้อความสุดท้ายเท่านั้น ทดสอบการเปลี่ยนแปลงคำสั่งกับข้อความที่ไม่สำคัญ: คำสั่งกว้างเกินไปอาจตอบการคัดลอกเสียง, แปลข้อความ หรือเพิ่มคำอธิบายแทนการแก้ไข
-
การเก็บโมเดล AI ทางเลือก: ใช้ไดรฟ์ในเครื่องที่รวดเร็วและมีพื้นที่เพียงพอ การคัดลอกโมเดลที่มีอยู่ช่วยป้องกันการดาวน์โหลดซ้ำ; การเปลี่ยนโฟลเดอร์เพียงอย่างเดียวจะไม่ทำให้โมเดลที่หายไปหรือไม่เข้ากันใช้งานได้
ดู โมเดล AI และฮาร์ดแวร์ และ การปรับปรุง AI
-
คุณภาพโมเดลการจดจำผู้พูด: ควรใช้โมเดลคุณภาพสูงกว่าเมื่อการแยกเสียงที่คล้ายกันมีความสำคัญ และเครื่องมีหน่วยความจำ/ประสิทธิภาพเพียงพอ ใช้โมเดลเบากว่าสำหรับเซสชันยาวบนฮาร์ดแวร์ที่จำกัด โมเดลที่ดาวน์โหลดจะสามารถเลือกใช้ได้ทันที
-
ความไวในการแยกผู้พูด: เริ่มต้นด้วย ค่าเริ่มต้น เพิ่มค่าหากเสียงของสองคนที่แตกต่างแต่คล้ายกันถูกผสานซ้ำ ๆ ข้อแลกเปลี่ยนคือเสียงของคนคนเดียวที่เปลี่ยนไป ระยะทาง หรือมุมไมโครโฟนอาจถูกแบ่งเป็นผู้พูดเพิ่มเติม ลดค่าหากคนคนเดียวถูกแสดงซ้ำ ๆ ว่าเป็นหลายคน ข้อแลกเปลี่ยนคือเสียงที่คล้ายกันจริงอาจถูกผสาน
-
ความไวต่อการตรวจจับเสียงพูด: เพิ่มความไวเมื่อมีการถอดเสียงคลิก เสียงรบกวนในห้อง หรือช่วงเงียบ ลดความไวเมื่อผู้พูดเงียบถูกละเว้น เกตนี้ตัดสินใจว่าจะส่งบล็อกใดไปถอดเสียงหรือไม่; บล็อกที่ถูกปฏิเสธอย่างรุนแรงไม่สามารถกู้คืนได้ด้วยโมเดลถอดเสียงที่แม่นยำกว่า
-
ช่วงหยุดเพื่อสรุปผล (ค่าเริ่มต้น 10 วินาที บนหน้าบันทึกการสนทนา): ใช้ช่วงหยุดสั้นเมื่อส่วนต่าง ๆ ควรปิดอย่างรวดเร็วหลังจากผู้พูดหยุด ใช้ช่วงหยุดยาวสำหรับการสนทนาที่รอบคอบซึ่งมีการหยุดนิ่งยาว ๆ; ผลลัพธ์จะปรากฏช้าลง แต่โอกาสที่ความคิดเห็นเดียวจะแยกออกเป็นสองส่วนมีน้อยลง
-
จำนวนผู้พูดที่คาดไว้ (ตั้งค่าอัตโนมัติเป็นค่าเริ่มต้น บนหน้าบันทึกการสนทนา): ให้เก็บค่า อัตโนมัติ ไว้เมื่อผู้เข้าร่วมสามารถเข้าร่วมหรือออกจากการประชุมได้ ตั้งค่าจำนวนที่ทราบสำหรับการประชุมที่มีจำนวนแน่นอนเมื่อการจัดกลุ่มอัตโนมัติให้จำนวนผิด จำนวนแน่นอนที่ผิดอาจทำให้เสียงที่ไม่เกี่ยวข้องเข้ามาอยู่ด้วยกันหรือแยกเสียงหนึ่งออกเพื่อตอบสนองจำนวนที่ขอตามคำขอ
การแยกผู้พูดเป็นไปในรูปแบบความน่าจะเป็น ระยะห่างของไมโครโฟน การทับซ้อน เสียงสะท้อน และเสียงรบกวนรอบข้างที่เปลี่ยนแปลงสำคัญ; การแก้ไขผู้พูดด้วยตนเองยังคงจำเป็น ดูที่ บันทึกการสนทนา
ส่วนนี้สำหรับนักพัฒนาหรือโปรแกรมเมอร์เท่านั้น ใช้กำหนดค่าไคลเอนต์คอมพิวเตอร์คู่แยกที่สตรีมจากไมโครโฟนของคอมพิวเตอร์อีกเครื่องหนึ่งบนเครือข่ายภายในเดียวกัน
-
เปิดใช้งานบริการเฉพาะเมื่อจำเป็นต้องใช้ไมโครโฟนของไคลเอนต์เท่านั้น เลือกอะแดปเตอร์เครือข่ายที่สามารถเข้าถึงได้จากฝั่งไคลเอนต์; VPN และอะแดปเตอร์เสมือนมักสร้างที่อยู่สำหรับจับคู่ซึ่งเครื่องอื่นไม่สามารถเข้าถึงได้
-
ใช้พอร์ตเริ่มต้นเว้นแต่จะขัดแย้งกับบริการอื่น หากไคลเอนต์ไม่สามารถเชื่อมต่อได้ ตรวจสอบอะแดปเตอร์ที่เลือก ไฟร์วอลล์ท้องถิ่น และตรวจสอบว่าทั้งสองระบบอยู่ในเครือข่ายที่เชื่อถือได้เดียวกันก่อนเปลี่ยนพอร์ตแบบสุ่ม
-
จัดการ URL/โทเค็นสำหรับจับคู่ว่าเป็นความลับ ใครก็ตามที่สามารถเข้าถึงบริการและมีโทเค็นที่ถูกต้องอาจพยายามเชื่อมต่อ สร้าง URL ใหม่หรือกระจายใหม่หลังจากเปลี่ยนอะแดปเตอร์ ที่อยู่ พอร์ต หรือโทเค็น
-
สถานะของไคลเอนต์ที่เชื่อมต่อจะแสดงว่าไคลเอนต์ไหนใช้งานได้และความสามารถของพวกเขา เสียงจะถูกสตรีมจากไคลเอนต์ที่ถูกเลือกเป็นอุปกรณ์บันทึก; การเชื่อมต่อไคลเอนต์เพียงอย่างเดียวไม่ได้หมายความว่าทุกไมโครโฟนที่เชื่อมต่อจะบันทึกพร้อมกัน
-
ไม่มีการส่งผ่านคลาวด์ ซึ่งช่วยเพิ่มความเป็นส่วนตัว แต่หมายความว่าการจัดเส้นทาง ไฟร์วอลล์ โหมดสลีป และคุณภาพ Wi-Fi จะมีผลโดยตรงต่อการใช้งานและความหน่วงเวลา
- ทำซ้ำปัญหาในแอปพลิเคชันเป้าหมายหนึ่งโดยปิดการปรับปรุง AI และการแสดงตัวอย่างแบบเรียลไทม์
- สำหรับคำที่พิมพ์ผิด ให้ปรับระดับไมโครโฟน/ลดเสียงรบกวน เลือกภาษาคงที่ และทดสอบโมเดลการถอดเสียงอื่นก่อนเปลี่ยนการตั้งค่าแทรกข้อความ
- สำหรับข้อความที่ถูกต้องแต่แทรกผิด ให้เปลี่ยนวิธีการแทรกก่อน จากนั้นเปลี่ยนทางลัดการวาง แล้วค่อยเพิ่มดีเลย์เฉพาะส่วนที่เกี่ยวข้อง
- สำหรับการพูดเงียบที่หายไป ให้ลดความไวการตรวจจับเสียงพูดเล็กน้อย; สำหรับเสียงรบกวนที่ถูกตีความว่าเป็นเสียงพูด ให้เพิ่มความไวเล็กน้อย
- สำหรับโหลดสูง ให้ปิดโหมดเรียลไทม์หรือเพิ่มช่วง hop ของมันก่อนลดคุณภาพการถอดเสียงสุดท้าย
- คืนค่าเริ่มต้นในส่วนที่ได้รับผลกระทบหากการเปลี่ยนแปลงหลายครั้งทำให้ผลลัพธ์ยากต่อการตีความ
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động