-
Notifications
You must be signed in to change notification settings - Fork 0
Thai AI Models and Hardware
Voice2Win แยกงานออกเป็นสามประเภท ความเข้าใจความแตกต่างนี้ทำให้การตั้งค่าโมเดลและฮาร์ดแวร์ปัญญาประดิษฐ์ (AI) ง่ายขึ้นมาก
| งาน | วัตถุประสงค์ | เทคโนโลยี |
|---|---|---|
| การถอดเสียงหลัก | การถอดเสียงตามปกติ, คำสั่งเสียง, การถอดเสียงเป็นบล็อก, และการถอดเสียงซ้ำ | Whisper หรือ Parakeet |
| การถอดเสียงแบบสด | ผลลัพธ์ชั่วคราวในช่วงเริ่มต้นของการบันทึก | โมเดล Sherpa-ONNX ออนไลน์แยกต่างหาก |
| การปรับปรุง AI | แก้ไขหรือแปลงข้อความ | โมเดล Gemma ในตัว, Ollama, LM Studio, หรือ Voice2Win ที่ใช้ร่วมกัน |
Parakeet เป็นเครื่องถอดเสียงหลัก ไม่ใช่โมเดลแบบสตรีม
OpenAI Whisper มีการจดจำแบบออฟไลน์ที่ดีมากในหลายภาษา มันใช้ทรัพยากรมากกว่าและมักจะช้ากว่า Parakeet การเร่งด้วยการ์ดกราฟิกแนะนำสำหรับโมเดลขนาดใหญ่และการถอดเสียงแบบบล็อกแบบเรียลไทม์
NVIDIA Parakeet V3 มีประสิทธิภาพมากกว่าและทำงานได้ดีบนโปรเซสเซอร์หลัก อาจมีข้อผิดพลาดน้อยกว่า Whisper เล็กน้อยและรองรับชุดภาษาที่น้อยกว่า เลือกใช้เมื่อความเร็วและการใช้ทรัพยากรต่ำมีความสำคัญมากกว่าการครอบคลุมหลายภาษาสูงสุด
การตั้งค่า AI Models จะแสดงเฉพาะโมเดลที่อยู่ในเครื่องยนต์ที่เลือก ใช้ Manage Models เพื่อดาวน์โหลดหรือเอาไฟล์โมเดลออก รายการ Current Model ในหน้าต่างหลักจากนั้นจะเลือกจากโมเดลที่ดาวน์โหลดแล้ว
ตารางการมอบหมายตัวประมวลผลหลัก (CPU) / การ์ดกราฟิก (GPU) และโมเดล AI กำหนดการถอดเสียงเสียงและการปรับปรุง AI อย่างอิสระ
- ตัวประมวลผลหลัก (CPU) เป็นตัวเลือกที่เข้ากันได้มากที่สุด แต่บางครั้งอาจช้ากว่า
- การ์ดกราฟิก (GPU) ช่วยเร่งการทำงานที่รองรับ และจะแสดงคำเตือนเกี่ยวกับประสิทธิภาพหากงานที่เลือกมีแนวโน้มจะช้า หรือมีหน่วยความจำกราฟิกไม่เพียงพอ
- Ollama หรือ LM Studio สามารถให้การปรับปรุง AI จากเซิร์ฟเวอร์ในเครื่อง ใส่โฮสต์และพอร์ตของเซิร์ฟเวอร์ ค้นหาเครือข่ายเวอร์ชัน 4 ของโปรโตคอลอินเทอร์เน็ต (IPv4) ในเครื่องถ้าต้องการ รีเฟรชรายการโมเดล และเลือกโมเดลที่รายงานมา
- อินสแตนซ์ Voice2Win ร่วมกัน สามารถให้การถอดเสียง การปรับปรุง AI หรือทั้งสองอย่างจากคอมพิวเตอร์เครื่องอื่น
การเปลี่ยน runtime จะโหลดโมเดลที่ได้รับผลกระทบใหม่ในพื้นหลัง และอาจใช้เวลาสักครู่
- Whisper และ AI Enhancement ในตัวใช้การเร่งกราฟิก Vulkan บน Windows และ Linux; macOS ใช้เส้นทางกราฟิกพื้นเมืองของมัน
- Parakeet และการถอดเสียงสตรีมบน Windows ใช้ DirectML สำหรับการเร่งกราฟิก
- โปรเซสเซอร์หลักยังคงสามารถใช้เป็นสำรองได้
Voice2Win เลือกที่จะไม่รวมรันไทม์ CUDA เพราะขนาดของแพ็กเกจ ปัจจุบันไดรเวอร์กราฟิกที่รองรับ Vulkan หรือ DirectML สำคัญกว่าการติดตั้ง CUDA แยกต่างหาก
โมเดลเสียงและ AI สามารถอยู่ในหน่วยความจำพร้อมกันได้ ความต้องการหน่วยความจำรวมของพวกมันมีความสำคัญ:
- หากหน่วยความจำกราฟิกเฉพาะไม่เพียงพอ ให้เลือกโมเดลที่มีขนาดเล็กลงหรือที่ถูกควอนไทซ์อย่างเข้มงวดมากขึ้น
- กำหนดให้ภาระงานหนึ่งทำงานบนโปรเซสเซอร์หลักและอีกภาระงานหนึ่งบนการ์ดกราฟิก
- หลีกเลี่ยงการโหลดโมเดลที่มีการประเมินคำเตือนเกินหน่วยความจำระบบหรือกราฟิกที่มีอยู่ การสลับหน้าระเบียนหนักอาจทำให้คอมพิวเตอร์ทั้งหมดไม่ตอบสนอง
- ใช้ตำแหน่งจัดเก็บ AI-model ทางเลือกเมื่อความจุดิสก์เป็นข้อจำกัด แทนที่จะเป็นหน่วยความจำ
Ollama ตั้งค่าเริ่มต้นที่พอร์ต 11434; LM Studio ตั้งค่าเริ่มต้นที่พอร์ต 1234 Voice2Win จะสอบถามรายการโมเดลของเซิร์ฟเวอร์ที่เลือกและส่งคำสั่งเพิ่มประสิทธิภาพเฉพาะไปยังเซิร์ฟเวอร์ที่กำหนดนั้น ความพร้อมใช้งานของเซิร์ฟเวอร์ ความเป็นส่วนตัว และพฤติกรรมของโมเดลขึ้นอยู่กับการติดตั้งเซิร์ฟเวอร์นั้น
คอมพิวเตอร์ One Voice2Win สามารถเปิดเผยโมเดลเสียงและ AI ที่โหลดอยู่ในปัจจุบันให้กับอินสแตนซ์ Voice2Win อื่นได้:
- ใน การตั้งค่า → โมเดล AI เปิดการแชร์เวลาใช้งาน
- เลือกพอร์ตและรหัสผ่านตามต้องการ
- บนคอมพิวเตอร์เครื่องอื่น ให้เพิ่มอินสแตนซ์ Voice2Win ที่แชร์ไว้ ใส่ชื่อคอมพิวเตอร์หรือที่อยู่ IPv4, พอร์ต และรหัสผ่าน หรือค้นหาเครือข่ายท้องถิ่น
- กำหนดการถอดเสียงและ/หรือการปรับปรุง AI ให้กับแถวระยะไกล
ลูกค้าที่เชื่อมต่อและข้อมูลการใช้งานครั้งล่าสุดจะแสดงบนคอมพิวเตอร์ที่แชร์ไว้ ให้เวอร์ชันตรงกัน เพราะความไม่ตรงกันของเวอร์ชันอาจทำให้เกิดปัญหาความเข้ากันได้ อินสแตนซ์ที่กำลังใช้เวลาใช้งานที่แชร์จะไม่สามารถแชร์เวลาใช้งานนั้นต่อไปได้
คุณสมบัตินี้ส่งข้อมูลงานผ่านการเชื่อมต่อเครือข่ายที่ตั้งค่าไว้ ใช้เครือข่ายที่เชื่อถือได้และกำหนดรหัสผ่านเมื่อผู้ใช้อื่นสามารถเข้าถึงพอร์ตได้
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động