VahanaTTS เป็นระบบ Text-to-Speech (TTS) ที่ใช้โมเดล VITS ซึ่งช่วยให้คุณสามารถแปลงข้อความเป็นเสียงได้อย่างรวดเร็ว รองรับการใช้งานทั้งบน GPU และ CPU
- โมเดล fintune จาก MMS-TTS-THA
- เปิด Command Prompt หรือ Terminal
- ใช้คำสั่งต่อไปนี้:
git clone https://github.com/VYNCX/VachanaTTS.git
cd VachanaTTS
pip install -r requirements.txt
///GPU Usage
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118- รันไฟล์
install.batเพื่อติดตั้งโปรแกรม:- หากต้องการใช้งาน GPU ให้พิมพ์
y(ต้องใช้ NVIDIA CUDA)- ข้อดี: รวดเร็ว
- ข้อเสีย: ใช้ทรัพยากรเครื่องและพื้นที่เยอะ
- หากต้องการใช้งาน CPU ให้พิมพ์
n- ข้อดี: ประหยัดพื้นที่และทรัพยากร
- ข้อเสีย: ช้ากว่า โดยเฉพาะหากใช้งานโหมดโคลนเสียง
- หากต้องการใช้งาน GPU ให้พิมพ์
- รันคำสั่งต่อไปนี้ใน Command Prompt หรือ Terminal:
python app.pyภาษาไทย
python app-th.pyหรือ
- เปิดไฟล์
app.batเพื่อเริ่มโปรแกรม ,ภาษาไทยเปิดapp-th.bat
- ใช้งานบน Google Colab
ก่อนใช้งาน จำเป็นต้องดาวน์โหลดโมเดลจาก Huggingface ตัวอย่างโมเดล:
- ดาวน์โหลดโมเดลที่ต้องการ
- วางไฟล์โมเดลในโฟลเดอร์
modelsของโปรเจกต์
- หากใช้การโคลนเสียง ดาวน์โหลดโมเดล OpenVoice แตกไฟล์ และ วางไฟล์โมเดลในโฟลเดอร์
OPENVOICE_MODELSของโปรเจกต์
หรือ
รันไฟล์ finetune-webui.bat เพื่อ Finetune โมเดล ด้วย Webui
ตัวอย่างการเตรียม Dataset
- รองรับเสียงความยาว 3-15 วินาที ต่อ 1 เสียง
- แนะนำ ไฟล์เสียง อย่างน้อย 10-20 เสียง ในการ Finetune
ตัวอย่าง Dataset
/dataset
/TH_MALE
- metadata.csv
- /audio
- /audio1.wav
ไฟล์ Metadata.csv
file_name,text
audio/audio1.wav,สวัสดีครับทุกคน ยินดีที่ได้พบกันอีกครั้ง
audio/audio2.wav,เธอเคยเห็นนกบินสูงบนฟ้าสีครามไหม
- พอดแคสต์ ตัวอย่างข้อความ Speaker 1 แทนผู้พูด 1 จากโมเดลเสียง ตัวอย่าง
Speaker 1 : สำหรับพอดแคสต์ในวันนี้ เราจะมาพูดคุยกันเกี่ยวกับหัวข้อที่หลายคนอาจจะสนใจครับ
Speaker 2 : ใช่ค่ะ หัวข้อในวันนี้คือ "การสร้างแรงบันดาลใจในชีวิตประจำวัน" ซึ่งหวังว่าทุกคนจะได้ไอเดียดี ๆ กลับไปนะคะ
-
วิดีโอ Dubbing ใช้ 1, เพื่อลำดับผู้พูด และตามด้วยคำพูด จาก ไฟล์ srt
- ถ้าไม่ใช้ ลำดับผู้พูดก็ไม่จำเป็นต่องใส่ด้านหน้าความ แต่จะใช้ได้เพียง โมเดลเสียงเดียวเท่านั้น
- สามารถนำเสียงที่ต้องการโคลนมาใส่เพื่อโคลนเสียงให้เข้ากับเสียงในวิดีโอนั้น(อาจใช้เวลานานในการประมวลผล หากใช้การโคลนเสียง) หรือ ไม่ใช้การโคลนเสียงก็ได้
-
ตัวอย่าง SRT ไฟล์
1
00:00:00,009 --> 00:00:03,336
1, ใครจากนักแสดงที่ทำให้คุณหัวเราะมากที่สุด?
2
00:00:03,643 --> 00:00:04,224
2, คุณ.
3
00:00:07,841 --> 00:00:10,555
2, งานแรกของคุณคืออะไร?