Skip to content

Releases: Cuongyd196/cit-voice-studio

CIT Voice Studio 1.0.3

Choose a tag to compare

@Cuongyd196 Cuongyd196 released this 03 Oct 05:43

CIT Voice Studio 1.0.3

Cập nhật: tải bản mới cho máy của bạn và cài đè lên bản cũ. Giọng đã nhân bản, lịch sử, từ điển và cài đặt được giữ nguyên.

Mới: Giọng nước ngoài - 31 ngôn ngữ

  • Tải thêm mô hình Supertonic 3 (~400 MB) trong Cài đặt → Quản lý & Chọn Mô hình AI để đọc tiếng Anh, Nhật, Hàn, Pháp, Đức, Tây Ban Nha, Nga, Ả Rập… (chưa có tiếng Trung) với 10 giọng nam nữ (F1-F5, M1-M5).
  • Chọn tiếng của đoạn văn ở ô Ngôn ngữ văn bản (mặc định Tiếng Anh, hoặc Tự nhận theo văn bản). Nút nghe thử giọng đọc câu mẫu bằng tiếng đó.
  • Dùng được ở mọi tab: TTS Studio, Hội thoại, Tạo hàng loạt, Lồng tiếng theo phụ đề.
  • Thẻ cảm xúc riêng: <laugh> (cười), <breath> (lấy hơi), <sigh> (thở dài), chèn bằng thanh cảm xúc. Thẻ nghỉ [nghỉ 2s] và từ điển phát âm dùng như bình thường.
  • Văn bản mẫu tự đổi sang tiếng Anh khi dùng mô hình này.
  • Chạy bằng CPU, có trên Windows, Linux và macOS. Tiếng Việt vẫn nên dùng VieNeu (chất lượng tốt hơn); Supertonic không nhân bản giọng.

Nhớ mô hình đã chọn

  • Mở lại ứng dụng sẽ dùng đúng mô hình bạn chọn lần trước, không còn quay về mô hình mặc định. Mô hình bị xoá hoặc lỗi thì tự quay về mô hình mặc định.

Điều khoản sử dụng 1.1

  • Ghi rõ ứng dụng dùng hai mô hình (VieNeu-TTS và Supertonic 3) cùng giấy phép của từng mô hình, trong đó có các giới hạn sử dụng của giấy phép OpenRAIL-M. Bạn sẽ được hỏi đồng ý lại một lần.

Cho phần mềm khác gọi API

  • Thêm tham số không bắt buộc language (vd. "en", "ja") ở /stream, /api/tts/generate, /api/tts/generate-with-subtitles, /api/tts/conversation. Mô hình VieNeu bỏ qua tham số này, nên phần mềm đang dùng không cần sửa gì.
  • /health có thêm languages (các mã ngôn ngữ dùng được) và supports_cloning.

CIT Voice Studio 1.0.2

Choose a tag to compare

@Cuongyd196 Cuongyd196 released this 02 Oct 14:47

CIT Voice Studio 1.0.2

Cập nhật: tải bản mới cho máy của bạn và cài đè lên bản cũ. Giọng đã nhân bản, lịch sử và cài đặt được giữ nguyên.

Mới: Lồng tiếng theo phụ đề SRT

  • Thả file phụ đề .srt vào tab Đọc file: ứng dụng đọc từng câu và đặt đúng mốc thời gian, ra một file audio dài khớp video (lưu vào Lịch sử, tải WAV/MP3).
  • Câu dài hơn khung được đọc nhanh hơn cho vừa (tối đa 1,5 lần); vẫn chưa vừa thì lấn sang khoảng lặng hoặc đẩy câu sau lùi lại - không bao giờ cắt chữ.
  • Kèm file phụ đề đã chỉnh mốc để khớp với giọng đọc khi có câu bị lùi.
  • Chọn được giọng có sẵn hoặc giọng bạn đã nhân bản; áp dụng từ điển phát âm.

Đổi tốc độ đọc mượt hơn

  • Đọc nhanh hoặc chậm hơn (thanh Tốc độ) không còn bị rè, méo tiếng như trước, ở mọi tab: TTS Studio, Hội thoại, Tạo hàng loạt, Lồng tiếng.
  • Đổi tốc độ cũng nhanh hơn nhiều với bài dài.

Điều khoản sử dụng

  • Khi cài (Windows) và khi mở ứng dụng lần đầu, bạn cần đọc và đồng ý Điều khoản sử dụng.
  • Dấu đồng ý chỉ lưu trên máy bạn, không gửi đi đâu.

Nhân bản giọng an toàn hơn

  • Chỉ nhân bản được giọng của chính bạn: thu âm trực tiếp bằng micro và đọc câu đồng ý hiện trên màn hình (khoảng 8 giây).
  • Ứng dụng nghe kiểm tra ngay trên máy rồi mới lưu giọng. Lần đầu cần tải bộ kiểm tra giọng đọc (~77 MB).
  • Không còn chọn file ghi âm có sẵn để nhân bản.
  • Giọng bạn đã nhân bản ở bản cũ vẫn dùng bình thường.

Cho phần mềm khác gọi API

  • Thay đổi: bỏ POST /api/tts/clone (nhân bản từ file gửi lên). Hãy tạo giọng trong ứng dụng, rồi dùng giọng đó qua voice_id ở /api/tts/generate, /stream, /api/tts/generate-with-subtitles, /api/tts/conversation.

CIT Voice Studio 1.0.1

Choose a tag to compare

@Cuongyd196 Cuongyd196 released this 28 Sep 00:19

CIT Voice Studio 1.0.1 - ĐÃ ĐÓNG - VUI LÒNG CẬP NHẬT BẢN MỚI NHẤT

Giọng đọc tốt hơn

  • Nâng VieNeu-TTS lên bản 3.8.3.
  • 25 giọng có sẵn (thêm 5 giọng mới).

Nhân bản giọng

  • Kết quả được lưu vào Lịch sử như TTS Studio.
  • Thẻ cảm xúc và thẻ nghỉ chèn đúng chỗ con trỏ.

Khác

  • Đọc văn bản rất dài không còn bị treo hay trắng màn hình.
  • Lịch sử không còn tự xoá bài cũ. Tab Lịch sử hiện số bài, dung lượng và nút mở thư mục.
  • Tab Thông tin hiện số phiên bản và có nút "Kiểm tra cập nhật". Có thể bật tự kiểm tra bản mới trong Cài đặt (mặc định tắt).
  • Thêm cảnh báo sử dụng hợp lý khi nhân bản giọng.

CIT Voice Studio 1.0.0

Choose a tag to compare

@Cuongyd196 Cuongyd196 released this 23 Sep 09:57

CIT Voice Studio 1.0.0 - VUI LÒNG CẬP NHẬT BẢN MỚI NHẤT

Bản phát hành đầu tiên. Chuyển văn bản tiếng Việt thành giọng nói, chạy hoàn toàn trên máy bạn, trên Windows, Linux và macOS (Mac chip Apple).

Tải về

Chọn đúng file cho máy của bạn:

Máy của bạn File Dung lượng
Windows 10/11 64-bit CIT-Voice-Studio-v1.0.0-win-x86_64.exe ~365 MB
Ubuntu, Debian, Linux Mint… cit-voice-studio_1.0.0_amd64.deb ~460 MB
Linux khác (64-bit) CIT-Voice-Studio-v1.0.0-linux-x86_64.tar.gz ~460 MB
Mac chip Apple (M1, M2, M3…), macOS 14+ CIT-Voice-Studio-v1.0.0-macos-arm64.dmg ~410 MB

Mọi bản đều kèm sẵn mô hình giọng nói: cài xong dùng được ngay, không cần Internet, dữ liệu lưu trực tiếp trên máy bạn.

Cài đặt

Windows: bấm đúp file .exe và làm theo hướng dẫn, không cần quyền quản trị. Nếu Windows chặn: chuột phải vào file → Properties → tích Unblock → OK, hoặc bấm More info → Run anyway. Gỡ qua Settings → Apps.

Linux (.deb): sudo apt install ./cit-voice-studio_1.0.0_amd64.deb, rồi mở CIT Voice Studio trong menu ứng dụng hoặc gõ cit-voice-studio.

Linux (.tar.gz): giải nén, chạy ./CIT-Voice-Studio trong thư mục vừa giải nén.

Trên Linux, giao diện mở trong trình duyệt tại http://127.0.0.1:8001. Giữ cửa sổ Terminal mở trong lúc dùng.

macOS: mở .dmg, kéo CIT Voice Studio vào Applications. Lần đầu mở bị chặn thì vào System Settings → Privacy & Security → Open Anyway. Chưa có bản cho Mac chip Intel.

Bản Linux và macOS có file HUONG-DAN.txt đi kèm, hướng dẫn chi tiết.

Có gì

  • 20 giọng mẫu: nam và nữ, giọng Bắc, Trung, Nam; phong cách tin tức, kể chuyện, đọc truyện, tự nhiên
  • Nghe thử từng giọng ngay trong danh sách trước khi chọn
  • Nhân bản giọng nói từ đoạn mẫu 3–8 giây
  • Hội thoại và podcast nhiều người nói
  • Đọc file PDF, Word (.docx) và TXT
  • Tạo hàng loạt: mỗi mốc [P1], [P2]… thành một file audio, tải chung một file .zip
  • Tạo audio kèm phụ đề .srt cho video
  • Chèn cảm xúc trong câu: [cười], [thở dài], [hắng giọng]
  • Chèn khoảng lặng chính xác: [nghỉ 2s], [nghỉ 500ms]
  • Từ điển phát âm cho từ viết tắt, tên riêng
  • Đọc tiếng Anh xen tiếng Việt
  • Chỉnh tốc độ đọc 0.75x – 1.50x
  • Xuất WAV hoặc MP3, 48 kHz
  • Nghe ngay trong lúc đang tạo
  • Lịch sử các bản đã tạo, còn nguyên sau khi tắt ứng dụng
  • API cho phần mềm khác gọi vào tại http://127.0.0.1:8001, có thể mở cho máy khác trong mạng LAN kèm khoá API

Tốc độ

Chạy bằng CPU. Đo trên laptop Intel i7-8650U đời 2017: đọc đoạn dài 1 phút mất khoảng 30 giây.

Máy có card NVIDIA (Windows và Linux) có thể bấm Cài hỗ trợ GPU trong Cài đặt. Ứng dụng tự tải PyTorch/CUDA, vài GB, cần ít nhất 12 GB trống. macOS chỉ chạy CPU.

Gặp lỗi

  • Windows mở bằng trình duyệt thay vì cửa sổ riêng: không phải lỗi, mọi tính năng vẫn chạy. Máy thiếu Microsoft Edge WebView2 Runtime, cài miễn phí tại https://go.microsoft.com/fwlink/p/?LinkId=2124703.
  • macOS không mở được: cần macOS 14 Sonoma trở lên.

Nguồn gốc

CIT Voice Studio do Cường IT phát triển, dựa trên VieNeu-TTS của tác giả Phạm Nguyễn Ngọc Bảo.

Toàn bộ mô hình trí tuệ nhân tạo và thuật toán tổng hợp giọng nói là công trình nghiên cứu của tác giả VieNeu-TTS.

Giấy phép Apache 2.0. File LICENSE và NOTICE đi kèm trong mọi bản cài.