-
Notifications
You must be signed in to change notification settings - Fork 0
Vietnamese Settings Reference
Mở Cài đặt bằng nút bánh răng. OK lưu các thay đổi; Hủy bỏ qua chúng. Các thay đổi ảnh hưởng đến mô hình, môi trường chạy, vị trí lưu trữ hoặc dịch vụ mạng có thể mất một lúc để áp dụng và có thể tải lại một thành phần.
Tài liệu tham khảo này nhằm mục đích làm hướng dẫn tinh chỉnh, không chỉ là danh sách các điều khiển. Các giá trị mặc định là điểm khởi đầu tốt cho hầu hết các cài đặt Windows cục bộ. Thay đổi từng cài đặt liên quan một lần, thử nghiệm trong ứng dụng mà bạn thực sự nhập liệu bằng giọng nói, và giữ giá trị trước đó cho đến khi kết quả rõ ràng tốt hơn.
| Mục tiêu | Điểm khởi đầu được khuyến nghị |
|---|---|
| Nhập liệu mỗi ngày đáng tin cậy trong các ứng dụng máy tính để bàn thông thường | Ngôn ngữ ghi âm cố định, dán từ Clipboard, bật khôi phục clipboard, độ trễ mặc định, bật chuẩn hóa âm thanh |
| Ghi âm vào terminal hoặc remote desktop | Thử Unicode trước nếu không thể chuyển tiếp clipboard. Nếu không, giữ Clipboard và chọn phím tắt dán được chấp nhận bởi máy đích từ xa. Sử dụng Mã quét (Scan Code) cho các ứng dụng chỉ phản hồi đáng tin cậy với đầu vào giống phím vật lý. |
| Tài liệu dài | Ngôn ngữ cố định, dấu câu nói, định dạng chuỗi, chế độ phím tắt thường trực hoặc kết hợp, lưu các bản ghi WAV |
| Các trường tìm kiếm ngắn, trò chuyện và lệnh | Bỏ dấu chấm cuối; tùy chọn dùng chữ thường đầu tiên; chế độ giữ phím tắt tránh vô tình để lại ghi âm đang hoạt động |
| Sử dụng im lặng hoặc nhạy cảm về quyền riêng tư | Vô hiệu hóa việc lưu các bản ghi WAV, xem lại việc lưu giữ bản ghi chuyển đổi âm thanh, vô hiệu hóa chèn vào clipboard nếu lo ngại các ứng dụng giám sát clipboard, và tránh sử dụng các runtime từ xa | | Độ trễ cảm nhận thấp nhất | Vô hiệu hóa xem trước trực tiếp trừ khi cần thiết, sử dụng mô hình/runtime chuyển đổi âm thanh nhanh tại chỗ, giữ độ trễ chèn thấp, và không thu thập kết quả AI trước khi chèn |
- Ngôn ngữ phiên âm: Chọn ngôn ngữ mà bạn sử dụng thường xuyên nhất. Một ngôn ngữ cố định thường khởi động nhanh hơn và đáng tin cậy hơn Tự động, đặc biệt là đối với các bản ghi ngắn, tên riêng và các từ có âm tương tự. Chỉ sử dụng phát hiện ngôn ngữ tự động khi bạn thực sự chuyển đổi ngôn ngữ giữa các bản ghi; việc phát hiện ngôn ngữ khó chính xác trong một cụm từ ngắn và có thể chọn sai.
- Thuật ngữ chuyên môn và tên riêng tùy chỉnh: Thêm các tên hiếm, thuật ngữ sản phẩm, viết tắt và cách đánh vần mà bạn muốn Whisper ưu tiên. Giữ danh sách tập trung: nó hướng dẫn việc nhận dạng nhưng không phải là quy tắc tìm-thay thế đảm bảo, và một danh sách lớn các từ thông thường có thể tạo ra thiên vị không mong muốn. Hướng dẫn này dành cho Whisper; bộ máy phiên âm khác có thể không sử dụng theo cùng cách.
Phương pháp chèn tốt nhất phụ thuộc vào ứng dụng mục tiêu. Hãy thử nghiệm nó trong chương trình khó nhất mà bạn sử dụng, không chỉ trong một trình soạn thảo đơn giản.
-
Clipboard: Lựa chọn tổng quát tốt nhất trên Windows và thường nhanh nhất cho văn bản dài, ký tự đặc biệt và Unicode phức tạp. Voice2Win tạm thời thay thế clipboard, gửi lệnh dán và có thể khôi phục nội dung trước đó. Trình quản lý clipboard hoặc các ứng dụng khác có thể quan sát văn bản tạm thời, và việc chuyển tiếp clipboard có thể bị vô hiệu hóa trong phiên làm việc từ xa.
-
Unicode: Không phụ thuộc vào bố cục và là lựa chọn đầu tiên tốt cho các phiên làm việc từ xa, hệ thống không phải Windows, và văn bản chứa ký tự không có trên bố cục bàn phím hiện tại. Một số trò chơi, terminal, ứng dụng cũ và cửa sổ nâng cao không chấp nhận Unicode mô phỏng một cách đáng tin cậy.
-
Mã quét (Scan Code): Hoạt động gần giống nhất với nhập từ bàn phím vật lý và có thể hỗ trợ các ứng dụng mục tiêu cũ hoặc bất thường. Nó phụ thuộc vào bố cục bàn phím đang kích hoạt; một ký tự không có phím tương ứng trên bố cục đó có thể bị thiếu hoặc sai. Thông thường, phương pháp này chậm hơn việc dán văn bản từ clipboard đối với một đoạn văn bản dài.
-
Độ trễ mô phỏng bàn phím (0–50 ms): Giữ ở mức thấp trừ khi việc chèn ký tự bằng Unicode hoặc Mã quét bị mất hoặc sai thứ tự. Tăng dần độ trễ với các ứng dụng chậm, máy ảo hoặc máy tính từ xa. Cài đặt này chỉ làm chậm các phím đã mô phỏng; nó không cải thiện nhận dạng giọng nói.
-
Sử dụng clipboard cho các ứng dụng mục tiêu gặp sự cố: Giữ tùy chọn này bật khi sử dụng Unicode hoặc Scan Code trừ khi việc sử dụng clipboard bị cấm. Voice2Win sau đó có thể chuyển sang các ứng dụng đã biết không chấp nhận nhập liệu mô phỏng một cách tốt. Chỉ tắt nó khi lý do về quyền riêng tư của clipboard hoặc chuyển tiếp clipboard khiến bạn cố ý chọn mô phỏng bàn phím.
-
Thời gian chờ trước khi chèn (0–2000 ms, mặc định 40 ms): Thời gian để giá trị clipboard mới sẵn sàng trước khi phím tắt dán được gửi đi. Tăng giá trị này khi mục tiêu thỉnh thoảng dán giá trị clipboard trước đó hoặc không dán gì cả, đặc biệt khi đồng bộ clipboard từ xa. Giá trị lớn hơn sẽ thêm cùng một độ trễ cho mọi lần chèn.
-
Tổ hợp phím dán: Sử dụng Ctrl+V cho các ứng dụng Windows thông thường. Thử Ctrl+Shift+V hoặc Shift+Insert khi một terminal, desktop từ xa, hoặc công cụ AI coi Ctrl+V là thứ gì đó khác với dán văn bản thuần túy. Chọn phím tắt mà mục tiêu cuối cùng mong đợi, không nhất thiết theo cửa sổ remote-desktop cục bộ.
-
Thu thập văn bản trong khi AI đang nâng cao và chèn nó trong một bước duy nhất: Bật tính năng này khi đầu ra AI tiến triển di chuyển con trỏ, kích hoạt định dạng hoặc tự động hoàn thành, hoặc tạo ra nhiều bước hoàn tác. Tắt nó khi việc nhìn thấy kết quả càng sớm càng quan trọng; việc thu thập sẽ chờ đến khi kết quả AI hoàn tất trước khi bất kỳ thứ gì được chèn.
-
Khôi phục clipboard trước đó: Giữ tính năng này được bật cho công việc bình thường để Voice2Win không làm mất những gì bạn đã sao chép trước khi đọc chính tả. Chỉ tắt nó khi bạn muốn kết quả đọc chính tả vẫn giữ trên clipboard hoặc một mục tiêu cụ thể đọc clipboard sau khi phím tắt dán đã được thực hiện.
-
Thời gian chờ trước khi khôi phục (0–2000 ms, mặc định 120 ms): Tăng thời gian này khi mục tiêu không chèn gì hoặc chỉ một phần văn bản vì giá trị clipboard trước đó được khôi phục quá nhanh. Chỉ giữ nó cao tới mức cần thiết: trong khoảng thời gian này, văn bản được điều khiển vẫn có sẵn cho các ứng dụng nhận biết clipboard.
Các tùy chọn này sửa đổi văn bản đã nhận dạng trước khi chèn. Chúng hữu ích nhất khi các lệnh nói của bạn theo một mẫu nhất quán.
-
Dấu câu nói: Bật tính năng này cho văn bản dài khi bạn muốn các cụm từ như “dấu phẩy”, “dấu hỏi” hoặc các từ tương đương theo ngôn ngữ được chuyển thành dấu câu. Tắt nó khi những từ đó có thể là nội dung theo nghĩa đen, hoặc khi bạn muốn mô hình phiên âm tự động chèn dấu câu.
-
Xóa dấu chấm cuối: Hữu ích cho các trường tìm kiếm, tin nhắn chat, các trường biểu mẫu, tên tệp, và lệnh giọng nói khi không muốn có dấu chấm cuối được thêm tự động. Tắt nó cho các câu hoàn chỉnh trong tài liệu và email.
-
Chữ cái đầu viết thường: Hữu ích khi ra lệnh ghi âm thường được chèn vào giữa một câu có sẵn. Tắt nó cho các câu mới, tiêu đề, tên và tin nhắn độc lập.
-
Kết nối các bản ghi liên tiếp trong cùng một ứng dụng: Bật tính năng này khi bạn tạo một đoạn văn từ nhiều bản ghi; Voice2Win có thể duy trì khoảng cách và ngữ cảnh câu giữa chúng. Tắt tính năng này khi các bản ghi liên tiếp thường được nhập vào các trường khác nhau, hoặc khi bạn thường xuyên di chuyển con trỏ thủ công giữa các bản ghi.
-
Độ nhạy phát hiện giọng nói (0–100, mặc định 35%): Giá trị thấp hơn chấp nhận giọng nói nhỏ hơn nhưng cũng có thể coi tiếng thở, tiếng bấm hoặc tiếng ồn nền là giọng nói. Giá trị cao hơn lọc tiếng ồn mạnh hơn nhưng có thể từ chối giọng nói nhỏ hoặc các cuối từ. Bắt đầu với giá trị mặc định và thay đổi theo từng bước nhỏ trong khi quan sát mức đầu vào; đưa micro lại gần thường tốt hơn là sử dụng giá trị cực đoan.
-
Làm sạch phần đầu ghi âm (0–500 ms, mặc định 250 ms): Loại bỏ tiếng nhấn phím nóng, tiếng xử lý và im lặng đầu ghi. Tăng giá trị này nếu phần đầu của bản ghi có chứa tiếng nhấn phím; giảm giá trị nếu âm tiết đầu bị cắt hoặc bạn đọc những từ rất ngắn ngay sau khi nhấn phím nóng.
-
Chuẩn hóa ghi âm (mặc định bật, mục tiêu 85%): Được khuyến nghị cho micro thông thường và khi khoảng cách nói thay đổi vì nó trình bày mức độ nhất quán hơn cho mô hình. Tắt nó đối với đầu vào phòng thu/ảo đã được chuẩn hóa, hoặc khi chuẩn hóa làm tăng rõ rệt tiếng ồn nền liên tục. Mục tiêu này không phải là điều khiển mức micro và không thể phục hồi âm thanh bị méo.
-
Lưu bản ghi WAV (mặc định bật): Giữ bật khi bạn muốn phát lại, ghi lại, so sánh chất lượng, hoặc chứng cứ chẩn đoán. Tắt khi dung lượng lưu trữ hoặc bảo mật quan trọng hơn. Âm thanh thường chiếm nhiều không gian hơn văn bản.
-
Xóa bản ghi WAV đã lưu: Xóa âm thanh đã lưu trong khi giữ văn bản phiên âm. Sử dụng sau khi kiểm tra rằng bạn không cần phát lại hoặc ghi lại; việc xóa không thể tái tạo âm thanh gốc.
- Giữ: Ghi âm chỉ diễn ra khi phím tắt được giữ. Thích hợp cho việc ghi chú ngắn, thường xuyên và là chế độ an toàn nhất khi cần tránh ghi âm ngẫu nhiên từ môi trường xung quanh.
- Khóa: Nhấn một lần để bắt đầu và nhấn lại để dừng. Thích hợp cho các đoạn văn dài, sử dụng trợ năng hoặc nói rảnh tay, nhưng cần hành động dừng có chủ ý.
- Hỗn hợp / nhấn đôi: Giữ để ghi âm ngắn hoặc nhấn đôi để khóa. Đây là mặc định linh hoạt nhất cho công việc hỗn hợp. Sử dụng Giữ nếu các lần nhấn đôi ngẫu nhiên đôi khi làm ghi âm vẫn tiếp tục.
-
Gán các phím tắt riêng cho Speech to Text và Voice Command. Ưu tiên các tổ hợp phím chưa được hệ điều hành, trình điều khiển bàn phím, desktop từ xa hoặc ứng dụng mục tiêu xử lý. Các phím tắt Voice2Win trùng lặp sẽ bị từ chối.
-
Trên Windows, Voice2Win thường không thể chèn vào ứng dụng đang chạy với đặc quyền cao hơn. Chỉ chạy Voice2Win ở chế độ nâng cao khi thực sự cần nhập liệu vào các ứng dụng nâng cao; quyền truy cập đầu vào toàn cầu ở mức nâng cao sẽ tăng tác động của bất kỳ lỗi ứng dụng hoặc cấu hình nào.
-
Tắt tiếng đầu ra âm thanh toàn cầu khi nhấn phím nóng hữu ích khi sử dụng loa vì âm thanh hệ thống không thể phát ngược vào micro. Tắt tính năng này khi sử dụng tai nghe hoặc khi cần nghe cuộc họp hoặc nguồn media trong quá trình ghi âm.
-
Tín hiệu bắt đầu và dừng riêng biệt giúp trạng thái latch/hybrid rõ ràng khi chỉ báo không hiển thị. Giữ âm thanh ngắn và nhỏ khi sử dụng loa để micro không thu lại. Tăng thời lượng hoặc âm lượng để thuận tiện tiếp cận, không phải để giải quyết việc phát hiện phím tắt không đáng tin cậy.
- Ngôn ngữ giao diện chỉ thay đổi menu và nhãn; nó không chọn ngôn ngữ phiên âm.
- Chủ đề tối là một sở thích trực quan và không ảnh hưởng đến nhận dạng hay hiệu suất.
- Kiểu chỉ báo: hiển thị mức đơn giản ít gây xao nhãng nhất; dạng sóng hoặc thanh giúp đánh giá hoạt động nói dễ hơn; hiển thị kiểu phổ cho thấy chi tiết hơn nhưng nhìn sẽ bận hơn. Chọn kiểu giúp bạn xác nhận hoạt động của micro mà không che ứng dụng mục tiêu.
- Bảng màu, vị trí và kích thước: Sử dụng bảng màu độ tương phản cao và vị trí tránh xa thanh công cụ, chú thích và con trỏ văn bản. Chỉ báo lớn hơn giúp truy cập và đọc văn bản theo thời gian thực; chỉ báo nhỏ hơn sẽ tốt hơn khi chỉ trạng thái ghi âm quan trọng.
-
Tắt tự động khởi động là tốt nhất khi Voice2Win được sử dụng thỉnh thoảng. Tự động khởi động qua Registry là lựa chọn bình thường của Windows để khởi động sau khi đăng nhập. Trình lập lịch tác vụ (Task Scheduler) hữu ích khi cần thứ tự khởi động hoặc thực thi với quyền nâng cao. Trên Linux, ứng dụng sử dụng cơ chế tự động khởi động trên desktop cho mỗi người dùng.
-
Chạy với quyền nâng cao qua Task Scheduler nên để tắt trừ khi bạn cần điều khiển ứng dụng với quyền quản trị. Nâng cao quyền không phải là một tùy chọn về hiệu suất; nó thay đổi ranh giới bảo mật của việc truy cập bàn phím toàn cục.
-
Hiển thị hộp thoại xác nhận tự động khởi động hữu ích khi kiểm tra thiết lập tự động khởi động mới hoặc trên máy tính dùng chung. Chỉ tắt nó khi việc khởi động đáng tin cậy và không cần giám sát.
-
Hiển thị màn hình khởi động (splash screen) giúp khi việc khởi tạo mô hình/thời gian chạy mất thời gian đáng kể. Tắt nó để khởi động kiểu khay (tray) yên tĩnh hơn.
-
Âm báo sẵn sàng xác nhận rằng khởi động và chuẩn bị mô hình đã hoàn tất, đặc biệt khi Voice2Win khởi động ở chế độ thu nhỏ. Tắt nó trong môi trường yên tĩnh; điều chỉnh thời lượng và âm lượng chỉ đủ để dễ nhận biết.
-
Thu nhỏ khi đóng (mặc định bật) giữ các phím tắt toàn cục vẫn khả dụng sau khi đóng cửa sổ chính. Tắt nó khi nút đóng cửa sổ nên thoát ứng dụng thay vào đó.
-
Tự động kiểm tra cập nhật (mặc định bật) được khuyên dùng để sửa lỗi, tương thích mô hình/runtime, và cập nhật bảo mật. Chỉ tắt nó đối với các cài đặt đã được quản lý có chủ ý hoặc cài đặt offline, và kiểm tra thủ công thay vào đó.
-
Tắt hộp thoại thông tin hàng tuần ẩn thông báo thông tin định kỳ sau khi bạn không còn cần nó; nó không vô hiệu hóa các tin nhắn chức năng hoặc lỗi.
-
Trạng thái tự động hóa nhập liệu trên Linux là thông tin chẩn đoán. Tự động hóa nhập liệu tương thích X11 được hỗ trợ; một phiên bản thuần Wayland có thể hạn chế các phím tắt toàn cục và chèn văn bản. Nếu không khả dụng, hãy sử dụng một phiên bản X11 hoặc chế độ tương thích mà môi trường máy tính để bàn cung cấp.
-
Đường dẫn lưu trữ bản ghi âm: Chọn một thư mục cục bộ đáng tin cậy. Sử dụng một vị trí được mã hóa cho các bản ghi âm nhạy cảm và đảm bảo phần mềm sao lưu/đồng bộ không xung đột với các tệp đang được ghi. Ổ đĩa mạng chậm hoặc không liên tục có thể làm chậm các hoạt động lịch sử.
-
Xóa các bản ghi âm cũ / tuổi tối đa: Bật giữ tự động khi chính sách bảo mật hoặc việc sử dụng đĩa quan trọng. Chọn một tuổi vẫn bao phủ được khoảng thời gian bạn thực sự cần sửa lỗi và ghi lại. Các tệp WAV đã lưu thường chiếm phần lớn trong lịch sử.
-
Đường dẫn lưu trữ mô hình: Ưu tiên sử dụng SSD cục bộ nhanh với đủ dung lượng trống. Ổ đĩa có thể tháo rời và ổ đĩa mạng làm cho việc tải mô hình kém tin cậy và có thể biến một ổ đĩa bị ngắt kết nối thành mô hình dường như bị mất.
-
Sử dụng thư mục gốc dữ liệu tùy chỉnh / di chuyển tất cả dữ liệu ứng dụng: Hữu ích cho các thiết lập di động, sao lưu có kiểm soát, hoặc giữ dữ liệu lớn ngoài ổ đĩa hệ thống. Chọn một thư mục có quyền truy cập phù hợp và dung lượng trống, sau đó khởi động lại khi được yêu cầu. Điều này di chuyển dữ liệu cục bộ; nó không mã hóa hoặc tải tự động lên.
Chuyển đổi theo thời gian thực là bản xem trước trong khi bạn vẫn đang nói. Bản chuyển đổi cuối cùng thông thường vẫn là kết quả chính thức. Hãy để chế độ theo thời gian thực tắt khi bản xem trước không hữu ích: điều đó giảm thiểu việc sử dụng tài nguyên và tránh các từ sơ bộ thay đổi trên màn hình.
- Block chạy lặp lại mô hình chuyển giọng Whisper chính trên âm thanh chồng chéo. Chọn nó khi bạn muốn bản xem trước giống kết quả Whisper cuối cùng và có GPU được hỗ trợ với bộ nhớ đủ. Nó cung cấp nhiều ngữ cảnh hơn nhưng tạo ra khối lượng công việc GPU lặp lại đáng kể.
- Stream sử dụng một mô hình streaming Sherpa-ONNX riêng biệt. Chọn nó để nhận phản hồi từng phần sớm nhất hoặc khi chế độ Block không khả dụng. Bản xem trước của nó có thể thô hơn và chỉ hỗ trợ các ngôn ngữ được liệt kê trong cài đặt; bản chuyển giọng cuối cùng vẫn có thể khác.
- Chiều cao hiển thị tối đa giới hạn mức độ màn hình mà bản xem trước có thể chiếm. Tăng nó cho mục đích truy cập dài hạn; giảm khi chỉ báo che ứng dụng mục tiêu. Nó không thay đổi chất lượng nhận dạng.
Các giá trị mặc định được cân bằng và phụ thuộc lẫn nhau. Khôi phục chúng trước khi khắc phục sự cố và chỉ thay đổi một tham số mỗi lần.
-
Kích thước cửa sổ (mặc định 10 giây): Tăng khi ngữ cảnh câu không đủ hoặc các cụm từ dài thay đổi quá nhiều giữa các bản chụp. Cửa sổ lớn hơn mất nhiều thời gian hơn và sử dụng nhiều tài nguyên tính toán/bộ nhớ hơn. Giảm để cập nhật từng bản nhanh hơn trên phần cứng đủ khả năng, chấp nhận ít ngữ cảnh hơn.
-
Khoảng nhảy (mặc định 3 giây): Giảm để cập nhật xem trước thường xuyên hơn; tăng khi tải GPU quá cao. Khoảng nhảy nhỏ hơn khởi chạy nhiều lần phiên âm hơn và không làm mỗi lần chạy nhanh hơn.
-
Chồng lấn / ngữ cảnh (mặc định 20 giây): Tăng khi các từ ở ranh giới khối bị trùng, bỏ sót, hoặc ghép sai. Giảm để giảm công việc lặp lại. Quá ít chồng lấn sẽ loại bỏ bằng chứng cần thiết để đối chiếu các bản chụp liền kề.
-
Độ trễ ổn định (mặc định 6 giây): Tăng khi các từ được xác nhận quá sớm và bối cảnh sau đó sẽ sửa lỗi cho chúng. Giảm khi văn bản ổn định xuất hiện quá chậm, chấp nhận nhiều sửa đổi hơn.
-
Giới hạn thời gian im lặng (mặc định 1000 ms): Giảm khi văn bản nên ổn định nhanh chóng sau một khoảng tạm ngừng. Tăng khi những sự ngập ngừng tự nhiên làm chia nhỏ hoặc kết thúc ý nghĩ quá sớm.
-
Kiểm tra thêm ranh giới câu (mặc định 2): Chỉ tăng khi các chuyển tiếp câu liên tục sai và GPU còn dư. Mỗi lần chuyển bản ghi thêm sẽ tốn thời gian. Đặt thành 0 để tắt các lần chạy bổ sung; kiểm tra ranh giới trung tâm vẫn được giữ.
-
Hệ số dịch chuyển (mặc định 20%): Kiểm soát mức độ dịch chuyển của các cửa sổ xác minh bổ sung so với kích thước cửa sổ. Tăng giá trị này khi việc kiểm tra một khu vực rộng hơn xung quanh ranh giới có ích; giảm giá trị này khi ngữ cảnh xung quanh là đủ. Nó chỉ quan trọng khi đi kèm với các kiểm tra bổ sung.
- Thời gian chạy: CPU cung cấp khả năng tương thích rộng nhất. DirectML có thể giảm độ trễ trên các GPU Windows được hỗ trợ nhưng sử dụng tài nguyên GPU mà mô hình chính cũng có thể cần.
- Biến thể mô hình: Chọn Nhanh (Fast) để giảm độ trễ và tiết kiệm tài nguyên. Chọn Chính xác (Accurate) khi chất lượng xem trước quan trọng hơn tốc độ.
- Cửa sổ tinh chỉnh câu (1–8, mặc định 2): Giá trị 1 cho phép hoàn tất câu nhanh nhất. Giá trị lớn hơn giữ nhiều ngữ cảnh câu hơn để tinh chỉnh nhưng làm chậm quá trình hoàn tất và tăng khối lượng công việc. Mặc định là sự cân bằng thực tế.
- Mô hình đã lưu trong bộ nhớ đệm: Xóa một mô hình đã lưu trong bộ nhớ đệm không sử dụng giúp giải phóng dung lượng đĩa. Nếu kết hợp ngôn ngữ / thời gian chạy / mô hình đó được chọn sau, nó phải được tải xuống lại trước khi bản xem trước sẵn sàng.
Xem Phiên âm theo thời gian thực để biết quy trình làm việc đầy đủ và các yêu cầu về khả năng sẵn có.
- Whisper là lựa chọn chung cho việc hỗ trợ ngôn ngữ rộng và các biến thể mô hình đã được thiết lập. Parakeet có thể hấp dẫn khi các ngôn ngữ được hỗ trợ và phần cứng khả dụng phù hợp với trường hợp sử dụng của bạn. Chọn dựa trên các bản ghi âm thực tế của bạn; đánh giá sao và ước tính tốc độ chỉ mang tính hướng dẫn, không thay thế cho việc thử nghiệm micro, ngôn ngữ và từ vựng của bạn.
- Các mô hình lớn hơn hoặc chất lượng cao hơn thường cần nhiều bộ nhớ và thời gian hơn nhưng có thể cải thiện âm thanh khó. Bắt đầu với mô hình nhỏ nhất mà vẫn đủ độ chính xác đáng tin cậy. Một mô hình gây áp lực bộ nhớ hoặc hàng đợi dài có thể kém hữu ích hơn một mô hình hơi nhỏ hơn nhưng luôn hoàn thành.
-
Phân công chuyển đổi âm thanh thành văn bản và nâng cao AI một cách độc lập. GPU thường là lựa chọn tốt nhất cho công việc lặp lại tại chỗ; CPU là phương án dự phòng tương thích nhưng có thể chậm hơn nhiều. Phân chia hai nhiệm vụ này trên các thiết bị khác nhau có thể tránh tình trạng tranh chỗ bộ nhớ GPU khi cả hai cùng được sử dụng.
-
Đối với Ollama hoặc LM Studio, chọn loại máy chủ, địa chỉ, cổng và mô hình đã tải. Chỉ sử dụng khám phá trên mạng đáng tin cậy và xác minh rằng mô hình được chọn thực sự có sẵn trên máy chủ.
-
Một máy chủ AI từ xa hoặc một máy tính Voice2Win khác có thể chuyển công việc khỏi máy yếu hơn, nhưng sẽ tạo ra độ trễ mạng và gửi âm thanh hoặc văn bản của nhiệm vụ đến hệ thống đó. Chỉ sử dụng các máy chủ và mạng đáng tin cậy.
-
Chia sẻ runtime cục bộ chỉ khi một cài đặt Voice2Win đáng tin cậy khác cần nó. Sử dụng mật khẩu, cho phép cổng qua tường lửa chỉ trên cấu hình mạng dự định, và tắt chia sẻ khi không còn cần thiết. Cảnh báo phiên bản và máy khách kết nối giúp xác định các máy khách không mong muốn hoặc không tương thích.
-
Kích thước ngữ cảnh (mặc định 4096): Tăng kích thước này cho văn bản được chọn dài, hướng dẫn dài hoặc các biến đổi cần nhiều ngữ cảnh xung quanh hơn. Ngữ cảnh lớn hơn tiêu tốn nhiều bộ nhớ hơn và có thể chậm hơn. Nó không tự động cải thiện các sửa lỗi ngắn.
-
Số lượng token tối đa (mặc định 512): Tăng khi các bản viết lại dài bị cắt bớt. Giảm để giới hạn thời gian phản hồi và ngăn đầu ra dài ngoài mong đợi. Việc sửa chính tả bình thường hiếm khi cần giá trị quá lớn.
-
Nhiệt độ (mặc định 0.2): Giá trị thấp lặp lại hơn và thích hợp nhất cho sửa lỗi, định dạng và giữ nguyên nghĩa. Chỉ tăng khi viết lại một cách sáng tạo có chủ ý; giá trị cao hơn có thể thay đổi cách diễn đạt hoặc các sự kiện một cách tự do hơn.
-
Độ dài bản ghi tối thiểu để cải thiện AI (mặc định 20 ký tự): Giảm nó khi ngay cả những cụm từ rất ngắn cũng cần được xử lý. Tăng nó để tránh khởi động/muộn mô hình và một số chỉnh sửa bất ngờ cho các đầu vào nhỏ như “yes” hoặc tên.
-
Lời nhắc hệ thống: Đây là hướng dẫn cố định để cải thiện AI mặc định. Nêu ngôn ngữ mong muốn, liệu ý nghĩa và giọng điệu có cần được giữ nguyên không, và chỉ trả về văn bản cuối cùng. Thử thay đổi lời nhắc trên các văn bản không quan trọng: lời nhắc quá rộng có thể trả lời chép chính tả, dịch nó, hoặc thêm giải thích thay vì sửa.
-
Lưu trữ mô hình AI thay thế: Sử dụng ổ cứng cục bộ nhanh với dung lượng phù hợp. Sao chép các mô hình hiện có sẽ ngăn việc tải lại; chỉ thay đổi thư mục thôi sẽ không khiến mô hình bị thiếu hoặc không tương thích trở nên sử dụng được.
Xem Mô hình AI và phần cứng và Cải thiện AI.
-
Chất lượng mô hình nhận dạng người nói: Ưu tiên mô hình chất lượng cao hơn khi việc tách các giọng nói tương tự là quan trọng và máy có đủ bộ nhớ/hiệu năng. Sử dụng mô hình nhẹ hơn cho các phiên dài trên phần cứng hạn chế. Các mô hình đã tải về sẽ trở nên có thể chọn ngay lập tức.
-
Độ nhạy tách người nói: Bắt đầu với Mặc định. Tăng độ nhạy khi hai giọng nói khác nhau nhưng tương tự bị gộp lặp lại; đổi lại là giọng nói thay đổi của một người, khoảng cách, hoặc góc micro có thể bị tách thành các người nói bổ sung. Giảm độ nhạy khi một người liên tục được hiển thị như nhiều người nói; đổi lại là các giọng nói thực sự tương tự có thể bị gộp.
-
Độ nhạy nhận diện giọng nói: Tăng lên khi các cú nhấp chuột, tiếng ồn trong phòng, hoặc các đoạn im lặng bị phiên âm. Giảm xuống khi các người nói nhỏ bị bỏ sót. Cổng này quyết định xem một đoạn có được gửi để phiên âm hay không; một đoạn bị từ chối mạnh mẽ không thể được khôi phục bằng mô hình phiên âm chính xác hơn.
-
Tạm dừng hoàn tất (mặc định 10 giây, trên trang Ghi âm Cuộc trò chuyện): Sử dụng tạm dừng ngắn hơn khi các phần cần kết thúc nhanh sau khi người nói dừng. Sử dụng tạm dừng dài hơn cho các cuộc thảo luận suy ngẫm với những khoảng dừng dài; kết quả sẽ xuất hiện muộn hơn, nhưng một đóng góp ít có khả năng bị tách ra.
-
Người nói dự kiến (Mặc định là Tự động, trên trang Ghi âm Cuộc trò chuyện): Giữ Tự động khi người tham gia có thể vào hoặc rời khỏi. Đặt số lượng đã biết cho một cuộc họp cố định khi việc phân nhóm tự động tạo ra số lượng sai. Số lượng cố định sai có thể buộc các giọng nói không liên quan lại với nhau hoặc chia một giọng nói để đáp ứng số lượng yêu cầu.
Phân tách người nói là xác suất. Khoảng cách micro, sự chồng lấn, tiếng vang và tiếng ồn nền thay đổi đều quan trọng; việc chỉnh sửa người nói bằng tay vẫn có thể cần thiết. Xem Ghi âm Cuộc trò chuyện.
Phần chỉ dành cho nhà phát triển này cấu hình trình khách đồng hành trên máy tính để bàn riêng biệt, phát trực tiếp âm thanh từ micro của máy tính khác trên cùng mạng cục bộ.
-
Chỉ bật dịch vụ khi cần micro của máy khách. Chọn bộ điều hợp mạng mà máy khách có thể truy cập; VPN và bộ điều hợp ảo thường tạo địa chỉ ghép nối mà máy tính khác không thể truy cập.
-
Giữ cổng mặc định trừ khi nó xung đột với dịch vụ khác. Nếu máy khách không thể kết nối, kiểm tra bộ điều hợp đã chọn, tường lửa cục bộ và xem cả hai hệ thống có cùng mạng tin cậy hay không trước khi thay đổi các cổng ngẫu nhiên.
-
Xem URL/token ghép nối như một bí mật. Bất kỳ ai có thể truy cập dịch vụ và có token hợp lệ đều có thể cố gắng kết nối. Tạo lại hoặc phân phối lại URL sau khi thay đổi bộ điều hợp, địa chỉ, cổng hoặc token.
-
Trạng thái máy khách kết nối hiển thị những máy khách nào có sẵn và khả năng của họ. Âm thanh được truyền từ máy khách được chọn làm thiết bị ghi âm; việc chỉ kết nối một máy khách không khiến tất cả các micro đã kết nối ghi âm cùng lúc.
-
Không có trung gian đám mây. Điều này cải thiện quyền riêng tư nhưng có nghĩa là định tuyến, tường lửa, chế độ ngủ và chất lượng Wi-Fi trực tiếp ảnh hưởng đến khả năng sẵn có và độ trễ.
Xem Máy khách Companion.
- Tái hiện vấn đề trong một ứng dụng mục tiêu với nâng cấp AI và xem trước theo thời gian thực bị tắt.
- Đối với các từ sai, điều chỉnh mức/micrô tiếng ồn, chọn một ngôn ngữ cố định, và thử một mô hình chuyển văn bản khác trước khi thay đổi cài đặt chèn văn bản.
- Đối với văn bản đúng nhưng bị chèn sai, trước tiên thay đổi phương pháp chèn, sau đó là phím tắt dán, rồi chỉ tăng độ trễ phù hợp.
- Đối với giọng nói nhỏ bị mất, giảm nhạy cảm phát hiện giọng nói một chút; đối với tiếng ồn bị hiểu nhầm là giọng nói, tăng nó một chút.
- Khi tải cao, tắt chế độ theo thời gian thực hoặc tăng khoảng nhảy của nó trước khi giảm chất lượng chuyển văn bản cuối cùng.
- Khôi phục mặc định trong phần bị ảnh hưởng nếu nhiều thay đổi đã làm kết quả khó hiểu.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động