-
Notifications
You must be signed in to change notification settings - Fork 0
Hindi AI Models and Hardware
Voice2Win तीन प्रकार के मॉडल कार्य को अलग करता है। अंतर को समझना कृत्रिम बुद्धिमत्ता (एआई) मॉडल और हार्डवेयर सेटिंग्स को बहुत आसान बनाता है।
| कार्यभार | उद्देश्य | तकनीक |
|---|---|---|
| मुख्य ट्रांसक्रिप्शन | सामान्य डिक्टेशन, वॉइस कमांड, ब्लॉक ट्रांसक्रिप्शन और रीट्रांसक्रिप्शन | व्हिस्पर या पैराकिट |
| स्ट्रीम ट्रांसक्रिप्शन | रिकॉर्डिंग के दौरान बहुत प्रारंभिक अस्थायी परिणाम | अलग शेरपा-ONNX ऑनलाइन मॉडल |
| एआई सुधार | टेक्स्ट को संशोधित या रूपांतरित करता है | बिल्ट-इन जेम्मा मॉडल, ओलामा, एलएम स्टूडियो, या साझा Voice2Win इंस्टेंस |
पैराकिट एक मुख्य ट्रांसक्रिप्शन इंजन है, स्ट्रीम मॉडल नहीं।
OpenAI Whisper कई भाषाओं में बहुत अच्छी ऑफ़लाइन पहचान प्रदान करता है। यह अधिक संसाधनों का उपयोग करता है और आम तौर पर Parakeet से धीमा होता है। बड़े मॉडल और वास्तविक समय ब्लॉक ट्रांसक्रिप्शन के लिए ग्राफिक्स-कार्ड त्वरण की सिफारिश की जाती है।
NVIDIA Parakeet V3 बहुत अधिक कुशल है और मुख्य प्रोसेसर पर अच्छा प्रदर्शन करता है। यह Whisper की तुलना में थोड़ा कम त्रुटिरहित हो सकता है और एक छोटी भाषा सेट का समर्थन करता है। इसे तब चुनें जब गति और कम संसाधन उपयोग अधिक महत्वपूर्ण हो, बजाय अधिकतम बहुभाषी कवरेज के।
AI मॉडल्स सेटिंग्स केवल चुने गए इंजन से संबंधित मॉडल दिखाती हैं। मॉडल फ़ाइलों को डाउनलोड या हटाने के लिए Manage Models का उपयोग करें। मुख्य विंडो की Current Model सूची तब डाउनलोड किए गए मॉडलों में चयन करती है।
मुख्य प्रोसेसर (CPU) / ग्राफिक्स कार्ड (GPU) और AI मॉडल असाइनमेंट तालिका ऑडियो ट्रांसक्रिप्शन और AI एन्हांसमेंट को स्वतंत्र रूप से असाइन करती है।
- मुख्य प्रोसेसर (CPU) सबसे संगत विकल्प है लेकिन यह धीमा हो सकता है।
- ग्राफिक्स कार्ड (GPU) समर्थित वर्कलोड को तेज करता है और प्रदर्शन चेतावनी दिखाता है यदि चयनित वर्कलोड धीमा होने की संभावना है या इसमें पर्याप्त ग्राफिक्स मेमोरी नहीं है।
- Ollama या LM Studio स्थानीय सर्वर से AI एन्हांसमेंट प्रदान कर सकते हैं। इसका होस्ट और पोर्ट दर्ज करें, यदि आवश्यक हो तो स्थानीय इंटरनेट प्रोटोकॉल संस्करण 4 (IPv4) नेटवर्क खोजें, मॉडल सूची को रिफ्रेश करें, और रिपोर्ट किए गए मॉडल का चयन करें।
- शेयर की गई Voice2Win इंस्टेंस ऑडियो ट्रांसक्रिप्शन, AI एन्हांसमेंट, या दोनों को किसी अन्य कंप्यूटर से प्रदान कर सकती है।
रनटाइम बदलने से प्रभावित मॉडल बैकग्राउंड में रीलोड होता है और इसमें कुछ समय लग सकता है।
- Whisper और built-in AI Enhancement Windows और Linux पर Vulkan ग्राफिक्स एस्सेलेरेशन का उपयोग करते हैं; macOS अपने नेटिव ग्राफिक्स पाथ का उपयोग करता है।
- Parakeet और Windows स्ट्रीम ट्रांसक्रिप्शन ग्राफिक्स एस्सेलेरेशन के लिए DirectML का उपयोग करते हैं।
- मुख्य प्रोसेसर बैकअप के रूप में उपलब्ध रहता है।
Voice2Win जानबूझकर CUDA रनटाइम को बंडल नहीं करता क्योंकि उनके पैकेज का आकार बड़ा होता है। Vulkan या DirectML सपोर्ट वाला वर्तमान ग्राफिक्स ड्राइवर CUDA को अलग से इंस्टॉल करने से ज्यादा महत्वपूर्ण है।
Speech और AI मॉडल एक ही समय में रेजिडेंट रह सकते हैं। उनकी संयुक्त मेमोरी आवश्यकता मायने रखती है:
- यदि समर्पित ग्राफिक्स मेमोरी अपर्याप्त है, तो छोटे या अधिक कसकर क्वांटाइज्ड मॉडल चुनें।
- एक वर्कलोड को मुख्य प्रोसेसर को सौंपें और दूसरे को ग्राफिक्स कार्ड को।
- उस मॉडल को लोड करने से बचें जिसके चेतावनी अनुमान उपलब्ध सिस्टम या ग्राफिक्स मेमोरी से अधिक हैं; भारी पेजिंग पूरे कंप्यूटर को अप्रत्याशित रूप से निष्क्रिय कर सकता है।
- जब मेमोरी के बजाय डिस्क क्षमता सीमा हो, तो वैकल्पिक एआई-मॉडल संग्रहण स्थान का उपयोग करें।
Ollama डिफ़ॉल्ट रूप से पोर्ट 11434 पर चलता है; LM Studio डिफ़ॉल्ट रूप से पोर्ट 1234 पर चलता है। Voice2Win चयनित सर्वर की मॉडल सूची पूछता है और केवल उस कॉन्फ़िगर किए गए सर्वर को संवर्धन प्रॉम्प्ट भेजता है। सर्वर की उपलब्धता, गोपनीयता, और मॉडल व्यवहार उस सर्वर स्थापना की जिम्मेदारी है।
एक Voice2Win कंप्यूटर अपने वर्तमान में लोड किए गए स्पीच और AI मॉडल को अन्य Voice2Win इंस्टेंस के लिए एक्सपोज़ कर सकता है:
- Settings → AI Models में जाएँ और रनटाइम शेयरिंग सक्षम करें।
- एक पोर्ट चुनें और वैकल्पिक रूप से पासवर्ड सेट करें।
- दूसरे कंप्यूटर पर, एक साझा Voice2Win इंस्टेंस जोड़ें, इसका कंप्यूटर नाम या IPv4 पता, पोर्ट, और पासवर्ड दर्ज करें, या स्थानीय नेटवर्क में खोजें।
- रिमोट रो को ऑडियो ट्रांसक्रिप्शन और/या AI एन्हांसमेंट असाइन करें।
कनेक्टेड क्लाइंट और अंतिम उपयोग की जानकारी साझा करने वाले कंप्यूटर पर दिखाई जाती है। संस्करणों को संतुलित रखें; संस्करण असंगति संगतता समस्याएं पैदा कर सकती है। एक इंस्टेंस जो स्वयं साझा किए गए रनटाइम का उपयोग कर रहा है, वह उस रनटाइम को आगे साझा नहीं कर सकता।
यह फ़ीचर कॉन्फ़िगर किए गए नेटवर्क कनेक्शन के माध्यम से वर्कलोड डेटा भेजता है। जब अन्य उपयोगकर्ता पोर्ट तक पहुँच सकते हों तो विश्वासपूर्ण नेटवर्क और पासवर्ड का उपयोग करें।
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động