PC पर हिंदी वॉयस टाइपिंग, पूरी तरह ऑफलाइन¶
यह पृष्ठ अंग्रेज़ी संस्करण का हिंदी अनुवाद है। किसी भी अंतर की स्थिति में अंग्रेज़ी संस्करण को सही माना जाएगा।
संक्षेप में: YazSes एक मुफ़्त, ओपन-सोर्स dictation सॉफ्टवेयर है जो आपके PC पर किसी भी application में हिंदी टाइप करता है — और यह इंटरनेट से पूरी तरह कटे रहने पर भी काम करता है। आप एक key दबाकर रखते हैं, बोलते हैं, key छोड़ते हैं, और देवनागरी टेक्स्ट वहीं आ जाता है जहाँ आपका cursor है। डिफ़ॉल्ट रूप से कुछ भी upload नहीं होता, कोई account नहीं चाहिए, और कोई per-minute शुल्क नहीं है।
हिंदी वॉयस टाइपिंग के अधिकतर उपलब्ध विकल्प या तो websites हैं या Android keyboards: आप उनके text box में बोलते हैं और फिर नतीजा copy करके बाहर ले जाते हैं, और इंटरनेट जाते ही वे रुक जाते हैं। YazSes आपके अपने कंप्यूटर पर चलने वाला एक background program है, इसलिए यह सीधे Word, browser, code editor, WhatsApp Web या terminal में टाइप करता है — ट्रेन में, कमज़ोर नेटवर्क वाले इलाके में, या ऐसी मशीन पर भी जो कभी इंटरनेट से जुड़ती ही नहीं।
कौन-कौन सी भारतीय भाषाएँ समर्थित हैं¶
YazSes के साथ आने वाला speech model बहुभाषी है। नीचे दी गई हर भाषा installed model द्वारा समर्थित है और इसे dictation भाषा के रूप में सेट किया जा सकता है:
| भाषा | कोड | भाषा | कोड |
|---|---|---|---|
| हिन्दी | hi | कन्नड़ | kn |
| बांग्ला | bn | मलयालम | ml |
| तमिल | ta | पंजाबी | pa |
| तेलुगु | te | उर्दू | ur |
| मराठी | mr | असमिया | as |
| गुजराती | gu | नेपाली | ne |
| संस्कृत | sa | सिंधी | sd |
सभी भाषाओं में accuracy एक जैसी नहीं है — नीचे ईमानदार सीमाएँ देखें। हिन्दी, बांग्ला, तमिल और उर्दू के पीछे असमिया या संस्कृत की तुलना में कहीं अधिक training data है।
हिंदी के लिए सेटअप¶
सिर्फ़ दो settings मायने रखती हैं। डिफ़ॉल्ट model केवल अंग्रेज़ी के लिए है, इसलिए बहुभाषी model पर जाना ज़रूरी है:
फिर restart करें:
बस इतनी ही configuration है। पहली बार dictation करने पर model अपने आप download हो जाता है — अलग से कोई download step नहीं है, और उसके बाद इसे कभी network की ज़रूरत नहीं पड़ती।
किसी अन्य भारतीय भाषा के लिए ऊपर दी गई तालिका से language कोड बदल दें:
कौन-सा model size चुनें¶
भारतीय भाषाओं को बड़े model से अंग्रेज़ी की तुलना में कहीं ज़्यादा फ़ायदा होता है। अगर हिंदी आउटपुट मोटे तौर पर सही दिखता है पर शब्दों के अंत बार-बार बिगड़ते हैं, तो आम तौर पर कारण model का आकार होता है, आपका microphone नहीं।
| Model | भारतीय भाषाओं के लिए उपयुक्तता |
|---|---|
small.en, base.en | काम नहीं करेंगे। केवल अंग्रेज़ी, कोई language token नहीं। |
small | हिंदी के लिए शुरुआत करने लायक। छोटी भाषाओं में कमज़ोर। |
medium | भारतीय भाषाओं में स्पष्ट रूप से बेहतर। CPU साथ दे तो यही चुनें। |
large-v3 | सर्वोत्तम गुणवत्ता; CPU पर सबसे धीमा। |
देखें: performance tuning।
Hinglish — हिंदी और अंग्रेज़ी मिली-जुली बातचीत¶
हिंदी वाक्य में अंग्रेज़ी शब्द मिलाना सामान्य भारतीय बोलचाल है, और यही वह स्थिति है जहाँ अधिकतर dictation tools गड़बड़ करते हैं। YazSes में इसके लिए एक routing layer है:
यह स्पष्ट रहे कि यह क्या करता है: यह सामान्य बहुभाषी model के ऊपर दोनों भाषाओं के बीच routing करता है। यह विशेष रूप से code-switching के लिए train किया गया model नहीं है। [polyglot] adapter_path के ज़रिए एक अलग adapter दिया जा सकता है, पर वह अलग से train होता है और जब तक आप इसे सेट नहीं करते, यह खाली रहता है।
क्या देवनागरी सचमुच मेरे applications में टाइप होगी?¶
यह जायज़ सवाल है, क्योंकि हिंदी को पहचानना और हिंदी को टाइप करना दो अलग समस्याएँ हैं। YazSes को उस window में keystrokes भेजने होते हैं जो उस समय focus में है, और हर तरीक़ा ऐसे अक्षर नहीं बना सकता जो आपके भौतिक keyboard layout पर मौजूद ही नहीं हैं।
- Linux X11 पर — परखा हुआ, काम करता है।
xdotoolbackend से देवनागरी सही टाइप होती है, क्योंकि यह हर अक्षर को भौतिक key के बजाय X keysym से जोड़ता है। इसे पूरी तरह जाँचा गया है:नमस्ते हिंदीभेजा गया और target application को ठीक वही, byte-दर-byte, मिला। - किसी भी platform पर — clipboard backend बनावट से ही काम करता है। यह UTF-8 टेक्स्ट सीधे भेजता है, इसलिए script मायने ही नहीं रखती:
- Linux Wayland पर — भरोसा करने से पहले ख़ुद जाँच लें। डिफ़ॉल्ट Wayland backend
ydotoolkeyboard layout के नीचे kernel input layer पर काम करता है, और यही वह जगह है जहाँ ग़ैर-लातीनी अक्षर सबसे आसानी से छूट जाते हैं। हम इसके ज़रिए देवनागरी आउटपुट की पुष्टि नहीं कर पाए हैं। अगर आप GNOME या KDE पर Wayland इस्तेमाल कर रहे हैं, तो पहले किसी text editor में एक हिंदी वाक्य बोलकर देखें; अगर कुछ न आए तो ऊपर बताए अनुसार[injection] backendकोclipboardकर दें।
अगर टेक्स्ट पहचान तो लिया जाता है पर application में पहुँचता नहीं, तो यह injection की समस्या है, भाषा की नहीं — troubleshooting देखें।
ईमानदार सीमाएँ¶
- भरोसा करने से पहले अपनी ही आवाज़ पर परखें। Whisper की accuracy भाषा और उच्चारण के अनुसार बदलती है, और भारतीय भाषाओं में इसका प्रदर्शन अंग्रेज़ी से काफ़ी पीछे है। यह पृष्ठ बराबरी का दावा नहीं कर रहा।
- छोटी भारतीय भाषाएँ वाक़ई कमज़ोर हैं। असमिया, सिंधी, संस्कृत और नेपाली के पास हिंदी से बहुत कम training data है। बड़ा model मदद करता है, पर यह अंतर मिटाता नहीं।
- बहुभाषी models धीमे हैं अंग्रेज़ी-only models की तुलना में। साधारण CPU पर हिंदी में
medium, अंग्रेज़ी मेंbase.enसे काफ़ी धीमा रहेगा। - Wayland + देवनागरी अपुष्ट है, जैसा ऊपर बताया गया। X11 और clipboard — यही दो रास्ते हमने वास्तव में जाँचे हैं।
संबंधित पृष्ठ¶
- English version of this page — आधिकारिक संस्करण
- Multilingual dictation — code-switching, transliteration और translation विस्तार से
- Windows पर install करें · Linux · macOS
- Performance tuning — model size बनाम latency