अक्सर पूछे जाने वाले प्रश्न (अंग्रेजी) 3.8.’2025 रविवार

1. प्रश्न: SL5 ऑरा क्या है? उत्तर: यह एक सिस्टम-व्यापी, ऑफ़लाइन वाक्-से-पाठ कार्यक्रम है। यह आपको इंटरनेट कनेक्शन की आवश्यकता के बिना अपने कंप्यूटर (विंडोज, मैकओएस, लिनक्स) पर किसी भी एप्लिकेशन को निर्देशित करने की अनुमति देता है।

2. प्रश्न: मुझे इसका उपयोग क्यों करना चाहिए? इसे क्या खास बनाता है? उ: गोपनीयता। आपका ध्वनि डेटा आपकी स्थानीय मशीन पर 100% संसाधित होता है और कभी भी क्लाउड पर नहीं भेजा जाता है। यह इसे पूरी तरह से निजी और जीडीपीआर के अनुरूप बनाता है।

3. प्रश्न: क्या यह मुफ़्त है? उत्तर: हां, सामुदायिक संस्करण पूरी तरह से मुफ़्त और खुला स्रोत है। आप हमारे GitHub: https://github.com/sl5net/Vosk-System-Listener पर कोड और इंस्टॉलर पा सकते हैं

4. प्रश्न: मुझे इसका उपयोग करने के लिए क्या चाहिए? A: एक कंप्यूटर और एक माइक्रोफ़ोन। सर्वोत्तम सटीकता के लिए, हम अंतर्निर्मित लैपटॉप माइक के स्थान पर एक समर्पित हेडसेट माइक्रोफ़ोन की दृढ़ता से अनुशंसा करते हैं।

5. प्रश्न: सटीकता सही नहीं है. मैं इसे कैसे सुधार सकता हूँ? उत्तर: लगातार मात्रा और गति से स्पष्ट रूप से बोलने का प्रयास करें। पृष्ठभूमि शोर को कम करना और बेहतर माइक्रोफ़ोन का उपयोग करना सबसे बड़ा अंतर लाता है। सॉफ़्टवेयर अनुकूलन (उन्नत पावर): अगले स्तर की सटीकता के लिए, SL5 ऑरा फ़ज़ीमैप्स नामक एक शक्तिशाली सुविधा का उपयोग करता है। इन्हें अपना व्यक्तिगत, बुद्धिमान शब्दकोश समझें। आप सामान्य, आवर्ती पहचान त्रुटियों को ठीक करने के लिए नियमों के साथ सरल टेक्स्ट फ़ाइलें बना सकते हैं।

उदाहरण: यदि सॉफ़्टवेयर अक्सर “GitHub” के बजाय “गेट हैप” सुनता है, तो आप एक नियम जोड़ सकते हैं जो इसे हर बार स्वचालित रूप से ठीक कर देता है।

लाभ: यह आपको सॉफ़्टवेयर को अपने विशिष्ट तकनीकी शब्दजाल, उत्पाद के नाम, संक्षिप्ताक्षरों को “सिखाने” या यहां तक कि अद्वितीय शब्दावली के लिए नियम-सेट बनाने की अनुमति देता है। इन मानचित्रों को अनुकूलित करके, आप अपने विशिष्ट उपयोग के मामले के लिए सटीकता में उल्लेखनीय सुधार कर सकते हैं।


भाग 1: सामान्य प्रश्न

प्रश्न: SL5 ऑरो क्या है? उत्तर: SL5 ऑरो एक सिस्टम-व्यापी, ऑफ़लाइन स्पीच-टू-टेक्स्ट प्रोग्राम है। यह आपको इंटरनेट कनेक्शन की आवश्यकता के बिना अपने कंप्यूटर पर किसी भी एप्लिकेशन (उदाहरण के लिए, आपका ईमेल क्लाइंट, एक वर्ड प्रोसेसर, एक कोड संपादक) में टेक्स्ट निर्देशित करने की अनुमति देता है।

प्रश्न: “ऑफ़लाइन” का क्या अर्थ है और यह महत्वपूर्ण क्यों है? उ: “ऑफ़लाइन” का अर्थ है कि सभी वॉयस प्रोसेसिंग सीधे आपके कंप्यूटर पर होती है। आपका ध्वनि डेटा कभी क्लाउड सर्वर (जैसे Google, Amazon, या OpenAI) पर नहीं भेजा जाता है। यह अधिकतम गोपनीयता और सुरक्षा प्रदान करता है, जो इसे गोपनीय जानकारी (उदाहरण के लिए, वकीलों, डॉक्टरों, पत्रकारों के लिए) के लिए आदर्श बनाता है और जीडीपीआर जैसे डेटा सुरक्षा नियमों का पूरी तरह से अनुपालन करता है।

प्रश्न: क्या यह सचमुच मुफ़्त है? क्या चालबाजी है? उत्तर: “सामुदायिक संस्करण” 100% मुफ़्त और खुला-स्रोत है। कोई पकड़ नहीं है. हम ओपन-सोर्स टूल की शक्ति में विश्वास करते हैं। यदि आपको सॉफ़्टवेयर मूल्यवान लगता है और आप इसके निरंतर विकास का समर्थन करना चाहते हैं, तो आप हमारे Ko-fi page के माध्यम से ऐसा कर सकते हैं।

प्रश्न: यह सॉफ्टवेयर किसके लिए है? उ: यह उन लोगों के लिए है जो बहुत लिखते हैं और अपनी दक्षता बढ़ाना चाहते हैं: लेखक, छात्र, प्रोग्रामर, कानूनी और चिकित्सा पेशेवर, शारीरिक सीमाओं वाले लोग, या कोई भी जो टाइपिंग के बजाय बोलना पसंद करते हैं।

भाग 2: स्थापना एवं सेटअप

प्रश्न: कौन से ऑपरेटिंग सिस्टम समर्थित हैं? उ: सॉफ़्टवेयर का परीक्षण किया गया है और पुष्टि की गई है कि यह विंडोज़ 11, मंज़रो लिनक्स, और उबंटू और मैकओएस पर काम करता है।

प्रश्न: मैं इसे विंडोज़ पर कैसे स्थापित करूं? उत्तर: हम एक सरल वन-क्लिक इंस्टॉलर प्रदान करते हैं। यह एक .Bat स्क्रिप्ट है जिसके लिए वातावरण स्थापित करने और आवश्यक मॉडल डाउनलोड करने के लिए प्रशासनिक अधिकारों की आवश्यकता होती है। एक बार चलाने के बाद, यह आपके लिए सब कुछ संभाल लेगा।

प्रश्न: मॉडलों का डाउनलोड बहुत बड़ा है। क्यों? उ: वाक् पहचान मॉडल ही सॉफ़्टवेयर को ऑफ़लाइन काम करने की अनुमति देते हैं। इनमें आपकी भाषा को समझने के लिए एआई के लिए सभी आवश्यक डेटा शामिल हैं। बड़े, अधिक सटीक मॉडल आकार में कई गीगाबाइट हो सकते हैं। विश्वसनीय डाउनलोड सुनिश्चित करने के लिए हमारा नया डाउनलोडर इन्हें छोटे, सत्यापन योग्य हिस्सों में विभाजित करता है।

प्रश्न: मैं लिनक्स पर हूं। प्रक्रिया क्या है? उ: लिनक्स पर, आप आमतौर पर GitHub से रिपॉजिटरी को क्लोन करेंगे और एक सेटअप स्क्रिप्ट चलाएंगे। यह स्क्रिप्ट एक पायथन वर्चुअल वातावरण बनाती है, निर्भरताएँ स्थापित करती है, और श्रुतलेख सेवा शुरू करती है।

प्र: जब मैं विंडोज़ पर .py फ़ाइल पर डबल-क्लिक करता हूं, तो यह एक टेक्स्ट एडिटर में खुलती है। मैं इसे कैसे चलाऊं? उ: यह एक सामान्य विंडोज़ समस्या है जहां .py फ़ाइलें पायथन दुभाषिया से संबद्ध नहीं हैं। आपको अलग-अलग पायथन स्क्रिप्ट को सीधे नहीं चलाना चाहिए। हमेशा प्रदान की गई मुख्य स्टार्टअप स्क्रिप्ट का उपयोग करें (उदाहरण के लिए, एक .bat फ़ाइल), क्योंकि यह सुनिश्चित करता है कि सही वातावरण पहले सक्रिय हो।

भाग 3: उपयोग एवं विशेषताएँ

प्रश्न: मैं वास्तव में आदेश देने के लिए इसका उपयोग कैसे करूं? उ: सबसे पहले, आप उपयुक्त स्क्रिप्ट चलाकर “डिक्टेशन सेवा” शुरू करें। यह बैकग्राउंड में चलेगा. फिर, आप रिकॉर्डिंग शुरू करने और बंद करने के लिए एक ट्रिगर (जैसे हॉटकी या समर्पित स्क्रिप्ट) का उपयोग करते हैं। इसके बाद मान्यता प्राप्त पाठ वर्तमान में सक्रिय किसी भी विंडो में स्वचालित रूप से टाइप हो जाएगा।

प्रश्न: मैं सटीकता कैसे सुधारूं? उ: 1. एक अच्छे माइक्रोफोन का उपयोग करें: एक हेडसेट माइक्रोफोन लैपटॉप के अंतर्निर्मित माइक से कहीं बेहतर है। 2. पृष्ठभूमि शोर को कम करें: एक शांत वातावरण महत्वपूर्ण है। 3. स्पष्ट रूप से बोलें: लगातार गति और मात्रा में बोलें। बड़बड़ाओ मत या जल्दी मत करो. सॉफ़्टवेयर अनुकूलन (उन्नत पावर): अगले स्तर की सटीकता के लिए, SL5 ऑरो फ़ज़ीमैप्स नामक एक शक्तिशाली सुविधा का उपयोग करता है। इन्हें अपना व्यक्तिगत, बुद्धिमान शब्दकोश समझें। आप सामान्य, आवर्ती पहचान त्रुटियों को ठीक करने के लिए नियमों के साथ सरल टेक्स्ट फ़ाइलें बना सकते हैं।

उदाहरण: यदि सॉफ़्टवेयर अक्सर “GitHub” के बजाय “गेट हैप” सुनता है, तो आप एक नियम जोड़ सकते हैं जो इसे हर बार स्वचालित रूप से ठीक कर देता है।

लाभ: यह आपको सॉफ़्टवेयर को अपने विशिष्ट तकनीकी शब्दजाल, उत्पाद के नाम, संक्षिप्ताक्षरों को “सिखाने” या यहां तक कि अद्वितीय शब्दावली के लिए नियम-सेट बनाने की अनुमति देता है। इन मानचित्रों को अनुकूलित करके, आप अपने विशिष्ट उपयोग के मामले के लिए सटीकता में उल्लेखनीय सुधार कर सकते हैं।

प्रश्न: क्या मैं भाषाएँ बदल सकता हूँ? उत्तर: हाँ. सिस्टम कॉन्फ़िगरेशन फ़ाइलों की लाइव “हॉट-रीलोडिंग” का समर्थन करता है। आप कॉन्फ़िगरेशन में भाषा मॉडल बदल सकते हैं, और सेवा पुनरारंभ की आवश्यकता के बिना तुरंत उस पर स्विच हो जाएगी।

प्रश्न: “भाषा उपकरण” क्या है? उत्तर: लैंग्वेजटूल एक ओपन-सोर्स व्याकरण और स्टाइल चेकर है जिसे हमने एकीकृत किया है। आपके भाषण को पाठ में बदलने के बाद, लैंग्वेजटूल स्वचालित रूप से सामान्य प्रतिलेखन त्रुटियों (उदाहरण के लिए, “दाएं” बनाम “लिखें”) को ठीक करता है और विराम चिह्न को ठीक करता है, जिससे अंतिम आउटपुट में काफी सुधार होता है।

भाग 4: समस्या निवारण और सहायता

प्रश्न: मैंने सेवा शुरू कर दी है, लेकिन जब मैं आदेश देने की कोशिश करता हूं तो कुछ नहीं होता। उत्तर: निम्नलिखित की जाँच करें:

  1. क्या सेवा अभी भी आपके टर्मिनल/कंसोल में चल रही है? किसी भी त्रुटि संदेश की तलाश करें.

  2. क्या आपका माइक्रोफ़ोन आपके ऑपरेटिंग सिस्टम में डिफ़ॉल्ट इनपुट डिवाइस के रूप में सही ढंग से चुना गया है?

  3. क्या माइक्रोफ़ोन म्यूट है या वॉल्यूम बहुत कम सेट है?

प्रश्न: मुझे एक बग मिला है या मेरे पास किसी नई सुविधा का विचार है। मुझे क्या करना चाहिए? उ: यह बहुत बढ़िया है! बग की रिपोर्ट करने या सुविधाओं का सुझाव देने के लिए सबसे अच्छी जगह हमारे GitHub repository पर एक “समस्या” खोलना है।

5. प्रश्न: सटीकता सही नहीं है. मैं इसे कैसे सुधार सकता हूँ? उ: सटीकता आपके सेटअप और सॉफ़्टवेयर अनुकूलन दोनों पर निर्भर करती है।

  • आपका सेटअप (मूल बातें): लगातार मात्रा और गति से स्पष्ट रूप से बोलने का प्रयास करें। बैकग्राउंड शोर को कम करने और लैपटॉप के बिल्ट-इन माइक के बजाय एक अच्छे हेडसेट माइक्रोफोन का उपयोग करने से बहुत फर्क पड़ता है।

  • सॉफ़्टवेयर अनुकूलन (उन्नत पावर): अगले स्तर की सटीकता के लिए, SL5 ऑरो फ़ज़ीमैप्स नामक एक शक्तिशाली सुविधा का उपयोग करता है। इन्हें अपना व्यक्तिगत, बुद्धिमान शब्दकोश समझें। आप सामान्य, आवर्ती पहचान त्रुटियों को ठीक करने के लिए नियमों के साथ सरल टेक्स्ट फ़ाइलें बना सकते हैं।

  • उदाहरण: यदि सॉफ़्टवेयर अक्सर “गिटहब” के बजाय “गेट हैप” सुनता है, तो आप एक नियम जोड़ सकते हैं जो इसे हर बार स्वचालित रूप से ठीक कर देता है।

  • लाभ: यह आपको सॉफ़्टवेयर को अपने विशिष्ट तकनीकी शब्दजाल, उत्पाद के नाम, संक्षिप्ताक्षरों को “सिखाने” या यहां तक कि अद्वितीय शब्दावली के लिए नियम-सेट बनाने की अनुमति देता है। इन मानचित्रों को अनुकूलित करके, आप अपने विशिष्ट उपयोग के मामले के लिए सटीकता में उल्लेखनीय सुधार कर सकते हैं।

आर्किटेक्चरल डीप डाइव: निरंतर “वॉकी-टॉकी” शैली रिकॉर्डिंग प्राप्त करना

हमारी श्रुतलेख सेवा वॉकी-टॉकी का उपयोग करने के समान एक निर्बाध, निरंतर रिकॉर्डिंग अनुभव प्रदान करने के लिए एक मजबूत, राज्य-संचालित वास्तुकला लागू करती है। सिस्टम ऑडियो कैप्चर करने के लिए हमेशा तैयार रहता है, लेकिन इसे केवल तभी संसाधित करता है जब स्पष्ट रूप से ट्रिगर किया जाता है, जिससे उच्च प्रतिक्रिया और कम संसाधन उपयोग सुनिश्चित होता है।

यह प्रसंस्करण थ्रेड से ऑडियो श्रवण लूप को अलग करके और दो प्रमुख घटकों के साथ सिस्टम स्थिति को प्रबंधित करके प्राप्त किया जाता है: एक active_session ईवेंट फ़्लैग और OS-स्तरीय माइक्रोफ़ोन नियंत्रण के लिए हमारा audio_manager

राज्य मशीन तर्क:

सिस्टम एक सतत लूप में संचालित होता है, जिसे एक हॉटकी द्वारा प्रबंधित किया जाता है जो दो प्राथमिक स्थितियों के बीच टॉगल करता है:

  1. सुनने की स्थिति (डिफ़ॉल्ट/तैयार):

  • शर्त: सक्रिय_सत्र ध्वज गलत है।

  • माइक स्थिति: माइक्रोफ़ोन को *अनम्यूट माइक्रोफ़ोन() के लिए म्यूट किया गया है। वोस्क श्रोता सक्रिय है और ऑडियो इनपुट की प्रतीक्षा कर रहा है।

  • कार्रवाई: जब उपयोगकर्ता हॉटकी दबाता है, तो स्थिति परिवर्तित हो जाती है। active_session ध्वज को True पर सेट किया गया है, जो “वास्तविक” श्रुतलेख की शुरुआत का संकेत देता है।

  1. प्रसंस्करण स्थिति (उपयोगकर्ता ने बोलना समाप्त कर दिया है):

  • शर्त: उपयोगकर्ता हॉटकी दबाता है जबकि active_session ध्वज True है।

  • माइक स्थिति: पहली कार्रवाई mute_microphone() के माध्यम से माइक्रोफ़ोन को तुरंत म्यूट करना है। यह वोस्क इंजन में ऑडियो स्ट्रीम को तुरंत रोक देता है।

  • कार्रवाई:

  • सक्रिय_सत्र ध्वज गलत पर सेट है। *अंतिम मान्यता प्राप्त ऑडियो खंड वोस्क से प्राप्त किया गया है।

  • प्रोसेसिंग थ्रेड इस अंतिम पाठ के साथ लॉन्च किया गया है।

  • महत्वपूर्ण रूप से, अंततः ब्लॉक के भीतर, प्रोसेसिंग थ्रेड पूरा होने पर unmute_microphone() निष्पादित करता है।

अनम्यूट सिग्नल का “जादू”:

अंतहीन लूप की कुंजी अंतिम unmute_microphone() कॉल है। जैसे ही श्रुतलेख का प्रसंस्करण समाप्त हो जाता है और माइक्रोफ़ोन अनम्यूट हो जाता है, सिस्टम स्वचालित रूप से और तुरंत सुनने स्थिति में वापस आ जाता है। वोस्क श्रोता, जो धैर्यपूर्वक प्रतीक्षा कर रहा था, तुरंत फिर से ऑडियो प्राप्त करना शुरू कर देता है, जो श्रुतलेख ‘बी’ को पकड़ने के लिए तैयार है।

यह एक अत्यधिक प्रतिक्रियाशील चक्र बनाता है: दबाएँ -> बोलें -> दबाएँ -> (म्यूट करें और प्रोसेस करें) -> (अनम्यूट करें और सुनें)

यह आर्किटेक्चर सुनिश्चित करता है कि माइक्रोफ़ोन केवल टेक्स्ट प्रोसेसिंग की संक्षिप्त अवधि के लिए ही म्यूट किया जाता है, जिससे सिस्टम मजबूत नियंत्रण बनाए रखते हुए उपयोगकर्ता को तात्कालिक महसूस कराता है और अचानक होने वाली रिकॉर्डिंग को रोकता है।