वर्तमान लेख में, हम आपको दिखाते हैं कि आप नियमित अभिव्यक्तियों का उपयोग करके स्वचालित दस्तावेज़ प्रसंस्करण के लाभों का आनंद कैसे ले सकते हैं। यह विशेष रूप से किसी भी उद्योग में कंपनियों के दस्तावेज़ों पर लागू होता है।
हम आपको नियमित अभिव्यक्तियों के सटीक उदाहरण दिखाते हैं और चरण-दर-चरण समझाते हैं कि उनका क्या अर्थ है और आप उनका उपयोग कैसे कर सकते हैं।
इस प्रकार, आप अपनी संचालन दक्षता बढ़ा सकते हैं, उच्च सटीकता के माध्यम से मानवीय त्रुटियों को कम कर सकते हैं, अपने वर्तमान खर्चों को कम कर सकते हैं, डेटा अखंडता बनाए रख सकते हैं और डेटा सुरक्षा में सुधार कर सकते हैं।
वर्तमान लेख बुद्धिमान दस्तावेज़ प्रसंस्करण के बारे में पहले भाग का विस्तार करता है,यहाँ आपको सीधे लेख पर ले जाता है.
दस्तावेज़ों से विशिष्ट डेटा तत्वों को निकालना एक अत्यंत महंगा और समय लेने वाला कार्य हो सकता है। अक्सर, दस्तावेज़ों की स्कैन कॉपीं बड़े आउटसोर्सिंग डेटा एंट्री कंपनियों को भेजी जाती हैं, जहाँ डेटा को हाथ से दर्ज किया जाता है।
हालाँकि, इस दृष्टिकोण के कई नुकसान हैं, जैसे कि:
- इससे दस्तावेज़ सुरक्षा खतरे में पड़ सकती है
- कार्यप्रवाह प्रक्रियाओं में विलंबता आती है
- स्वचालित निष्कर्षण की तुलना में, मैन्युअल इंडेक्सिंग एक धीमी प्रक्रिया है
- बड़े परियोजनाओं पर मैन्युअल इंडेक्सिंग अच्छी तरह स्केल नहीं होती
- मैन्युअल इंडेक्सिंग डेटा में त्रुटियाँ ला सकता है
- यदि दस्तावेज़ बदला जाता है, तो पूरी प्रक्रिया फिर से शुरू हो जाती है
और भी बहुत कुछ।
स्कैनिंग के प्रसार के बावजूद, व्यापारिक लेनदेन का एक बड़ा हिस्सा अभी भी कागजी दस्तावेजों पर आधारित है। अनुमान है कि 85% चालान अभी भी कागज पर जारी किए जाते हैं।
इसके अलावा, मौजूद कागज के पहाड़ हैं जिन्हें विशाल गोदामों में संग्रहीत करना है!
नियमित अभिव्यक्ति (Regular Expression) क्या है?
नियमित अभिव्यक्तियाँ, जिन्हें "REGEX" भी कहा जाता है, पाठ को खोजने और संशोधित करने के लिए एक शक्तिशाली उपकरण हैं। वे पाठ में जटिल पैटर्न को पहचानने और संपादित करने की सुविधा प्रदान करते हैं।
एक नियमित अभिव्यक्ति सामान्य अक्षरों और विशेष मेटा-अक्षरों के संयोजन से बनी होती है, जिनके विशेष कार्य होते हैं।
नियमित अभिव्यक्तियों का उपयोग पाठ को बदलने या संशोधित करने के लिए भी किया जा सकता है। उदाहरण के लिए, एक नियमित अभिव्यक्ति का उपयोग किया जा सकता है।
वे शब्द प्रसंस्करण और कार्य स्वचालन के लिए एक बहुत ही शक्तिशाली उपकरण हैं।
नियमित अभिव्यक्तियाँ व्यवसाय को कैसे स्वचालित करने में मदद कर सकती हैं?
विभिन्न प्रकारों, विभिन्न नामकरण नियमों और पर्याप्त खोज प्रणाली के बिना डिजिटल दस्तावेजों में वृद्धि से खोज प्रक्रिया और विशिष्ट सामग्री से दस्तावेज़ जानकारी निकालने की प्रक्रिया जटिल हो जाती है, विशेष रूप से जब वर्गीकृत नहीं किए गए दस्तावेज़ों की बात आती है, तो खोज असटीक हो जाती है और इसमें अधिक समय लगता है।
नियमित अभिव्यक्तियाँ (regex) दस्तावेजों में विशिष्ट डेटा खोजने, निकालने और बदलने के लिए एक तेज़ और शक्तिशाली तरीका प्रदान करती हैं। नियमित अभिव्यक्तियाँ मूल रूप से एक खोज पैटर्न का वर्णन करने के लिए उपयोग की जाने वाली एक विशेष पाठ स्ट्रिंग होती हैं।
यह बताया गया है कि एक निर्दिष्ट वर्णमाला के लिए दस्तावेज़ सामग्री को कैसे खोजा और पढ़ा जाता है। नियमित अभिव्यक्तियाँ (Regular expressions) विशेष प्रतीकों का उपयोग करके जानकारी में पैटर्न परिभाषित करने का एक तरीका हैं।
रेगेक्स विधि उन दस्तावेज़ों के लिए सबसे उपयुक्त है जिनमें पढ़े जाने वाले मानों की स्थितियाँ बदल सकती हैं और साधारण दस्तावेज़ टेम्पलेट काम नहीं कर सकते।
आप हमारी कॉमडेस्क (ComDesk).

नियमित अभिव्यक्तियों को कैसे बनाएं?
नियमित अभिव्यक्तियाँ इस बात पर निर्भर करती हैं कि किस प्रकार का पैटर्न खोजा जा रहा है, अलग-अलग तरीकों से संयोजित की जा सकती हैं।
विशिष्ट प्रकार के वर्णों या पैटर्न को दर्शाने के लिए., *, +, ?, ^, $, [], और [a-z] जैसे मेटा-वर्णों का उपयोग करें।
वैकल्पिक भागों का उपयोग करें: पैटर्न के कुछ भागों को वैकल्पिक बनाने के लिए प्रश्नचिह्न (?) या तारांकन (*) का उपयोग करें।
समूहों का उपयोग करें: पैटर्न के कुछ भागों को समूहीकृत करने और उन्हें एक इकाई के रूप में मानने के लिए कोष्ठक () का उपयोग करें।
यह ध्यान रखना महत्वपूर्ण है कि नियमित अभिव्यक्ति के नियम प्रोग्रामिंग भाषा के अनुसार भिन्न हो सकते हैं। इसलिए उपयोग किए जाने वाले उपकरणों की दस्तावेज़ीकरण को पढ़ना महत्वपूर्ण है। PaperOffice के लिए लिखी गई RegEx ECMAScript और PCRE2 के साथ संगत होनी चाहिए।
सुझाव
"ऑटोमेटेड डॉक्यूमेंट स्टोरेज पार्ट 3 / रेगेक्स & वैरिएबल्स / इनवॉइस प्रोसेसिंग डॉक्यूमेंट मैनेजमेंट" विषय पर YouTube पर एक वीडियो भी उपलब्ध है, जो इस प्रक्रिया को आसानी से और स्पष्ट रूप से समझाता है:
मैं अपने दस्तावेज़ से REGEX का उपयोग करके जानकारी कैसे निकालूं?
व्यावहारिक उदाहरण
वर्तमान लेख में, हम दिखाते हैं कि PaperOffice में मल्टी-एलिमेंट रेगुलर एक्सप्रेशन के माध्यम से आप दस्तावेज़ से कोई भी डेटा कैसे निकाल सकते हैं और इसे स्वचालित रूप से दस्तावेज़ के लिए एक कीवर्ड के रूप में कैसे संग्रहीत कर सकते हैं।
हमने नीचे एक नमूना दस्तावेज़ बनाया है जिसमें एक विशिष्ट तिथि है। यह दस्तावेज़ एक चालान (invoice) है। हमारे दस्तावेज़ पर तिथि पैटर्न इस प्रकार फॉर्मेट किया गया है:

महीना, अक्षरों से बना, लेकिन पहला अक्षर हमेशा कैपिटल होता है, उसके बाद एक स्पेस, फिर दिन जिसके बाद एक कॉमा आता है, एक और स्पेस, और फिर वर्ष।
उदाहरण के लिए: 20 सितंबर 2019 या 5 मार्च 2022
इस तिथि को निकालने के लिए हम निम्नलिखित रेगुलर एक्सप्रेशन (REGEX) का उपयोग कर सकते हैं:
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})
आइए इस अभिव्यक्ति को व्यक्तिगत समूहों में तोड़ें। ये समूह सिंगल ब्रैकेट द्वारा अलग किए गए हैं ().
पहले समूह में हम 3 महीने के अक्षर खोजते हैं: ([A-Z][a-z]{2})
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
महीना निकालें
- [A-Z] इसका अर्थ है कि हम A-Z से एक कैपिटल अक्षर खोज रहे हैं। उदाहरण के लिए, "S" का Sept से। यह ध्यान देने योग्य है कि अपरकेस और लोअरकेस अक्षरों को अलग-अलग माना जाता है।
- [a-z]{2} इसका अर्थ है कि हम a-z से दो लोअरकेस अक्षर खोज रहे हैं। वह होगा ep "Sep" से।
फिर हम निम्नलिखित स्ट्रिंग के साथ एक स्पेस खोजते हैं: \s
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
दिनांक निकालें
दूसरे समूह में दिनों के संख्यात्मक निर्देशन खोजें: (0[1-9]|[12][0-9]|3[01])
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
दिन को तीन अलग-अलग कथनों द्वारा अलग किया जाना चाहिए।
चूंकि हमें यह नहीं पता कि दस्तावेज़ में क्या तिथि आ सकती है, यह पहला दिन (01) या अंतिम दिन (31) माह का हो सकता है, इसलिए आपको विभिन्न विकल्पों के अनुसार नाम दिए जाने चाहिए।
ये अक्षर "|".
उदाहरण: (1|2|3) = 1 या 2 या 3।
वर्ग ब्रैकेट में अनुमत अक्षरों की सूची आती है। एकाधिक वर्ग ब्रैकेट एकाधिक अक्षरों से मेल खाते हैं। यदि एक अभिव्यक्ति को कई अक्षरों का वर्णन करना है, तो उन्हें बस एक के बाद एक जोड़ दिया जाता है। फिर इनपुट को बाएं से दाएं आपकी अभिव्यक्ति से तुलना किया जाता है।
बेशक, सभी संख्याओं की सूची बनाने की आवश्यकता नहीं है। हालांकि, समग्र रूप से, ब्रैकेट वाला पूरा अभिव्यक्ति केवल एक अक्षर के लिए खड़ा होती है।
-
0[1-9]यह स्ट्रिंग इस बात का संकेत देती है कि संख्या "0" से शुरू हो सकती है, जिसके बाद 1 से 9 तक की कोई संख्या आती है। इसलिए हमें 01 - 09 तक कोई भी संख्या मिलती है।
स्ट्रिंग एक ऐसी संख्या पैटर्न को खोजती है जो शून्य से शुरू होती है। यदि आपके दस्तावेज़ में सामान्यतः तिथि "5 मार्च 2022" होती है, अर्थात संख्या "5" के आगे "0" नहीं होता, तो स्ट्रिंग में "0" को छोड़ दिया जाता है।
- [12][0-9]इस वर्ण श्रृंखला का अर्थ है कि संख्या '1' या '2' से शुरू हो सकती है, जिसके बाद 0 से 9 तक कोई भी संख्या आ सकती है। परिणाम 10 से 29 तक कोई भी संख्या हो सकता है।
- 3[01]यह स्ट्रिंग इस बात को दर्शाती है कि एक संख्या '3' से शुरू हो सकती है, जिसके बाद '0' या '1' आता है। परिणाम 30 या 31 हो सकता है।
दिन के विकल्पों को परिभाषित करने के बाद, वर्ष के लिए अभिव्यक्ति निर्धारित की जानी चाहिए।
अब हम अल्पविराम और स्थान खोजते हैं: ,\s
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})
वर्ष निकालें
अंतिम समूह में हम वर्ष खोजते हैं: (20\d{2})
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})
हम किसी भी वर्ष को खोजना शुरू करते हैं, लेकिन जानते हैं कि यह ≥ 2000 होगा।
- 20यह स्ट्रिंग इस बात को दर्शाती है कि हम बिल्कुल 20 से शुरू होने वाले किसी भी वर्ष की तलाश में हैं।
- \d{2}यह स्ट्रिंग इस बात को दर्शाती है कि हम एक संभावित दो-अंकीय संख्या, अर्थात '00' से '99' तक की तलाश में हैं।
उदाहरण के लिए, वर्ण\d0 और 9 के बीच एक अंक से मेल खाता है, जबकि वर्ण \d{2} एक दो-अंकीय संख्या से मेल खाता है।

यदि नियमित अभिव्यक्ति को PaperOffice में उपयोग किया जाता है, तो अंतिम परिणाम तिथि होती है"Sep 20, 2019".
इस प्रकार, किसी भी तिथि को दस्तावेज़ से पढ़ा जा सकता है बिना हमें मूल मान के पता चले। इन समूहों का उपयोग कहीं और भी किया जा सकता है और अन्य तिथि प्रारूपों को पढ़ने के लिए स्वतंत्र रूप से स्थानांतरित किया जा सकता है।
यहाँ एक और उदाहरण है:

तारीख दिन से शुरू होती है, जिसके बाद अक्षरों से बना महीना आता है, लेकिन पहला अक्षर हमेशा बड़ा होता है, उसके बाद एक बिंदु, एक और स्पेस, और फिर वर्ष आता है।
इस तारीख को निकालने के लिए, वर्णित नियमित अभिव्यक्ति (REGEX) का उपयोग किया जा सकता है, एक अतिरिक्त पूर्णता के साथ, क्योंकि दूसरे उदाहरण में महीने के बाद 'बिंदु' दिया गया है।
इसे निम्नलिखित वर्ण स्ट्रिंग के साथ निर्दिष्ट किया जा सकता है: \.
तो पूर्ण अभिव्यक्ति इस प्रकार दिखती है:
(0[1-9]|[12][0-9]|3[01])\s([A-Z][a-z]{2})\.\s(20\d{2})
आप हमेशा अपनी बनाई गई regex को सत्यापित कर सकते हैं, https://regex101.com पेज पर जाकर इसे अपने इनसर्ट टेक्स्ट के साथ सत्यापित करें। Regex101 न केवल यह जांचेगा कि आपकी regex सही है, बल्कि आपको नियमित अभिव्यक्ति की अधिकांश व्याख्या भी देगा।
और इस प्रकार आप विभिन्न वर्ण सेट का किसी भी काम के लिए उपयोग कर सकते हैं।
REGEX के माध्यम से ऑर्डर नंबर पढ़ें
एक अन्य उदाहरण के रूप में, हम दस्तावेज़ से ऑर्डर नंबर पढ़ना चाहते हैं।

हमारे दस्तावेज़ पर ऑर्डर नंबर निम्नलिखित रूप में फॉर्मेट किया गया है:
यह हमेशा बड़े अक्षरों से शुरू होता है XYB, जिसके बाद एक हाइफन आता है, फिर 8 अंक, एक और हाइफन और अंत में 3 यादृच्छिक बड़े अक्षर।
ऑर्डर नंबर के उदाहरण होंगे:
XYB-12316723-LSH
XYB-98456723-JRD
इस ऑर्डर नंबर को निकालने के लिए हम निम्नलिखित नियमित अभिव्यक्ति का उपयोग कर सकते हैं:
XYB-\d{8}-[A-Z]{3}
आइए अभिव्यक्ति को एक-एक करके तोड़ें।
सबसे पहले हम डैश प्रतीक के साथ ठीक पहले 3 बड़े अक्षरों की खोज करते हैं: XYB-
XYB\d{8}-[A-Z]{3}
इसके बाद हम एक हائफ़न के बाद आने वाले 8 अंकों की खोज करते हैं: \d{8}-
XYB-\d{8}-[A-Z]{3}
यह \d वर्ण, जैसा कि पहले वर्णित किया गया है, 0 और 9 के बीच एक अंक से मेल खाता है, जबकि \d{8} वर्ण आठ-अंकीय संख्या से मेल खाता है।
और अंत में हम किसी भी 3 बड़े अक्षरों की खोज कर रहे हैं: [A-Z]{3}
XYB-\d{8}-[A-Z]{3}
यह इस तरह से PaperOffice निम्नलिखित ऑर्डर नंबरों को देखता है:
XYB-12316723-LSH
XYB-98456723-JRD
XYB-975432671829
ZYB-12342176-ZHD
पहले दो XYB-12316723-LSH और XYB-98456723-JRD
पहचानें।
हमने एक Regex101 लिंक तैयार किया है इस उदाहरण के लिए, जिसमें वर्णित नियमित अभिव्यक्ति 4 उदाहरणों के साथ सूचीबद्ध है। आप देख सकते हैं कि दिए गए ऑर्डर नंबरों में से केवल दो ही हमारी आवश्यकताओं को पूरा करते हैं।
REGEX के माध्यम से आइटल नंबर पढ़ें
हमारे दस्तावेज़ पर आइटल नंबर निम्नलिखित रूप में फॉर्मेट किया गया है:
यह हमेशा दो बड़े अक्षरों के साथ शुरू होता है, जिसके बाद एक हائफ़न आता है, और फिर 6 अंक।

आइटल नंबरों के उदाहरण इस प्रकार हैं:
MS-863398
DS-452829
इन आइटल नंबरों को निकालने के लिए, हम निम्नलिखित नियमित अभिव्यक्ति का उपयोग कर सकते हैं:
[A-Z]{2}-\d{6}
PaperOffice आपके दस्तावेज़ों को डिजिटल बना सकता है और आपके सिस्टम के साथ एकीकृत हो सकता है ताकि आप बिना कई कोड लिखे और बनाए रखे, चालानों और अन्य दस्तावेज़ों से डेटा निकालने की प्रक्रिया को स्वचालित कर सकें।
अपने उपयोग के मामलों पर चर्चा करने और यह जानने के लिए कि डिजिटल युग में PaperOffice आपको और अधिक प्रतिस्पर्धी कैसे बना सकता है, हमसे संपर्क करें।
शुरुआत करना आपके विचार से आसान है।
क्या आप अभी भी असफल होने की चिंता कर रहे हैं? अपने व्यवसाय जीवन में PaperOffice एकीकरण के बारे में हमारे ग्राहकों के केस स्टडी पढ़ें और सरलता को स्वयं समझें या परीक्षण इंस्टॉलेशन के लिए आवेदन करें।
कागज रहित कार्यालय किसके लिए उपयुक्त है?
इस सवाल का जल्दी और आसान जवाब है: हर कंपनी के लिए। छोटे और मध्यम उद्यमों और स्टार्टअप्स से लेकर बड़ी कंपनियों तक, सभी व्यापार क्षेत्र और आकार कागज रहित कार्यालय से लाभान्वित होते हैं। हालांकि, परिवर्तन विशेष रूप से छोटे और मध्यम उद्यमों के लिए मूल्यवान है: प्रसंस्करण प्रयास और लागत में कमी आगे की वृद्धि के लिए आवश्यक बजट को मुक्त करती है।
क्या मैं अपने कागज रहित कार्यालय के लिए क्लाउड-आधारित DMS प्रदाता का उपयोग कर सकता हूं?
नहीं। 2018 में GDPR लागू होने के बाद से हर किसी के मुंह पर आया एक और कारक डेटा सुरक्षा है। DMS समाधान और DMS सॉफ्टवेयर का उपयोग अक्सर संवेदनशील, व्यक्तिगत डेटा वाले दस्तावेजों को संसाधित, प्रबंधित और संग्रहीत करने के लिए किया जाता है। GDPR के उल्लंघन की स्थिति में, विधायी उच्च जुर्माने का प्रावधान करता है।
-
लाभ प्रयास और लागत को न्यायोचित ठहराते हैं
डिजिटल रूप से काम करना और पुराने दस्तावेजों को नए युग में लाना भविष्य में अविश्वसनीय मात्रा में समय, पैसा और तनाव बचाने के लिए सर्वश्रेष्ठ प्रमुख निवेश होगा। -
आपको किसी ऐसे व्यक्ति की आवश्यकता है जो जानता हो
डिजिटलीकरण के सभी लाभों का लाभ उठाने के लिए आपको अपने पास अपना आईटी विशेषज्ञ नहीं चाहिए।
आपको जो चाहिए वह आपके साथ सही साझेदार है जो अपनी अनुभव के कारण ठीक वही लागू कर सकता है जिसकी आपको आवश्यकता है। डर फैलाने से बचें और बिना वास्तव में परखे हुए शानदार पॉवरपॉइंट प्रस्तुतियों के बजाय परीक्षण स्थितियों का चयन करें। -
हार्डवेयर आमतौर पर पहले से ही उपलब्ध होता है
अनुभव से पता चला है कि लगभग हर संस्थान, कंपनी और संगठन के पास एक बड़ी कॉपी मशीन होती है जो अपने क्षमता का उपयोग नहीं करती। ये उपकरण भारी स्कैनिंग को पसंद करते हैं, पेपरक्लिप के प्रति सहिष्णु होते हैं और बिना स्कैनर निवेश के डिजिटल शुरुआत की नींव बन सकते हैं। -
सही डीएमएस के साथ अपेक्षा से सस्ता
उन्हें डीएमएस / ईसीएम प्रणालियों में लागत के जाल से बचें जहां आप निर्माताओं के हाथों बेबस हैं। अपने स्वयं के प्रशासनिक विकल्पों, जैसे दस्तावेजों को शिक्षित करना और सेटिंग्स स्वयं करना, के मामले में कोई समझौता न करें। यदि आपको मदद की आवश्यकता है, तो निर्मात आपकी मदद करने के लिए तैयार रहेगा, लेकिन स्वतंत्र रहें। -
डिजिटल स्वचालन भविष्य है
प्रक्रियाएं भविष्य में पूरी तरह से समान होंगी, लेकिन पूर्णतः स्वचालित होंगी।
चालान आ रहा है? कार्यप्रवाह सक्रिय हो जाता है और सब कुछ अपनी परिभाषित दिशा में चलता है।
क्या आप सभी 1000 फ़ोल्डरों में खोजना चाहते हैं? कोई समस्या नहीं, क्योंकि आपके पास अपना Google है!
