Selles artiklis näitame teile, kuidas saate regulaaravaldiste abil nautida automaatse dokumenditöötluse eeliseid. See kehtib eriti ettevõtete dokumentide kohta olenemata tööstusharust.
Toome teile regulaaravaldiste täpsed näited ja selgitame samm-sammult, mida need tähendavad ja kuidas saate neid kasutada.
Selle abil saate suurendada oma operatiivset efektiivsust, vähendada inimvigade arvu täpsemuse tõttu, alandada praegusi kulusid, säilitada andmete terviklikkust ja parandada andmeturvalisust.
See artikkel laiendab esimest osa intelligentse dokumenditöötluse kohta,siin saate minna otse artiklisse.
Konkreetsete andmeelementide väljavõtmine dokumentidest võib olla äärmiselt kallis ja ajamahukas ülesanne. Sageli saadetakse dokumentide skannid suurtele outsourcitud andmesisestusettevõtetele, kus andmed sisestatakse käsitsi.
Sellel lähenemisel on siiski mitmeid puudusi, nagu järgneb:
- See võib ohustada dokumendi turvalisust
- Töövoogude protsessidesse tekib viivitus
- Võrreldes automaatse väljavõtmisega on käsitsi indekseerimine aeglane protsess
- Käsitsi indekseerimine ei skaalitu hästi suurtes projektides
- Käsitsi indekseerimine võib andmetesse viia vigu
- Kui dokument on muudetud, algab kogu protsess uuesti
Ja paljud teised.
Hoolimata skaneerimise laialdast levikust põhineb suur osa äritehingutest endiselt paberdokumentidel. Arvatakse, et 85% arvetest saadetakse endiselt paberil.
Lisaks on olemas märgid olemasolevast paberist, mida tuleb hoida tohutu suurtes ladudes!
Mis on regulaaravaldis?
Regulaaravaldised, mida tuntakse ka kui "REGEX", on võimas tööriist teksti otsimiseks ja manipuleerimiseks. Need võimaldavad tuvastada ja muuta tekstis keerukaid mustreid.
Regulaaravaldis koosneb tavaliste tähtede ja erifunktsioonidega spetsiaalsete metatähtede kombinatsioonist.
Regulaaravaldiseid saab kasutada ka teksti asendamiseks või manipuleerimiseks. Näiteks saab regulaaravaldist kasutada.
Need on väga võimas tööriist sõnavõtmise ja ülesannete automatiseerimise jaoks.
Kuidas saavad regulaaravaldised aidata äri automatiseerida?
Erinevat tüüpi digitaalsete dokumentide, erinevate nimeandmiste reeglite ja piisava otsingusüsteemita suurenenud arvukus raskendab otsinguprotsessi ja dokumentide teabe eraldamist kindlast sisust, eriti kui tegemist on klassifitseerimata dokumentidega, muutub otsimine ebatäpseks ja võtab kaua aega.
Regulaaravaldised (regex) pakuvad kiiget ja võimat viisi leida, eraldada ja asendada dokumentides kindlat andmet. Regulaaravaldised on põhimõtteliselt spetsiaalne tekstistring, mida kasutatakse otsingumustri kirjeldamiseks.
Dokumentisisu otsitakse ja loetakse ette antud märgijada jaoks. Regulaaravalised on viis musterite defineerimiseks teabes, kasutades erisümboleid.
Regex meetod sobib kõige paremini dokumentide puhul, mille puhul väärtuste positsioonid võivad varieeruda ja lihtsad dokumendimaabrid ei tööta.
Lihtsate avaliste loendi leiate meie ComDeskist.

Kuidas koostada regulaaravaldiseid?
Regulaaravalised saab koostada erineval viisil, sõltuvalt sellest, millist tüüpi mustrit otsitakse.
Kasutage metatähiseid nagu ., *, +, ?, ^, $, [], ja [a-z], et esitada konkreetseid märgitüüpe või mustreid.
Kasutage valikulisi osi: Kasutage küsimärki (?) või tähte (*) osa mustri valikuliseks tegemiseks.
Kasutage gruppe: Kasutage sulge, et grupeerida mustri osi ja käsitleda neid ühikuna.
On oluline märkida, et regulaaravaliste reeglid võivad varieeruda sõltuvalt programmeerimiskeelest. Seetõttu on oluline lugeda kasutatavate tööriistade dokumentatsiooni. PaperOffice jaoks kirjutatud RegEx peab olema ühilduv ECMAScripti ja PCRE2-ga.
Nõuanne
Teemal "Automated Document STORAGE Part 3 / REGEX & Variables / Invoice Processing Document Management" on YouTube'is ka video, mis selgitab seda protsessi lihtsalt ja selgelt:
Kuidas ma saan oma dokumendist teavet REGEX abil eraldada?
Praktilised näited
Selles artiklis demonstreerime, kuidas saate PaperOffice'is mitme elemendiga regulaaravaldiste abil dokumentist andmeid eraldada ja need automaatselt dokumendi märksõnana salvestada.
Allpool on toodud näitedookument, millel on kindel kuupäev. See dokument on arve. Meie dokumendi kuupäeva muster on vormindatud järgmiselt:

Kuu, mis koosneb tähtedest, kuid esimene täht on alati suurkirjas, millele järgneb tühik, seejärel päev ja koma, veel üks tühik ning seejärel aasta.
Näiteks:Sep 20, 2019 või Mar 05, 2022
Selle kuupäeva eraldamiseks saame kasutada järgmist regulaaravaldist (REGEX):
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})
Lahutame avalise üksikute rühmade kaupa. Need rühmad on eraldatud ühe sulgudega().
Esimeses rühmas otsime kolme kuu tähte: ([A-Z][a-z]{2})
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Kuu eraldamine
- [A-Z]See tähendab, et otsime suurt tähte A-Z vahemikus. Näiteks täht "S" sõnas Sept. Tuleb märkida, et suured ja väikesed tähed käituvad eraldi.
- [a-z]{2}See tähendab, et otsime kahte väikest tähte a-z vahemikus. See oleks ep sõnas "Sep".
Seejärel otsime tühikut järgmise stringiga:\s
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Kuupäeva eraldamine
Teises rühmas otsige numbrilist päevamärget: (0[1-9]|[12][0-9]|3[01])
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Päev peab olema eraldatud kolme erineva väitega.
Kuna me ei tea, milline kuupäev dokumendis esineda võib, võib see olla esimene päev (01) või viimane päev (31) kuus, seega tuleb vastavalt erinevaid variante nimetada.
Need on eraldatud märgiga "|".
Näide: (1|2|3) = 1 või 2 või 3.
Lubatud märkide loetelu järgneb sulgudes. Mitmed sulud vastavad mitmele märgile. Kui avaldis peab kirjeldama mitut märki, liidetakse need lihtsalt üksteise järel. Siis võrreldakse sisendit teie avaldisega vasakult paremale.
Muidugi ei pea kõik numbrid olema loetletud. Üldiselt tähistab aga kogu sulgudes olev avaldis ainult ühte märki.
-
0[1-9]See string tähendab, et number võib alata "0"-ga, millele järgneb number vahemikus 1 kuni 9. Nii saame arvu 01–09.
String otsib numbrimustrit, mis algab nulliga. Kui teie dokumendis on kuupäev tavaliselt "5. märts 2022", st ilma numbrita "0" enne arvu "5", jäetakse stringis olev "0" vahele.
- [12][0-9]See tähis tähendab, et number võib algada "1" või "2"-ga, millele järgneb suvaline number 0-st 9-ni. Tulemuseks võib olla suvaline number vahemikus 10–29.
- 3[01]See tähis tähendab, et number võib algada "3"-ga, millele järgneb "0" või "1". Tulemuseks võib olla 30 või 31.
Pärast päeva valikute määramist tuleb määrata aasta avaldis.
Nüüd otsime komat ja tühikut: ,\s
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Aasta eraldamine
Viimases rühmas otsime aastat: (20\d{2})
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})
Alustame suvalise aasta otsimist, teades samas, et see on ≥ 2000.
- 20See tähis tähendab, et otsime suvalist aastat, mis algab täpselt 20-ga.
- \d{2}See tähis tähendab, et otsime võimalikku kahekohalist arvu, st vahemikus "00" kuni "99".
Näiteks märk \d vastab numbrile 0–9, samas kui märk \d{2} vastab kahekohalisele arvule.

Kui regulaaravaldis kasutatakse PaperOffice'is, on lõpptulemuseks kuupäev "Sep 20, 2019".
Nii saab dokumentidest lugeda suvalist kuupäeva, teadmata algset väärtust. Neid rühmi saab kasutada ka mujal ja vabalt teisaldada teiste kuupäevavormingute lugemiseks.
Siin on veel üks näide:

Kuupäev algab päevaga, millele järgneb kuukiri tähtedest, kuid esimene täht on alati suurkirjas, millele järgneb punkt, üks tühik ja seejärel aasta.
Selle kuupäeva väljavõtmiseks saab kasutada eelnevalt kirjeldatud regulaaravaldis (REGEX), lisades sellele täienduse, kuna teises näites on kuu järel "punkt".
Seda saab määrata järgmise tähemärgijada abil: \.
Seega näeb täielik avaldis välja selline:
(0[1-9]|[12][0-9]|3[01])\s([A-Z][a-z]{2})\.\s(20\d{2})
Saate oma loodud regex-i alati valideerida, minnes https://regex101.com lehele selle valideerimiseks koos oma sisestatud tekstiga. Regex101 ei kontrolli mitte ainult seda, kas teie regex on õige, vaid selgitab ka enamikku regulaaravaldisest teile.
Ja nii saate kasutada erinevaid tähemärkide komplekte igaks otstarbeks.
Lugege tellimuse numbrit REGEX-i abil
Teise näitena soovime dokumendist lugeda tellimuse numbri.

Meie dokumendi tellimuse number on vormindatud järgmiselt:
See algab alati suurte tähtedega XYB, millele järgneb sidekriips, seejärel 8 numbrit, veel üks sidekriips ja lõpuks 3 suvalist suurt tähte.
Tellimuse numbri näited oleksid:
XYB-12316723-LSH
XYB-98456723-JRD
Selle tellimuse numbri väljavõtmiseks saame kasutada järgmist regulaaravaldist:
XYB-\d{8}-[A-Z]{3}
Lahutame avaldise samm-sammult.
Esmaselt otsime täpselt esimest 3 suurt tähte koos kriipsu sümbooliga: XYB-
XYB\d{8}-[A-Z]{3}
Pärast seda otsime 8 numbrit, millele järgneb teine kriips: \d{8}-
XYB-\d{8}-[A-Z]{3}
Täht \d, nagu eelnevalt kirjeldatud, tähistab numbrit vahemikus 0 kuni 9, samas kui \d{8} tähistab kaheksakohalist arvu.
Ja lõpuks otsime suvalisi 3 suurt tähte: [A-Z]{3}
XYB-\d{8}-[A-Z]{3}
Nii näeb PaperOffice välja järgmised tellimuste numbrid:
XYB-12316723-LSH
XYB-98456723-JRD
XYB-975432671829
ZYB-12342176-ZHD
esimesed kaks XYB-12316723-LSH ja XYB-98456723-JRD
tunnistada.
Oleme ette valmistanud lingi Regex101 selle näite jaoks, kus on toodud kirjeldatud regulaaravaldis koos 4 näitega. Näete, et ainult kaks antud tellimuste numbrit vastavad meie nõuetele.
Lugege artikkelnumbreid REGEXi abil
Meie dokumendi artiklinumber on vormistatud järgmiselt:
See algab alati kahe suure tähega, millele järgneb kriips, seejärel 6 numbrit.

Artiklinumbrite näited oleksid:
MS-863398
DS-452829
Nende artiklinumbrite väljavõtmiseks saame kasutada järgmist regulaaravaldist:
[A-Z]{2}-\d{6}
PaperOffice saab digiteerida teie dokumendid ja integreeruda teie süsteemidega, et automatiseerida andmete väljavõtmist arvetest ja muust dokumentatsioonist ilma, et peaksite kirjutama ja seejärel hoidma üles tohutut koodi.
Võtke meiega ühendust, et arutada oma kasutusjuhte ja saada teada rohkem sellest, kuidas PaperOffice võib aidata teil digiajastus veelgi konkurentsivõimelisemaks muutuda.
Alustamine on lihtsam, kui arvate.
Kas te endiselt muretsete, et ei saa hakkama? Lugege meie klientide juhtumiuuringuid PaperOffice integratsiooni kohta teie äriellu ja veenduge ise lihtsuses või taotlege lihtsalt testpaigaldust.
Who is a paperless office suitable for?
Kellele sobib paberivaba kontor?
Kiire ja lihtne vastus sellele küsimusele on: igale ettevõttele. Kõik ärisektorid ja suurused saavad kasu paberivabast kontoris, alates väike- ja keskmise suurusega ettevõtetest ning startupidest kuni suurten ettevõteteni. Siiski on üleminek eriti väärtuslik väikestele ja keskmise suurusega ettevõtetele: Töötluskulu ja kulude vähendamine vabastab eelarve, mis on vajalik edasise kasvu tugevdajateks.
Kas ma saan kasutada pilvepõhist DMS-teenusepakkuja oma paberivaba kontori jaoks?
-
Ei. Teine tegur, mis on olnud kõigi suus alates GDPR-i jõustumisest 2018. aastal, on andmekaitse. DMS lahendusi ja tarkvara kasutatakse dokumentide töötlemiseks, haldamiseks ja salvestamiseks, mis sageli sisaldavad tundlikke isikuandmeid. GDPR-i rikkumiste korral näeb seadusandja ette kõrged trahvid.
Digitaalselt töötamine ja vanade dokumentide toomine uude ajastusse on parim investeering, mis tulevikus säästab tohutult aega, raha ja närve. -
Te vajate kedagi, kes teab
Teil ei ole vaja omaenda IT-spetsialisti, et kasutada ära digiteerimise kõiki eeliseid.
Mida te vajate, on õige partner teie kõrval, kes saab oma kogemuste tõttu teostada täpselt seda, mida te vajate. Vältige hirmutamist ja valige testpositsioonid pigem kui muljetavaldavad PowerPointi esitlused, ilma et olete seda tegelikult testinud. -
Riistvara on tavaliselt juba olemas
Kogemus on näidanud, et peaaegu igal ettevõttel või firmal on suur koopiamasin, mis ei kasuta oma potentsiaali. Need seadmed armastavad massskaneerimist, on tolerantsed klambrite suhtes ja võivad olla digitaalse alguse aluseks ilma skanneri investeeringuta. -
Odavam kui oodatud õige DMS-iga
Vältige kululõkse DMS / ECM süsteemides, kus olete tootjate armust. Ärge tehke kompromisse omaenda haldusvõimaluste osas, nagu dokumentide õpetamine ja seadete tegemine ise. Kui vajate abi, aitab tootja meelsasti, kuid säilitage sõltumatus. -
Digitaalne automatiseerimine on tulevik
Protseduurid on tulevikus täiesti identsed, kuid täielikult automatiseeritud.
Arve saabub? Töövoog aktiveeritakse ja kõik läheb oma määratud teed.
Otsige läbi kõigi 1000 kausta? Ei mingit probleemi, sest teil on oma Google!
