Dalam artikel ini, kami menunjukkan kepada Anda cara menggunakan ekspresi reguler untuk menikmati manfaat pemrosesan dokumen otomatis. Hal ini berlaku khususnya untuk dokumen dari perusahaan di industri apa pun.
Kami memberikan contoh konkret ekspresi reguler dan menjelaskan langkah demi langkah apa artinya serta bagaimana Anda dapat menggunakannya.
Dengan cara ini, Anda dapat meningkatkan efisiensi operasional, mengurangi kesalahan manusia melalui akurasi yang lebih tinggi, menurunkan biaya saat ini, menjaga integritas data, dan meningkatkan keamanan data.
Artikel ini melanjutkan bagian pertama tentang pemrosesan dokumen cerdas,di sini membawa Anda langsung ke artikel.
Mengekstrak elemen data spesifik dari dokumen bisa menjadi tugas yang sangat mahal dan memakan waktu. Seringkali, scan dokumen dikirim ke perusahaan entri data outsourcing besar, di mana data dimasukkan secara manual.
Namun, ada beberapa kerugian dari pendekatan ini, yaitu:
- Ini dapat membahayakan keamanan dokumen
- Terjadi penundaan dalam proses alur kerja
- Dibandingkan dengan ekstraksi otomatis, pengindeksan manual adalah proses yang lambat
- Pengindeksan manual tidak dapat diskalakan dengan baik pada proyek besar
- Pengindeksan manual mungkin memperkenalkan kesalahan ke dalam data
- Jika dokumen diubah, seluruh proses dimulai ulang dari awal
Dan masih banyak lagi.
Meskipun pemindaian semakin berkembang, sebagian besar transaksi bisnis masih didasarkan pada dokumen berbasis kertas. Diperkirakan bahwa 85% faktur masih diterbitkan secara kertas.
Selain itu, ada tumpukan dokumen kertas yang harus disimpan di gudang-gudang besar!
Apa itu ekspresi reguler?
Ekspresi reguler, juga dikenal sebagai "REGEX", adalah alat yang kuat untuk mencari dan memanipulasi teks. Ekspresi ini memungkinkan pengenalan dan pengeditan pola kompleks dalam teks.
Sebuah ekspresi reguler terdiri dari kombinasi huruf biasa dan karakter meta khusus yang memiliki fungsi tertentu.
Ekspresi reguler juga dapat digunakan untuk mengganti atau memanipulasi teks. Misalnya, ekspresi reguler dapat digunakan.
Mereka adalah alat yang sangat kuat untuk pemrosesan kata dan otomatisasi tugas.
Bagaimana ekspresi reguler dapat membantu mengotomatisasi bisnis?
Peningkatan dokumen digital dari berbagai jenis, aturan penamaan yang berbeda, dan tanpa sistem pencarian yang memadai mempersulit proses pencarian dan ekstraksi informasi dokumen dari konten tertentu, terutama ketika berkaitan dengan dokumen yang tidak diklasifikasikan, pencarian menjadi tidak tepat dan memakan waktu lama.
Ekspresi reguler (regex) menyediakan cara yang cepat dan kuat untuk menemukan, mengekstrak, dan mengganti data spesifik dalam dokumen. Pada dasarnya, ekspresi reguler adalah string teks khusus yang digunakan untuk menggambarkan pola pencarian.
Begini cara konten dokumen dicari dan dibaca untuk string karakter yang ditentukan. Ekspresi reguler adalah cara mendefinisikan pola dalam informasi menggunakan simbol khusus.
Metode Regex paling cocok untuk dokumen di mana posisi nilai yang akan dibaca dapat bervariasi dan template dokumen sederhana tidak dapat bekerja.
Anda dapat menemukan daftar ekspresi sederhana di kami ComDesk.

Bagaimana cara membuat ekspresi reguler?
Ekspresi reguler dapat disusun dengan berbagai cara, tergantung pada jenis pola yang dicari.
Gunakan metakarakter seperti ., *, +, ?, ^, $, [], dan [a-z] untuk mewakili jenis karakter atau pola tertentu.
Gunakan bagian opsional: Gunakan tanda tanya (?) atau asterisk (*) untuk membuat bagian dari pola menjadi opsional.
Gunakan grup: Gunakan kurung untuk mengelompokkan bagian dari pola dan memperlakukannya sebagai satu unit.
Penting untuk dicatat bahwa aturan ekspresi reguler dapat bervariasi tergantung pada bahasa pemrograman. Jadi penting untuk membaca dokumentasi alat yang digunakan. RegEx yang ditulis untuk PaperOffice harus kompatibel dengan ECMAScript dan PCRE2.
Tip
Ada juga video di YouTube tentang topik "Penyimpanan Dokumen Otomatis Bagian 3 / REGEX & Variabel / Pemrosesan Faktur Manajemen Dokumen", yang menjelaskan proses ini dengan mudah dan jelas:
Bagaimana saya mengekstrak informasi dari dokumen saya menggunakan REGEX?
Contoh praktis
Dalam artikel ini, kami menunjukkan cara mengekstrak data apa pun dari dokumen berkat ekspresi reguler multi-elemen di PaperOffice dan menyimpannya secara otomatis sebagai kata kunci untuk dokumen tersebut.
Kami telah membuat dokumen sampel di bawah ini yang memiliki tanggal tertentu. Dokumen ini adalah faktur. Pola tanggal pada dokumen kami diformat seperti ini:

Bulan, terdiri dari huruf, tetapi huruf pertama selalu kapital, diikuti oleh spasi, kemudian hari diikuti koma, spasi lagi, dan kemudian tahun.
Sebagai contoh:Sep 20, 2019 atau Mar 05, 2022
Untuk mengekstrak tanggal ini, kita dapat menggunakan ekspresi reguler (REGEX) berikut:
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})
Mari kita uraikan ekspresi ini menjadi kelompok-kelompok individu. Kelompok-kelompok ini dipisahkan oleh kurung siku tunggal().
Dalam kelompok pertama kita mencari 3 huruf bulan: ([A-Z][a-z]{2})
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Ekstrak bulan
- [A-Z] String ini berarti kita mencari huruf kapital dari A-Z. Sebagai contoh, huruf "S" dari Sept. Perlu dicatat bahwa huruf besar dan kecil diperlakukan secara terpisah.
- [a-z]{2} String ini berarti kita mencari dua huruf kecil dari a-z. Itu adalah ep dari "Sep".
Kemudian kita mencari spasi dengan string berikut:\s
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Ekstrak tanggal
Di grup kedua, cari penunjukan hari dalam angka: (0[1-9]|[12][0-9]|3[01])
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Hari harus dipisahkan oleh tiga pernyataan yang berbeda.
Karena kita tidak tahu tanggal apa yang dapat muncul dalam dokumen, itu bisa berupa hari pertama (01) atau hari terakhir (31) dari bulan, jadi Anda harus sesuai dengan opsi yang berbeda dinamai.
Pemisah menggunakan karakter "|".
Contoh: (1|2|3) = 1 atau 2 atau 3.
Daftar karakter yang diizinkan mengikuti dalam kurung siku. Beberapa kurung siku cocok dengan beberapa karakter. Jika sebuah ekspresi harus menggambarkan beberapa karakter, ini hanya dilampirkan satu demi satu. Kemudian input dibandingkan dengan ekspresi Anda dari kiri ke kanan.
Tentu saja, tidak semua angka harus terdaftar. Secara keseluruhan, bagaimanapun, seluruh ekspresi dalam kurung siku mewakili hanya satu karakter.
-
0[1-9] String ini berarti bahwa angka dapat dimulai dengan "0" diikuti oleh angka dari 1 hingga 9. Jadi kita mendapatkan angka apa pun dari 01 - 09.
String mencari pola angka yang dimulai dengan nol. Jika dokumen Anda biasanya memiliki tanggal "5 Maret 2022", yaitu tanpa angka "0" di depan angka "5", maka "0" dalam string dihilangkan.
- [12][0-9]Rangkaian karakter ini berarti bahwa angka dapat dimulai dengan "1" atau "2", diikuti oleh angka apa pun dari 0 hingga 9. Hasilnya bisa berupa angka apa pun dari 10 hingga 29.
- 3[01]Rangkaian string ini berarti bahwa sebuah angka mungkin dimulai dengan "3" diikuti oleh "0" atau "1". Hasilnya bisa berupa 30 atau 31.
Setelah opsi untuk hari telah ditentukan, ekspresi untuk tahun harus ditetapkan.
Sekarang kita mencari koma dan spasi: ,\s
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Ekstrak tahun
Dalam grup terakhir kita mencari tahun: (20\d{2})
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})
Kita mulai mencari tahun apa pun, tetapi tahu bahwa itu akan ≥ 2000.
- 20Rangkaian string ini berarti kita mencari tahun apa pun yang dimulai tepat dengan 20.
- \d{2}Rangkaian string ini berarti kita mencari angka dua digit yang mungkin, yaitu dari "00" hingga "99".
Misalnya, karakter \d cocok dengan digit antara 0 dan 9, sedangkan karakter \d{2} cocok dengan angka dua digit.

Jika ekspresi reguler sekarang digunakan di PaperOffice, hasil akhirnya adalah tanggal "Sep 20, 2019".
Dengan cara ini, tanggal apa pun dapat dibaca dari dokumen tanpa kita mengetahui nilai aslinya. Grup-grup ini juga dapat digunakan di tempat lain dan dipindahkan secara bebas untuk membaca format tanggal lainnya.
Berikut adalah contoh lain:

Tanggal dimulai dengan hari, diikuti oleh bulan, yang terdiri dari huruf-huruf, tetapi huruf pertama selalu ditulis dengan huruf kapital, diikuti oleh titik, spasi lagi, dan kemudian tahun.
Untuk mengekstrak tanggal ini, ekspresi reguler (REGEX) yang baru saja dijelaskan dapat digunakan, dengan tambahan penyelesaian, karena pada contoh kedua "titik" diberikan setelah bulan.
Hal ini dapat ditentukan dengan string karakter berikut: \.
Jadi ekspresi lengkapnya terlihat seperti ini:
(0[1-9]|[12][0-9]|3[01])\s([A-Z][a-z]{2})\.\s(20\d{2})
Anda selalu dapat memvalidasi regex yang Anda buat dengan pergi ke halaman https://regex101.com untuk memvalidasinya bersama dengan teks Sisipkan Anda. Regex101 tidak hanya akan memeriksa apakah regex Anda benar, tetapi juga menjelaskan sebagian besar ekspresi reguler kepada Anda.
Dan sehingga Anda dapat menggunakan berbagai set karakter untuk apa saja.
Baca nomor pesanan berkat REGEX
Sebagai contoh lain, kami ingin membaca nomor pesanan dari dokumen.

Nomor pesanan pada dokumen kami diformat sebagai berikut:
Ini selalu dimulai dengan huruf kapital XYB, diikuti oleh tanda hubung, diikuti oleh 8 digit, tanda hubung lagi dan akhirnya 3 huruf kapital acak.
Contoh nomor pesanan adalah:
XYB-12316723-LSH
XYB-98456723-JRD
Untuk mengekstrak nomor pesanan ini kita dapat menggunakan ekspresi reguler berikut:
XYB-\d{8}-[A-Z]{3}
Mari kita uraikan ekspresinya satu per satu.
Pertama kita mencari tepat 3 huruf kapital dengan simbol dash: XYB-
XYB\d{8}-[A-Z]{3}
Setelah itu kita mencari 8 digit diikuti oleh tanda hubung lagi: \d{8}-
XYB-\d{8}-[A-Z]{3}
The \d karakter, seperti yang dijelaskan sebelumnya, cocok dengan digit antara 0 dan 9, sedangkan \d{8} cocok dengan angka delapan digit.
Dan akhirnya kita mencari 3 huruf kapital: [A-Z]{3}
XYB-\d{8}-[A-Z]{3}
Beginilah PaperOffice akan melihat nomor pesanan berikut:
XYB-12316723-LSH
XYB-98456723-JRD
XYB-975432671829
ZYB-12342176-ZHD
dua pertama XYB-12316723-LSH dan XYB-98456723-JRD
mengenali.
Kami telah menyiapkan sebuah tautan ke Regex101 untuk contoh ini, di mana ekspresi reguler yang baru saja dijelaskan terdaftar dengan 4 contoh. Anda dapat melihat bahwa hanya dua dari nomor pesanan yang diberikan memenuhi persyaratan kami.
Baca nomor artikel berkat REGEX
Nomor artikel pada dokumen kami diformat sebagai berikut:
Ini selalu dimulai dengan dua huruf kapital, diikuti oleh tanda hubung, diikuti oleh 6 digit.

Contoh nomor item adalah:
MS-863398
DS-452829
Untuk mengekstrak nomor artikel ini, kita dapat menggunakan ekspresi reguler berikut:
[A-Z]{2}-\d{6}
PaperOffice dapat mendigitalkan dokumen Anda dan terintegrasi dengan sistem Anda untuk mengotomatisasi ekstraksi data dari faktur dan dokumentasi lainnya tanpa perlu menulis dan kemudian memelihara banyak kode.
Hubungi kami untuk membahas kasus penggunaan Anda dan pelajari lebih lanjut tentang bagaimana PaperOffice dapat membantu Anda menjadi lebih kompetitif di era digital.
Memulai lebih mudah dari yang Anda kira.
Apakah Anda masih khawatir tidak berhasil? Baca studi kasus dari pelanggan kami tentang integrasi PaperOffice ke dalam kehidupan bisnis Anda dan yakinkan diri sendiri akan kesederhanaannya, atau ajukan permohonan untuk instalasi uji coba.
Untuk siapa kantor tanpa kertas cocok?
Jawaban cepat dan mudah atas pertanyaan tersebut adalah: untuk setiap perusahaan. Semua sektor bisnis dan ukuran perusahaan diuntungkan dari kantor tanpa kertas, mulai dari UKM dan startup hingga perusahaan besar. Namun, konversi ini sangat berharga bagi perusahaan kecil dan menengah: Pengurangan upaya pemrosesan dan biaya membebaskan anggaran yang diperlukan untuk pendorong pertumbuhan lebih lanjut.
Bisakah saya menggunakan penyedia DMS berbasis cloud untuk kantor tanpa kertas saya?
Tidak. Faktor lain yang menjadi pembicaraan utama sejak berlakunya GDPR pada tahun 2018 setidaknya adalah perlindungan data. Solusi dan perangkat lunak DMS digunakan untuk memproses, mengelola, dan menyimpan dokumen yang sering kali berisi data pribadi yang sensitif. Dalam hal pelanggaran GDPR, legislator menetapkan denda tinggi.
-
Manfaat membenarkan upaya dan biaya
Bekerja secara digital dan membawa dokumen lama ke era baru akan menjadi investasi kunci terbaik untuk menghemat waktu, uang, dan ketenangan pikiran yang luar biasa di masa depan. -
Anda membutuhkan seseorang yang tahu
Anda tidak memerlukan spesialis IT sendiri untuk memanfaatkan semua keunggulan digitalisasi.
Yang Anda butuhkan adalah mitra yang tepat di sisi Anda yang, berkat pengalamannya, dapat menerapkan apa pun yang Anda butuhkan. Hindari ketakutan dan pilih posisi uji coba daripada presentasi PowerPoint mewah tanpa benar-benar mengujinya. -
Perangkat keras biasanya sudah tersedia
Pengalaman menunjukkan bahwa hampir setiap operasi, perusahaan, dan organisasi memiliki mesin fotokopi besar yang tidak menggunakan potensinya. Perangkat ini suka pemindaian massal, toleran terhadap klip kertas, dan dapat menjadi dasar untuk memulai digitalisasi tanpa investasi pemindai. -
Lebih murah dari yang diharapkan dengan DMS yang tepat
Hindari jebakan biaya dengan sistem DMS/ECM di mana Anda sepenuhnya bergantung pada produsen. Jangan membuat kompromi ketika datang ke opsi administrasi sendiri, seperti mengajarkan dokumen dan membuat pengaturan sendiri. Jika Anda membutuhkan bantuan, produsen akan senang membantu Anda, tetapi tetap independen. -
Otomatisasi digital adalah masa depan
Prosedur akan sepenuhnya identik di masa depan, tetapi sepenuhnya otomatis.
Faktur masuk? Alur kerja dipicu dan semuanya berjalan sesuai jalur yang ditentukan.
Menelusuri semua 1000 folder? Tidak masalah, karena Anda memiliki Google sendiri!
