Nhảy đến nội dung
Tổng quan Tổng quan Tin tức Tin tức
Chia sẻ
Công nghệ 24 tháng 10, 2022 15 phút

Sử dụng Biểu thức Chính quy (REGEX) cho Thu thập và Trích xuất Dữ liệu Tự động (Phần 2)

Nhờ có OCR, AI và REGEX trong PaperOffice, việc xử lý tài liệu thông minh có thể được đảm bảo hoàn toàn.

Được tin tưởng bởi các công ty hàng đầu trên toàn thế giới

Trong bài viết hiện tại, chúng tôi hướng dẫn bạn cách sử dụng biểu thức chính quy để tận dụng những lợi ích của việc xử lý tài liệu tự động. Điều này đặc biệt áp dụng cho các tài liệu từ các công ty thuộc mọi ngành nghề.

Chúng tôi cung cấp các ví dụ cụ thể về biểu thức chính quy và giải thích từng bước ý nghĩa cũng như cách sử dụng chúng.

Bằng cách này, bạn có thể tăng hiệu quả hoạt động, giảm lỗi do con người thông qua độ chính xác cao hơn, giảm chi phí hiện tại, duy trì tính toàn vẹn của dữ liệu và cải thiện bảo mật dữ liệu.

Bài viết hiện tại mở rộng phần đầu tiên về xử lý tài liệu thông minh, tại đây đưa bạn trực tiếp đến bài viết.

Việc trích xuất các yếu tố dữ liệu cụ thể từ tài liệu có thể là một nhiệm vụ tốn kém và mất nhiều thời gian. Thường thì, các bản quét tài liệu được gửi đến các công ty gia công nhập liệu quy mô lớn, nơi dữ liệu được nhập bằng tay.

Tuy nhiên, có một số nhược điểm của phương pháp này như sau:

  • Điều này có thể gây nguy hiểm cho bảo mật tài liệu
  • Gây ra sự chậm trễ trong các quy trình làm việc
  • So với trích xuất tự động, lập chỉ mục thủ công là một quá trình chậm chạp
  • Lập chỉ mục thủ công không mở rộng tốt trên các dự án lớn
  • Lập chỉ mục thủ công có thể đưa ra lỗi vào dữ liệu
  • Nếu một tài liệu được thay đổi, toàn bộ quy trình sẽ bắt đầu lại từ đầu

Và nhiều hơn nữa.

Mặc dù việc quét tài liệu ngày càng phổ biến, một tỷ lệ lớn các giao dịch kinh doanh vẫn dựa trên các tài liệu giấy. Người ta ước tính rằng 85% hóa đơn vẫn được phát hành dưới dạng giấy.

Ngoài ra, còn có núi tài liệu giấy tồn đọng cần phải lưu trữ trong những kho hàng khổng lồ!

Biểu thức chính quy là gì?

Biểu thức chính quy, còn được gọi là "REGEX", là một công cụ mạnh mẽ để tìm kiếm và thao tác với văn bản. Chúng cho phép nhận diện và chỉnh sửa các mẫu phức tạp trong văn bản.

Một biểu thức chính quy bao gồm sự kết hợp giữa các chữ cái thông thường và các ký tự đặc biệt (metacharacters) có chức năng riêng.

Biểu thức chính quy cũng có thể được sử dụng để thay thế hoặc thao tác với văn bản. Ví dụ, một biểu thức chính quy có thể được sử dụng.

Chúng là một công cụ rất mạnh mẽ cho việc xử lý văn bản và tự động hóa tác vụ.

Biểu thức chính quy có thể giúp tự động hóa doanh nghiệp như thế nào?

Sự gia tăng của các tài liệu số với nhiều loại khác nhau, các quy tắc đặt tên khác nhau và thiếu hệ thống tìm kiếm đầy đủ làm phức tạp quá trình tìm kiếm và trích xuất thông tin từ nội dung cụ thể, đặc biệt là khi liên quan đến các tài liệu chưa được phân loại, việc tìm kiếm trở nên kém chính xác và mất nhiều thời gian.

Biểu thức chính quy (regex) cung cấp một cách nhanh chóng và mạnh mẽ để tìm kiếm, trích xuất và thay thế dữ liệu cụ thể trong các tài liệu. Về cơ bản, biểu thức chính quy là một chuỗi văn bản đặc biệt được sử dụng để mô tả một mẫu tìm kiếm.

Đây là cách tìm kiếm và đọc nội dung tài liệu cho một chuỗi ký tự cụ thể. Biểu thức chính quy (Regular expressions) là cách xác định các mẫu thông tin bằng các ký tự đặc biệt.

Phương pháp Regex phù hợp nhất với các tài liệu mà vị trí của giá trị cần đọc có thể thay đổi và các mẫu tài liệu đơn giản không thể hoạt động.

Bạn có thể tìm danh sách các biểu thức đơn giản tại ComDesk.

Bộ sưu tập ví dụ Regex của PaperOffice

Làm thế nào để xây dựng biểu thức chính quy?

Biểu thức chính quy có thể được ghép nối theo nhiều cách khác nhau, tùy thuộc vào loại mẫu đang được tìm kiếm.

Sử dụng các ký tự đặc biệt như ., *, +, ?, ^, $, [], và [a-z] để đại diện cho các loại ký tự hoặc mẫu cụ thể.

Sử dụng các phần tùy chọn: Sử dụng dấu chấm hỏi (?) hoặc dấu sao (*) để làm cho một phần của mẫu trở nên tùy chọn.

Sử dụng nhóm: Sử dụng dấu ngoặc đơn để nhóm các phần của mẫu và xử lý chúng như một đơn vị.

Cần lưu ý rằng quy tắc biểu thức chính quy có thể khác nhau tùy theo ngôn ngữ lập trình. Vì vậy, điều quan trọng là phải đọc tài liệu hướng dẫn của các công cụ được sử dụng. RegEx viết cho PaperOffice phải tương thích với ECMAScript và PCRE2.

Mẹo

Cũng có một video trên YouTube về chủ đề "Lưu trữ Tài liệu Tự động Phần 3 / REGEX & Biến / Xử lý Hóa đơn Quản lý Tài liệu", giải thích quá trình này một cách dễ dàng và rõ ràng:

Video của PaperOffice

Làm thế nào để trích xuất thông tin từ tài liệu của tôi bằng REGEX?

Ví dụ thực tế

Trong bài viết hiện tại, chúng tôi minh họa cách bạn có thể trích xuất bất kỳ dữ liệu nào từ tài liệu nhờ vào các biểu thức chính quy đa phần tử trong PaperOffice và tự động lưu trữ nó dưới dạng từ khóa cho tài liệu đó.

Chúng tôi đã tạo một tài liệu mẫu bên dưới có chứa một ngày cụ thể. Tài liệu này là một hóa đơn. Mẫu ngày trên tài liệu của chúng tôi được định dạng như sau:

Đọc hóa đơn PaperOffice bằng regex

Tháng, gồm các chữ cái, nhưng chữ cái đầu tiên luôn viết hoa, theo sau là một khoảng trắng, rồi đến ngày tiếp theo kèm dấu phẩy, một khoảng trắng khác, và cuối cùng là năm.

Ví dụ: Sep 20, 2019 hoặc Mar 05, 2022

Để trích xuất ngày này, chúng ta có thể sử dụng biểu thức chính quy (REGEX) sau:

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})

Hãy phân tích biểu thức thành các nhóm riêng lẻ. Các nhóm này được phân tách bằng dấu ngoặc đơn ().

Trong nhóm đầu tiên chúng ta tìm kiếm 3 chữ cái của tháng: ([A-Z][a-z]{2})

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})

Trích xuất tháng

  • [A-Z] Chuỗi này có nghĩa là chúng ta đang tìm kiếm một chữ cái viết hoa từ A-Z. Ví dụ, chữ cái "S" từ Sept. Cần lưu ý rằng chữ hoa và chữ thường được xử lý riêng biệt.
  • [a-z]{2} Chuỗi này có nghĩa là chúng ta đang tìm kiếm hai chữ cái viết thường từ a-z. Đó chính là ep từ "Sep".

Sau đó, chúng ta tìm kiếm một khoảng trắng với chuỗi sau: \s

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})

Trích xuất ngày

Trong nhóm thứ hai, tìm ký hiệu của ngày dưới dạng số: (0[1-9]|[12][0-9]|3[01])

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})

Ngày phải được phân tách bởi ba phần khác nhau.
Vì chúng ta không biết ngày nào có thể xuất hiện trong tài liệu, nó có thể là ngày đầu tiên (01) hoặc ngày cuối cùng (31) của tháng, vì vậy bạn phải tương ứng với các tùy chọn khác nhau được đặt tên.
Những cái này được phân tách bằng ký tự "|".
Ví dụ: (1|2|3) = 1 hoặc 2 hoặc 3.

Danh sách các ký tự cho phép theo sau trong dấu ngoặc vuông. Nhiều dấu ngoặc vuông khớp với nhiều ký tự. Nếu một biểu thức phải mô tả nhiều ký tự, những ký tự này chỉ cần được nối tiếp nhau. Sau đó, đầu vào được so sánh với biểu thức của bạn từ trái sang phải.

Tất nhiên, không phải tất cả các số đều phải được liệt kê. Tuy nhiên, tổng thể, toàn bộ biểu thức trong ngoặc vuông đại diện cho chỉ một ký tự.

  • 0[1-9] Chuỗi này có nghĩa là số có thể bắt đầu bằng "0" theo sau là một số từ 1 đến 9. Vì vậy, chúng ta nhận được bất kỳ số nào từ 01 - 09.
    Chuỗi tìm kiếm một mẫu số bắt đầu bằng số không. Nếu tài liệu của bạn thường có ngày "5 tháng Ba năm 2022", tức là không có số "0" đứng trước số "5", thì chữ "0" trong chuỗi ký tự bị bỏ qua.
  • [12][0-9]Chuỗi ký tự này có nghĩa là số có thể bắt đầu bằng "1" hoặc "2", tiếp theo là bất kỳ số nào từ 0 đến 9. Kết quả có thể là bất kỳ số nào từ 10 đến 29.
  • 3[01]Chuỗi này có nghĩa là một số có thể bắt đầu bằng "3" tiếp theo là "0" hoặc "1". Kết quả có thể là 30 hoặc 31.

Sau khi các tùy chọn cho ngày đã được xác định, biểu thức cho năm cần được xác định.

Bây giờ chúng ta tìm dấu phẩy và khoảng trắng: ,\s

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})

Trích xuất năm

Trong nhóm cuối cùng, chúng ta tìm năm: (20\d{2})

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})

Chúng ta bắt đầu tìm bất kỳ năm nào, nhưng biết rằng nó sẽ ≥ 2000.

  • 20Chuỗi này có nghĩa là chúng ta đang tìm kiếm bất kỳ năm nào bắt đầu chính xác bằng 20.
  • \d{2}Chuỗi này có nghĩa là chúng ta đang tìm kiếm một số có thể gồm hai chữ số, tức là từ "00" đến "99".

Ví dụ, ký tự\dkhớp với một chữ số từ 0 đến 9, trong khi ký tự \d{2} khớp với một số gồm hai chữ số.

Các biến được đọc từ tài liệu và cung cấp sẵn

Nếu biểu thức chính quy được sử dụng trong PaperOffice, kết quả cuối cùng là ngày"Sep 20, 2019".

Bằng cách này, bất kỳ ngày nào cũng có thể được trích xuất từ tài liệu mà không cần biết giá trị gốc. Các nhóm này cũng có thể được sử dụng ở bất kỳ đâu và di chuyển tự do để đọc các định dạng ngày khác.

Đây là một ví dụ khác:

Đọc hóa đơn PaperOffice 2 bằng Regex

Ngày bắt đầu bằng ngày, tiếp theo là tháng, được tạo thành từ các chữ cái, nhưng chữ cái đầu tiên luôn viết hoa, theo sau là dấu chấm, một khoảng trắng khác và sau đó là năm.

Để trích xuất ngày này, có thể sử dụng biểu thức chính quy (REGEX) vừa mô tả, với một phần bổ sung thêm, vì trong ví dụ thứ hai, dấu "chấm" được đặt sau tháng.

Điều này có thể được chỉ định bằng chuỗi ký tự sau: \.

Vì vậy, biểu thức đầy đủ trông như thế này:

(0[1-9]|[12][0-9]|3[01])\s([A-Z][a-z]{2})\.\s(20\d{2})

Bạn luôn có thể xác thực biểu thức chính quy đã tạo bằng cách truy cập trang https://regex101.com để xác thực nó cùng với văn bản chèn của bạn. Regex101 không chỉ kiểm tra xem biểu thức chính quy của bạn có đúng hay không, mà còn giải thích hầu hết các biểu thức chính quy cho bạn.

Và vì vậy bạn có thể sử dụng các tập ký tự khác nhau cho bất kỳ mục đích nào.

Đọc số đơn hàng nhờ REGEX

Là một ví dụ khác, chúng tôi muốn đọc số đơn hàng từ tài liệu.

Các biến được đọc từ tài liệu và cung cấp sẵn

Số đơn hàng trên tài liệu của chúng tôi được định dạng như sau:

Điều này luôn bắt đầu bằng các chữ cái in hoa XYB, tiếp theo là dấu gạch ngang, tiếp theo là 8 chữ số, một dấu gạch ngang khác và cuối cùng là 3 chữ cái in hoa ngẫu nhiên.

Ví dụ về số đơn hàng bao gồm:

XYB-12316723-LSH

XYB-98456723-JRD

Để trích xuất số đơn hàng này, chúng ta có thể sử dụng biểu thức chính quy sau:

XYB-\d{8}-[A-Z]{3}

Hãy phân tích biểu thức từng phần một.

Đầu tiên, chúng ta tìm chính xác 3 chữ cái in hoa đầu tiên với ký tự gạch ngang: XYB-

XYB\d{8}-[A-Z]{3}

Sau đó, chúng ta tìm 8 chữ số theo sau bởi một dấu gạch ngang: \d{8}-

XYB-\d{8}-[A-Z]{3}

The \d ký tự, như đã mô tả trước đó, khớp với một chữ số từ 0 đến 9, trong khi \d{8} khớp với một số gồm tám chữ số.

Và cuối cùng, chúng ta đang tìm kiếm bất kỳ 3 chữ cái in hoa nào: [A-Z]{3}

XYB-\d{8}-[A-Z]{3}

Đây là cách PaperOffice sẽ nhận diện các số đơn hàng sau đây:

XYB-12316723-LSH

XYB-98456723-JRD

XYB-975432671829

ZYB-12342176-ZHD

hai chữ cái in hoa đầu tiên XYB-12316723-LSHXYB-98456723-JRD

nhận diện.

Chúng tôi đã chuẩn bị một liên kết đến Regex101 cho ví dụ này, trong đó biểu thức chính quy vừa được mô tả được liệt kê cùng với 4 ví dụ. Bạn có thể thấy rằng chỉ có hai trong số các số đơn hàng đưa ra đáp ứng yêu cầu của chúng tôi.

Đọc số lượng hàng nhờ REGEX

Số lượng hàng trên tài liệu của chúng tôi được định dạng như sau:

Luôn bắt đầu bằng hai chữ cái in hoa, theo sau bởi một dấu gạch ngang, rồi đến 6 chữ số.

Đọc hóa đơn PaperOffice bằng Regex

Ví dụ về số lượng hàng sẽ là:

MS-863398

DS-452829

Để trích xuất các số lượng hàng này, chúng ta có thể sử dụng biểu thức chính quy sau:

[A-Z]{2}-\d{6}

PaperOffice có thể số hóa tài liệu của bạn và tích hợp với các hệ thống của bạn để tự động hóa việc trích xuất dữ liệu từ hóa đơn và các tài liệu khác mà không cần phải viết và duy trì hàng tấn mã.

Liên hệ với chúng tôi để thảo luận về các trường hợp sử dụng của bạn và tìm hiểu thêm về cách PaperOffice có thể giúp bạn trở nên cạnh tranh hơn trong kỷ nguyên số.

Bắt đầu dễ dàng hơn bạn nghĩ.

Bạn vẫn lo lắng về việc không thành công? Hãy đọc các nghiên cứu trường hợp từ khách hàng của chúng tôi về việc tích hợp PaperOffice vào cuộc sống kinh doanh của bạn và tự thuyết phục mình về sự đơn giản hoặc đơn giản là đăng ký cài đặt thử nghiệm.

Văn phòng không giấy tờ phù hợp với ai?

Câu trả lời nhanh và dễ dàng cho câu hỏi này là: dành cho mọi công ty. Tất cả các lĩnh vực kinh doanh và quy mô đều được hưởng lợi từ văn phòng không giấy tờ, từ các doanh nghiệp vừa và nhỏ (SMEs) và startup đến các công ty lớn. Tuy nhiên, việc chuyển đổi đặc biệt có giá trị đối với các công ty vừa và nhỏ: Việc giảm bớt nỗ lực xử lý và chi phí giải phóng ngân sách cần thiết cho các chất xúc tác tăng trưởng tiếp theo.

Tôi có thể sử dụng nhà cung cấp DMS dựa trên đám mây cho văn phòng không giấy tờ của mình không?

Không. Một yếu tố khác đã được mọi người nhắc đến nhiều nhất kể từ khi GDPR có hiệu lực vào năm 2018 là bảo vệ dữ liệu. Các giải pháp và phần mềm DMS được sử dụng để xử lý, quản lý và lưu trữ các tài liệu thường chứa dữ liệu nhạy cảm, cá nhân. Trong trường hợp vi phạm GDPR, nhà lập pháp quy định các khoản phạt nặng.

  • Lợi ích biện minh cho nỗ lực và chi phí
    Làm việc kỹ thuật số và đưa các tài liệu cũ vào kỷ nguyên mới sẽ là khoản đầu tư tốt nhất để tiết kiệm một lượng lớn thời gian, tiền bạc và căng thẳng trong tương lai.
  • Bạn cần một người am hiểu
    Bạn không cần chuyên viên IT riêng để tận hưởng tất cả những lợi ích của quá trình số hóa.
    Điều bạn cần là một đối tác phù hợp bên cạnh, người nhờ vào kinh nghiệm của mình có thể triển khai chính xác những gì bạn cần. Tránh gây hoang mang và thay vì chọn các bài thuyết trình PowerPoint hào nhoáng mà chưa thực sự kiểm chứng, hãy thử nghiệm trước.
  • Phần cứng thường đã có sẵn
    Kinh nghiệm cho thấy hầu hết mọi hoạt động, công ty và doanh nghiệp đều có một máy photocopy lớn không tận dụng hết tiềm năng của nó. Những thiết bị này thích quét hàng loạt, chịu được kẹp giấy và có thể là nền tảng cho bước khởi đầu kỹ thuật số mà không cần đầu tư máy quét.
  • Rẻ hơn dự kiến với hệ thống DMS phù hợp
    Tránh các bẫy chi phí với hệ thống DMS/ECM nơi bạn phụ thuộc hoàn toàn vào nhà sản xuất. Không thỏa hiệp khi nói đến khả năng tự quản lý của chính bạn, chẳng hạn như tự dạy tài liệu và tự thực hiện các cài đặt. Nếu cần hỗ trợ, nhà sản xuất sẽ sẵn lòng giúp đỡ, nhưng hãy giữ sự độc lập.
  • Tự động hóa kỹ thuật số là tương lai
    Các quy trình trong tương lai sẽ hoàn toàn giống nhau, nhưng được tự động hóa hoàn toàn.
    Hóa đơn đến? Quy trình làm việc được kích hoạt và mọi thứ diễn ra theo đúng lộ trình đã định.
    Tìm kiếm qua tất cả 1000 thư mục? Không vấn đề gì, vì bạn có Google của riêng mình!

Về tác giả

Nhóm PaperOffice AI

Nội dung & Nghiên cứu

Đội ngũ chuyên gia của chúng tôi gồm các chuyên gia AI, kỹ sư và chuyên gia ngành báo cáo về các phát triển mới nhất trong AI, AI-IDP và tự động hóa tài liệu thông minh – với hơn 24 năm kinh nghiệm.

Chia sẻ bài viết này LinkedIn

Đừng bỏ lỡ bài viết tiếp theo

Nhận những hiểu biết mới nhất về AI và tự động hóa tài liệu được gửi trực tiếp vào hộp thư đến của bạn.

Sẵn sàng cho tương lai?

Khám phá cách PaperOffice AI có thể cách mạng hóa quy trình xử lý tài liệu của bạn.

Quý vị muốn dùng thử PaperOffice ở đâu?

Máy tính và điện thoại thông minh đã được kết nối: Không gian làm việc trên máy, thu thập trên điện thoại.

Phiên bản dùng thử của bạn đã sẵn sàng

Bạn muốn bắt đầu ở đâu?

Không gian làm việc đầy đủ được tối ưu hóa cho máy tính. Phiên bản di động phù hợp để thu thập, kiểm tra và phê duyệt tài liệu.

app.paperoffice.ai

Bắt đầu trên máy tính

Chúng tôi sẽ gửi liên kết truy cập cá nhân của bạn đến địa chỉ email của bạn.

Đăng ký miễn phí Mở ứng dụng Ứng dụng PaperOffice Sản phẩm đầy đủ: web, máy tính và di động. Thu thập, tổ chức, tìm kiếm và làm việc trên tài liệu cùng nhóm. Cần tài khoản miễn phí Mở Playground Playground Thử các chức năng được chọn ngay — không đăng ký, với khóa API demo bị hạn chế. Không cần đăng ký, nhưng có khóa API demo bị hạn chế