Перейти к содержимому
Обзор Обзор Новости Новости
Поделиться
Технологии 24 октября 2022 г. 9 мин

Использование регулярных выражений REGEX для автоматического сбора и извлечения данных (Часть 2)

Благодаря OCR, ИИ и REGEX в PaperOffice интеллектуальная обработка документов может быть полностью гарантирована.

Доверие ведущих компаний по всему миру

Все статьи Технологии

В текущей статье мы покажем вам, как использовать регулярные выражения для получения преимуществ автоматизированной обработки документов. Это относится в частности к документам компаний любой отрасли.

Мы приводим точные примеры регулярных выражений и пошагово объясняем, что они означают и как вы можете их использовать.

Таким образом, вы можете повысить свою операционную эффективность, уменьшить количество человеческих ошибок за счет более высокой точности, снизить текущие затраты, сохранить целостность данных и улучшить безопасность данных.

Текущая статья расширяет первую часть о интеллектуальной обработке документов,здесь вы переходите непосредственно к статье.

Извлечение конкретных элементов данных из документов может быть чрезвычайно дорогой и трудоемкой задачей. Часто сканы документов отправляются крупным аутсорсинговым компаниям по вводу данных, где данные вводятся вручную.

Однако у этого подхода есть несколько недостатков, а именно:

  • Это может поставить под угрозу безопасность документов
  • В процессы рабочего процесса вносится задержка
  • По сравнению с автоматическим извлечением, ручная индексация является медленным процессом
  • Ручная индексация плохо масштабируется на крупных проектах
  • Ручная индексация может внести ошибки в данные
  • Если документ изменен, весь процесс начинается заново

И многое другое.

Несмотря на широкое распространение сканирования, значительная часть бизнес-транзакций по-прежнему основана на бумажных документах. По оценкам, 85% счетов все еще выставляются на бумаге.

Кроме того, существуют огромные объемы существующей бумаги, которые необходимо хранить в больших складах!

Что такое регулярное выражение?

Регулярные выражения, также известные как «REGEX», являются мощным инструментом для поиска и обработки текста. Они позволяют распознавать и редактировать сложные шаблоны в тексте.

Регулярное выражение состоит из комбинации обычных букв и специальных метасимволов, которые выполняют особые функции.

Регулярные выражения также можно использовать для замены или обработки текста. Например, регулярное выражение может быть использовано.

Они являются очень мощным инструментом для обработки слов и автоматизации задач.

Как регулярные выражения могут помочь автоматизировать бизнес?

Увеличение количества цифровых документов различных типов, с разными правилами именования и без достаточной системы поиска усложняет процесс поиска и извлечения информации о документах из определенного контента, особенно когда речь идет о неклассифицированных документах: поиск становится неточным и занимает много времени.

Регулярные выражения (regex) обеспечивают быстрый и мощный способ поиска, извлечения и замены конкретных данных в документах. По сути, регулярное выражение — это специальная текстовая строка, используемая для описания шаблона поиска.

Таким образом осуществляется поиск и чтение содержимого документа по заданной строке. Регулярные выражения — это способ определения шаблонов в информации с помощью специальных символов.

Метод Regex лучше всего подходит для документов, в которых позиции считываемых значений могут варьироваться, а простые шаблоны документов не работают.

Список простых выражений можно найти в нашем ComDesk.

Коллекция примеров регулярных выражений PaperOffice

Как создать регулярные выражения?

Регулярные выражения можно составлять по-разному в зависимости от типа искомой закономерности.

Используйте метасимволы, такие как ., *, +, ?, ^, $, [], и [a-z], чтобы обозначать определенные типы символов или шаблонов.

Используйте необязательные части: используйте знак вопроса (?) или звездочку (*), чтобы сделать части шаблона необязательными.

Используйте группы: используйте скобки для группировки частей шаблона и обработки их как единого целого.

Важно отметить, что правила регулярных выражений могут различаться в зависимости от языка программирования. Поэтому важно читать документацию используемых инструментов. RegEx, написанный для PaperOffice, должен быть совместим с ECMAScript и PCRE2.

Совет

На YouTube также есть видео на тему «Автоматизированное ХРАНЕНИЕ документов Часть 3 / REGEX & Переменные / Обработка счетов-фактур и управление документами», которое легко и понятно объясняет этот процесс:

Видео PaperOffice

Как извлечь информацию из моего документа с помощью REGEX?

Практические примеры

В данной статье мы демонстрируем, как вы можете извлекать любые данные из документа благодаря использованию многосоставных регулярных выражений в PaperOffice и автоматически сохранять их в качестве ключевых слов документа.

Ниже приведен пример документа с конкретной датой. Этот документ является счетом-фактурой. Шаблон даты в нашем документе имеет следующий формат:

Извлечение данных счета PaperOffice с помощью регулярных выражений

Месяц, записанный буквами, причем первая буква всегда заглавная, затем следует пробел, далее день, запятая, еще один пробел и год.

Например:Sep 20, 2019 или Mar 05, 2022

Чтобы извлечь эту дату, мы можем использовать следующее регулярное выражение (REGEX):

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})

Давайте разберем выражение на отдельные группы. Эти группы разделены одинарными скобками().

В первой группе мы ищем три буквы месяца: ([A-Z][a-z]{2})

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})

Извлечение месяца

  • [A-Z] Эта часть означает, что мы ищем заглавную букву от A до Z. Например, букву"S" из"Sept". Следует отметить, что заглавные и строчные буквы обрабатываются отдельно.
  • [a-z]{2} Эта часть означает, что мы ищем две строчные буквы от a до z. Это будут"ep" из "Sep".

Затем мы ищем пробел с помощью следующей строки:\s

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})

Извлечь дату

Во второй группе ищем обозначение дня цифрами: (0[1-9]|[12][0-9]|3[01])

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})

День должен быть отделен тремя разными элементами.
Поскольку мы не знаем, какая дата может встретиться в документе, это может быть первый день (01) или последний день (31) месяца, поэтому необходимо учитывать разные варианты.
Они разделяются символом "|".
Пример: (1|2|3) = 1 или 2 или 3.

Список допустимых символов следует в квадратных скобках. Несколько квадратных скобок соответствуют нескольким символам. Если выражение должно описывать несколько символов, они просто записываются друг за другом. Затем ввод сравнивается с вашим выражением слева направо.

Конечно, не все числа нужно перечислять. Однако в целом все выражение в скобках обозначает только один символ.

  • 0[1-9]Эта строка означает, что число может начинаться с "0", за которым следует цифра от 1 до 9. Таким образом, мы получаем любое число от 01 до 09.
    Строка ищет шаблон числа, который начинается с нуля. Если в вашем документе обычно указана дата "5 марта 2022 года", то есть без цифры "0" перед цифрой "5", то "0" в строке опускается.
  • [12][0-9]Эта строка означает, что число может начинаться с "1" или "2", за которым следует любая цифра от 0 до 9. Результатом может быть любое число от 10 до 29.
  • 3[01]Эта строка означает, что число может начинаться с "3", за которым следует "0" или "1". Результатом может быть 30 или 31.

После того как варианты для дня определены, должно быть определено выражение для года.

Теперь мы ищем запятую и пробел: ,\s

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})

Извлечь год

В последней группе мы ищем год: (20\d{2})

([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})

Мы начинаем искать любой год, но знаем, что он будет ≥ 2000.

  • 20Эта строка означает, что мы ищем любой год, начинающийся ровно с 20.
  • \d{2}Эта строка означает, что мы ищем возможное двузначное число, то есть от "00" до "99".

Например, символ \d соответствует цифре от 0 до 9, в то время как символ \d{2} соответствует двузначному числу.

Переменные считываются из документа и становятся доступными

Если регулярное выражение теперь используется в PaperOffice, конечным результатом является дата "Sep 20, 2019".

Таким образом, любую дату можно извлечь из документа, не зная исходного значения. Эти группы также можно использовать где угодно и свободно перемещать для чтения других форматов дат.

Вот еще один пример:

Прочитать счет PaperOffice 2 с помощью регулярных выражений

Дата начинается с дня, за которым следует месяц, состоящий из букв, причем первая буква всегда заглавная, затем точка, еще один пробел и год.

Для извлечения этой даты можно использовать описанное выше регулярное выражение (REGEX) с дополнительным уточнением, так как во втором примере после месяца ставится точка.

Это можно указать следующей строкой символов: \.

Итак, полное выражение выглядит так:

(0[1-9]|[12][0-9]|3[01])\s([A-Z][a-z]{2})\.\s(20\d{2})

Вы всегда можете проверить созданное регулярное выражение, перейдя на страницу https://regex101.com для проверки вместе с вашим вставляемым текстом. Regex101 не только проверит правильность вашего регулярного выражения, но и объяснит большую его часть.

Итак, вы можете использовать различные наборы символов для любых целей.

Чтение номера заказа с помощью REGEX

В качестве еще одного примера мы хотели бы прочитать номер заказа из документа.

Переменные считываются из документа и становятся доступными

Номер заказа в нашем документе имеет следующий формат:

Он всегда начинается с заглавных букв XYB, за которыми следует дефис, затем 8 цифр, еще один дефис и, наконец, 3 случайные заглавные буквы.

Примеры номеров заказов:

XYB-12316723-LSH

XYB-98456723-JRD

Для извлечения этого номера заказа мы можем использовать следующее регулярное выражение:

XYB-\d{8}-[A-Z]{3}

Давайте разберем это выражение по частям.

Сначала мы ищем ровно первые 3 заглавные буквы с символом дефиса: XYB-

XYB\\d{8}-[A-Z]{3}

После этого мы ищем 8 цифр, за которыми следует еще один дефис: \\d{8}-

XYB-\\d{8}-[A-Z]{3}

The \\d символ, как описано ранее, соответствует цифре от 0 до 9, в то время как символ \\d{8} соответствует восьмизначному числу.

И наконец, мы ищем любые 3 заглавные буквы: [A-Z]{3}

XYB-\\d{8}-[A-Z]{3}

Так PaperOffice выглядел бы следующие номера заказов:

XYB-12316723-LSH

XYB-98456723-JRD

XYB-975432671829

ZYB-12342176-ZHD

первые два XYB-12316723-LSH и XYB-98456723-JRD

распознать.

Мы подготовили ссылку на Regex101 для этого примера, в котором приведенное выше регулярное выражение показано с 4 примерами. Вы можете видеть, что только два из указанных номеров заказов соответствуют нашим требованиям.

Чтение номеров статей благодаря REGEX

Номер статьи на нашем документе отформатирован следующим образом:

Это всегда начинается с двух заглавных букв, за которыми следует дефис, а затем 6 цифр.

Прочитать счет PaperOffice с помощью регулярных выражений

Примеры номеров статей:

MS-863398

DS-452829

Для извлечения этих номеров статей мы можем использовать следующее регулярное выражение:

[A-Z]{2}-\\d{6}

PaperOffice может оцифровать ваши документы и интегрироваться с вашими системами для автоматизации извлечения данных из счетов-фактур и другой документации без необходимости писать и поддерживать множество кода.

Свяжитесь с нами, чтобы обсудить ваши варианты использования и узнать больше о том, как PaperOffice может помочь вам стать более конкурентоспособными в цифровую эпоху.

Начать работу проще, чем вы думаете.

Вы все еще беспокоитесь о том, что не справитесь? Прочтите кейсы наших клиентов об интеграции PaperOffice в вашу бизнес-жизнь и убедитесь в простоте или просто подайте заявку на тестовую установку.

Для кого подходит безбумажный офис?

Быстрый и простой ответ на этот вопрос: для любой компании. Все отрасли и размеры бизнеса выигрывают от перехода к безбумажному офису, от малых предприятий и стартапов до крупных компаний. Однако особенно ценным преобразование является для малых и средних предприятий: Снижение усилий и затрат на обработку высвобождает бюджет, необходимый для дальнейших драйверов роста.

Могу ли я использовать облачного поставщика DMS для своего безбумажного офиса?

Нет. Еще одним фактором, который стал предметом обсуждения всех с момента вступления в силу GDPR в 2018 году, является защита данных. Решения и программное обеспечение DMS используются для обработки, управления и хранения документов, которые часто содержат конфиденциальные персональные данные. В случае нарушений GDPR законодатель предусматривает высокие штрафы.

  • Преимущества оправдывают усилия и затраты
    Работа в цифровом формате и перевод старых документов в новую эпоху станет лучшей инвестицией, которая сэкономит огромное количество времени, денег и нервов в будущем.
  • Вам нужен человек, который разбирается
    Чтобы воспользоваться всеми преимуществами цифровизации, вам не нужен собственный ИТ-специалист.
    Вам нужен правильный партнер рядом с вами, который благодаря своему опыту сможет реализовать именно то, что вам нужно. Избегайте запугивания и выбирайте тестовые позиции вместо модных презентаций PowerPoint, которые не были действительно протестированы.
  • Обычно оборудование уже имеется
    Опыт показал, что почти в каждом предприятии, компании и организации есть большой копир, который не использует свой потенциал. Эти устройства любят массовое сканирование, терпимы к скрепкам и могут стать основой для цифрового старта без инвестиций в сканер.
  • Дешевле, чем ожидалось, с правильной DMS
    Избегайте ловушек затрат с системами DMS / ECM, где вы находитесь в полной зависимости от производителей. Не идите на компромиссы в вопросах собственных возможностей администрирования, таких как обучение документов и самостоятельная настройка. Если вам нужна помощь, производитель будет рад помочь вам, но оставайтесь независимыми.
  • Цифровая автоматизация — это будущее
    Процедуры в будущем будут полностью идентичны, но полностью автоматизированы.
    Приходит счет? Рабочий процесс запускается, и все идет по своему определенному пути.
    Искать во всех 1000 папках? Нет проблем, ведь у вас есть свой Google!

Об авторе

Команда PaperOffice AI

Контент и исследования

Наша команда экспертов, состоящая из специалистов по ИИ, инженеров и отраслевых экспертов, рассказывает о последних разработках в области ИИ, AI-IDP и интеллектуальной автоматизации документов — обладая более чем 24-летним опытом.

Поделиться этой статьей LinkedIn

Не упустите следующую статью

Получайте последние инсайты об ИИ и автоматизации документов прямо на ваш почтовый ящик.

Готовы к будущему?

Узнайте, как PaperOffice AI может революционизировать ваши процессы обработки документов.

Где вы хотите протестировать PaperOffice?

Компьютер и смартфон связаны: рабочее пространство на компьютере, захват на телефоне.

Ваша пробная версия готова

Где вы хотите начать?

Полный рабочий стол оптимизирован для компьютера. Мобильная версия подходит для захвата, проверки и утверждения документов.

app.paperoffice.ai

Начать на компьютере

Мы отправим вашу личную ссылку для доступа на ваш адрес электронной почты.

Зарегистрироваться бесплатно Открыть приложение Приложение PaperOffice Полный продукт: веб, компьютер и мобильные устройства. Захватывайте, организуйте, ищите документы и работайте с ними вместе с командой. Требуется бесплатная учётная запись Открыть Playground Playground Выбранные функции сразу — с ограниченным демо-ключом API. С ограниченным демо-ключом API