В текущей статье мы покажем вам, как использовать регулярные выражения для получения преимуществ автоматизированной обработки документов. Это относится в частности к документам компаний любой отрасли.
Мы приводим точные примеры регулярных выражений и пошагово объясняем, что они означают и как вы можете их использовать.
Таким образом, вы можете повысить свою операционную эффективность, уменьшить количество человеческих ошибок за счет более высокой точности, снизить текущие затраты, сохранить целостность данных и улучшить безопасность данных.
Текущая статья расширяет первую часть о интеллектуальной обработке документов,здесь вы переходите непосредственно к статье.
Извлечение конкретных элементов данных из документов может быть чрезвычайно дорогой и трудоемкой задачей. Часто сканы документов отправляются крупным аутсорсинговым компаниям по вводу данных, где данные вводятся вручную.
Однако у этого подхода есть несколько недостатков, а именно:
- Это может поставить под угрозу безопасность документов
- В процессы рабочего процесса вносится задержка
- По сравнению с автоматическим извлечением, ручная индексация является медленным процессом
- Ручная индексация плохо масштабируется на крупных проектах
- Ручная индексация может внести ошибки в данные
- Если документ изменен, весь процесс начинается заново
И многое другое.
Несмотря на широкое распространение сканирования, значительная часть бизнес-транзакций по-прежнему основана на бумажных документах. По оценкам, 85% счетов все еще выставляются на бумаге.
Кроме того, существуют огромные объемы существующей бумаги, которые необходимо хранить в больших складах!
Что такое регулярное выражение?
Регулярные выражения, также известные как «REGEX», являются мощным инструментом для поиска и обработки текста. Они позволяют распознавать и редактировать сложные шаблоны в тексте.
Регулярное выражение состоит из комбинации обычных букв и специальных метасимволов, которые выполняют особые функции.
Регулярные выражения также можно использовать для замены или обработки текста. Например, регулярное выражение может быть использовано.
Они являются очень мощным инструментом для обработки слов и автоматизации задач.
Как регулярные выражения могут помочь автоматизировать бизнес?
Увеличение количества цифровых документов различных типов, с разными правилами именования и без достаточной системы поиска усложняет процесс поиска и извлечения информации о документах из определенного контента, особенно когда речь идет о неклассифицированных документах: поиск становится неточным и занимает много времени.
Регулярные выражения (regex) обеспечивают быстрый и мощный способ поиска, извлечения и замены конкретных данных в документах. По сути, регулярное выражение — это специальная текстовая строка, используемая для описания шаблона поиска.
Таким образом осуществляется поиск и чтение содержимого документа по заданной строке. Регулярные выражения — это способ определения шаблонов в информации с помощью специальных символов.
Метод Regex лучше всего подходит для документов, в которых позиции считываемых значений могут варьироваться, а простые шаблоны документов не работают.
Список простых выражений можно найти в нашем ComDesk.

Как создать регулярные выражения?
Регулярные выражения можно составлять по-разному в зависимости от типа искомой закономерности.
Используйте метасимволы, такие как ., *, +, ?, ^, $, [], и [a-z], чтобы обозначать определенные типы символов или шаблонов.
Используйте необязательные части: используйте знак вопроса (?) или звездочку (*), чтобы сделать части шаблона необязательными.
Используйте группы: используйте скобки для группировки частей шаблона и обработки их как единого целого.
Важно отметить, что правила регулярных выражений могут различаться в зависимости от языка программирования. Поэтому важно читать документацию используемых инструментов. RegEx, написанный для PaperOffice, должен быть совместим с ECMAScript и PCRE2.
Совет
На YouTube также есть видео на тему «Автоматизированное ХРАНЕНИЕ документов Часть 3 / REGEX & Переменные / Обработка счетов-фактур и управление документами», которое легко и понятно объясняет этот процесс:
Как извлечь информацию из моего документа с помощью REGEX?
Практические примеры
В данной статье мы демонстрируем, как вы можете извлекать любые данные из документа благодаря использованию многосоставных регулярных выражений в PaperOffice и автоматически сохранять их в качестве ключевых слов документа.
Ниже приведен пример документа с конкретной датой. Этот документ является счетом-фактурой. Шаблон даты в нашем документе имеет следующий формат:

Месяц, записанный буквами, причем первая буква всегда заглавная, затем следует пробел, далее день, запятая, еще один пробел и год.
Например:Sep 20, 2019 или Mar 05, 2022
Чтобы извлечь эту дату, мы можем использовать следующее регулярное выражение (REGEX):
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})
Давайте разберем выражение на отдельные группы. Эти группы разделены одинарными скобками().
В первой группе мы ищем три буквы месяца: ([A-Z][a-z]{2})
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Извлечение месяца
- [A-Z] Эта часть означает, что мы ищем заглавную букву от A до Z. Например, букву"S" из"Sept". Следует отметить, что заглавные и строчные буквы обрабатываются отдельно.
- [a-z]{2} Эта часть означает, что мы ищем две строчные буквы от a до z. Это будут"ep" из "Sep".
Затем мы ищем пробел с помощью следующей строки:\s
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Извлечь дату
Во второй группе ищем обозначение дня цифрами: (0[1-9]|[12][0-9]|3[01])
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
День должен быть отделен тремя разными элементами.
Поскольку мы не знаем, какая дата может встретиться в документе, это может быть первый день (01) или последний день (31) месяца, поэтому необходимо учитывать разные варианты.
Они разделяются символом "|".
Пример: (1|2|3) = 1 или 2 или 3.
Список допустимых символов следует в квадратных скобках. Несколько квадратных скобок соответствуют нескольким символам. Если выражение должно описывать несколько символов, они просто записываются друг за другом. Затем ввод сравнивается с вашим выражением слева направо.
Конечно, не все числа нужно перечислять. Однако в целом все выражение в скобках обозначает только один символ.
-
0[1-9]Эта строка означает, что число может начинаться с "0", за которым следует цифра от 1 до 9. Таким образом, мы получаем любое число от 01 до 09.
Строка ищет шаблон числа, который начинается с нуля. Если в вашем документе обычно указана дата "5 марта 2022 года", то есть без цифры "0" перед цифрой "5", то "0" в строке опускается.
- [12][0-9]Эта строка означает, что число может начинаться с "1" или "2", за которым следует любая цифра от 0 до 9. Результатом может быть любое число от 10 до 29.
- 3[01]Эта строка означает, что число может начинаться с "3", за которым следует "0" или "1". Результатом может быть 30 или 31.
После того как варианты для дня определены, должно быть определено выражение для года.
Теперь мы ищем запятую и пробел: ,\s
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s (20\d{2})
Извлечь год
В последней группе мы ищем год: (20\d{2})
([A-Z][a-z]{2})\s(0[1-9]|[12][0-9]|3[01]),\s(20\d{2})
Мы начинаем искать любой год, но знаем, что он будет ≥ 2000.
- 20Эта строка означает, что мы ищем любой год, начинающийся ровно с 20.
- \d{2}Эта строка означает, что мы ищем возможное двузначное число, то есть от "00" до "99".
Например, символ \d соответствует цифре от 0 до 9, в то время как символ \d{2} соответствует двузначному числу.

Если регулярное выражение теперь используется в PaperOffice, конечным результатом является дата "Sep 20, 2019".
Таким образом, любую дату можно извлечь из документа, не зная исходного значения. Эти группы также можно использовать где угодно и свободно перемещать для чтения других форматов дат.
Вот еще один пример:

Дата начинается с дня, за которым следует месяц, состоящий из букв, причем первая буква всегда заглавная, затем точка, еще один пробел и год.
Для извлечения этой даты можно использовать описанное выше регулярное выражение (REGEX) с дополнительным уточнением, так как во втором примере после месяца ставится точка.
Это можно указать следующей строкой символов: \.
Итак, полное выражение выглядит так:
(0[1-9]|[12][0-9]|3[01])\s([A-Z][a-z]{2})\.\s(20\d{2})
Вы всегда можете проверить созданное регулярное выражение, перейдя на страницу https://regex101.com для проверки вместе с вашим вставляемым текстом. Regex101 не только проверит правильность вашего регулярного выражения, но и объяснит большую его часть.
Итак, вы можете использовать различные наборы символов для любых целей.
Чтение номера заказа с помощью REGEX
В качестве еще одного примера мы хотели бы прочитать номер заказа из документа.

Номер заказа в нашем документе имеет следующий формат:
Он всегда начинается с заглавных букв XYB, за которыми следует дефис, затем 8 цифр, еще один дефис и, наконец, 3 случайные заглавные буквы.
Примеры номеров заказов:
XYB-12316723-LSH
XYB-98456723-JRD
Для извлечения этого номера заказа мы можем использовать следующее регулярное выражение:
XYB-\d{8}-[A-Z]{3}
Давайте разберем это выражение по частям.
Сначала мы ищем ровно первые 3 заглавные буквы с символом дефиса: XYB-
XYB\\d{8}-[A-Z]{3}
После этого мы ищем 8 цифр, за которыми следует еще один дефис: \\d{8}-
XYB-\\d{8}-[A-Z]{3}
The \\d символ, как описано ранее, соответствует цифре от 0 до 9, в то время как символ \\d{8} соответствует восьмизначному числу.
И наконец, мы ищем любые 3 заглавные буквы: [A-Z]{3}
XYB-\\d{8}-[A-Z]{3}
Так PaperOffice выглядел бы следующие номера заказов:
XYB-12316723-LSH
XYB-98456723-JRD
XYB-975432671829
ZYB-12342176-ZHD
первые два XYB-12316723-LSH и XYB-98456723-JRD
распознать.
Мы подготовили ссылку на Regex101 для этого примера, в котором приведенное выше регулярное выражение показано с 4 примерами. Вы можете видеть, что только два из указанных номеров заказов соответствуют нашим требованиям.
Чтение номеров статей благодаря REGEX
Номер статьи на нашем документе отформатирован следующим образом:
Это всегда начинается с двух заглавных букв, за которыми следует дефис, а затем 6 цифр.

Примеры номеров статей:
MS-863398
DS-452829
Для извлечения этих номеров статей мы можем использовать следующее регулярное выражение:
[A-Z]{2}-\\d{6}
PaperOffice может оцифровать ваши документы и интегрироваться с вашими системами для автоматизации извлечения данных из счетов-фактур и другой документации без необходимости писать и поддерживать множество кода.
Свяжитесь с нами, чтобы обсудить ваши варианты использования и узнать больше о том, как PaperOffice может помочь вам стать более конкурентоспособными в цифровую эпоху.
Начать работу проще, чем вы думаете.
Вы все еще беспокоитесь о том, что не справитесь? Прочтите кейсы наших клиентов об интеграции PaperOffice в вашу бизнес-жизнь и убедитесь в простоте или просто подайте заявку на тестовую установку.
Для кого подходит безбумажный офис?
Быстрый и простой ответ на этот вопрос: для любой компании. Все отрасли и размеры бизнеса выигрывают от перехода к безбумажному офису, от малых предприятий и стартапов до крупных компаний. Однако особенно ценным преобразование является для малых и средних предприятий: Снижение усилий и затрат на обработку высвобождает бюджет, необходимый для дальнейших драйверов роста.
Могу ли я использовать облачного поставщика DMS для своего безбумажного офиса?
Нет. Еще одним фактором, который стал предметом обсуждения всех с момента вступления в силу GDPR в 2018 году, является защита данных. Решения и программное обеспечение DMS используются для обработки, управления и хранения документов, которые часто содержат конфиденциальные персональные данные. В случае нарушений GDPR законодатель предусматривает высокие штрафы.
-
Преимущества оправдывают усилия и затраты
Работа в цифровом формате и перевод старых документов в новую эпоху станет лучшей инвестицией, которая сэкономит огромное количество времени, денег и нервов в будущем. -
Вам нужен человек, который разбирается
Чтобы воспользоваться всеми преимуществами цифровизации, вам не нужен собственный ИТ-специалист.
Вам нужен правильный партнер рядом с вами, который благодаря своему опыту сможет реализовать именно то, что вам нужно. Избегайте запугивания и выбирайте тестовые позиции вместо модных презентаций PowerPoint, которые не были действительно протестированы. -
Обычно оборудование уже имеется
Опыт показал, что почти в каждом предприятии, компании и организации есть большой копир, который не использует свой потенциал. Эти устройства любят массовое сканирование, терпимы к скрепкам и могут стать основой для цифрового старта без инвестиций в сканер. -
Дешевле, чем ожидалось, с правильной DMS
Избегайте ловушек затрат с системами DMS / ECM, где вы находитесь в полной зависимости от производителей. Не идите на компромиссы в вопросах собственных возможностей администрирования, таких как обучение документов и самостоятельная настройка. Если вам нужна помощь, производитель будет рад помочь вам, но оставайтесь независимыми. -
Цифровая автоматизация — это будущее
Процедуры в будущем будут полностью идентичны, но полностью автоматизированы.
Приходит счет? Рабочий процесс запускается, и все идет по своему определенному пути.
Искать во всех 1000 папках? Нет проблем, ведь у вас есть свой Google!
