

OCR в DLP: распознавание текста на сканах и фото
План статьи
Сотрудник может обойти текстовый контроль, отправив коллеге или контрагенту не сам документ, а его фотографию или скриншот. Для классической DLP-системы без функции распознавания этот файл — «просто картинка», не содержащая текста. Решить проблему позволяет OCR: технология преобразует изображение в машиночитаемый текст, который система уже умеет анализировать, — и закрывает слепую зону. Когда речь идет про такую задачу, как информационная безопасность бизнеса, игнорировать графические файлы в трафике нельзя.
Что такое OCR и как работает оптическое распознавание символов
OCR (от англ. Optical Character Recognition — оптическое распознавание символов) — это технология преобразования изображения с текстом в машиночитаемый формат. Иными словами, OCR распознавание переводит пиксели, формирующие буквы на фото или скане, в текстовые символы, с которыми могут работать компьютерные программы.
Процесс работы технологии состоит из нескольких базовых этапов. Сначала выполняется предобработка изображения: система корректирует контраст, устраняет шум, выравнивает перекос. Затем происходит сегментация — выделение отдельных строк, слов и символов. На финальном этапе алгоритм распознает каждый символ и формирует итоговый текстовый результат.
Традиционно оптическое распознавание символов применяется для оцифровки документов, автоматизации ввода данных и перевода бумажных архивов в электронный вид. Однако в контексте ИБ эта технология обретает новую ценность. Она перестает быть просто инструментом преобразования изображения в текст и становится критически важным механизмом контроля, без которого защита корпоративных периметров теряет смысл.
Почему изображения — это слепая зона для защиты от утечек
Стандартный контентный анализ, встроенный в DLP-системы, отлично читает электронные документы, письма и сообщения. Но он не «видит» текст, зашитый внутри графических файлов. Это создает серьезный канал утечки: сотрудник понимает, что текстовые файлы проверяются, и использует картинки для обхода политик безопасности.
Типовые сценарии/утечки через изображение включают:
- вложение комерческих документов в e-mail по неосторожности или умышленно;
- создание скриншота экрана с конфиденциальной перепиской или CRM-системой (от англ. Customer Relationship Management — система управления отношениями с клиентами) и передача его через мессенджер;
- пересылку скана паспорта, СНИЛС (страхового номера индивидуального лицевого счета) или договора в виде картинки;
- вставку графического файла с реквизитами в тело письма.
Как OCR встроен в DLP и что он распознает
Принцип интеграции технологии в DLP прозрачен, но эффективен. Система перехватывает графический файл в сетевом трафике или на рабочей станции, прогоняет его через внутренний модуль OCR, а извлеченный текст уходит на обработку контентного анализа. Дальше система ищет ключевые слова, шаблоны, персональные данные (ПДн) — иными словами, «картинка» становится проверяемой.
| Тип изображения | Что на нем | Риск утечки | Что делает DLP с OCR |
|---|---|---|---|
| Фото документа | Договор, приказ, справка | Обход текстового контроля | Распознает текст → контентный анализ |
| Скан паспорта, СНИЛС | Персональные данные | Утечка ПДн (152-ФЗ) | Находит шаблоны персональных данных и помечает документ как содержащий ПДн |
| Скриншот переписки или экрана | Реквизиты, пароли, данные клиентов | Утечка через мессенджеры | Извлекает текст и применяет политики безопасности |
| Изображение с номерами банковских карт | Платежные данные | Финансовая утечка | Распознает номер карты, применяет политику безопасности и формирует оповещение |
Связка OCR + контентный анализ + поиск ПДн
OCR работает не сам по себе, а как вход для остальных методов проверки. Технология лишь извлекает машиночитаемый текст, а дальнейшее решение принимают другие модули DLP. Контроль изображений в DLP становится эффективным, когда распознанный текст сверяется с регулярными выражениями (для поиска номеров карт) или списками ключевых слов. Этот комплексный подход помогает реализовать полный цикл оценки передаваемой информации и предупредить негативные сценарии утечки данных.
Ограничения и точность распознавания
Несмотря на очевидную пользу, оптическое распознавание символов не является универсальным решением. Точность распознавания зависит от качества исходного материала: разрешения изображения, уровня шума, контрастности, освещения, перекоса страницы, степени сжатия и даже от того, перекрыт ли текст посторонними объектами. Дополнительные сложности возникают при обработке рукописного текста, декоративных шрифтов, а также документов на редких языках и с экзотическими письменностями.
Ложные срабатывания и пропуски возможны, поэтому оптическое распознавание символов должно работать в связке с другими методами. DLP-система обрабатывает документы комплексно.
| Технология | Что распознает | Применение |
|---|---|---|
| Контентный анализ | Ключевые слова, термины | Классификация данных |
| OCR | Текст на изображениях и сканах | Контроль фотографий документов |
| Цифровые отпечатки | Фрагменты эталонных документов | Защита даже части файла |
Практический вывод очевиден: OCR закрывает конкретный канал (текст в картинках), но не заменяет весь стек DLP. Обработка документов должна строиться на сочетании технологий.
Организационная и правовая сторона контроля изображений
Внедрение технического контроля требует проработки организационной базы. В политике ИБ должен быть четко прописан регламент: какие изображения и в каких каналах подлежат проверке. Это особенно актуально в эпоху массового перехода на удаленную работу, когда корпоративный трафик выходит за пределы офиса.
Контроль коммуникаций сотрудников правомерен только при соблюдении юридических формальностей. Во-первых, средство контроля должно быть объявлено служебным в локальном нормативном акте (политика ИБ или регламент). Во-вторых, факт мониторинга закрепляется в трудовом договоре, а сотрудник должен быть ознакомлен с этим под подпись. В-третьих, должна быть определена конкретная цель обработки данных.
Баланс интересов строится на том, что контроль ради защиты персональных данных (ПДн, согласно 152-ФЗ) и коммерческой тайны (согласно 98-ФЗ) легитимен. Проверка сканов паспортов в трафике — это тоже обработка ПДн, и она должна быть обоснована той же целью. Таким образом, защита от утечек должна опираться на твердую правовую базу.
Чек-лист: когда OCR в DLP реально нужен вашей компании
- Сотрудники активно обмениваются фотографиями документов через рабочую почту и мессенджеры.
- В компании есть клиентские сервисы, куда клиенты присылают сканы паспортов и договоров (банки, страхование, недвижимость).
- Организация работает с большим объемом коммерческой тайны, а доступ к корпоративным базам данных открыт широкому кругу лиц.
- В штате есть удаленные сотрудники, использующие личные устройства для решения рабочих задач (BYOD — от англ. Bring Your Own Device, «принеси свое устройство»).
- Ранее фиксировались инциденты, когда данные уходили через документы с изображениями.
DLP-система SecureTower использует технологию OCR (отдельный OCR-модуль) для распознавания текста на изображениях и сканах: система обнаруживает текстовые данные, переданные в виде картинки, распознает изображение и применяет к полученному тексту политики безопасности, заданные в Консоли клиента.
Для файлов со значительными дефектами изображения предусмотрена тонкая настройка распознавания. После извлечения текст прогоняется через контентный анализ, поиск паспортов, СНИЛС и банковских карт, а также цифровые отпечатки. Это закрывает канал утечки через фото и скриншоты, слепой для обычного текстового контроля.
SecureTower работает на собственной инфраструктуре, а полнофункциональный триал на 30 дней доступен бесплатно для юридических лиц.
Заключение
Без оптического распознавания символов любая картинка со скриншотом или фото документа остается слепой зоной для DLP. Внедрение OCR закрывает реальный канал утечки, превращая графические файлы в анализируемый текст. Однако важно понимать, что технология работает исключительно в связке с контентным анализом, цифровыми отпечатками и грамотно выстроенными регламентами. Только такой комплексный подход способен обеспечить реальную защиту данных. Если вы планируете укрепить информационную безопасность в 2026 году, учет графических каналов утечки должен стать обязательной частью стратегии.
FAQ
- Зачем DLP-системе нужен OCR?
Без OCR DLP не видит текст внутри фотографий и сканов. Технология извлекает текст из картинки, позволяя контентному анализу проверять файлы на наличие конфиденциальных данных и персональной информации.
- Может ли сотрудник обойти контроль, отправив фото документа вместо файла?
Если в DLP не внедрен OCR, то да, такой трюк сработает — система воспримет фото как безобидный графический файл. DLP с модулем OCR распознает текст на фото и применит к нему стандартные политики безопасности.
- Как DLP находит паспорт или СНИЛС на скане?
DLP прогоняет изображение через OCR, получая машиночитаемый текст. Затем контентный анализатор проверяет этот текст по регулярным выражениям — шаблонам, характерным для номеров паспорта или СНИЛС, — и помечает найденное как персональные данные. Такая проверка опирается на ту же логику, что и защита баз данных в целом: искать не документ целиком, а конкретные форматные признаки внутри него.
- Распознает ли OCR рукописный текст?
Распознавание рукописного текста — сложная задача. В DLP-системах OCR преимущественно ориентируется на печатный и машиночитаемый текст, где точность максимальна.
- Безопасно ли пользоваться бесплатными онлайн-сервисами OCR для рабочих документов?
Нет, это прямой канал утечки. Загружая рабочий скан в публичный онлайн-конвертер, вы передаете данные третьей стороне. Корпоративные документы должны обрабатываться только внутри контура компании.
- Контролирует ли DLP скриншоты переписки?
Да, если скриншот передается через контролируемые каналы связи (почта, мессенджеры). Модуль OCR извлечет текст из скриншота, и DLP проверит его на наличие ключевых слов или нарушений политик.
- Как OCR помогает понять, как распознать инсайдера?
Технология позволяет фиксировать попытки выноса корпоративных данных с помощью скриншотов или фотографий. Если лояльный на первый взгляд сотрудник внезапно начинает пересылать фото клиентских баз, DLP с модулем OCR распознает этот текст и мгновенно подаст сигнал, помогая вычислить инсайдеров и кротов в вашей организации.
- Может ли система проверить графический файл, если он спрятан в архиве?
Да, современные системы безопасности могут осуществлять анализ запароленных архивов. DLP извлекает файлы из архива (при известном пароле или перехвате), после чего OCR-модуль распознает текст на всех найденных внутри изображениях, предотвращая утечки даже в сложных форматах.



