

Поиск конфиденциальных данных на рабочих станциях
План статьи
На компьютерах сотрудников годами копятся выгрузки из CRM, сканы документов, старые версии договоров, отчеты — обычные рабочие файлы, которые никто не удалил. Поиск конфиденциальных данных отвечает на простой вопрос: что из этого на самом деле хранится в компании и где именно.
Почему конфиденциальные данные оседают на рабочих станциях
Рабочий компьютер редко используется строго по задаче. Сотрудник выгрузил данные из CRM для отчета, сохранил копию договора, получил по почте скан паспорта, перенес клиентскую базу в локальную папку «на всякий случай» — а потом просто забыл про нее.
Проблема в том, что такие копии живут вне какого-либо реестра. Файл сохраняют под нейтральным именем, переносят в другую папку, кладут в архив — и найти его вручную можно, только если специально искать. При ручной инвентаризации приходится перебирать диски, каталоги и вложения один за другим, и к моменту, когда проверка закончится, данные успеют устареть еще раз.
Особенно неприятная ситуация — когда конфиденциальные сведения остаются у сотрудника, которому они уже не нужны по работе. Забытая выгрузка клиентской базы на его диске — это лишнее место хранения ПДн, о котором компания даже не знает, а значит не может обеспечить безопасность базы данных, и лишний риск утечки, и потенциальное нарушение требований к обработке персональных данных.
Чаще всего забытые копии находятся:
- в локальных папках пользователей и на рабочем столе;
- в каталогах с выгрузками из CRM и других корпоративных систем;
- в сетевых папках для обмена файлами;
- в архивах и резервных копиях;
- во «временных» и промежуточных версиях документов.
Поиск по имени файла здесь не спасает. Конфиденциальный документ вполне может содержать персональные данные, а скан паспорта — быть просто картинкой без единого слова в названии.
Что такое поиск конфиденциальных данных и зачем он нужен
Discovery — это поиск конфиденциальных данных и их несанкционированных копий по заданным критериям в уже существующей инфраструктуре: на рабочих станциях, файловых серверах, съемных носителях, в рабочих архивах.
Это другая задача, чем контроль передачи информации. Там вопрос — что пользователь отправляет, куда и как. Здесь вопрос другой: что уже лежит внутри компании и законно ли оно там лежит.
С помощью Discovery можно:
- понять, где на самом деле хранится конфиденциальная информация;
- находить забытые и задублированные копии документов;
- выявлять ПДн и другие категории чувствительных данных;
- проводить аудит после изменений в структуре хранения;
- находить то, что нужно переместить, защитить или удалить.
Поиск конфиденциальных данных — не замена антивирусу, файрволу или SIEM: у них другие задачи. Discovery работает с данными «в покое» — тем, что уже лежит внутри инфраструктуры, а не только с тем, что из нее пытаются вынести.
Как система понимает содержимое: контентный анализ, OCR и цифровые отпечатки
Рассмотрим работу с конфиденциальными данными с точки зрения работы DLP-системы, где реализован подобный поиск. Главное отличие от обычного поиска файлов — система смотрит не на название и не на расширение, а на то, что реально внутри.
Контентный анализ работает через ключевые слова, шаблоны, регулярные выражения и словари — находит документ по характерным признакам, независимо от того, как его назвал пользователь. Скажем, система может распознать в файле определенный набор сведений, относящихся к персональным данным или внутренней информации компании.

Цифровые отпечатки идут дальше: берется эталонный документ или его фрагмент, и если часть этого материала всплывает в другом файле — хоть в переработанном виде, — система это заметит. Особенно полезно для договоров, внутренних регламентов и отчетов, содержание которых заранее известно.

Отдельно — изображения. OCR распознает текст на сканах и фотографиях, поэтому снятый на телефон паспорт не становится невидимым для поиска просто потому, что в нем нет текстового слоя.

А для отдельных категорий ПДн есть точечные признаки — система умеет узнавать характерные форматы паспорта, СНИЛС, ИНН и банковских карт.
| Технология | Что распознает | Применение |
|---|---|---|
| Контентный анализ | Ключевые слова, словоформы, шаблоны | Классификация по содержимому |
| OCR | Текст в изображениях, сканах и фотографиях | Поиск сканов и фотографий документов |
| Цифровые отпечатки | Фрагменты эталонных документов | Обнаружение даже части файла |
| Поиск ПДн | Паспорта, СНИЛС, ИНН, банковские карты | Выявление ПДн |
Смысл в том, чтобы искать не абстрактный «конфиденциальный файл», а конкретные признаки того, что компания считает чувствительным. Точность распознавания изображений зависит от качества самого файла, а словари и отпечатки нужно настраивать под задачи конкретной организации — не рассчитывать на универсальный набор из коробки.
Существуют также понятия ложных срабатываний и точности. Поиск по содержимому только из предустановленных вариантов без настройки под конкретную компанию много не даст: универсальный словарь не знает терминологии организации, а общий шаблон загруженных печатей не гарантирует блокировку передачи документов в конкретном случае. Корпоративные словари, характерные шаблоны и отпечатки эталонных документов, созданные для конкретного предприятия, снижают число ложных срабатываний — но качество результата все равно зависит от качества исходных файлов, особенно сканов. Чем точнее заданы критерии, тем проще отсеять то, что не имеет отношения к делу.
От находки к порядку: классификация и реакция
Найти файл — только начало. Дальше его нужно отнести к категории — персональные данные, коммерческая тайна, внутренняя информация — и решить, что с ним делать.
Дальнейшие шаги зависят от категории: перенести в защищенное хранилище, ограничить доступ, зашифровать, удалить, если хранение больше не нужно, заблокировать передачу. Так разовая проверка превращается в постоянное управление конфиденциальными данными, а не остается одноразовой акцией.
Важно и то, где именно нашелся файл, и кто к нему имеет доступ.
| Где ищут | Что обычно находят | Риск при отсутствии контроля |
|---|---|---|
| Локальный диск рабочей станции | Выгрузки CRM, сканы паспортов | Утечка ПДн, риск нарушения законодательства по персональным данным |
| Сетевая папка, файловый сервер | Копии договоров, финансовые отчеты | Раскрытие коммерческой тайны, избыточный доступ |
| Съемный носитель | Резервные копии, архивы | Потеря носителя = утечка данных |
| Рабочая почта, архив | Пересланные документы с ПДн | Неконтролируемое распространение |
Заключение
Поиск конфиденциальных данных нужен, чтобы видеть реальную картину хранения информации внутри компании, а не ту, что записана в документах. Поиска по названию и расширению для этого мало — конфиденциальные сведения прячутся в переименованных файлах, архивах, сканах и фотографиях. Discovery через анализ содержимого, OCR, отпечатки и точечный поиск ПДн находит то, что иначе останется незамеченным, — и переводит хранение данных из случайности в управляемый процесс.
FAQ
- Как DLP понимает содержимое документа при поиске конфиденциальных данных?
По ключевым словам, словарям, шаблонам и регулярным выражениям — плюс цифровые отпечатки и точечный поиск ПДн для более узких задач.
- Чем поиск по содержимому лучше поиска по расширению и имени файла?
Имя и расширение ничего не говорят о том, что внутри. Один и тот же тип файла может быть обычным рабочим документом или содержать конфиденциальные данные — контентный анализ ищет именно признаки содержимого, а не оболочку файла.
- Что такое цифровые отпечатки документов и зачем они нужны?
Эталонный документ или его фрагмент превращается в отпечаток, и если этот же кусок текста всплывает в другом файле — даже в измененном виде, — система это заметит.
- Как система находит паспорта и СНИЛС в файлах и на сканах?
В текстовых файлах — по характерным форматам этих данных. В сканах и фотографиях — через OCR, который сначала распознает текст на изображении, а потом проверяет его теми же правилами.
- Зачем при поиске конфиденциальных данных нужен OCR?
Без него скан или фото паспорта — просто картинка, невидимая для текстового поиска. OCR превращает изображение в текст, который уже можно анализировать.
- Можно ли искать конфиденциальные файлы на рабочих станциях сотрудников законно?
Да, если это делается по правилам: закреплено в локальном нормативном акте, с определенной целью обработки и ознакомлением сотрудников. Служебные ресурсы — да, личные устройства и частная переписка — нет.
- Что делать с найденными несанкционированными копиями?
Смотря что это за данные и нужны ли они еще. Можно перенести в защищенное хранилище, ограничить доступ, зашифровать или просто удалить, если копия больше не нужна.



