Обезличивание документов
Договор с паспортом клиента, реестр сотрудников, выгрузка из 1С в Excel. Mask Gate убирает из файла паспорта, ИНН, СНИЛС и телефоны — и отдаёт тот же файл обратно, только без этих данных.
Обезличить документТекст можно просто вставить в форму. С документом так не выйдет: у файла есть структура — таблицы, колонтитулы, сноски, — и обезличивание обязано её сохранить. Иначе получатель сразу увидит, что документ прогоняли через скрипт, а половина реквизитов поехала.
Что именно убирается из документа
Движок ищет персональные данные в тексте документа и заменяет их. Категории, которые он различает на сегодня:
- паспорт РФ — серия и номер, в том числе с пробелами и разделителями, на которых спотыкаются простые регулярки;
- ИНН, СНИЛС, ОГРН и ОГРНИП — с проверкой контрольной суммы, поэтому случайный набор цифр за реквизит не считается;
- номера банковских карт — с проверкой по алгоритму Луна, плюс CVV и срок действия;
- расчётные счета, БИК и КПП;
- телефоны и адреса электронной почты.
Полный список с настройками стратегий живёт на отдельной странице — какие данные находим. Она собирается из политики вашего инстанса, поэтому не может разойтись с тем, что реально умеет движок.
Какие файлы принимаются
Формат определяется по расширению файла. Список ниже — это то, что реально стоит в коде, а не в презентации:
| Формат | Что разбирается |
|---|---|
| DOCX | Абзацы, таблицы (включая вложенные), колонтитулы всех типов, текстовые блоки, сноски, концевые сноски, комментарии, скрытый текст правок и переменные документа. |
| XLSX | Все листы, значения ячеек, формулы (в том числе без сохранённого результата), комментарии к ячейкам и текст фигур. |
| Текстовый слой, поля формы, вложенные файлы. Страницы без текстового слоя и страницы с крупными картинками распознаются через OCR. | |
| TXT, CSV | Кодировка определяется автоматически: CP1251 читается так же, как UTF-8. |
| PNG, JPG, JPEG, TIFF, TIF, BMP | Текст с изображения распознаётся локальным OCR — найденные персональные данные попадают в отчёт по файлу. |
Что вы получаете на выходе
В этом и смысл обезличивания документов, а не текста: результат — файл, который можно отправлять дальше.
| Вход | Результат |
|---|---|
| DOCX | Документ .docx с замаскированным содержимым. Структура, стили и таблицы остаются на месте. |
| XLSX | Книга .xlsx с замаскированными значениями. Формулы и листы не ломаются. |
| PDF, в котором найденные данные закрыты чёрными плашками. Если ничего не найдено, отдаётся исходный файл без изменений. | |
| TXT, CSV | Текст с замаскированными значениями. |
| Картинки | Отчёт с находками. Маскированного изображения сервис пока не собирает — об этом ниже. |
Готовый файл доступен по ссылке со случайным токеном. Ссылка живёт 5 минут, а сам результат — в памяти сервера, не на диске. Скачали — он ваш, дальше сервис к нему не возвращается.
Как это работает по шагам
- Файл разбирается на текстовые фрагменты с пометкой, откуда каждый взят: тело документа, конкретный колонтитул, лист таблицы, страница PDF.
- Каждый фрагмент проходит через детектор. Найденное получает категорию и уверенность, а не просто «похоже на цифры».
- Срабатывает стратегия из политики: заменить на плейсхолдер вида
[REMOVED:RU_PASSPORT]или спрятать значение в vault и оставить токен. - Документ пересобирается в исходном формате — уже с заменами.
- Если нужна обратимость, токен из документа раскрывается через vault: значения там зашифрованы, а не лежат открытым текстом.
Загрузить можно не только один файл: сервис принимает пачку документов и обрабатывает каждый отдельно. Один испорченный файл в пачке не делает «чистыми» остальные — по нему будет отдельная ошибка.
Ограничения, о которых лучше знать заранее
Маскирование документа — операция с чужим форматом, и у неё есть края. Мы предпочитаем отказать, чем отдать файл с дырой.
- Картинки внутри DOCX и XLSX. Если в документе лежат вставленные изображения, пересборка их не проверяет: файл помечается как непроверенный, и скачать маскированный результат нельзя. Это осознанный отказ, а не баг: скан паспорта, вставленный в договор картинкой, иначе уехал бы в «обезличенный» документ как есть.
- Обратимый PDF и таблицы. Для PDF и табличных форматов обратимая маскировка отдаёт текстовый результат: пометить токеном страницу PDF нельзя без потери вёрстки.
- PDF на выходе — растровый. Мы рендерим страницы и закрываем найденные данные плашками, поэтому текстовый слой в таком файле теряется: искать по нему текст не получится.
- Длинные сканы. Длинный документ может упереться в лимит времени на извлечение текста. Тогда файл помечается ошибкой — вы не получите документ с молчаливой пометкой «чисто». Ограничение известно и в работе.
- Только форматы из списка. Старый .doc, ODT и RTF сервис не принимает: их сначала надо сохранить в поддерживаемом формате.
И главное: обезличивание документа убирает данные из файла. Оно не делает вас невидимым, не мешает сотруднику пересказать паспорт словами и не заменяет аудит доступа к папке с договорами.
Чем это отличается от проверки документов и от обезличивания вообще
Три близких запроса — три разных задачи, и мы разводим их сознательно.
- Проверка документов отвечает на вопрос «что там внутри?»: вы загружаете файл и получаете список находок. Обезличивание идёт на шаг дальше — на выходе готовый файл без персональных данных.
- Обезличивание персональных данных — про термин и закон: что говорит 152-ФЗ, какие пять методов утвердил Роскомнадзор. Здесь — про работу с конкретным документом.
- Маскирование персональных данных — про сам приём: чем замена на плейсхолдер отличается от токена и что происходит с каждой категорией данных.
- Маскирование перед нейросетью — про момент отправки в модель. Если документ нужно скормить ИИ, начните оттуда.
Частые вопросы
Файл уходит на сервер?
Да: документ отправляется по HTTPS и разбирается на сервере Mask Gate. На время разбора он лежит во временном файле, который удаляется сразу после обработки. Готовый результат живёт в памяти и доступен по ссылке со случайным токеном 5 минут.
Можно вернуть исходные данные обратно?
Да, если выбрать обратимую маскировку: исходные значения шифруются и попадают в vault, а в документе остаётся токен. По токену значение раскрывается — это и есть метод введения идентификаторов из приказа Роскомнадзора № 140.
Что будет с длинным сканом на десять страниц?
На разбор файла есть бюджет времени. Тяжёлый скан может в него не влезть — тогда файл помечается ошибкой и результата не будет. Документ при этом не отдаётся как проверенный.
Можно обезличить сразу несколько документов?
Да, сервис принимает батч файлов, и каждый файл в нём обрабатывается отдельно. Если один файл в пачке не разобрался, остальные всё равно проверяются, а в ответе видно, что именно пошло не так.
Что бесплатно
Без регистрации — 10 бесплатных проверок в день. После входа — 20 бесплатных проверок в день. Это проверки текста — попробовать можно прямо с главной, без входа. Документ обрабатывается в кабинете: загрузка файла требует аккаунта. Первый файл на аккаунте без платежей сервис проверяет целиком — с находками и скачиванием результата. Это разовый грант, а не подписка: когда он израсходован, документы идут с баланса, цены — на странице тарифов.