Что происходит с вашим документом при AI-проверке на соответствие законам

·3 мин чтения

Когда документ загружается в AI-сервис для анализа, его текст обычно передаётся во внешнюю языковую модель — это может означать, что данные физически обрабатываются за пределами страны, где находится сама компания-разработчик сервиса. Для документов, содержащих персональные данные (а договоры и политики конфиденциальности почти всегда их содержат), это создаёт отдельный юридический вопрос — трансграничную передачу персональных данных.

Почему это вообще важно

Многие AI-сервисы для анализа документов используют сторонние языковые модели — это стандартная практика, дешевле и быстрее, чем обучать собственную модель с нуля. Но это означает, что текст документа, который загружает пользователь, уходит за пределы инфраструктуры самого сервиса — к провайдеру модели.

Если провайдер модели физически обрабатывает данные не в той стране, где действует местное законодательство о защите данных (например, 152-ФЗ в России), возникает вопрос трансграничной передачи персональных данных — а для неё, как правило, нужны отдельные правовые основания: явное согласие пользователя, включение страны в перечень с "адекватной защитой" данных, или иные механизмы.

Как можно снизить объём передаваемых персональных данных

Один из подходов — обезличивание данных до того, как документ уходит на анализ, то есть замена структурированных персональных данных на плейсхолдеры прямо в браузере пользователя, ещё до отправки на сервер.

В AI Compliance Checker это устроено так:

  • перед отправкой документа на анализ телефоны, email, ИНН, ОГРН/ОГРНИП, СНИЛС, номера паспорта и банковских карт автоматически заменяются на плейсхолдеры вида [ТЕЛЕФОН СКРЫТ], [EMAIL СКРЫТ] и так далее
  • пользователь видит сводку того, что было скрыто, до отправки документа — например, "Скрыто: 2 телефона, 1 email, 1 ИНН"
  • в саму модель для анализа уходит уже обезличенный текст, а не оригинальный файл с реальными данными

Что такое обезличивание не решает — и почему это важно понимать

Обезличивание по формату (регулярные выражения для телефонов, email, номеров документов) — не то же самое, что полное обезличивание документа. Имена людей, названия компаний и адреса таким способом не распознаются: для этого нужна отдельная технология (NER — распознавание именованных сущностей), а не поиск по чёткому формату.

Это осознанное ограничение, а не недоработка: попытка "как бы" скрывать имена без точной модели создала бы ложное чувство полной защиты — хуже, чем явно сказать, что именно скрывается, а что нет. Если для конкретного документа критично скрыть имена или адреса — это стоит сделать вручную перед загрузкой.

Что стоит проверить, если вы сами выбираете AI-инструмент для анализа документов

  • Что происходит с текстом документа после анализа — удаляется или хранится, и как долго
  • Использует ли сервис ваши документы для дообучения моделей (обычно это отдельный пункт в пользовательском соглашении или политике конфиденциальности)
  • Какая модель используется для анализа и где она физически обрабатывает данные
  • Есть ли у сервиса какие-либо меры по снижению объёма персональных данных, передаваемых во внешнюю модель

Как проверить свой документ с учётом обезличивания данных

Проверьте документ бесплатно за 2 минуты → Загрузить документ

Похожие вопросы

Материал носит информационный характер и не является юридической консультацией.

Проверьте свой договор прямо сейчас

Первая проверка — бесплатно, с полным отчётом.

Проверить документ →