Что происходит с вашим документом при AI-проверке на соответствие законам
Когда документ загружается в AI-сервис для анализа, его текст обычно передаётся во внешнюю языковую модель — это может означать, что данные физически обрабатываются за пределами страны, где находится сама компания-разработчик сервиса. Для документов, содержащих персональные данные (а договоры и политики конфиденциальности почти всегда их содержат), это создаёт отдельный юридический вопрос — трансграничную передачу персональных данных.
Почему это вообще важно
Многие AI-сервисы для анализа документов используют сторонние языковые модели — это стандартная практика, дешевле и быстрее, чем обучать собственную модель с нуля. Но это означает, что текст документа, который загружает пользователь, уходит за пределы инфраструктуры самого сервиса — к провайдеру модели.
Если провайдер модели физически обрабатывает данные не в той стране, где действует местное законодательство о защите данных (например, 152-ФЗ в России), возникает вопрос трансграничной передачи персональных данных — а для неё, как правило, нужны отдельные правовые основания: явное согласие пользователя, включение страны в перечень с "адекватной защитой" данных, или иные механизмы.
Как можно снизить объём передаваемых персональных данных
Один из подходов — обезличивание данных до того, как документ уходит на анализ, то есть замена структурированных персональных данных на плейсхолдеры прямо в браузере пользователя, ещё до отправки на сервер.
В AI Compliance Checker это устроено так:
- перед отправкой документа на анализ телефоны, email, ИНН, ОГРН/ОГРНИП, СНИЛС, номера паспорта и банковских карт автоматически заменяются на плейсхолдеры вида
[ТЕЛЕФОН СКРЫТ],[EMAIL СКРЫТ]и так далее - пользователь видит сводку того, что было скрыто, до отправки документа — например, "Скрыто: 2 телефона, 1 email, 1 ИНН"
- в саму модель для анализа уходит уже обезличенный текст, а не оригинальный файл с реальными данными
Что такое обезличивание не решает — и почему это важно понимать
Обезличивание по формату (регулярные выражения для телефонов, email, номеров документов) — не то же самое, что полное обезличивание документа. Имена людей, названия компаний и адреса таким способом не распознаются: для этого нужна отдельная технология (NER — распознавание именованных сущностей), а не поиск по чёткому формату.
Это осознанное ограничение, а не недоработка: попытка "как бы" скрывать имена без точной модели создала бы ложное чувство полной защиты — хуже, чем явно сказать, что именно скрывается, а что нет. Если для конкретного документа критично скрыть имена или адреса — это стоит сделать вручную перед загрузкой.
Что стоит проверить, если вы сами выбираете AI-инструмент для анализа документов
- Что происходит с текстом документа после анализа — удаляется или хранится, и как долго
- Использует ли сервис ваши документы для дообучения моделей (обычно это отдельный пункт в пользовательском соглашении или политике конфиденциальности)
- Какая модель используется для анализа и где она физически обрабатывает данные
- Есть ли у сервиса какие-либо меры по снижению объёма персональных данных, передаваемых во внешнюю модель
Как проверить свой документ с учётом обезличивания данных
Проверьте документ бесплатно за 2 минуты → Загрузить документ
Похожие вопросы
- Политика конфиденциальности по 152-ФЗ: что должно быть обязательно
- Полное руководство по 152-ФЗ для малого бизнеса
Материал носит информационный характер и не является юридической консультацией.