Безопасность облачных LLM: токенизация и Presidio
Облачные языковые модели (LLM) вроде OpenAI GPT 5.6 Sol или Anthropic Fable 5 обладают невероятными возможностями, но отправка в них конфиденциальной информации — огромный риск для бизнеса и прямое нарушение ФЗ-152. Как получить все преимущества передовых облачных моделей, не раскрывая коммерческую тайну и персональные данные клиентов? Ответ кроется в технологии токенизации (маскирования) конфиденциальных данных с использованием Microsoft Presidio.
Проблема конфиденциальности в облачных LLM
Современные облачные языковые модели (LLM) совершили революцию в автоматизации бизнес-процессов. Они пишут тексты, анализируют документы, извлекают ключевую информацию и помогают сотрудникам принимать решения в разы быстрее. Однако у облачного подхода есть существенный недостаток: необходимость отправлять данные на внешние серверы.
Для компаний, работающих в рамках жестких регуляторных требований (например, ФЗ-152 «О персональных данных» в России или GDPR в Европе), прямая отправка клиентских данных в облако зарубежных провайдеров категорически запрещена. Даже если провайдер гарантирует, что данные не используются для обучения моделей, сам факт передачи персональных данных (PII — Personally Identifiable Information) или коммерческой тайны третьей стороне создает серьезные юридические и репутационные риски.
Дилемма выбора
Развертывание собственных локальных моделей (On-Premise) полностью решает проблему безопасности, но требует закупки дорогостоящего оборудования (GPU) и сложной настройки. При этом локальные модели меньшего размера часто уступают по качеству и гибкости гигантам вроде OpenAI GPT 5.6 Sol. Как же использовать мощь облачных LLM и оставаться в безопасности?
Что такое токенизация и маскирование PII?
Решение заключается в деперсонализации (маскировании) данных до того, как они покинут защищенный контур компании. Этот процесс часто называют токенизацией персональных данных.
Суть технологии проста: специальный локальный программный модуль анализирует запрос пользователя, находит в нем любые чувствительные данные (имена, телефоны, адреса, реквизиты компаний, номера документов) и заменяет их на безопасные плейсхолдеры (токены). В облачную модель отправляется абсолютно обезличенный текст.
Когда облачная LLM генерирует ответ, она оперирует этими же токенами. Возвращенный ответ перехватывается локальным модулем, который производит обратную замену (демаскирование) — подставляет реальные данные из локальной таблицы соответствий. В итоге пользователь видит полноценный и качественный ответ, в то время как облачный провайдер не получил ни одного байта конфиденциальной информации.
Схема работы маскирования данных
Давайте посмотрим, как этот процесс выглядит на конкретном русском примере.
Пример очистки данных в реальном времени
Исходный запрос пользователя: «Привет! Меня зовут Иван Иванов, мой телефон +7 (999) 123-45-67. Напиши проект договора для ООО 'Альфа' (ИНН 7712345678), генеральный директор Петров Петр Петрович.»
Запрос после обработки модулем маскирования (то, что видит облачная LLM): «Привет! Меня зовут [PERSON_1], мой телефон [PHONE_NUMBER_1]. Напиши проект договора для [ORGANIZATION_1] (ИНН [RU_INN_1]), генеральный директор [PERSON_2].»
Ответ от облачной LLM: «Договор подготовлен для [ORGANIZATION_1] (ИНН [RU_INN_1]) в лице генерального директора [PERSON_2]. По всем вопросам обращаться к [PERSON_1] по телефону [PHONE_NUMBER_1].»
Итоговый ответ, который видит пользователь: «Договор подготовлен для ООО 'Альфа' (ИНН 7712345678) в лице генерального директора Петрова Петра Петровича. По всем вопросам обращаться к Ивану Иванову по телефону +7 (999) 123-45-67.»
Microsoft Presidio — как это устроено внутри
Для реализации такого надежного маскирования мы используем Microsoft Presidio — библиотеку с открытым исходным кодом от компании Microsoft, разработанную специально для обнаружения и анонимизации персональных данных (PII) в текстах.
Presidio состоит из двух ключевых компонентов:
- Presidio Analyzer — модуль, который анализирует текст с использованием NLP-моделей (обработки естественного языка), регулярных выражений (Regex) и валидаторов контрольных сумм. Он находит сущности и присваивает им оценку уверенности (confidence score).
- Presidio Anonymizer — модуль, который берет результаты анализа и применяет к ним правила маскирования (замена на плейсхолдеры, хеширование, удаление или шифрование).
По умолчанию Presidio оптимизирован под английский язык, но его архитектура позволяет легко интегрировать поддержку других языков. Для качественной работы с русским языком мы подключаем специализированные русскоязычные NLP-модели (например, на базе SpaCy ru_core_news_lg или BERT-моделей) и добавляем кастомные распознаватели (Recognizers) для специфических российских форматов данных.
- Российские номера телефонов: распознавание различных форматов записи (+7, 8, скобки, дефисы).
- ИНН (Идентификационный номер налогоплательщика): проверка 10-значных (для юрлиц) и 12-значных (для физлиц) номеров с валидацией контрольных чисел.
- СНИЛС и ОГРН: специализированные регулярные выражения с проверкой контрольной суммы для исключения ложных срабатываний.
- Паспортные данные: распознавание серий и номеров российских паспортов в различных контекстах.
- Адреса и ФИО: использование именованных сущностей (NER) для точного определения русских имен, фамилий, отчеств и географических названий.
Опция безопасности в WikiAgent: Бета-режим без доплат
Мы в Wikilect стремимся предоставить нашим клиентам максимальный уровень безопасности без компромиссов в качестве работы ИИ. Именно поэтому мы интегрировали технологию маскирования персональных данных на базе Microsoft Presidio непосредственно в нашу платформу WikiAgent.
Теперь при использовании WikiAgent вам не нужно выбирать между безопасностью локальных моделей и интеллектом облачных гигантов. Вы можете подключить любую передовую облачную модель (например, через API Yandex Cloud, OpenAI или Anthropic), включив функцию защиты данных.
Доступно прямо сейчас
В настоящее время функция маскирования PII находится в бета-режиме и доступна всем пользователям WikiAgent без дополнительной платы. Вы можете активировать ее в настройках безопасности вашего проекта.
Все процессы анализа и маскирования происходят локально в вашем контуре (при On-Premise развертывании) или на наших защищенных серверах на территории РФ перед отправкой запроса внешним провайдерам. Это гарантирует полное соответствие требованиям ФЗ-152 и защищает вашу интеллектуальную собственность.
FAQ
Замедляет ли маскирование работу ИИ?
Практически нет. Локальный анализ текста с помощью Presidio занимает доли секунды (обычно от 50 до 150 миллисекунд), что абсолютно незаметно на фоне времени, которое требуется облачной LLM для генерации ответа.
Какие типы данных умеет скрывать Presidio в WikiAgent?
Система распознает и маскирует имена, фамилии, отчества, номера телефонов, email-адреса, почтовые адреса, номера банковских карт, а также специфические российские реквизиты: ИНН, СНИЛС, ОГРН, серии и номера паспортов.
Может ли облачная LLM восстановить исходные данные?
Нет, это физически невозможно. Облачная модель получает только обезличенные плейсхолдеры вроде [PERSON_1] или [RU_INN_1]. У нее нет доступа к таблице соответствий, которая хранится исключительно локально в вашей сессии и уничтожается сразу после завершения диалога.
Как включить эту функцию в WikiAgent?
Функция доступна в настройках безопасности WikiAgent. Пока она находится в бета-тестировании, ее можно активировать бесплатно одним переключателем в панели управления.
Попробуйте безопасную работу с облачными LLM
Активируйте маскирование персональных данных в WikiAgent и используйте самые мощные мировые нейросети без риска утечки конфиденциальной информации.
Читайте дальше
Выберите смежное решение Wikilect, чтобы сравнить сценарии внедрения и подобрать подходящий формат AI-автоматизации.
Теневой ИИ: как взять под контроль
Что делать, если сотрудники уже используют публичные нейросети, и как направить этот процесс в безопасное русло.
On-Premise или Облако
Подробное сравнение вариантов развертывания ИИ-решений с точки зрения безопасности, инфраструктуры и затрат.
Как устроена база знаний для WikiAgent
Разбираем внутреннюю архитектуру хранения документов и управления доступом в WikiAgent.