Блог
    Безопасность
    Безопасность
    LLM
    Токенизация
    Presidio
    Персональные данные
    WikiAgent

    Безопасность облачных LLM: токенизация и Presidio

    Облачные языковые модели (LLM) вроде OpenAI GPT 5.6 Sol или Anthropic Fable 5 обладают невероятными возможностями, но отправка в них конфиденциальной информации — огромный риск для бизнеса и прямое нарушение ФЗ-152. Как получить все преимущества передовых облачных моделей, не раскрывая коммерческую тайну и персональные данные клиентов? Ответ кроется в технологии токенизации (маскирования) конфиденциальных данных с использованием Microsoft Presidio.

    Автор: Команда WikilectДата: 28 августа 2026 г.7 минут

    Проблема конфиденциальности в облачных LLM

    Современные облачные языковые модели (LLM) совершили революцию в автоматизации бизнес-процессов. Они пишут тексты, анализируют документы, извлекают ключевую информацию и помогают сотрудникам принимать решения в разы быстрее. Однако у облачного подхода есть существенный недостаток: необходимость отправлять данные на внешние серверы.

    Для компаний, работающих в рамках жестких регуляторных требований (например, ФЗ-152 «О персональных данных» в России или GDPR в Европе), прямая отправка клиентских данных в облако зарубежных провайдеров категорически запрещена. Даже если провайдер гарантирует, что данные не используются для обучения моделей, сам факт передачи персональных данных (PII — Personally Identifiable Information) или коммерческой тайны третьей стороне создает серьезные юридические и репутационные риски.

    Дилемма выбора

    Развертывание собственных локальных моделей (On-Premise) полностью решает проблему безопасности, но требует закупки дорогостоящего оборудования (GPU) и сложной настройки. При этом локальные модели меньшего размера часто уступают по качеству и гибкости гигантам вроде OpenAI GPT 5.6 Sol. Как же использовать мощь облачных LLM и оставаться в безопасности?

    Что такое токенизация и маскирование PII?

    Решение заключается в деперсонализации (маскировании) данных до того, как они покинут защищенный контур компании. Этот процесс часто называют токенизацией персональных данных.

    Суть технологии проста: специальный локальный программный модуль анализирует запрос пользователя, находит в нем любые чувствительные данные (имена, телефоны, адреса, реквизиты компаний, номера документов) и заменяет их на безопасные плейсхолдеры (токены). В облачную модель отправляется абсолютно обезличенный текст.

    Когда облачная LLM генерирует ответ, она оперирует этими же токенами. Возвращенный ответ перехватывается локальным модулем, который производит обратную замену (демаскирование) — подставляет реальные данные из локальной таблицы соответствий. В итоге пользователь видит полноценный и качественный ответ, в то время как облачный провайдер не получил ни одного байта конфиденциальной информации.

    Схема работы маскирования данных

    Локальный защищенный контур WikiAgent

    1. Исходный запрос с PII

    2. Сохранение связей

    3. Очищенный запрос

    5. Восстановление данных

    6. Подстановка реальных PII

    4. Передача анонимного текста

    4. Ответ с токенами

    7. Итоговый ответ

    Пользователь

    Модуль маскирования (Presidio)

    Таблица соответствий

    Отправка в API

    Прием ответа

    Деанонимизатор

    Облачная LLM (GPT 5.6 Sol / Fable 5)

    Архитектура безопасного взаимодействия с облачной LLM через маскирование данных

    Давайте посмотрим, как этот процесс выглядит на конкретном русском примере.

    Пример очистки данных в реальном времени

    Исходный запрос пользователя: «Привет! Меня зовут Иван Иванов, мой телефон +7 (999) 123-45-67. Напиши проект договора для ООО 'Альфа' (ИНН 7712345678), генеральный директор Петров Петр Петрович.»

    Запрос после обработки модулем маскирования (то, что видит облачная LLM): «Привет! Меня зовут [PERSON_1], мой телефон [PHONE_NUMBER_1]. Напиши проект договора для [ORGANIZATION_1] (ИНН [RU_INN_1]), генеральный директор [PERSON_2].»

    Ответ от облачной LLM: «Договор подготовлен для [ORGANIZATION_1] (ИНН [RU_INN_1]) в лице генерального директора [PERSON_2]. По всем вопросам обращаться к [PERSON_1] по телефону [PHONE_NUMBER_1].»

    Итоговый ответ, который видит пользователь: «Договор подготовлен для ООО 'Альфа' (ИНН 7712345678) в лице генерального директора Петрова Петра Петровича. По всем вопросам обращаться к Ивану Иванову по телефону +7 (999) 123-45-67.»

    Microsoft Presidio — как это устроено внутри

    Для реализации такого надежного маскирования мы используем Microsoft Presidio — библиотеку с открытым исходным кодом от компании Microsoft, разработанную специально для обнаружения и анонимизации персональных данных (PII) в текстах.

    Presidio состоит из двух ключевых компонентов:

    • Presidio Analyzer — модуль, который анализирует текст с использованием NLP-моделей (обработки естественного языка), регулярных выражений (Regex) и валидаторов контрольных сумм. Он находит сущности и присваивает им оценку уверенности (confidence score).
    • Presidio Anonymizer — модуль, который берет результаты анализа и применяет к ним правила маскирования (замена на плейсхолдеры, хеширование, удаление или шифрование).

    По умолчанию Presidio оптимизирован под английский язык, но его архитектура позволяет легко интегрировать поддержку других языков. Для качественной работы с русским языком мы подключаем специализированные русскоязычные NLP-модели (например, на базе SpaCy ru_core_news_lg или BERT-моделей) и добавляем кастомные распознаватели (Recognizers) для специфических российских форматов данных.

    • Российские номера телефонов: распознавание различных форматов записи (+7, 8, скобки, дефисы).
    • ИНН (Идентификационный номер налогоплательщика): проверка 10-значных (для юрлиц) и 12-значных (для физлиц) номеров с валидацией контрольных чисел.
    • СНИЛС и ОГРН: специализированные регулярные выражения с проверкой контрольной суммы для исключения ложных срабатываний.
    • Паспортные данные: распознавание серий и номеров российских паспортов в различных контекстах.
    • Адреса и ФИО: использование именованных сущностей (NER) для точного определения русских имен, фамилий, отчеств и географических названий.

    Опция безопасности в WikiAgent: Бета-режим без доплат

    Мы в Wikilect стремимся предоставить нашим клиентам максимальный уровень безопасности без компромиссов в качестве работы ИИ. Именно поэтому мы интегрировали технологию маскирования персональных данных на базе Microsoft Presidio непосредственно в нашу платформу WikiAgent.

    Теперь при использовании WikiAgent вам не нужно выбирать между безопасностью локальных моделей и интеллектом облачных гигантов. Вы можете подключить любую передовую облачную модель (например, через API Yandex Cloud, OpenAI или Anthropic), включив функцию защиты данных.

    Доступно прямо сейчас

    В настоящее время функция маскирования PII находится в бета-режиме и доступна всем пользователям WikiAgent без дополнительной платы. Вы можете активировать ее в настройках безопасности вашего проекта.

    Все процессы анализа и маскирования происходят локально в вашем контуре (при On-Premise развертывании) или на наших защищенных серверах на территории РФ перед отправкой запроса внешним провайдерам. Это гарантирует полное соответствие требованиям ФЗ-152 и защищает вашу интеллектуальную собственность.

    FAQ

    Замедляет ли маскирование работу ИИ?

    Практически нет. Локальный анализ текста с помощью Presidio занимает доли секунды (обычно от 50 до 150 миллисекунд), что абсолютно незаметно на фоне времени, которое требуется облачной LLM для генерации ответа.

    Какие типы данных умеет скрывать Presidio в WikiAgent?

    Система распознает и маскирует имена, фамилии, отчества, номера телефонов, email-адреса, почтовые адреса, номера банковских карт, а также специфические российские реквизиты: ИНН, СНИЛС, ОГРН, серии и номера паспортов.

    Может ли облачная LLM восстановить исходные данные?

    Нет, это физически невозможно. Облачная модель получает только обезличенные плейсхолдеры вроде [PERSON_1] или [RU_INN_1]. У нее нет доступа к таблице соответствий, которая хранится исключительно локально в вашей сессии и уничтожается сразу после завершения диалога.

    Как включить эту функцию в WikiAgent?

    Функция доступна в настройках безопасности WikiAgent. Пока она находится в бета-тестировании, ее можно активировать бесплатно одним переключателем в панели управления.

    Попробуйте безопасную работу с облачными LLM

    Активируйте маскирование персональных данных в WikiAgent и используйте самые мощные мировые нейросети без риска утечки конфиденциальной информации.