Защита AI — это совокупность процессов, архитектурных решений и контролей, снижающих риски prompt-injection, отравления данных, кражи моделей, утечек через API и RAG. Фундамент — жёсткая сегментация, строгая аутентификация, валидация ввода/вывода и непрерывный мониторинг. Ниже — практические меры и чек-листы.
Карта угроз AI: prompt-injection, data poisoning, model theft
Ключевые векторы угроз для защиты AI
- Prompt-injection: злоумышленник внедряет инструкции в пользовательский ввод, контент базы знаний или внешние источники (RAG), чтобы обойти системные правила, эксфильтровать секреты или выполнить нежелательные действия через инструменты/функции.
- Data poisoning: преднамеренное искажение обучающих или retrieval-данных для смещения ответов, деградации качества или установки триггеров (backdoors).
- Model theft: утечка бинарей/весов локальных моделей, кража через небезопасное хранилище, а также извлечение параметров/поведения по API (extraction) или подсказками.
Последствия для интеграции искусственного интеллекта и защиты AI
- Эскалация привилегий через инструменты (plugins/functions) и автоматизацию.
- Утечка ИИ-секретов, данных клиентов (PII/PCI), ключей API и системных промптов.
- Срыв SLA, рост затрат из-за неограниченных запросов, репутационные и юридические риски.
Меры смягчения по слоям
| Угроза | Вектор | Базовые меры | Усиления |
|---|---|---|---|
| Prompt-injection | Пользовательский ввод, RAG-корпус | Системные правила, output-гарды, контент-фильтры | Tool sandboxing, строгая схема вызовов функций, валидация намерений |
| Data poisoning | Обучение/индексация | Подписи источников, контроль версий, Curated-датасеты | Аномалия-детект, тестовые наборы, двоичное утверждение знаний |
| Model theft | Хранилища, API, логи | Шифрование в покое/транзите, mTLS, RBAC | Watermarking, honey-weights, rate limit, мониторинг шаблонов извлечения |
Безопасность API и токенов: rate limit, mTLS, scopes
Аутентификация и авторизация в защите AI
- Scopes/Claims: минимально необходимые права для каждого сервиса и инструмента. Разделяйте права чтения/записи, моделирование/векторизацию, админ-операции.
- Короткоживущие токены: rotation по времени и по использованию; запрет long-lived ключей в коде и логах.
- mTLS между сервисами: взаимная проверка сертификатов, привязка к окружению и сервисному аккаунту.
- RBAC/ABAC на уровне шлюза: периметр для моделей, векторных БД, стораджей и инструментов.
Управление трафиком и устойчивость защиты AI
- Rate limit и токен-квоты: per-user, per-app, per-IP. Жёсткие лимиты на генерацию и векторизацию, отдельные лимиты для чувствительных инструментов.
- Concurrency/Timeouts/Circuit breakers: защита от штормов запросов и деградации апстримов.
- Допуски по контенту: отклонение слишком длинных/подозрительных промптов; предварительная нормализация и дедупликация.
Проблемы API и их профилактика в защите AI
- Утечки ключей: секрет-сканеры в CI/CD, KMS/Secrets Manager, запрет передачи ключей в промпты и RAG.
- Непредсказуемые счета: бюджет-ограничения, алерты по расходам, сорс-таггинг по фичам.
- Инъекции через инструменты: явные схемы функций, whitelisting параметров, жесткая сериализация.
RAG-слои: фильтры, валидация, безопасные системные промпты
Гигиена корпуса и индексирования для защиты AI
- Верификация источников: подписанные артефакты, allowlist доменов/репозиториев.
- Препроцессинг: удаление скрытых инструкций, HTML/JS-санитаризация, блок подписи «инструкций к модели» в документах.
- Версионирование и откат индексов: воспроизводимость результатов и быстрый rollback при отравлении.
Поиск и ранжирование в контексте защиты AI
- Query-фильтры: ограничение областей знаний, безопасность мультитенантности на уровне индекса.
- Re-ranking и majority-vote из нескольких источников для снижения влияния одиночных ядовитых документов.
Оркестрация промптов и защита AI
- Безопасные системные промпты: явные запреты на выполнение скрытых инструкций из контента, правило «никогда не раскрывай секреты и ключи», политика инструментов.
- Валидация вывода: схемы, типизация, пост-фильтры токсичности/PII, заземление на цитаты с проверкой ссылок.
- Аудит промптов: логирование системных/пользовательских частей и версий шаблонов.
DLP для промптов и ответов в защите AI
Контроль данных на вводе для защиты AI
- PII/PCI-детекторы: маскирование номеров карт, паспортов, телефонов перед передачей в модель.
- Контекстные политики: запрет отправки конфиденциальных полей конкретных объектов (например, зарплаты) в сторонние API.
- Красные словари: словари секретов и служебных токенов для мгновенной блокировки эксфильтрации.
Контроль данных на выводе в защите AI
- Output-DLP: сканирование ответов на PII/секреты, авто-редактура/редакция, безопасные замены.
- Watermark/канарейки: маркеры в чувствительном контенте для отслеживания утечек.
- Политики хранения: TTL логов промптов/ответов, шифрование в покое, минимизация ретенции.
Мониторинг и аудит AI: логи, аномалии и защита AI
Наблюдаемость для защиты AI
- Полные логи: промпт/контекст, выбранная модель/версия, инструменты, токены, задержки, идентификаторы пользователя и скоупов.
- Сигналинг аномалий: всплески длины промптов, нестандартные шаблоны извлечения данных, частые ошибки валидации.
- Метрики качества: groundedness, фактуальность, токсичность, PII-утечки, дрейф ответов по версиям.
Тестовые наборы и красные команды для защиты AI
- Adversarial-наборы: сценарии prompt-injection, jailbreak, попытки эксфильтрации ключей, обходы RAG.
- Regression-тесты: стабильность при обновлении модели, индексов и системных промптов.
- Chaos-дни: искусственные задержки/ошибки API, истечение токенов, отключение инструментов для проверки деградаций.
Интеграция AI: процесс и разграничение ответственности в защите AI
Процесс «security by design» при защите AI
- Threat modeling: диаграммы потоков данных, перечень доверенных границ, список секретов и точек эксфильтрации.
- Политики доступа: матрица ролей для разработчиков промптов, операторов RAG, MLOps, SecOps.
- Change management: двоичный обзор промптов и индексов, предварительные тесты безопасности, канареечные релизы.
Инструменты и совместимость для защиты AI
- Совместимость с DLP/SIEM/SOAR: стриминг логов, сигнатуры событий, авто-блокировки.
- Секреты и ключи: единый KMS, политиками шифрования и ротации для всех AI-сервисов.
- Vendor-риски: оценка политик провайдера моделей и векторных БД, границы обработки данных, регионы хранения.
Практический чек-лист защиты данных и security AI
- Системные промпты: запреты на выполнение внешних инструкций, политика инструментов, версияция.
- Ввод: нормализация, схема, лимиты длины, контент-фильтры, PII-DLP.
- RAG: верифицированные источники, антиподписи инструкций, контроль доступа к индексам.
- API: mTLS, scopes, короткоживущие токены, rate limit, бюджет-алерты.
- Хранилища: шифрование, сегментация сетей, приватные buckets/векторы, запрет публичных ACL.
- Модели: защита весов, watermarking, мониторинг extraction-паттернов.
- Мониторинг: полные логи, аномалии, SIEM-алерты, тестовые наборы и регулярные red-team сессии.
- Процессы: change control, двоичное ревью промптов и индексов, обучение команд.