Красная команда по ИИ

Оригинал: AI Red Team

Создайте красную команду по ИИ, ответственную за проведение регулярных, санкционированных учений красной команды, основанных на данных об угрозах, для выявления и устранения уязвимостей в системах с поддержкой ИИ до развёртывания и на всём протяжении эксплуатации. Тестирование ИИ силами красной команды имитирует реалистичное поведение злоумышленников, чтобы оценить, как атаки могут повлиять на конфиденциальность, целостность, доступность, безопасность, приватность и эффективность выполнения целевых задач системой с поддержкой ИИ.

Учения красной команды должны охватывать всю систему с поддержкой ИИ, включая модели и данные, агентов (в том числе их память и инструменты), потоки данных, процессы принятия решений, логику приложений, системы извлечения данных, идентичности и разрешения, зависимости ПО, компоненты системы, не использующие ИИ, инфраструктуру, пользовательские интерфейсы и рабочие процессы с участием людей.

Учение красной команды по ИИ можно организовать в три этапа: планирование и определение области учения, проведение выбранных испытаний и оценка результатов, на основе которой формируются отчётность и меры по устранению недостатков.

  1. Планирование и определение области

    • Документируйте предполагаемое использование системы, среду развёртывания, пользователей, чувствительные данные, подключённые ресурсы и возможные последствия отказа или неправомерного использования. Составьте схему компонентов системы, границ доверия, потоков данных, внешних сервисов, точек принятия решений человеком, а также точек доступа на этапах обучения и инференса.
    • Установите правила проведения учений, охватывающие разрешённые системы, учётные записи, данные и техники, временные окна тестирования, ограничения ресурсов, процедуры эскалации, порядок работы с доказательствами и условия остановки. Планируйте разрушительные, нарушающие приватность или дорогостоящие тесты для изолированных сред с надлежащими мерами защиты.
    • Разработайте модель угроз на основе среды эксплуатации системы и релевантного поведения злоумышленников. Определите цели злоумышленника, уровень его доступа, знания, возможности, ресурсы и ограничения; учтите цифровые и физические пути атак, а также роль контроля со стороны человека.
    • Используйте тактики, техники и процедуры ATLAS для выявления релевантных вариантов поведения злоумышленников и построения векторов угроз. Назначьте им приоритеты с учётом вероятности и серьёзности воздействия на систему.
    • Определите критерии успеха и условия остановки. Определите метрики уровня задач для оценки воздействия на возможности ИИ и операционные метрики для измерения воздействия на систему в целом.
  2. Проведение

    • Проводите выбранные испытания ручными и автоматизированными методами по мере необходимости. Автоматизация позволяет создавать варианты входных данных, повторно воспроизводить последовательности атак и оценивать ответы в большом масштабе. Специалисты, проводящие тестирование, могут разрабатывать атаки с учётом особенностей системы, адаптироваться к наблюдаемым средствам защиты и исследовать неожиданное поведение.
    • Соблюдайте правила проведения учений и фиксируйте действия в рамках атаки, ответы системы, поведение средств контроля, отклонения от плана тестирования и доказательства, необходимые для оценки результатов.
    • Остановите тестирование или запустите процедуру эскалации при достижении заранее определённых условий. После тестирования удалите тестовые учётные записи, изменённые данные, установленное ПО, инструкции, сохраняющиеся в системе, и другие артефакты учений.
  3. Оценка, отчётность и совершенствование

    • Оцените результаты по заданным метрикам уровня задач и операционным метрикам. Документируйте успешные и неуспешные атаки, их последствия, наблюдаемое поведение средств контроля, отклонения от плана тестирования и пробелы в модели угроз.
    • Сообщите о выявленных проблемах соответствующим разработчикам, специалистам по защите, командам эксплуатации, владельцам рисков и другим заинтересованным сторонам.
    • Назначьте ответственных за выявленные проблемы, отслеживайте их устранение и повторно тестируйте исправленные системы.
    • Используйте продемонстрированные атаки для совершенствования превентивных средств контроля, обнаружения, реагирования на инциденты и восстановления. Там, где это уместно, преобразуйте подтверждённые сбои в регрессионные тесты, наборы данных для оценки, логику обнаружения, требования к мониторингу или критерии развёртывания.

Тестирование силами красной команды — непрерывный процесс; его следует повторять по мере развития ландшафта угроз, а также при внесении изменений в систему, её компоненты, предполагаемое использование или среду развёртывания. Новые данные об угрозах, уязвимости и результаты тестирования должны служить основой для определения области и приоритетов будущих учений.

Связанные техники

AML.T0010Компрометация цепочки поставок ИИ

Отработайте в контролируемых условиях внедрение недоверенных компонентов — ПО, данных, моделей и инструментов ИИ-агента — через репрезентативные пути их получения и развёртывания. Устраните недостатки, связанные со сведениями о происхождении, валидацией, процедурами одобрения, изоляцией и откатом.

AML.T0010.001ПО для ИИ

Внедряйте недоверенные пакеты ПО для ИИ, библиотеки, плагины или программные компоненты только в контролируемую среду. Проверьте средства контроля зависимостей, сканирование, подписание, процедуры одобрения, изоляцию и безопасность установки.

AML.T0010.002Данные

Внедряйте недоверенные наборы данных только в контролируемую среду через репрезентативные пути их получения и приёма. Проверьте механизмы отслеживания происхождения, обеспечения целостности, санитизации, проверки и отбраковки данных.

AML.T0010.003Модель

Внедряйте недоверенную или модифицированную модель только в контролируемую среду через репрезентативные пути её получения и развёртывания. Проверьте сведения о происхождении, сканирование, подписание, процедуры одобрения, изоляцию и возможность возврата к предыдущей версии модели.

AML.T0010.005Инструмент ИИ-агента

Внедряйте недоверенный инструмент ИИ-агента или недоверенное определение инструмента только в контролируемую среду. Убедитесь, что источник входит в число разрешённых; проверьте целостность, факт проведения проверки, границы разрешений и безопасность активации.

AML.T0015Обход ИИ-модели

Проведите репрезентативные цифровые и мультимодальные атаки обхода, а также атаки обхода в физическом домене. Используйте успешные атаки, чтобы повысить устойчивость модели и улучшить предобработку, обнаружение состязательных входных данных, контроль со стороны человека и мониторинг.

AML.T0018Манипуляция ИИ-моделью

В контролируемых условиях попытайтесь изменить или подменить модели, веса, адаптеры и связанную с ними конфигурацию. Устраните недостатки механизмов авторизации, обеспечения целостности артефактов, процедур одобрения развёртывания, мониторинга и восстановления.

AML.T0018.000Отравление ИИ-модели

Проверьте, могут ли контролируемые изменения весов модели, контролируемое дообучение или контролируемые изменения связанных с моделью артефактов привести к появлению целевого или устойчивого поведения. Усовершенствуйте отслеживание происхождения модели, её валидацию и мониторинг целостности, а также механизм возврата к предыдущей версии.

AML.T0018.001Изменение архитектуры ИИ-модели

В контролируемых условиях попытайтесь внести неавторизованные изменения в архитектуру модели или в её исполняемые компоненты. Проверьте процессы рассмотрения изменений, контроля целостности, подписания и одобрения развёртывания, а также механизмы восстановления.

AML.T0020Отравление обучающих данных

В контролируемых условиях внедрите отравленные записи или триггеры в репрезентативные пайплайны обработки данных. Проверьте и усовершенствуйте отслеживание происхождения данных, их санитизацию и проверку, обнаружение дрейфа, валидацию модели и механизмы возврата к предыдущему состоянию.

AML.T0024Эксфильтрация через API инференса ИИ

Испытайте интерфейсы инференса с помощью методов определения принадлежности к обучающей выборке, инверсии ИИ-модели и извлечения функциональной копии ИИ-модели. Используйте полученные результаты для совершенствования мер защиты приватности, аутентификации, ограничений на выходные данные, лимитов частоты запросов и мониторинга.

AML.T0024.000Определение принадлежности к обучающей выборке

Проверьте, позволяют ли выходные данные модели определить, входили ли известные образцы данных в её обучающую выборку. Усовершенствуйте обучение с сохранением приватности, ограничения на выходные данные, контроль доступа и мониторинг запросов.

AML.T0024.001Инверсия ИИ-модели

Попытайтесь реконструировать чувствительные записи, атрибуты или сведения, характерные для обучающих данных, на основе выходных данных модели. Устраните утечку за счёт внесения изменений в модель, минимизации выходных данных, мер защиты приватности и ограничения доступа к инференсу.

AML.T0024.002Извлечение ИИ-модели

Эмулируйте извлечение функциональной копии модели с помощью запросов на инференс. Внедрите надлежащую аутентификацию, ограничения частоты запросов, ограничения на выходные данные, обнаружение аномалий и мониторинг попыток извлечения модели.

AML.T0029Отказ в обслуживании ИИ-сервиса

Направляйте на систему состязательные рабочие нагрузки и отрабатывайте сценарии отказов зависимостей, которые могут привести к исчерпанию ресурсов сервисов инференса или вспомогательных сервисов. По результатам применяйте квоты, ограничения числа одновременных операций, таймауты, изоляцию ресурсов и механизмы плавной деградации.

AML.T0034Искусственное увеличение затрат

Отрабатывайте сценарии с запросами и рабочими процессами, предназначенными для увеличения затрат на инференс, инфраструктуру или внешние сервисы. Проверяйте бюджеты, квоты, ограничения частоты запросов, средства управления рабочими нагрузками, систему оповещения и механизмы остановки.

AML.T0034.000Чрезмерные запросы

В контролируемых условиях генерируйте интенсивный поток запросов. Проверяйте аутентификацию, квоты пользователей и тенантов, ограничения частоты запросов, обнаружение аномалий, оповещения о затратах и средства защиты сервиса.

AML.T0034.001Ресурсоёмкие запросы

В контролируемых условиях направляйте на систему запросы, специально подготовленные для потребления непропорционально большого объёма ресурсов при инференсе. Проверяйте ограничения на входные данные, таймауты, ограничения рабочей нагрузки, изоляцию ресурсов и мониторинг затрат.

AML.T0034.002Потребление ресурсов агентом

Тестируйте рекурсивное поведение, повторные вызовы инструментов, использование API, приводящее к высоким затратам, и расширение области задачи под контролем злоумышленника. Проверяйте бюджеты, ограничения числа итераций, таймауты, пороги обязательного одобрения и средства остановки выполнения.

AML.T0051Промпт-инъекция в LLM

Тестируйте прямые, косвенные и срабатывающие по триггеру инструкции, передаваемые через пользовательский ввод, извлечённые данные, документы, сообщения, веб-сайты, изображения, метаданные и выходные данные инструментов. Устраняйте недостатки в обеспечении границ доверия, обработке инструкций, управлении разрешениями и мониторинге.

AML.T0051.000Прямая промпт-инъекция

Отправляйте контролируемые вредоносные инструкции напрямую через доступные пользователям интерфейсы модели и приложения. Совершенствуйте механизмы, обеспечивающие соблюдение инструкций, а также контроль входных данных, авторизацию и мониторинг.

AML.T0051.001Косвенная промпт-инъекция

Размещайте контролируемые вредоносные инструкции во внешнем или извлечённом содержимом, которое обрабатывает система. Совершенствуйте границы доверия при обработке содержимого, средства контроля извлечения, изоляцию инструкций и ограничения на действия, выполняемые в результате.

AML.T0051.002Триггерная промпт-инъекция

Размещайте контролируемые инструкции в содержимом или рабочих процессах, где впоследствии их активируют действия пользователей или системные события. Проверяйте разрешения на активацию триггеров, обработку контекста, ограничения на действия и мониторинг.

AML.T0053Вызов инструментов ИИ-агента

Попытайтесь выбрать неавторизованные инструменты, передать небезопасные аргументы, выйти за пределы привилегий пользователя или выстроить цепочки вызовов инструментов для совершения действий, способных причинить вред. Устраните недостатки в настройке разрешений, валидации аргументов, изоляции в песочнице, средствах контроля действий и требованиях к одобрению.

AML.T0054Джейлбрейк LLM

Отрабатывайте различные варианты джейлбрейка: выполняемые вручную и автоматизированные, многоходовые, многоязычные, закодированные, преобразованные и мультимодальные. Используйте успешные случаи джейлбрейка для совершенствования гардрейлов, рекомендаций, выравнивания модели и мониторинга, а также включайте их в регрессионные оценки.

AML.T0056Извлечение системного промпта LLM

Тестируйте интерфейсы модели и приложения на возможность раскрытия системных инструкций, политик, определений инструментов или скрытого контекста. Удаляйте встроенные секреты и совершенствуйте изоляцию конфигурации и средства контроля выходных данных.

AML.T0057Утечка данных из LLM

Размещайте синтетические секреты или записи-канарейки в репрезентативных источниках данных и пытайтесь извлечь их через промпты, механизмы извлечения данных, инструменты и отображаемые выходные данные. Совершенствуйте разграничение полномочий, фильтрацию, изоляцию тенантов и обнаружение эксфильтрации.

AML.T0068Обфускация промпта LLM

Тестируйте закодированные, преобразованные, визуально скрытые, многоязычные и мультимодальные инструкции. Используйте случаи успешного обхода для совершенствования нормализации, декодирования, анализа содержимого и средств обнаружения.

AML.T0070Отравление RAG

Размещайте контролируемое вредоносное или вводящее в заблуждение содержимое в репрезентативных источниках поступления данных. Совершенствуйте механизмы допуска источников, отслеживание происхождения данных, валидацию содержимого, средства контроля индексирования и фильтрацию при извлечении данных.

AML.T0080Отравление контекста ИИ-агента

Попытайтесь добиться сохранения вредоносных инструкций в памяти ИИ-агента и в долгоживущих ветках диалога. Проверяйте наличие необходимых разрешений на изменение контекста, механизмы проверки целостности, маркировку уровня доверия, сроки действия, видимость для пользователя и меры по устранению последствий.

AML.T0080.000Память

Попытайтесь сохранить в долговременной памяти ИИ-агента контролируемое вредоносное содержимое — инструкции или предпочтения. Проверяйте наличие необходимых разрешений, видимость для пользователя, механизмы проверки целостности, сроки действия и средства устранения последствий отравления памяти.

AML.T0080.001Цепочка сообщений

Внедряйте контролируемые вредоносные инструкции в долгоживущие цепочки сообщений или цепочки сообщений с общим доступом. Проверяйте изоляцию контекста и его обработку с учётом уровня доверия, сброс цепочек сообщений, сроки действия и мониторинг.

AML.T0081Изменение конфигурации ИИ-агента

Отрабатывайте сценарии неавторизованных изменений системных промптов, инструментов, источников знаний, настроек безопасности и требований к одобрению. Совершенствуйте средства контроля доступа, процедуры одобрения изменений, мониторинг целостности и механизмы восстановления системы на основе доверенных конфигураций.