Красная команда по ИИ
Оригинал: AI Red Team
Создайте красную команду по ИИ, ответственную за проведение регулярных, санкционированных учений красной команды, основанных на данных об угрозах, для выявления и устранения уязвимостей в системах с поддержкой ИИ до развёртывания и на всём протяжении эксплуатации. Тестирование ИИ силами красной команды имитирует реалистичное поведение злоумышленников, чтобы оценить, как атаки могут повлиять на конфиденциальность, целостность, доступность, безопасность, приватность и эффективность выполнения целевых задач системой с поддержкой ИИ.
Учения красной команды должны охватывать всю систему с поддержкой ИИ, включая модели и данные, агентов (в том числе их память и инструменты), потоки данных, процессы принятия решений, логику приложений, системы извлечения данных, идентичности и разрешения, зависимости ПО, компоненты системы, не использующие ИИ, инфраструктуру, пользовательские интерфейсы и рабочие процессы с участием людей.
Учение красной команды по ИИ можно организовать в три этапа: планирование и определение области учения, проведение выбранных испытаний и оценка результатов, на основе которой формируются отчётность и меры по устранению недостатков.
Планирование и определение области
- Документируйте предполагаемое использование системы, среду развёртывания, пользователей, чувствительные данные, подключённые ресурсы и возможные последствия отказа или неправомерного использования. Составьте схему компонентов системы, границ доверия, потоков данных, внешних сервисов, точек принятия решений человеком, а также точек доступа на этапах обучения и инференса.
- Установите правила проведения учений, охватывающие разрешённые системы, учётные записи, данные и техники, временные окна тестирования, ограничения ресурсов, процедуры эскалации, порядок работы с доказательствами и условия остановки. Планируйте разрушительные, нарушающие приватность или дорогостоящие тесты для изолированных сред с надлежащими мерами защиты.
- Разработайте модель угроз на основе среды эксплуатации системы и релевантного поведения злоумышленников. Определите цели злоумышленника, уровень его доступа, знания, возможности, ресурсы и ограничения; учтите цифровые и физические пути атак, а также роль контроля со стороны человека.
- Используйте тактики, техники и процедуры ATLAS для выявления релевантных вариантов поведения злоумышленников и построения векторов угроз. Назначьте им приоритеты с учётом вероятности и серьёзности воздействия на систему.
- Определите критерии успеха и условия остановки. Определите метрики уровня задач для оценки воздействия на возможности ИИ и операционные метрики для измерения воздействия на систему в целом.
Проведение
- Проводите выбранные испытания ручными и автоматизированными методами по мере необходимости. Автоматизация позволяет создавать варианты входных данных, повторно воспроизводить последовательности атак и оценивать ответы в большом масштабе. Специалисты, проводящие тестирование, могут разрабатывать атаки с учётом особенностей системы, адаптироваться к наблюдаемым средствам защиты и исследовать неожиданное поведение.
- Соблюдайте правила проведения учений и фиксируйте действия в рамках атаки, ответы системы, поведение средств контроля, отклонения от плана тестирования и доказательства, необходимые для оценки результатов.
- Остановите тестирование или запустите процедуру эскалации при достижении заранее определённых условий. После тестирования удалите тестовые учётные записи, изменённые данные, установленное ПО, инструкции, сохраняющиеся в системе, и другие артефакты учений.
Оценка, отчётность и совершенствование
- Оцените результаты по заданным метрикам уровня задач и операционным метрикам. Документируйте успешные и неуспешные атаки, их последствия, наблюдаемое поведение средств контроля, отклонения от плана тестирования и пробелы в модели угроз.
- Сообщите о выявленных проблемах соответствующим разработчикам, специалистам по защите, командам эксплуатации, владельцам рисков и другим заинтересованным сторонам.
- Назначьте ответственных за выявленные проблемы, отслеживайте их устранение и повторно тестируйте исправленные системы.
- Используйте продемонстрированные атаки для совершенствования превентивных средств контроля, обнаружения, реагирования на инциденты и восстановления. Там, где это уместно, преобразуйте подтверждённые сбои в регрессионные тесты, наборы данных для оценки, логику обнаружения, требования к мониторингу или критерии развёртывания.
Тестирование силами красной команды — непрерывный процесс; его следует повторять по мере развития ландшафта угроз, а также при внесении изменений в систему, её компоненты, предполагаемое использование или среду развёртывания. Новые данные об угрозах, уязвимости и результаты тестирования должны служить основой для определения области и приоритетов будущих учений.
Связанные техники
Отработайте в контролируемых условиях внедрение недоверенных компонентов — ПО, данных, моделей и инструментов ИИ-агента — через репрезентативные пути их получения и развёртывания. Устраните недостатки, связанные со сведениями о происхождении, валидацией, процедурами одобрения, изоляцией и откатом.
AML.T0010.001ПО для ИИВнедряйте недоверенные пакеты ПО для ИИ, библиотеки, плагины или программные компоненты только в контролируемую среду. Проверьте средства контроля зависимостей, сканирование, подписание, процедуры одобрения, изоляцию и безопасность установки.
AML.T0010.002ДанныеВнедряйте недоверенные наборы данных только в контролируемую среду через репрезентативные пути их получения и приёма. Проверьте механизмы отслеживания происхождения, обеспечения целостности, санитизации, проверки и отбраковки данных.
AML.T0010.003МодельВнедряйте недоверенную или модифицированную модель только в контролируемую среду через репрезентативные пути её получения и развёртывания. Проверьте сведения о происхождении, сканирование, подписание, процедуры одобрения, изоляцию и возможность возврата к предыдущей версии модели.
AML.T0010.005Инструмент ИИ-агентаВнедряйте недоверенный инструмент ИИ-агента или недоверенное определение инструмента только в контролируемую среду. Убедитесь, что источник входит в число разрешённых; проверьте целостность, факт проведения проверки, границы разрешений и безопасность активации.
AML.T0015Обход ИИ-моделиПроведите репрезентативные цифровые и мультимодальные атаки обхода, а также атаки обхода в физическом домене. Используйте успешные атаки, чтобы повысить устойчивость модели и улучшить предобработку, обнаружение состязательных входных данных, контроль со стороны человека и мониторинг.
AML.T0018Манипуляция ИИ-модельюВ контролируемых условиях попытайтесь изменить или подменить модели, веса, адаптеры и связанную с ними конфигурацию. Устраните недостатки механизмов авторизации, обеспечения целостности артефактов, процедур одобрения развёртывания, мониторинга и восстановления.
AML.T0018.000Отравление ИИ-моделиПроверьте, могут ли контролируемые изменения весов модели, контролируемое дообучение или контролируемые изменения связанных с моделью артефактов привести к появлению целевого или устойчивого поведения. Усовершенствуйте отслеживание происхождения модели, её валидацию и мониторинг целостности, а также механизм возврата к предыдущей версии.
AML.T0018.001Изменение архитектуры ИИ-моделиВ контролируемых условиях попытайтесь внести неавторизованные изменения в архитектуру модели или в её исполняемые компоненты. Проверьте процессы рассмотрения изменений, контроля целостности, подписания и одобрения развёртывания, а также механизмы восстановления.
AML.T0020Отравление обучающих данныхВ контролируемых условиях внедрите отравленные записи или триггеры в репрезентативные пайплайны обработки данных. Проверьте и усовершенствуйте отслеживание происхождения данных, их санитизацию и проверку, обнаружение дрейфа, валидацию модели и механизмы возврата к предыдущему состоянию.
AML.T0024Эксфильтрация через API инференса ИИИспытайте интерфейсы инференса с помощью методов определения принадлежности к обучающей выборке, инверсии ИИ-модели и извлечения функциональной копии ИИ-модели. Используйте полученные результаты для совершенствования мер защиты приватности, аутентификации, ограничений на выходные данные, лимитов частоты запросов и мониторинга.
AML.T0024.000Определение принадлежности к обучающей выборкеПроверьте, позволяют ли выходные данные модели определить, входили ли известные образцы данных в её обучающую выборку. Усовершенствуйте обучение с сохранением приватности, ограничения на выходные данные, контроль доступа и мониторинг запросов.
AML.T0024.001Инверсия ИИ-моделиПопытайтесь реконструировать чувствительные записи, атрибуты или сведения, характерные для обучающих данных, на основе выходных данных модели. Устраните утечку за счёт внесения изменений в модель, минимизации выходных данных, мер защиты приватности и ограничения доступа к инференсу.
AML.T0024.002Извлечение ИИ-моделиЭмулируйте извлечение функциональной копии модели с помощью запросов на инференс. Внедрите надлежащую аутентификацию, ограничения частоты запросов, ограничения на выходные данные, обнаружение аномалий и мониторинг попыток извлечения модели.
AML.T0029Отказ в обслуживании ИИ-сервисаНаправляйте на систему состязательные рабочие нагрузки и отрабатывайте сценарии отказов зависимостей, которые могут привести к исчерпанию ресурсов сервисов инференса или вспомогательных сервисов. По результатам применяйте квоты, ограничения числа одновременных операций, таймауты, изоляцию ресурсов и механизмы плавной деградации.
AML.T0034Искусственное увеличение затратОтрабатывайте сценарии с запросами и рабочими процессами, предназначенными для увеличения затрат на инференс, инфраструктуру или внешние сервисы. Проверяйте бюджеты, квоты, ограничения частоты запросов, средства управления рабочими нагрузками, систему оповещения и механизмы остановки.
AML.T0034.000Чрезмерные запросыВ контролируемых условиях генерируйте интенсивный поток запросов. Проверяйте аутентификацию, квоты пользователей и тенантов, ограничения частоты запросов, обнаружение аномалий, оповещения о затратах и средства защиты сервиса.
AML.T0034.001Ресурсоёмкие запросыВ контролируемых условиях направляйте на систему запросы, специально подготовленные для потребления непропорционально большого объёма ресурсов при инференсе. Проверяйте ограничения на входные данные, таймауты, ограничения рабочей нагрузки, изоляцию ресурсов и мониторинг затрат.
AML.T0034.002Потребление ресурсов агентомТестируйте рекурсивное поведение, повторные вызовы инструментов, использование API, приводящее к высоким затратам, и расширение области задачи под контролем злоумышленника. Проверяйте бюджеты, ограничения числа итераций, таймауты, пороги обязательного одобрения и средства остановки выполнения.
AML.T0051Промпт-инъекция в LLMТестируйте прямые, косвенные и срабатывающие по триггеру инструкции, передаваемые через пользовательский ввод, извлечённые данные, документы, сообщения, веб-сайты, изображения, метаданные и выходные данные инструментов. Устраняйте недостатки в обеспечении границ доверия, обработке инструкций, управлении разрешениями и мониторинге.
AML.T0051.000Прямая промпт-инъекцияОтправляйте контролируемые вредоносные инструкции напрямую через доступные пользователям интерфейсы модели и приложения. Совершенствуйте механизмы, обеспечивающие соблюдение инструкций, а также контроль входных данных, авторизацию и мониторинг.
AML.T0051.001Косвенная промпт-инъекцияРазмещайте контролируемые вредоносные инструкции во внешнем или извлечённом содержимом, которое обрабатывает система. Совершенствуйте границы доверия при обработке содержимого, средства контроля извлечения, изоляцию инструкций и ограничения на действия, выполняемые в результате.
AML.T0051.002Триггерная промпт-инъекцияРазмещайте контролируемые инструкции в содержимом или рабочих процессах, где впоследствии их активируют действия пользователей или системные события. Проверяйте разрешения на активацию триггеров, обработку контекста, ограничения на действия и мониторинг.
AML.T0053Вызов инструментов ИИ-агентаПопытайтесь выбрать неавторизованные инструменты, передать небезопасные аргументы, выйти за пределы привилегий пользователя или выстроить цепочки вызовов инструментов для совершения действий, способных причинить вред. Устраните недостатки в настройке разрешений, валидации аргументов, изоляции в песочнице, средствах контроля действий и требованиях к одобрению.
AML.T0054Джейлбрейк LLMОтрабатывайте различные варианты джейлбрейка: выполняемые вручную и автоматизированные, многоходовые, многоязычные, закодированные, преобразованные и мультимодальные. Используйте успешные случаи джейлбрейка для совершенствования гардрейлов, рекомендаций, выравнивания модели и мониторинга, а также включайте их в регрессионные оценки.
AML.T0056Извлечение системного промпта LLMТестируйте интерфейсы модели и приложения на возможность раскрытия системных инструкций, политик, определений инструментов или скрытого контекста. Удаляйте встроенные секреты и совершенствуйте изоляцию конфигурации и средства контроля выходных данных.
AML.T0057Утечка данных из LLMРазмещайте синтетические секреты или записи-канарейки в репрезентативных источниках данных и пытайтесь извлечь их через промпты, механизмы извлечения данных, инструменты и отображаемые выходные данные. Совершенствуйте разграничение полномочий, фильтрацию, изоляцию тенантов и обнаружение эксфильтрации.
AML.T0068Обфускация промпта LLMТестируйте закодированные, преобразованные, визуально скрытые, многоязычные и мультимодальные инструкции. Используйте случаи успешного обхода для совершенствования нормализации, декодирования, анализа содержимого и средств обнаружения.
AML.T0070Отравление RAGРазмещайте контролируемое вредоносное или вводящее в заблуждение содержимое в репрезентативных источниках поступления данных. Совершенствуйте механизмы допуска источников, отслеживание происхождения данных, валидацию содержимого, средства контроля индексирования и фильтрацию при извлечении данных.
AML.T0080Отравление контекста ИИ-агентаПопытайтесь добиться сохранения вредоносных инструкций в памяти ИИ-агента и в долгоживущих ветках диалога. Проверяйте наличие необходимых разрешений на изменение контекста, механизмы проверки целостности, маркировку уровня доверия, сроки действия, видимость для пользователя и меры по устранению последствий.
AML.T0080.000ПамятьПопытайтесь сохранить в долговременной памяти ИИ-агента контролируемое вредоносное содержимое — инструкции или предпочтения. Проверяйте наличие необходимых разрешений, видимость для пользователя, механизмы проверки целостности, сроки действия и средства устранения последствий отравления памяти.
AML.T0080.001Цепочка сообщенийВнедряйте контролируемые вредоносные инструкции в долгоживущие цепочки сообщений или цепочки сообщений с общим доступом. Проверяйте изоляцию контекста и его обработку с учётом уровня доверия, сброс цепочек сообщений, сроки действия и мониторинг.
AML.T0081Изменение конфигурации ИИ-агентаОтрабатывайте сценарии неавторизованных изменений системных промптов, инструментов, источников знаний, настроек безопасности и требований к одобрению. Совершенствуйте средства контроля доступа, процедуры одобрения изменений, мониторинг целостности и механизмы восстановления системы на основе доверенных конфигураций.