Отравленные шаблоны GGUF: атака на цепочку поставок во время инференса
Оригинал: Poisoned GGUF Templates: Inference-Time Supply Chain Attack
Исследователи из Pillar Security и Fujitsu Research of Europe продемонстрировали бэкдор в цепочке поставок, срабатывающий во время инференса: отравленные шаблоны чата изменяют поведение модели и агента без изменения весов модели. Бэкдор встроен в доверенную логику формирования промпта, что позволяет ему оставаться неактивным до срабатывания триггера и обходить средства защиты, анализирующие только внешнее содержимое промпта.
Исследователи продемонстрировали атаку с использованием GPT-Generated Unified Format (GGUF) — широко используемого формата моделей, объединяющего в одном артефакте квантованные веса, метаданные конфигурации и логику шаблона чата. Злоумышленник может изменить шаблон и повторно распространить артефакт; при срабатывании лексического, семантического или контекстного триггера шаблон внедряет подконтрольные злоумышленнику инструкции в контекст, передаваемый модели.
Атака была проверена на восемнадцати моделях из семи семейств с использованием четырёх движков инференса. В ходе контролируемых испытаний она приводила к манипулированию ответами модели, перенаправлению вызовов инструментов агентом, эксфильтрации чувствительных данных и внедрению подконтрольного злоумышленнику кода в генерируемое ПО.
Процедура
- AML.TA0003 Подготовка ресурсов
AML.T0002.001 Модели
Злоумышленник получает легитимный артефакт модели с открытыми весами, содержащий включённый в его состав шаблон чата. Злоумышленник выбирает артефакт, пользователи которого на последующих этапах с высокой вероятностью сохранят и будут использовать поставляемый вместе с ним шаблон. - AML.TA0003 Подготовка ресурсов
AML.T0017.000 Состязательные атаки на ИИ
Злоумышленник разрабатывает бэкдор на основе шаблона, содержащий условную логику срабатывания триггера и полезную нагрузку в виде подконтрольной злоумышленнику инструкции. Триггер выбирается так, чтобы срабатывать при обычном использовании целевого приложения. - AML.TA0001 Подготовка атаки на ИИ
AML.T0018.003 Изменение логики формирования промпта
Злоумышленник изменяет шаблон чата, включённый в состав артефакта модели. При наличии триггера изменённый шаблон внедряет подконтрольные злоумышленнику инструкции в контекст модели, не изменяя её весов. - AML.TA0007 Уклонение от защиты
AML.T0074 Маскировка
Злоумышленник делает так, чтобы изменённый артефакт выглядел эквивалентным легитимной модели. В отсутствие триггера артефакт сохраняет ожидаемое поведение, а вредоносная логика скрыта среди легитимных элементов форматирования шаблона и легитимной управляющей логики. - AML.TA0003 Подготовка ресурсов
AML.T0115.001 Модели
Злоумышленник публикует изменённый артефакт модели в репозитории моделей или через другой канал распространения, используемый разработчиками и организациями на последующих этапах цепочки поставок. - AML.TA0004 Первичный доступ
AML.T0010.003 Модель
Жертва скачивает и интегрирует отравленный артефакт, доверяя модели и включённым в её состав компонентам. В результате бэкдор в шаблоне внедряется в ИИ-приложение или ИИ-агента жертвы. - AML.TA0005 Выполнение
AML.T0011.000 Небезопасные ИИ-артефакты
Жертва загружает и использует отравленный артефакт в совместимом движке инференса. Во время инференса движок автоматически интерпретирует включённый в состав артефакта шаблон чата, из-за чего изменённая злоумышленником логика формирования промпта выполняется в рамках обычного использования модели. - AML.TA0005 Выполнение
AML.T0051.002 Триггерная промпт-инъекция
При появлении заданной фразы или контекстного условия шаблон внедряет подконтрольную злоумышленнику инструкцию в сериализованный контекст модели. Обычная активность жертвы активирует бэкдор без дальнейшего участия злоумышленника. - AML.TA0011 Воздействие
AML.T0031 Нарушение целостности ИИ-модели
Внедрённая инструкция заставляет модель выдавать правдоподобные, но неверные либо сформированные под влиянием злоумышленника ответы. В отсутствие триггера модель продолжает вести себя нормально, из-за чего компрометацию целостности трудно обнаружить. - AML.TA0007 Уклонение от защиты
AML.T0067 Манипуляция доверенными компонентами ответа LLM
Внедрённая инструкция заставляет модель включать в ответ выбранные злоумышленником гиперссылки, ссылки на источники или другие компоненты так, чтобы они казались пользователю релевантными или заслуживающими доверия. - AML.TA0005 Выполнение
AML.T0053 Вызов инструментов ИИ-агента
Когда отравленная модель работает в составе ИИ-агента, внедрённая инструкция меняет выбор инструментов агентом, аргументы их вызовов или порядок выполнения операций в интересах достижения цели злоумышленника, при этом позволяя продолжить выполнение легитимной задачи. - AML.TA0010 Эксфильтрация
AML.T0086 Эксфильтрация через вызов инструмента ИИ-агента
Скомпрометированный ИИ-агент вызывает инструмент с сетевым доступом или возможностью записи, чтобы передать чувствительную информацию в место назначения, подконтрольное злоумышленнику. Затем агент может продолжить и завершить легитимную задачу пользователя, тем самым скрывая неавторизованную передачу. - AML.TA0011 Воздействие
AML.T0048.003 Ущерб пользователям
Скомпрометированная система может подвергать пользователей риску нарушения приватности, кражи учётных данных, получения вводящей в заблуждение информации или ПО, изменённого злоумышленником. Вредоносное содержимое, внедрённое в сгенерированные артефакты, может продолжать воздействовать на пользователей на последующих этапах цепочки поставок после развёртывания или распространения этих артефактов.