Отравленные шаблоны GGUF: атака на цепочку поставок во время инференса

Оригинал: Poisoned GGUF Templates: Inference-Time Supply Chain Attack

Исследователи из Pillar Security и Fujitsu Research of Europe продемонстрировали бэкдор в цепочке поставок, срабатывающий во время инференса: отравленные шаблоны чата изменяют поведение модели и агента без изменения весов модели. Бэкдор встроен в доверенную логику формирования промпта, что позволяет ему оставаться неактивным до срабатывания триггера и обходить средства защиты, анализирующие только внешнее содержимое промпта.

Исследователи продемонстрировали атаку с использованием GPT-Generated Unified Format (GGUF) — широко используемого формата моделей, объединяющего в одном артефакте квантованные веса, метаданные конфигурации и логику шаблона чата. Злоумышленник может изменить шаблон и повторно распространить артефакт; при срабатывании лексического, семантического или контекстного триггера шаблон внедряет подконтрольные злоумышленнику инструкции в контекст, передаваемый модели.

Атака была проверена на восемнадцати моделях из семи семейств с использованием четырёх движков инференса. В ходе контролируемых испытаний она приводила к манипулированию ответами модели, перенаправлению вызовов инструментов агентом, эксфильтрации чувствительных данных и внедрению подконтрольного злоумышленнику кода в генерируемое ПО.

Процедура

  1. AML.TA0003 Подготовка ресурсов

    AML.T0002.001 Модели

    Злоумышленник получает легитимный артефакт модели с открытыми весами, содержащий включённый в его состав шаблон чата. Злоумышленник выбирает артефакт, пользователи которого на последующих этапах с высокой вероятностью сохранят и будут использовать поставляемый вместе с ним шаблон.
  2. AML.TA0003 Подготовка ресурсов

    AML.T0017.000 Состязательные атаки на ИИ

    Злоумышленник разрабатывает бэкдор на основе шаблона, содержащий условную логику срабатывания триггера и полезную нагрузку в виде подконтрольной злоумышленнику инструкции. Триггер выбирается так, чтобы срабатывать при обычном использовании целевого приложения.
  3. AML.TA0001 Подготовка атаки на ИИ

    AML.T0018.003 Изменение логики формирования промпта

    Злоумышленник изменяет шаблон чата, включённый в состав артефакта модели. При наличии триггера изменённый шаблон внедряет подконтрольные злоумышленнику инструкции в контекст модели, не изменяя её весов.
  4. AML.TA0007 Уклонение от защиты

    AML.T0074 Маскировка

    Злоумышленник делает так, чтобы изменённый артефакт выглядел эквивалентным легитимной модели. В отсутствие триггера артефакт сохраняет ожидаемое поведение, а вредоносная логика скрыта среди легитимных элементов форматирования шаблона и легитимной управляющей логики.
  5. AML.TA0003 Подготовка ресурсов

    AML.T0115.001 Модели

    Злоумышленник публикует изменённый артефакт модели в репозитории моделей или через другой канал распространения, используемый разработчиками и организациями на последующих этапах цепочки поставок.
  6. AML.TA0004 Первичный доступ

    AML.T0010.003 Модель

    Жертва скачивает и интегрирует отравленный артефакт, доверяя модели и включённым в её состав компонентам. В результате бэкдор в шаблоне внедряется в ИИ-приложение или ИИ-агента жертвы.
  7. AML.TA0005 Выполнение

    AML.T0011.000 Небезопасные ИИ-артефакты

    Жертва загружает и использует отравленный артефакт в совместимом движке инференса. Во время инференса движок автоматически интерпретирует включённый в состав артефакта шаблон чата, из-за чего изменённая злоумышленником логика формирования промпта выполняется в рамках обычного использования модели.
  8. AML.TA0005 Выполнение

    AML.T0051.002 Триггерная промпт-инъекция

    При появлении заданной фразы или контекстного условия шаблон внедряет подконтрольную злоумышленнику инструкцию в сериализованный контекст модели. Обычная активность жертвы активирует бэкдор без дальнейшего участия злоумышленника.
  9. AML.TA0011 Воздействие

    AML.T0031 Нарушение целостности ИИ-модели

    Внедрённая инструкция заставляет модель выдавать правдоподобные, но неверные либо сформированные под влиянием злоумышленника ответы. В отсутствие триггера модель продолжает вести себя нормально, из-за чего компрометацию целостности трудно обнаружить.
  10. AML.TA0007 Уклонение от защиты

    AML.T0067 Манипуляция доверенными компонентами ответа LLM

    Внедрённая инструкция заставляет модель включать в ответ выбранные злоумышленником гиперссылки, ссылки на источники или другие компоненты так, чтобы они казались пользователю релевантными или заслуживающими доверия.
  11. AML.TA0005 Выполнение

    AML.T0053 Вызов инструментов ИИ-агента

    Когда отравленная модель работает в составе ИИ-агента, внедрённая инструкция меняет выбор инструментов агентом, аргументы их вызовов или порядок выполнения операций в интересах достижения цели злоумышленника, при этом позволяя продолжить выполнение легитимной задачи.
  12. AML.TA0010 Эксфильтрация

    AML.T0086 Эксфильтрация через вызов инструмента ИИ-агента

    Скомпрометированный ИИ-агент вызывает инструмент с сетевым доступом или возможностью записи, чтобы передать чувствительную информацию в место назначения, подконтрольное злоумышленнику. Затем агент может продолжить и завершить легитимную задачу пользователя, тем самым скрывая неавторизованную передачу.
  13. AML.TA0011 Воздействие

    AML.T0048.003 Ущерб пользователям

    Скомпрометированная система может подвергать пользователей риску нарушения приватности, кражи учётных данных, получения вводящей в заблуждение информации или ПО, изменённого злоумышленником. Вредоносное содержимое, внедрённое в сгенерированные артефакты, может продолжать воздействовать на пользователей на последующих этапах цепочки поставок после развёртывания или распространения этих артефактов.

Источники

  1. LLM Backdoors at the Inference Level: The Threat of Poisoned Templates
  2. Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise