ZombieAgent: атака на ChatGPT с эксфильтрацией данных

Оригинал: ZombieAgent: Data Exfiltration Attack on ChatGPT

ZombieAgent — proof-of-concept-атака с косвенной промпт-инъекцией, которую исследователи Radware продемонстрировали применительно к функциям Deep Research и Connector в ChatGPT от OpenAI. Продемонстрированные атаки показали, как ChatGPT во время обычных действий пользователя может принимать на обработку и выполнять инструкции, скрытые в содержимом, контролируемом внешней стороной, например в электронных письмах и документах. В демонстрации источником инъекции служил Gmail, однако аналогичным образом можно было злоупотребить любым ChatGPT Connector, например Outlook, Google Drive, Jira или Teams.

Исследователи безопасности Radware отправили вредоносное электронное письмо со скрытыми инструкциями в почтовый ящик Gmail, подключённый к ChatGPT. Когда позднее пользователь попросил ChatGPT выполнить обычную задачу, связанную с почтовым ящиком, ChatGPT извлёк письмо и выполнил содержащиеся в нём инструкции. Пользователь не открывал вредоносное письмо, не нажимал на него и вообще не взаимодействовал с ним осознанно.

Внедрённые инструкции заставили ChatGPT собрать информацию из подключённых сервисов и эксфильтрировать её с помощью запросов к URL. OpenAI ранее внедрила защитный механизм, запрещавший ChatGPT динамически формировать или изменять URL, которые могли использоваться для эксфильтрации данных через параметры запроса. Исследователи обошли этот механизм, предоставив индексированный словарь заранее сформированных статических URL и предписав ChatGPT открывать URL, соответствующие отдельным символам, чтобы эксфильтрировать собранные данные.

Исследователи также показали, что вредоносные инструкции могут манипулировать функцией Memory в ChatGPT. Внедрённые записи памяти предписывали ChatGPT сохранять чувствительную информацию из будущих разговоров, а во время последующих взаимодействий извлекать заданное подконтрольное злоумышленнику электронное письмо и выполнять содержащиеся в нём инструкции. Так был создан устойчивый механизм многократного сбора и эксфильтрации данных в разных чат-сессиях.

Исследователи также продемонстрировали, как вредоносный промпт может распространяться. Скомпрометированный ИИ-агент мог собирать адреса электронной почты из почтового ящика жертвы и с помощью подключённых возможностей работы с электронной почтой отправлять этим контактам дополнительные сообщения с вредоносным промптом. Получатели, чьи ИИ-агенты позднее обрабатывали отравленные сообщения, могли становиться новыми жертвами.

Процедура

  1. AML.TA0003 Подготовка ресурсов

    AML.T0065 Создание промптов для LLM

    Исследователи подготовили для различных вариантов атаки вредоносные полезные нагрузки в виде промптов. Эти нагрузки содержали инструкции для доступа через коннекторы, сбора данных, кодирования посредством статических URL, манипулирования функцией Memory и распространения.
  2. AML.TA0003 Подготовка ресурсов

    AML.T0079 Размещение средств атаки

    Исследователи подготовили инфраструктуру для приёма эксфильтрированных данных.
  3. AML.TA0007 Уклонение от защиты

    AML.T0068 Обфускация промпта LLM

    Промпт-инъекция была визуально скрыта в содержимом, контролируемом внешней стороной, с помощью таких приёмов, как белый текст на белом фоне или микроскопический размер шрифта. ChatGPT мог обрабатывать инструкции, хотя они были незаметны пользователю.
  4. AML.TA0004 Первичный доступ

    AML.T0093 Внедрение промпта через публичное приложение

    Исследователи отправили вредоносное письмо в подключённый к ChatGPT почтовый ящик либо предоставили вредоносный документ, который можно было загрузить в ChatGPT или получить через подключённый сервис. В результате промпт оказался в источнике данных, к которому имел доступ ИИ-агент жертвы.
  5. AML.TA0005 Выполнение

    AML.T0051.001 Косвенная промпт-инъекция

    Последующий легитимный запрос пользователя, например просьба к ChatGPT суммаризировать содержимое почтового ящика, заставил агента извлечь вредоносное содержимое и выполнить скрытые инструкции. Пользователь не взаимодействовал с вредоносным письмом осознанно.
  6. AML.TA0006 Закрепление

    AML.T0080.000 Память

    Вредоносные инструкции заставили ChatGPT создавать или изменять записи в функции Memory. Отравленные записи памяти предписывали ChatGPT сохранять чувствительную информацию из разговоров и выполнять заданные злоумышленником действия во время последующих взаимодействий.
  7. AML.TA0012 Повышение привилегий

    AML.T0053 Вызов инструментов ИИ-агента

    Вредоносные инструкции заставили ChatGPT задействовать возможности коннекторов и веб-доступа, доступные в рамках полномочий жертвы. В результате выполнение инструкций из промпта обеспечило доступ к информации и возможность выполнять действия, которые не были напрямую доступны исследователям.
  8. AML.TA0009 Сбор материалов

    AML.T0085.001 Инструменты ИИ-агента

    ChatGPT использовал инструменты подключённых сервисов для извлечения информации, доступной агенту жертвы. В ходе демонстрации были собраны содержимое почтового ящика и контактные данные из электронной почты.
  9. AML.TA0007 Уклонение от защиты

    AML.T0054 Джейлбрейк LLM

    Исследователи обошли ограничение ChatGPT, запрещавшее динамически формировать или изменять URL, предоставив индексированный словарь статических URL. ChatGPT кодировал собранные данные, выбирая и открывая URL, соответствующий каждому символу и его позиции.
  10. AML.TA0010 Эксфильтрация

    AML.T0086 Эксфильтрация через вызов инструмента ИИ-агента

    ChatGPT задействовал функцию открытия URL, чтобы отправить запросы к выбранным URL, подконтрольным злоумышленнику. Исследователи восстановили чувствительные данные по символам и их позициям, закодированным в получившихся запросах к серверу. Запросы исходили из инфраструктуры OpenAI, а не с эндпоинта жертвы или из её корпоративной сети.
  11. AML.TA0009 Сбор материалов

    AML.T0085.001 Инструменты ИИ-агента

    ChatGPT выполнил поиск в почтовом ящике жертвы и собрал адреса электронной почты, принадлежавшие потенциальным дополнительным целям.
  12. AML.TA0015 Латеральное перемещение

    AML.T0053 Вызов инструментов ИИ-агента

    Вредоносные инструкции заставили ChatGPT воспроизводить промпт в новых электронных письмах или документах и распространять эти материалы среди собранных контактов. Если отравленное содержимое обрабатывал другой ИИ-агент, атака могла распространяться между пользователями или подключёнными ИИ-системами.

Источники

  1. ZombieAgent: New ChatGPT Vulnerabilities Let Data Theft Continue (and Spread)