Эксфильтрация разговоров ChatGPT
Оригинал: ChatGPT Conversation Exfiltration
Embrace the Red продемонстрировали, что разговоры пользователей ChatGPT могут быть эксфильтрованы посредством косвенной промпт-инъекции. Для выполнения атаки злоумышленник размещает вредоносный промпт на общедоступном веб-сайте, где с ним может взаимодействовать пользователь ChatGPT. Промпт заставляет ChatGPT сформировать ответ с Markdown-разметкой изображения, в URL которого скрытно встроено содержимое разговора пользователя. Отображая изображение пользователю, ChatGPT автоматически отправляет запрос к скрипту под контролем злоумышленника и тем самым эксфильтрирует содержимое разговора. Кроме того, исследователь показал, как промпт может инициировать вызов других плагинов, что создаёт возможность причинения дополнительного вреда.
Процедура
- AML.TA0003 Подготовка ресурсов
AML.T0065 Создание промптов для LLM
Исследователь разработал промпт, который заставляет ChatGPT добавлять в ответы Markdown-изображение, где разговор пользователя встроен в URL. - AML.TA0003 Подготовка ресурсов
AML.T0079 Размещение средств атаки
Исследователь разместил этот промпт на веб-странице, чтобы ChatGPT мог получить его при обращении к странице. - AML.TA0004 Первичный доступ
AML.T0078 Компрометация при посещении сайта
Когда запрос пользователя заставляет ChatGPT открыть эту веб-страницу через плагинWebPilot, модель считывает промпт злоумышленника. - AML.TA0005 Выполнение
AML.T0051.001 Косвенная промпт-инъекция
Промпт-инъекция срабатывает и заставляет ChatGPT добавить Markdown-изображение с сервера злоумышленника.
История переписки пользователя при этом встраивается в URL как query-параметр.
- AML.TA0010 Эксфильтрация
AML.T0077 Рендеринг ответа LLM
ChatGPT автоматически отображает изображение пользователю, из-за чего отправляет запрос на сервер злоумышленника и передает туда разговор пользователя. - AML.TA0012 Повышение привилегий
AML.T0053 Вызов инструментов ИИ-агента
Кроме того, промпт может заставить LLM вызывать плагины, которые пользователь не запрашивал.
В этом примере исследователь показал, как плагин
WebPilotобращается к плагинуExpedia. - AML.TA0011 Воздействие
AML.T0048.003 Ущерб пользователям
В результате нарушается конфиденциальность пользователя, и он может стать целью дальнейших атак.