Определение и инструкции

Оригинал: Definition and Instructions

Злоумышленники могут отравить доступное модели определение инструмента ИИ-агента или инструкции по работе с ним, чтобы манипулировать тем, как агент интерпретирует, выбирает или вызывает этот инструмент. Отравленное содержимое может находиться в описаниях инструментов, строках документации (docstrings), именах параметров, справочном тексте, схемах входных или выходных данных, аннотациях, примерах, манифестах, файлах с инструкциями для навыков или ином статическом содержимом, которое используется для передачи модели сведений о возможностях инструмента.

Вредоносные инструкции на этом уровне могут предписывать агенту собирать дополнительные данные, задавать значения скрытых или ненужных параметров, скрывать действия от пользователя либо вызывать другие инструменты. Поскольку агент может получать более полное представление инструмента, чем то, которое отображается в пользовательском интерфейсе, модель может обрабатывать вредоносные инструкции, которые не видны человеку, выполняющему проверку, или видны ему лишь частично[[invariant-tool-poisoning]].

Отравление определения также может использоваться для «затенения инструментов» (tool shadowing): при такой атаке определение одного вредоносного инструмента содержит инструкции, которые изменяют то, как агент выбирает или вызывает другой, доверенный инструмент. Если определения нескольких подключённых инструментов включены в один контекст модели, отравленный инструмент может не вызываться: его определение всё равно способно повлиять на агента[[invariant-tool-poisoning]].

Тактики

Родительская техника

Другие подтехники родителя

Примеры процедур из кейсов

Источники