Определение и инструкции
Оригинал: Definition and Instructions
Злоумышленники могут отравить доступное модели определение инструмента ИИ-агента или инструкции по работе с ним, чтобы манипулировать тем, как агент интерпретирует, выбирает или вызывает этот инструмент. Отравленное содержимое может находиться в описаниях инструментов, строках документации (docstrings), именах параметров, справочном тексте, схемах входных или выходных данных, аннотациях, примерах, манифестах, файлах с инструкциями для навыков или ином статическом содержимом, которое используется для передачи модели сведений о возможностях инструмента.
Вредоносные инструкции на этом уровне могут предписывать агенту собирать дополнительные данные, задавать значения скрытых или ненужных параметров, скрывать действия от пользователя либо вызывать другие инструменты. Поскольку агент может получать более полное представление инструмента, чем то, которое отображается в пользовательском интерфейсе, модель может обрабатывать вредоносные инструкции, которые не видны человеку, выполняющему проверку, или видны ему лишь частично[[invariant-tool-poisoning]].
Отравление определения также может использоваться для «затенения инструментов» (tool shadowing): при такой атаке определение одного вредоносного инструмента содержит инструкции, которые изменяют то, как агент выбирает или вызывает другой, доверенный инструмент. Если определения нескольких подключённых инструментов включены в один контекст модели, отравленный инструмент может не вызываться: его определение всё равно способно повлиять на агента[[invariant-tool-poisoning]].
Тактики
Родительская техника
Другие подтехники родителя
Примеры процедур из кейсов
Отравленный навык содержал в `rules/logic.md` вредоносные инструкции, доступные модели. После того как навык был установлен и стал доступен агенту, эти инструкции изменили то, как Claude Code обрабатывал связанные с навыком запросы.
AML.CS0054Эксфильтрация данных через отравленный удалённый MCP-инструментДоступная модели строка документации (docstring) MCP-инструмента содержала вредоносные инструкции, предписывавшие агенту прочитать файлы с учётными данными, скрыть от пользователя дополнительные действия и поместить содержимое этих файлов в параметр инструмента, который в противном случае не требовался бы.