Ограничение потребления ресурсов рабочими нагрузками ИИ

Оригинал: Limit AI Workload Resource Consumption

Ограничивайте объём ресурсов, который может потреблять запрос к ИИ, задание инференса или рабочий процесс ИИ-агента. Устанавливайте ограничения на размер входных данных, размер батча, время выполнения, объём памяти, вычислительные ресурсы и размер выходных данных. Сервисы генеративного ИИ также должны ограничивать число токенов контекста и выходных токенов. В агентных ИИ-системах следует ограничивать число итераций, повторных попыток, вызовов инструментов и параллельных задач, глубину делегирования и расходы, возникающие при обращении к нижестоящим сервисам.

Применяйте ограничения ресурсов на всём протяжении рабочего процесса, поскольку один запрос может инициировать несколько вызовов модели или внешних действий. Используйте таймауты, предельные уровни затрат, автоматические выключатели (circuit breakers) и условия безопасного завершения, чтобы отдельные рабочие нагрузки не могли исчерпать общие ресурсы. Эти меры дополняют ограничения частоты запросов, которые защищают от большого числа запросов, по отдельности не требующих значительных затрат.

Связанные техники

AML.T0029Отказ в обслуживании ИИ-сервиса

Ограничивайте объём ресурсов, потребляемых отдельными запросами, чтобы снизить риск отказа в обслуживании ИИ-сервиса из-за входных данных, требующих значительных вычислительных ресурсов.

AML.T0034Искусственное увеличение затрат

Устанавливайте бюджеты ресурсов для запросов к ИИ и рабочих процессов с использованием ИИ, чтобы ограничить затраты, возникающие из-за ресурсоёмких запросов, чрезмерного объёма выходных данных и неконтролируемой активности ИИ-агентов.

AML.T0034.001Ресурсоёмкие запросы

Для ресурсоёмких запросов ограничивайте размер входных и выходных данных, время выполнения, потребление памяти и вычислительных ресурсов.

AML.T0034.002Потребление ресурсов агентом

Ограничивайте число итераций агента и вызовов инструментов, степень ветвления, продолжительность выполнения и расходы, возникающие при обращении к нижестоящим сервисам, чтобы удерживать потребление ресурсов агентом в заданных пределах.