Anthropic представляет руководство по безопасности для ИИ-агентов

Команда Anthropic опубликовала новое руководство под названием Zero Trust for AI agents, посвященное безопасному развертыванию автономных ИИ-агентов в корпоративной среде. В этом документе особое внимание уделяется рискам, связанным с агентными системами, а также подходам к кибербезопасности. По мнению Anthropic, современные ИИ-решения значительно ускорили время между обнаружением уязвимости и ее использованием.

Главный принцип, на который опираются разработчики, — это Zero Trust (нулевое доверие), который предполагает проверку каждого действия и доскональную оценку возможных угроз. Среди основных описанных рисков – различные виды атак, в том числе внедрение вредоносного кода через пользовательский ввод и заражение инструментов.

Компания предлагает трехуровневую модель защиты, в том числе использование песочницы для агентов с недоверенными входами. Кроме того, руководство рекомендует вести детальную регистрацию действий и настраивать отслеживание для воспроизведения событий.

Важно помнить, что для эффективной защиты недостаточно простых фильтров; необходимо строить систему на базе идентичности и минимальных полномочий. Как говорит Anthropic, безопасность не столько в передовых технологиях, сколько в надежной архитектуре системы.

*компания Meta Platforms Inc. признана экстремистской организацией, ее деятельность на территории России запрещена