NVIDIA опубликовала свою позицию по защите AI-агентов, представив её как инженерную задачу, а не задачу моделирования. Компания утверждает, что каждому развёртыванию агента нужны исполнимые границы, назначенный ответственный и доказательства того, что защиты работают. Основной тезис: обязанности по безопасности, сложившиеся во времена интернета и облачных вычислений — установить идентичность, контролировать доступ, ограничить поверхность воздействия, проверять работоспособность защит, — без изменений переносятся на агентов, которые рассуждают, используют инструменты и адаптируют действия под данные, с которыми сталкиваются.
Что NVIDIA предлагает для стека агентов
Стек описан в трёх частях: модели дают возможности, harnesses организуют контекст, инструменты и рабочие процессы, а среды исполнения предоставляют инфраструктуру, в которой выполняются действия. Каждый слой несёт собственную ответственность за безопасность, и защита требует контроля на всех уровнях, поскольку данные, инструкции и действия движутся через систему. Собственный вклад NVIDIA — OpenShell, открытая безопасная среда исполнения, которая применяет политики вне досягаемости агента и обеспечивает изолированное выполнение, управляя доступом агента к данным, сети и системным ресурсам. Партнёры Open Secure AI Alliance строят решения на её основе: Cisco DefenseClaw добавляет уровень управления, а JFrog интегрируется с OpenShell, чтобы сканировать и проверять навыки агентов и применять политики доступа к ним.
Механика опирается на разделение прав и рассуждений. Агент, обновляющий запись о клиенте, не должен автоматически получать возможность выгружать эти данные; он может запросить дополнительный доступ, но не может сам его авторизовать. Пределы по файлам, сетевым назначениям и процессам задаёт среда исполнения, а не собственные суждения агента. NVIDIA иллюстрирует это примером агента, который встречает вредоносные инструкции во вложенном документе и пытается отправить данные клиентов на несанкционированный адрес: сетевая политика должна заблокировать передачу, а защищённые журналы — зафиксировать попытку вызова инструмента, решение об авторизации и результат, чтобы служба безопасности могла определить использованный инструмент и адрес назначения. Каждому агенту также нужна прослеживаемая идентичность и учётные данные, ограниченные его задачей, а значимые действия и изменения прав по-прежнему требуют одобрения человека.
Что это значит для компаний, внедряющих агентов
Для бизнеса практическое следствие в том, что безопасность агентов становится требованием к закупке и тестированию, а не свойством модели. Перед развёртыванием командам нужны доказательства, что контроли блокируют попытки получить учётные данные за пределами полномочий агента или отправить чувствительные данные на несанкционированный адрес; тестирование должно охватывать и попытки изменить права или помешать мониторингу. NVIDIA указывает, что такие проверки нужно повторять после существенных изменений моделей, инструментов или рабочих процессов. Назначенный ответственный обязан на основе результатов решить, готова ли система к развёртыванию, а сбои, найденные при тестировании или эксплуатации, — воспроизводиться, расследоваться и превращаться в повторяемые тесты. В качестве примеров повторяемой симуляции атак и непрерывного red teaming названы CrowdStrike SafeMind и Palo Alto Networks Prisma AIRS.
У небольших компаний другой компромисс, чем у крупных. Малая команда вряд ли будет вести собственную программу red teaming, поэтому зависит от управляемых возможностей и сервисов, которые дают закрытые модели. Открытые модели позволяют защитникам изучать нужные компоненты, адаптировать стратегии и работать на инфраструктуре, которую они контролируют: во время инцидента такой контроль помогает воспроизвести сбой и проверить исправление на своих системах, не выводя чувствительные доказательства за их пределы. Ценность сильного AI в этой работе, по версии NVIDIA, следует оценивать по воспроизводимым находкам, проверяемым исправлениям и ускорению реакции, а не по заявлениям поставщика. Capital One VulnHunter и ReversingLabs Spectra Assure приведены как примеры AI-анализа безопасности кода и программных пакетов на предмет вредоносного кода и подмены.
Для покупателей остаётся открытым ряд вопросов. В источнике не указано, какие контроли обязательны, как подтверждается соответствие требованиям и что должен содержать аудиторский след для регулятора, — это нужно уточнять у поставщика. Из анонса также не следует, что какая-либо конкретная среда исполнения сама по себе делает агента безопасным: сама NVIDIA формулирует так, что инструкции и защитные механизмы направляют поведение, тогда как безопасность требует исполнимых границ независимо от рассуждений агента. Поэтому командам, оценивающим платформы для агентов, стоит спросить, где применяются политики, кто владеет учётными данными, что и как долго логируется, как отзывается доступ и воспроизводимы ли результаты тестов на их собственной инфраструктуре.
Следить стоит за распространением OpenShell и Open Secure AI Alliance: если уровень управления Cisco DefenseClaw и проверка навыков от JFrog перейдут от анонсов об интеграции к промышленным внедрениям с опубликованными доказательствами тестов, многоуровневая защита агентов станет стандартным пунктом закупки. Если же альянс останется обменом исследованиями без назначенных ответственных и повторяемых тестов, большинство компаний продолжит считать безопасность агентов настройкой уровня модели — и понесёт связанный с этим операционный риск.
