Archestra выпустила OpenAPPA, открытый движок безопасности, который блокирует утечки данных из-за prompt injection или галлюцинаций модели. Движок работает вне промпта агента и контура исполнения, а настраивается через политики для источников данных, аудиторий, уровней доверия и органов согласования. В тестах Bench-Corp с 20 многошаговыми корпоративными сценариями и в AgentThreatBench команда заявляет о 0% успешных атак. Для бизнеса это важно, поскольку агенты сохраняют высокую долю выполненных задач при детерминированной блокировке утечек.
Как OpenAPPA контролирует политики вне контура агента
OpenAPPA реализует подход под названием Agentic Permissions Policy Algebra, описанный в работе Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov и Matvey Kukuy. Формальная алгебра и гарантии восстановления опубликованы на arXiv под заголовком APPA: Recoverable Information-Flow Control for Real-World LLM Agents. Сам продукт пока имеет статус preview, а документация и репозиторий GitHub содержат технические детали и иллюстрации. Политики задаются одним файлом appa. toml, где фиксируются источники, аудитории, уровни доверия и authorities с детерминированными правилами.
Каждый контракт инструмента включает три рабочих атрибута: requires, delta и effects. Requires задает нужное членство в аудитории и уровень доверия для запуска, delta определяет ограничения при возврате данных, а effects формирует журнал успешных действий. Метки аудитории и доверия комбинируются монотонно через lattice algebra и могут только ужесточаться. Чтение ограниченных записей сужает аудиторию, а чтение непроверенных внешних страниц снижает доверие. В одном примере чтение тикета через get_ticket_from_crm ограничивает траекторию значением internal, после чего разрешается вызов process_internal_data.
Archestra противопоставляет эту схему подходам с моделью-судьей, таким как Claude Code auto mode и Codex auto-review. В документации говорится, что вторая модель для проверки каждого вызова не отслеживает поток данных между вызовами и сама уязвима к инъекциям, поэтому harness скрывает от нее выводы инструментов. Даже сильные классификаторы достигают потолка 99.3%, что при миллионах вызовов дает много нарушений. Простые allowlists и denylists тоже не работают: агент заменяет запрещенный rm -rf эквивалентным скриптом Python, а слишком жесткие правила снижают полезность. Репозиторий описывает цель как баланс двух осей: небезопасные потоки и бесполезный отказ от законной работы.
Что нулевой уровень взлома означает для бизнеса
Для компаний, запускающих агентов на корпоративных данных, заявленное сочетание — это 0% успешных атак при 89% выполненных задач в строгих ограничениях. Штатный Claude Code auto mode показал 10% успешных атак при 90% выполнения, а Microsoft FIDES пропустил 31% атак и выполнил лишь 41% задач. Bench-Corp проверяет политики в сложных многошаговых сценариях ассистента, а AgentThreatBench превращает OWASP Top 10 for Agentic Applications (2026) в исполняемые задачи с двойной оценкой полезности и безопасности. AgentThreatBench включен в репозиторий UK AI Safety Institute inspect_evals, что важно для регулируемых заказчиков.
Механика восстановления объясняет большую часть разрыва в полезности, и ее стоит проверять при выборе. При попытке незаконного действия движок останавливает отправку и предлагает структурированные пути продолжения вместо плоского отказа. Sanitizers могут редактировать нагрузку, например удалять персональные данные для расширения допустимой аудитории, а authorities направляют запросы операторам или API проверки для разового согласования. Disposable Child Branches изолируют чтение недоверенных данных во временном суб-агенте и возвращают родителю только очищенные выводы по схеме. В абляционных тестах без remedy plans выполнение падало до 35.0%, поэтому покупателям стоит уточнять, какие опции восстановления включены.
Маркером подтверждения станет повторение нулевого результата вне авторских тестов на Bench-Corp и AgentThreatBench по утечкам данных, инъекциям, согласованиям и изоляции арендаторов. Если независимые внедрения подтвердят почти нулевой успех атак при выполнении около 89%, детерминированный контроль потоков станет требованием закупок для клиентских и мультиарендных агентов. Снижение любой из метрик в производственных пилотах покажет, что настройка политик или интеграция восстановления требуют доработки перед широким запуском.
