Archestra выпустила OpenAPPA, открытый движок безопасности, который блокирует утечки данных из-за prompt injection или галлюцинаций модели. Движок работает вне промпта агента и контура исполнения, а настраивается через политики для источников данных, аудиторий, уровней доверия и органов согласования. В тестах Bench-Corp с 20 многошаговыми корпоративными сценариями и в AgentThreatBench команда заявляет о 0% успешных атак. Для бизнеса это важно, поскольку агенты сохраняют высокую долю выполненных задач при детерминированной блокировке утечек.

Archestra выпустила OpenAPPA с нулевым числом успешных атак на агентов

Как OpenAPPA контролирует политики вне контура агента

OpenAPPA реализует подход под названием Agentic Permissions Policy Algebra, описанный в работе Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov и Matvey Kukuy. Формальная алгебра и гарантии восстановления опубликованы на arXiv под заголовком APPA: Recoverable Information-Flow Control for Real-World LLM Agents. Сам продукт пока имеет статус preview, а документация и репозиторий GitHub содержат технические детали и иллюстрации. Политики задаются одним файлом appa. toml, где фиксируются источники, аудитории, уровни доверия и authorities с детерминированными правилами.

Каждый контракт инструмента включает три рабочих атрибута: requires, delta и effects. Requires задает нужное членство в аудитории и уровень доверия для запуска, delta определяет ограничения при возврате данных, а effects формирует журнал успешных действий. Метки аудитории и доверия комбинируются монотонно через lattice algebra и могут только ужесточаться. Чтение ограниченных записей сужает аудиторию, а чтение непроверенных внешних страниц снижает доверие. В одном примере чтение тикета через get_ticket_from_crm ограничивает траекторию значением internal, после чего разрешается вызов process_internal_data.

Archestra противопоставляет эту схему подходам с моделью-судьей, таким как Claude Code auto mode и Codex auto-review. В документации говорится, что вторая модель для проверки каждого вызова не отслеживает поток данных между вызовами и сама уязвима к инъекциям, поэтому harness скрывает от нее выводы инструментов. Даже сильные классификаторы достигают потолка 99.3%, что при миллионах вызовов дает много нарушений. Простые allowlists и denylists тоже не работают: агент заменяет запрещенный rm -rf эквивалентным скриптом Python, а слишком жесткие правила снижают полезность. Репозиторий описывает цель как баланс двух осей: небезопасные потоки и бесполезный отказ от законной работы.

Что нулевой уровень взлома означает для бизнеса

Для компаний, запускающих агентов на корпоративных данных, заявленное сочетание — это 0% успешных атак при 89% выполненных задач в строгих ограничениях. Штатный Claude Code auto mode показал 10% успешных атак при 90% выполнения, а Microsoft FIDES пропустил 31% атак и выполнил лишь 41% задач. Bench-Corp проверяет политики в сложных многошаговых сценариях ассистента, а AgentThreatBench превращает OWASP Top 10 for Agentic Applications (2026) в исполняемые задачи с двойной оценкой полезности и безопасности. AgentThreatBench включен в репозиторий UK AI Safety Institute inspect_evals, что важно для регулируемых заказчиков.

Механика восстановления объясняет большую часть разрыва в полезности, и ее стоит проверять при выборе. При попытке незаконного действия движок останавливает отправку и предлагает структурированные пути продолжения вместо плоского отказа. Sanitizers могут редактировать нагрузку, например удалять персональные данные для расширения допустимой аудитории, а authorities направляют запросы операторам или API проверки для разового согласования. Disposable Child Branches изолируют чтение недоверенных данных во временном суб-агенте и возвращают родителю только очищенные выводы по схеме. В абляционных тестах без remedy plans выполнение падало до 35.0%, поэтому покупателям стоит уточнять, какие опции восстановления включены.

Маркером подтверждения станет повторение нулевого результата вне авторских тестов на Bench-Corp и AgentThreatBench по утечкам данных, инъекциям, согласованиям и изоляции арендаторов. Если независимые внедрения подтвердят почти нулевой успех атак при выполнении около 89%, детерминированный контроль потоков станет требованием закупок для клиентских и мультиарендных агентов. Снижение любой из метрик в производственных пилотах покажет, что настройка политик или интеграция восстановления требуют доработки перед широким запуском.