Google начала внедрение флагманской модели Gemini 4 Argon среди проверенных специалистов по кибербезопасности, отложив доступ для широкого круга разработчиков. За пределами Google модель доступна только участникам программы Fairwind, в которую уже входят более 650 организаций. По данным Google, Argon опережает конкурирующие модели в 12 из 18 внутренних тестов. Это важно, поскольку самая сильная модель для кода и автоматизации сначала приходит в бизнес через команды безопасности.
Поэтапный запуск и результаты тестов
Программа Fairwind открылась 3 сентября с компактной модели Gemini 3.8 Flash Cyber, позже к ней присоединились CrowdStrike Holdings и Palo Alto Networks. Главный архитектор ИИ Google Koray Kavukcuoglu заявил, что возможности такого уровня требуют поэтапного подхода. Компания участвует в добровольной процедуре правительства США по доступу к моделям до выпуска. По ее словам, защита от использования модели для кибератак и разработки вооружений еще усиливается.
Google называет Argon моделью для длительной работы и подняла лимит вывода до 1 млн токенов против 64 000 у прежних моделей Gemini. В тесте DeepSWE v1.1 для длительного программирования Argon набрала 77,9%, опередив Anthropic Claude Opus 5.5 с 74,2% и OpenAI GPT-6 Astra с близким результатом. В тесте AutomationBench для сквозной бизнес-работы Argon показала 51,3% против 42,5% у Opus 5.5. Тест Terminal-Bench 4.0 остался за Opus 5.5, а FrontierSWE v2 входит в число немногих тестов, удержанных Astra.
По оценке Google, Argon лучше всех ее выпущенных моделей противостоит косвенному внедрению инструкций. Отдельные мониторы следят за цепочкой рассуждений и действиями и могут остановить модель при выходе за намерения пользователя. Участники Fairwind и внутренние команды Google получают версию со снятыми киберограничениями, которая самостоятельно находит и исправляет уязвимости. В тесте исправлений CWE-bench v1 эта версия разделила с GPT-6 Astra результат 68%. Платные разработчики и подписчики Google AI Ultra следующие в очереди, дата не названа.
Что это значит для бизнеса
Внутреннее внедрение показывает, где крупные инженерные организации могут применить такие модели в первую очередь: перенос и оптимизация существующего кода. Команды Google используют агентов Argon для перевода кода с C и C++ на Rust — от базовых библиотек на десятки тысяч строк до ядра Zircon в Fuchsia объемом более 800 000 строк. В видеодекодере libgav1 агенты переписали 32 000 строк критичного к скорости кода в безопасный Rust, после чего он стал работать в 2,7 раза быстрее прежнего порта без изменения результата. Проверка памяти по всему парку освободила более 300 тебибайт в центрах обработки данных.
Цены создают временное окно для планирования агентных нагрузок. На старте Argon будет стоить 2 доллара за млн входных токенов и 10 долларов за млн выходных токенов, а кэшированный ввод дешевле на 95%. Anthropic просит за Opus 5.5 4 и 20 долларов, и Google заявляет, что после стартового периода Argon перейдет на эти тарифы. Небольшие компании могут проверить длинные выводы и кэшированный контекст по низким ставкам, а крупные — сравнить стоимость поставщиков для постоянной автоматизации. Разница заметнее всего в проектах с повторными запусками на большой кодовой базе.
Приоритет защитникам также указывает на ограничения, которые стоит проверить до внедрения модели. Программа Wiz Scan for Good нашла критическую уязвимость с раскрытием персональных данных в больничном ПО, которую прежние флагманские модели пропустили, но этот случай не доказывает такую же выявляемость в других местах. Стоит спросить, какие киберограничения сняты для защитников, какой контроль сохраняется и чем будет отличаться общая версия. Также важно проверить, как лидерство в DeepSWE и AutomationBench переносится на конкретные процессы, а не считать его общим превосходством.
