Google DeepMind представила Gemini 4 Argon для программирования, корпоративной работы со знаниями и киберзащиты, противопоставив модель классу GPT-6 Astra и Claude Opus 5.5. Компания заявляет о первом месте в 13 из 19 опубликованных бенчмарков и о лимите вывода в 1 млн токенов против прежних 64K, что названо рекордом отрасли. Доступ на старте открыт только для государственных пользователей и проверенных специалистов по киберзащите в программе Fairwind, а более широкий доступ для разработчиков и бизнеса обещан в кратчайшие сроки. Для бизнеса это важно, поскольку Google возвращается в высшую лигу после месяцев без моделей крупнее Flash.

Gemini 4 Argon: вывод до 1 млн токенов пока только для киберзащиты

Что Argon предлагает на старте

Базовые тарифы установлены на уровне $4 за 1 млн входных токенов и $20 за 1 млн выходных токенов, а вводная скидка 50% снижает их до $2 и $10 без объявленной даты окончания. Кэшированный ввод получает скидку 95%. Вывод в 1 млн токенов реализован через Long Decode Continuation, новую функцию API, которая приостанавливает длинные ответы и продолжает их в следующих вызовах. Оценки расходятся: Vals указывает максимум 262K на выходе, а Artificial Analysis получила 1 млн токенов именно через механизм продолжения. Google сообщает, что доработает защитные ограничения перед открытием доступа разработчикам, предприятиям и потребителям.

По заявленным результатам Argon набирает 77,9% в DeepSWE против 74,2% у Opus 5.5 и 74,1% у Astra. Artificial Analysis присваивает модели 53 балла в Intelligence Index, столько же у GPT-6 Astra и 52 у GPT-6.1 Sol. Модель занимает первое место в AutomationBench-AA с 77,5% и получает 57% в Terminal Bench 4, уступая Sonnet 5.5, Opus 5.5 и Astra. Vals ставит ее на первое место в Vals Index с 68,9%, фиксирует рост Terminal-Bench 4.0 с 19,0% до 57,6%, а также 70% в задачах CyberBench proof-of-concept и 100% в IOI 2024–2026. В аренах это первое место в Text Arena с 1525 баллами и восьмое место в Code Arena WebDev с 1679 баллами.

Модель вышла после того, как Google DeepMind в феврале выпустила 3.1 Pro, более крупную, чем Flash, затем последовали промежуточные версии 3.x Flash и кадровые перестановки в руководстве в прошлом месяце. Конкуренты за это время выпустили модели класса Fable и Astra, поэтому главным вопросом оставались сроки ответа Google. В качестве подтверждения масштаба компания ссылается на внутренние внедрения: агенты на Argon освободили более 300 TiB памяти дата-центров и переносят более 800 тыс. строк кода ядра на C и C++ в Rust. Также агенты заменили 32 тыс. строк SIMD-кода на безопасный Rust, ускорив существующий Rust-порт в 2,7 раза при идентичном результате. Команда утверждает, что внутренние агентные циклы на Argon помогли завершить доказательство CK-гипотезы.

Что это меняет для корпоративного применения ИИ

Для компаний, использующих агентов в программировании и работе со знаниями, ближайший эффект связан со стоимостью выполненной задачи при сохранении скидок. Artificial Analysis оценивает стоимость в $1,99 за задачу по льготному тарифу против $3,26 у Astra, а по стандартному тарифу Argon обойдется уже в $3,98. Экономия связана с ценой, а не с бережливостью: в среднем Argon тратит 62 тыс. выходных токенов на задачу против 27 тыс. у Astra. В Vals Index средняя стоимость составляет $15,68 за задачу. Небольшие команды получают более дешевый доступ к длинному выводу для миграции и рефакторинга, а крупные организации могут тестировать массовую конвертацию кода, где объем вывода определяет бюджет.

Ограничения влияют на выбор решения. Доступ пока имеют только участники Fairwind, поэтому большинство предприятий не может проверить ограничения, задержки и условия поддержки в production. Уровень галлюцинаций в AA-Omniscience составляет 15% против 51% у Astra, но точность ниже: 50% против 63% у Astra, и этот компромисс нужно проверять на собственных данных. Широта в программировании выглядит сильной: 30 безупречных приложений в Vibe Code Bench против 25 у Opus 5 и 24 у Astra, однако часть наблюдателей поставила опубликованные цифры под сомнение, включая DeepSWE и возможное влияние preference-данных. В юридическом бенчмарке Harvey заявленные 19,6% уступают 25,42% у Muse Spark 1.2, поэтому регулируемое применение требует отдельной проверки.

Показателем подтверждения тренда станет переход от Fairwind к общему доступу для разработчиков и бизнеса, а также появление даты окончания вводных тарифов $2 и $10. Если оценки Artificial Analysis и Vals подтвердятся вне тестового набора Google, а работа кэша окажется стабильной, длинные рабочие процессы для миграции кода и аналитического синтеза можно будет уверенно закладывать в бюджет. Если доступ останется узким или вернутся стандартные цены, преимущество в стоимости быстро сократится.