xAI, компания, основанная Илоном Маском, выпустила Grok 4.7 — свою самую способную модель на сегодня для кодинга и работы со знаниями — по цене $2 за миллион входных токенов и $6 за миллион выходных. Цена и есть главный факт запуска: она ставит модель ближе к китайским предложениям, чем к западным фронтирным системам. Для компаний, которые платят за инференс в больших объёмах, эта разница значит больше, чем заголовочный результат бенчмарка.
Что внутри Grok 4.7
По данным компании, модель построена на более крупной базовой модели, чем предшественница, и обучалась с более длинным reinforcement learning. Отдельной целью было лучше проверять собственный вывод, что xAI подаёт как способ снизить число ошибок в многошаговых задачах. Модель доступна через Grok API, Cursor и Grok Build, то есть покупатель может обратиться к ней и напрямую, и внутри уже используемых инструментов для кодинга. Число параметров, объём вычислительных ресурсов на обучение и дата выпуска помимо самого запуска в источнике не раскрываются.
Именно цена $2 за миллион входных токенов и $6 за миллион выходных отделяет Grok 4.7 от западного фронтира. Claude Fable 5.1 и GPT-6, с которыми её сравнивают, позиционируются как премиальные системы, и источник отмечает, что низкий тариф, вероятно, установлен не случайно. На практике команда, прогоняющая большие объёмы проверки кода, обработки документов или агентных циклов, платит за токены при каждом вызове, поэтому именно цена входа определяет месячный счёт сильнее, чем любой отдельный тест способностей. Компромисс здесь явный: меньше стоимость вызова против более слабых результатов на задачах, которые труднее всего автоматизировать.
Что это значит для бизнеса
В независимом Artificial Analysis Intelligence Index (v4.3.2), объединяющем десять бенчмарков, Grok 4.7 набирает 46 баллов и занимает середину списка. Claude Fable 5.1 и GPT-6 лидируют с 53 баллами каждая. Разрыв в семь баллов — первый сигнал для того, кто выбирает модель по умолчанию: на суммаризации, черновиках и рутинной работе со знаниями разница может быть не видна в ежедневном результате, тогда как разница в цене видна в каждом счёте. Небольшая компания с ограниченным бюджетом на инференс может поставить Grok 4.7 в продакшен и держать премиальные модели для узкого набора задач, где качество измеримо.
Картина меняется в агентном кодинге, где модель должна действовать внутри терминала, а не отвечать на вопрос. На Terminal-Bench 4.0 Grok 4.7 достигает лишь 26 процентов против 60 процентов у GPT-6 Astra и 55 процентов у Claude Fable 5.1. Даже более дешёвая DeepSeek V4.1 Flash обходит её с 27 процентами. Этот результат и есть практический предел запуска: для команд, строящих автономных кодинг-агентов, низкая цена токена не компенсирует долю успешных проходов менее половины от лидерской, потому что неудачный прогон стоит инженерного времени, а повторная попытка снова стоит токенов.
Перед внедрением модели покупателю стоит разделить два утверждения. Цена и доступность через Grok API, Cursor и Grok Build — подтверждённые факты запуска. Заявление о лучшей самопроверке исходит от самой xAI и не подкреплено независимым измерением в источнике, поэтому его нужно проверять на собственных задачах. То же касается среднего места в индексе: десять бенчмарков, усреднённых в одно число, ничего не говорят о работе в конкретной предметной области, а результат в агентном кодинге подсказывает, где находится слабое место. Вопросы, которые стоит задать поставщику: какая версия бенчмарка использовалась, проводилась ли оценка на той же обвязке, что и у конкурирующих моделей, и как выглядит доля успешных проходов на собственном репозитории покупателя.
Тренд подтвердится или опровергнется тем, как поведёт себя ценовой разрыв. Если Claude и GPT-6 удержат свои тарифы, а xAI сохранит для Grok 4.7 цену $2 и $6 за миллион токенов, дешёвый инференс станет постоянным вторым уровнем для рутинной работы, а премиальный уровень останется за агентным кодингом и другими задачами, где исход решает доля успешных проходов. Если лидеры снизят цены в ответ, разрыв, значимый для бизнеса, закроется, и единственным оставшимся аргументом станет разброс в бенчмарках.
