SpaceX Corp. представила Grok 4.7 — свою самую мощную большую языковую модель на сегодняшний день — и назначила цену от $2 за миллион входных токенов и $6 за миллион выходных. В бенчмарке CursorBench 4.0, созданном компанией Cursor, ещё одним недавним приобретением SpaceX, модель выполняла задачи в среднем за $4,69 за задачу, опередив GPT-5.6 Sol и Fable 5.1. Выпуск важен потому, что именно стоимость выполненной задачи, а не место в рейтинге, определяет, можно ли запускать агента в промышленном масштабе.
Что показывают бенчмарки
Компания проверила Grok 4.7 и на более распространённых бенчмарках. Модель уверенно обошла Fable 5.1 в Harvey Legal Agent Benchmark и EEBench, где собраны задачи по юриспруденции и проектированию чипов соответственно. Однако в EEBench её результат оказался ниже, чем у GPT-6 Astra — последней LLM от OpenAI Group PBC. SpaceX сравнивала свою модель с аппаратно-интенсивными версиями конкурентов, то есть конфигурациями, где приоритет отдан качеству вывода, а не экономии. Для задач, чувствительных к задержке, компания предлагает вариант, который обрабатывает запросы вдвое быстрее и стоит вдвое дороже, — так покупатель может выбирать между ценой и скоростью ответа внутри одного семейства моделей.
SpaceX объясняет результат новой базовой моделью. Обучение LLM состоит из нескольких этапов, каждый из которых улучшает свою сторону алгоритма, а базовая модель — это исходная версия, появляющаяся после первого этапа. Поставщики часто переиспользуют базовые модели между релизами, поэтому новая база — это содержательное изменение, а не плановое обновление. Инженеры также переработали процесс обучения с подкреплением — метод, которым усиливают способности базовой модели к рассуждению. По сравнению с предшественником Grok 4.7 получала более сложные учебные задачи и работала над ними дольше; такой подход компания называет длительной обработкой задач.
Модель рассчитана на работу с обвязкой Grok Bot — набором технических ресурсов, который позволяет Grok 4.7 распределять сложную работу между несколькими ИИ-агентами. Эти агенты могут параллельно выполнять разные задачи, что ускоряет обработку, и проверять точность результатов друг друга. SpaceX также оснастила Grok 4.7 новыми защитами: по словам компании, модель поставила рекорды в LatchBio и HackerBench — бенчмарках, проверяющих способность LLM блокировать вредоносные запросы в биологических исследованиях и кибербезопасности. Сочетание параллельных агентов и тестов на отказ указывает на корпоративное применение, где непроверенный запрос — это риск, а не возможность.
Выпуск состоялся менее чем через неделю после предыдущего релиза SpaceX. В пятницу компания представила модель преобразования текста в речь, которая вдвое точнее предшественницы и стоит вдвое дешевле, и заявила, что Grok Voice Transcribe 2.0 превосходит несколько конкурентов в этой категории. Такой темп отражает то, как консолидировалась линейка Grok: серия алгоритмов началась в xAI Corp., стартапе, основанном Илоном Маском, который в прошлом году объединился с xAI Inc., а затем объединённая организация вошла в состав SpaceX. Эта структура дала SpaceX не только линейку моделей, но и несколько центров обработки данных для ИИ.
Что это значит для бизнеса
Для компаний, внедряющих ИИ, практический сдвиг в том, что у сильной модели теперь есть опубликованная стоимость задачи. При $4,69 за выполненную задачу CursorBench команды могут оценить расходы на агентский процесс до того, как на него согласятся, а ставки $2 и $6 за миллион токенов делают обработку больших объёмов входных данных более дешёвой частью счёта. Небольшая компания может начать со стандартной версии и платить только за фактически выполненные запуски, тогда как крупная организация с чувствительными к задержке задачами может принять двойную цену за удвоенную скорость. Обвязка с параллельными агентами важнее всего там, где несколько проверок должны идти одновременно, например при разборе документов или анализе кода.
Часть данных пока не подтверждена. Результаты бенчмарков приводит сама SpaceX, независимых воспроизведений ещё нет. Сравнение с аппаратно-интенсивными версиями моделей конкурентов означает, что преимущество по цене может не сохраниться против их стандартных конфигураций, поэтому покупателю стоит уточнить, какая конфигурация измерялась. Рекорды в LatchBio и HackerBench описывают поведение модели на конкретных наборах тестов, а не гарантию для любого внедрения. Перед выбором стоит запросить у поставщика стоимость задачи на своей нагрузке, задержку быстрого тарифа и то, как обвязка агентов разрешает противоречия между их выводами. Сам выпуск не доказывает, что Grok 4.7 — лучшая модель для конкретной задачи.
Следить стоит за тем, воспроизведут ли независимые оценки стоимость в CursorBench 4.0 и разрыв с GPT-6 Astra в EEBench в ближайшие недели. Если сторонние проверки подтвердят экономику одной задачи, цена за задачу станет стандартным способом сравнения моделей, и у закупочных команд появится цифра, которую можно заложить в бюджет. Если результаты не воспроизведутся, преимущество останется заявлением поставщика, и покупателям следует и дальше тестировать кандидатов параллельно.
