Сгенерированная титульная карточка для статьи под названием «Grok 4.7 против Grok 4.6 — та же цена, другая модель», с подзаголовком «Что на самом деле изменилось в релизе 21 сентября» и плашками со статистикой: Terminal-Bench 4.0 38,0% против 20,3%, AA Index 46 против 44 и $2/$6 в обоих случаях.
Guides & Insights

Grok 4.7 против Grok 4.6: та же цена $2/$6, но под капотом — другая модель

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

SpaceXAI выпустила Grok 4.7 21 сентября 2026 года, и первое, на что стоит обратить внимание, — это то, что не изменилось: цена. Grok 4.7 стоит $2 за миллион входных токенов и $6 за миллион выходных токенов — ровно столько же, сколько Grok 4.6 стоит с момента запуска 12 августа 2026 года. Та же тарифная сетка, то же контекстное окно на 500 000 токенов, тот же ввод текста и изображений — и всё же эти две модели далеко не равны в оценках, которые важны для агентной работы. По собственным опубликованным данным SpaceXAI, Grok 4.7 почти вдвое превосходит Grok 4.6 в Terminal-Bench 4.0: 38,0% против 20,3%. В этом и заключается вся суть этого сравнения: смена поколения по той же цене, где почти весь прирост сосредоточен в одном месте, а те аспекты Grok 4.6, которые раздражали продакшн-команды, всё ещё остались.

Что на самом деле изменилось между двумя моделями?

Собственное описание релиза от SpaceXAI узкое, и стоит процитировать его форму, а не эпитеты. Grok 4.7 построен на более крупной базовой модели, чем Grok 4.6, и для него был проведён более длительный прогон обучения с подкреплением, нацеленный на задачи, выполнение которых «может занимать часы». Компания утверждает, что этот прогон отточил три вещи: самопроверку, обработку длинного контекста и поведение внутри среды Grok Bot. Здесь нет заявлений о новой архитектуре, новой модальности или другом стеке обслуживания.

Такая формулировка важна, потому что она предсказывает, где проявятся улучшения по бенчмаркам, — и они проявляются именно там. Более длительный RL-проход по сложным многочасовым задачам продвигает работу в терминале и с репозиториями гораздо сильнее, чем улучшает тест на знание. Если вы надеялись, что Grok 4.7 будет более универсальной моделью, чем Grok 4.6, заметки к релизу говорят об обратном — это та же форма модели, дообученная дальше в сторону сложного края агентной работы.

История с параметрами — единственная часть всего этого, которая не является раскрытием со стороны вендора. В начале сентября Маск заявил, что Grok 4.7 содержит примерно 2,1 трлн параметров против 1,5 трлн у Grok 4.6, то есть на 40% больше, и с тех пор эта цифра повторяется повсюду. Она никогда не появлялась в спецификационном листе SpaceXAI. Относитесь к ней как к широко растиражированному утверждению о базовой модели, а не как к подтверждённой спецификации — и учтите, что количество параметров мало что говорит о стоимости обслуживания или возможностях, когда архитектура разреженная, а у линейки Grok она именно такая.

Разрыв в бенчмарках с прикреплённой меткой источника

Каждая цифра в этом разделе взята из материалов SpaceXAI о запуске. Ни одна из них не была независимо воспроизведена на момент написания, и честный способ читать это — как набор утверждений, который, как оказалось, необычно конкретен, — что делает его проверяемым позже, но не делает проверенным сейчас.

• Terminal-Bench 4.0 — Grok 4.7 38.0% (по данным вендора) против Grok 4.6 20.3%. Самая крупная дельта в релизе, и именно она соответствует заявлению о «более длительном RL на более сложных задачах».

• CursorBench 4.0 — Grok 4.7 46.3% (по данным производителя) против Grok 4.6 40.4%. Реальный прирост, но скромный — меньше шести пунктов, на бенчмарке, который ближе к повседневной работе в редакторе, чем к автономным терминальным сессиям.

• DeepSWE v1.1 — Grok 4.7 71,0% при высоком уровне усилий рассуждения (по данным производителя) против Grok 4.6 65,2%. Снова солидное, но невпечатляющее улучшение.

• EEBench — Grok 4.7 64,0% (по данным производителя). Рядом с ним не была опубликована цифра для Grok 4.6, так что этот результат ничего не говорит об обновлении.

• AA-Briefcase v1.1 — Grok 4.7 с 1 657 Elo (по данным вендора) в оценке профессиональной интеллектуальной работы.

Читайте список как единое целое — и закономерность остаётся неизменной: Grok 4.7 заметно лучше там, где задача длительная и агентная, и незначительно лучше там, где задача короткая. Скачок в Terminal-Bench — примерно двукратный; прирост в работе с редактором — однозначные проценты. Если ваша нагрузка имеет форму автодополнения, вы платите те же $2/$6 за небольшое улучшение. Если ваша нагрузка — это «запустить на два часа и вернуться», релиз нацелен прямо на вас.

Что говорят независимые измерения на данный момент

Существует одна независимая цифра, и её стоит привести аккуратно, потому что её легко понять неправильно. Artificial Analysis присуждает Grok 4.7 46 баллов по своему Intelligence Index, версия v4.3.2, ставя его на 16-е место из 655 моделей в рейтинге. Grok 4.6 находится на 44 по той же шкале. Разрыв в два пункта по составному индексу — это не удвоение, которое демонстрирует Terminal-Bench, и это расхождение показательно, а не противоречиво: индекс объединяет рассуждения, знания, математику и программирование, поэтому большой прирост в одном агентном срезе размывается всем тем, что модель не изменила.

Две дополнительные детали с той же страницы полезнее, чем итоговая оценка. Во-первых, Grok 4.7 сгенерировала 240 миллионов выходных токенов при прогоне индекса против медианы в 92 миллиона — это многословная модель рассуждений, и при ставке $6 за миллион выходных токенов такая многословность становится отдельной статьёй расходов. Во-вторых, сводный показатель индекса ставит её в число сильнейших моделей в её ценовом сегменте, а это именно то сравнение, которое действительно важно для покупателя. Artificial Analysis не опубликовала заполненное значение цены для Grok 4.7 на странице модели, поэтому не берите оттуда её показатель стоимости за задачу; используйте указанные вендором $2/$6.

A generated two-column comparison scoreboard for Grok 4.7 and Grok 4.6 with six rows: Terminal-Bench 4.0 38.0% vs 20.3%, CursorBench 4.0 46.3% vs 40.4%, DeepSWE v1.1 71.0% vs 65.2%, AA Intelligence Index 46 vs 44, context 500K on both, and price $2/$6 on both, with a footer noting all benchmark figures are vendor-reported and the index scores are per Artificial Analysis v4.3.2.

Ценовой обрыв не устранила ни одна из моделей.

Вот та часть тарифной сетки Grok 4.6, которую продакшен-команды успели возненавидеть, и Grok 4.7 её не изменил. До 200 000 входных токенов тариф составляет $2 на входе и $6 на выходе. Выше этого порога весь запрос пересчитывается по тарифу $4 на входе и $12 на выходе. Не токены сверх лимита — весь запрос. Запрос на 210 000 токенов стоит вдвое дороже, чем запрос на 199 000 токенов, из-за 11 000 лишних токенов.

С контекстным окном в 500 000 токенов у обеих моделей с этого обрыва легко сорваться. Длительные агентные запуски с большим контекстом и промпты на весь репозиторий — именно те рабочие нагрузки, для которых настраивалась Grok 4.7, а значит, лучший сценарий использования модели также с наибольшей вероятностью может вызвать удвоение. Если вы переносите работу на Grok 4.7, потому что она лучше справляется с длительными агентными сессиями, закладывайте в бюджет повышение цены до переноса, а не после.

Есть также скоростной тариф, который нужно учитывать. SpaceXAI выпускает быстрый вариант Grok 4.7, который вдвое увеличивает скорость вывода и вдвое повышает указанную цену. Это оправданный компромисс для интерактивного программирования и плохой — для пакетной работы: одна и та же задача при том же качестве стоит вдвое дороже ради экономии реального времени, за которой никто не следит.

Миграция с Grok 4.6 без переписывания

Практическая хорошая новость заключается в том, что это замена модели, а не миграция платформы. Обе модели принимают текст и изображения и возвращают текст, обе используют одни и те же уровни усилий рассуждения от low до xhigh, и форма запроса — та же, которую SpaceXAI обслуживает с Grok 4.5. Код, который вызывает Grok 4.6 с параметром усилия, не нуждается в перестройке для вызова Grok 4.7.

Замена не бесплатна прежде всего в оценке. Улучшения Grok 4.7 сосредоточены в длительных агентных прогонах, поэтому набор тестов, построенный на коротких промптах в один ход, почти ничего вам не покажет — вы увидите улучшение масштаба CursorBench и решите, что обновление не стоило затраченных усилий, тогда как его обоснование кроется в задачах, которые ваш набор тестов никогда не проверяет. Измерение, которое действительно позволило бы закрыть вопрос, — это завершение задач в многошаговой работе: принятые патчи, внесённые регрессии, вызовы инструментов на завершённую задачу и то, как часто прогону требуется вмешательство человека. Именно на эти оси указывают собственные цифры вендора, и именно их не покрывает ни один опубликованный бенчмарк для вашей кодовой базы.

Многословность — это второй показатель, который стоит измерять. Модель, которая выдаёт 240 миллионов токенов на стандартном индексе, будет выдавать больше токенов на вашей рабочей нагрузке, чем её предшественница, и при $6 за миллион выходных токенов это может незаметно свести на нет ценность обновления за ту же цену. Отслеживайте выходные токены на завершённую задачу в течение недели, прежде чем принять решение.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Кому позвонить?

Решение действительно простое, что необычно для сравнения моделей. Grok 4.6 остаётся правильным выбором для коротких взаимодействий и трафика, чувствительного к стоимости: чаты, классификация, суммирование и помощь с кодом в масштабе редактора, где преимущества Grok 4.7 невелики, а его многословность — это налог. Grok 4.7 — правильный выбор для рабочей нагрузки, под которую он создавался, — долгосрочного агентного программирования и работы в терминале, где задача выполняется часами, а самопроверка определяет разницу между завершённой работой и застрявшей.

Запускать обе модели — это не компромисс, а верное решение, и это недорого. Grok 4.6 есть в каталоге OrcaRouter по каталожной цене SpaceXAI с наценкой 0%, передаваемой напрямую, поэтому приведённый выше тариф $2/$6 — это то, что вы платите; и поскольку мы передаём каталожную цену провайдера напрямую, а не добавляем наценку, любое изменение цены поставщиком становится актуальным на нашей стороне в тот же день, когда оно вступает в силу. Один API-ключ охватывает Grok 4.6 и более 200 других моделей, поэтому переключение трафика между ними в зависимости от задачи — это изменение конфигурации, а не второй договор. Если вы хотите протестировать Grok 4.7 на продакшен-пути, прежде чем доверять ему, более безопасный подход — оставить резерв на Grok 4.6, модели, которую можно маршрутизировать уже сегодня, и позволить автоматическому переключению между провайдерами возвращать запрос обратно, когда новая модель даёт сбой.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing SpaceXAI's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 500K token context window, and the reasoning and vision capability tags.

Что посмотреть дальше

Два момента определят исход этого сравнения, и ни один из них пока не наступил. Первый — независимое воспроизведение результата Terminal-Bench 4.0: 38% — это достаточно большой скачок, чтобы кто-нибудь его перепроверил, и если он подтвердится, аргументы в пользу Grok 4.7 в агентных пайплайнах будут сильны по существу, а не благодаря маркетингу. Второй — остальная часть дорожной карты Grok: SpaceXAI публично выстроила Grok 4.8, Grok 4.9 и Grok 5 после этого релиза, а срок жизни самого Grok 4.6 составил около пяти недель. Опираться на Grok 4.7 как на долгосрочное платформенное допущение означало бы повторить ошибку, которую команды совершили с Grok 4.5.

Пока что апгрейд по той же цене — это реальность, и направление движения ясно. Цифра, которую стоит запомнить: за $2/$6 вы получили модель, которая примерно вдвое улучшает результаты на длительных задачах в терминале и почти не меняется во всём остальном — и это конкретное, полезное, проверяемое утверждение, а не поколенческий скачок.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно