
Grok 4.7 против Grok 4.6: та же цена $2/$6, но под капотом — другая модель
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 1009 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 195 tok/s
- OrcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- xAISpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
SpaceXAI выпустила Grok 4.7 21 сентября 2026 года, и первое, на что стоит обратить внимание, — это то, что не изменилось: цена. Grok 4.7 стоит $2 за миллион входных токенов и $6 за миллион выходных токенов — ровно столько же, сколько Grok 4.6 стоит с момента запуска 12 августа 2026 года. Та же тарифная сетка, то же контекстное окно на 500 000 токенов, тот же ввод текста и изображений — и всё же эти две модели далеко не равны в оценках, которые важны для агентной работы. По собственным опубликованным данным SpaceXAI, Grok 4.7 почти вдвое превосходит Grok 4.6 в Terminal-Bench 4.0: 38,0% против 20,3%. В этом и заключается вся суть этого сравнения: смена поколения по той же цене, где почти весь прирост сосредоточен в одном месте, а те аспекты Grok 4.6, которые раздражали продакшн-команды, всё ещё остались.
Что на самом деле изменилось между двумя моделями?
Собственное описание релиза от SpaceXAI узкое, и стоит процитировать его форму, а не эпитеты. Grok 4.7 построен на более крупной базовой модели, чем Grok 4.6, и для него был проведён более длительный прогон обучения с подкреплением, нацеленный на задачи, выполнение которых «может занимать часы». Компания утверждает, что этот прогон отточил три вещи: самопроверку, обработку длинного контекста и поведение внутри среды Grok Bot. Здесь нет заявлений о новой архитектуре, новой модальности или другом стеке обслуживания.
Такая формулировка важна, потому что она предсказывает, где проявятся улучшения по бенчмаркам, — и они проявляются именно там. Более длительный RL-проход по сложным многочасовым задачам продвигает работу в терминале и с репозиториями гораздо сильнее, чем улучшает тест на знание. Если вы надеялись, что Grok 4.7 будет более универсальной моделью, чем Grok 4.6, заметки к релизу говорят об обратном — это та же форма модели, дообученная дальше в сторону сложного края агентной работы.
История с параметрами — единственная часть всего этого, которая не является раскрытием со стороны вендора. В начале сентября Маск заявил, что Grok 4.7 содержит примерно 2,1 трлн параметров против 1,5 трлн у Grok 4.6, то есть на 40% больше, и с тех пор эта цифра повторяется повсюду. Она никогда не появлялась в спецификационном листе SpaceXAI. Относитесь к ней как к широко растиражированному утверждению о базовой модели, а не как к подтверждённой спецификации — и учтите, что количество параметров мало что говорит о стоимости обслуживания или возможностях, когда архитектура разреженная, а у линейки Grok она именно такая.
Разрыв в бенчмарках с прикреплённой меткой источника
Каждая цифра в этом разделе взята из материалов SpaceXAI о запуске. Ни одна из них не была независимо воспроизведена на момент написания, и честный способ читать это — как набор утверждений, который, как оказалось, необычно конкретен, — что делает его проверяемым позже, но не делает проверенным сейчас.
• Terminal-Bench 4.0 — Grok 4.7 38.0% (по данным вендора) против Grok 4.6 20.3%. Самая крупная дельта в релизе, и именно она соответствует заявлению о «более длительном RL на более сложных задачах».
• CursorBench 4.0 — Grok 4.7 46.3% (по данным производителя) против Grok 4.6 40.4%. Реальный прирост, но скромный — меньше шести пунктов, на бенчмарке, который ближе к повседневной работе в редакторе, чем к автономным терминальным сессиям.
• DeepSWE v1.1 — Grok 4.7 71,0% при высоком уровне усилий рассуждения (по данным производителя) против Grok 4.6 65,2%. Снова солидное, но невпечатляющее улучшение.
• EEBench — Grok 4.7 64,0% (по данным производителя). Рядом с ним не была опубликована цифра для Grok 4.6, так что этот результат ничего не говорит об обновлении.
• AA-Briefcase v1.1 — Grok 4.7 с 1 657 Elo (по данным вендора) в оценке профессиональной интеллектуальной работы.
Читайте список как единое целое — и закономерность остаётся неизменной: Grok 4.7 заметно лучше там, где задача длительная и агентная, и незначительно лучше там, где задача короткая. Скачок в Terminal-Bench — примерно двукратный; прирост в работе с редактором — однозначные проценты. Если ваша нагрузка имеет форму автодополнения, вы платите те же $2/$6 за небольшое улучшение. Если ваша нагрузка — это «запустить на два часа и вернуться», релиз нацелен прямо на вас.
Что говорят независимые измерения на данный момент
Существует одна независимая цифра, и её стоит привести аккуратно, потому что её легко понять неправильно. Artificial Analysis присуждает Grok 4.7 46 баллов по своему Intelligence Index, версия v4.3.2, ставя его на 16-е место из 655 моделей в рейтинге. Grok 4.6 находится на 44 по той же шкале. Разрыв в два пункта по составному индексу — это не удвоение, которое демонстрирует Terminal-Bench, и это расхождение показательно, а не противоречиво: индекс объединяет рассуждения, знания, математику и программирование, поэтому большой прирост в одном агентном срезе размывается всем тем, что модель не изменила.
Две дополнительные детали с той же страницы полезнее, чем итоговая оценка. Во-первых, Grok 4.7 сгенерировала 240 миллионов выходных токенов при прогоне индекса против медианы в 92 миллиона — это многословная модель рассуждений, и при ставке $6 за миллион выходных токенов такая многословность становится отдельной статьёй расходов. Во-вторых, сводный показатель индекса ставит её в число сильнейших моделей в её ценовом сегменте, а это именно то сравнение, которое действительно важно для покупателя. Artificial Analysis не опубликовала заполненное значение цены для Grok 4.7 на странице модели, поэтому не берите оттуда её показатель стоимости за задачу; используйте указанные вендором $2/$6.

Ценовой обрыв не устранила ни одна из моделей.
Вот та часть тарифной сетки Grok 4.6, которую продакшен-команды успели возненавидеть, и Grok 4.7 её не изменил. До 200 000 входных токенов тариф составляет $2 на входе и $6 на выходе. Выше этого порога весь запрос пересчитывается по тарифу $4 на входе и $12 на выходе. Не токены сверх лимита — весь запрос. Запрос на 210 000 токенов стоит вдвое дороже, чем запрос на 199 000 токенов, из-за 11 000 лишних токенов.
С контекстным окном в 500 000 токенов у обеих моделей с этого обрыва легко сорваться. Длительные агентные запуски с большим контекстом и промпты на весь репозиторий — именно те рабочие нагрузки, для которых настраивалась Grok 4.7, а значит, лучший сценарий использования модели также с наибольшей вероятностью может вызвать удвоение. Если вы переносите работу на Grok 4.7, потому что она лучше справляется с длительными агентными сессиями, закладывайте в бюджет повышение цены до переноса, а не после.
Есть также скоростной тариф, который нужно учитывать. SpaceXAI выпускает быстрый вариант Grok 4.7, который вдвое увеличивает скорость вывода и вдвое повышает указанную цену. Это оправданный компромисс для интерактивного программирования и плохой — для пакетной работы: одна и та же задача при том же качестве стоит вдвое дороже ради экономии реального времени, за которой никто не следит.
Миграция с Grok 4.6 без переписывания
Практическая хорошая новость заключается в том, что это замена модели, а не миграция платформы. Обе модели принимают текст и изображения и возвращают текст, обе используют одни и те же уровни усилий рассуждения от low до xhigh, и форма запроса — та же, которую SpaceXAI обслуживает с Grok 4.5. Код, который вызывает Grok 4.6 с параметром усилия, не нуждается в перестройке для вызова Grok 4.7.
Замена не бесплатна прежде всего в оценке. Улучшения Grok 4.7 сосредоточены в длительных агентных прогонах, поэтому набор тестов, построенный на коротких промптах в один ход, почти ничего вам не покажет — вы увидите улучшение масштаба CursorBench и решите, что обновление не стоило затраченных усилий, тогда как его обоснование кроется в задачах, которые ваш набор тестов никогда не проверяет. Измерение, которое действительно позволило бы закрыть вопрос, — это завершение задач в многошаговой работе: принятые патчи, внесённые регрессии, вызовы инструментов на завершённую задачу и то, как часто прогону требуется вмешательство человека. Именно на эти оси указывают собственные цифры вендора, и именно их не покрывает ни один опубликованный бенчмарк для вашей кодовой базы.
Многословность — это второй показатель, который стоит измерять. Модель, которая выдаёт 240 миллионов токенов на стандартном индексе, будет выдавать больше токенов на вашей рабочей нагрузке, чем её предшественница, и при $6 за миллион выходных токенов это может незаметно свести на нет ценность обновления за ту же цену. Отслеживайте выходные токены на завершённую задачу в течение недели, прежде чем принять решение.

Кому позвонить?
Решение действительно простое, что необычно для сравнения моделей. Grok 4.6 остаётся правильным выбором для коротких взаимодействий и трафика, чувствительного к стоимости: чаты, классификация, суммирование и помощь с кодом в масштабе редактора, где преимущества Grok 4.7 невелики, а его многословность — это налог. Grok 4.7 — правильный выбор для рабочей нагрузки, под которую он создавался, — долгосрочного агентного программирования и работы в терминале, где задача выполняется часами, а самопроверка определяет разницу между завершённой работой и застрявшей.
Запускать обе модели — это не компромисс, а верное решение, и это недорого. Grok 4.6 есть в каталоге OrcaRouter по каталожной цене SpaceXAI с наценкой 0%, передаваемой напрямую, поэтому приведённый выше тариф $2/$6 — это то, что вы платите; и поскольку мы передаём каталожную цену провайдера напрямую, а не добавляем наценку, любое изменение цены поставщиком становится актуальным на нашей стороне в тот же день, когда оно вступает в силу. Один API-ключ охватывает Grok 4.6 и более 200 других моделей, поэтому переключение трафика между ними в зависимости от задачи — это изменение конфигурации, а не второй договор. Если вы хотите протестировать Grok 4.7 на продакшен-пути, прежде чем доверять ему, более безопасный подход — оставить резерв на Grok 4.6, модели, которую можно маршрутизировать уже сегодня, и позволить автоматическому переключению между провайдерами возвращать запрос обратно, когда новая модель даёт сбой.

Что посмотреть дальше
Два момента определят исход этого сравнения, и ни один из них пока не наступил. Первый — независимое воспроизведение результата Terminal-Bench 4.0: 38% — это достаточно большой скачок, чтобы кто-нибудь его перепроверил, и если он подтвердится, аргументы в пользу Grok 4.7 в агентных пайплайнах будут сильны по существу, а не благодаря маркетингу. Второй — остальная часть дорожной карты Grok: SpaceXAI публично выстроила Grok 4.8, Grok 4.9 и Grok 5 после этого релиза, а срок жизни самого Grok 4.6 составил около пяти недель. Опираться на Grok 4.7 как на долгосрочное платформенное допущение означало бы повторить ошибку, которую команды совершили с Grok 4.5.
Пока что апгрейд по той же цене — это реальность, и направление движения ясно. Цифра, которую стоит запомнить: за $2/$6 вы получили модель, которая примерно вдвое улучшает результаты на длительных задачах в терминале и почти не меняется во всём остальном — и это конкретное, полезное, проверяемое утверждение, а не поколенческий скачок.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
