Титульная карточка для статьи о дате выхода Grok 4.7 с текстом «Grok 4.7 — вопрос даты выхода», подзаголовком «Ещё не выпущено. Вот что xAI на самом деле заявила.» и тремя чипами: «Начальное обучение завершено», «Данные SpaceX получены» и «Маск: 3–4 недели», с нижней строкой «~2,1 трлн параметров — утверждение, а не спецификация».
Guides & Insights

Grok 4.7 набирает 46 баллов в индексе интеллекта Artificial Analysis и выводит SpaceXAI в топ-четвёрку

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Grok 4.7 набирает 46 баллов в индексе интеллекта Artificial Analysis и выводит SpaceXAI в топ-четвёрку

Grok 4.7 вышла. SpaceXAI выпустила её в понедельник, 21 сентября 2026 года — по той же цене, что и Grok 4.6: $2 за миллион входных токенов и $6 за миллион выходных токенов, с тем же контекстным окном на 500 000 токенов, более поздней датой отсечки знаний и новым высшим уровнем рассуждений. Она доступна в Cursor и Grok Build, через собственный API поставщика, а также через сторонние среды для программирования, маршрутизаторы моделей и облачные платформы. Grok 4.5 от 8 июля остаётся ниже неё как более дешёвый вариант, а модели, которые ей всё ещё нужно превзойти, не изменились: Claude Fable 5.1, Claude Opus 5 и GPT-5.6 Sol — все находятся выше неё в индексе интеллекта v4.3.2 от Artificial Analysis, где первый независимый балл Grok 4.7 — 46 — оказывается на два балла выше Grok 4.6 и на семь баллов ниже Claude Fable 5.1. В том же рейтинге AA-Briefcase от того же оценщика для долгосрочной работы со знаниями она занимает четвёртое место, уступая трём позициям Claude и опережая Claude Opus 5 при уровне усилий xhigh, примерно за половину стоимости Claude Opus 5 за задачу — первый независимый результат в этом выпуске, который воспринимается как победа по соотношению цена-качество, а не как отставание. Спустя одиннадцать дней картина расширилась по краям, а не в середине: с 1 октября она постепенно появляется в собственных веб- и мобильных приложениях Grok, где переключатель режимов теперь указывает её в двух самых сложных пунктах, и она указана на OrcaRouter по собственным ценам SpaceXAI $2/$6.

Вот и запуск. Более полезные числа появились в тот же день — от единственного оценщика в этой истории, который не является вендором: Artificial Analysis опубликовала свой первый независимый прогон по Grok 4.7, и это результат из трёх частей — 46 в Intelligence Index, что всего на два пункта выше Grok 4.6, 56 в Coding Agent Index, что на девять пунктов выше, и 1 657 Elo в AA-Briefcase, что на 111 пунктов выше. Эти три числа указывают в разные стороны, и разброс между ними — самое интересное в этом релизе. Далее следуют поставленная спецификация, собственная таблица бенчмарков вендора с меткой, необходимой каждой строке, а затем независимые оценки, прочитанные должным образом, — включая то, что они говорят об оговорке о готовности, которую SpaceXAI так и не затронула.

Что SpaceXAI выпустила 21 сентября

Начнём со спецификации, потому что она на удивление близка к спецификации предшественника. Grok 4.7 стоит столько же, сколько Grok 4.6, — $2 за миллион входных токенов и $6 за миллион выходных токенов при объёме менее 200 000 входных токенов, а когда запрос пересекает этот порог, цена возрастает до $4 за входные и $12 за выходные; та же структура, которую ввела Grok 4.6. Контекстное окно — 500 000 токенов. Дата отсечения знаний — май 2026 года, на три месяца позже, чем 1 февраля 2026 года у Grok 4.6. Усилие рассуждений распределено по четырём уровням — low, medium, high и xhigh, — а опубликованные показатели приведены для xhigh. Быстрый вариант обеспечивает вдвое большую скорость вывода за вдвое большую цену.

По сути, xAI описывает три изменения, а не новую архитектуру. Базовая модель крупнее, чем у Grok 4.6. Запуск обучения с подкреплением был дольше и с уклоном в задачи, на выполнение которых уходят многие часы. И модель обучали проверять собственную работу и лучше удерживать длинный контекст, включая нативное понимание обвязки Grok Bot. Собственное резюме компании в одну строку: «вдвое быстрее, за половину цены сопоставимых моделей» — это позиционное заявление о конкурентах, а не измерение, и читать его стоит именно так.

Доступность была широкой в первый день и с тех пор расширялась дважды. На старте: Cursor и Grok Build, собственный API поставщика, сторонние инструменты для кодинга, маршрутизаторы моделей и облачные платформы; собственная страница Grok Build от SpaceXAI теперь прямо предлагает «начать разработку с Grok 4.7». 28 сентября Amazon Web Services добавила её в Amazon Bedrock с тем же контекстным окном на 500 000 токенов и теми же четырьмя уровнями усилий при рассуждении, обслуживаемую через профили инференса между регионами, так что теперь модель доступна через собственный каталог гиперскейлера, а не только через API поставщика. Затем 1 октября она начала разворачиваться внутри потребительских веб- и мобильных приложений Grok, и два дня спустя она всё ещё находится именно там. Этот последний шаг прошёл на удивление тихо: SpaceXAI анонсировала аналогичный шаг для Grok 4.5 в посте в блоге под названием «Представляем Grok 4.5 на iOS, Android, Web и X», а для Grok 4.7 не опубликовала ничего, поэтому изменение видно в продукте, а не объявлено. Это серверное изменение, а не поставляемое в сборке, что подтверждают карточки приложений: обе карточки Grok для iOS и Android обновились 1 октября — сборка в App Store — 1.4.47, выпущенная в тот день, и в её примечаниях к выпуску упоминаются только «Улучшения для Chat, Voice и Imagine», тогда как карточка в Play была обновлена в тот же день. Изменение приходит с бэкенда, а не встроено в бинарник. Поскольку о развёртывании сообщают, а не документируют его, точный охват установить труднее, чем для размещения в Bedrock, за которым стоит датированный пост AWS, и в сообщениях уже появились расхождения: аккаунты, отслеживающие это, теперь описывают Grok 4.7 как базовую модель во всех режимах — Fast, Expert, Build и Heavy — список, который не соответствует тому, что на самом деле обслуживает grok.com. Воспринимайте это как собственные сообщения трекеров, а не как описание от поставщика. Отдельные партнёры по кибербезопасности получают доступ только по приглашению к возможностям ред-тиминга модели.

Одна поправка к тому, что зафиксировал этот материал. Количество параметров, которое два месяца циркулировало — примерно 2,1 трлн, примерно на 40% выше 1,5 трлн у Grok 4.6, — до сих пор не указано ни в одной спецификации. xAI не публиковала количество параметров для Grok 4.7, а Artificial Analysis указывает размер модели как нераскрытый. Эта цифра всегда была заявлением основателя, и запуск не превратил её в спецификацию.

Таблица бенчмарков принадлежит самой xAI — а вот что — нет.

Каждый показатель в списке ниже взят из анонса вендора, и ни один из них не был независимо воспроизведён. Читайте это с этой оговоркой: это показатели xAI по выбранным xAI тестам, опубликованные в день релиза, а первая неделя после любого запуска — это когда бенчмарки вендора наименее надёжны. Столбцы для сравнения тоже взяты у вендора — Grok 4.6 (high), GPT-5.6 Sol (max) и Claude Fable 5.1 (max), каждый запускался с выбранным вендором уровнем усилий.

• CursorBench 4.0 — Grok 4.7 46,3 %, Grok 4.6 40,4 %, GPT-5.6 Sol 41,7 %, Claude Fable 5.1 51,8 %. По данным вендора.

• DeepSWE v1.1 — Grok 4.7 71,0 % при высоком уровне усилий, Grok 4.6 65,2 %, GPT-5.6 Sol 72,7 %, Claude Fable 5.1 70,0 %. По данным производителя.

• Terminal-Bench 4.0 — Grok 4.7 37,6 %, Grok 4.6 20,3 %, GPT-5.6 Sol 37,3 %, Claude Fable 5.1 57,9 %. По данным производителя, с учётом пересмотра: в таблице на день запуска в строке Grok 4.7 было указано 38,0 %, а сегодня на странице производителя указано 37,6 %.

• EEBench — Grok 4.7: 64,0%, Grok 4.6: 53,0%, GPT-5.6 Sol: 39,4%, Claude Fable 5.1: 56,4%. По данным вендора.

• Harvey Legal Agent — Grok 4.7 19,6 %, Grok 4.6 15,8 %, GPT-5.6 Sol 2,5 %, Claude Fable 5.1 6,7 %. По данным поставщика.

• HealthBench Professional — Grok 4.7 56,7%, Grok 4.6 48,5%, GPT-5.6 Sol 60,5%, Claude Fable 5.1 62,1%. По данным производителя.

• AA Briefcase v1.1 — Grok 4.7 1 657, Grok 4.6 1 546, GPT-5.6 Sol 1 487, Claude Fable 5.1 1 678. Это единственная строка в таблице, которая больше не является исключительно вендорской: собственное табло AA-Briefcase от Artificial Analysis публикует те же 1 657 для Grok 4.7 при уровне усилий xhigh и 1 546 для Grok 4.6 при high. Столбцы сравнения по-прежнему отражают выбор моделей и уровней усилий вендора.

• GDPval Elo — Grok 4.7 1,695, Grok 4.6 1,605, GPT-6 Astra 1,542, Claude Fable 5.1 1,735. По данным вендоров.

Честное прочтение этого набора — не «Grok 4.7 побеждает». Он превосходит Grok 4.6 по всем восьми — это минимум, который преемник вам должен. В сравнении с конкурентами это смешанная картина: опережает GPT-5.6 Sol на CursorBench, Terminal-Bench и EEBench, отстаёт от него на DeepSWE; отстаёт от Claude Fable 5.1 на CursorBench, Terminal-Bench, HealthBench и обеих метриках в стиле Elo, опережает его на EEBench и в оценке юридического агента Harvey. Это также показывает, насколько результат бенчмарка зависит от уровня усилий — 71,0% в DeepSWE — это число, полученное при высоком уровне усилий, в таблице, где остальные значения указаны при xhigh.

Безопасность — это единственное место, где заявления вендора необычно конкретны. xAI утверждает, что Grok 4.7 был построен на совершенно новом стеке защитных механизмов, и называет его самой сильной моделью, которую компания тестировала на устойчивость к отказам и джейлбрейкам. В биобезопасностном бенчмарке LatchBio она сообщает о 62,4%; в HackerBench v0.3 она сообщает о пропуске 3,3% рискованных запросов двойного назначения, при этом редко блокируя законную работу по безопасности. Это оценки, о которых сообщил сам вендор, на его собственном релизе, и ни одна третья сторона их не воспроизвела.

Первые числа в этом материале, принадлежащие не вендору, — это три числа, опубликованные Artificial Analysis 21 сентября, и это расхождение показательно. В Intelligence Index Grok 4.7 набирает 46 при усилии xhigh по шкале v4.3.2 — 16-е место в этом рейтинге — против 44 у Grok 4.6. Этот прирост в два балла, по словам Artificial Analysis, достаточен, чтобы ввести SpaceXAI в топ-4 лабораторий индекса. Трактуйте эту позицию точно: это утверждение о лучшей модели лаборатории, а не об этой конкретной, и сама модель по-прежнему отстаёт на четыре балла от 50 у Claude Fable 5 и на семь — от 53, которые одинаковы у Claude Fable 5.1 и GPT-6 Astra. Прирост в два балла также укладывается в диапазон, который наблюдается между уровнями усилий одной и той же модели, — это напоминание о том, что преемник, набирающий больше предшественника, — не то же самое, что преемник, меняющий границы возможного. Ещё одно замечание о том, как читать это число: версия шкалы имеет значение, потому что Artificial Analysis пересчитала свой индекс, и значения 61/62/63, встречающиеся в большинстве публикаций за июль и август, относятся к выведенной из обращения шкале, действовавшей до сентября 2026 года, — их нельзя сравнивать с этими.

Coding Agent Index — это второе число, и именно оно изменилось. Работая в собственном харнессе Grok Build от SpaceXAI при усилии xhigh, Grok 4.7 набирает 56 против 47 у Grok 4.6 — девять пунктов, а не два — что ставит его на четвёртое место среди моделей, оценённых в их нативных харнессах, позади Claude Fable 5.1, GPT-6 Astra и Claude Opus 5, и впереди GPT-5.6 Sol. Индекс представляет собой равно взвешенную композитную оценку DeepSWE v1.1, Terminal-Bench 4.0 и SWE-Atlas-QnA на 303 задачах, и все три компонента улучшились: DeepSWE с 65% до 73%, Terminal-Bench с 18% до 33%, SWE-Atlas-QnA с 58% до 63%. Это первое независимое свидетельство того, что исправление, описанное xAI — более длительное обучение с подкреплением с акцентом на многочасовые задачи — что-то дало, и это то число, которое команде, выбирающей coding-агента, следует взвешивать наиболее тщательно, потому что оно измерено в харнессе, с которым модель фактически поставляется, а не в собственной таблице вендора.

Оговорка состоит в том, чего стоят эти девять пунктов. Собственный прогон Artificial Analysis сгенерировал 240 млн выходных токенов на Intelligence Index против медианы в 94 млн по отслеживаемым моделям — более чем вдвое — и оценил стоимость оценки одной задачи Index в $3,74. При $6 за миллион выходных токенов многословность — это та статья расходов, которая решает, можно ли позволить себе агентный цикл, так что прирост в девять пунктов, купленный более чем вдвое превышающим медиану объёмом вывода, — это реальный компромисс, а не бесплатное улучшение. Это же измерение также означает, что оценки из заголовков не следует трактовать как единый вердикт: в пересчёте на токен преимущество Grok 4.7 над Grok 4.6 меньше, чем предполагает разница в индексе, а на оценках общих знаний, из которых состоит Intelligence Index, он близок к той же модели при существенно более высоком счёте. Результат AA-Briefcase в следующем разделе — исключение из этого, причём крупное.

The Artificial Analysis model page for Grok 4.6 (high) showing an Intelligence Index of 61 against a median of 34, pricing of $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, and a released August 2026 label.

Второй независимый совет: AA-Briefcase, и что можно получить за половину стоимости выполнения задачи

Artificial Analysis в тот же день опубликовала третью оценку для Grok 4.7, и именно она относится к работе со знаниями, а не к коду. В AA-Briefcase — собственном рейтинге Artificial Analysis для долгосрочной агентной работы со знаниями, построенном на четырёх многонедельных проектных сценариях и 91 оценённом результате — Grok 4.7 при xhigh effort набирает 1 657 Elo, занимая четвёртое место в рейтинге и уступая только позициям Anthropic: Claude Fable 5.1 при max effort (1 678), Claude Opus 5 при max effort (1 673) и Claude Fable 5.1 при xhigh (1 669). Grok 4.7 отстаёт на 16 Elo от Claude Opus 5 при max effort и при xhigh на 8 Elo опережает Claude Opus 5 при xhigh (1 649). Воспринимайте это место в рейтинге точно: «уступает только моделям Anthropic» — это формулировка, которую использовала сама Artificial Analysis, и она точна, — но четвёртое место не второе, а три строки выше — все от одного и того же вендора.

Прирост относительно предыдущего поколения — самое крупное единичное изменение в релизе. В сравнении с Grok 4.6 при высоком уровне усилий (1,546) Grok 4.7 при xhigh набирает 111 Elo на AA-Briefcase — более чем в пятьдесят раз больше, чем прирост в два пункта по Intelligence Index. Artificial Analysis почти полностью объясняет это качеством аналитики: 1,994 Elo здесь против 1,690 у Grok 4.6, тогда как качество подачи слегка снижается — 1,499 против 1,519. Это отчётливая сигнатура: модель лучше рассуждает об анализе и чуть хуже оформляет итоговый материал. То же направление видно в цифрах, которые Artificial Analysis привела для AA-Briefcase-Lite — публичного сценария due diligence, выпущенного на Hugging Face: качество аналитики выросло с 1,698 до 1,994, подача снизилась с 1,531 до 1,499. Две оговорки к этому сравнению. AA-Briefcase-Lite явно демонстрационный: на собственной странице методологии Artificial Analysis сказано, что публичный пятый сценарий «не учитывается в официальных результатах AA-Briefcase». А приведённые для него показатели качества совпадают со строками xhigh, опубликованными на основной доске, так что воспринимайте абзац о Lite как иллюстрацию направления движения, а не как отдельную таблицу результатов.

Строка затрат — это то место, где этот результат меняет решение. Показатель AA-Briefcase «стоимость за задачу» — это общая стоимость выполнения полной заявки, делённая на её 91 задачу; если разделить опубликованные суммарные значения Artificial Analysis, получается примерно $9,30 за задачу для Grok 4.7 при xhigh против примерно $17,79 для Claude Opus 5 при максимальных усилиях — примерно вдвое меньше при разрыве в 16 пунктов Elo. Собственное резюме Artificial Analysis по этому результату таково: Grok 4.7 занимает место «чуть позади Opus 5 при ~50% его стоимости за задачу». Это тот же компромисс, который описывает остальная часть этого материала, приходящий к тому же ответу с другой стороны: Grok 4.7 не превосходит фронтир, а подрезает его по цене. Две оговорки, обе честные. Счёт за токены реален — в AA-Briefcase-Lite Artificial Analysis оценила стоимость API для создания примерных презентаций примерно в $8 для Grok 4.7 при xhigh против примерно $4,40 для Grok 4.6 при xhigh, так что преемник обходится примерно на 80% дороже, чем заменяемая им модель, за ту же работу. А показатели на задачу рассчитываются по использованию токенов по прайс-листовым ценам с репрезентативной долей попаданий в кэш, поэтому они зависят от вашего кэширования: это модель счёта, а не ваш счёт.

Место Grok 4.7 по сравнению с Grok 4.6 и остальными игроками

• Цена за 1 млн токенов — Grok 4.7: $2 за вход / $6 за выход при вводе менее 200K, $4/$12 — при превышении; Grok 4.6 — идентично.

• Контекстное окно — 500 000 токенов для обоих.

• Дата отсечки знаний — май 2026 года у Grok 4.7 против 1 февраля 2026 года у Grok 4.6.

• Усилие рассуждения — низкое / среднее / высокое / xhigh для Grok 4.7 в сравнении с опубликованными уровнями Grok 4.6.

Независимая оценка — 46 при уровне усилий xhigh против 44 по индексу интеллекта v4.3.2 от Artificial Analysis. Этого, по словам Artificial Analysis, достаточно, чтобы включить SpaceXAI в четвёрку ведущих лабораторий индекса.

• Независимый балл за программирование — 56 против 47 в Artificial Analysis Coding Agent Index, каждая модель в своём нативном харнессе. Четвёртое место среди моделей с нативным харнессом, впереди GPT-5.6 Sol.

• Показатель независимой интеллектуальной работы — 1 657 Elo при уровне усилий xhigh против 1 546 у Grok 4.6 при уровне усилий high в рейтинге AA-Briefcase от Artificial Analysis. Четвёртое место в общем зачёте: уступая трём позициям Anthropic и опережая Claude Opus 5 при уровне усилий xhigh.

• Стоимость одной задачи AA-Briefcase — около $9,30 против примерно $17,79 у Claude Opus 5 при максимальных усилиях, в одном и том же рейтинге. Примерно вдвое меньший счёт за задачу при разнице в 16 пунктов Elo.

• Токенов вывода за один запуск Index — 240 миллионов против медианы в 94 миллиона у моделей, которые отслеживает Artificial Analysis. Это улучшение не даётся бесплатно.

• Оценка кодирования вендоров — CursorBench 4.0: 46,3% против 40,4%.

• Скорость обслуживания — быстрый вариант с вдвое большей скоростью вывода за вдвое большую цену по сравнению со стандартным обслуживанием Grok 4.6.

• Безопасность — новый стек защитных механизмов с заявленным показателем 62,4% в бенчмарке биобезопасности LatchBio; Grok 4.6 был выпущен без такого заявления.

А вот и участники на той же таблице результатов: Claude Fable 5.1 — 53, Claude Opus 5 — 51, GPT-5.6 Sol — 47, Kimi K3 — 44. Собственное предсказание Маска — что Grok 4.7 «должен быть примерно на уровне Opus 5.0, а не 5.1» — теперь подкреплено числом, и это число оказалось там, где он и говорил: ниже фронтира, а не выше. Измеренный разрыв с Claude Fable 5.1 составляет семь пунктов; разрыв в цене идёт в другую сторону: для Claude Fable 5.1 указано $10/$50 за миллион токенов против $2/$6 у Grok 4.7 — в пять раз выше цена ввода и более чем в восемь раз выше цена вывода. Именно такой выбор приходится делать команде, и это компромисс по соотношению цены и производительности, а не победа по возможностям. AA-Briefcase — единственная таблица в этом материале, где порядок меняется: там Grok 4.7 при xhigh опережает Claude Opus 5 при xhigh — 1 657 против 1 649, — хотя всё ещё уступает Opus 5 при максимальном усилии с 1 673 и Claude Fable 5.1 с 1 678. Также стоит сопоставить три независимые оценки, прежде чем делать вывод, потому что они указывают не в одну сторону: отставание на семь пунктов по общему интеллекту, опережение GPT-5.6 Sol по индексу агентов для программирования, преимущество в 111 пунктов Elo над предшественником в интеллектуальной работе — и расплата за эти достижения выходными токенами. Какой из этих фактов определит ваш выбор, зависит от того, является ли рабочая нагрузка агентом для программирования, интеллектуальным результатом или чат-запросом, — и такое разделение полезнее единого рейтинга.

Что утечки сообщили верно — и единственное, что они так и не прояснили

Артефакты, которые эта публикация отслеживала вплоть до сентября, были настоящими, а запуск превращает их в проверку того, чего стоит этот класс доказательств. Вот реестр.

• В пул-реквесте каталога цена была указана правильно. Заявка от 21 сентября, добавлявшая Grok 4.7 в каталоги Zen и Go клиента-агента с открытым исходным кодом, — открыта в 05:36 UTC, автоматически закрыта ботом соответствия в 07:46 UTC из-за отсутствующего раздела шаблона пул-реквеста, так и не объединена, — указывала модель по опубликованным тарифам Grok 4.6. Оказалось, что это было точно верно: $2/$6, без изменений. Но механизм важнее результата. Участник скопировал тарифы из модели выше, и копирование случайно оказалось правильной догадкой. Это удача, а не авторитет, и заявления о возможностях в том же пул-реквесте тоже не несли информации. Предложение может быть правильным и всё равно не быть доказательством.

• След подготовки был настоящим и не являлся релизом. Строка grok-4.7 на странице квот моделей в Google Cloud Console, о которой 16–17 сентября сообщили трекеры сообщества, и датированный слаг сборки grok-4-7-0907, всплывший в ошибке конфигурации Grok Bot, — оба указывали на готовящуюся модель. Ни к одному из них никто не привязывал дату, и ни один из них не был анонсом. Они устанавливают лишь то, что готовилась сторонняя инфраструктура, — что задним числом было верно и всё же не являлось графиком.

• Количество параметров так и не было подтверждено. Примерно 2,1 триллиона, примерно на 40% больше, чем у Grok 4.6, — эту цифру Маск повторил 2 сентября, — и она по-прежнему отсутствует во всех спецификациях на момент запуска. Это самый ясный случай за всю эту историю, когда число циркулировало достаточно широко, чтобы восприниматься как факт, но при этом никогда не имело источника от вендора.

A what-we-know-so-far card for Grok 4.7 listing six rows: Status not released — in supplemental training, Model ID none — docs top out at grok-4.6, Release date none — Musk says 3–4 weeks, Parameters ~2.1T (claim, not verified), Training data SpaceX engineering corpus (reported), Benchmarks none published, with a footer reading that all figures are Musk claims or community reports and no independent scores exist.

Карточка выше фиксирует предзапусковое состояние на момент последней проверки в этом материале: ни идентификатора модели, ни даты выпуска, ни опубликованных бенчмарков. С тех пор объявление от 21 сентября сделало каждую строку в ней неактуальной, и она сохранена здесь потому, что разрыв между той карточкой и выпущенной моделью — это и есть настоящая история последних шести недель: запуск передовой модели, не давший никаких подтверждённых характеристик вплоть до дня её выпуска.

• Оговорка о готовности — это открытый вопрос, и теперь появились частичные доказательства. Маск в середине сентября сказал, что Grok 4.7 «завершается преждевременно» на задачах высокой сложности и что проверка его ответов «недостаточно строгая»; он объяснил это слишком высоким штрафом в обучении с подкреплением за длинные ответы, оговорившись «возможно». В анонсе запуска это не рассматривается. Заявленное xAI исправление является косвенным: более длительное обучение с подкреплением со смещением в сторону многочасовых задач и улучшенная самопроверка — это ровно то изменение, которое нужно было бы внести, чтобы устранить преждевременное завершение. Результат Coding Agent Index — первый внешний признак того, что дело сдвинулось: 56 против 47 у Grok 4.6, при этом Terminal-Bench 4.0 почти удвоился с 18% до 33%, а это как раз дальний конец диапазона — долгосрочные задачи со множеством шагов. Это не однозначный ответ, потому что те же оценки в этом харнессе — это ещё и результаты, которые достигаются ценой гораздо большего количества выходных токенов. Продолжает ли модель прекращать работу над длинными сложными задачами, может проверить любой, у кого есть доступ к API, и это остаётся первым, что стоит проверить.

• Корпус SpaceX по-прежнему не подтверждён. Заявленное дополнение к обучающим данным — телеметрия Starlink, журналы давления в камере сгорания Raptor, телеметрия входа Starship в атмосферу, внутренние ветки Slack, тикеты Jira, репозитории GitHub и записи ERP — это сообщения сообщества о том, что сказал Маск, а не раскрытие компанией. Анонс запуска описывает более крупную базовую модель и более длительный прогон обучения с подкреплением и ничего не говорит о корпусе. Если он там есть, никакая спецификация это не подтвердит; единственным доказательством будет то, сделает ли модель в реальной инженерной работе что-то, чего не могут её аналоги.

Хронология, которая четыре раза промахнулась, и в чём рынок оказался прав

Grok 4.7 публично обещали в рамках пяти отдельных сроков, и первые четыре истекли. 24–25 июля Маск сказал «около четырёх недель», подразумевая 22 августа. 12 августа он пересмотрел срок до «3–4 недель», подразумевая 2–9 сентября. 2 сентября он сузил его примерно до десяти дней, указывая на 12 сентября. 11 сентября, в день, когда этот срок истёк, он сказал «ещё несколько дней». Пятый вообще не был окном — это была строка grok-4.7 на странице квот Google Cloud, — и именно он оказался ближе всего к истине: модель вышла 21 сентября, вскоре после последней даты, которую кто-либо называл, и без даты, привязанной к артефакту, который ей предшествовал.

Прогнозные рынки правильно определили календарь, но ошиблись с моделью. Рынок Kalshi «SpaceXAI выпустит Grok 4.7 до 18 сентября?» прекратил торги в 03:59 UTC 18 сентября, последняя сделка прошла по 65 центов, при 1 785 торговавшихся контрактах и 1 211 открытых. Все рассчитанные контракты на обоих крупных рынках — окна Kalshi от 14, 21, 28 и 31 августа и 4, 8 и 11 сентября, а также контракты Polymarket от 12 и 14 сентября — завершились с исходом «Нет». Рынок Polymarket «следующая модель Grok (4.7 или выше) будет выпущена к 18 сентября?» 15 сентября держался на уровне 64% после колебаний от 42% до 88,5% в течение одиннадцати дней. Рынок был прав, что не поддался вызванным твитами всплескам, и прав, что окно 18 сентября закроется пустым. Он был на три дня раньше срока выхода модели — а это единственное, что контракт с фиксированной датой не способен оценить.

Число просмотров стоит сохранить как заметку для калибровки. Обратный отсчёт Маска 2 сентября — «выйдет через 10 дней» — собрал 10,29 млн просмотров и оказался ошибочным. Его откат 11 сентября собрал 2,05 млн и тоже был ошибочным. Его посты с дорожной картой 13–14 сентября собрали около 1,99 млн и оказались ближе всего к истине — он описал Grok 4.8, модель примерно на 2,5 трлн параметров, обученную на написанном с нуля стеке C++, как «заметное улучшение» по сравнению с Grok 4.7. Охват на протяжении всего этого отражал уверенность, а не точность.

Два пункта дорожной карты теперь являются открытыми вопросами, а не прогнозами. У Grok 4.8 нигде нет ни ID модели, ни цен, ни контекстного окна, ни записи в бенчмарке. А трактовка, будто Grok 4.7 был тихо «ребрендирован» в Grok 4.8 — интерпретация одного издания, основанная на том, что Маск назвал 4.8, пока 4.7 задерживался — разрешилась противоположным образом: 4.7 вышел как 4.7, с 46 в Index против 44 у Grok 4.6, что является приращением преемника, а не перезапуском.

Что это значит для команд, которые сегодня обращаются к Grok

Практическая картина изменилась 21 сентября — и изменилась наименее драматичным образом из возможных: новый ID модели при той же цене, том же контекстном окне, приросте на два пункта по индексу, приросте на девять пунктов по кодинг-агенту и приросте на 111 пунктов в работе со знаниями. Два изменения с тех пор значат больше, чем кажется. Приложения Grok теперь дают модель обычным пользователям, а не только разработчикам, а каталог на этой стороне теперь включает её — вместе это превращает слой маршрутизации, описанный в конце этой статьи, из плана в вариант по умолчанию. Если ваша модель затрат строилась на Grok 4.6 по $2/$6, цена за токен для Grok 4.7 всё ещё верна — а вот количество токенов нет. Собственный прогон Artificial Analysis сжёг 240 миллионов выходных токенов в Intelligence Index против медианы в 94 миллиона по отслеживаемым моделям, так что один и тот же запрос может стоить существенно более чем вдвое дороже, хотя тарифная сетка идентична, — и это тот тип изменения, который никогда не отражается в таблице цен. Оценивайте стоимость реального агентного цикла по выходным токенам, а не по ставке за миллион, прежде чем делать вывод, что этот релиз бесплатен. Если ваша причина перейти — заявленная вендором граница цена–производительность, то самое сильное подтверждение этого теперь AA-Briefcase, а не таблица вендора: четвёртое место в этой таблице при примерно вдвое меньшей, чем у Claude Opus 5, стоимости за задачу, на фоне семипунктового разрыва по Intelligence Index с Claude Fable 5.1 и ценового разрыва в обратную сторону — пятикратного на входе и более чем восьмикратного на выходе. А если ваша нагрузка — именно кодинг-агент, аргумент сильнее, чем предполагает Index: 56 в Coding Agent Index на испытательном стенде Grok Build, впереди GPT-5.6 Sol, — это совсем другая лига по сравнению с 46 по общему интеллекту. Что из этого важнее, целиком зависит от вашей нагрузки, и никто за пределами SpaceXAI не запускал Grok 4.7 на вашей нагрузке.

В каталоге OrcaRouter линейка Grok теперь включает Grok 4.7 наряду с Grok 4.6, Grok 4.5 и Grok 4.3 — по прайс-листу провайдера с наценкой 0%: $2 за миллион входных токенов и $6 за миллион выходных, чтение входных данных из кэша — $0.50, и тот же скачок до $4 на входе и $12 на выходе, когда запрос превышает 200 000 входных токенов, который взимает SpaceXAI. Именно это даёт сквозная передача тарифной сетки без изменений: цена за токен в вашей модели затрат — это цена за токен в вашем счёте, а все модели семейства отвечают на один ключ, так что перенос рабочей нагрузки с Grok 4.6 на Grok 4.7 — это изменение строки, а не второй контракт. На той странице указано контекстное окно на 500 000 токенов и та же совместимая с OpenAI поверхность — Chat Completions и Responses — на которую уже нацелена интеграция с Grok 4.6.

The OrcaRouter model page for grok/grok-4.6 showing the New and Featured badges, $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, text and image input, and the released August 12, 2026 label for Grok 4.6 by SpaceXAI.

Этот слой маршрутизации — также низкорисковый способ оценить модель, независимые цифры которой появились в тот же день, что и у поставщика. Приведённый выше список бенчмарков по-прежнему принадлежит самому поставщику — это выбранные им оценки, выбранные им уровни усилий, выбранные им столбцы сравнения — и ничего из этого не было воспроизведено. Что изменилось, так это то, что три оценки Artificial Analysis не принадлежат поставщику, поэтому вопрос сместился с «реально ли всё это» на «на какой из этих результатов похожа моя рабочая нагрузка»: 46, который говорит об общем интеллекте среднего уровня, 56, который говорит о четвёртом месте среди кодирующих агентов с нативной обвязкой, или 1 657, который говорит о четвёртом месте в интеллектуальном труде при вдвое меньшей стоимости за задачу, чем у фронтира. А число, определяющее экономику, — это вообще не бенчмарк, а выходные токены, которые потребляет запуск, и оценить их может только ваш собственный трафик — 240 миллионов на запуск Index по измерению Artificial Analysis против медианы в 94 миллиона, и примерно $8 против $4.40 за набор примерных презентаций в его публичном сценарии AA-Briefcase-Lite. Автоматическое переключение при сбое позволяет направить реальный трафик на новую модель и переключиться обратно на провайдера, который всё ещё отвечает, если счёт за токены или поведение с преждевременным прекращением работы окажется хуже заявленного, — а это разница между тестированием непроверенной модели и ставкой на неё целого пайплайна.

Как узнать первым (проверка, которая сработала)

Раньше в этом разделе был список сигналов, на которые стоило обращать внимание в ожидании. Ожидание окончено, поэтому вот тот же список, сверенный с тем, что произошло в действительности.

• Список моделей стал подтверждением, и он изменился. В течение шести недель совет в этом материале был таким: следите за списком моделей вендора, а не за твитами, потому что в тот момент, когда Grok 4.7 станет реальностью, в списке появится ID модели с ценой и контекстным окном. Именно это и произошло: grok-4.7 теперь появляется с контекстным окном 500K, ценой $2/$6 при вводе менее 200K и $4/$12 выше этого, датой отсечения знаний — май 2026 года — и четырьмя уровнями усилий. Ни одно из окон Маска, ни один аргумент о частоте выпусков и ни одна дата выхода на рынок не сдвинули этот список; релиз сдвинул его.

• Сторонние каталоги опережают анонс, и это предложения, а не развёртывания. Пул-реквест каталога от 21 сентября был самым ясным примером этого на сегодня, и его закрытие показательно: участник подготовил изменения для модели, бот закрыл изменение из-за отсутствующего раздела шаблона два часа спустя, а модель вышла через два дня после этого. Рассматривайте этот класс артефактов как намерение с отметкой времени. Он действительно предшествует анонсу, и это не доступность.

• Следите за каталогом моделей OrcaRouter. Теперь всё изменилось. На протяжении всего сентября в этой статье советовали считать страницу модели grok-4.7 на orcarouter.ai сигналом «её уже можно вызвать сегодня через нас», потому что модель попадает в список только после того, как провайдер её подключил. Теперь в каталоге есть Grok 4.7 по тарифу вендора без наценки, так что проверка, которую советовали провести читателю, даёт ответ: сегодня её можно вызывать через единый API.

• Что касается видимости для потребителей, приложение Grok теперь представило Grok 4.7 пользователям, которые никогда не откроют консоль API. При повторном чтении 2 октября данные выбора, которые grok.com показывает неавторизованному посетителю, по-прежнему называют модель в двух из четырёх пунктов — Expert гласит «Думает усердно · Grok 4.7», а Heavy — «Команда экспертов · Grok 4.7» — в то время как Fast, который является режимом по умолчанию при открытии приложения, описывается только как «Быстрые ответы», а Auto — как выбор между Fast и Expert. Четыре пункта — это Auto, Fast, Expert и Heavy. Build не входит в их число: Grok Build — это отдельный терминальный продукт на своей странице, и именно с этой страницы фактически происходит атрибуция Build для модели — там посетителям предлагается «установите сейчас и начните создавать с Grok 4.7». Итак, утверждение, которое циркулировало 1 октября и было повторено 2 октября — что Grok 4.7 теперь является базовой моделью во всех режимах «Fast, Expert, Build и Heavy» — перечисляет режим, который приложение не предоставляет, и пропускает тот, в котором оно открывается, и это трактовка трекеров, а не вендора, поскольку SpaceXAI вообще ничего не публиковала об этом развёртывании. Аналогичный шаг с Grok 4.5 получил отдельный пост в блоге; в этом же случае продукт тихо изменился, а новостная страница — нет.

Текущее положение дел

Grok 4.7 вышел 21 сентября 2026 года по цене $2 за миллион входных токенов и $6 за миллион выходных, с контекстным окном в 500 000 токенов и отсечкой знаний май 2026 года. Что изменилось за одиннадцать дней с тех пор — это не сама модель, а карта доступности: Amazon Bedrock добавил её 28 сентября, она начала разворачиваться внутри собственных веб- и мобильного приложений Grok 1 октября и всё ещё разворачивалась там 2 октября, а теперь она указана на OrcaRouter по собственному тарифу SpaceXAI без наценки. Её независимые оценки появились в тот же день, что и запуск, и по-прежнему расходятся: 46 при усилии xhigh в индексе интеллекта v4.3.2 от Artificial Analysis — на два балла выше Grok 4.6 и достаточно, чтобы поставить SpaceXAI в топ-четвёрку лабораторий индекса; 56 в индексе Coding Agent Index в харнессе Grok Build — на девять баллов выше Grok 4.6 и четвёртое место среди моделей с нативным харнессом, впереди GPT-5.6 Sol; и 1657 Elo в AA-Briefcase — на 111 баллов выше Grok 4.6 и четвёртое место в таблице после трёх записей Anthropic, при примерно вдвое меньшей стоимости за задачу, чем у Claude Opus 5. Каждый бенчмарк в таблице запуска от вендора — собственный и невоспроизведённый, за одним исключением: собственная таблица AA-Briefcase от Artificial Analysis публикует те же 1657, а вендор с тех пор пересмотрел свою строку Terminal-Bench с 38,0% вниз до 37,6%. Улучшения в кодинге и работе со знаниями реальны, и они стоят выходных токенов — 240 миллионов на прогон индекса против медианы в 94 миллиона и около $8 против $4,40 за набор примеров презентаций в публичном сценарии должной осмотрительности от AA, — а это и есть число, которое решает, дешёвый ли это релиз. Цифра в ~2,1 триллиона параметров, ходившая два месяца, всё ещё не имеет источника от вендора, а оговорка о преждевременном отказе так и не была прямо рассмотрена, хотя скачок Terminal-Bench с 18% до 33% в харнессе Grok Build — первое стороннее свидетельство того, что исправление сработало. Оба сигнала, за которыми эта статья советовала читателям следить, сработали: список моделей вендора пополнился grok-4.7 с прикреплённой ценой и контекстным окном, а здешний каталог указывает её по тому же тарифу. Так что выигрышный ход проще, чем в сентябре — Grok 4.6 по $2/$6 была ответом, и Grok 4.7 по $2/$6 — тот же ответ с более новым ID модели, лучшими оценками в кодинге и работе со знаниями, куда более крупным счётом за токены и потребительским приложением, которое называет её в двух своих самых сложных режимах.

Сравнение в этой статье3

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно