Титульная карточка для сравнения GPT-6 и Grok 4.7. В заголовке написано: «GPT-6 против Grok 4.7». На плашке написано: «GPT-6 Sol: контекст 1,05 млн, вывод 128 тыс., $2,00 / $10,00». На плашке написано: «Grok 4.7: контекст 500 тыс., вывод 450 тыс., $2,00 / $6,00». В нижнем колонтитуле написано: «Цена за ввод совпадает; цена за вывод и потолок вывода — нет».
Guides & Insights

GPT-6 vs Grok 4.7: столбец вывода решает всё

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

GPT-6 Sol и Grok 4.7 берут одинаковую плату за входные токены — $2,00 за миллион, оба — что делает столбец ввода бесполезным при выборе между ними. Решение находится на один столбец правее. GPT-6 Sol берёт $10,00 за миллион выходных токенов; Grok 4.7 — $6,00. И эти две модели расходятся в том, сколько выходных данных разрешено сгенерировать за один вызов, в три с половиной раза: GPT-6 Sol ограничен 128 000 токенов, тогда как Grok 4.7 — флагман SpaceXAI, выпущенный 21 сентября 2026 года как преемник Grok 4.6 — доходит до 450 000.

Всё остальное в этом сравнении вытекает из этих двух фактов, плюс ещё один: у GPT-6 Sol больше контекстное окно — 1 050 000 токенов против 500 000 у Grok 4.7. Так что это не история о том, что одна модель лучше. Это история о двух моделях разной формы и о том, какая форма у вашей рабочей нагрузки.

Сначала придайте своему запросу правильную форму

Полезный способ разобраться с выбором между GPT-6 и Grok 4.7 — по тому, какой ресурс фактически потребляет ваша задача. Три случая охватывают большую часть продакшн-трафика.

Длинный вход, короткий выход. Вы подаёте большой документ, кодовую базу или длинный журнал работы агента и получаете обратно сводку, diff или решение. Здесь связывающим ограничением становится контекстное окно, и 1 050 000 токенов у GPT-6 Sol — это примерно вдвое больше, чем 500 000 у Grok 4.7. Но обратите внимание на строку о тарифных уровнях на обеих карточках: ставка Grok 4.7 в $2,00 действует до 200 000 входных токенов и повышается до $4,00 сверх этого, тогда как ставка GPT-6 Sol в $2,00 действует до 272 000 токенов и повышается до $4,00 после. На 200 001 токене Grok уже пересчитан по новому тарифу, а GPT-6 Sol — ещё нет, поэтому документ на 250 000 токенов стоит $4,00 за миллион у Grok 4.7 и $2,00 за миллион у GPT-6 Sol — вдвое дороже, и это ещё до учёта вывода.

Короткий ввод, длинный вывод. Вы генерируете: длинный документ, большой файл кода, структурированный артефакт или цепочку вызовов инструментов, результаты которых модель должна полностью выписать. Именно для этого создан Grok 4.7. Потолок вывода в 450 000 токенов более чем на порядок превышает то, что допускают большинство моделей, а при цене $6.00 за миллион выходных токенов против $10.00 вы платите на 40% меньше за каждый из этих токенов. Если ваша генерация регулярно превышает 128 000 выходных токенов, GPT-6 Sol вообще не сможет выполнить запрос за один вызов, а Grok 4.7 сможет.

Сбалансированный и тяжёлый по обоим. Длинный ввод и длинный вывод вместе — это случай, когда две карточки взаимодействуют. Ввод на 400 000 токенов с выводом на 200 000 токенов стоит $4.00 за ввод и $12.00 за вывод на Grok 4.7 (оба выше её порога) и $4.00 за ввод и $15.00 за вывод на GPT-6 Sol. Это единственная конфигурация, где GPT-6 Sol оказывается более дорогой моделью в расчёте на токен, и стоит проверить свои собственные средние значения на этом примере, прежде чем предполагать, что модель по умолчанию эпохи ChatGPT дешевле.

Что изменила OpenAI — и почему это важно здесь

GPT-6 — это семейство из трёх моделей, и 7 октября 2026 года OpenAI представила среднюю из них публике. GPT-6 в ChatGPT — развёртывание Intelligent UI — работает на GPT-6 Sol для Plus, Pro, Business и Enterprise и на GPT-6 Luna для Free и Go, охватывая более 1,2 миллиарда человек, которые пользуются ChatGPT еженедельно. Это факт распространения, а не факт возможностей, и он меняет то, что означает «GPT-6» при сравнении: когда кто-то говорит, что GPT-6 победил другую модель или проиграл ей в каком-то бенчмарке, обычно имеется в виду именно GPT-6 Sol или флагманскую GPT-6 Astra за $10.00 / $50.00.

В этом противостоянии развёртывание ChatGPT имеет значение в одном конкретном отношении. Grok 4.7 был выпущен 21 сентября 2026 года, за четыре дня до GPT-6 Sol, и это чистая API- и app-модель без эквивалентного потребительского варианта по умолчанию для миллиарда пользователей. Собственное описание SpaceXAI узкое и конкретное: флагман для длительной разработки ПО, агентных рабочих процессов с использованием инструментов и самопроверкой, а также интеллектуальной работы со знаниями. Это утверждение о работе с большим объёмом вывода, а именно в такой форме карта Grok сильнее.

Табло с честной маркировкой

Независимая оценка этих двух исходит от Artificial Analysis, и краткий вывод таков: по сводному индексу они близки, а по отдельным тестам расходятся так, что это соответствует продуктам.

• AA Intelligence Index: Grok 4.7 — 46,4 (16-е место среди моделей, которые он оценивает), GPT-6 Sol — 47,6; GPT-6 Sol опережает примерно на один пункт
• Humanity's Last Exam: Grok 4.7 — 43,1 %, GPT-6 Sol — 47,9 %
• SciCode: Grok 4.7 — 57,4 %, GPT-6 Sol — 57,6 % — практически на одном уровне
• Long-Context Recall: Grok 4.7 — 76,7 %, GPT-6 Sol — 83,7 % — GPT-6 Sol впереди, что согласуется с более крупным окном
• Terminal-Bench (v4.0 на карточке Grok): Grok 4.7 — 25,8 %, GPT-6 Sol — 43,9 % в том же семействе тестовых стендов
• Программирование: Grok 4.7 попадает в верхний дециль индекса программирования, среди сильнейших моделей в таблице лидеров

Две оговорки, и они не для красного словца. Значения индексов для двух моделей оценивались в разные даты, так что это не прямое сравнение в один день, и разница в один пункт укладывается в колебания, которые даёт ревизия. И каждая приведённая выше цифра Grok 4.7 — это собственное опубликованное число провайдера в том виде, в каком оно указано в каталоге, а не оценка, которую мы пересчитывали; честное прочтение таково: Grok 4.7 — это модель для кодинга из верхнего дециля, которая отстаёт примерно на пункт от GPT-6 Sol по составному показателю общего рассуждения, а разрыв по terminal-bench — самый крупный отдельный сигнал во всём наборе.

Screenshot of the OrcaRouter model page for Grok 4.7, showing the SpaceXAI Grok 4.7 card with a 500,000-token context window, up to 450,000-token output, text/image/file input and text output, and a tiered rate of $2.00 per million input and $6.00 per million output up to 200,000 tokens, stepping to $4.00 and $12.00 above.

Задержка и надёжность, которые скрывает спецификация

Публикуемые тарифные планы и таблицы бенчмарков одинаково умалчивают о том, что определяет качество обслуживания в продакшене, поэтому стоит смотреть на измеренные цифры, а не на маркетинговые.

По результатам собственных замеров OrcaRouter в плейграунде за первую неделю октября 2026 года Grok 4.7 показал медианную задержку до первого токена 3 825 мс и выдавал результат со скоростью примерно 147 токенов в секунду при уровне ошибок около 8%. Измеренная медианная задержка GPT-6 Sol в том же окне была выше — 6 363 мс — при значительно более высоком уровне ошибок. Это наблюдения из плейграунда на общем маршруте, а не SLA вендора, и уровень ошибок 39% на маршруте одной модели — это проблема маршрутизации, а не проблема модели; именно для покрытия подобных разрывов и существует failover. Для сравнения важно то, что маршрут Grok 4.7 в этом конкретном окне выглядел существенно более отзывчивым и надёжным, чем маршрут GPT-6 Sol, и что опубликованная карточка ни того, ни другого вендора не сказала бы вам об этом.

Вести оба, не отдавая предпочтения ни одному

Соблазн в таком близком сравнении — выбрать один вариант заранее по цене, а через три месяца обнаружить, что структура вашего трафика изменилась. Именно эту проблему решает маршрутизация. В OrcaRouter и grok/grok-4.7, и GPT-6 Sol — это живые маршруты в одном каталоге за одним API, по прайс-листовой цене провайдера с наценкой 0% — так что когда SpaceXAI или OpenAI меняет тариф, изменение вступает в силу в тот же день, а не при следующей сверке счетов. Автоматическое переключение при сбое между провайдерами покрывает случай, когда один из маршрутов деградирует, что напрямую актуально с учетом разброса частоты ошибок выше. А DSL маршрутизации позволяет разделять трафик по форме запроса, а не по предпочтению модели: направляйте задачи с длинным входом и коротким выходом модели с большим окном, отправляйте генерацию с длинным выходом той, у которой потолок 450K и более дешевый тариф на выход, и пусть выбор делает предикат по размеру запроса, а не человек.

Выбор

Если ваша работа — анализ длинных документов, рассуждения с большим контекстом или что-либо, что выходит за 200 000 входных токенов, GPT-6 Sol — лучшая карта: вдвое больший контекст, более высокий независимый индекс и порог, который находится на 72 000 токенов дальше. Если ваша работа — генерация: длинные артефакты кода, лонгриды, длинные цепочки вызова инструментов, где модель должна записать то, что нашла, — Grok 4.7 — лучшая карта: потолок вывода в 450 000 токенов, недостижимый для GPT-6 Sol, выходные токены на 40% дешевле, и соответствующий профиль программирования из верхнего дециля. Если вы действительно делаете и то и другое, ответ — не модель. Это маршрут.

A comparison card titled 'The shape of the request decides'. Left column 'Grok 4.7': rows 'Context: 500K', 'Output: up to 450K', 'Input: $2.00 to 200K, then $4.00', 'Output: $6.00, then $12.00', 'AA Index: 46.4'. Right column 'GPT-6 Sol': rows 'Context: 1,050,000', 'Output: 128K', 'Input: $2.00 to 272K, then $4.00', 'Output: $10.00, then $15.00', 'AA Index: 47.6'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; evaluation dates differ between models.'Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate card of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно