Hero-титульная карточка для сравнения «Grok 4.6 против DeepSeek V4 Pro», с подзаголовком «Фронтовая ценовая война, развернувшаяся с разницей в 24 часа», и бейджем «Сравнение · август 2026».
Guides & Insights

Grok 4.6 против DeepSeek V4 Pro: ценовая война на фронтире, с разницей в 24 часа

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Две фронтирные модели вышли в течение 24 часов друг за другом, и разрыв между их прайс-листами — самый большой, который произвело это поколение. Grok 4.6 вышел 12 августа 2026 года по цене $2 за миллион входных токенов и $6 за миллион выходных. DeepSeek V4 Pro — официальный производственный релиз флагмана D​eepSeek, версия DeepSeek-V4-Pro-0813, — последовал 13 августа 2026 года по цене ¥3 за миллион входных токенов с промахом кэша и ¥6 за миллион выходных, что примерно составляет $0.42 и $0.85. Та же категория, те же агентные амбиции, на порядок разница в цене. Это не сравнение двух спецификаций; это сравнение двух стратегий того, сколько должна стоить агентная модель, и обе вышли на этой неделе.

Этот материал сопоставляет два прайс-листа, рассматривает заявления каждого вендора о бенчмарках в привязке к его имени и вычисляет, во что на самом деле обходится разрыв на реальной рабочей нагрузке — потому что на бумаге эти модели ближе по возможностям, чем по философии, и именно разница в цене за задачу определяет решение.

Вся суть в выборе момента.

То, что обе модели вышли в одном и том же 48-часовом окне, — не календарная случайность. Grok 4.6 — это агентная переработка SpaceXAI своей фундаментальной модели на 1,5 трлн параметров: пост-тренировочное обновление с сильным упором на обучение с подкреплением в кодинге, работе с ядром и САПР, позиционируемое как топливо для принадлежащих компании продуктов Cursor и Grok Bot. DeepSeek V4 Pro — это формализация превью, которое незаметно переопределило понятие «агентный» при значительно более низкой цене; теперь модель доработана под агентную экономику: в примечаниях DeepSeek к сборке 0813 на первом месте — значительно улучшенные агентные возможности, добавлена поддержка Responses API и интеграции с Codex, сохранены как режим мышления (по умолчанию), так и режим без мышления, JSON-вывод, вызовы инструментов и формат Anthropic API. Две очень разные компании одновременно пришли к выводу, что главный рынок конца 2026 года — это агенты, и установили цены на свои продукты для очень разных кошельков.

Два прайс-листа бок о бок

Grok 4.6 — $2.00 / $6.00 / $0.50 (кэшированный ввод) за миллион токенов, контекст 500K, шаг $4 / $12 / $1 при входных данных свыше примерно 200K токенов, и более быстрый вариант по удвоенной базовой ставке.

DeepSeek V4 Pro — ¥3.00 (≈$0.42) за некэшированный вход, ¥0.025 (≈$0.0035) за кэшированный вход, ¥6.00 (≈$0.85) за выход на миллион токенов, с окном контекста в 1 миллион токенов и до 384K выходных токенов. Его более дешёвая версия, V4 Flash, стоит ¥1 / ¥2.

Даже против Grok 4.6 — уже самого дешёвого frontier API своего поколения — DeepSeek V4 Pro примерно в пять раз дешевле по входу при промахе кэша и в семь раз дешевле по выходу, и он предоставляет вдвое большее контекстное окно и гораздо больший максимальный выход в том же ценовом диапазоне. Эти две модели не конкурируют по цене; DeepSeek в одностороннем порядке установил новый нижний предел, и Grok теперь является премиальным вариантом в том же предложении. Эта подача важна, потому что предыдущая подача — «Grok 4.6 — дешёвая frontier-модель» — была верна ровно один день.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

Что на самом деле улучшил DeepSeek V4 Pro

Запуск D​eepSeek показывает самые впечатляющие цифры, потому что они сравниваются с его собственной предварительной версией, и разрыв между предварительной версией и релизом огромен. По собственной оценке вендора:

DeepSWE — 62,7% в релизной сборке против 12,8% в предварительной версии — показатель долгосрочных задач в программной инженерии, который вендор ставит между 58,0% у Opus 4.8 и 70,0% у Claude Fable 5.

Cybergym — 83,3%, по сравнению с 52,7%, слегка опередив Fable 5 (83,1%) и превзойдя Opus 4.8 (78,3%).

Terminal Bench 2.1 — 87,9%, в пределах одного пункта от 88,0% у Fable 5 и выше, чем 85,0% у Opus 4.8.

AutomationBench (публичный) — 31,8%, по сравнению с 12,8%, опережая и Fable 5 (29,1%), и Opus 4.8 (27,2%).

Toolathlon-Verified, NL2Repo, DSBench-FullStack и DSBench-Hard — 74.1%, 61.5%, 71.1% и 67.2% соответственно, сгруппированы на уровне или около уровня Opus 4.8 / Fable 5.

Каждый из этих результатов получен самим D​eepSeek на собственном наборе оценочных тестов. Направление очевидно: превью не был готов к продакшен-циклам агентов, а релизная сборка, как утверждается, готова — но честная оценка такова: ни одна независимая лаборатория ещё не тестировала DeepSeek V4 Pro, и модели, с которыми он сравнивается, не названы внешней стороной.

С чем отвечает Grok 4.6

Счёт Grok 4.6 иной по своей природе: он единственный из двух, у которого есть независимое табло. Artificial Analysis оценила его в 61 по своему Индексу интеллекта — вровень с GPT-5.6 Sol, впереди Kimi K3 (60) — ещё до того, как DeepSeek V4 Pro вообще вышел. Его фирменная таблица заявляет о лидирующих 65,9% на DeepSWE v1.1 и 69,9% на CursorBench v3.2, с открыто признанным слабым местом в 26% на Terminal-Bench v3.0. Это данные, сообщённые xAI, и ни одно из них не было независимо воспроизведено по состоянию на 13 августа.

Расхождения версий важны, когда вы пытаетесь сравнить их напрямую. 87,9 у D​eepSeek — это результат на Terminal Bench 2.1; 26% у Grok — на более сложной v3.0 — разные экзамены, так что «D​eepSeek разносит Grok на терминалах» — нечестное утверждение, как и «Grok лидирует на DeepSWE» без упоминания того, что два вендора использовали разные версии eval и ни одна цифра не подтверждена третьей стороной. Сопоставимо здесь лишь независимое измерение: у Grok 4.6 есть один проверенный скоркард, у DeepSeek V4 Pro — пока ни одного, и для продакшн-решения эта асимметрия сама по себе — информация.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

Общая стоимость длительного выполнения агента

Возьмите реалистичную агентную задачу — чтение и осмысление 500K токенов контекста, написание 100K токенов выходного текста, что является рефакторингом среднего размера или конвейером обработки длинных документов, в пределах окон обеих моделей:

Grok 4.6 — 0.5M вход по $2 = $1.00, плюс 0.1M выход по $6 = $0.60. Итого: $1.60.

DeepSeek V4 Pro — 0.5M входных токенов с промахом кэша по ¥3 = ¥1.50, плюс 0.1M выходных токенов по ¥6 = ¥0.60. Итого: ¥2.10, около $0.29.

Это разрыв в 5,5 раза на той же номинальной задаче ещё до учёта каких-либо преимуществ кэширования — а окно D​eepSeek в 1M токенов плюс максимальный выход в 384K также означает, что задача умещается в один проход, тогда как окно Grok 4.6 в 500K может потребовать двух проходов. Но есть загвоздка, из-за которой это нельзя свести к однострочному ответу: стоимость и риск рассуждений. Режим мышления D​eepSeek включён по умолчанию, поэтому каждый запрос требует оплаты полной трассировки рассуждений, даже когда она не нужна, а уверенность вендора, основанная на собственных бенчмарках, не проверена ни одной независимой стороной. Низкая цена за токен при всегда включённых рассуждениях по-прежнему означает низкую цену за задачу при таких тарифах, но «дёшево» и «проверено» — разные утверждения, и только одна из этих моделей соответствует второму.

Кто должен выбирать

Решение заключается не столько в том, «что лучше», сколько в том, «какой профиль риска соответствует рабочей нагрузке»:

Высокие объёмы, ограниченный бюджет и готовность мириться с непроверенными цифрами — DeepSeek V4 Pro — это вариант минимальной цены. Контекст в 1M и вывод в 384K делают его более сильным кандидатом для длинных контекстов и пакетной обработки, а ставка ¥0.025 за кэшированный ввод делает конвейеры с большим количеством извлечений почти бесплатными. Просто проведите собственные оценки, потому что независимых никто не проводил.

Агентная глубина с независимой оценкой в OpenAI-совместимой экосистеме — 61 у Grok 4.6 подтверждён, направление его бенчмарков на кодинг и агентность непротиворечиво, а конечная слабость известна заранее. Время до первого токена в 42 секунды — это цена, которую вы платите за подтверждённое качество.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

Смешанный трафик — это как раз тот случай, когда нужно маршрутизировать, а не выбирать. В OrcaRouter обе модели находятся за одним ключом по ценам провайдеров без наценки — поэтому ¥3/¥6 D​eepSeek остаются ¥3/¥6 в счёте, а Grok 4.6 остаётся $2/$6, и ни на ту, ни на другую наценки нет. Правило маршрутизации может отправлять длинноконтекстную и чувствительную к стоимости работу на DeepSeek V4 Pro, а проверенную агентную работу — на Grok 4.6, делить трафик по запросам, пока ваша собственная оценка не определит пропорцию, и полагаться на автоматическое переключение при сбое, если поведение любого из вендоров в первую неделю противоречит цифрам, заявленным при запуске. Для пары моделей, которым всего день от роду и которые находятся по разные стороны ценовой войны, возможность сравнить обе на своей собственной нагрузке — и изменить пропорцию без изменения кода — это не вопрос удобства. Это единственный оправданный способ внедрить любую из них.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube