
GPT-6.1 Sol против DeepSeek V4 Pro: три метра, три разных ответа
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Спросите, насколько далеко друг от друга GPT-6.1 Sol и DeepSeek V4 Pro, и честный ответ таков: всё зависит от того, по какой метрике смотреть, а три эти метрики расходятся сильнее, чем большинство сравнений моделей расходятся во всём. По цене за миллион токенов при смешанном соотношении ввода и вывода 3:1 это $4,00 против $0,99 — разница в четыре раза. По тому, сколько на самом деле стоило прогнать один и тот же набор тестов, это $0,72 против $0,67 за задачу — семь процентов. По Artificial Analysis Intelligence Index это 51,8 против 36 — шестнадцать пунктов, что звучит как решающий довод, пока не посмотришь, с кем сравнивали каждое число, потому что собственная методология этого оценщика помещает две модели в разные лиги. GPT-6.1 Sol был выпущен 29 сентября 2026 года по цене $2,00 за ввод и $10,00 за вывод с окном в 1 050 000 токенов. DeepSeek V4 Pro — флагман на основе смеси экспертов под лицензией MIT, 1,6 трлн параметров, из которых 49 млрд активных, выпущен 13 августа 2026 года по цене $0,66 и $1,98 с окном в 1 048 576 токенов. Одна — текстовая модель, которую можно скачать. Другая видит изображения. Разобраться, по какой из трёх метрик вам на самом деле стоит ориентироваться, — вот в чём вся задача.
Строка индекса — это не то сравнение, каким оно кажется.
Начните с числа, которое цитируют чаще всего, потому что именно его чаще всего цитируют неправильно.
Artificial Analysis публикует свою методологию вместе с таблицей лидеров, и два предложения в ней имеют здесь значение. Модели с открытыми весами, говорится в ней, сравниваются только с другими моделями с открытыми весами того же размерного класса — крошечные, малые, средние, крупные, с границей в 150 миллиардов параметров. Проприетарные модели вместо этого сравниваются в рамках ценового диапазона, при смешанном соотношении входных и выходных данных 3:1. Это две разные группы сравнения. DeepSeek V4 Pro 0813 имеет открытые веса — об этом говорится в FAQ самого оценщика, где указываются опубликованные веса, — и при общем числе параметров 1,6 триллиона он попадает в крупный класс моделей с открытыми весами. GPT-6.1 Sol является проприетарной и оценивается в сравнении с моделями в своём ценовом диапазоне.
Оценка 51,8 и оценка 36, стоящие в соседних строках одной и той же таблицы, таким образом, не являются очным сравнением. Это оценка относительно одного набора аналогов и оценка относительно другого, и именно поэтому показатели стоимости за задачу сопоставимы, а сырые значения индекса — нет. Если вы хотите узнать, насколько хороша DeepSeek V4 Pro как скачиваемая модель, 36 — это число, которое даёт ответ. Если вы хотите узнать, как она показывает себя по сравнению с размещённой на сервере передовой моделью, столбец индекса вам этого не скажет, и в этом случае честный ход — сказать это, а не вычитать 36 из 51,8 и называть это разрывом.
Что можно сравнить чисто: карточки цен, лимиты контекста и вывода, списки модальностей и стоимость запуска одного и того же набора оценок — потому что последняя цифра — это учёт одинаковой работы, а не балл.
Что говорят необработанные счётчики

• Цена ввода — GPT-6.1 Sol $2.00 против DeepSeek V4 Pro $0.66 за миллион токенов
• Цена за вывод — GPT-6.1 Sol $10.00 против DeepSeek V4 Pro $1.98, с переходом к $1.32 и $3.96 внутри двух четырёхчасовых окон UTC в будние дни
Чтение из кэша — GPT-6.1 Sol $0,10 против DeepSeek V4 Pro $0,022 за миллион; кэш есть у обоих, а дешёвая сторона снова в 4,5 раза дешевле
• Стоимость одной задачи индексации — GPT-6.1 Sol $0.72 против DeepSeek V4 Pro $0.67
• Выходные токены, сгенерированные на индексном наборе — GPT-6.1 Sol 67M против DeepSeek V4 Pro 160M
• Максимальный вывод — 384 000 токенов у DeepSeek V4 Pro против 128 000 токенов у GPT-6.1 Sol
• Модальности — GPT-6.1 Sol поддерживает текст, изображения и файлы; DeepSeek V4 Pro поддерживает только текст
Четвёртая и пятая строки — интересная пара. DeepSeek V4 Pro выдаёт в 2,4 раза больше токенов на одном и том же наборе тестов и всё равно обходится на 7% дешевле в расчёте на задачу, потому что его тариф за выходные токены составляет пятую часть от тарифа GPT-6.1 Sol. Так выглядит модель, ориентированная на цену, когда измеряешь объём вывода, а не тариф: многословность реальна, и она не устраняет преимущество. Окно по времени — это та самая звёздочка. Два четырёхчасовых блока по будням — 40 из 168 часов в неделю — удваивают указанный тариф до $1,32 и $3,96, и эта надбавка применяется к тем же токенам, которые в противном случае были бы самыми дешёвыми на любой из карт.
Чего не делает более дешёвая модель
Три вещи, и каждая из них — жёсткий предел, а не компромисс.
Он не видит. DeepSeek V4 Pro работает только с текстом: текст на входе, текст на выходе. Никаких скриншотов, никаких отсканированных PDF-файлов, никакого чтения графиков, никаких диаграмм в тикете. Сценарии использования компьютера и рабочие процессы с интенсивной работой с документами — именно те рабочие нагрузки, под которые позиционируется GPT-6.1 Sol, — недоступны ни за какие деньги. Если ваш конвейер уже направляет изображения в модель компьютерного зрения, это не проблема; если нет — это решающее ограничение.
У неё нет такого графика выпусков, под который можно было бы планировать. Название «deepseek-v4-pro» с августа указывает на сборку 0813, и путь к этому не был тихим: поставщик объявил о выводе этой сборки из эксплуатации на 14 сентября, отозвал анонс за два дня до этой даты и продолжил обслуживать API с неизменной тарификацией. В нашем собственном каталоге она по-прежнему значится флагманом с тем же контекстом, потолком вывода и лимитом параллелизма. Поставщик, способный за два дня отозвать уведомление о прекращении поддержки, может также и не делать этого; операционный вывод не в том, что модель нестабильна, а в том, что имя — это указатель, и привязка поведения к идентификатору сборки, а не к названию маршрута, — это дешёвая страховка.
Это не несёт с собой сопутствующих знаний. GPT-6.1 Sol существует восемь дней, и у него уже опубликована одна независимая конфигурация; у DeepSeek V4 Pro более длинная история оценок и гораздо более широкая база практиков, включая опубликованный стек обслуживания и сторонние работы по пропускной способности. Для развёртывания на собственном сервере этот массив материалов ценнее, чем строка индекса, потому что именно к нему обращаешься, когда модель ведёт себя странно на твоём оборудовании, а не на бенчмарке.
Когда счётчик, который в четыре раза дешевле, — это не тот счётчик
Если бы дешёвая модель была просто хуже во всём, эта статья была бы короткой. Неудобный факт заключается в том, что эти две различаются на 7% на задачу при одинаковой работе и в 2,4 раза — по тому, сколько они пишут, чтобы добиться результата. Это значит, что метрика смешанных токенов — та, что показывает 4×, — измеряет разницу, которую вы по большей части не оплачиваете, потому что она оценивает смесь токенов, которую вы, возможно, никогда не отправляете. А индексная метрика — та, что показывает 16 пунктов, — измеряет по двум группам сопоставимых моделей, и её нельзя вычитать.
Итак, практическое разделение — это не «фронтирная модель для сложной работы, дешёвая модель для простой». Это разделение по модальности и по объёму. Всё, что содержит изображение, отправляется в GPT-6.1 Sol; туда же идёт всё, где ответ короткий, а рассуждение — дорогая часть. Его пять уровней усилий — от low до max, где medium используется по умолчанию, — позволяют покупать рассуждения, а не текст, а кэшированный ввод по цене $0.10 делает длинный повторяющийся промпт дешёвым. Всё сугубо текстовое, высокообъёмное и допускающее более длинный ответ — классификация, извлечение, суммаризация, массовая генерация в рамках бюджета вывода в 384 000 токенов — отправляется в DeepSeek V4 Pro, в идеале — вне двух UTC-окон.
И то и другое на одной клавише, а разделение — это строка конфигурации.
Обе модели доступны на OrcaRouter по собственным опубликованным тарифам их провайдеров, без наценки: GPT-6.1 Sol — $2.00 / $10.00, с переходом на $4.00 / $15.00 при превышении 272 000 токенов промпта, и DeepSeek V4 Pro — $0.66 / $1.98, с двумя временными окнами, действующими так, как указано. Один ключ, один счёт, одна совместимая с OpenAI конечная точка для обеих.
Именно поэтому описанное выше разделение стоит записать, а не спорить о нём. Разделение по модальностям можно выразить в виде правила маршрутизации, так что запросы с изображениями идут в модель компьютерного зрения, а основная масса текста — в дешёвую модель, без изменений в приложении; если маршрут деградирует, аварийное переключение перенаправит вызов, а не завершит его сбоем. А поскольку обе модели находятся на одном эндпоинте, сравнение цен, которое действительно имеет значение — ваше, на вашем трафике, при вашем соотношении токенов, — можно построить по вашим собственным счетам, а не по среднему значению из набора бенчмарков.


Вердикт, если в одну строку, таков: трактовке «в четыре раза дешевле» доверять не стоит, а трактовку «семь процентов» нужно проверять. Четырёхкратная разница — это то, что смешанный счётчик говорит о такой смеси токенов, которую вы можете и не отправлять. Семь процентов — это то, во сколько та же оценка обошлась в обоих случаях, и в неё уже заложена 2,4-кратная разница в многословности. Шестнадцать пунктов реальны, но они также получены по двум разным группам сравнения, а ограничение, которое фактически определяет большинство вариантов развёртывания этой пары, вообще не является числом: одна из этих моделей умеет читать скриншот, а другая — нет.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
