Сгенерированная hero-карточка для GPT-6.1 Sol против DeepSeek V4 Pro с заголовком «Три измерителя — три разных ответа», тремя карточками метрик: «Смешанная цена 4x», «Стоимость на задачу индекса 1.07x» и «Индекс интеллекта: 16 пунктов», строкой «Одна — проприетарная и видит изображения. У другой открытые веса под лицензией MIT, и она работает только с текстом.», футером «Цены — по данным OpenAI и DeepSeek; показатели индекса и стоимости на задачу — по данным Artificial Analysis, которая сравнивает модели с открытыми весами и проприетарные модели в разных группах сопоставления.» и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

GPT-6.1 Sol против DeepSeek V4 Pro: три метра, три разных ответа

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Спросите, насколько далеко друг от друга GPT-6.1 Sol и DeepSeek V4 Pro, и честный ответ таков: всё зависит от того, по какой метрике смотреть, а три эти метрики расходятся сильнее, чем большинство сравнений моделей расходятся во всём. По цене за миллион токенов при смешанном соотношении ввода и вывода 3:1 это $4,00 против $0,99 — разница в четыре раза. По тому, сколько на самом деле стоило прогнать один и тот же набор тестов, это $0,72 против $0,67 за задачу — семь процентов. По Artificial Analysis Intelligence Index это 51,8 против 36 — шестнадцать пунктов, что звучит как решающий довод, пока не посмотришь, с кем сравнивали каждое число, потому что собственная методология этого оценщика помещает две модели в разные лиги. GPT-6.1 Sol был выпущен 29 сентября 2026 года по цене $2,00 за ввод и $10,00 за вывод с окном в 1 050 000 токенов. DeepSeek V4 Pro — флагман на основе смеси экспертов под лицензией MIT, 1,6 трлн параметров, из которых 49 млрд активных, выпущен 13 августа 2026 года по цене $0,66 и $1,98 с окном в 1 048 576 токенов. Одна — текстовая модель, которую можно скачать. Другая видит изображения. Разобраться, по какой из трёх метрик вам на самом деле стоит ориентироваться, — вот в чём вся задача.

Строка индекса — это не то сравнение, каким оно кажется.

Начните с числа, которое цитируют чаще всего, потому что именно его чаще всего цитируют неправильно.

Artificial Analysis публикует свою методологию вместе с таблицей лидеров, и два предложения в ней имеют здесь значение. Модели с открытыми весами, говорится в ней, сравниваются только с другими моделями с открытыми весами того же размерного класса — крошечные, малые, средние, крупные, с границей в 150 миллиардов параметров. Проприетарные модели вместо этого сравниваются в рамках ценового диапазона, при смешанном соотношении входных и выходных данных 3:1. Это две разные группы сравнения. DeepSeek V4 Pro 0813 имеет открытые веса — об этом говорится в FAQ самого оценщика, где указываются опубликованные веса, — и при общем числе параметров 1,6 триллиона он попадает в крупный класс моделей с открытыми весами. GPT-6.1 Sol является проприетарной и оценивается в сравнении с моделями в своём ценовом диапазоне.

Оценка 51,8 и оценка 36, стоящие в соседних строках одной и той же таблицы, таким образом, не являются очным сравнением. Это оценка относительно одного набора аналогов и оценка относительно другого, и именно поэтому показатели стоимости за задачу сопоставимы, а сырые значения индекса — нет. Если вы хотите узнать, насколько хороша DeepSeek V4 Pro как скачиваемая модель, 36 — это число, которое даёт ответ. Если вы хотите узнать, как она показывает себя по сравнению с размещённой на сервере передовой моделью, столбец индекса вам этого не скажет, и в этом случае честный ход — сказать это, а не вычитать 36 из 51,8 и называть это разрывом.

Что можно сравнить чисто: карточки цен, лимиты контекста и вывода, списки модальностей и стоимость запуска одного и того же набора оценок — потому что последняя цифра — это учёт одинаковой работы, а не балл.

Что говорят необработанные счётчики

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• Цена ввода — GPT-6.1 Sol $2.00 против DeepSeek V4 Pro $0.66 за миллион токенов

• Цена за вывод — GPT-6.1 Sol $10.00 против DeepSeek V4 Pro $1.98, с переходом к $1.32 и $3.96 внутри двух четырёхчасовых окон UTC в будние дни

Чтение из кэша — GPT-6.1 Sol $0,10 против DeepSeek V4 Pro $0,022 за миллион; кэш есть у обоих, а дешёвая сторона снова в 4,5 раза дешевле

• Стоимость одной задачи индексации — GPT-6.1 Sol $0.72 против DeepSeek V4 Pro $0.67

• Выходные токены, сгенерированные на индексном наборе — GPT-6.1 Sol 67M против DeepSeek V4 Pro 160M

• Максимальный вывод — 384 000 токенов у DeepSeek V4 Pro против 128 000 токенов у GPT-6.1 Sol

• Модальности — GPT-6.1 Sol поддерживает текст, изображения и файлы; DeepSeek V4 Pro поддерживает только текст

Четвёртая и пятая строки — интересная пара. DeepSeek V4 Pro выдаёт в 2,4 раза больше токенов на одном и том же наборе тестов и всё равно обходится на 7% дешевле в расчёте на задачу, потому что его тариф за выходные токены составляет пятую часть от тарифа GPT-6.1 Sol. Так выглядит модель, ориентированная на цену, когда измеряешь объём вывода, а не тариф: многословность реальна, и она не устраняет преимущество. Окно по времени — это та самая звёздочка. Два четырёхчасовых блока по будням — 40 из 168 часов в неделю — удваивают указанный тариф до $1,32 и $3,96, и эта надбавка применяется к тем же токенам, которые в противном случае были бы самыми дешёвыми на любой из карт.

Чего не делает более дешёвая модель

Три вещи, и каждая из них — жёсткий предел, а не компромисс.

Он не видит. DeepSeek V4 Pro работает только с текстом: текст на входе, текст на выходе. Никаких скриншотов, никаких отсканированных PDF-файлов, никакого чтения графиков, никаких диаграмм в тикете. Сценарии использования компьютера и рабочие процессы с интенсивной работой с документами — именно те рабочие нагрузки, под которые позиционируется GPT-6.1 Sol, — недоступны ни за какие деньги. Если ваш конвейер уже направляет изображения в модель компьютерного зрения, это не проблема; если нет — это решающее ограничение.

У неё нет такого графика выпусков, под который можно было бы планировать. Название «deepseek-v4-pro» с августа указывает на сборку 0813, и путь к этому не был тихим: поставщик объявил о выводе этой сборки из эксплуатации на 14 сентября, отозвал анонс за два дня до этой даты и продолжил обслуживать API с неизменной тарификацией. В нашем собственном каталоге она по-прежнему значится флагманом с тем же контекстом, потолком вывода и лимитом параллелизма. Поставщик, способный за два дня отозвать уведомление о прекращении поддержки, может также и не делать этого; операционный вывод не в том, что модель нестабильна, а в том, что имя — это указатель, и привязка поведения к идентификатору сборки, а не к названию маршрута, — это дешёвая страховка.

Это не несёт с собой сопутствующих знаний. GPT-6.1 Sol существует восемь дней, и у него уже опубликована одна независимая конфигурация; у DeepSeek V4 Pro более длинная история оценок и гораздо более широкая база практиков, включая опубликованный стек обслуживания и сторонние работы по пропускной способности. Для развёртывания на собственном сервере этот массив материалов ценнее, чем строка индекса, потому что именно к нему обращаешься, когда модель ведёт себя странно на твоём оборудовании, а не на бенчмарке.

Когда счётчик, который в четыре раза дешевле, — это не тот счётчик

Если бы дешёвая модель была просто хуже во всём, эта статья была бы короткой. Неудобный факт заключается в том, что эти две различаются на 7% на задачу при одинаковой работе и в 2,4 раза — по тому, сколько они пишут, чтобы добиться результата. Это значит, что метрика смешанных токенов — та, что показывает 4×, — измеряет разницу, которую вы по большей части не оплачиваете, потому что она оценивает смесь токенов, которую вы, возможно, никогда не отправляете. А индексная метрика — та, что показывает 16 пунктов, — измеряет по двум группам сопоставимых моделей, и её нельзя вычитать.

Итак, практическое разделение — это не «фронтирная модель для сложной работы, дешёвая модель для простой». Это разделение по модальности и по объёму. Всё, что содержит изображение, отправляется в GPT-6.1 Sol; туда же идёт всё, где ответ короткий, а рассуждение — дорогая часть. Его пять уровней усилий — от low до max, где medium используется по умолчанию, — позволяют покупать рассуждения, а не текст, а кэшированный ввод по цене $0.10 делает длинный повторяющийся промпт дешёвым. Всё сугубо текстовое, высокообъёмное и допускающее более длинный ответ — классификация, извлечение, суммаризация, массовая генерация в рамках бюджета вывода в 384 000 токенов — отправляется в DeepSeek V4 Pro, в идеале — вне двух UTC-окон.

И то и другое на одной клавише, а разделение — это строка конфигурации.

Обе модели доступны на OrcaRouter по собственным опубликованным тарифам их провайдеров, без наценки: GPT-6.1 Sol — $2.00 / $10.00, с переходом на $4.00 / $15.00 при превышении 272 000 токенов промпта, и DeepSeek V4 Pro — $0.66 / $1.98, с двумя временными окнами, действующими так, как указано. Один ключ, один счёт, одна совместимая с OpenAI конечная точка для обеих.

Именно поэтому описанное выше разделение стоит записать, а не спорить о нём. Разделение по модальностям можно выразить в виде правила маршрутизации, так что запросы с изображениями идут в модель компьютерного зрения, а основная масса текста — в дешёвую модель, без изменений в приложении; если маршрут деградирует, аварийное переключение перенаправит вызов, а не завершит его сбоем. А поскольку обе модели находятся на одном эндпоинте, сравнение цен, которое действительно имеет значение — ваше, на вашем трафике, при вашем соотношении токенов, — можно построить по вашим собственным счетам, а не по среднему значению из набора бенчмарков.

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

Вердикт, если в одну строку, таков: трактовке «в четыре раза дешевле» доверять не стоит, а трактовку «семь процентов» нужно проверять. Четырёхкратная разница — это то, что смешанный счётчик говорит о такой смеси токенов, которую вы можете и не отправлять. Семь процентов — это то, во сколько та же оценка обошлась в обоих случаях, и в неё уже заложена 2,4-кратная разница в многословности. Шестнадцать пунктов реальны, но они также получены по двум разным группам сравнения, а ограничение, которое фактически определяет большинство вариантов развёртывания этой пары, вообще не является числом: одна из этих моделей умеет читать скриншот, а другая — нет.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно