Заголовок для сравнения DeepSeek V4 Pro и Qwen3.8 Max, подзаголовок «Специалист по рассуждениям против китайского универсала».
Guides & Insights

DeepSeek V4 Pro против Qwen3.8 Max: специалист по логическим рассуждениям против китайского универсала

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

С интервалом в десять дней в Китае появились две самые примечательные модели: Alibaba выпустила Qwen3.8 Max 3 августа 2026 года — флагман с разреженной архитектурой MoE на 2,4 триллиона параметров, который она позиционирует как универсальное решение для агентов, офисной работы и мультимодального понимания, — а D​eepSeek выпустила официальную версию DeepSeek V4 Pro 12 августа, свою специализированную модель для рассуждений и кода с 1,6 триллиона параметров и ценой на выходные токены примерно в семь раз ниже, чем у Q​wen. Обе модели нацелены на одни и те же кошельки разработчиков, но расходятся во мнениях о том, для чего нужна флагманская модель. Qwen3.8 Max хочет быть единственной моделью, через которую вы пропускаете все; DeepSeek V4 Pro хочет быть той, которой вы поручаете самые сложные задачи.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

Основные выводы

Qwen3.8 Max — это модель с более высокой сырой производительностью в китайских общих рейтингах (SuperCLUE #1, июль) и более сильный мультимодальный/корпоративный пакет — видеовход, встроенные инструменты, структурированный вывод, всё в одном API.

• DeepSeek V4 Pro значительно дешевле (~7× на выходе), уже имеет открытые веса и теперь претендует на более высокие показатели в кодинге/агентных задачах — Terminal-Bench 2.1: 87.9 против 86.6, заявленных вендором Q​wen.

• Обратите внимание на издержки многословия: независимые прогоны показывают, что Qwen3.8 Max в среднем требует ~64 шагов и ~$1.14 на агентную задачу — это проблема фактической стоимости, которую спецификация скрывает.

Честный заголовок: Qwen3.8 Max — это флагман «войны возможностей», который соответствует ценам закрытых моделей из США; DeepSeek V4 Pro — это контраргумент по соотношению цены и производительности.

Две философии в одной таблице спецификаций

• Всего параметров — Qwen3.8 Max 2.4T (разреженная MoE, ~95B активных) против DeepSeek V4 Pro 1.6T (MoE, ~49B активных)

• Контекст / максимальный вывод — у обоих контекст 1M; Q​wen достигает максимума примерно 128–131K вывода против 384K у D​eepSeek

• Входные данные — Q​wen принимает текст, изображения и видео; DeepSeek V4 Pro принимает текст и изображения, с новым нативным рассуждением по изображениям в официальной сборке

• Открытые веса — DeepSeek V4 Pro: выпущен (MIT); Qwen3.8 Max: обещан на неделю 10 августа, первый Max-class Q​wen, когда-либо открытый.

• Дополнительные возможности API — Q​wen из коробки включает встроенные инструменты и структурированный вывод; DeepSeek V4 Pro предлагает переключатели режима рассуждений, структурированный JSON, Responses API и совместимость с Codex.

• Цена — Qwen3.8 Max $2.00 / $6.00 за миллион токенов ($0.25 кэш) против DeepSeek V4 Pro ~$0.42 / $0.87 ($0.0035 кэш)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Где Qwen3.8 Max побеждает

По оси общего интеллекта Qwen3.8 Max впереди, и независимые данные это подтверждают. Artificial Analysis оценивает его Индекс интеллекта в 58, Индекс программирования в 71.8 и Индекс агентности в 58 — это самый высокий результат, которого какая-либо китайская лаборатория достигала в верхней части рейтинга агентных моделей. В июльском рейтинге SuperCLUE для китайского языка он занимает 1-е место с результатом 71.48, тогда как DeepSeek-V4-Pro занимает 5-е место с 64.4. Демонстрации Alibaba при запуске — 16-дневный автономный цикл программирования и воспроизведение научной работы, которое превзошло результат AIME24 из оригинальной статьи — являются самым убедительным доказательством во всём цикле релиза, что это действительно способный агент для долгосрочных задач.

Для разработчика практические преимущества заключаются в интеграционных возможностях: приём видео, встроенный вызов инструментов, структурированный вывод без настройки и экосистема (Model Studio, инструментарий Q​wen), которую D​eepSeek не пытается повторить. Если рабочая нагрузка документо-ориентирована, мультимодальна или требует корпоративной интеграции, Qwen3.8 Max — это модель, к которой китайский рынок сейчас обращается по умолчанию.

Где DeepSeek V4 Pro выигрывает

Что касается кодирования и стоимости, официальный V4 Pro — это контраргумент. D​eepSeek сообщает, что официальная сборка набирает 87,9 на Terminal-Bench 2.1 (против 72,1 у предварительной версии) и 62,7 на DeepSWE — тогда как Q​wen заявляет о 86,6 на Terminal-Bench. Предварительная версия уже показывала 80,6 на SWE-bench Verified, 90,1 на GPQA Diamond и 93,5 на LiveCodeBench — результат №1 среди открытых моделей в соревновательном программировании, а изменения в официальной сборке сосредоточены именно на агентных и рассуждающих задачах, где эти показатели и живут.

Теперь о цене. При $0.42/$0.87 за миллион токенов DeepSeek V4 Pro примерно в 4.8 раза дешевле на входе и в 6.9 раза дешевле на выходе, чем у Qwen3.8 Max ($2/$6). Компания D​eepSeek также 6 августа предупредила о грядущем повышении цен, что делает сегодняшний тариф окном, а не обещанием — подробнее ниже.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

Выполните математические расчеты для реальной агентной задачи.

Независимые агентные запуски — это то, где ценник Qwen перестаёт быть реальной ценой. В агентных задачах Artificial Analysis Qwen3.8 Max в среднем выполнял ~64 шага на задачу и стоил ~$1.14 за задачу, против ~$0.53 у предыдущего поколения — модель многословна и много планирует. Запустите ту же структуру задачи на DeepSeek V4 Pro по цене $0.87 за миллион выходных токенов, и стоимость за задачу окажется примерно на порядок ниже. Если ваш продукт — это цикл, который вызывает модель сто раз в день на пользователя, эта разница и есть ваша маржа.

Оговорки о надежности с обеих сторон

Честность в отношении источников здесь обоюдоостра. Независимое тестирование выявило рост уровня галлюцинаций у Qwen3.8 Max с 23% до 40% и снижение показателя AA-Omniscience на десять пунктов — модель стала более способной, но менее заслуживающей доверия в одном и том же релизе. Предварительная версия D​eepSeek продемонстрировала задокументированный 94% показатель «всегда отвечает» в AA-Omniscience, что означает, что она склонна давать ответ независимо от того, знает ли она его. Оба сигнала важны для продакшена; ни один из них не является дисквалифицирующим для рабочих нагрузок, на которые нацелены эти модели.

Почему сроки выпуска открытых весов меняют расчёт цены

Релиз Qwen3.8 Max с открытыми весами, когда он выйдет, изменит экономику этого противостояния в течение недели: пользователи самохостинга получат флагманскую модель на 2,4 трлн параметров, и давление на цены API станет реальным. Это именно тот сценарий, при котором pass-through-ценообразование не даёт вам лукавить. OrcaRouter передаёт официальную цену провайдера без наценки, поэтому как только Alibaba или DeepSeek меняет цену — вверх или вниз — изменение в тот же день вступает в силу на одном ключе, без пересмотра условий и без второго контракта, который нужно читать. Вы маршрутизируете запросы к той из моделей (Qwen3.8 Max или DeepSeek V4 Pro), которую предпочитает ваш текущий eval, и цена остаётся такой, какую фактически устанавливает вендор.

Какой из них для вашего выбора конструктора API?

Выбирайте Qwen3.8 Max, когда задача требует всего спектра — мультимодальный ввод, структурированный вывод, встроенные инструменты, качество китайского языка на вершине текущих рейтингов — и ваша модель затрат допускает многословные агентные прогоны. Выбирайте DeepSeek V4 Pro, когда задача требует интенсивных рассуждений или кода, объём токенов велик, открытые веса важны для соответствия требованиям или самостоятельного хостинга, или когда бюджет является ограничивающим фактором. Наиболее чистое прочтение этого противостояния — то, о котором сигнализируют сами компании: Qwen3.8 Max — это флагман, с которым вы сверяете всё, а DeepSeek V4 Pro — тот, кто делает бенчмарк дорогим.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube