Титульная карточка статьи «DeepSeek V4 Pro Benchmarks»: табло с крупным индикатором, заголовок «DeepSeek V4 Pro — оценочная карта бенчмарков», подзаголовок «Официальные результаты 0813, независимые проверки и то, что пока не воспроизведено», и чипы с надписями «TERMINAL-BENCH 2.1: 87.9», «DEEPSWE: 62.7», «AA INDEX: 53», «1M CONTEXT». Логотип OrcaRouter в правом нижнем углу.
Guides & Insights

Бенчмарки DeepSeek V4 Pro: полная таблица результатов 0813, все независимые проверки и то, что ещё никто не проверил

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Краткий ответ: DeepSeek V4 Pro демонстрирует действительно сильные агентные показатели по собственным данным Deep​Seek — Terminal-Bench 2.1: 87.9, DeepSWE: 62.7, CyberGym: 83.3 — но почти все ключевые цифры сообщены самим вендором, и независимая картина выглядит скромнее. Artificial Analysis ставит официальную сборку 0813 на 53 балла в своём индексе интеллекта, вровень с GLM 5.2, на четыре балла позади GPT-5.6 Terra и на семь — позади Kimi K3; Vals AI ранжирует её на 12-е место, ниже предыдущего поколения GPT-5.5. Эта статья — полная сводка, которую никто ещё не составлял: полная карточка сборки 0813, расширенный набор задач по кодингу из технического отчёта, все существующие независимые проверки и честный перечень того, какие цифры воспроизведены, а какие остаются лишь словом Deep​Seek. Через неделю после выхода карточки начала проясняться и картина с обслуживанием: 19 августа 2026 года LMSYS и Ant Group опубликовали стек обслуживания H20, достигающий 271 выходного токена в секунду при размере батча 1. Ему посвящён отдельный раздел ниже, и он, как и всё со стороны вендора на этой странице, помечен как самозаявленный, пока кто-нибудь его не воспроизведёт.

Официальная таблица результатов 0813 — собственные цифры Deep​Seek, все до одной.

Deep​Seek's official announcement (API docs, news260813, August 13, 2026) reports the production build against the April preview. Every figure in this section is vendor-reported — none has been independently reproduced as of August 16, 2026:

• Terminal-Bench 2.1 — 87.9 (превью: 72.1).

• DeepSWE — 62.7 (превью: 12.8) — примерно пятикратный скачок, который является самым поразительным утверждением на карточке.

• CyberGym — 83.3 (превью: 52.7).

• Humanity's Last Exam — 42.7 без инструментов, 60.0 с инструментами (предварительно: 37.7 / 48.2).

• Toolathlon-Verified — 74.1 (превью: 55.9).

• AutomationBench (публичный) — 31.8 (предпросмотр: 12.8).

• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (превью: 41.8 / 31.1).

• NL2Repo — 61.5 (предпросмотр: 38.5).

• Последний экзамен агентов — 25.7 (превью: 16.5).

Закономерность, на которую стоит обратить внимание, — в том, где сосредоточены улучшения: в бенчмарках для агентных систем и кибербезопасности. Это ровно та сводка результатов, которую лаборатория публикует, когда хочет разрекламировать агентную модель, — и ровно та, которая требует нейтрального повторного прогона, прежде чем вы потратите на неё производственные деньги.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

Расширенный набор кодировок из технического отчёта DeepSeek

Помимо агентной карточки, технический отчёт Deep​Seek (в агрегации BenchLM от 16 августа 2026 года) добавляет более широкий набор по программированию и длинному контексту. Также предоставлено вендором и помечено BenchLM как «Provider exact» — без независимого тестирования:

• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.

• LiveCodeBench Pass@1-CoT — 93.5% — лучший проверенный в каталоге BenchLM.

• Рейтинг Codeforces — 3206 — также лучший из подтверждённых в каталоге.

• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.

• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — оба показателя — лучшие в каталоге по поиску на 1M токенов, что важно для модели, заявляющей контекстное окно в 1M токенов.

• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (указаны на странице модели OrcaRouter).

Что на самом деле измеряют независимые оценщики

Три независимых источника прогнали DeepSeek V4 Pro, и их вердикты группируются ниже карточки производителя:

• Artificial Analysis Intelligence Index — 53 (по данным SCMP, август 2026 года; на странице модели OrcaRouter указано 53.2 — 20-е место из 132). На уровне GLM 5.2, на четыре балла ниже GPT-5.6 Terra, на семь — Kimi K3.

• Artificial Analysis Coding — 68.8, занимает 24-е место из 130 (по данным страницы модели OrcaRouter).

• Vals AI Index — 12-е место, отставая от GPT-5.5 предыдущего поколения и значительно уступая Kimi K3 и Claude Opus 5 (SCMP). Собственное тестирование Vals AI выявило два конкретных слабых места: выполнение задач в изолированной среде терминала и создание сложных финансовых моделей в таблицах Excel.

• Vibe Code Bench v1.1 — 49.93 (Vals AI, единственный независимый запуск «Benchmark exact» в наборе).

Честный реестр — что воспроизведено, а что всё ещё просто слова Deep​Seek.

Это раздел, ради которого существует статья о бенчмарках, и причина добавить эту страницу в закладки, а не репортаж о запуске. Распределите каждый результат по одной из двух категорий:

• Из независимых источников: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI — 12-е место, Vibe Code Bench 49.93 — и отдельно полученный прогон Terminal-Bench 2.1 с результатом 78.7, который находится рядом с 87.9 от Deep​Seek на странице модели OrcaRouter. Этот разрыв в девять пунктов между числом производителя и независимым прогоном — самый важный показатель на этой странице: это количественно выраженный разрыв воспроизводимости.

• Только по данным вендора, не воспроизведено независимо:все показатели в официальной карточке 0813, приведённой выше (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7), и весь расширенный набор задач по кодингу (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Собственная документация Deep​Seek называет показатель Terminal-Bench 2.1 «прогоном провайдера».

При таком прочтении история выглядит связной: DeepSeek V4 Pro — реальная модель среднего уровня среди передовых — AA 53, занимающая места с тринадцатого по двадцатое, — с вендорской картой показателей, которая заявляет о почти максимальной производительности в агентных задачах и написании кода. Оба утверждения верны и не противоречат друг другу: одно измерено, другое заявлено.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Сколько стоит скоркард

DeepSeek V4 Pro — это флагманская MoE-модель с общим объёмом 1,6 трлн параметров, из которых 49 млрд активны, окном контекста в 1 млн токенов и максимальной выдачей в 384 тыс. токенов. На OrcaRouter она предлагается по прейскурантной цене Deep​Seek без наценки: $0,435 за миллион входных токенов и $0,87 за миллион выходных (чтение из кэша — $0,060 за миллион); цифры взяты из каталога, проверенного 15 августа 2026 года, и подтверждены на актуальной странице модели. При такой цене расчёт цены за балл — самый сильный аргумент в пользу модели: она стоит примерно десятую часть от цены выходных токенов моделей, набравших близкие баллы в независимом индексе, так что вы платите по ценам среднего уровня за результат, который, если верить заявлениям вендора, близок к топовым. Один нюанс: Deep​Seek анонсировал пиковый и внепиковый тарифы (вне пика — 50% от пикового), вступающие в силу 17 августа по пекинскому времени, так что цена может измениться — приведённые цифры соответствуют актуальной прейскурантной цене на момент написания статьи.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Обслуживание DeepSeek V4 Pro: 271 выходных токенов/с на H20

Бенчмарки оценивают, что знает модель; показатели обслуживания оценивают, насколько дёшево можно заставить её думать. 19 августа 2026 года LMSYS — организация, стоящая за Chatbot Arena — и команда открытого кода Ant Group опубликовали первую серьёзную работу по обслуживанию сборки 0813: «стек обслуживания для конкретных сценариев», построенный на SGLang, движке с открытым исходным кодом, который поддерживает LMSYS. Ключевой показатель — 271 выходной токен/с при размере пакета 1 на NVIDIA H20, что команда оценивает как 1.42× от B300 — достигнуто на чипе, у которого нет нативных FP4 Tensor Cores. Это собственные измерения LMSYS и Ant Group, объявленные в их блоге и в X; ни одно из них не было независимо воспроизведено.

Остальные цифры стека, все из которых были самостоятельно сообщены LMSYS и Ant Group по своему собственному стеку:

• Задержка декодированиякомпонент «оптимизированный DSpark» сокращает время на один выходной токен (TPOT) на 74.8–78.0% при размере пакета 1.

• Prefill — префилл на 1 миллион токенов завершается за 43,7 секунды; среднегеометрический прирост пропускной способности префилла — 36,5%.

• KV-кэш — схема, которую команда называет «Humming MXFP4AFP8 + Online C128», расширяет ёмкость полного токенового KV-кэша в 10,14 раза — рычаг, обеспечивающий практичность агентных рабочих нагрузок с 1 млн токенов на этом классе чипов.

• Декодирование на GPU — при контексте 4K пропускная способность декодирования на GPU возрастает с 319,9 до 703,2 токенов/с/GPU, что даёт улучшение в 2,20 раза.

Прежде чем планировать размер парка на его основе, прочитайте оговорки. Размер батча 1 — это однопоточный режим (то, с чем сталкивается интерактивный агент или чат, а не высококонкурентный API), а коэффициент 1,42× относительно B300 LMSYS приводит, не публикуя абсолютных токенов/с для B300, так что разрыв заявлен, но не поддаётся проверке. Результат также измеряет стек, а не чип: эти выигрыши достигаются за счёт оптимизации на уровне SGLang на оборудовании, которое в противном случае выглядело бы недостаточно мощным для MoE с суммарным объёмом 1,6 трлн параметров. Для контекста: живая страница моделей OrcaRouter фиксирует DeepSeek V4 Pro через общий API-эндпоинт на уровне 80,8 выходных токенов/с; показатель H20 — это результат однопоточного бенчмарка на выделенном стеке, другое число с другим смыслом.

Если ваша рабочая нагрузка обслуживается через API, это никак не меняет способ вызова модели: DeepSeek V4 Pro — это один ключ, совместимый с OpenAI, на OrcaRouter по цене из прайс-листа DeepSeek, с автоматическим переключением, если провайдер зависнет. Показатели H20 наиболее важны, если вы команда, которая взвешивает собственный парк H20 против оплаты API, — разрыв, который закрывает работа LMSYS и Ant Group, — это решение о закупке оборудования, а не о выборе модели.

Когда эта рекомендация неверна

Честные случаи, когда DeepSeek V4 Pro не стоит выбирать:

• Вам нужно независимо подтверждённое передовое рассуждение.AA Index 53 находится в середине таблицы — Kimi K3 (60) и GPT-5.6 Terra (57) впереди и подтверждены. Если ваше решение зависит от измеренного потолка, карточка вендора этого не меняет.

• Вы ставите продакшн на DeepSWE 62.7 до того, как кто-то перезапустит его. Скачок с 12.8 до 62.7 за один релиз — это утверждение, а не факт. Дождитесь нейтрального воспроизведения — разрыв 87.9 против 78.7 в Terminal-Bench показывает, что можно обнаружить.

• Ваша рабочая нагрузка — это автоматизация терминала в песочнице или финансовое моделирование в Excel. Vals AI говорит, что именно здесь модель испытывает трудности, независимо от оценки вендора.

• Вы принимаете решение по кибербезопасности на основе CyberGym 83.3. Это Deep​Seek тестирует собственную модель на собственном бенчмарке — вендор безопасности, покупающийся на эту цифру, покупает непроверенные данные.

• Вы покупаете H20s, ориентируясь исключительно на показатель 271 токен/с. Эта цифра — одностековый, самостоятельно заявленный бенчмарк при размере батча 1 — многообещающая, но невоспроизведённая, и лишь одна точка на кривой стоимости, которая также учитывает утилизацию, энергопотребление и тот стек обслуживания, который вы реально будете запускать.

Итог

DeepSeek V4 Pro 0813 — это настоящая фронтирная модель с вендорской картой показателей, которая опережает независимые результаты этой модели. Релиз 0813 превратил текстовое превью в серьёзного агентного конкурента — мы уже отдельно рассказывали о самом релизе, — и если вы хотите оценить его сегодня, это один OpenAI-совместимый ключ на OrcaRouter по цене из прайс-листа Deep​Seek, с автоматическим переключением, если провайдер застопорится. Просто читайте карту показателей так, как эта статья её разделяет: независимые проверки (AA 53, Vals 12th, прогон Terminal-Bench на 78.7) — это то, чему можно доверять сегодня; значения 87.9 и 62.7 — то, что стоит проверить, прежде чем строить на них. Та же дисциплина теперь распространяется и на обслуживание: 271 выходной токен/с на H20 от LMSYS и Ant Group — это лучшая картина пропускной способности, которая у нас есть, и это всё ещё их слово, пока нейтральный прогон не подтвердит её. Покупайте его за соотношение цены и производительности и контекст на 1M токенов, а не за невоспроизведённые громкие цифры.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube