
Бенчмарки DeepSeek V4 Pro: полная таблица результатов 0813, все независимые проверки и то, что ещё никто не проверил
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
Краткий ответ: DeepSeek V4 Pro демонстрирует действительно сильные агентные показатели по собственным данным DeepSeek — Terminal-Bench 2.1 на уровне 87,9, DeepSWE на уровне 62,7, CyberGym на уровне 83,3 — но почти все ключевые цифры предоставлены самим разработчиком, и независимая картина выглядит скромнее. Artificial Analysis оценивает официальную сборку 0813 в 53 балла по своему Индексу интеллекта — на одном уровне с GLM-5.2, на четыре балла ниже GPT-5.6 Terra и на семь ниже Kimi K3; Vals AI ставит её на 12-е место, ниже GPT-5.5 предыдущего поколения. Эта статья — единственная полная сводка: полная таблица результатов 0813, расширенный набор задач по кодингу из технического отчёта, все существующие независимые проверки и честный перечень того, какие цифры были воспроизведены, а какие существуют только на словах DeepSeek.
Официальная карта результатов 0813 — собственные показатели DeepSeek, все они.
Официальное объявление DeepSeek (документация API, news260813, 13 августа 2026 года) сообщает о производственной сборке по сравнению с апрельской предварительной версией. Все цифры в этом разделе предоставлены вендором — ни одна из них не была независимо воспроизведена по состоянию на 16 августа 2026 года:
• Terminal-Bench 2.1 — 87.9 (превью: 72.1).
• DeepSWE — 62.7 (превью: 12.8) — примерно пятикратный скачок, который является самым поразительным утверждением на карточке.
• CyberGym — 83.3 (превью: 52.7).
• Humanity's Last Exam — 42.7 без инструментов, 60.0 с инструментами (предварительно: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (превью: 55.9).
• AutomationBench (публичный) — 31.8 (предпросмотр: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (превью: 41.8 / 31.1).
• NL2Repo — 61.5 (предпросмотр: 38.5).
• Последний экзамен агентов — 25.7 (превью: 16.5).
Закономерность, на которую стоит обратить внимание, — в том, где сосредоточены улучшения: в бенчмарках для агентных систем и кибербезопасности. Это ровно та сводка результатов, которую лаборатория публикует, когда хочет разрекламировать агентную модель, — и ровно та, которая требует нейтрального повторного прогона, прежде чем вы потратите на неё производственные деньги.

Расширенный набор кодировок из технического отчета DeepSeek
Помимо агентной карточки, технический отчёт DeepSeek (в агрегации BenchLM от 16 августа 2026 года) добавляет более широкий набор для кодинга и длинного контекста. Также предоставлено вендором и помечено BenchLM как «Provider exact» — без независимого тестирования:
• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% — лучший проверенный в каталоге BenchLM.
• Рейтинг Codeforces — 3206 — также лучший из подтверждённых в каталоге.
• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — оба показателя — лучшие в каталоге по поиску на 1M токенов, что важно для модели, заявляющей контекстное окно в 1M токенов.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (указаны на странице модели OrcaRouter).
Что на самом деле измеряют независимые оценщики
Три независимых источника прогнали DeepSeek V4 Pro, и их вердикты группируются ниже карточки производителя:
• Artificial Analysis Intelligence Index — 53 (по данным SCMP, август 2026; на странице модели OrcaRouter указано 53.2, 20-е место из 132). На уровне GLM-5.2, на четыре балла отстаёт от GPT-5.6 Terra, на семь — от Kimi K3.
• Artificial Analysis Coding — 68.8, занимает 24-е место из 130 (по данным страницы модели OrcaRouter).
• Vals AI Index — 12-е место, отставая от GPT-5.5 предыдущего поколения и значительно уступая Kimi K3 и Claude Opus 5 (SCMP). Собственное тестирование Vals AI выявило два конкретных слабых места: выполнение задач в изолированной среде терминала и создание сложных финансовых моделей в таблицах Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, единственный независимый запуск «Benchmark exact» в наборе).
Честный реестр — что воспроизведено, а что пока лишь слово DeepSeek
Это раздел, ради которого существует статья о бенчмарках, и причина добавить эту страницу в закладки, а не репортаж о запуске. Распределите каждый результат по одной из двух категорий:
• Независимый источник: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI — 12-е место, Vibe Code Bench 49.93 — а также отдельно полученный прогон Terminal-Bench 2.1 с результатом 78.7, который соседствует с 87.9 от DeepSeek на странице модели OrcaRouter. Этот разрыв в девять пунктов между показателем вендора и независимым прогоном — самый важный показатель на этой странице: это количественно выраженный разрыв воспроизводимости.
• Только по данным вендора, независимо не воспроизведено: каждый показатель в официальной карточке 0813 выше (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) и весь расширенный набор задач по программированию (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). В документации самого DeepSeek показатель Terminal-Bench 2.1 помечен как «прогон провайдера».
При таком прочтении история выглядит связной: DeepSeek V4 Pro — реальная модель среднего уровня среди передовых — AA 53, занимающая места с тринадцатого по двадцатое, — с вендорской картой показателей, которая заявляет о почти максимальной производительности в агентных задачах и написании кода. Оба утверждения верны и не противоречат друг другу: одно измерено, другое заявлено.

Сколько стоит скоркард
DeepSeek V4 Pro — это флагманская MoE-модель с общим объемом 1.6T и 49B активных параметров, контекстным окном на 1M токенов и максимальной выдачей 384K. На OrcaRouter она предлагается по прейскурантной цене DeepSeek без наценки: $0.435 за миллион входных токенов и $0.87 за миллион выходных (чтение кэша — $0.060 за миллион), согласно каталогу, проверенному 15 августа 2026 года и подтвержденному на актуальной странице модели. При такой цене математика «цена за балл» — самый веский аргумент в пользу модели: это примерно десятая часть цены за выходные токены у моделей, набирающих близкие баллы в независимом рейтинге, так что вы платите по среднеуровневым ценам за показатели, которые, если заявления вендора подтвердятся, находятся почти на вершине. Один нюанс: DeepSeek анонсировала график пиковых и внепиковых цен (вне пика — 50% от пиковой) с 17 августа по пекинскому времени, так что тариф может измениться — указанные цифры являются актуальной прейскурантной ценой на момент публикации.

Когда эта рекомендация ошибочна
Честные случаи, когда DeepSeek V4 Pro не стоит выбирать:
• Вам нужно независимо подтверждённое передовое рассуждение.AA Index 53 находится в середине таблицы — Kimi K3 (60) и GPT-5.6 Terra (57) впереди и подтверждены. Если ваше решение зависит от измеренного потолка, карточка вендора этого не меняет.
• Вы ставите продакшн на DeepSWE 62.7 до того, как кто-то перезапустит его. Скачок с 12.8 до 62.7 за один релиз — это утверждение, а не факт. Дождитесь нейтрального воспроизведения — разрыв 87.9 против 78.7 в Terminal-Bench показывает, что можно обнаружить.
• Ваша рабочая нагрузка — это автоматизация терминала в песочнице или финансовое моделирование в Excel. Vals AI говорит, что именно здесь модель испытывает трудности, независимо от оценки вендора.
• Вы принимаете решение по кибербезопасности на основе CyberGym 83.3. Это DeepSeek, тестирующий собственную модель на собственном бенчмарке — вендор безопасности, который покупается на эту цифру, покупает неаудированные данные.
Суть
DeepSeek V4 Pro 0813 — это настоящая модель переднего края, чья вендорская карточка показателей превосходит её независимые результаты. Релиз 0813 превратил текстовое превью в серьёзного агентного конкурента — об этом релизе мы рассказывали отдельно, — и если вы хотите оценить его сегодня, это один ключ, совместимый с OpenAI, на OrcaRouter по цене из прайс-листа DeepSeek, с автоматическим переключением, если провайдер застопорится. Просто читайте карточку так, как она разбита в этой статье: независимые проверки (AA 53, Vals 12th, прогон 78.7 на Terminal-Bench) — это то, чему можно доверять сегодня; значения 87.9 и 62.7 — это то, что стоит проверить, прежде чем строить на них что-либо. Покупайте из-за соотношения цены и производительности и контекста в 1M токенов, а не из-за невоспроизводимых громких цифр.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
