Титульная карточка главного материала: DeepSeek V4.1 Flash Benchmarks — что 74,2 доказывает и чего не доказывает, дата выпуска — 2026-09-10, с пометкой: «шесть дней независимых результатов».
Guides & Insights

Бенчмарки DeepSeek V4.1 Flash: что 74.2 доказывает, а что не доказывает

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

DeepSeek V4.1 Flash набрала 74,2 балла в DeepSWE v1.1 — на десятую долю балла выше GPT-6 Astra, на полбалла выше Gemini 3.8 Flash и Claude Opus 5, — и всю неделю эту цифру цитировали как смену караула. Стоит уточнить, чем это на самом деле является. Сама модель не новая — DeepSeek V4.1 Flash стала общедоступной 2026-09-10, шесть дней назад, — так что здесь нет запуска. В этом окне появился слой измерений: первые записи в независимых индексах, первый независимый результат арены, поддержка обслуживания с нулевого дня в трёх стеках и решение вендора снять с эксплуатации собственный флагман в пользу этой модели. Эта страница — обзор того, что действительно было измерено, с указанием источника для каждой цифры и прямым заявлением о том, что пока никто не установил.

Показатель DeepSWE и четыре модели в пределах половины пункта от него

DeepSWE v1.1 — это долгосрочный бенчмарк по программной инженерии от Datacurve: 113 оригинальных задач в 91 репозитории с открытым исходным кодом и на пяти языках программирования, построенный вокруг изменений в нескольких файлах и поведенческой корректности. В собственной карточке модели DeepSeek таблица, приводимая производителем, выглядит так: DeepSeek V4.1 Flash 74.2, Claude Opus 5 74.0, GPT-5.6 Sol 73.0, Kimi K3 67.5, GLM-5.3 66.9, DeepSeek V4-Pro-0813 62.7, DeepSeek V4-Flash 54.4.

Независимая таблица лидеров для того же бенчмарка не воспроизводит этот порядок, и различия здесь важнее главного показателя. Таблица лидеров DeepSWE v1.1 Pass@1 от Datacurve ставит Muse Spark 1.3 (FAIR) на первое место с 75,40, впереди DeepSeek V4.1 Flash с 74,20. Следом: GPT-6 Astra с 74,12 (сверхвысокий) и 74,10 (макс.), Gemini 3.8 Flash с 73,83 (высокий), Claude Opus 5 с 73,65 (макс.).

Итак, 74,2 — это реальная запись в реальной сторонней таблице лидеров, и она занимает второе место, а не первое. Утверждение, распространившееся в день релиза, — что это лучший результат на DeepSWE, — не выдерживает проверки таблицей лидеров, в которой указана эта оценка. Muse Spark 1.3 опережает на 1,2 балла.

А теперь часть, которую пропускают. Четыре передовые модели на этом бенчмарке разнесены менее чем на 0,55 балла: 74,20, 74,12, 73,83, 73,65. Это более узкая полоса, чем шум измерения. Опубликованный разброс от запуска к запуску на DeepSWE составляет порядка 1,4–3,2 балла — в три–шесть раз больше всего разрыва между первой четвёркой. Преимущество в 0,2 балла над GPT-6 Astra — не открытие; это то, как выглядит ничья, если напечатать её с двумя десятичными знаками.

Чувствительность к каркасу — это вторая причина относиться к числу с осторожностью, и здесь доказательства даёт собственная документация вендора. В одних и тех же материалах релиза DeepSeek сообщает результаты DeepSWE для восьми каркасов. Показатель 74,2 был достигнут на mini-SWE. Та же модель набрала 72,6 на DSH Minimal, 70,5 на DSH Standard, 69,8 на Claude Code, 67,6 на DSH PTC, 66,2 на Pi, 65,6 на Codex и 65,5 на OpenCode. Это разброс в 8,7 пункта на одной модели и одном бенчмарке, вызванный исключительно обвязкой, в которую она заключена. Тот, кто сравнивает показатель DeepSeek, полученный на mini-SWE, с показателем конкурента, полученным на другом агентном цикле, сравнивает каркасы, а не модели.

Куда независимый индекс фактически его помещает

Artificial Analysis запускает фиксированный набор тестов при заявленных настройках усилия, что делает его Intelligence Index самым чистым доступным внешним критерием. На странице модели DeepSeek V4.1 Flash, при максимальном усилии рассуждения, индекс равен 40 — #6 из 113 моделей в этом классе, при медиане по классу 18. Закрытые конкуренты располагаются выше: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. Предыдущий флагман самой DeepSeek, V4-Pro-0813, находится ниже — 36.

Сопоставьте две таблицы результатов — и расхождение окажется структурным, а не ошибкой. На выбранном DeepSeek бенчмарке, при правильно подобранном скаффолде, модель идёт вровень с фронтиром. На фиксированном внешнем наборе тестов, усреднённом по рассуждениям, программированию, математике и агентной работе, она отстаёт на одиннадцать баллов от Claude Opus 5 и на один балл от Gemini 3.8 Flash. И то и другое может быть верно. Вендорская таблица — это аргумент; индекс — это среднее.

На главной странице также приведены две цифры, которые важны для решения о маршрутизации и редко попадают в заголовки. DeepSeek V4.1 Flash выдаёт 214,4 выходных токена в секунду при максимальном усилии — быстро. Он также сгенерировал 250 млн выходных токенов, завершая Intelligence Index, против медианы в 140 млн, что Artificial Analysis отмечает как заметную многословность. Многословность — не проблема качества; это счёт. Модель, которая думает на 79% большим числом токенов, чем её аналоги, возвращает часть своего ценового преимущества при каждом длительном вызове рассуждения.

Single-column scoreboard for DeepSeek V4.1 Flash: DeepSWE v1.1 74.2, second behind Muse Spark 1.3; Artificial Analysis Intelligence Index 40 against Claude Opus 5 at 51; ProgramBench 20.3 single model; ProgramBench agent team 30.04% at 8 hours; output speed 214.4 tokens per second; off-peak price $0.15 in and $0.60 out per 1M.

ProgramBench: оценка одной модели и оценка мультиагентной системы — это не одно и то же измерение.

Это число чаще всего можно прочитать неправильно, поэтому его стоит аккуратно отделить.

• Одна модель, стандартная конфигурация — DeepSeek V4.1 Flash набирает 20,3 балла в ProgramBench (Almost@1) согласно собственной карточке модели DeepSeek. Это ниже, чем 23,0 у GPT-5.6 Sol, и значительно ниже 37,0 у Claude Opus 5, и лишь немного выше 19,0 у GLM-5.3 и 17,5 у Kimi K3. Данные заявлены производителем, и они не льстят модели.

• Конфигурация мультиагентной команды — технический отчёт DeepSeek, DeepSeek-V4.1-Flash: раздвигая пределы сжатия KV-кэша, описывает предварительный рецепт Agent Swarm RL, в котором ведущий агент координирует участников команды через общую доску задач. На подмножестве ProgramBench из 172 задач с высокой уверенностью — то есть задач, где эталонное решение проходит с результатом 95% или выше, — мультиагентная конфигурация поднимается с 13,59% при часовом дедлайне до пика в 30,04% за восемь часов, тогда как базовый одноагентный вариант растёт с 12,79% до 20,39%.

30,04 % — это источник утверждения о «30 %», и это не оценка одной модели. Это команда агентов, которой дали восемь часов, измеренная на отфильтрованном подмножестве, в предварительной оценке самого поставщика. Сравнение, к которому это подталкивает — «намного выше одиночного Sol, почти в 2 раза больше Kimi K3», — арифметически корректно относительно 23,0 у Sol и 17,5 у K3, и в то же время это сравнение между мультиагентной конфигурацией и базовыми показателями отдельных моделей на другом наборе задач. В том же отчёте показан эффект на FrontierSWE v2: мультиагентная конфигурация достигает 32,90 % за двадцать часов против 28,20 % у одиночного агента. Разрыв реален, он сужается по мере увеличения срока, а стоимость его получения в токенах немала — в одном практическом отчёте сообщается о более чем 10-кратном расходе токенов и времени выполнения, приближающемся к четырём часам.

Число параметров пока не определено, поэтому считайте любое сравнение размеров предварительным.

В примечаниях к выпуску DeepSeek описывается «MoE с 552 млрд параметров». Это цифра от производителя, и именно её повторяет большинство публикаций. Но это также не весь артефакт.

В собственной карточке модели DeepSeek документируется второй компонент наряду с трансформерным бэкбоном: «Engram conditional memory (196 млрд параметров, с разреженным доступом на основе поиска по токенам)». Сложите эти два — получится 748 млрд. Это та арифметика, которая стоит за трактовкой сообщества, распространившейся на r/LocalLLaMA в течение нескольких часов после релиза, а собственный индекс safetensors в карточке модели перечисляет 763 млрд параметров по всем её типам тензоров. Цифра примерно 510 ГБ в FP8 происходит из той же линии анализа: то, что вы фактически скачиваете и держите в памяти.

Всё сходится: эти числа считают разные вещи. 552B — это вычислительный каркас, то есть параметры, через которые проходит токен. 196B — это таблица поиска, к которой обращаются на определённых слоях и которая возвращает сохранённую информацию, а не вычисляет её. 8B и 16B — значения активаций, которые приводит DeepSeek — это срезы на один токен, активные во время prefill и decode соответственно. Все четыре числа описывают одну и ту же модель.

Ничто из этого не делает сравнение безопасным. Любое утверждение вида «эта модель соответствует фронтирной модели при доле её размера» опирается на заголовок вендора, который исключает пятую часть артефакта. Пока кто-нибудь не опубликует воспроизводимый учёт параметров, аргументы, основанные на размере, должны сопровождаться этой оговоркой непосредственно в тексте.

ARC-AGI: нет результата для этой модели

Для DeepSeek V4.1 Flash нет оценки ARC-AGI-2 или ARC-AGI-1. На странице проверенных результатов ARC Prize нет записи об этой контрольной точке, и в собственной таблице бенчмарков DeepSeek нет строки ARC. Единственный проверенный ARC Prize результат DeepSeek относится к более старой контрольной точке V4 Flash 0731 — 61,4% на ARC-AGI-2 semi-private при максимальном усилии рассуждения и 89,0% на ARC-AGI-1, при $0,04 и $0,02 за задачу соответственно. Это показатели предшественника на другой модели, и ссылаться на них как на результаты V4.1 Flash было бы неправильно. Если ARC-AGI важен для вашей оценки, эта модель в настоящее время не имеет оценки.

Что ещё приземлилось внутри окна

Для читателя, решающего, стоит ли пробовать эту модель, изменились три вещи, и ни одна из них не является собственным релизом самой модели.

• Независимый результат арены.OpenDesign Arena прогнала тринадцать моделей через одинаковые задачи по дизайну — веб-приложения, дашборды, мобильные экраны, лендинги. DeepSeek V4.1 Flash набрала 81,2 из 100 против 82,7 у GPT-6 Astra, при $0,023 за завершённый дизайн против $1,61, и завершила за 5,3 минуты против 11,1. Доля готовых результатов — выходных данных, которые можно использовать без доработки — составила 57,7% против 60% у Astra. Это одно из первых по-настоящему независимых измерений модели, и оно измеряет именно дизайнерский результат, а не общие рассуждения или программирование.

• Поддержка обслуживания Day-0 на трёх стеках. vLLM опубликовал day-0-образ (2026-09-09), проверенный на оборудовании NVIDIA и AMD. SGLang и Miles опубликовали поддержку day-0 для инференса и RL 2026-09-10, включая путь выгрузки Engram на хост, который увеличил ёмкость KV-кэша на 36% на 4x GB300, и оптимизацию bounded-replay, повысившую пропускную способность prefill в 1,56 раза на 8x H200. Cambricon в тот же день объявила об адаптации Day-0 в стеке vLLM. Для модели, чья главная особенность — агрессивное сжатие KV-кэша: четверть объёма HBM предыдущего поколения и восьмая часть его SSD, — возможность работать на стандартных стеках с первого дня и есть разница между лабораторным результатом и чем-то, что можно развернуть.

• Вендор снял с производства собственный флагман. DeepSeek постепенно отказывается от V4-Pro. С 04:00 UTC 14 сентября 2026 года любой запрос с указанием «deepseek-v4-pro» направляется на V4.1 Flash и тарифицируется по ставкам Flash — так будет продолжаться до запуска V4.1 Pro. DeepSeek V4.1 Pro не выпущена — это будущая модель, а перенаправление — временная мера, которая не даёт сломаться закреплённым интеграциям. Также сняты с поддержки: «deepseek-v4-flash» и «deepseek-v4-flash-vision-exp», оба временно перенаправляются на V4.1 Flash для совместимости. Если у вас в продакшене закреплён ID модели, это перенаправление — тот единственный операционный факт на этой странице, который нельзя игнорировать.

Что цена делает с решением

Ценообразование — вот где эта модель перестаёт быть просто историей о бенчмарках. Согласно собственным опубликованным тарифам DeepSeek, действующим с 04:00 UTC 2026-09-10, пиковыми часами считаются 01:00–04:00 и 06:00–10:00 UTC в будние дни, а всё остальное время — внепиковым.

• В непиковые часы, за миллион токенов — $0.003 при попадании в кэш, $0.15 при промахе кэша, $0.60 за вывод.

• Пик, за миллион токенов — $0.006 за попадание в кэш, $0.30 за промах кэша, $1.20 за вывод.

• Кэшированный ввод по сравнению с передовой закрытой моделью — три десятых цента за миллион против примерно пятидесяти центов. Для агента, циклически обрабатывающего один и тот же репозиторий, на этот уровень приходится большая часть токенов.

• Измерено на нашем собственном каталоге — $0.15 за вход и $0.60 за выход за миллион токенов, медианное время до первого токена — 784 мс, 211 токенов в секунду за последние семь дней.

Artificial Analysis указывает для одной и той же модели цену $0.30 за вход и $1.20 за выход при 98% скидке на кэширование и смешанной цене $0.18 за миллион — это пиковый тариф, и эти два показателя представляют собой одну и ту же цену в разные часы суток. Эту разницу стоит усвоить, прежде чем сравнивать поставщиков: модель с двухтарифной шкалой нельзя сравнивать по одной заявленной ставке.

Именно поэтому сквозное ценообразование здесь важнее, чем обычно. OrcaRouter маршрутизирует DeepSeek V4.1 Flash наряду с остальным своим каталогом по 0% наценки — цена из прайс-листа провайдера, без изменений, так что пиковые и внепиковые тарифы DeepSeek приходят на нашу сторону ровно такими, как их публикует DeepSeek, а изменение цены вендором вступает в силу в тот же день. Для модели, ставка которой удваивается на четыре часа каждое утро по будням, платформа, которая сглаживает тарифы, скрывает единственное число, которое вам было нужно.

Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Reasoning, Max Effort), showing an Artificial Analysis Intelligence Index score of 40 at rank 6 of 113, output speed 214.4 tokens per second at rank 4 of 113, $0.30 per million input and $1.20 per million output tokens with a 98% cache discount and $0.27 cost per Intelligence Index task, verbosity of 250M output tokens at rank 37 of 113, a 1M token context window, 552B total and 16B active parameters, and an MIT license.Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model identifier, NEW and FEATURED badges, Vision, Tools, JSON and Reasoning capability tags, a release date of 2026-09-10, a 1M token context window, 384K maximum output, text and image input, $0.15 input and $0.60 output per million tokens, and a p50 time to first token of 784 ms.

То, что никто не установил

Пробел в этой истории — не отсутствующий бенчмарк. Он в том, что не существует достоверного прямого сравнения DeepSeek V4.1 Flash с его названными конкурентами на общем стенде, проведённого кем-то, кто не заинтересован в результате. Каждое число на этой странице — одно из трёх: заявленное вендором, полученное третьей стороной на другой конфигурации или усреднённое по фиксированному набору тестов, который не был предназначен для изолирования именно этого противостояния. Нет ни одного прогона, где DeepSeek V4.1 Flash и GPT-6 Astra оценивались бы на одних и тех же задачах, с одинаковой обвязкой, одинаковым уровнем усилий и с опубликованным разбросом.

Три конкретные вещи изменили бы картину, и ни одной из них сегодня не существует.

• Сравнение DeepSWE с контролируемым скаффолдом. Разброс в 8,7 пункта между собственными скаффолдами DeepSeek больше, чем любой разрыв между четырьмя ведущими моделями в таблице лидеров. Пока передний край не измерен на одном испытательном стенде, порядок в верхней части этой таблицы не имеет значения.

• Независимое воспроизведение результата команды агентов ProgramBench. Показатель 30,04% взят из технического отчёта вендора по отфильтрованному подмножеству из 172 задач, в предварительной конфигурации, со стоимостью токенов, которая не была охарактеризована для продакшен-бюджетов.

• ARC-AGI. Для этого чекпоинта вообще не существует оценки.

Практическое следствие — это более узкое утверждение, чем то, которое поддерживают заголовки. DeepSeek V4.1 Flash измеримо находится в пределах погрешности от передового уровня на одном бенчмарке по долгосрочному программированию, действительно конкурентоспособен на независимых задачах проектирования при примерно 1,4% стоимости и отстаёт примерно на десять пунктов по агрегированному индексу. Этого достаточно, чтобы оправдать его запуск на вашей собственной рабочей нагрузке и позволить вашей оценке решить вопрос. Этого недостаточно, чтобы оправдать переписывание продакшн-таблицы маршрутизации на основании 0,2 пункта — и тот факт, что оба этих утверждения верны, и есть весь вывод.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно