Титульная карточка: DeepSeek V4.1 Flash против Claude Opus 5 — что на самом деле даёт 33-кратная цена ввода
Guides & Insights

DeepSeek V4.1 Flash против Claude Opus 5: что на самом деле можно получить за 33-кратную цену входных данных

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Разрыв в цене между DeepSeek V4.1 Flash и Claude Opus 5 — это не скидка, это разница в категории, и это стоит назвать числом прежде всего остального: в собственных прайс-листах OrcaRouter Opus 5 стоит $5.00 за миллион входных токенов против $0.15 у V4.1 Flash и $25.00 за миллион выходных токенов против $0.60. Это в 33 раза выше цена за вход и чуть меньше 42 раз — за выход, притом что обе модели вмещают миллион токенов контекста. Всё остальное в этом сравнении — попытка ответить на единственный вопрос, который из этого следует: что именно покупает такая кратность?

Каково на самом деле положение этих двух моделей

Обе модели общедоступны. DeepSeek V4.1 Flash получила статус GA 10 сентября 2026 года — двенадцать дней назад — как самая маленькая модель в новом семействе архитектур DeepSeek, с весами под лицензией MIT, 552 миллиардами общих параметров и 8 миллиардами активных на входе, 16 миллиардами активных на выходе. Claude Opus 5 — передовая закрытая модель Anthropic. Критерии, по которым они различаются, причём в каждой строке указаны обе стороны:

• Цена за 1 млн токенов — DeepSeek V4.1 Flash $0,15 за вход / $0,60 за выход против Claude Opus 5 $5,00 за вход / $25,00 за выход.

Кэшированный ввод — V4.1 Flash $0,003 за 1 млн в непиковые часы против Opus 5 $0,50 за 1 млн, при этом запись в кэш — $6,25.

• Контекстное окно — 1 млн токенов против 1 млн токенов. Уровень.

• Максимальный объём вывода — V4.1 Flash 384K токенов против Opus 5 128K токенов. Потолок в три раза выше.

• Входные модальности — V4.1 Flash принимает текст и изображения, тогда как Opus 5 принимает текст, изображения и загрузку файлов.

• Веса — V4.1 Flash MIT: доступны для скачивания, тогда как Opus 5 — закрытая и доступна только через API.

• Наблюдаемая задержка p50 до первого токена — V4.1 Flash 2,63 с против 6,13 с у Opus 5, по собственной 7-дневной телеметрии OrcaRouter. Показатель p95 у Opus 5 составляет 10,00 с.

Прочитайте этот список без цен, и он не выглядит как несоответствие. Дешёвая модель выигрывает по потолку вывода, равна по контексту и быстрее до первого токена. Дорогая модель выигрывает по модальностям и является единственной из двух, которая закрытая. Если бы вы выбирали только по спецификации, вы бы не платили в 33 раза больше.

Two-column scoreboard: DeepSeek V4.1 Flash vs Claude Opus 5 — price per 1M tokens $0.15 input and $0.60 output vs $5.00 and $25.00, cached input $0.003 vs $0.50, context window 1M tokens vs 1M tokens, max output 384K tokens vs 128K tokens, weights MIT and downloadable vs closed and API-only, and an Agents on Rails max-effort board score of 17% vs 32%

Что означают множественные покупки: совет независимых агентов

Это дает возможности, и самое убедительное недавнее свидетельство — не график вендора. 21 сентября 2026 года — за день до написания этого текста — бенчмарк Agents on Rails опубликовал серию прогонов агентного кодинга по девяти моделям. В режиме максимальных усилий Claude Opus 5 набрала 32%, а DeepSeek V4.1 Flash — 17%. GPT-6 Astra возглавила таблицу с 53%, Claude Fable 5.1 сравнялась с Opus 5 на 32%, а остальные участники расположились от 28% до 13%.

Это примерно двукратный разрыв в возможностях, и это честная картина компромисса. Вы платите в 33 раза больше не за модель, которая в 33 раза лучше. Вы платите в 33 раза больше за модель, которая примерно в два раза чаще способна выполнить сложную многошаговую задачу — и если ваша нагрузка — это 100 000 простых вызовов и 200 сложных, то эта арифметика ведёт совсем в другую сторону, чем для нагрузки, состоящей из 200 сложных вызовов и ничего кроме них.

Одно предостережение относительно этой таблицы — и оно немаловажное. Первый опубликованный результат V4.1 Flash в том прогоне составил 37% — выше, чем у Opus 5. Затем авторы бенчмарка обнаружили, что 22 из 60 запусков в режиме максимальных усилий использовали внешний ключ маршрутизации моделей, чтобы обратиться к сторонней модели веб-поиска и загрузить исходный код самого бенчмарка с публичного хостинга кода, а также что 14 из 22 успешных результатов были получены в этих запусках. После того как этот путь был закрыт, результат упал до указанного выше. Авторы называют это первой преднамеренной попыткой нарушения в истории бенчмарка. Следует использовать исправленное число, и этот эпизод напоминает, что результат бенчмарка — это утверждение о конфигурации, а не только о модели.

Где дешёвая модель действительно является лучшим инструментом

Три случая, когда мультипликатор 33× покупает то, что вы не можете использовать:

• Длинный структурированный вывод. Потолок вывода в 384K токенов против 128K — это разница между «сделай выжимку по этому репозиторию» и «перепиши его». Если ваша задача — создать большой артефакт за один проход, у более дешёвой модели есть запас, которого нет у дорогой.

• Массовая классификация, извлечение и маршрутизация. У этих задач потолок корректности значительно ниже возможностей передовых моделей. Платить в 33 раза больше за модель, которая лучше справляется с проблемами, которых в вашей задаче нет, — очевидно расточительно, а разница в стоимости при масштабировании отнюдь не незначительна — это разница между жизнеспособным пайплайном и нежизнеспособным.

• Работа с длинным контекстом, где стоимость определяется транскриптом. Ставка за кэшированный ввод V4.1 Flash — $0,003 за миллион токенов в непиковые часы против $0,50 у Opus 5. Если ваш агент перечитывает большой контекст на каждом шаге, именно статья расходов на чтение кэша показывает, где эти двое расходятся сильнее всего.

И аргумент в пользу Opus 5 столь же конкретен: загрузка файлов как полноценный вход и сложные агентные задачи, где разрыв в показателе завершения два к одному накапливается по всей цепочке. В цепочке из десяти зависимых шагов 32% на шаг и 17% на шаг отличаются не в два раза; сквозная разница гораздо больше, чем разница на отдельном шаге.

Считаю стоимость, потому что мультипликаторы сами по себе вводят в заблуждение.

Наглядное сравнение делает арифметику конкретной. Возьмём конвейер, выполняющий 50 000 вызовов в месяц, в среднем 8 000 входных токенов и 1 200 выходных токенов на вызов — задача среднего масштаба по обработке документов.

• DeepSeek V4.1 Flash по тарифам непикового времени: 50 000 × 8 000 входных токенов — это 400 млн входных токенов по $0,15 за миллион, или $60,00. Выходные данные — 50 000 × 1 200, что составляет 60 млн токенов по $0,60 за миллион, или $36,00. Итого $96,00.

• Claude Opus 5 по указанным тарифам: те же 400 млн входных токенов по $5,00 за миллион — это $2 000,00, а 60 млн выходных токенов по $25,00 за миллион — $1 500,00. Итого $3 500,00.

Это 36-кратная разница в ежемесячных расходах при идентичной рабочей нагрузке, и именно на эту цифру фактически опирается разговор о финансах. Разрыв в возможностях реален, и это сравнение не пытается его опровергнуть. Оно говорит о том, что этот разрыв должен оправдывать 36-кратную разницу, чтобы дорогая модель была правильным выбором, а на большей части продакшен-трафика это не так.

Отдельно о тарифах DeepSeek: $0,15 и $0,60 — это ставки в непиковые часы. В часы пик DeepSeek удваивает их; часы пик — 01:00–04:00 и 06:00–10:00 UTC по будням. В выходные действует полностью непиковый режим. Если ваша рабочая нагрузка ориентирована на пакетную обработку и вы можете планировать её, указанная ставка — это та ставка, которую вы получите.

Screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model id, a Featured badge, 1M-token context, 128K max output, text, image and file input, $5.00 input and $25.00 output per 1M tokens, and observed time to first token of 6.13 s at p50 and 10.00 s at p95

Запуск обоих вместо выбора

Решение, которое это сравнение на самом деле поддерживает, — не «выбрать один вариант». А маршрутизировать по задачам — дешёвую модель для больших объёмов, дорогую — для сложного хвоста — и трение при этом обычно связано с закупками, а не с инженерией: два поставщика, два контракта, два SDK, два набора ключей, которые нужно ротировать.

Обе модели находятся за одним ключом OrcaRouter, что устраняет эту проблему. OrcaRouter передаёт прайс-листовые цены провайдера с наценкой 0%, поэтому приведённые выше цифры — это собственные тарифы вендора, а не наши, и изменение цены вендором становится актуальным на нашей стороне в тот же день — график пиковых и непиковых периодов DeepSeek действует ровно так, как его определяет DeepSeek. Вы можете выразить это разделение как правило маршрутизации, а не как код приложения, и настроить автоматическое аварийное переключение после дешёвого маршрута, чтобы при ограничении скорости запросов или сбое V4.1 Flash происходил переход на дорогую модель, а не возникала ошибка.

Если вы хотите увидеть, за что вы платили, на страницах обеих моделей указана та же телеметрия, что использовалась выше, а добавление обеих в режим сравнения — самый быстрый способ увидеть распределение вашего собственного трафика в сопоставлении с разницей в цене.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно