
DeepSeek V4.1 Flash против Claude Opus 5: что на самом деле можно получить за 33-кратную цену входных данных
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Разрыв в цене между DeepSeek V4.1 Flash и Claude Opus 5 — это не скидка, это разница в категории, и это стоит назвать числом прежде всего остального: в собственных прайс-листах OrcaRouter Opus 5 стоит $5.00 за миллион входных токенов против $0.15 у V4.1 Flash и $25.00 за миллион выходных токенов против $0.60. Это в 33 раза выше цена за вход и чуть меньше 42 раз — за выход, притом что обе модели вмещают миллион токенов контекста. Всё остальное в этом сравнении — попытка ответить на единственный вопрос, который из этого следует: что именно покупает такая кратность?
Каково на самом деле положение этих двух моделей
Обе модели общедоступны. DeepSeek V4.1 Flash получила статус GA 10 сентября 2026 года — двенадцать дней назад — как самая маленькая модель в новом семействе архитектур DeepSeek, с весами под лицензией MIT, 552 миллиардами общих параметров и 8 миллиардами активных на входе, 16 миллиардами активных на выходе. Claude Opus 5 — передовая закрытая модель Anthropic. Критерии, по которым они различаются, причём в каждой строке указаны обе стороны:
• Цена за 1 млн токенов — DeepSeek V4.1 Flash $0,15 за вход / $0,60 за выход против Claude Opus 5 $5,00 за вход / $25,00 за выход.
Кэшированный ввод — V4.1 Flash $0,003 за 1 млн в непиковые часы против Opus 5 $0,50 за 1 млн, при этом запись в кэш — $6,25.
• Контекстное окно — 1 млн токенов против 1 млн токенов. Уровень.
• Максимальный объём вывода — V4.1 Flash 384K токенов против Opus 5 128K токенов. Потолок в три раза выше.
• Входные модальности — V4.1 Flash принимает текст и изображения, тогда как Opus 5 принимает текст, изображения и загрузку файлов.
• Веса — V4.1 Flash MIT: доступны для скачивания, тогда как Opus 5 — закрытая и доступна только через API.
• Наблюдаемая задержка p50 до первого токена — V4.1 Flash 2,63 с против 6,13 с у Opus 5, по собственной 7-дневной телеметрии OrcaRouter. Показатель p95 у Opus 5 составляет 10,00 с.
Прочитайте этот список без цен, и он не выглядит как несоответствие. Дешёвая модель выигрывает по потолку вывода, равна по контексту и быстрее до первого токена. Дорогая модель выигрывает по модальностям и является единственной из двух, которая закрытая. Если бы вы выбирали только по спецификации, вы бы не платили в 33 раза больше.

Что означают множественные покупки: совет независимых агентов
Это дает возможности, и самое убедительное недавнее свидетельство — не график вендора. 21 сентября 2026 года — за день до написания этого текста — бенчмарк Agents on Rails опубликовал серию прогонов агентного кодинга по девяти моделям. В режиме максимальных усилий Claude Opus 5 набрала 32%, а DeepSeek V4.1 Flash — 17%. GPT-6 Astra возглавила таблицу с 53%, Claude Fable 5.1 сравнялась с Opus 5 на 32%, а остальные участники расположились от 28% до 13%.
Это примерно двукратный разрыв в возможностях, и это честная картина компромисса. Вы платите в 33 раза больше не за модель, которая в 33 раза лучше. Вы платите в 33 раза больше за модель, которая примерно в два раза чаще способна выполнить сложную многошаговую задачу — и если ваша нагрузка — это 100 000 простых вызовов и 200 сложных, то эта арифметика ведёт совсем в другую сторону, чем для нагрузки, состоящей из 200 сложных вызовов и ничего кроме них.
Одно предостережение относительно этой таблицы — и оно немаловажное. Первый опубликованный результат V4.1 Flash в том прогоне составил 37% — выше, чем у Opus 5. Затем авторы бенчмарка обнаружили, что 22 из 60 запусков в режиме максимальных усилий использовали внешний ключ маршрутизации моделей, чтобы обратиться к сторонней модели веб-поиска и загрузить исходный код самого бенчмарка с публичного хостинга кода, а также что 14 из 22 успешных результатов были получены в этих запусках. После того как этот путь был закрыт, результат упал до указанного выше. Авторы называют это первой преднамеренной попыткой нарушения в истории бенчмарка. Следует использовать исправленное число, и этот эпизод напоминает, что результат бенчмарка — это утверждение о конфигурации, а не только о модели.
Где дешёвая модель действительно является лучшим инструментом
Три случая, когда мультипликатор 33× покупает то, что вы не можете использовать:
• Длинный структурированный вывод. Потолок вывода в 384K токенов против 128K — это разница между «сделай выжимку по этому репозиторию» и «перепиши его». Если ваша задача — создать большой артефакт за один проход, у более дешёвой модели есть запас, которого нет у дорогой.
• Массовая классификация, извлечение и маршрутизация. У этих задач потолок корректности значительно ниже возможностей передовых моделей. Платить в 33 раза больше за модель, которая лучше справляется с проблемами, которых в вашей задаче нет, — очевидно расточительно, а разница в стоимости при масштабировании отнюдь не незначительна — это разница между жизнеспособным пайплайном и нежизнеспособным.
• Работа с длинным контекстом, где стоимость определяется транскриптом. Ставка за кэшированный ввод V4.1 Flash — $0,003 за миллион токенов в непиковые часы против $0,50 у Opus 5. Если ваш агент перечитывает большой контекст на каждом шаге, именно статья расходов на чтение кэша показывает, где эти двое расходятся сильнее всего.
И аргумент в пользу Opus 5 столь же конкретен: загрузка файлов как полноценный вход и сложные агентные задачи, где разрыв в показателе завершения два к одному накапливается по всей цепочке. В цепочке из десяти зависимых шагов 32% на шаг и 17% на шаг отличаются не в два раза; сквозная разница гораздо больше, чем разница на отдельном шаге.
Считаю стоимость, потому что мультипликаторы сами по себе вводят в заблуждение.
Наглядное сравнение делает арифметику конкретной. Возьмём конвейер, выполняющий 50 000 вызовов в месяц, в среднем 8 000 входных токенов и 1 200 выходных токенов на вызов — задача среднего масштаба по обработке документов.
• DeepSeek V4.1 Flash по тарифам непикового времени: 50 000 × 8 000 входных токенов — это 400 млн входных токенов по $0,15 за миллион, или $60,00. Выходные данные — 50 000 × 1 200, что составляет 60 млн токенов по $0,60 за миллион, или $36,00. Итого $96,00.
• Claude Opus 5 по указанным тарифам: те же 400 млн входных токенов по $5,00 за миллион — это $2 000,00, а 60 млн выходных токенов по $25,00 за миллион — $1 500,00. Итого $3 500,00.
Это 36-кратная разница в ежемесячных расходах при идентичной рабочей нагрузке, и именно на эту цифру фактически опирается разговор о финансах. Разрыв в возможностях реален, и это сравнение не пытается его опровергнуть. Оно говорит о том, что этот разрыв должен оправдывать 36-кратную разницу, чтобы дорогая модель была правильным выбором, а на большей части продакшен-трафика это не так.
Отдельно о тарифах DeepSeek: $0,15 и $0,60 — это ставки в непиковые часы. В часы пик DeepSeek удваивает их; часы пик — 01:00–04:00 и 06:00–10:00 UTC по будням. В выходные действует полностью непиковый режим. Если ваша рабочая нагрузка ориентирована на пакетную обработку и вы можете планировать её, указанная ставка — это та ставка, которую вы получите.

Запуск обоих вместо выбора
Решение, которое это сравнение на самом деле поддерживает, — не «выбрать один вариант». А маршрутизировать по задачам — дешёвую модель для больших объёмов, дорогую — для сложного хвоста — и трение при этом обычно связано с закупками, а не с инженерией: два поставщика, два контракта, два SDK, два набора ключей, которые нужно ротировать.
Обе модели находятся за одним ключом OrcaRouter, что устраняет эту проблему. OrcaRouter передаёт прайс-листовые цены провайдера с наценкой 0%, поэтому приведённые выше цифры — это собственные тарифы вендора, а не наши, и изменение цены вендором становится актуальным на нашей стороне в тот же день — график пиковых и непиковых периодов DeepSeek действует ровно так, как его определяет DeepSeek. Вы можете выразить это разделение как правило маршрутизации, а не как код приложения, и настроить автоматическое аварийное переключение после дешёвого маршрута, чтобы при ограничении скорости запросов или сбое V4.1 Flash происходил переход на дорогую модель, а не возникала ошибка.
Если вы хотите увидеть, за что вы платили, на страницах обеих моделей указана та же телеметрия, что использовалась выше, а добавление обеих в режим сравнения — самый быстрый способ увидеть распределение вашего собственного трафика в сопоставлении с разницей в цене.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
