Обзор DeepSeek V4: Самые дешевые серьезные 1M-токеновые модели в ИИ?

Обзор DeepSeek V4: Самые дешевые серьезные 1M-токеновые модели в ИИ?

Автор

Fengya Tian

Дата публикации

Назад ко всем статьям

DeepSeek выпустила семейство V4 24 апреля 2026 года — две модели, V4-Pro и V4-Flash, доступные в API и опубликованные в открытом исходном коде в первый же день — и тихо подняла планку того, сколько стоят серьёзные возможности ИИ. Обе модели имеют контекстное окно в 1M токенов по умолчанию, обе предлагают режимы размышления и без размышления, а флагманская V4-Pro достигает верхней планки в $0.87 за миллион выходных токенов: цена, которая ниже, чем у любой сопоставимой модели с контекстом в 1M токенов на рынке, как открытой, так и закрытой.

И июль — месяц решающих действий. В уведомлении от 29 июня DeepSeek подтвердил, что официальная версия V4 выйдет в середине июля 2026 года, обещая улучшения функций и производительности, а также вводя пиковое ценообразование, удваивающее тарифы в часы деловой активности в Пекине. Через десять дней, 24 июля, названия устаревших моделей `deepseek-chat` и `deepseek-reasoner` окончательно уходят в прошлое. Этот обзор охватывает, что такое V4 на самом деле, сколько она стоит сейчас и после официального релиза, в чём она выигрывает, где явно проигрывает и что делать до наступления сроков.

Краткий вердикт

Рассмотрите DeepSeek V4, если вы…

- Запускайте высоконагруженные производственные задачи, где стоимость единицы продукции определяет рентабельность — ценообразование V4 находится в своем собственном классе.

- Нужен длинный контекст недорого: стандартно 1 млн токенов, до 384 тыс. выходных токенов на ответ, с агрессивными скидками на кэширование контекста

- Хотите интеграцию «drop-in» — API поддерживает как формат OpenAI ChatCompletions, так и Anthropic, поэтому существующие инструменты в основном работают без изменений.

- Цените открытые веса и возможности самостоятельного хостинга, особенно меньший V4-Flash

Отложите (или перенаправьте в другое место), если вы…

- Запуск долгосрочных автономных агентов — по опубликованной Z.ai кросс-модельной таблице, V4-Pro значительно отстает как от GLM-5.2, так и от закрытого фронтира на марафонских тестах.

- Требуется ввод изображения: V4 только текст

- Полагайтесь на фиксированные цены круглосуточно — с официального запуска в середине июля 2026 года стоимость в пиковые часы удваивается в течение деловых часов Пекина (в непиковые часы сохраняются сегодняшние тарифы).

Что такое DeepSeek V4?

V4 — это семейство моделей четвёртого поколения от DeepSeek, выпущенное в виде двух моделей Mixture-of-Experts. DeepSeek-V4-Pro является флагманом: 1,6 триллиона параметров в общей сложности, из которых 49 миллиардов активны на каждый токен. DeepSeek-V4-Flash — это версия для эффективности: 284 миллиарда параметров в общей сложности, 13 миллиардов активных. Обе модели по умолчанию используют контекстное окно на 1 миллион токенов на официальных сервисах DeepSeek, и обе предоставляют два режима — размышление для сложных задач и без размышления для скорости — под идентификаторами моделей deepseek-v4-pro и `deepseek-v4-flash`.

Два важных момента позиционирования. Во-первых, V4 был запущен как предварительная версия которую DeepSeek считает пригодной для использования в продакшене — и, согласно уведомлению компании от 29 июня, официальная версия выйдет в середине июля 2026 года с «оптимизацией функций и улучшением производительности». Во-вторых, он был запущен с открытым исходным кодом, продолжая практику DeepSeek по публичному выпуску весов — что оставляет возможность самостоятельного хостинга и тонкой настройки, на практике для 284B Flash больше, чем для 1.6T Pro.

Что нового в DeepSeek V4?

Контекст в 1M токенов по умолчанию, а не как платная опция. Все официальные сервисы DeepSeek теперь используют полное окно в миллион токенов как стандарт — без отдельного SKU для длинного контекста, без премиум-тарифа.

Огромный запас выходного объема. Обе модели поддерживают до 384 тысяч выходных токенов на ответ — втрое больше, чем допускают большинство конкурентов с контекстом 1 млн, — что важно для генерации целых файлов кода, длинных структурированных извлечений и написания отчетов.

Двойные режимы на одной конечной точке. Режим размышлений для сложных задач, без размышлений для дешевых быстрых вызовов, переключаемый по запросу вместо по модели.

Два уровня с одной формой API.Pro для возможностей, Flash для объема — тот же контекст, те же режимы, та же интеграция.

Двойная совместимость API.V4 изначально поддерживает как формат OpenAI ChatCompletions, так и формат Anthropic API, поэтому большинство существующих агентских инструментов подключаются без переписывания.

Цены: что это на самом деле стоит

Это раздел, который делает V4 знаменитым. V4-Pro стоит $0.435 за миллион входных токенов и $0.87 за миллион выходных. V4-Flash стоит $0.14 и $0.28. Попадания в кэш при повторном контексте указаны по цене значительно ниже цента за миллион токенов — что фактически бесплатно для циклов агента, которые повторно считывают одно и то же состояние проекта.

Для масштаба: GLM-5.2, который сам по себе считается выгодной летней находкой, стоит $1.40 / $4.40. Claude Sonnet 5 стоит $3 / $15, Claude Opus 4.8 — $5 / $25. Цена вывода V4-Pro составляет пятую часть от цены GLM-5.2 и примерно 3% от цены Opus 4.8. Даже если V4-Pro проигрывает в некоторых прямых сравнениях качества — а это так — экономика меняет то, какие вопросы вообще стоит задавать модели.

Одно изменение грядет с официальным релизом.Согласно уведомлению DeepSeek от 29 июня, с середины июля цены на все токены удвоятся в пиковые окна — с 09:00 до 12:00 и с 14:00 до 18:00 по пекинскому времени — тогда как в непиковые часы останутся сегодняшние ставки. Даже удвоенная, пиковая выходная цена V4-Pro (около $1,74 за миллион) всё еще ниже стандартной ставки GLM-5.2, но эпоха фиксированных цен заканчивается с превью: если ваш трафик приходится на пик китайских рабочих часов, учтите колебание — или планируйте и маршрутизируйте в обход.

Оценка отзыва

Приведенные ниже оценки являются нашей редакционной оценкой на основе официальной документации DeepSeek и опубликованной Z.ai таблицы кросс-модельных тестов — относитесь к кросс-вендорным цифрам как к контексту от третьих лиц, а не к собственным заявлениям DeepSeek.

- Кодирование: 8/10 — способен на повседневную инженерную работу; не лидер в категории open-weight.

- Агентность / использование инструментов: 7/10 — хорошая оркестрация инструментов, слабая в автономности на длинные дистанции

- Рассуждение: 8/10 — отличные результаты по математике и естественным наукам для своего ценового класса.

- Экономическая эффективность: 10/10 — ничто сопоставимое не может сравниться.

- Контекст и длинные документы: 9/10 — 1M на входе, 384K на выходе, почти бесплатные попадания в кэш

- Скорость: 8/10 — небольшое количество активных параметров, плюс режим без размышлений для быстрых путей

Общая оценка: ~8.3/10 — король соотношения цены и производительности середины 2026 года, с долгосрочной звездочкой.

Плюсы

- Ценообразование, которое переопределяет кривую: $0.14–$0.87 за миллион токенов по всей линейке

- {{1}}1M стандартный контекст с выводом 384K{{/1}} — самый большой потолок вывода в своем классе

- Режимы с мышлением и без мышления на одной конечной точке, переключаемые по запросу

Совместимость с API OpenAI и Anthropic означает почти нулевое трение при миграции.

- Открытые веса сохраняют возможность самостоятельного хостинга и тонкой настройки.

Минусы

Долгосрочная агентная работа — явная слабость: в опубликованной таблице Z.ai модель V4-Pro набирает 29,0 на FrontierSWE, в то время как GLM-5.2 показывает 74,4, а Claude Opus 4.8 — 75,1.

Только текст: в V4 API нет ввода изображений

- Пиковое ценообразование вводится с официальным релизом в середине июля — тарифы удваиваются в рабочие часы Пекина, поэтому бюджеты перестают быть плоскими.

- Пока еще предварительная версия до середины июля, поэтому поведение может измениться с выходом официальной версии.

Вывод из эксплуатации deepseek-chat и deepseek-reasoner 24 июля 2026 года заставляет пользователей устаревших версий мигрировать по графику DeepSeek.

- Самостоятельное размещение модели Pro с 1,6 трлн параметров непрактично для почти всех (Flash с 284 млрд — это реалистичная цель).

Как DeepSeek V4 сравнивается

V4-Pro против V4-Flash.Тот же контекст, те же режимы, тот же API — разделение это качество против пропускной способности при разнице в цене в 3 раза. Разумное значение по умолчанию: Flash для резюме, извлечения, классификации и чата; Pro для кода, анализа и всего, что проверяет человек.

против GLM-5.2.Битва открытых весов этим летом — и она действительно близка по ценности. GLM-5.2 — более сильный кодер: в опубликованной таблице Z.ai он опережает V4-Pro 81.0 против 64.0 на Terminal-Bench 2.1 и доминирует в долгосрочных задачах (74.4 против 29.0 на FrontierSWE), в то время как V4 отвечает ценами в 3–5 раз ниже и тройным потолком вывода. Объёмные пайплайны склоняются к V4; агенты кодирования — к GLM-5.2.

против закрытого фронтира.Claude Opus 4.8 и GPT-5.5 остаются явно более сильными моделями по сложным бенчмаркам. Но при разрыве в цене вывода в 30–60 раз по сравнению с Opus 4.8, V4 не пытается выиграть эту борьбу — он пытается сделать 90% вашего трафика настолько дешевым, что отправлять его куда-либо еще становится неоправданно.

Крайний срок 24 июля: миграция с устаревших имен

Если ваша интеграция по-прежнему вызывает `deepseek-chat` или `deepseek-reasoner`, эти имена перестанут работать после 24 июля 2026 года, 15:59 UTC. В настоящее время они направляются к V4-Flash, что означает, что ваш трафик уже работает по экономике V4 – но после отсечки запросы будут безусловно неудачными. Сама миграция – это одна строка (`model: "deepseek-v4-pro"` или `"deepseek-v4-flash"`), так что настоящая работа заключается в повторном тестировании промптов на поведении V4 и принятии решения, конечная точка за конечной точкой, какой уровень обслуживания заслуживает каждая нагрузка – или размещении маршрутизатора спереди, чтобы следующее устаревание было изменением конфигурации, а не кода.

Кому следует использовать DeepSeek V4?

Высокообъемные продукты — поддержка, суммаризация, извлечение, классификация — где ценообразование V4 делает маржинальные функции прибыльными.

Рабочие нагрузки с длинными документами и интенсивным использованием RAG, которые ежедневно заполняют окна размером 1 млн токенов и получают выгоду от почти бесплатных попаданий в кэш.

Команды, генерирующие длинные выходные данные: кодовые базы, отчеты, структурированные данные — выход 384K — это потолок класса.

Экономные строители, которым нужна функциональная базовая конфигурация и которые готовы переложить сложные 10% на другие задачи.

Кому следует искать в другом месте?

Команды, чья основная рабочая нагрузка — долгоживущие автономные агенты — GLM-5.2 или закрытый флагман — это более безопасный путь.

Визуально-зависимые рабочие процессы (V4 не делает снимков)

Тот, кому сегодня нужна контрактная «стабильная» метка, а не предварительная версия.

Стоит ли DeepSeek V4?

За такую цену — однозначно да, как направление, а не религия. V4 не превосходит лучшего открытого кодера (GLM-5.2) или флагманских моделей по качеству, и его показатели долгосрочного агента действительно слабы. Что он делает — так это делает огромные объемы повседневной AI-работы (сводки, извлечения, черновики и диалоговые обороты, которые составляют основную часть реальных токенов) почти бесплатными. Выигрышный паттерн — V4 как нижний уровень объема, с каналами эскалации над ним.

Окончательный вердикт

DeepSeek V4 — это эталон соотношения цены и производительности, с которым теперь сравнивают все остальные модели. Наша оценка: ~8.3/10. Используйте Flash там, где важен объем, Pro — там, где качество имеет значение, но бюджет ограничен, а для задач высшего уровня обращайтесь к более мощной модели. Пересчитайте свои затраты, когда в середине июля вступят в силу пиковые цены: дешевое останется дешевым, но перестанет быть фиксированным. И если вы все еще используете deepseek-chat или deepseek-reasoner: у вас есть время до 24 июля. Действуйте.

Использование DeepSeek V4 через OrcaRouter

Трехполосная стратегия — V4 для объема, более сильная открытая или закрытая модель для сложных задач, запасной вариант для надежности — это именно та конфигурация, которую сложно выполнять вручную, но тривиально за шлюзом. OrcaRouter обслуживает DeepSeek V4 вместе с GLM-5.2, Claude, GPT, Gemini и 200+ другими моделями через единую совместимую с OpenAI конечную точку, по ценам провайдеров с нулевой наценкой на токены: интеллектуальная маршрутизация выбирает полосу под каждый запрос, автоматическое резервирование устраняет сбои в эпоху предварительных версий, а мониторинг по каждой модели показывает фактическую стоимость полосы за выполненную задачу. Также нейтрализуются изменения со стороны провайдера, такие как отказ от названия 24 июля или пиковое ценообразование в середине июля — когда имя модели исчезает или открывается ценовое окно, вы обновляете правило маршрутизации, а не кодовую базу.

Часто задаваемые вопросы

Доступен ли DeepSeek V4 сейчас?

Да — V4-Pro и V4-Flash работают на DeepSeek API с 24 апреля 2026 года под идентификаторами моделей deepseek-v4-pro и deepseek-v4-flash, с открытыми исходными весами. Официально это предварительная версия; уведомление DeepSeek от 29 июня указывает официальный релиз на середину июля 2026 года.

Что такое ценообразование DeepSeek в часы пик?

Объявлено для официального выпуска: с середины июля 2026 года все цены на токены удваиваются в рабочие часы Пекина (09:00-12:00 и 14:00-18:00 по пекинскому времени), в то время как в непиковые часы сохраняются текущие тарифы. Трафик, пиковые нагрузки которого приходятся на нерабочие часы Китая — в основном западные рабочие нагрузки — в значительной степени избегает надбавки.

Что происходит с deepseek-chat и deepseek-reasoner?

В настоящее время они автоматически перенаправляются на V4-Flash, но после 24 июля 2026 года (15:59 UTC) оба названия будут полностью удалены, и запросы будут завершаться ошибкой. Обновите параметр модели явно до наступления крайнего срока.

Стоит ли мне использовать V4-Pro или V4-Flash?

Flash для объемной работы, которую человек никогда не проверяет построчно — резюмирование, извлечение, классификация, чат. Pro для кода, анализа и составления проектов, примерно в 3 раза дороже Flash, но все еще намного дешевле любой сопоставимой модели.

DeepSeek V4 лучше, чем GLM-5.2?

Дешевле, но не лучше. В опубликованной таблице Z.ai GLM-5.2 явно лидирует в кодировании и доминирует в долгосрочной работе агентов; V4 отвечает ценами в 3–5 раз ниже, выходным лимитом в 384K и почти бесплатными попаданиями в кэш. Многие команды используют оба: V4 для объёмов, GLM-5.2 для агентов кодирования.

DeepSeek V4 — это текстовая модель, поэтому она напрямую не обрабатывает изображения, как специализированные мультимодальные системы. Однако я могу анализировать текст, извлечённый из загруженных изображений (например, с помощью OCR), если вы прикрепите файл. Таким образом, я работаю с текстовым содержанием изображений, но не с самими визуальными данными.

Нет — API V4 предназначен только для текста. Вместо этого направляйте задачи компьютерного зрения (скриншоты, PDF как пиксели, диаграммы) в мультимодальную модель, например Claude или Gemini.

Могу ли я разместить DeepSeek V4 на собственном сервере?

Веса открыты, но будьте реалистичны в отношении масштаба: V4-Pro — это MoE с 1,6 трлн параметров — территория дата-центров, — в то время как V4-Flash с 284 млрд параметров является практической целью для самостоятельного хостинга для хорошо оснащённых команд.

Работает ли V4 с моими существующими инструментами OpenAI или Claude?

В основном да — API изначально поддерживает как форматы OpenAI ChatCompletions, так и Anthropic, поэтому платформы для агентов и SDK, созданные для любого из них, обычно подключаются с изменением базового URL и имени модели.

Могу ли я использовать DeepSeek V4 через OrcaRouter?

Да — модели DeepSeek доступны на OrcaRouter по ценам из прайс-листа провайдера без наценки, наряду с GLM, Claude, GPT и Gemini, так что вы можете выполнять разделение объема и эскалации за одной конечной точкой.

Готовы сделать ваш счёт за токены скучным? Создайте аккаунт OrcaRouter, укажите клиенту, совместимому с OpenAI, одну конечную точку и направьте основной объём на DeepSeek V4, пока более мощные модели обрабатывают вершину — с нулевой наценкой на токены и интеграцией, защищённой от 24 июля.


© 2026 OrcaRouter