Титульная карточка: DeepSeek V4.1 Flash против Gemini 3.1 Pro — одна из них всё ещё превью
Guides & Insights

DeepSeek V4.1 Flash против Gemini 3.1 Pro: один из них всё ещё предварительная версия

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самое полезное, что стоит знать о DeepSeek V4.1 Flash в сравнении с Gemini 3.1 Pro, не указано ни в одной спецификации. DeepSeek V4.1 Flash — общедоступная модель, выпущенная 10 сентября 2026 года с весами под лицензией MIT, которые можно скачать. Gemini 3.1 Pro находится в предварительном доступе с 19 февраля 2026 года и спустя примерно семь месяцев всё ещё предоставляется под названием предварительной сборки. Эта асимметрия не решает, какая модель лучше, но она определяет, какие обязательства вы на себя берёте, строя что-либо на одной из них, и она задаёт рамку для всего ниже.

Оба вмещают миллион токенов контекста. Оба принимают изображения. Реальные различия между ними — это кривая цены после 200 000 входных токенов, входные модальности, потолок вывода и тот факт, что одно из этих двух — это файл, которым вы можете владеть, а другое — API.

Какова на самом деле позиция этих двоих

• Цена за 1 млн токенов при контексте до 200K — DeepSeek V4.1 Flash $0.15 за ввод / $0.60 за вывод против Gemini 3.1 Pro $2.00 за ввод / $12.00 за вывод. Это в 13 раз больше цены за ввод и в 20 раз больше цены за вывод.

• Цена за 1 млн токенов при контексте свыше 200K — V4.1 Flash без изменений на уровне $0.15 / $0.60 против Gemini 3.1 Pro $4.00 за вход / $18.00 за выход. Множитель по входу увеличивается до 27× ровно в той точке, где выполняется работа с длинным контекстом.

• Кэшированный ввод — V4.1 Flash $0.003 за 1 млн в непиковое время против Gemini 3.1 Pro $0.40 за 1 млн. На два порядка — по статье расходов, которая определяет, доступно ли повторное чтение контекста.

• Контекстное окно — 1 млн токенов против 1 млн токенов. Уровень.

• Максимальный объём вывода — 384K токенов у V4.1 Flash против 65K токенов у Gemini 3.1 Pro. В шесть раз выше потолка.

• Входные модальности — V4.1 Flash принимает текст и изображения, тогда как Gemini 3.1 Pro принимает текст, изображения, аудио, видео и загрузку файлов.

• Веса — V4.1 Flash MIT, доступны для скачивания, в отличие от Gemini 3.1 Pro — закрытая, только API.

• Статус выпуска — V4.1 Flash общедоступна с 10 сентября 2026 года, тогда как Gemini 3.1 Pro находится в предварительной версии с 19 февраля 2026 года.

• Наблюдаемая задержка до первого токена — V4.1 Flash: 2,63 с при p50 и 9,05 с при p95 против Gemini 3.1 Pro: 10,00 с при p50 и 10,00 с при p95 — по собственной 7-дневной телеметрии OrcaRouter. Медианное ожидание дорогой модели находится на потолке телеметрии, и её хвост не смещается с него.

Прочитайте список без цен — и картина знакома по любому сравнению моделей с открытыми весами с передовыми: скачиваемая модель выигрывает по потолку вывода, равна по контексту и опережает по наблюдаемой задержке. Закрытая модель выигрывает по модальностям, и в них она побеждает безоговорочно. Ничто здесь само по себе не объясняет 13-кратное превышение по входу.

Two-column scoreboard: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — price per 1M tokens $0.15 input and $0.60 output vs $2.00 and $12.00 up to 200K and $4.00 and $18.00 above, cached input $0.003 vs $0.40, context window 1M tokens on both, max output 384K tokens vs 65K tokens, input modalities text and images vs audio, file, image, text and video, weights MIT vs closed, release state generally available since 2026-09-10 vs in preview since 2026-02-19, and a time to first token of 2.63 s at p50 and 9.05 s at p95 vs 10.00 s at p50 and p95

Обрыв на отметке 200K — вот главная история ценообразования.

Заявленная ставка Gemini 3.1 Pro — не единая ставка. Запросы объёмом до 200 000 входных токенов тарифицируются по $2,00 за миллион входных и $12,00 за миллион выходных; а запрос, превышающий этот порог, тарифицируется по $4,00 и $18,00. У DeepSeek V4.1 Flash нет тарифных уровней — он тарифицируется по $0,15 и $0,60, независимо от того, 2 000 токенов в запросе или 900 000, с той лишь оговоркой, что в часы пик DeepSeek удваивает свою ставку, а по выходным полностью работает в непиковом режиме.

Эта граница уровня оказывается в наихудшем возможном месте для работы с длинным контекстом, потому что работа с длинным контекстом по определению — это работа, которая её пересекает. Пример с расчётами делает это наглядным. Возьмём конвейер, выполняющий 20 000 вызовов в месяц, каждый в среднем 250 000 входных токенов и 4 000 выходных токенов — задача анализа документов с большими файлами.

• DeepSeek V4.1 Flash по тарифам вне пиковых часов: 20 000 × 250 000 — это 5 000 млн входных токенов по $0,15 за миллион, или $750,00. Выходные токены: 20 000 × 4 000, что составляет 80 млн токенов по $0,60 за миллион, или $48,00. Итого $798,00.

• Gemini 3.1 Pro на его тарифе свыше 200K: те же 5 000 млн входных токенов по $4,00 за миллион — это $20 000,00, а 80 млн выходных токенов по $18,00 за миллион — это $1 440,00. Итого $21 440,00.

Это 27-кратная разница в месячных расходах при одинаковом трафике, и это не та кратность, которую можно было бы предположить по заявленным числам. Заявленная кратность — 13×. Кратность, которую вы фактически платите за работу с длинным контекстом, — 27×, потому что граница уровня проходит ровно там, где находятся ваши промпты.

Во что вам на самом деле обходится метка предварительного просмотра

Предварительная сборка — это предварительная сборка во всей отрасли: она не даёт никаких опубликованных гарантий стабильности. Поставщик не обязался сохранять конечную точку с тем же поведением, по той же цене или под тем же названием. Это не критика Gemini 3.1 Pro — именно это означает данный ярлык, и именно поэтому суффикс Preview сохраняется уже семь месяцев, а не оказывается двухнедельной формальностью.

Для прототипа это ничего не значит. Для продакшн-пути это конкретный, измеримый риск: вы делаете ставку на то, что сборка, под которую вы настраивались, останется неизменной. Контраст с другой стороной этого сравнения — структурный, а не риторический. DeepSeek V4.1 Flash имеет статус GA, а его веса лицензированы по MIT и доступны для скачивания, что означает: даже если хостируемый API завтра изменит свои условия, сама модель всё равно останется в ваших руках. Закрытая preview-модель не даёт вам ни обязательства GA, ни запасного выхода. Если ваша нагрузка может работать на любом из них, эта разница стоит больше, чем один балл в бенчмарке.

Где Gemini 3.1 Pro — лучший инструмент

Разрыв модальностей — это не ошибка округления, и это единственное измерение в этом списке, где дешёвую модель нельзя заменить ни за какую цену. Gemini 3.1 Pro принимает аудио и видео как полноценные входные данные, а также загрузку файлов. DeepSeek V4.1 Flash работает с текстом и изображениями. Если ваш конвейер обрабатывает запись звонка, снимок экрана или видеообзор, DeepSeek V4.1 Flash — не более дешёвый вариант, а вообще не вариант. 13-кратная разница не имеет значения для задачи, которую одна модель может выполнить, а другая — нет.

Есть второй, менее заметный случай. Gemini 3.1 Pro в той или иной форме находится в открытом доступе с февраля, и это модель с более длительной историей эксплуатации — больше людей проверяли её пределы, а её поведение на реальном трафике задокументировано лучше, чем у релиза, которому двенадцать дней. Для интерактивной работы с интенсивным выводом, где медианное ожидание в десять секунд приемлемо, потому что задача выполняется в фоне, именно эта история и служит аргументом — и аргументом реальным. Это не аргумент о задержке: по приведённой выше телеметрии более дешёвая модель быстрее из этих двух как по медиане, так и по хвосту.

И есть вопрос о том, что означает метка предварительной версии для этой истории. Семь месяцев доступности под именем предварительной сборки — это дольше, чем достаётся большинству моделей, и это также семь месяцев без обязательства GA. DeepSeek V4.1 Flash на момент написания существует всего двенадцать дней, и её независимая история скудна: единственный недавний сторонний обзор, в котором она фигурирует, — доска Agents on Rails по агентному программированию, опубликованная 21 сентября 2026 года, — поставил её на 17% при максимальном усилии, в середине поля. Двенадцати дней недостаточно, чтобы репутация модели что-либо значила — в любую сторону, — и это честная причина, по которой покупатель может предпочесть здесь более старую модель, и это не имеет ничего общего со скоростью.

Маршрутизация по длине контекста, потому что именно это и есть настоящее решение

Решение, которое подразумевает это сравнение, — не «выбрать одно». Это правило из двух пунктов: работа с длинным контекстом и большим объёмом идёт в DeepSeek V4.1 Flash, а всё, что содержит аудио или видео, идёт в Gemini 3.1 Pro. Неудобство заключается в том, что это правило легко сформулировать, но раздражающе сложно реализовать, потому что эти два пункта обычно находятся у разных вендоров с разными ключами, разными SDK и разными лимитами запросов.

Обе модели доступны по одному ключу OrcaRouter, что превращает это правило в правило маршрутизации, а не в ветвление кода в вашем приложении — вы можете привязать решение напрямую к длине контекста запроса, а именно это измерение и определяет разницу в стоимости в данном случае. OrcaRouter передаёт цены провайдеров по прайс-листу с наценкой 0%, поэтому ступенчатые тарифы выше — это собственные тарифы Google, а пиковое расписание DeepSeek — собственное расписание DeepSeek, причём изменение цены вендором вступает в силу на нашей стороне в тот же день. А поскольку одна сторона этой пары — preview-сборка, автоматическое переключение при сбое стоит предусмотреть: если сборка обновится у вас под ногами, запрос уйдёт на другую модель, а не на страницу с ошибкой.

Этот последний пункт — практическое воплощение всего вышесказанного. Множитель 27× при работе с длинным контекстом — причина маршрутизировать, а не выбирать, а ярлык предварительной версии у одной из двух моделей — причина иметь место, куда запрос может уйти, когда сборка изменится.

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the model id, 1M-token context, 65K max output, audio, file, image, text and video input, $2.00 input and $12.00 output per 1M tokens, and observed time to first token of 10.00 s at both p50 and p95

Что посмотреть

• Выйдет ли Gemini 3.1 Pro из режима preview. Выпуск GA убрал бы оговорку о стабильности и изменил бы картину этого сравнения сильнее, чем любое изменение цены.

• Изменится ли уровень выше 200 000. Граница уровня играет в арифметике затрат бо́льшую роль, чем заявленная ставка.

• Накопит ли DeepSeek V4.1 Flash независимый послужной список. Модель с весами под лицензией MIT, потолком вывода 384K и контекстом 1M при $0.15 за миллион входных токенов — необычное сочетание; а есть ли для этого способности — вопрос, на который пока не ответил ни один публичный бенчмарк.

Пока не выйдет первое из этого, точная сводка такова: DeepSeek V4.1 Flash примерно в тринадцать раз дешевле на входе и в двадцать семь раз дешевле на входе с длинным контекстом, чем Gemini 3.1 Pro, только его из этих двух можно скачать, и только за ним из этих двух стоит обязательство по GA. Gemini 3.1 Pro — это модель с более длительной историей использования в продакшене, и только она из этих двух умеет читать аудио и видео. Маршрутизируйте запросы соответственно.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart