
DeepSeek V4.1 Flash против Gemini 3.1 Pro: один из них всё ещё предварительная версия
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Самое полезное, что стоит знать о DeepSeek V4.1 Flash в сравнении с Gemini 3.1 Pro, не указано ни в одной спецификации. DeepSeek V4.1 Flash — общедоступная модель, выпущенная 10 сентября 2026 года с весами под лицензией MIT, которые можно скачать. Gemini 3.1 Pro находится в предварительном доступе с 19 февраля 2026 года и спустя примерно семь месяцев всё ещё предоставляется под названием предварительной сборки. Эта асимметрия не решает, какая модель лучше, но она определяет, какие обязательства вы на себя берёте, строя что-либо на одной из них, и она задаёт рамку для всего ниже.
Оба вмещают миллион токенов контекста. Оба принимают изображения. Реальные различия между ними — это кривая цены после 200 000 входных токенов, входные модальности, потолок вывода и тот факт, что одно из этих двух — это файл, которым вы можете владеть, а другое — API.
Какова на самом деле позиция этих двоих
• Цена за 1 млн токенов при контексте до 200K — DeepSeek V4.1 Flash $0.15 за ввод / $0.60 за вывод против Gemini 3.1 Pro $2.00 за ввод / $12.00 за вывод. Это в 13 раз больше цены за ввод и в 20 раз больше цены за вывод.
• Цена за 1 млн токенов при контексте свыше 200K — V4.1 Flash без изменений на уровне $0.15 / $0.60 против Gemini 3.1 Pro $4.00 за вход / $18.00 за выход. Множитель по входу увеличивается до 27× ровно в той точке, где выполняется работа с длинным контекстом.
• Кэшированный ввод — V4.1 Flash $0.003 за 1 млн в непиковое время против Gemini 3.1 Pro $0.40 за 1 млн. На два порядка — по статье расходов, которая определяет, доступно ли повторное чтение контекста.
• Контекстное окно — 1 млн токенов против 1 млн токенов. Уровень.
• Максимальный объём вывода — 384K токенов у V4.1 Flash против 65K токенов у Gemini 3.1 Pro. В шесть раз выше потолка.
• Входные модальности — V4.1 Flash принимает текст и изображения, тогда как Gemini 3.1 Pro принимает текст, изображения, аудио, видео и загрузку файлов.
• Веса — V4.1 Flash MIT, доступны для скачивания, в отличие от Gemini 3.1 Pro — закрытая, только API.
• Статус выпуска — V4.1 Flash общедоступна с 10 сентября 2026 года, тогда как Gemini 3.1 Pro находится в предварительной версии с 19 февраля 2026 года.
• Наблюдаемая задержка до первого токена — V4.1 Flash: 2,63 с при p50 и 9,05 с при p95 против Gemini 3.1 Pro: 10,00 с при p50 и 10,00 с при p95 — по собственной 7-дневной телеметрии OrcaRouter. Медианное ожидание дорогой модели находится на потолке телеметрии, и её хвост не смещается с него.
Прочитайте список без цен — и картина знакома по любому сравнению моделей с открытыми весами с передовыми: скачиваемая модель выигрывает по потолку вывода, равна по контексту и опережает по наблюдаемой задержке. Закрытая модель выигрывает по модальностям, и в них она побеждает безоговорочно. Ничто здесь само по себе не объясняет 13-кратное превышение по входу.

Обрыв на отметке 200K — вот главная история ценообразования.
Заявленная ставка Gemini 3.1 Pro — не единая ставка. Запросы объёмом до 200 000 входных токенов тарифицируются по $2,00 за миллион входных и $12,00 за миллион выходных; а запрос, превышающий этот порог, тарифицируется по $4,00 и $18,00. У DeepSeek V4.1 Flash нет тарифных уровней — он тарифицируется по $0,15 и $0,60, независимо от того, 2 000 токенов в запросе или 900 000, с той лишь оговоркой, что в часы пик DeepSeek удваивает свою ставку, а по выходным полностью работает в непиковом режиме.
Эта граница уровня оказывается в наихудшем возможном месте для работы с длинным контекстом, потому что работа с длинным контекстом по определению — это работа, которая её пересекает. Пример с расчётами делает это наглядным. Возьмём конвейер, выполняющий 20 000 вызовов в месяц, каждый в среднем 250 000 входных токенов и 4 000 выходных токенов — задача анализа документов с большими файлами.
• DeepSeek V4.1 Flash по тарифам вне пиковых часов: 20 000 × 250 000 — это 5 000 млн входных токенов по $0,15 за миллион, или $750,00. Выходные токены: 20 000 × 4 000, что составляет 80 млн токенов по $0,60 за миллион, или $48,00. Итого $798,00.
• Gemini 3.1 Pro на его тарифе свыше 200K: те же 5 000 млн входных токенов по $4,00 за миллион — это $20 000,00, а 80 млн выходных токенов по $18,00 за миллион — это $1 440,00. Итого $21 440,00.
Это 27-кратная разница в месячных расходах при одинаковом трафике, и это не та кратность, которую можно было бы предположить по заявленным числам. Заявленная кратность — 13×. Кратность, которую вы фактически платите за работу с длинным контекстом, — 27×, потому что граница уровня проходит ровно там, где находятся ваши промпты.
Во что вам на самом деле обходится метка предварительного просмотра
Предварительная сборка — это предварительная сборка во всей отрасли: она не даёт никаких опубликованных гарантий стабильности. Поставщик не обязался сохранять конечную точку с тем же поведением, по той же цене или под тем же названием. Это не критика Gemini 3.1 Pro — именно это означает данный ярлык, и именно поэтому суффикс Preview сохраняется уже семь месяцев, а не оказывается двухнедельной формальностью.
Для прототипа это ничего не значит. Для продакшн-пути это конкретный, измеримый риск: вы делаете ставку на то, что сборка, под которую вы настраивались, останется неизменной. Контраст с другой стороной этого сравнения — структурный, а не риторический. DeepSeek V4.1 Flash имеет статус GA, а его веса лицензированы по MIT и доступны для скачивания, что означает: даже если хостируемый API завтра изменит свои условия, сама модель всё равно останется в ваших руках. Закрытая preview-модель не даёт вам ни обязательства GA, ни запасного выхода. Если ваша нагрузка может работать на любом из них, эта разница стоит больше, чем один балл в бенчмарке.
Где Gemini 3.1 Pro — лучший инструмент
Разрыв модальностей — это не ошибка округления, и это единственное измерение в этом списке, где дешёвую модель нельзя заменить ни за какую цену. Gemini 3.1 Pro принимает аудио и видео как полноценные входные данные, а также загрузку файлов. DeepSeek V4.1 Flash работает с текстом и изображениями. Если ваш конвейер обрабатывает запись звонка, снимок экрана или видеообзор, DeepSeek V4.1 Flash — не более дешёвый вариант, а вообще не вариант. 13-кратная разница не имеет значения для задачи, которую одна модель может выполнить, а другая — нет.
Есть второй, менее заметный случай. Gemini 3.1 Pro в той или иной форме находится в открытом доступе с февраля, и это модель с более длительной историей эксплуатации — больше людей проверяли её пределы, а её поведение на реальном трафике задокументировано лучше, чем у релиза, которому двенадцать дней. Для интерактивной работы с интенсивным выводом, где медианное ожидание в десять секунд приемлемо, потому что задача выполняется в фоне, именно эта история и служит аргументом — и аргументом реальным. Это не аргумент о задержке: по приведённой выше телеметрии более дешёвая модель быстрее из этих двух как по медиане, так и по хвосту.
И есть вопрос о том, что означает метка предварительной версии для этой истории. Семь месяцев доступности под именем предварительной сборки — это дольше, чем достаётся большинству моделей, и это также семь месяцев без обязательства GA. DeepSeek V4.1 Flash на момент написания существует всего двенадцать дней, и её независимая история скудна: единственный недавний сторонний обзор, в котором она фигурирует, — доска Agents on Rails по агентному программированию, опубликованная 21 сентября 2026 года, — поставил её на 17% при максимальном усилии, в середине поля. Двенадцати дней недостаточно, чтобы репутация модели что-либо значила — в любую сторону, — и это честная причина, по которой покупатель может предпочесть здесь более старую модель, и это не имеет ничего общего со скоростью.
Маршрутизация по длине контекста, потому что именно это и есть настоящее решение
Решение, которое подразумевает это сравнение, — не «выбрать одно». Это правило из двух пунктов: работа с длинным контекстом и большим объёмом идёт в DeepSeek V4.1 Flash, а всё, что содержит аудио или видео, идёт в Gemini 3.1 Pro. Неудобство заключается в том, что это правило легко сформулировать, но раздражающе сложно реализовать, потому что эти два пункта обычно находятся у разных вендоров с разными ключами, разными SDK и разными лимитами запросов.
Обе модели доступны по одному ключу OrcaRouter, что превращает это правило в правило маршрутизации, а не в ветвление кода в вашем приложении — вы можете привязать решение напрямую к длине контекста запроса, а именно это измерение и определяет разницу в стоимости в данном случае. OrcaRouter передаёт цены провайдеров по прайс-листу с наценкой 0%, поэтому ступенчатые тарифы выше — это собственные тарифы Google, а пиковое расписание DeepSeek — собственное расписание DeepSeek, причём изменение цены вендором вступает в силу на нашей стороне в тот же день. А поскольку одна сторона этой пары — preview-сборка, автоматическое переключение при сбое стоит предусмотреть: если сборка обновится у вас под ногами, запрос уйдёт на другую модель, а не на страницу с ошибкой.
Этот последний пункт — практическое воплощение всего вышесказанного. Множитель 27× при работе с длинным контекстом — причина маршрутизировать, а не выбирать, а ярлык предварительной версии у одной из двух моделей — причина иметь место, куда запрос может уйти, когда сборка изменится.

Что посмотреть
• Выйдет ли Gemini 3.1 Pro из режима preview. Выпуск GA убрал бы оговорку о стабильности и изменил бы картину этого сравнения сильнее, чем любое изменение цены.
• Изменится ли уровень выше 200 000. Граница уровня играет в арифметике затрат бо́льшую роль, чем заявленная ставка.
• Накопит ли DeepSeek V4.1 Flash независимый послужной список. Модель с весами под лицензией MIT, потолком вывода 384K и контекстом 1M при $0.15 за миллион входных токенов — необычное сочетание; а есть ли для этого способности — вопрос, на который пока не ответил ни один публичный бенчмарк.
Пока не выйдет первое из этого, точная сводка такова: DeepSeek V4.1 Flash примерно в тринадцать раз дешевле на входе и в двадцать семь раз дешевле на входе с длинным контекстом, чем Gemini 3.1 Pro, только его из этих двух можно скачать, и только за ним из этих двух стоит обязательство по GA. Gemini 3.1 Pro — это модель с более длительной историей использования в продакшене, и только она из этих двух умеет читать аудио и видео. Маршрутизируйте запросы соответственно.

