
Gemini 3.5 Flash-Lite против Qwen 3.8: Бюджетная рабочая лошадка против 2.4T флагмана
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 за 1 млн токенов · 56 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3150Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 200 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicНОВИНКАAnthropic: Claude Opus 52026-07-2461Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2150Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1651Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1557Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0854Интеллект72Кодинг
- tencentTencent: Hy32026-07-0641Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3053Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1651Интеллект69Кодинг60Математика
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Интеллект61Кодинг61Математика
Когда это сравнение было впервые написано, оно было необычно однобоким: Gemini 3.5 Flash-Lite был реальным, доступным для покупки продуктом, и Qwen 3.8 был закрытой предварительной версией без цены, без бенчмарков и без весов. Сравнивать было почти нечего.
Это уже не так. Qwen3.8-Max стал общедоступен 3 августа 2026 года с опубликованным прайс-листом $2 / $6 за миллион токенов, совместимой с OpenAI и DashScope конечной точкой и полной таблицей сравнительных показателей. Он работает в режиме самообслуживания, позволяет контролировать бюджет и доступен в реальном времени — в том числе на OrcaRouter. Поэтому эта статья была полностью переписана, потому что честное сравнение сегодня — это не «выпущенная модель против пустых обещаний». Это настоящий уровень сравнение: самая дешевая высокопроизводительная рабочая лошадка Google против крупнейшего флагмана Alibaba.
Примечание для разработчиков — эти две модели находятся на противоположных концах ценовой кривой, поэтому правильный вопрос — к какому уровню относится ваша нагрузка. OrcaRouter предоставляет доступ к 200+ моделям через одну конечную точку, совместимую с OpenAI, так что вы можете протестировать обе на одной и той же задаче без подключения двух SDK.
Краткий вердикт. Эти модели на самом деле не конкурируют — они отвечают на разные вопросы. Flash-Lite — это экономичная модель: индекс Artificial Analysis 36, $0.30 / $2.50 за 1M, примерно 490 токенов/сек, общедоступна. Она рассчитана на обработку каждого запроса с ничтожными затратами. Qwen3.8-Max — это флагман: ~2,4 трлн параметров, контекст на 1M токенов по фиксированному тарифу, нативный ввод изображений и видео, а также заявленные производителем показатели уровня передовых моделей (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) — по цене $2 / $6, что в 6,7 раза превышает тариф Flash-Lite на входные токены. Flash-Lite — правильный выбор по умолчанию для высоконагруженной классификации, маршрутизации и извлечения данных. К Qwen3.8-Max переходят, когда задача действительно требует рассуждений уровня передовых моделей, контекста в миллион токенов или нетекстового ввода. Единственная оговорка, которая не изменилась: у Qwen по-прежнему нет независимых результатов бенчмарков.
Основные выводы
• Qwen 3.8 теперь общедоступен — по состоянию на 3 августа 2026 года опубликованы цены, открыт самостоятельный доступ и представлена таблица бенчмарков. Прежнее описание закрытой предварительной версии, не поддающейся бюджетированию, устарело.
• Flash-Lite значительно дешевле: $0.30 / $2.50 за 1M по сравнению с Qwen $2 / $6 — примерно в 6.7× на входе и 2.4× на выходе.
• Flash-Lite намного быстрее: примерно 490 токенов/сек, создан для высокопроизводительной работы. Qwen3.8-Max показывает p50-время до первого токена 1,64 с в 7-дневной телеметрии OrcaRouter, но является большой и основательной моделью.
• Flash-Lite имеет единственный проверенный аудитом балл: Artificial Analysis Index 36. Qwen3.8-Max остаётся неоценённым ни одним независимым оценщиком, хотя Alibaba теперь публикует собственные цифры.
• Qwen уверенно выигрывает по совокупности возможностей: контекст на 1 млн токенов по фиксированной цене без наценки за длинные запросы, плюс ввод текста/изображений/видео и OmniDocBench 1.5 92.1 для разбора документов. Flash-Lite — это небольшая эффективная модель.
• Открытые веса: Qwen обещают в течение недели (лицензии пока нет), плюс Qwen3.8-27B как сообщается, работает в ~17 ГБ VRAM. Flash-Lite закрыт навсегда.
Примечание о точности: все показатели качества Qwen3.8-Max сообщены Alibaba и не проверены третьими сторонами. Показатели Gemini 3.5 Flash-Lite взяты из Artificial Analysis. Ценообразование Qwen — это тарифная карта GA из Alibaba Model Studio, которая заменяет доступ в эпоху предварительного просмотра, описанный в более ранних версиях этой статьи.
Характеристики и цена, бок о бок
• Производитель / статус — Flash-Lite: Google; общедоступен; Qwen3.8-Max: Alibaba; GA (3 августа 2026 года)
• Позиционирование — Flash-Lite: недорогой, высокопроизводительный уровень эффективности; Qwen3.8-Max: флагман / амбиции на передовую
• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: Всё ещё не оценено
• Показатели, заявленные вендором — Flash-Lite: результат измерен третьей стороной; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (все данные Alibaba)
• Цена (за 1M, вход/выход) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, фиксированная для контекста 1M; кэшированный ввод $0.25
• Скорость — Flash-Lite: ~490 ток/с (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1.64 с (OrcaRouter 7-дневная телеметрия)
• Контекст — Flash-Lite: контекст уровня эффективности; Qwen3.8-Max: 1M токенов (983,616 с размышлением; максимальный вывод 131,072)
• Модальность — Flash-Lite: эффективная модель для работы с текстом; Qwen3.8-Max: текст, изображение, видео на входе → текст на выходе
• Веса — Flash-Lite: закрыты, только через API; Qwen3.8-Max: обещаны в течение недели, лицензии пока нет
• Доступ сегодня — Flash-Lite: стандартный API, самообслуживание; Qwen3.8-Max: стандартный API, самообслуживание (Model Studio, DashScope, OrcaRouter)
При таком представлении вывод совершенно иной, чем раньше. Колонка Qwen больше не пуста — она заполнена, и в нескольких строках она оказывается более сильным вариантом. На смену старой схеме «известная величина против обещания» приходит очевидный разрыв между уровнями: Flash-Lite примерно в 6,7 раза дешевле на входе и примерно в 13 раз быстрее по пропускной способности, тогда как Qwen предлагает мультимодальный контекст на миллион токенов и заявленные рассуждения передового уровня.Оба — полноценные продукты; просто они выполняют разные задачи.
Единственная строка, где по-прежнему действует старая предосторожность, — это бенчмарк-линия. Индекс 36 Flash-Lite был измерен Artificial Analysis на публичной таблице лидеров. Каждый показатель Qwen — GPQA Diamond 92.6, Terminal-Bench 86.6 и остальные — был получен Alibaba на собственном стенде. Это реальное улучшение по сравнению с публикацией ничего, но это не сторонняя верификация, и лаборатории публикуют те бенчмарки, в которых побеждают.

Индекс 36 против неоценённого флагмана: если честно это читать
Заманчиво поставить Index 36 от Flash-Lite против GPQA Diamond 92.6 от Qwen и объявить разгром. Это была бы категориальная ошибка дважды.
Во-первых, индекс интеллекта Artificial Analysis — это составной показатель по множеству задач; GPQA Diamond — это один тест уровня выпускника в области естественных наук. Они не находятся на одной шкале, и их нельзя вычитать друг из друга.
Во-вторых, и, что более важно, Flash-Lite никогда не был рассчитан на высокие результаты. Индекс 36 — это то, как выглядит эффективная модель. Инженерная цель Google заключалась в создании модели, достаточно дешёвой и быстрой, чтобы ставить её перед каждым входящим запросом — маршрутизация заявок, классификация, извлечение информации, суммаризация в больших объёмах — где передовая модель была бы экономически абсурдной. Оценивать её по потолку логических рассуждений в сравнении с флагманом с 2.4T параметров — значит упускать, для чего она предназначена.
Что мы можем сказать, — это уже и полезнее. Qwen3.8-Max, скорее всего, является значительно более способной моделью — её собственные заявленные показатели намного выше, чем могла бы дать модель Index-36, а скачок FrontierSWE до 73.5 с 40.7 у предшественника свидетельствует о реальном прогрессе. Но «скорее всего» остаётся предположением, поскольку ни один независимый оценщик не проверял её. Для контекста: предшественник Qwen3.7-Max набрал 46 по индексу AA — выше, чем показатель Flash-Lite (36), но далеко до передовых моделей, — так что предполагаемый поколенческий скачок Alibaba велик и неподтверждён.
Практическое следствие: если ваша задача — одна из тех, что Flash-Lite уже корректно выполняет, более высокий потолок Qwen не стоит для вас ничего, и вы будете платить за него в 6,7 раза больше. Потолок имеет значение только тогда, когда Flash-Lite на самом деле не справляется.
Стоимость на практике: разрыв уровней в цифрах
Возьмите задачу классификации с высоким объемом: 2000 токенов на входе, 200 токенов на выходе, выполняемую 500 000 раз в день — реалистичный сценарий для поддержки триажа или маршрутизации контента.
• Flash-Lite: за вызов, 0.002M × $0.30 = $0.0006, плюс 0.0002M × $2.50 = $0.0005. ≈ $0.0011 за вызов → ~$550/день.
• Qwen3.8-Max: за вызов, 0.002M × $2 = $0.004, плюс 0.0002M × $6 = $0.0012. ≈ $0.0052 за вызов → ~$2,600/день.
• Ежемесячно: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — разница в $61,500 при том же объёме задач.
При таком масштабе выбор уровня — самая крупная статья расходов в системе, и очень трудно оправдать флагманскую модель для работы, с которой справляется эффективная модель. Именно для этого сценария и существует Flash-Lite.
Теперь наоборот. Возьмём задачу с длинным документом: 600 000 токенов контекста, 5 000 токенов вывода, 200 раз в день.
• Qwen3.8-Max: 0.6M × $2 = $1.20, плюс 0.005M × $6 = $0.03. ≈ $1.23 за вызов, без надбавки за длинный промпт — и примерно $0.18 при кэшировании контекста по цене $0.25/1M.
• Flash-Lite вообще нельзя оценить для этой конфигурации, потому что контекст в 600 000 токенов за один вызов — это не то, на что рассчитана модель эконом-класса.
Итак, ответ полностью меняется в зависимости от формы рабочей нагрузки — в этом и есть настоящий урок. Flash-Lite выигрывает в высокообъёмных задачах с коротким контекстом с огромным отрывом. Qwen побеждает во всём, что требует миллиона токенов или не текстового ввода, где Flash-Lite — не более дешёвый вариант, а просто не вариант.

Сценарии: какой тариф подходит
Сортировка и маршрутизация обращений в поддержку при больших объёмах.Flash-Lite, однозначно. Индекса 36 достаточно для классификации, и при примерно $0.0011 за вызов вы можете прогнать через него каждую заявку. Передавайте более крупной модели лишь меньшинство неоднозначных случаев.
Анализ контракта или документа целиком. Qwen3.8-Max. Контекст в 1 млн токенов по фиксированной ставке означает, что документ на 400 страниц обрабатывается за один вызов без дополнительной платы и без разбиения на части, а заявленный показатель OmniDocBench 1.5 — 92.1 — ориентирован именно на такую работу.
Конвейеры скриншотов, диаграмм или видео.Qwen3.8-Max по умолчанию — принимает изображения и видео на вход и демонстрирует результат OSWorld-Verified 86.1 при управлении реальным GUI. Flash-Lite не подходит для нетекстового ввода.
Агентное программирование. Qwen3.8-Max по заявленным показателям (Terminal-Bench 2.1 — 86.6, FrontierSWE — 73.5), с оговоркой, что ни один из них независимо не подтверждён, а самый слабый из самостоятельно заявленных показателей — IFBench 82.8 на следование инструкциям, что представляет собой реальный риск для конвейеров, анализирующих вывод каждого шага.
Двухъярусная архитектура. Часто правильный ответ — оба варианта: Flash-Lite как дешёвый первый проход для каждого запроса, Qwen3.8-Max как путь эскалации для небольшой доли запросов, которым нужен миллион токенов, изображение или настоящее рассуждение. Такая схема даёт большую часть ценового преимущества Flash-Lite, оставляя при этом доступным передовой вариант.
Самохостинг и открытость
Flash-Lite закрыт и доступен только через API, навсегда — самостоятельное размещение невозможно.
Веса Qwen3.8-Max обещаны на этой неделе, но флагман не является реалистичной целью: примерно 1,2 ТБ в 4-битном формате против примерно 141 ГБ на H200 означает восемь или более топовых ускорителей, а Alibaba до сих пор не раскрыла количество активных параметров, так что пропускную способность, которую можно получить за такое вложение, невозможно смоделировать. Лицензионного текста тоже пока нет, что означает, что коммерческая применимость формально не определена.
Одновременно анонсированная модель Qwen3.8-27B — это релиз, который действительно важен для on-premise-планов. Также выпускаемая с открытыми весами и, по сообщениям, работающая примерно в 17 ГБ видеопамяти, она является реальным вариантом для self-hosting — и, что примечательно, гораздо более близким конкурентом Flash-Lite в нише эффективности, чем флагман на 2.4T.
Часто задаваемые вопросы
Могу ли я использовать Qwen 3.8 сегодня?
Да. Qwen3.8-Max стал общедоступным 3 августа 2026 года с опубликованными ценами $2 / $6 за 1 млн токенов и совместимой конечной точкой OpenAI и DashScope. Он доступен для самостоятельного использования через Alibaba Model Studio, DashScope и OrcaRouter. Более ранние версии этой статьи описывали ограниченный предварительный доступ; это устарело.
Что дешевле?
Gemini 3.5 Flash-Lite с большим отрывом: $0.30 / $2.50 за 1M против $2 / $6 у Qwen3.8-Max — примерно в 6,7 раза дешевле по входу и в 2,4 раза по выходу. При высокообъёмной работе с коротким контекстом эта разница перевешивает все остальные соображения.
Что лучше?
Это разные уровни. У Flash-Lite единственный проверенный результат (AA Index 36), но он создавался для дешёвой пропускной способности, а не для рассуждений. Qwen3.8-Max, скорее всего, гораздо более мощный — его самостоятельно заявленные результаты GPQA Diamond 92.6 и Terminal-Bench 2.1 86.6 соответствуют уровню передовых моделей — однако у него нет независимого бенчмарка, так что это остаётся предположением, а не измеренным результатом.
Что быстрее?
{{1}}Flash-Lite, существенно.{{/1}} {{2}}Artificial Analysis показывает примерно 490 токенов/сек, что и является целью его дизайна эффективного уровня.{{/2}} Qwen3.8-Max показывает p50 время до первого токена 1,64 секунды {{3}}в 7-дневной телеметрии OrcaRouter{{/3}}, но это крупная, основательная модель, и рецензенты эпохи предварительного просмотра находили её медленной на длинных агентных сборках.
У Qwen 3.8 уже есть открытые веса?
Пока нет. Alibaba сообщает, что веса флагманской модели появятся в течение недели, но лицензии, карточки модели или репозитория всё ещё нет. Даже после релиза модели на 2,4 трлн параметров потребуется восемь или более GPU класса H200. Анонсированная одновременно Qwen3.8-27B, по сообщениям, требующая ~17 ГБ видеопамяти, является практичным вариантом для самостоятельного хостинга.
Стоит ли использовать оба?
Часто да. Двухуровневая схема — {{1}}Flash-Lite как дешёвый первый проход для каждого запроса, Qwen3.8-Max как эскалационный уровень для длинноконтекстных, мультимодальных или по-настоящему сложных задач{{/1}} — сохраняет большую часть ценового преимущества Flash-Lite, предоставляя вам передовой вариант, который оправдывает свою цену.
Что мне выбрать для продакшена сегодня?
Flash-Lite для высокообъёмных задач с коротким контекстом и только текстом, где достаточно Index 36 — он дёшев, быстр, проверен и надёжен. Qwen3.8-Max — когда рабочей нагрузке требуется контекст на миллион токенов, ввод изображений или видео, или рассуждения, с которыми Flash-Lite явно не справляется. Обе модели теперь действительно пригодны для развёртывания, чего не было, когда это сравнение было впервые написано.
Суть
Gemini 3.5 Flash-Lite против Qwen 3.8Раньше это было сравнение продукта и анонса. Теперь уже нет. С 3 августа 2026 года Qwen3.8-Max общедоступен, имеет цену, самообслуживание и документацию — поэтому честная постановка вопроса — это выбор уровня, а не оценка готовности.
Flash-Lite {{1}}остаётся правильным выбором по умолчанию для работы, для которой он был создан: при $0,30 / $2,50 и ~490 токенов/сек он обрабатывает каждый запрос за копейки, а его проверенный Индекс 36{{/1}} вполне достаточен для классификации, маршрутизации и извлечения. Qwen3.8-Max {{2}}— это уровень эскалации: контекст на миллион токенов по фиксированной ставке, нативный ввод изображений и видео, заявленные рассуждения передового уровня{{/2}} — примерно в 6,7 раза дороже по стоимости ввода. Его единственная нерешённая слабость {{3}}остаётся прежней: ни один независимый оценщик не выставил ему оценку, поэтому его обоснование качества опирается на собственную таблицу Alibaba{{/3}}. Следите за {{4}}первой независимой оценкой Индекса интеллекта{{/4}} и {{5}}весами Qwen3.8-27B, которые составят гораздо более прямую конкуренцию нише Flash-Lite{{/5}}. А пока выбирайте, исходя из формы рабочей нагрузки, — и рассмотрите возможность использования обоих.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
