
Qwen3.8-Flash-Next против Qwen3.8-27B: Qwen4-preview MoE против рабочей лошадки с открытыми весами
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 578 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 182 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Удивительно в Qwen3.8-Flash-Next не то, что Alibaba заявляет, будто модель, активирующая всего 6 миллиардов параметров на токен, обходит большинство открытых моделей, — а то, что для её обслуживания требуется больше памяти, чем для плотной модели на 27 миллиардов параметров, с которой её сравнивают. Qwen3.8-Flash-Next, опубликованная в открытом доступе 26 августа 2026 года как предварительная версия архитектуры Qwen4, хранит таблицу поиска N-грамм на 51 миллиард параметров в системной оперативной памяти, а не в видеопамяти; Qwen3.8-27B — мультимодальная плотная модель под лицензией Apache-2.0, выпущенная в середине августа и являющаяся рабочей лошадкой текущего поколения Qwen 3.8 с открытыми весами, — помещается на одну видеокарту с 24 ГБ памяти в 4-битном формате. В собственной бенчмарк-таблице Alibaba новая MoE-модель превосходит 27B по 21 из 22 сравниваемых бенчмарков. Что касается независимых свидетельств — позиций в аренах, исследования юридического агента, сторонних измерений пропускной способности — 27B — единственная из двух, у кого они есть. Именно это сочетание и есть всё решение.
Суть противостояния в одной строке: две модели с открытыми весами, работающие с текстом и изображениями, одного поколения, с одинаковым нативным контекстом 262K, обе созданы для работы вне дата-центра — и разделены архитектурой, лицензией, ценой и тем, насколько их история подтверждена. Qwen3.8-Flash-Next — это разреженная MoE, которая предвосхищает всё, что, как ожидается, унаследует Qwen4. Qwen3.8-27B — это плотная модель, которая сжимает то, что Alibaba вынесла при создании флагмана на 2.4T, в то, что может запустить одна видеокарта. Выбор между ними — это меньше про возможности (Alibaba утверждает, что предварительная версия впереди) и больше про то, доверяете ли вы однодневному паспорту вендора вместо модели, которую комьюнити уже разобрала по косточкам.
Табло
Сначала об источниках: каждый показатель Qwen3.8-Flash-Next ниже — собственный показатель Alibaba, которому один день и который никто не воспроизводил. Заявления о ключевых бенчмарках Qwen3.8-27B также предоставлены Alibaba, но у 27B есть независимые результаты — позиции в арене предпочтений людей, исследование в юридической области и измерения пропускной способности AMD, — которым предварительная версия не может соответствовать.
• Всего параметров — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B хранятся), 6B активных. Qwen3.8-27B: ~27B плотных (28B с визуальным энкодером), все активные.
• Архитектура — Qwen3.8-Flash-Next: превью Qwen4 — Qwen Sparse Attention в чередовании с Gated DeltaNet, стробированная остаточная связь, N-граммные эмбеддинги, обучение с помощью Muon. Qwen3.8-27B: 48 слоёв линейного внимания GDN плюс 16 слоёв полного внимания (3:1), плотная модель.
• Контекст — 262 144 токена нативно, расширяемый до 1M с помощью YaRN.
• Модальность — оба принимают текст, изображения и видео на входе и возвращают текст.
• Лицензия — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.
• Цена — Qwen3.8-Flash-Next: $0,16 / $0,47 за 1M (анонсирована; продакшн-API ещё не открыт). Qwen3.8-27B: $0,33 / $2,40 за 1M, уже доступна сегодня.
• Потребление памяти при запуске — Qwen3.8-Flash-Next: таблица 51B в ОЗУ хоста, ~96 ГБ системной памяти плюс любой GPU; FP8 ~186 ГБ, Q4 GGUF ~82 ГБ. Qwen3.8-27B: BF16 ~55,6 ГБ, 4-битный вариант помещается в карту на 24 ГБ.
• Независимые доказательства — Qwen3.8-Flash-Next: пока нет. Qwen3.8-27B: #1 открытая модель на Arena.ai Image-to-WebDev, #9 в общем зачёте на Code Arena WebDev, #1 open-weight на бенчмарке Harvey's Legal Agent, пропускная способность, измеренная AMD.

По собственным данным Alibaba, превью выигрывает почти всё.
Опубликованное Alibaba сравнение показывает, что Qwen3.8-Flash-Next получает равные или более высокие оценки по 21 из 22 языковых и визуальных бенчмарков по сравнению с Qwen3.8-27B, и эти победы не косметические. SWE-bench Pro 62.5 против 61.7 — незначительное лидерство, но DeepSWE 58.7 против 42.2, JobBench 55.7 против 33.4 и CoWorkBench 73.9 против 70.7 — это реальные разрывы именно на тех агентных и офисных рабочих нагрузках, на которые ориентирован flash-уровень. Главные цифры превью — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — также превосходят соответствующие строки 27B в таблице Alibaba. Это тезис релиза, выраженный в данных: большая часть способностей к рассуждению и написанию кода от более крупной линейки Qwen 3.8 при небольшой доле активных вычислений.
Оставьте ярлык прикреплённым к этому предложению. Это собственные оценки Alibaba, полученные на собственном стенде Alibaba; в случае предварительной версии им один день, и обе не были воспроизведены. Разбор архитектуры KGP Talkie, который фигурирует в этом сравнении, приходит к выводу того же вида, но он работает на основе того же вендорского листа. Вендорская таблица — это обещание; ничто в этом абзаце не было независимо подтверждено.
Что у 27B есть, а у Flash-Next нет: доказательства
Это тот момент, когда противостояние перестаёт быть односторонним. Qwen3.8-27B уже две недели находится в открытом доступе, и сообщество выдало три независимых точки данных. На лидерборде Arena.ai Image-to-WebDev — где люди вслепую голосуют, какой из двух анонимизированных результатов зритель предпочёл бы выпустить, — 27B занимает первое место среди открытых моделей и седьмое в общем зачёте с заявленным результатом 1 574. На соседнем лидерборде Code Arena WebDev она расположилась на девятом месте в общем зачёте с результатом 1 595 — единственная модель своего размерного класса в первой десятке. Harvey, компания, специализирующаяся на юридическом ИИ, и Engram провели исследование с синтетической юридической фирмой, которое поставило адаптированную 27B на первое место в их бенчмарке юридических агентов — с оговоркой, что модель предварительно изучила тестовый корпус, так что это демонстрация потенциала дообучения, а не оценка исходных весов. AMD опубликовала Day-0 замеры пропускной способности: 24,5 токена/с на Ryzen AI Max+ 395 и 51,8 токена/с на Radeon AI PRO R9700. Ни одна из этих метрик не является универсальной оценкой качества — индекса Artificial Analysis для 27B по-прежнему нет, — но каждая получена от третьей стороны, которая действительно запускала модель.
У Qwen3.8-Flash-Next ничего этого нет. Весь его бенчмарк-лист принадлежит Alibaba, ему всего несколько часов на момент написания, и ни одна независимая лаборатория не воспроизвела ни одной строки. Это не обвинение; это определение релиза, выпущенного день назад. Но именно эта асимметрия и должна определять выбор: предварительная версия впереди по единственным существующим цифрам, и каждая из этих цифр написана вендором, который хочет, чтобы вы в неё поверили.
Форк развертывания
Практическая разница между этими двумя моделями в том, где находятся параметры, и это определяет, какое оборудование вам нужно. Qwen3.8-Flash-Next намеренно выгружает свою таблицу N-граммных эмбеддингов размером 51B в память хоста, где она может асинхронно предзагружаться — именно поэтому она добавляет 51B параметров ёмкости без добавления вычислений на токен. Как следствие, модель не поместится в потребительскую карту на 24 ГБ, как раньше помещалась локальная Qwen. По оценкам сообщества, Q4 GGUF составит примерно 82 ГБ суммарно (около 58 ГБ основных весов плюс 24 ГБ таблицы поиска), сборка FP8 — около 186 ГБ, BF16 — около 360 ГБ; рабочая конфигурация — это машина с ~96 ГБ системной памяти плюс любая видеокарта, которая потянет активные 6B. Выгода в том, что вычисления на токен обходятся дёшево — главная ставка архитектуры — а длинный контекст на 1M токенов остаётся доступным, потому что слои GDN сжимают историю вместо роста KV-кэша.
Qwen3.8-27B — это модель наоборот: плотная, поэтому каждый токен задействует все 27B параметров, но достаточно компактная, чтобы целиком поместиться на оборудовании, которое у вас уже есть. Веса в BF16 занимают примерно 55,6 ГБ; в 4-битном формате она работает на видеокарте с 24 ГБ памяти, например RTX 3090 или 4090, а замеры AMD показывают от 24,5 до 51,8 токенов/с на оборудовании класса AI Max и Radeon PRO. Если ограничение — одна рабочая станция, то 27B — это та, которая реально подходит; если ограничение — стоимость за токен в масштабе, то Flash-Next выигрывает на бумаге.
Ценовая вилка
Цены на API рассказывают ту же историю с другой стороны. Qwen3.8-27B уже доступен на OrcaRouter сегодня по цене $0.33 за миллион входных токенов и $2.40 за миллион выходных токенов, цена провайдера передаётся без наценки — опция самохостинга стала доступной, без необходимости покупать GPU. Qwen3.8-Flash-Next пока никуда не маршрутизируется: открытые веса — единственный путь, пока продакшн-версия Qwen3.8-Flash не откроется на QwenCloud API по объявленной цене $0.16/$0.47. Когда этот API откроется, та же прямая передача цены установит $0.16/$0.47 на нашей стороне в тот же день, на том же ключе, что и для 27B, с автоматическим переключением между ними — так что способ внедрить однодневную архитектуру — это не ставить на неё продакшн, а направить на неё часть трафика, используя проверенную модель как запасной вариант. Маршрутизирующий слой также может стоять перед моделью, которую вы обслуживаете сами, — это практический путь оценить открытые веса Flash-Next уже сегодня без второй интеграции.

Какой запустить?
Выбирайте Qwen3.8-Flash-Next, если хотите уже сейчас двигаться в направлении Qwen4, если ваш объём нагрузки достаточно велик, чтобы $0.16/$0.47 против $0.33/$2.40 были реальной цифрой, или если у вас достаточно оперативной памяти для самостоятельного размещения и вас устраивает работа по прайс-листу вендора. Выбирайте Qwen3.8-27B, если вам нужны условия Apache-2.0, одна карта на 24 ГБ, модель, к которой можно обратиться уже сегодня, или любая степень независимых доказательств — это единственная из двух, которую кто-либо за пределами Alibaba запускал.

Два приведённых выше скриншота — это публичные страницы каждой половины: страница OrcaRouter, где Qwen3.8-27B доступна для вызова сегодня по цене $0.33/$2.40, и карточка модели Qwen/Qwen3.8-Flash-Next на Hugging Face.
И честный итог — это вопрос, потому что доказательная база существует всего один день: сможет ли модель, активирующая 6 миллиардов своих параметров, сохранить счёт 21 из 22 при независимом воспроизведении, или же N-граммовая таблица, которая делает её обслуживание экономным, окажется тем самым элементом, который подводит на реальных нагрузках? 27B уже выдержала две недели пристального внимания сообщества. Flash-Next находится там, где 27B была две недели назад, — и это лучший аргумент для запуска их бок о бок, а не выбора одного из них.
