Qwen3.8-Flash-Next против Qwen3.8-27B — MoE Qwen4-preview против рабочей лошадки с открытыми весами. Перегенерированная иллюстрация.
Guides & Insights

Qwen3.8-Flash-Next против Qwen3.8-27B: Qwen4-preview MoE против рабочей лошадки с открытыми весами

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Удивительно в Qwen3.8-Flash-Next не то, что Alibaba заявляет, будто модель, активирующая всего 6 миллиардов параметров на токен, обходит большинство открытых моделей, — а то, что для её обслуживания требуется больше памяти, чем для плотной модели на 27 миллиардов параметров, с которой её сравнивают. Qwen3.8-Flash-Next, опубликованная в открытом доступе 26 августа 2026 года как предварительная версия архитектуры Qwen4, хранит таблицу поиска N-грамм на 51 миллиард параметров в системной оперативной памяти, а не в видеопамяти; Qw​en3.8-27B — мультимодальная плотная модель под лицензией Apache-2.0, выпущенная в середине августа и являющаяся рабочей лошадкой текущего поколения Qw​en 3.8 с открытыми весами, — помещается на одну видеокарту с 24 ГБ памяти в 4-битном формате. В собственной бенчмарк-таблице Alibaba новая MoE-модель превосходит 27B по 21 из 22 сравниваемых бенчмарков. Что касается независимых свидетельств — позиций в аренах, исследования юридического агента, сторонних измерений пропускной способности — 27B — единственная из двух, у кого они есть. Именно это сочетание и есть всё решение.

Суть противостояния в одной строке: две модели с открытыми весами, работающие с текстом и изображениями, одного поколения, с одинаковым нативным контекстом 262K, обе созданы для работы вне дата-центра — и разделены архитектурой, лицензией, ценой и тем, насколько их история подтверждена. Qwen3.8-Flash-Next — это разреженная MoE, которая предвосхищает всё, что, как ожидается, унаследует Qwen4. Qwen3.8-27B — это плотная модель, которая сжимает то, что Alibaba вынесла при создании флагмана на 2.4T, в то, что может запустить одна видеокарта. Выбор между ними — это меньше про возможности (Alibaba утверждает, что предварительная версия впереди) и больше про то, доверяете ли вы однодневному паспорту вендора вместо модели, которую комьюнити уже разобрала по косточкам.

Табло

Сначала об источниках: каждый показатель Qwen3.8-Flash-Next ниже — собственный показатель Alibaba, которому один день и который никто не воспроизводил. Заявления о ключевых бенчмарках Qw​en3.8-27B также предоставлены Alibaba, но у 27B есть независимые результаты — позиции в арене предпочтений людей, исследование в юридической области и измерения пропускной способности AMD, — которым предварительная версия не может соответствовать.

• Всего параметров — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B хранятся), 6B активных. Qw​en3.8-27B: ~27B плотных (28B с визуальным энкодером), все активные.

• Архитектура — Qwen3.8-Flash-Next: превью Qwen4 — Qw​en Sparse Attention в чередовании с Gated DeltaNet, стробированная остаточная связь, N-граммные эмбеддинги, обучение с помощью Muon. Qw​en3.8-27B: 48 слоёв линейного внимания GDN плюс 16 слоёв полного внимания (3:1), плотная модель.

• Контекст — 262 144 токена нативно, расширяемый до 1M с помощью YaRN.

• Модальность — оба принимают текст, изображения и видео на входе и возвращают текст.

• Лицензия — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.

• Цена — Qwen3.8-Flash-Next: $0,16 / $0,47 за 1M (анонсирована; продакшн-API ещё не открыт). Qw​en3.8-27B: $0,33 / $2,40 за 1M, уже доступна сегодня.

• Потребление памяти при запуске — Qwen3.8-Flash-Next: таблица 51B в ОЗУ хоста, ~96 ГБ системной памяти плюс любой GPU; FP8 ~186 ГБ, Q4 GGUF ~82 ГБ. Qw​en3.8-27B: BF16 ~55,6 ГБ, 4-битный вариант помещается в карту на 24 ГБ.

• Независимые доказательства — Qwen3.8-Flash-Next: пока нет. Qwen3.8-27B: #1 открытая модель на Arena.ai Image-to-WebDev, #9 в общем зачёте на Code Arena WebDev, #1 open-weight на бенчмарке Harvey's Legal Agent, пропускная способность, измеренная AMD.

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

По собственным данным Alibaba, превью выигрывает почти всё.

Опубликованное Alibaba сравнение показывает, что Qwen3.8-Flash-Next получает равные или более высокие оценки по 21 из 22 языковых и визуальных бенчмарков по сравнению с Qw​en3.8-27B, и эти победы не косметические. SWE-bench Pro 62.5 против 61.7 — незначительное лидерство, но DeepSWE 58.7 против 42.2, JobBench 55.7 против 33.4 и CoWorkBench 73.9 против 70.7 — это реальные разрывы именно на тех агентных и офисных рабочих нагрузках, на которые ориентирован flash-уровень. Главные цифры превью — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — также превосходят соответствующие строки 27B в таблице Alibaba. Это тезис релиза, выраженный в данных: большая часть способностей к рассуждению и написанию кода от более крупной линейки Qw​en 3.8 при небольшой доле активных вычислений.

Оставьте ярлык прикреплённым к этому предложению. Это собственные оценки Alibaba, полученные на собственном стенде Alibaba; в случае предварительной версии им один день, и обе не были воспроизведены. Разбор архитектуры KGP Talkie, который фигурирует в этом сравнении, приходит к выводу того же вида, но он работает на основе того же вендорского листа. Вендорская таблица — это обещание; ничто в этом абзаце не было независимо подтверждено.

Что у 27B есть, а у Flash-Next нет: доказательства

Это тот момент, когда противостояние перестаёт быть односторонним. Qw​en3.8-27B уже две недели находится в открытом доступе, и сообщество выдало три независимых точки данных. На лидерборде Arena.ai Image-to-WebDev — где люди вслепую голосуют, какой из двух анонимизированных результатов зритель предпочёл бы выпустить, — 27B занимает первое место среди открытых моделей и седьмое в общем зачёте с заявленным результатом 1 574. На соседнем лидерборде Code Arena WebDev она расположилась на девятом месте в общем зачёте с результатом 1 595 — единственная модель своего размерного класса в первой десятке. Harvey, компания, специализирующаяся на юридическом ИИ, и Engram провели исследование с синтетической юридической фирмой, которое поставило адаптированную 27B на первое место в их бенчмарке юридических агентов — с оговоркой, что модель предварительно изучила тестовый корпус, так что это демонстрация потенциала дообучения, а не оценка исходных весов. AMD опубликовала Day-0 замеры пропускной способности: 24,5 токена/с на Ryzen AI Max+ 395 и 51,8 токена/с на Radeon AI PRO R9700. Ни одна из этих метрик не является универсальной оценкой качества — индекса Artificial Analysis для 27B по-прежнему нет, — но каждая получена от третьей стороны, которая действительно запускала модель.

У Qwen3.8-Flash-Next ничего этого нет. Весь его бенчмарк-лист принадлежит Alibaba, ему всего несколько часов на момент написания, и ни одна независимая лаборатория не воспроизвела ни одной строки. Это не обвинение; это определение релиза, выпущенного день назад. Но именно эта асимметрия и должна определять выбор: предварительная версия впереди по единственным существующим цифрам, и каждая из этих цифр написана вендором, который хочет, чтобы вы в неё поверили.

Форк развертывания

Практическая разница между этими двумя моделями в том, где находятся параметры, и это определяет, какое оборудование вам нужно. Qwen3.8-Flash-Next намеренно выгружает свою таблицу N-граммных эмбеддингов размером 51B в память хоста, где она может асинхронно предзагружаться — именно поэтому она добавляет 51B параметров ёмкости без добавления вычислений на токен. Как следствие, модель не поместится в потребительскую карту на 24 ГБ, как раньше помещалась локальная Qw​en. По оценкам сообщества, Q4 GGUF составит примерно 82 ГБ суммарно (около 58 ГБ основных весов плюс 24 ГБ таблицы поиска), сборка FP8 — около 186 ГБ, BF16 — около 360 ГБ; рабочая конфигурация — это машина с ~96 ГБ системной памяти плюс любая видеокарта, которая потянет активные 6B. Выгода в том, что вычисления на токен обходятся дёшево — главная ставка архитектуры — а длинный контекст на 1M токенов остаётся доступным, потому что слои GDN сжимают историю вместо роста KV-кэша.

Qw​en3.8-27B — это модель наоборот: плотная, поэтому каждый токен задействует все 27B параметров, но достаточно компактная, чтобы целиком поместиться на оборудовании, которое у вас уже есть. Веса в BF16 занимают примерно 55,6 ГБ; в 4-битном формате она работает на видеокарте с 24 ГБ памяти, например RTX 3090 или 4090, а замеры AMD показывают от 24,5 до 51,8 токенов/с на оборудовании класса AI Max и Radeon PRO. Если ограничение — одна рабочая станция, то 27B — это та, которая реально подходит; если ограничение — стоимость за токен в масштабе, то Flash-Next выигрывает на бумаге.

Ценовая вилка

Цены на API рассказывают ту же историю с другой стороны. Qw​en3.8-27B уже доступен на OrcaRouter сегодня по цене $0.33 за миллион входных токенов и $2.40 за миллион выходных токенов, цена провайдера передаётся без наценки — опция самохостинга стала доступной, без необходимости покупать GPU. Qwen3.8-Flash-Next пока никуда не маршрутизируется: открытые веса — единственный путь, пока продакшн-версия Qwen3.8-Flash не откроется на QwenCloud API по объявленной цене $0.16/$0.47. Когда этот API откроется, та же прямая передача цены установит $0.16/$0.47 на нашей стороне в тот же день, на том же ключе, что и для 27B, с автоматическим переключением между ними — так что способ внедрить однодневную архитектуру — это не ставить на неё продакшн, а направить на неё часть трафика, используя проверенную модель как запасной вариант. Маршрутизирующий слой также может стоять перед моделью, которую вы обслуживаете сами, — это практический путь оценить открытые веса Flash-Next уже сегодня без второй интеграции.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

Какой запустить?

Выбирайте Qwen3.8-Flash-Next, если хотите уже сейчас двигаться в направлении Qwen4, если ваш объём нагрузки достаточно велик, чтобы $0.16/$0.47 против $0.33/$2.40 были реальной цифрой, или если у вас достаточно оперативной памяти для самостоятельного размещения и вас устраивает работа по прайс-листу вендора. Выбирайте Qw​en3.8-27B, если вам нужны условия Apache-2.0, одна карта на 24 ГБ, модель, к которой можно обратиться уже сегодня, или любая степень независимых доказательств — это единственная из двух, которую кто-либо за пределами Alibaba запускал.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

Два приведённых выше скриншота — это публичные страницы каждой половины: страница OrcaRouter, где Qw​en3.8-27B доступна для вызова сегодня по цене $0.33/$2.40, и карточка модели Qwen/Qwen3.8-Flash-Next на Hugging Face.

И честный итог — это вопрос, потому что доказательная база существует всего один день: сможет ли модель, активирующая 6 миллиардов своих параметров, сохранить счёт 21 из 22 при независимом воспроизведении, или же N-граммовая таблица, которая делает её обслуживание экономным, окажется тем самым элементом, который подводит на реальных нагрузках? 27B уже выдержала две недели пристального внимания сообщества. Flash-Next находится там, где 27B была две недели назад, — и это лучший аргумент для запуска их бок о бок, а не выбора одного из них.