Знакомьтесь с Qwen3.8-Flash — мультимодальная MoE-модель с открытыми весами, демонстрирующая архитектуру Qwen4. Регенерированная иллюстрация.
Guides & Insights

Знакомьтесь с Qwen3.8-Flash: мультимодальная MoE-модель с открытыми весами, предвосхищающая архитектуру Qwen4 — $0,15/$0,47 за 1 млн токенов на QwenCloud

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

26 августа 2026 года команда Qwen опубликовала в открытом доступе веса, лежащие в основе Qwen3.8-Flash — выпущенные на Hugging Face и ModelScope под названием Qwen3.8-Flash-Next — и запустила продакшн-модель, которая носит имя Qwen3.8-Flash, в QwenCloud API, подтвердив её официальные цены на следующий день. Главная цифра — официально подтверждённая в собственном анонсе Alibaba 28 августа, — это мультимодальная модель со смесью экспертов на 125 миллиардов параметров, которая активирует лишь около 6 миллиардов параметров на токен, что даёт разреженность примерно 95%; она построена на архитектуре, которую Alibaba прямо описывает как раннюю предварительную версию поколения Qwen4. Продакшн-API уже доступен на QwenCloud: $0,15 за миллион входных токенов, $0,47 за миллион выходных токенов и $0,016 за миллион при попадании в кэш. Это самый дешёвый способ запускать нечто, структурно происходящее от следующего флагмана Alibaba, и первый случай, когда лаборатория выпустила предварительную версию архитектуры как публичные открытые веса до появления полного семейства моделей.

Одно число значит больше, чем весь остальной список характеристик: {{1}}6B{{/1}}. Qwen3.8-Flash получает свои возможности не за счет грубой силы размера, а за счет того, куда направляет вычисления. {{2}}Тело MoE на 125B{{/2}}, {{3}}таблица эмбеддингов N-gram на 51B{{/3}} и {{4}}небольшой модуль предсказания нескольких токенов{{/4}} хранят на диске около {{5}}180B{{/5}} параметров, однако каждый токен проходит всего через {{6}}6B{{/6}} из них. Именно на этой {{7}}ставке{{/7}} держится весь этот релиз, и именно поэтому {{8}}счет за обучение{{/8}} так сильно снизился.

Что на самом деле было выпущено

Qwen3.8-Flash, без суффикса, — это продакшн-модель, которая теперь доступна в QwenCloud API и в продукте Alibaba Qw​en Office; она поставляется с контекстом по умолчанию в 1 млн токенов и встроенными инструментами по цене $0.15/$0.47 за миллион токенов, при попадании в кэш — $0.016. 28 августа список доступности расширился: согласно объявлению Alibaba, Qwen3.8-Flash теперь также доступен через OpenCode Go — подписку с фиксированной ставкой для агента написания кода в терминале с открытым исходным кодом; в собственном списке моделей OpenCode она указана как qwen3.8-flash по тем же ставкам $0.15/$0.47 за миллион.

A screenshot of the official Qwen Studio blog post 'Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency' (captured August 27, 2026), showing the Qwen Studio navigation bar, the article headline, and the 'Now Open Weights' announcement banner.

В официальном анонсе Qwen Studio выпуск открытых весов подаётся как приглашение экосистеме: внести структурные изменения заранее, чтобы сообщество и стеки для инференса успели адаптироваться до того, как будет выстроена полная линейка Qwen4. Первым признаком того, что это сработало, стал SGLang — движок инференса от LMSYS — опубликовавший поддержку Qwen3.8-Flash-Next в день релиза; модель также настроена для Transformers, vLLM и TokenSpeed.

Архитектура — это история.

Это не уменьшенная версия модели поколения Qw​en 3.8. Qwen3.8-Flash вносит четыре изменения, которые, по словам команды, унаследует семейство Qwen4, и каждое из них нацелено на своё узкое место.

• Внимание — Gated DeltaNet плюс Qw​en Sparse Attention. Gated DeltaNet (GDN) сжимает историю в состояния фиксированного размера в трёх из каждых четырёх слоёв, поэтому модель не перечитывает всё на каждом шаге; затем QSA рассматривает длинный контекст как задачу поиска — легковесный индексатор агрегирует последовательность в микроблоки, оценивает важность блоков и направляет внимание на наиболее релевантные области. По измерениям Alibaba, ядро внимания QSA достигает ускорения prefill до 7.6× и decode до 4.9× при контексте в 1M токенов (по данным производителя).

• Остаточный — гейтированный остаточный. Единый остаточный поток разделяется на четыре параллельные ветви с поэлементным гейтингом, что позволяет сети для каждого токена решать, сколько читать и записывать в каждой ветви; одна ветвь становится каналом дальней связи, соединяющим ранние слои внимания с глубокими. Остаточные состояния хранятся в FP8 для снижения пропускной способности памяти.

• Встраивание — n-граммные встраивания. Таблица поиска на 51 млрд параметров, ключом которой является текущий токен и несколько предыдущих. Она добавляет ёмкость без увеличения вычислений на токен, и поскольку таблица может находиться в памяти хоста и асинхронно предварительно загружаться, она не занимает постоянно память GPU.

• Оптимизатор — Muon. Большие 2D-линейные параметры (внимание, GDN, эксперты MoE) обучаются с Muon, тогда как эмбеддинги, роутер и низкоранговые части Gated Residual используют AdamW; команда заново подогнала закон масштабирования для новой архитектуры с учётом такого сочетания.

A single-column spec-sheet scoreboard titled 'Qwen3.8-Flash — the scoreboard' with the subtitle 'The 6B-active MoE that previews Qwen4', six rows reading 'Params: 125B MoE + 51B N-gram (~180B stored)', 'Active per token: ~6B (<5% activation)', 'Architecture: Qwen4 preview (QSA + GDN, gated residual, Muon)', 'Context: 262K native / 1M via YaRN', 'Price: $0.16 / $0.47 per 1M tokens', 'Open weights: Qwen3.8-Flash-Next (FP8 build available)', and a footer 'Benchmark figures vendor-reported; pricing as announced by Alibaba'; the OrcaRouter logo is composited in the bottom-right corner.

Для разработчика два из них имеют непосредственное значение: стек внимания — это причина, по которой контекст в 1 млн токенов может быть стандартом по умолчанию, а не амбициозной целью, а N-граммная таблица — почему модель на 125B параметров всё ещё может обслуживаться легко. Остальное — это превью-материал для Qwen4 — именно так Alibaba его позиционирует.

Бенчмарк-лист с честной маркировкой

Каждое число в этом разделе — собственная оценка Alibaba: этим данным один день, и на момент написания они не были воспроизведены ни одной независимой лабораторией. Относитесь к ним как к ориентировочным показателям, а не как к окончательным результатам. На наборе тестов Alibaba Qwen3.8-Flash-Next (6B активных) показывает SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5 и MathVision 95.7, а оценка JobBench составляет 55.7. Базовая версия, Qwen3.8-Flash-Next-Base, по сообщениям, является лучшей открытой моделью по 8 из 14 бенчмарков в попарном сравнении, включая MMLU-Pro, SuperGPQA, BBH и MMMU.

Заявления Alibaba о позиционировании в семействе следует называть тем, чем они являются — заявлениями. Компания утверждает, что Qwen3.8-Flash обходит Claude Opus 4.6 на 9,1 балла в SWE-bench Pro и примерно на 20 баллов в JobBench, а также вплотную приближается к Claude Opus 4.8. Всё это — данные вендора, и ни одно не воспроизведено независимо. Что можно проверить независимо уже сегодня, так это более узкий круг вещей: веса выложены, стек инференса уже их запускает, а SGLang добавил поддержку в тот же день. До независимого воспроизведения бенчмарк-таблицы — дни, а не недели.

Сколько это стоит

Цены легче всего проверить, потому что это опубликованная цена, а не бенчмарк — и 27 августа Alibaba официально подтвердила производственные тарифы QwenCloud: $0,15 за миллион входных токенов, $0,47 за миллион выходных токенов и $0,016 за миллион при попадании в кэш, при этом внутренний тариф для Китая составляет ¥0,8/¥2,7/¥0,1. Показатель попаданий в кэш — вот что важно для агентных нагрузок: длинноконтекстный агент, который каждый раз перечитывает большую историю, платит копейки за повторные чтения, и это именно та нагрузка, на которую нацелен стек внимания Qwen4-preview. Китайская пресса немедленно сравнила заявленную цену с аналогами — примерно треть того, что берёт DeepSeek-V4-Flash, и погрешность в сравнении с закрытыми фронтирными моделями. По собственным подсчётам Alibaba, обучение обошлось примерно в одну девятую от Qwen3.7-Plus, и именно этот структурный рычаг позволяет цене API оставаться на текущем уровне.

Рядом с остальным семейством Qw​en 3.8 разрыв очевиден: флагманская модель Qwen3.8-Max тарифицируется по $2.00 и $6.00 за миллион токенов, и она уже доступна на OrcaRouter по цене провайдера без наценки. Теперь, когда производственный API Qwen3.8-Flash открыт, та же сквозная ставка применяется к официальному тарифу $0.15/$0.47 и к тарифу $0.016 за попадание в кэш — маршрутизирующий слой — вот что отличает чтение о снижении цены от его наличия в конфиге. Обе модели за одним ключом, отказоустойчивость между ними, без второго контракта.

Что означает «предварительная версия Qwen4»?

Если читать анонс буквально, ставки очевидны: это не новый уровень Qw​en 3.8 — это архитектура Qwen4, выпущенная раньше времени под защитным брендом более маленькой и дешёвой модели. Причины для этого разумны: фреймворки, квантование и паттерны развёртывания должны созреть, а модель с 6B активных параметров — дешёвый способ для сообщества протестировать под нагрузкой GDN + QSA в масштабе, прежде чем Alibaba построит на этой основе нечто дорогое. Обратная сторона в том, что продакшн-версия Qwen3.8-Flash — это API, построенный на архитектуре, которую более широкая экосистема всё ещё проверяет. Ранние пользователи, по построению, и есть тестовый набор.

Быстрый способ попробовать это

Сегодня у вас есть четыре реальных варианта. Запустите открытые веса самостоятельно через vLLM, SGLang, Transformers или TokenSpeed — сборка FP8 — разумная отправная точка для всего, что меньше полного узла. Вызовите API QwenCloud, который теперь доступен по официальной ставке $0,15/$0,47 с попаданиями в кэш по $0,016. Используйте его в OpenCode Go — подписке с фиксированной ставкой для открытого терминального агента для написания кода, — которая добавила Qwen3.8-Flash на этой неделе (анонсировано Alibaba 28 августа, подтверждено в списке моделей OpenCode). Или вызывайте production-версию Flash через роутер так же, как вы уже вызываете Qwen3.8-Max, с официальной ставкой без наценки — никакой индивидуальной интеграции для поддержки.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the model description stating the artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default and built-in tools, plus License 'qwen-community-1.0', Model size 180B params, Tensor type BF16, and 2,551 downloads last month.

Открытый вопрос — честный вопрос: сможет ли модель, активирующая 6 миллиардов своих параметров, устоять в продакшене при самых разных нагрузках, или же таблица бенчмарков, которая сегодня выглядит свежей, останется такой же и через месяц? Это не повод ждать — это повод поставить её за фейловер, а не перед всем вашим стеком. Веса выложены, цена установлена, а архитектура — это объявленное направление Alibaba. Ближайшие недели решают, хватило ли 6B.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube