
Знакомьтесь с Qwen3.8-Flash: мультимодальная MoE-модель с открытыми весами, предвосхищающая архитектуру Qwen4 — $0,15/$0,47 за 1 млн токенов на QwenCloud
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
26 августа 2026 года команда Qwen опубликовала в открытом доступе веса, лежащие в основе Qwen3.8-Flash — выпущенные на Hugging Face и ModelScope под названием Qwen3.8-Flash-Next — и запустила продакшн-модель, которая носит имя Qwen3.8-Flash, в QwenCloud API, подтвердив её официальные цены на следующий день. Главная цифра — официально подтверждённая в собственном анонсе Alibaba 28 августа, — это мультимодальная модель со смесью экспертов на 125 миллиардов параметров, которая активирует лишь около 6 миллиардов параметров на токен, что даёт разреженность примерно 95%; она построена на архитектуре, которую Alibaba прямо описывает как раннюю предварительную версию поколения Qwen4. Продакшн-API уже доступен на QwenCloud: $0,15 за миллион входных токенов, $0,47 за миллион выходных токенов и $0,016 за миллион при попадании в кэш. Это самый дешёвый способ запускать нечто, структурно происходящее от следующего флагмана Alibaba, и первый случай, когда лаборатория выпустила предварительную версию архитектуры как публичные открытые веса до появления полного семейства моделей.
Одно число значит больше, чем весь остальной список характеристик: {{1}}6B{{/1}}. Qwen3.8-Flash получает свои возможности не за счет грубой силы размера, а за счет того, куда направляет вычисления. {{2}}Тело MoE на 125B{{/2}}, {{3}}таблица эмбеддингов N-gram на 51B{{/3}} и {{4}}небольшой модуль предсказания нескольких токенов{{/4}} хранят на диске около {{5}}180B{{/5}} параметров, однако каждый токен проходит всего через {{6}}6B{{/6}} из них. Именно на этой {{7}}ставке{{/7}} держится весь этот релиз, и именно поэтому {{8}}счет за обучение{{/8}} так сильно снизился.
Что на самом деле было выпущено
Qwen3.8-Flash, без суффикса, — это продакшн-модель, которая теперь доступна в QwenCloud API и в продукте Alibaba Qwen Office; она поставляется с контекстом по умолчанию в 1 млн токенов и встроенными инструментами по цене $0.15/$0.47 за миллион токенов, при попадании в кэш — $0.016. 28 августа список доступности расширился: согласно объявлению Alibaba, Qwen3.8-Flash теперь также доступен через OpenCode Go — подписку с фиксированной ставкой для агента написания кода в терминале с открытым исходным кодом; в собственном списке моделей OpenCode она указана как qwen3.8-flash по тем же ставкам $0.15/$0.47 за миллион.

В официальном анонсе Qwen Studio выпуск открытых весов подаётся как приглашение экосистеме: внести структурные изменения заранее, чтобы сообщество и стеки для инференса успели адаптироваться до того, как будет выстроена полная линейка Qwen4. Первым признаком того, что это сработало, стал SGLang — движок инференса от LMSYS — опубликовавший поддержку Qwen3.8-Flash-Next в день релиза; модель также настроена для Transformers, vLLM и TokenSpeed.
Архитектура — это история.
Это не уменьшенная версия модели поколения Qwen 3.8. Qwen3.8-Flash вносит четыре изменения, которые, по словам команды, унаследует семейство Qwen4, и каждое из них нацелено на своё узкое место.
• Внимание — Gated DeltaNet плюс Qwen Sparse Attention. Gated DeltaNet (GDN) сжимает историю в состояния фиксированного размера в трёх из каждых четырёх слоёв, поэтому модель не перечитывает всё на каждом шаге; затем QSA рассматривает длинный контекст как задачу поиска — легковесный индексатор агрегирует последовательность в микроблоки, оценивает важность блоков и направляет внимание на наиболее релевантные области. По измерениям Alibaba, ядро внимания QSA достигает ускорения prefill до 7.6× и decode до 4.9× при контексте в 1M токенов (по данным производителя).
• Остаточный — гейтированный остаточный. Единый остаточный поток разделяется на четыре параллельные ветви с поэлементным гейтингом, что позволяет сети для каждого токена решать, сколько читать и записывать в каждой ветви; одна ветвь становится каналом дальней связи, соединяющим ранние слои внимания с глубокими. Остаточные состояния хранятся в FP8 для снижения пропускной способности памяти.
• Встраивание — n-граммные встраивания. Таблица поиска на 51 млрд параметров, ключом которой является текущий токен и несколько предыдущих. Она добавляет ёмкость без увеличения вычислений на токен, и поскольку таблица может находиться в памяти хоста и асинхронно предварительно загружаться, она не занимает постоянно память GPU.
• Оптимизатор — Muon. Большие 2D-линейные параметры (внимание, GDN, эксперты MoE) обучаются с Muon, тогда как эмбеддинги, роутер и низкоранговые части Gated Residual используют AdamW; команда заново подогнала закон масштабирования для новой архитектуры с учётом такого сочетания.

Для разработчика два из них имеют непосредственное значение: стек внимания — это причина, по которой контекст в 1 млн токенов может быть стандартом по умолчанию, а не амбициозной целью, а N-граммная таблица — почему модель на 125B параметров всё ещё может обслуживаться легко. Остальное — это превью-материал для Qwen4 — именно так Alibaba его позиционирует.
Бенчмарк-лист с честной маркировкой
Каждое число в этом разделе — собственная оценка Alibaba: этим данным один день, и на момент написания они не были воспроизведены ни одной независимой лабораторией. Относитесь к ним как к ориентировочным показателям, а не как к окончательным результатам. На наборе тестов Alibaba Qwen3.8-Flash-Next (6B активных) показывает SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5 и MathVision 95.7, а оценка JobBench составляет 55.7. Базовая версия, Qwen3.8-Flash-Next-Base, по сообщениям, является лучшей открытой моделью по 8 из 14 бенчмарков в попарном сравнении, включая MMLU-Pro, SuperGPQA, BBH и MMMU.
Заявления Alibaba о позиционировании в семействе следует называть тем, чем они являются — заявлениями. Компания утверждает, что Qwen3.8-Flash обходит Claude Opus 4.6 на 9,1 балла в SWE-bench Pro и примерно на 20 баллов в JobBench, а также вплотную приближается к Claude Opus 4.8. Всё это — данные вендора, и ни одно не воспроизведено независимо. Что можно проверить независимо уже сегодня, так это более узкий круг вещей: веса выложены, стек инференса уже их запускает, а SGLang добавил поддержку в тот же день. До независимого воспроизведения бенчмарк-таблицы — дни, а не недели.
Сколько это стоит
Цены легче всего проверить, потому что это опубликованная цена, а не бенчмарк — и 27 августа Alibaba официально подтвердила производственные тарифы QwenCloud: $0,15 за миллион входных токенов, $0,47 за миллион выходных токенов и $0,016 за миллион при попадании в кэш, при этом внутренний тариф для Китая составляет ¥0,8/¥2,7/¥0,1. Показатель попаданий в кэш — вот что важно для агентных нагрузок: длинноконтекстный агент, который каждый раз перечитывает большую историю, платит копейки за повторные чтения, и это именно та нагрузка, на которую нацелен стек внимания Qwen4-preview. Китайская пресса немедленно сравнила заявленную цену с аналогами — примерно треть того, что берёт DeepSeek-V4-Flash, и погрешность в сравнении с закрытыми фронтирными моделями. По собственным подсчётам Alibaba, обучение обошлось примерно в одну девятую от Qwen3.7-Plus, и именно этот структурный рычаг позволяет цене API оставаться на текущем уровне.
Рядом с остальным семейством Qwen 3.8 разрыв очевиден: флагманская модель Qwen3.8-Max тарифицируется по $2.00 и $6.00 за миллион токенов, и она уже доступна на OrcaRouter по цене провайдера без наценки. Теперь, когда производственный API Qwen3.8-Flash открыт, та же сквозная ставка применяется к официальному тарифу $0.15/$0.47 и к тарифу $0.016 за попадание в кэш — маршрутизирующий слой — вот что отличает чтение о снижении цены от его наличия в конфиге. Обе модели за одним ключом, отказоустойчивость между ними, без второго контракта.
Что означает «предварительная версия Qwen4»?
Если читать анонс буквально, ставки очевидны: это не новый уровень Qwen 3.8 — это архитектура Qwen4, выпущенная раньше времени под защитным брендом более маленькой и дешёвой модели. Причины для этого разумны: фреймворки, квантование и паттерны развёртывания должны созреть, а модель с 6B активных параметров — дешёвый способ для сообщества протестировать под нагрузкой GDN + QSA в масштабе, прежде чем Alibaba построит на этой основе нечто дорогое. Обратная сторона в том, что продакшн-версия Qwen3.8-Flash — это API, построенный на архитектуре, которую более широкая экосистема всё ещё проверяет. Ранние пользователи, по построению, и есть тестовый набор.
Быстрый способ попробовать это
Сегодня у вас есть четыре реальных варианта. Запустите открытые веса самостоятельно через vLLM, SGLang, Transformers или TokenSpeed — сборка FP8 — разумная отправная точка для всего, что меньше полного узла. Вызовите API QwenCloud, который теперь доступен по официальной ставке $0,15/$0,47 с попаданиями в кэш по $0,016. Используйте его в OpenCode Go — подписке с фиксированной ставкой для открытого терминального агента для написания кода, — которая добавила Qwen3.8-Flash на этой неделе (анонсировано Alibaba 28 августа, подтверждено в списке моделей OpenCode). Или вызывайте production-версию Flash через роутер так же, как вы уже вызываете Qwen3.8-Max, с официальной ставкой без наценки — никакой индивидуальной интеграции для поддержки.

Открытый вопрос — честный вопрос: сможет ли модель, активирующая 6 миллиардов своих параметров, устоять в продакшене при самых разных нагрузках, или же таблица бенчмарков, которая сегодня выглядит свежей, останется такой же и через месяц? Это не повод ждать — это повод поставить её за фейловер, а не перед всем вашим стеком. Веса выложены, цена установлена, а архитектура — это объявленное направление Alibaba. Ближайшие недели решают, хватило ли 6B.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
