
Релиз Qwen3.8-Flash-Next: внутри превью архитектуры Qwen4 от Alibaba
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Самый полезный документ, опубликованный Alibaba 26 августа 2026 года, был не пресс-китом, а техническим отчётом. Qwen3.8-Flash-Next — открытая мультимодальная модель смеси экспертов с открытыми весами, выпущенная в тот день, — вышла вместе с документом под названием «О проектировании архитектуры Qwen3.8-Next: оценка, эффективность и стабильность обучения», и именно этот отчёт является главным. Он делает то, чего почти никогда не делают вендорские запуски: публикует абляции, негативные результаты и эксперименты с рецептами обучения, а затем связывает каждый вывод с архитектурой семейства Qwen4, предвестником которого является эта модель.
Что на самом деле вышло 26 августа
Сама модель скромна по стандартам Qwen 2026 года, и это намеренно. В Qwen3.8-Flash-Next хранится 125B параметров основной модели плюс отдельная таблица n-граммных эмбеддингов на 51B — примерно 176B до модуля мультитокенного предсказания на 4B — но активируется только 6B на токен. Это модель смеси экспертов с 512 экспертами, маршрутизацией top-10 и 48 слоями, с нативным контекстом в 262 144 токена и расширением до 1M через YaRN. На вход она принимает текст, изображения и видео, а на выходе выдаёт текст. Веса размещены на Hugging Face и ModelScope под лицензией qwen-community-1.0, а собственный блог Alibaba называет её «экспериментальным предвестником архитектуры, которая ляжет в основу Qwen4», — та же роль, которую Qwen3-Next сыграла для линейки Qwen3.5, канарейка, летящая перед флагманом.
В тот же день Alibaba запустил коммерческий аналог: сборку Qwen3.8-Flash, предоставляемую через API QwenCloud, по цене $0.16 за миллион входных токенов и $0.47 за миллион выходных. Эти два варианта легко спутать, и их стоит чётко различать. Qwen3.8-Flash-Next — это предварительная версия с открытыми весами, которую подробно разбирает технический отчёт; Qwen3.8-Flash — это продакшн-сборка для API, платная, с контекстом по умолчанию на 1M токенов и форматами запросов, совместимыми с OpenAI и Anthropic. Цена, бенчмарки и архитектурные доводы — всё это проистекает из одной и той же инженерной разработки.

Четыре архитектурные ставки в техническом отчёте
Стержень статьи — четыре ставки на то, как должна выглядеть передовая модель с длинным контекстом и низкой стоимостью, и каждая из них подкреплена экспериментальными данными.
• Внимание — гибрид GDN + QSA. Три из каждых четырёх слоёв используют Gated DeltaNet — слой линейного внимания, который сжимает историю в рекуррентное состояние фиксированного размера вместо KV-кэша, растущего с длиной последовательности. Оставшийся слой — это Qwen Sparse Attention, который агрегирует последовательность в микроблоки, дёшево оценивает их и выполняет полное внимание только на значимых областях. Alibaba сообщает об ускорении до 7,6× на этапе prefill и 4,9× на этапе decode при контексте в 1M; собственный бенчмарк SGLang, проведённый в день релиза, показал ещё более высокие результаты: 10,2× и 6,6×. При 90% попаданий в префиксный кэш пропускная способность prefill достигает 8,6× от показателя Qwen3.7-Plus. Это показатели, сообщённые вендором и партнёрами, а не независимо проверенные.
Остаточный поток — гейтированный остаточный (Gated Residual). Единственный остаточный путь расширяется до четырёх параллельных ветвей с поэлементным динамическим гейтированием — многоветвевая архитектура в стиле Hyper-Connection с управлением в стиле GatedNorm. Гейт регулирует чтение и запись для каждой ветви, что, по утверждению авторов, подавляет выбросы активаций и на практике позволяет хранить остаточные состояния в FP8.
• Embedding — таблица n-грамм на 51B. Вместо одного эмбеддинга на токен модель использует поиск по таблице на основе текущего токена и предыдущих, сохраняя целые фразы и локальные паттерны. Это почти бесплатно в расчёте на токен, и поскольку адреса поиска известны заранее, она может жить в памяти хоста и подгружаться асинхронно, полностью исключённая из памяти GPU. Этот трюк позволяет контрольной точке с 176B параметров работать на машинах класса 75GB, и он восходит к послойным эмбеддингам Gemma 3n и Engram от DeepSeek.
• Оптимизация — Muon, настройка. При обучении используется оптимизатор Muon — метод импульса на основе ортогонализации, применяемый к двумерным линейным отображениям (весам внимания, GDN и экспертов MoE), тогда как AdamW сохраняется для эмбеддингов, роутера и низкоранговых параметров. В статье также сообщается о негативном результате, который стоит прочитать: warm-up размера батча был отброшен после того, как выяснилось, что он обходится в дополнительные 18,8% шагов оптимизатора, ничего не улучшая.
Внимательно прочитайте таблицу бенчмарков.
Каждое заглавное число здесь принадлежит самой Qwen, опубликовано на карточке модели и в отчёте, и ни одно из них не было независимо воспроизведено — модель существует всего день, и её ещё никто не проверял. Если читать это так, это всё равно поразительно, потому что Qwen3.8-Flash-Next на равных соревнуется с DeepSeek-V4-Flash-0731, гораздо более крупной и устоявшейся моделью, на 6B активных параметров.
• DeepSWE 1.1 — 58.7 против 54.4 (по данным производителя).
• SWE-bench Pro — 62.5 против 56.0 (по данным поставщика).
Toolathlon Verified — 73.5 против 70.3 (по данным производителя).
• LiveCodeBench v6 — 91.9 против 90.6 (по данным вендора).
• GPQA Diamond — 91.7 против 90.8 (по данным производителя).
• IFBench — 81.3 против 79.2 (по данным вендора).
Затем промах, который отчёт публикует открыто: NL2Repo-Bench — 48,1 против 54,2 у DeepSeek-V4-Flash-0731 — реальное отставание в генерации кода на уровне репозитория, единственном измерении агентного кодинга, где меньшая модель не поспевает. Agents' Last Exam — почти вровень: 24,3 против 25,2. В офисной автоматизации Qwen сообщает о CoWorkBench 73,9 — но это внутренний бенчмарк, и Alibaba не включает его в основную таблицу.

Что касается зрения, в таблице с самоотчётом AndroidWorld показывает 84,5 против 62,0 у Claude Opus 4.6 Max, а RealWorldQA — 88,5 против 73,9. Humanity's Last Exam — единственный заголовок, где Qwen outright проигрывает Claude Opus 4.6 Max, — и сама оценка этого результата была выполнена GPT-4o, так что даже это сравнение нельзя назвать чистым.
Цена: одна двенадцатая флагмана
Затем — цифра, которая важна для бюджетов. Предлагаемая сборка Qwen3.8-Flash на QwenCloud стоит $0,16 за миллион входных токенов и $0,47 за миллион выходных. Это примерно одна двенадцатая цены флагманской модели самой Alibaba, Qwen3.8-Max по $2,00 за миллион входных и $6,00 за миллион выходных токенов — при том, что, по данным отчёта, модель обучалась примерно на одной девятой вычислительных мощностей, затраченных на Qwen3.7-Plus. Китайские вендоры моделей всё лето снижали цены на модели flash-уровня, и этот релиз — вклад Qwen в эту кампанию, который выходит на рынок с архитектурным обоснованием, а не просто со скидкой.
При сравнении в рамках категории считать проще, когда каждый провайдер показывает одно и то же число. OrcaRouter маршрутизирует остальное семейство Qwen — Qwen3.8-Max, Qwen3.8-27B и Qwen3.8 — по цене провайдера с нулевой наценкой, так что снижение цены вендором вступает в силу у нас в день анонса. Qwen3.8-Flash-Next пока нет в нашем каталоге; когда он появится в среде выполнения, которую мы поддерживаем, он встроится в ту же схему с одним ключом и ценой из прайс-листа без дополнительного контракта.
Что можно делать с этим сегодня
Поддержка сервинга в день релиза необычайно широкая. SGLang поставляет cookbook-страницу и выделенный образ (lmsysorg/sglang:qwen38flashnext); у vLLM есть vllm/vllm-openai:qwen38-flash-next; NVIDIA подтверждает работоспособность обоих, а также TensorRT LLM на стойке GB300 NVL72 со скоростью более 16 000 токенов в секунду на GPU в FP8, а NeMo покрывает дообучение. На масштабах ниже ЦОД модель работает на кластерах DGX Spark и рабочих станциях с 4×RTX PRO 6000, а вышедшая в тот же день серия квантизаций от сообщества — GGUF-кванты от Unsloth и 1-битная сборка, помещающаяся в 75 ГБ ОЗУ с точностью примерно 80% от полной, — означает, что чекпоинт со 176B параметров действительно можно запустить на оборудовании, которое есть у небольшой команды. Команды, предпочитающие вызывать её через API, а не запускать у себя, могут использовать Qwen3.8-Flash API через собственный QwenCloud от Alibaba и несколько сторонних платформ, хотя большинство первых пользователей в первую очередь возьмут открытые веса.

Расчёт VRAM за этим списком — это таблица n-грамм, и именно к ней дальше сходятся serving-стеки. Послойная эмбеддинг-таблица, которую техотчёт держит вне памяти GPU, — это чистая lookup-структура: на каждый сгенерированный токен модель достаёт лишь около 16 строк из её 320 миллионов, что и делает её выгрузку дешёвой. vLLM раздаёт Qwen3.8-Flash-Next из отдельного dev-образа, пока pull request с поддержкой архитектуры ещё открыт, а самая свежая часть этой работы — черновой PR от того же автора vLLM (vllm-project/vllm#54371, не смерджен) — добавляет serving-путь PLE-Offload: таблица остаётся в памяти хоста и читается через унифицированную виртуальную адресацию CUDA вместо резервирования VRAM. В FP8 на таблицу приходится примерно 48 ГБ из ~173 ГБ чекпоинта, поэтому её выгрузка — это разница между дата-центровой GPU и одной картой на 96 ГБ — RTX PRO 6000 или единым пулом памяти одного DGX Spark. Пока это ранний этап, так что относитесь к этому как к направлению, а не как к поддерживаемой сегодня опции; но это рантайм, догоняющий то, что техотчёт уже заявлял, и за этим стоит следить, если вас сдерживал именно объём VRAM.
Однодневное превью с неподтверждёнными показателями — классический пример того, когда не стоит ставить на него продакшн-путь, и именно для этого и нужен failover. Если в среде выполнения есть Qwen3.8-Flash-Next, и вы направляете одну конечную точку на него с автоматическим переключением на модель, которой уже доверяете, вы получаете преимущества новой архитектуры на некритичном трафике и чистую подстраховку, когда она испытывает трудности — без перенастройки, потому что это правило маршрутизации, а не изменение кода.
Что этот предварительный обзор говорит о Qwen4
У Alibaba этот приём уже был. Qwen3-Next анонсировал Gated DeltaNet в конце 2025 года со скудной документацией, и архитектура получила полную спецификацию только после того, как серия Qwen3.5 приняла её в масштабе. Паттерн повторяется: Qwen3.8-Flash-Next — канарейка, а отчёт — это спецификация через эксперимент. Конкретные вещи, за которыми стоит следить: примет ли флагман Qwen4 соотношение три к одному между GDN и QSA, переживёт ли n-граммное эмбеддинг-представление контакт с продакшн-сервингом в масштабе флагмана, и самое главное — подтвердят ли независимые оценки преимущество 6B-активного варианта над более крупными моделями. Если тезис об эффективности подтвердится, флагман Qwen4 может выйти с значительно более низкой стоимостью обслуживания, чем у предыдущего поколения.
Часто задаваемые вопросы
Qwen3.8-Flash-Next и Qwen3.8-Flash — это одна и та же модель?
Нет, и это различие важно. Qwen3.8-Flash-Next — это предварительная версия архитектуры с открытыми весами, которую анализирует технический отчет; Qwen3.8-Flash — это продакшен-сборка API, которую Alibaba предоставляет на QwenCloud по цене $0.16/$0.47 за миллион токенов с контекстом по умолчанию 1M. Одна и та же инженерная линия, но разные артефакты — один предназначен для самостоятельного размещения и изучения, другой — это платный управляемый сервис.
Стоит ли переносить производственные нагрузки на это уже сегодня?
Не без второго мнения. Все бенчмарки заявлены вендором и не воспроизведены, архитектура достаточно новая, так что серверные стеки ещё не устоялись — собственная поддержка vLLM всё ещё появляется через открытые пул-реквесты — и единственный пробел в агентном кодинге (NL2Repo) приходится ровно на ту задачу, с которой сталкиваются продакшн-разработчики. Открытые веса позволяют дёшево оценить модель самостоятельно, а поддержка SGLang и vLLM на уровне day-0 позволяет запустить пилот уже на этой неделе — но честный способ начать — это пилот за фейловером, а не полное переключение.
Когда на самом деле выйдет Qwen4?
Alibaba не сообщала. Единственный временной сигнал в этом релизе — исторический: последняя канарейка, Qwen3-Next, вылетела примерно за сезон до того, как серия Qwen3.5 переняла её архитектуру. При таком темпе флагманы Qwen4 ближе, чем кажется, — но отчёт явно посвящён архитектуре, а не дорожной карте.
Суть
Qwen3.8-Flash-Next — тот редкий случай, когда статья и есть продукт. Что касается самой модели, честная картина такова: 6B активных параметров, которые на большинстве общих бенчмарков соответствуют моделям гораздо большего размера; один названный пробел в коде уровня репозитория; цена обслуживания в двенадцать раз ниже флагманской; и архитектура, которая является ответом Qwen на вопрос, как фронтирная модель становится дешёвой. Технический отчёт говорит, для чего предназначен Qwen3.8-Flash-Next, — и дело не в самой модели. Это доказательство архитектуры, которая станет Qwen4, и его стоит прочитать до выхода Qwen4, потому что решение, которое он меняет, — это то самое решение, которое вы примете, когда Qwen4 появится.
