Релиз Qwen3.8-Flash-Next — внутри предварительной версии архитектуры Qwen4 от Alibaba. Регенерированная иллюстрация.
Guides & Insights

Релиз Qwen3.8-Flash-Next: внутри превью архитектуры Qwen4 от Alibaba

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самый полезный документ, опубликованный Ali​baba 26 августа 2026 года, был не пресс-китом, а техническим отчётом. Qwen3.8-Flash-Next — открытая мультимодальная модель смеси экспертов с открытыми весами, выпущенная в тот день, — вышла вместе с документом под названием «О проектировании архитектуры Qwen3.8-Next: оценка, эффективность и стабильность обучения», и именно этот отчёт является главным. Он делает то, чего почти никогда не делают вендорские запуски: публикует абляции, негативные результаты и эксперименты с рецептами обучения, а затем связывает каждый вывод с архитектурой семейства Qwen4, предвестником которого является эта модель.

Что на самом деле вышло 26 августа

Сама модель скромна по стандартам Qw​en 2026 года, и это намеренно. В Qwen3.8-Flash-Next хранится 125B параметров основной модели плюс отдельная таблица n-граммных эмбеддингов на 51B — примерно 176B до модуля мультитокенного предсказания на 4B — но активируется только 6B на токен. Это модель смеси экспертов с 512 экспертами, маршрутизацией top-10 и 48 слоями, с нативным контекстом в 262 144 токена и расширением до 1M через YaRN. На вход она принимает текст, изображения и видео, а на выходе выдаёт текст. Веса размещены на Hugging Face и ModelScope под лицензией qwen-community-1.0, а собственный блог Ali​baba называет её «экспериментальным предвестником архитектуры, которая ляжет в основу Qwen4», — та же роль, которую Qwen3-Next сыграла для линейки Qw​en3.5, канарейка, летящая перед флагманом.

В тот же день Ali​baba запустил коммерческий аналог: сборку Qwen3.8-Flash, предоставляемую через API QwenCloud, по цене $0.16 за миллион входных токенов и $0.47 за миллион выходных. Эти два варианта легко спутать, и их стоит чётко различать. Qwen3.8-Flash-Next — это предварительная версия с открытыми весами, которую подробно разбирает технический отчёт; Qwen3.8-Flash — это продакшн-сборка для API, платная, с контекстом по умолчанию на 1M токенов и форматами запросов, совместимыми с Open​AI и Anthropic. Цена, бенчмарки и архитектурные доводы — всё это проистекает из одной и той же инженерной разработки.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

Четыре архитектурные ставки в техническом отчёте

Стержень статьи — четыре ставки на то, как должна выглядеть передовая модель с длинным контекстом и низкой стоимостью, и каждая из них подкреплена экспериментальными данными.

• Внимание — гибрид GDN + QSA. Три из каждых четырёх слоёв используют Gated DeltaNet — слой линейного внимания, который сжимает историю в рекуррентное состояние фиксированного размера вместо KV-кэша, растущего с длиной последовательности. Оставшийся слой — это Qw​en Sparse Attention, который агрегирует последовательность в микроблоки, дёшево оценивает их и выполняет полное внимание только на значимых областях. Ali​baba сообщает об ускорении до 7,6× на этапе prefill и 4,9× на этапе decode при контексте в 1M; собственный бенчмарк SGLang, проведённый в день релиза, показал ещё более высокие результаты: 10,2× и 6,6×. При 90% попаданий в префиксный кэш пропускная способность prefill достигает 8,6× от показателя Qwen3.7-Plus. Это показатели, сообщённые вендором и партнёрами, а не независимо проверенные.

Остаточный поток — гейтированный остаточный (Gated Residual). Единственный остаточный путь расширяется до четырёх параллельных ветвей с поэлементным динамическим гейтированием — многоветвевая архитектура в стиле Hyper-Connection с управлением в стиле GatedNorm. Гейт регулирует чтение и запись для каждой ветви, что, по утверждению авторов, подавляет выбросы активаций и на практике позволяет хранить остаточные состояния в FP8.

• Embedding — таблица n-грамм на 51B. Вместо одного эмбеддинга на токен модель использует поиск по таблице на основе текущего токена и предыдущих, сохраняя целые фразы и локальные паттерны. Это почти бесплатно в расчёте на токен, и поскольку адреса поиска известны заранее, она может жить в памяти хоста и подгружаться асинхронно, полностью исключённая из памяти GPU. Этот трюк позволяет контрольной точке с 176B параметров работать на машинах класса 75GB, и он восходит к послойным эмбеддингам Gemma 3n и Engram от Deep​Seek.

• Оптимизация — Muon, настройка. При обучении используется оптимизатор Muon — метод импульса на основе ортогонализации, применяемый к двумерным линейным отображениям (весам внимания, GDN и экспертов MoE), тогда как AdamW сохраняется для эмбеддингов, роутера и низкоранговых параметров. В статье также сообщается о негативном результате, который стоит прочитать: warm-up размера батча был отброшен после того, как выяснилось, что он обходится в дополнительные 18,8% шагов оптимизатора, ничего не улучшая.

Внимательно прочитайте таблицу бенчмарков.

Каждое заглавное число здесь принадлежит самой Qw​en, опубликовано на карточке модели и в отчёте, и ни одно из них не было независимо воспроизведено — модель существует всего день, и её ещё никто не проверял. Если читать это так, это всё равно поразительно, потому что Qwen3.8-Flash-Next на равных соревнуется с DeepSeek-V4-Flash-0731, гораздо более крупной и устоявшейся моделью, на 6B активных параметров.

• DeepSWE 1.1 — 58.7 против 54.4 (по данным производителя).

• SWE-bench Pro — 62.5 против 56.0 (по данным поставщика).

Toolathlon Verified — 73.5 против 70.3 (по данным производителя).

• LiveCodeBench v6 — 91.9 против 90.6 (по данным вендора).

• GPQA Diamond — 91.7 против 90.8 (по данным производителя).

• IFBench — 81.3 против 79.2 (по данным вендора).

Затем промах, который отчёт публикует открыто: NL2Repo-Bench — 48,1 против 54,2 у DeepSeek-V4-Flash-0731 — реальное отставание в генерации кода на уровне репозитория, единственном измерении агентного кодинга, где меньшая модель не поспевает. Agents' Last Exam — почти вровень: 24,3 против 25,2. В офисной автоматизации Qw​en сообщает о CoWorkBench 73,9 — но это внутренний бенчмарк, и Ali​baba не включает его в основную таблицу.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

Что касается зрения, в таблице с самоотчётом AndroidWorld показывает 84,5 против 62,0 у Claude Opus 4.6 Max, а RealWorldQA — 88,5 против 73,9. Humanity's Last Exam — единственный заголовок, где Qw​en outright проигрывает Claude Opus 4.6 Max, — и сама оценка этого результата была выполнена GPT-4o, так что даже это сравнение нельзя назвать чистым.

Цена: одна двенадцатая флагмана

Затем — цифра, которая важна для бюджетов. Предлагаемая сборка Qwen3.8-Flash на QwenCloud стоит $0,16 за миллион входных токенов и $0,47 за миллион выходных. Это примерно одна двенадцатая цены флагманской модели самой Ali​baba, Qwen3.8-Max по $2,00 за миллион входных и $6,00 за миллион выходных токенов — при том, что, по данным отчёта, модель обучалась примерно на одной девятой вычислительных мощностей, затраченных на Qwen3.7-Plus. Китайские вендоры моделей всё лето снижали цены на модели flash-уровня, и этот релиз — вклад Qw​en в эту кампанию, который выходит на рынок с архитектурным обоснованием, а не просто со скидкой.

При сравнении в рамках категории считать проще, когда каждый провайдер показывает одно и то же число. OrcaRouter маршрутизирует остальное семейство Qwen — Qwen3.8-Max, Qwen3.8-27B и Qwen3.8 — по цене провайдера с нулевой наценкой, так что снижение цены вендором вступает в силу у нас в день анонса. Qwen3.8-Flash-Next пока нет в нашем каталоге; когда он появится в среде выполнения, которую мы поддерживаем, он встроится в ту же схему с одним ключом и ценой из прайс-листа без дополнительного контракта.

Что можно делать с этим сегодня

Поддержка сервинга в день релиза необычайно широкая. SGLang поставляет cookbook-страницу и выделенный образ (lmsysorg/sglang:qwen38flashnext); у vLLM есть vllm/vllm-openai:qwen38-flash-next; NVIDIA подтверждает работоспособность обоих, а также TensorRT LLM на стойке GB300 NVL72 со скоростью более 16 000 токенов в секунду на GPU в FP8, а NeMo покрывает дообучение. На масштабах ниже ЦОД модель работает на кластерах DGX Spark и рабочих станциях с 4×RTX PRO 6000, а вышедшая в тот же день серия квантизаций от сообщества — GGUF-кванты от Unsloth и 1-битная сборка, помещающаяся в 75 ГБ ОЗУ с точностью примерно 80% от полной, — означает, что чекпоинт со 176B параметров действительно можно запустить на оборудовании, которое есть у небольшой команды. Команды, предпочитающие вызывать её через API, а не запускать у себя, могут использовать Qwen3.8-Flash API через собственный QwenCloud от Ali​baba и несколько сторонних платформ, хотя большинство первых пользователей в первую очередь возьмут открытые веса.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

Расчёт VRAM за этим списком — это таблица n-грамм, и именно к ней дальше сходятся serving-стеки. Послойная эмбеддинг-таблица, которую техотчёт держит вне памяти GPU, — это чистая lookup-структура: на каждый сгенерированный токен модель достаёт лишь около 16 строк из её 320 миллионов, что и делает её выгрузку дешёвой. vLLM раздаёт Qwen3.8-Flash-Next из отдельного dev-образа, пока pull request с поддержкой архитектуры ещё открыт, а самая свежая часть этой работы — черновой PR от того же автора vLLM (vllm-project/vllm#54371, не смерджен) — добавляет serving-путь PLE-Offload: таблица остаётся в памяти хоста и читается через унифицированную виртуальную адресацию CUDA вместо резервирования VRAM. В FP8 на таблицу приходится примерно 48 ГБ из ~173 ГБ чекпоинта, поэтому её выгрузка — это разница между дата-центровой GPU и одной картой на 96 ГБ — RTX PRO 6000 или единым пулом памяти одного DGX Spark. Пока это ранний этап, так что относитесь к этому как к направлению, а не как к поддерживаемой сегодня опции; но это рантайм, догоняющий то, что техотчёт уже заявлял, и за этим стоит следить, если вас сдерживал именно объём VRAM.

Однодневное превью с неподтверждёнными показателями — классический пример того, когда не стоит ставить на него продакшн-путь, и именно для этого и нужен failover. Если в среде выполнения есть Qwen3.8-Flash-Next, и вы направляете одну конечную точку на него с автоматическим переключением на модель, которой уже доверяете, вы получаете преимущества новой архитектуры на некритичном трафике и чистую подстраховку, когда она испытывает трудности — без перенастройки, потому что это правило маршрутизации, а не изменение кода.

Что этот предварительный обзор говорит о Qwen4

У Alibaba этот приём уже был. Qwen3-Next анонсировал Gated DeltaNet в конце 2025 года со скудной документацией, и архитектура получила полную спецификацию только после того, как серия Qwen3.5 приняла её в масштабе. Паттерн повторяется: Qwen3.8-Flash-Next — канарейка, а отчёт — это спецификация через эксперимент. Конкретные вещи, за которыми стоит следить: примет ли флагман Qwen4 соотношение три к одному между GDN и QSA, переживёт ли n-граммное эмбеддинг-представление контакт с продакшн-сервингом в масштабе флагмана, и самое главное — подтвердят ли независимые оценки преимущество 6B-активного варианта над более крупными моделями. Если тезис об эффективности подтвердится, флагман Qwen4 может выйти с значительно более низкой стоимостью обслуживания, чем у предыдущего поколения.

Часто задаваемые вопросы

Qwen3.8-Flash-Next и Qwen3.8-Flash — это одна и та же модель?

Нет, и это различие важно. Qwen3.8-Flash-Next — это предварительная версия архитектуры с открытыми весами, которую анализирует технический отчет; Qwen3.8-Flash — это продакшен-сборка API, которую Ali​baba предоставляет на QwenCloud по цене $0.16/$0.47 за миллион токенов с контекстом по умолчанию 1M. Одна и та же инженерная линия, но разные артефакты — один предназначен для самостоятельного размещения и изучения, другой — это платный управляемый сервис.

Стоит ли переносить производственные нагрузки на это уже сегодня?

Не без второго мнения. Все бенчмарки заявлены вендором и не воспроизведены, архитектура достаточно новая, так что серверные стеки ещё не устоялись — собственная поддержка vLLM всё ещё появляется через открытые пул-реквесты — и единственный пробел в агентном кодинге (NL2Repo) приходится ровно на ту задачу, с которой сталкиваются продакшн-разработчики. Открытые веса позволяют дёшево оценить модель самостоятельно, а поддержка SGLang и vLLM на уровне day-0 позволяет запустить пилот уже на этой неделе — но честный способ начать — это пилот за фейловером, а не полное переключение.

Когда на самом деле выйдет Qwen4?

Ali​baba не сообщала. Единственный временной сигнал в этом релизе — исторический: последняя канарейка, Qwen3-Next, вылетела примерно за сезон до того, как серия Qw​en3.5 переняла её архитектуру. При таком темпе флагманы Qwen4 ближе, чем кажется, — но отчёт явно посвящён архитектуре, а не дорожной карте.

Суть

Qwen3.8-Flash-Next — тот редкий случай, когда статья и есть продукт. Что касается самой модели, честная картина такова: 6B активных параметров, которые на большинстве общих бенчмарков соответствуют моделям гораздо большего размера; один названный пробел в коде уровня репозитория; цена обслуживания в двенадцать раз ниже флагманской; и архитектура, которая является ответом Qwen на вопрос, как фронтирная модель становится дешёвой. Технический отчёт говорит, для чего предназначен Qwen3.8-Flash-Next, — и дело не в самой модели. Это доказательство архитектуры, которая станет Qwen4, и его стоит прочитать до выхода Qwen4, потому что решение, которое он меняет, — это то самое решение, которое вы примете, когда Qwen4 появится.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube