Карточка заголовка для статьи «Qwen3.8-Flash-Next — ОТЧЁТ ОБ УТЕЧКЕ» с бейджем «НЕПОДТВЕРЖДЕНО — ПРЕВЬЮ АРХИТЕКТУРЫ QWEN4», подзаголовком «Alibaba выпускает архитектуру Qwen4 до выхода самой модели», тремя чипами: «Источник: @kimmonismus», «25 августа 2026 г.» и «Релиз: 26 августа, 23:00 UTC+8», левой карточкой «Утверждение: мультимодальная MoE-модель с открытыми весами, предвосхищающая архитектуру Qwen4» и правой карточкой «Статус: веса не выпущены, релиз через ~24 часа». Логотип OrcaRouter размещён в правом нижнем углу.
Guides & Insights

Qwen3.8-Flash-Next: Alibaba представляет архитектуру Qwen4 до того, как Qwen4 появится

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Alibaba собирается опубликовать архитектуру Qwen4 до того, как выпустит модель Qwen4. {{1}}Qwen3.8-Flash-Next{{/1}} — мультимодальная модель на основе смеси экспертов с открытыми весами, построенная на архитектуре следующего поколения, которая ляжет в основу семейства Qwen4, — должна появиться в открытом доступе на ModelScope в {{2}}23:00{{/2}} по пекинскому времени {{3}}26 августа 2026 года{{/3}}. Alibaba позиционирует этот релиз как {{4}}технологический предпросмотр{{/4}}: разработчики получают архитектуру раньше, а полное семейство Qwen4 выйдет позже. На момент написания этой статьи {{5}}количество параметров, лицензия и цена{{/5}} не подтверждены, так что это материал в формате {{6}}«что мы знаем на данный момент»{{/6}} — каждый конкретный пункт ниже снабжён пометкой о степени его достоверности.

Если вы не следили за темпом выпуска Alibaba в этом месяце, то якорь — Qwen3.8-Max — флагманская модель с 2,4 триллиона параметров, выпущенная 3 августа и опубликованная в открытом виде как Qwen3.8-2.4T-A95B менее чем через две недели. Qwen3.8-Flash-Next появляется менее чем через месяц после этого. Та же лаборатория, которая выпустила открытую модель с 2,4 триллиона параметров, теперь предоставляет архитектуру для следующего поколения, прежде чем флагман этого поколения даже получит название.

Что было объявлено

Сигнал дошёл до арены по обычным каналам. Тизерная страница ModelScope для Qwen3.8-Flash-Next появилась 25 августа с бейджем «Скоро открытый релиз», слоганом «Вперёд, к новому поколению — молниеносная скорость» и таймером обратного отсчёта до 2026-08-26 23:00 (UTC+08:00). Команда Qwen из Alibaba в тот же день опубликовала в X: «Грядёт следующая волна Qwen». Пост, благодаря которому к нам попал этот материал, от @kimmonismus в X, описал то же самое немного другими словами: мультимодальная MoE-модель с открытыми весами на архитектуре нового поколения, ранний доступ, чтобы сообщество могло подготовиться к семейству Qwen4.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

Часть, которую стоит перечитать, — это собственная формулировка Alibaba. Модель описана как построенная на архитектуре следующего поколения, «которая будет питать грядущее семейство Qwen4» — и явно не как сам Qwen4. Заявленная причина Alibaba заключается в том, что архитектурные изменения должны оказаться в руках сообщества до появления семейства, чтобы среды выполнения, квантования и приложения были готовы к моменту выхода настоящего продукта. Это маркетинговая позиция, но также и техническое обязательство: сначала показать сложную часть, взяв сообщество с собой.

Что подтверждено сегодня, а что нет:

Подтверждено, согласно тизеру и заявлению Qwen: Qwen3.8-Flash-Next — это модель с открытыми весами, мультимодальная и MoE-модель на архитектуре Qwen4.

• Подтверждено, согласно заявлению Qw​en: он представляет два ключевых архитектурных изменения — гибридную архитектуру GDN и разреженное внимание Qw​en (QSA).

Подтверждено, согласно тизеру: время релиза — 2026-08-26 23:00 (UTC+08:00), на ModelScope.

• Не подтверждено: общее или активное количество параметров, условия лицензии, длина контекста, доступность API и цены, а также все результаты бенчмарков. Независимой оценки пока не существует, поскольку веса ещё не опубликованы.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Что на самом деле представляет собой архитектура Qwen4

Два механизма лежат в основе истории. Первый — GDN, Gated Delta Network, — это слой линейного внимания от Alibaba. Там, где стандартный трансформер хранит кэш ключей и значений, растущий с длиной последовательности, слой GDN поддерживает рекуррентное состояние фиксированного размера и обновляет его по обучаемому правилу стробирования; его родословная идёт через DeltaNet и Mamba-2. Выгода здесь та, что уже тихо обеспечивает работу линейки Qwen начиная с Qwen3-Next: длинные контексты остаются дешёвыми, потому что состояние не растёт, в то время как меньшинство полных слоёв внимания остаётся в смеси для точного извлечения, с которым линейное внимание справляется плохо. В текущем поколении эта смесь работает примерно в пропорции три слоя GDN на один полный слой внимания — анализ чекпойнта Qwen3.8-2.4T-A95B сообществом насчитывает 69 слоёв GDN против 23 слоёв внимания. Qwen3.8-Flash-Next описывается как «гибридная архитектура GDN» именно на этой линии.

Второй — QSA, он же Qw​en Sparse Attention, — по-настоящему новый компонент, и публичного технического описания его пока нет: только название и позиционирование как одного из двух главных изменений превью. Само отсутствие деталей — часть той же картины. Превью Qwen3-Next в конце 2025 года представило Gated DeltaNet с таким же дефицитом документации, и архитектура получила полное описание только после того, как её переняла серия Qw​en3.5. Для читателя практический вывод оба раза один и тот же: сначала появляется канарейка архитектуры, а документация и продакшн-модели — после.

Плейбук, который уже однажды сработал

Alibaba уже проделывала этот точный ход раньше, и он сработал. В конце 2025 года Qwen3-Next представил Gated DeltaNet и гибрид линейного и полного внимания. Когда серия Qw​en3.5 вышла, она внедрила этот план в полном масштабе — и гибрид сохранялся на протяжении поколения Qw​en3.8, включая флагман 2.4T. Этот прецедент важен здесь из-за сроков, которые он подразумевает. Полное семейство Qwen4 следует ожидать за пределами этого предпросмотра, а не в нём; если разрыв после Qwen3-Next — ориентир, расстояние между «вот архитектура» и «вот семейство» измеряется месяцами. Ничто в тизере этого не подтверждает — это вывод из паттерна, который Alibaba применила дважды.

Чего мы до сих пор не знаем

Неизвестные — это и есть суть превью, и они реальны:

• Параметры. Тизер не раскрывает никаких параметров. Предположения сообщества на X и Reddit — без официального подтверждения — указывают на конфигурацию с примерно 125B суммарно / 6B активных параметров и большой таблицей поиска n-граммных эмбеддингов. Воспринимайте это как слух.

• Уровень «Flash». В поколении Qw​en3.5 доступная только в облаке модель Qwen3.5-Flash была улучшенным вариантом модели Qwen3.5-35B-A3B с открытыми весами. Является ли Qwen3.8-Flash-Next открытым аналогом модели Qw​en3.8 аналогичного размера, неизвестно; возможно, это модель класса 125B-A6B. Обе интерпретации — лишь догадки.

• Лицензия. Недавние релизы Qw​en от Alibaba варьируются от Apache-2.0 (Qw​en3.8-27B) до лицензии Qwen3.8-Max с ограничением по выручке. То, где окажется Flash-Next, определяет, можно ли использовать его в коммерческих целях и в какой форме.

• Бенчмарки. В заявлении Qwen подчёркиваются агентное программирование, долгосрочные задачи и мультимодальный интеллект, но никаких цифр не приводится, и независимой оценки не будет до выхода весов.

Семья, работающая по двухнедельному циклу

Окружающий темп — это отдельная история. {{1}}Флагман Qwen3.8-Max с 2,4 триллиона параметров вышел 3 августа;{{/1}} {{2}}затем, 12–13 августа, появилась модель с открытыми весами Qwen3.8-2.4T-A95B;{{/2}} {{3}}а несколько дней спустя вышла бесплатная Apache-2.0 Qw​en3.8-27B;{{/3}} {{4}}и вот, ещё до конца месяца, уже анонсируют архитектуру следующего поколения.{{/4}} {{5}}Ни одна другая лаборатория сейчас не работает в таком темпе.{{/5}} {{6}}Для читателя, выбирающего модель, практическое следствие таково: «лучший Qw​en» — движущаяся мишень, и разрыв между поколениями сокращается быстрее, чем обычно успевает адаптироваться окружающая экосистема.{{/6}} Покупать решение, а не модель — всё более оправданный шаг.

Что разработчику следует делать сейчас

Планируйте архитектуру, а не только модель. Qwen3.8-Flash-Next в первый день будет непроверенным превью: нет независимых бенчмарков, среда выполнения всё ещё догоняет, и есть только заявления вендора об агентских и долгосрочных преимуществах, которые важны для рабочих нагрузок, которые будут её использовать. Безопасный способ оценить её — не встраивать её в производственный контур, а направить на неё малозначимую копию рабочей нагрузки, сравнить результат с действующей моделью и позволить автоматическому переходу на резерв поглощать моменты, когда провайдер, обслуживающий новую модель с открытыми весами, ведёт себя некорректно. В OrcaRouter это тот же эндпоинт и тот же ключ, которые вы уже используете: Qwen3.8-Flash-Next и ваша текущая модель находятся за одним API, и DSL маршрутизации может проводить A/B-тест превью против действующей модели на одном и том же промпте, прежде чем что-либо будет зафиксировано.

Ценообразование, когда оно существует, следует читать так же. Alibaba не объявила API-цену для Flash-Next, а невыпущенные веса нигде не маршрутизируются. Когда провайдер её всё же раскрывает, OrcaRouter передаёт цену провайдера без изменений с наценкой 0% — так что каким бы ни оказалось число Alibaba, оно появится без изменений в тот же день. Самый близкий ориентир, к которому можно реально обратиться сегодня, — это Qwen3.8-Max (qwen/qwen3.8-max), флагман, под которым в итоге окажется эта архитектура: окно контекста на 1 000 000 токенов по $2.00 за миллион входных токенов и $6.00 за миллион выходных токенов, передаваемых по прейскурантной цене. Держите это число в голове, когда цена Flash-Next упадёт; это стоимость, которую следующему поколению предстоит превзойти.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

Что посмотреть сразу

В тот момент, когда истекает таймер релиза, важны четыре вещи:

• Количество параметров и уровень активных параметров — является ли это моделью класса 125B-A6B, как описывают слухи, или более малой моделью.

• Лицензия — пермиссивная, как у Qwen3.8-27B, или ограниченная, как у лицензии Max.

• Воспроизводят ли первые независимые оценки заявления вендора об агентном кодировании и долгосрочных горизонтах — цифры, которым можно доверять, а не маркетинговая линия.

Как долго Alibaba ждёт, прежде чем полное семейство Qwen4 последует за предварительной версией.

Ничего из этого отсюда не узнать. Что известно сегодня — так это форма решения, которое принял Alibaba: компания ставит на то, что следующее поколение её архитектуры стоит выложить до выхода флагмана. Эта ставка и есть история — а веса появятся завтра.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube