
Qwen3.8-Flash-Next вышел: Alibaba поставляет архитектуру Qwen4 до появления самого Qwen4
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов · 84 tok/s
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Qwen3.8-Flash-Next наконец получила цифры, которых не предоставила Alibaba, — и они говорят не то, что самая громкая версия этой истории. В индексе Artificial Analysis Intelligence Index, пересчитанном до v4.3 7 сентября, предварительная версия Alibaba с открытыми весами набирает 40 баллов и занимает пятое место среди 113 моделей в своей сравнительной категории. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — модель, с которой её постоянно сравнивают, — набирает 35 баллов и занимает девятое место. Это не паритет; это преимущество в пять баллов у меньшей модели. Это также первый широкий независимый рейтинг, охвативший модель, единственными опубликованными цифрами которой до этого месяца были цифры самого производителя. Сама модель не нова: веса были выложены на Hugging Face 24 августа, а официальный релиз на ModelScope состоялся 26 августа. Что изменилось в этом месяце, так это то, что читатель теперь может проверить утверждения, а не принимать их на веру.
Поводом вернуться к этому посту послужил @teortaxesTex в X, который спросил, не является ли превью незаметно недооценённым: якобы на том же уровне Artificial Analysis, что и DeepSeek V4 Flash 0731, «почти в 4 раза меньше», «при почти в 3 раза меньшем числе активных параметров». Два из этих трёх утверждений не выдерживают сопоставления с опубликованными данными — и эта поправка играет в пользу модели, потому что по цифрам, которые имеют значение, превью опережает то, с чем его сравнивают, а не находится с ним на одном уровне.
Начнём с размера, где числа однозначны. Qwen3.8-Flash-Next хранит примерно 180 млрд параметров — основная часть mixture-of-experts на 125 млрд, отдельная таблица n-gram-эмбеддингов на 51 млрд и около 4 млрд слоёв multi-token prediction — и активирует 6 млрд из них на токен. DeepSeek V4 Flash 0731 хранит 284 млрд и активирует 13 млрд. Это цифры из карточки модели Qwen и документации DeepSeek, и это цифры, которые Artificial Analysis приводит на обеих страницах моделей. Соотношения, которые они дают, составляют 1.6x по хранимым параметрам и 2.2x по активным параметрам. Это настоящая история эффективности, и именно поэтому эта архитектура важна — но это не 4x и не 3x. Мы не смогли найти нигде опубликованных цифр, которые подтверждали бы более крупные множители. Если имелся в виду объём памяти при обслуживании, а не количество параметров, это число тоже не опубликовано.
Что было объявлено
Alibaba опубликовала архитектуру Qwen4 раньше, чем выпустила модель Qwen4. Qwen3.8-Flash-Next — открытая по весам мультимодальная модель на основе смеси экспертов, построенная на архитектуре следующего поколения, которая ляжет в основу семейства Qwen4, — вышла в два этапа: официальный репозиторий Qwen/Qwen3.8-Flash-Next появился на Hugging Face 24 августа, за два дня до релиза на ModelScope, на который указывал таймер тизера. Официальный релиз на ModelScope состоялся 26 августа в 23:00 UTC+08:00; тогда же была объявлена цена на предоставляемый в сервисе вариант Qwen3.8-Flash. Главное утверждение в карточке модели, которое с тех пор циркулирует, состоит в том, что модель, активирующая 6B параметров на токен, превосходит Claude Opus 4.6 Max в 8 из 9 сопоставимых бенчмарков по собственной таблице Alibaba. Полное семейство Qwen4, как продолжает повторять Alibaba, появится позже.
Если вы не следили за темпом Alibaba в этом месяце, то главный ориентир — Qwen3.8-Max — флагманская модель с 2,4 трлн параметров, выпущенная 3 августа и открытая как Qwen3.8-2.4T-A95B менее чем через две недели. Веса Qwen3.8-Flash-Next вышли меньше чем через месяц после этого. Та же лаборатория, которая выпустила открытую модель с 2,4 трлн параметров, теперь раздаёт архитектуру следующего за ней поколения ещё до того, как флагман этого поколения даже получил название.

Часть, которую стоит перечитать, — это собственная формулировка Alibaba. Модель описывается как построенная на архитектуре следующего поколения, «которая ляжет в основу будущего семейства Qwen4», — и явно не как сам Qwen4. Alibaba объясняет это тем, что архитектурные изменения должны оказаться в руках сообщества до появления семейства, чтобы среды выполнения, квантизации и приложения были готовы, когда выйдет настоящий продукт. Это маркетинговая позиция, но также и техническое обязательство: сначала показать сложную часть, повести сообщество за собой.
Что карточка модели решает, а что — нет:
• Подтверждено, согласно официальной карточке модели: Qwen3.8-Flash-Next имеет открытые веса, является мультимодальной и построена как смесь экспертов на архитектуре Qwen4 — карточка называет её «экспериментальным предварительным просмотром архитектуры, которая ляжет в основу Qwen4».
• Подтверждено, согласно карточке модели и конфигурации: два ключевых архитектурных изменения — Gated Delta Network (GDN) и Qwen Sparse Attention (QSA) — внутри 48-слойной гибридной архитектуры, включающей 36 слоёв с линейным вниманием и 12 слоёв с полным вниманием.
• Подтверждено из репозитория: 125B общих параметров при 6B активируемых на токен (512 экспертов, 10 маршрутизируемых плюс один общий) — Artificial Analysis указывает 180B, если учесть отдельную 51B таблицу n-граммных эмбеддингов и слои MTP — с нативным контекстом в 262 144 токена, расширяемым до 1 000 000 в рамках лицензии Qwen Community License 1.0.
• Больше не неподтверждено: модель теперь независимо оценена, причём дважды. Таблица Alibaba по-прежнему принадлежит самому вендору и всё ещё не воспроизведена, но она уже не единственное доказательство в комнате.
Первые независимые оценки уже поступили — и они говорят «впереди», а не «на одном уровне».
Artificial Analysis выпустила Intelligence Index v4.3 7 сентября, и именно пересчёт — причина того, что всё это вообще можно сопоставлять. Обновление v4.3 заменило Terminal-Bench v2.1 на гораздо более сложный Terminal-Bench v4.0, а τ³-Banking — на AutomationBench-AA, агентный бенчмарк рабочих процессов, созданный совместно с Zapier на закрытом отложенном наборе из 657 задач. Вес закрытого отложенного набора вырос до 45%. Заявленная цель состояла в том, чтобы не дать фронтирным моделям накручивать индекс, и влияние на оценки оказалось значительным: GPT-6 Astra и Claude Fable 5.1, два лидера, оба оказались на отметке 53, тогда как по старой шкале им выставляли оценки в шестидесятых.
Это важно, когда вы смотрите на цифры сообщества. Цифры «56 против 52», которые ходили для Qwen3.8-Flash-Next и DeepSeek V4 Flash 0731 в начале сентября, были вычислены на индексе до v4.3; по v4.3 эта пара находится на 40 и 35. Сопоставлять один набор с другим — это сравнивать два разных экзамена.
На текущем индексе вот как две модели на самом деле сравниваются по собственным оценкам Artificial Analysis:
• Индекс интеллекта — Qwen3.8-Flash-Next 40 (5-е место из 113 в классе) против DeepSeek V4 Flash 0731 (Рассуждение, максимальные усилия) 35 (9-е место из 113).
• Агентная работа со знаниями — AA-Briefcase 1587 против 1259; GDPval-AA v2 1647 против 1468; AutomationBench-AA 56% против 54%.
• Терминал и программирование — Terminal-Bench v4.0: 25% против 12%; SciCode: 51% против 50%.
• Общие и научные рассуждения — Humanity's Last Exam 38% против 39%; CritPt 11% против 17%; GDP.pdf 16% против 11%; AA-LCR v1.1 80% против 80%.
• Фактическое припоминание против конфабуляции — AA-Omniscience −10 против −14, преимущество в четыре пункта у предварительной версии Qwen.
• Цена — $0.15 за миллион входных / $0.47 за миллион выходных против $0.44 / $1.32; смешанная цена — $0.0882 за миллион токенов против $0.2298. Стоимость за задачу Intelligence Index: $0.37 против $0.22.
• Скорость и задержка — 53 выходных токена в секунду против 210; время до первого токена 2,80 с против 0,98 с; сквозное время ответа 49,76 с против 12,88 с; время на задачу 1 572,60 с против 221,65 с.
• Использование токенов — 108 тыс. выходных токенов на задачу против 62 тыс., из которых 72 тыс. — токены рассуждения против 45 тыс. Artificial Analysis называет предварительную версию «очень многословной» и «более медленной, чем в среднем».
• Контекст и размер — 256k токенов против 1 000k; 180B всего / 6B активных против 284B / 13B.
Вместе эти данные дают более точный ответ, чем «тот же уровень». Qwen3.8-Flash-Next выигрывает в споре о точности и эффективности почти по всем осям, которые измеряет Artificial Analysis: это модель с более высокими оценками, она меньше и стоит примерно втрое дешевле за токен. DeepSeek V4 Flash 0731 безоговорочно выигрывает по производственной части: вчетверо выше пропускная способность, вчетверо меньше сквозная задержка, в семь раз меньше реального времени на выполненную задачу и вчетверо больше контекстное окно. А по стоимости за выполненную задачу — показателю, который выдерживает испытание многословностью токенов, — DeepSeek оказывается дешевле: $0,22 против $0,37, несмотря на более высокую цену по прайсу. Если «недооценённый» означает «лучше, чем его репутация с точки зрения качества на параметр», этот ярлык справедлив. Если же это означает «вам стоит использовать именно её», столбцы скорости и задержки говорят об обратном.

За пределами Artificial Analysis тоже есть независимые свидетельства. Сторонний испытательный стенд smf-bench опубликовал 5 сентября прогон «Official A»: Qwen3.8-Flash-Next в квантизации NVFP4 от NVIDIA на одном DGX Spark, с отключённым режимом размышления, набрал 137 из 157 (87,3%) с чистым результатом 30 из 30 в разделе программирования, против 117 из 157 у прогона DeepSeek V4 Flash Vision-Exp на двух Spark на том же наборе из 157 тестов. Это один стенд на одном классе машин, и он не заменяет широкую оценку — но это вторая точка данных, указывающая в том же направлении, и она исходит от того, у кого нет интереса ни к одному из поставщиков.
Что на самом деле представляет собой архитектура Qwen4
Два механизма формируют эту историю. Первый, GDN — Gated Delta Network, — это слой линейного внимания Alibaba. Тогда как стандартный трансформер хранит кэш ключей и значений, который растёт с длиной последовательности, слой GDN поддерживает рекуррентное состояние фиксированного размера и обновляет его с помощью обученного правила гейтирования; линия развития проходит через DeltaNet и Mamba-2. Выигрыш — в том, что именно этот механизм незаметно обеспечивает работу линейки Qwen начиная с Qwen3-Next: длинные контексты остаются дешёвыми, потому что состояние не растёт, а меньшинство слоёв полного внимания остаётся в смеси, чтобы выполнять точный поиск, с которым линейное внимание плохо справляется. В текущем поколении эта смесь даёт примерно три слоя GDN на каждый слой полного внимания — согласно анализу сообщества, в чекпоинте Qwen3.8-2.4T-A95B насчитывается 69 слоёв GDN против 23 слоёв внимания. Qwen3.8-Flash-Next показывает то же соотношение три к одному: 36 слоёв линейного внимания против 12 слоёв полного внимания.
Второй, QSA — Qwen Sparse Attention — это действительно новая часть, и его публичное описание всё ещё скудно: в карточке модели добавляется, что он работает на уровне микроблоков с бюджетом в 512 блоков / 2048 токенов, но полного технического описания пока не существует. Эта скудость деталей сама по себе является частью закономерности. Анонс Qwen3-Next в конце 2025 года представил Gated DeltaNet с такой же скудной документацией, и архитектура была полностью описана только после того, как её приняла серия Qwen3.5. Для читателя практический вывод в обоих случаях одинаков: архитектурная «канарейка» появляется первой, документация и рабочие модели появляются позже.
Плейбук, который уже однажды сработал
Alibaba уже проворачивала этот же трюк раньше, и он сработал. В конце 2025 года Qwen3-Next предварительно представил Gated DeltaNet и гибрид линейного и полного внимания. Когда вышла серия Qwen3.5, она масштабно переняла этот шаблон — и с тех пор гибрид сохраняется в поколении Qwen3.8, включая флагман 2.4T. Причина, по которой этот прецедент здесь важен, — сроки, которые он подразумевает. Полное семейство Qwen4 следует ожидать по другую сторону этого превью, а не внутри него; если ориентироваться на разрыв с Qwen3-Next, расстояние между «вот архитектура» и «вот семейство» измеряется месяцами. Ничто в карточке модели этого не подтверждает — это вывод из закономерности, которую Alibaba к настоящему моменту воспроизвела дважды.
Чего мы до сих пор не знаем
Неизвестных стало меньше, но они не исчезли:
Таблица бенчмарков вендора по-прежнему остается вендорской. Artificial Analysis теперь независимо оценила модель, что устраняет самый большой пробел в освещении запуска, — но собственное ключевое утверждение Alibaba о том, что модель превосходит Claude Opus 4.6 Max в 8 из 9 сопоставимых бенчмарков, опирается на собственные внутренние оценки Alibaba (CoWorkBench, JobBench, AndroidWorld) наряду с публичными, и ни одна из них не была воспроизведена третьей стороной.
• Является ли предварительная версия той же моделью, что и обслуживаемая. Карточка позиционирует Qwen3.8-Flash-Next как экспериментальную предварительную версию с открытыми весами, тогда как производственный обслуживаемый вариант — Qwen3.8-Flash от Qwen Cloud — добавляет контекст по умолчанию размером 1 000 000 токенов и встроенные инструменты. Является ли эта обслуживаемая модель той же архитектурой при большем окне контекста, всё ещё не указано, и независимые оценки выше относятся к предварительной версии с открытыми весами, а не к обслуживаемой модели API.
• Лицензия известна и является реальной лицензией: Qwen Community License 1.0 разрешает коммерческое использование, включая продажу производных работ, но требует отдельного коммерческого соглашения с Alibaba, если вы ведёте бизнес Model-as-a-Service или AI-work-assistant и превышаете определённый порог выручки и ежемесячно активных пользователей. Это не то же самое, что лицензия Qwen3.8-Max с порогом по выручке, но её стоит прочитать, прежде чем строить что-либо на этих весах.
• Об одном отчёте с практики стоит сказать отдельно: в заметке от 6 сентября о сборке NVFP4 от сообщества зафиксирован сбой вызова инструментов с грамматическими ограничениями, когда одновременно включены режим размышления и предсказание нескольких токенов; источник прослеживается до пути ограниченного декодирования xgrammar. Это ошибка времени выполнения в квантованной сборке сообщества, а не свойство модели, — но если ваш стенд для оценки опирается на вызовы инструментов с грамматическими ограничениями, это первое, что нужно проверить.
Семья, работающая по двухнедельному циклу
Окружающий ритм — это отдельная история. Qwen3.8-Max, флагман с 2,4 трлн параметров, выпущен 3 августа; Qwen3.8-2.4T-A95B с открытыми весами последовал 12–13 августа; бесплатная Qwen3.8-27B под Apache-2.0 появилась через несколько дней; а теперь, до конца месяца, показывают архитектуру следующего поколения — и через неделю её независимо тестируют. Ни одна другая лаборатория сейчас не выпускает итерации с такой частотой. Для читателя, выбирающего модели, практическое следствие таково: «лучший Qwen» — это движущаяся цель, а разрыв между поколениями наступает быстрее, чем обычно успевает адаптироваться окружающая экосистема. Покупать решение, а не модель, — всё более оправданный ход.
Что разработчику следует делать сейчас
Цифры эффективности меняют расчёт локального обслуживания сильнее, чем сам запуск. 6B-active модель, набирающая 40 баллов в текущем индексе, поддаётся сжатию: официальная квантизация NVFP4 от NVIDIA — именно та, что использовалась в прогоне smf-bench от 5 сентября, а созданные сообществом сборки NVFP4 и FP8 помимо неё уже находятся в обращении, что и делает развёртывание модели с 180B хранимых параметров класса одной GPU вообще возможным. Оговорка неизменна — это непроверенный предварительный просмотр, таблица поставщика не воспроизведена, а характер независимых оценок (сильные на работе со знаниями и терминальных задачах, слабее на долгосрочной генерации репозиториев и показателях прохождения агентом с одной попытки) означает, что слабости модели проявляются именно там, где живут изменения продакшн-кода. Запустите на ней малозначимую копию реальной рабочей нагрузки, прежде чем она коснётся чего-либо важного, и пусть автоматическое переключение при сбое поглощает моменты, когда предварительная версия ведёт себя неправильно.
Что касается цены, картина, которая была туманной на старте, теперь стала конкретной. Artificial Analysis указывает тариф обслуживания предпросмотра на уровне $0,15 за миллион входных токенов и $0,47 за миллион выходных — против $0,44 и $1,32 у DeepSeek V4 Flash 0731, что на тот же порядок величины, что и у обслуживаемого варианта Qwen3.8-Flash, который Qwen Cloud указывает как ¥1 и ¥3 (примерно $0,16 и $0,47). Продакшен-вариант — это тот, который вы действительно можете вызывать сегодня: здесь он маршрутизируется как qwen/qwen3.8-flash, и OrcaRouter передаёт прайс-листовую цену вендора без наценки (0%), так что когда Alibaba меняет эту цифру, эндпоинт меняется вместе с ней в тот же день. То же самое верно и для модели сравнения в этом материале — DeepSeek V4 Flash 0731 маршрутизируется как deepseek/deepseek-v4-flash-0731 по прайс-листовой цене провайдера, что делает половину сравнения выше, касающуюся стоимости за токен, проверяемой на вашем собственном трафике, а не на подсчёте токенов из бенчмарка. Что здесь не маршрутизируется, так это сам предпросмотр Flash-Next с открытыми весами: чтобы использовать его сегодня, вы скачиваете веса и обслуживаете их сами, и именно поэтому история с квантизацией выше важнее прайс-листовой цены. Потолок, который должно преодолеть это поколение, по-прежнему виден на том же эндпоинте: Qwen3.8-Max (qwen/qwen3.8-max) находится на уровне $2,00 за миллион входных токенов и $6,00 за миллион выходных, также передаваемых по прайс-листовой цене вендора.

Практическая последовательность действий почти не изменилась, а вот уверенность в ней выросла. Если вам нужен production-вариант в виде готового сервиса без скачивания 100 ГБ весов, Qwen3.8-Flash уже можно вызывать по каталожной цене. Если же вам нужна сама архитектура — GDN, QSA, таблица n-грамм, приёмы выгрузки, — веса можно скачать, а среды выполнения готовы: vLLM обслуживает её с первого дня с механизмом выгрузки, который держит таблицу эмбеддингов n-грамм на 51 млрд параметров в памяти хоста, а не в постоянной VRAM, SGLang и TensorRT-LLM входят в список Day 0 от NVIDIA, а в библиотеке Ollama есть сборка MLX, которую можно загрузить на Apple Silicon. Единственное, что стоит прекратить, — это считать качество модели неизвестным. Теперь её качество измерено, и измерения оказались хорошими.
Что посмотреть дальше
• Сохранятся ли независимые показатели по мере развития индекса. 40 у Qwen3.8-Flash-Next сопровождается необычно высоким расходом токенов — она сожгла 245 млн токенов на прогоне индекса при медиане в 140 млн — и в собственной заметке Artificial Analysis её называют «очень многословной». Оценка, полученная за счёт более длительных рассуждений, всё ещё оценка, но это из тех показателей, которые меняются при изменении методики оценки. Следующая ревизия индекса — настоящая проверка того, был ли 40 уровнем или локальным максимумом.
• Оценивается ли отдельно обслуживаемый Qwen3.8-Flash. Каждое независимое число в этом материале относится к предпросмотру с открытыми весами. У продакшен-варианта с контекстом 1M и встроенными инструментами нет собственной независимой оценки, и если это та же архитектура при более длинном контексте, это дешёвая оценка, которую кому-то следует опубликовать.
• Насколько состоятельна поддержка сервинга «с первого дня» на практике — заявленные производителем показатели пропускной способности GB300 по-прежнему остаются заявленными производителем, а конфигурации экспертного параллелизма TP4 и KV-offload всё ещё настолько новые, что могут быть хрупкими.
• Как долго Alibaba ждёт, прежде чем полное семейство Qwen4 последует за превью.
Часть этой истории, касающаяся того, что нам уже известно, теперь в значительной степени закрыта. Спецификация опубликована, веса доступны для скачивания, архитектура подтверждена, обслуживаемый вариант Qwen3.8-Flash уже работает на хостинговых API по каталожной цене, и модель была независимо оценена двумя разными сторонами — при этом меньшая модель победила в споре о качестве, а большая — в споре о пропускной способности. Открытым остаётся вопрос, обобщается ли предварительная версия с 6B активных параметров за пределами бенчмарков, под которые она настраивалась, и как долго Alibaba будет ждать, прежде чем последует полное семейство Qwen4. Этот последний вопрос по-прежнему остаётся тем, на который релиз не даёт ответа, и по-прежнему именно он будет иметь наибольшее значение.
Сравнение в этой статье4
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
