Заглавная титульная карточка для «Qwen3.8-Max vs Qwen 3.8» с подзаголовком «Одно ядро 2.4T — арендуемый API или открытые веса», бейджами для обновления 0902 от 2 сентября 2026 года, размещённого API по цене $2/$6 за 1 млн токенов и открытых весов от 12 августа, а также нижним колонтитулом, в котором указано, что независимый Code Arena WebDev #1 достиг результата 1,691 для сборки 0902, а у открытого чекпойнта пока нет независимых оценок.
Guides & Insights

Qwen3.8-Max против Qwen 3.8: одно ядро 2.4T — арендовать или запускать — после обновления 0902

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

2 сентября 2026 года Alibaba выпустила датированное обновление Qwen3.8-Max — сборку, которую она закрепила как Qwen3.8-Max-0902 — и независимый рейтинг кодинга поставил новый снимок на #1 уже на той же неделе. Загружаемая версия того же ядра с 2,4 триллиона параметров — модель, которую большинство людей имеет в виду, когда пишут «Qwen 3.8» без суффикса, — всё ещё остаётся на контрольной точке от 12 августа: только текст, рассуждения включены принудительно, и ей не хватает сотен гигабайт, чтобы запуститься на чём-то меньшем, чем стойка GPU. Этот разрыв между размещённой флагманской моделью и открытыми весами в августе не существовал. Теперь это и есть всё сравнение, и именно поэтому одна и та же модель продолжает продаваться вам под двумя именами.

Qwen3.8-Max — это размещённый флагман Alibaba: разреженная модель смеси экспертов с 2,4 триллиона параметров, примерно 95 миллиардов активных параметров на токен, доступная через платный API с 3 августа и с мультимодальным контекстным окном на 1 миллион токенов. Qwen 3.8, если рассматривать это название отдельно, — открытый релиз того же поколения; наиболее значимый его элемент — Qwen3.8-2.4T-A95B, веса которой Alibaba опубликовала 12 августа под собственной лицензией. Это не две разные модели — подешевле и попремиальнее. Это один и тот же мозг, продаваемый двумя способами, и сентябрьский этап постобучения начал разводить эти два воплощения в разные стороны. Этот материал поможет разобраться, какой именно «Qwen 3.8» перед вами, что изменило обновление 0902 и какой путь — арендовать API или запускать веса — вам стоит выбрать сегодня.

Пара, которая не является соперничеством

Прежде чем перейти к датам и тарифным картам, об архитектуре: Qwen3.8-Max и Qwen3.8-2.4T-A95B объединяет мелкозернистая MoE-архитектура с 512 экспертами на слой (10 маршрутизируемых плюс один общий на слой), 92 слоями и гибридным стеком, в котором 69 из 92 слоёв используют линейное внимание — Gated DeltaNet в сочетании с гейтированным вниманием, — а полное внимание чередуется с ними для обработки длинного контекста. Именно поэтому в карточке модели можно заявлять о контексте в миллион токенов в API, и именно поэтому открытая сборка достигает нативного контекста в 262K, который при правильной конфигурации развёртывания расширяется до миллиона. Различия между этими двумя названиями лежат не в архитектуре весов, а на границах, — и эти границы сдвинулись со 2 сентября.

• Параметры — Qwen3.8-Max: всего 2,4 трлн / ~95 млрд активных, MoE. Qwen3.8-2.4T-A95B: то же ядро, то же количество активных.

• Поставка — Qwen3.8-Max: облачный API, доступен с 3 августа, обновлён до Qwen3.8-Max-0902 2 сентября. Qwen3.8-2.4T-A95B: загружаемые веса, впервые опубликованы 12 августа, с тех пор более новых чекпойнтов не было.

• Модальность — {{1}}Qwen3.8-Max{{/1}}: ввод текста, изображений и видео. {{2}}Qwen3.8-2.4T-A95B{{/2}}: только текст.

• Управление рассуждением — Qwen3.8-Max: переключатели мышления, включая режим без мышления. Qwen3.8-2.4T-A95B: мышление всегда включено, доступен только регулятор усилия рассуждения (низкий / высокий / сверхвысокий).

• Инструментарий — Qwen3.8-Max: нативный вызов функций, пять встроенных инструментов и структурированный вывод. Qwen3.8-2.4T-A95B: нет нативного слоя инструментов; что вы получаете, зависит от фреймворка инференса, с которым вы его запускаете.

Что изменило обновление от 2 сентября

Сборка 0902 — это пост-тренировочный проход, а не новая архитектура. Alibaba нацелила её на две вещи, которыми Qwen3.8-Max уже был известен, — кодинг и «cowork», как в компании называют длительные агентные и офисные задачи, — и цифры, которые легли вокруг этого, объясняют, почему это обновление имеет значение. На независимом лидерборде Code Arena: WebDev Qwen3.8-Max-0902 дебютировала с рейтингом 1 691 Elo — на 22 пункта выше предыдущей сборки, и этого хватило, чтобы сразу занять первое место. Alibaba также позиционирует сборку как модель с наилучшими показателями на границе цена-производительность этого лидерборда при смешанной ставке около $5 за миллион токенов: справочные цены $2 и $6, взвешенные по агентному трафику с преобладанием выходных токенов, — это примерно четверть стоимости сопоставимого вызова фронтирной модели где-либо ещё. Эти цифры стоит держать раздельно: 1 691 Elo — результат независимой арены, а формулировка про границу Парето — собственная характеристика Alibaba для этого независимого лидерборда.

Внутренние оценки Alibaba для прохода 0902, предоставленные вендором и не воспроизведённые независимо, показывают ту же тенденцию: Terminal-Bench 3.0 вырос с 11,3 до 29,0, ProgramBench — с 10,5 до 28,0, JobBench — с 53,4 до 64,0, а Elo в WorkArena — с 1 348 до 1 468. Воспринимайте это как «обновление сдвинуло агентную и кодовую оси», а не как проверенные показатели. На стороне общего интеллекта индекс Intelligence Index от Artificial Analysis даёт Qwen3.8-Max 56 баллов — конкурентоспособно, но это не причина тянуться к модели; причина — результаты по кодингу и агентным задачам.

То, что упустило большинство публикаций, — пост-обучение 0902 на данный момент доступно только через API. Alibaba не опубликовала открытый чекпоинт обновлённой модели: веса Qwen3.8-2.4T-A95B на Hugging Face по-прежнему восходят к релизу от 12 августа. Это означает, что размещённая в облаке Qwen3.8-Max и загружаемая основная модель больше не являются одной и той же моделью, как это было в середине августа. В API есть сентябрьское пост-обучение; в весах его нет. Если вся причина, по которой вы запускали открытую версию, заключалась в точном воспроизведении того, что делает флагманская модель, это допущение тихо перестало быть верным 2 сентября.

A comparison scoreboard for Qwen3.8-Max (0902) and Qwen 3.8 (2.4T-A95B open): left column shows Hosted API with a Sep-2 build tag, Text + image + video, 1M native context, a thinking toggle including off, native tools and JSON, and $2/$6 per 1M with a $0.25 cache tag; right column shows Open weights with an Aug-12 tag, Text only, 262K native context, thinking always on, framework-level tools and JSON, and weights plus your own GPUs; the footer notes independent Code Arena WebDev 1,691 and AA Index 56 for the Max, and that the open checkpoint has no independent scores yet.

Пять точек, в которых они действительно расходятся

{{1}}Если отложить в сторону общую архитектуру, практические различия выстраиваются чётко.{{/1}} {{2}}Первый фильтр — модальность: {{/2}}если ваша задача включает изображения или видео — скриншоты, диаграммы, документы с иллюстрациями, видеокадры — {{3}}только Qwen3.8-Max принимает их, и его окно в 1 млн токенов является нативным, а не расширением.{{/3}} Открытые веса работают только с текстом. {{4}}Второй фильтр — управление рассуждением: {{/4}}хостируемый API может работать с отключённым мышлением, что важно для чувствительных к задержкам и высоконагруженных задач извлечения данных, где цепочка рассуждений — чистые накладные расходы; открытая сборка не может отключить этот режим. {{5}}Третий фильтр — инструментарий: {{/5}}вызов функций, пять встроенных инструментов и JSON-режим входят в хостируемый продукт, {{6}}тогда как открытая сборка зависит от того, что предоставляет ваш сервисный слой.{{/6}}

Контекст тоньше, чем предполагают технические характеристики. Обе стороны могут достигать примерно миллиона токенов, но размещённая модель делает это естественно, с мультимодальным вводом, тогда как у открытой сборки собственный контекст в 262K должен быть расширен в конфигурации, и каждый токен этого расширенного окна — это текст. Ограничения на выход тоже различаются: API допускает до примерно 131K выходных токенов, и открытая сборка обычно настроена на аналогичный потолок, но практический потолок на открытой стороне задаётся вашим серверным стеком, а не моделью.

Сколько на самом деле стоит каждый маршрут

{{1}}Именно здесь два варианта предоставления перестают быть сопоставимы в принципе.{{/1}} {{2}}Прейскурантная цена Qwen3.8-Max: $2,00 за миллион входных токенов, $6,00 за миллион выходных и $0,25 за миллион кэшированных входных токенов.{{/2}} {{3}}Поскольку OrcaRouter передаёт прейскурантные цены провайдера с нулевой наценкой, вы платите именно эту цену; когда Alibaba меняет её, новая цена вступает в силу в тот же день.{{/3}} {{4}}Снапшот 0902 закреплён отдельно как qwen/qwen3.8-max-0902 для команд, которым нужно воспроизводимое поведение — та же цена, те же возможности, но фиксированный чекпойнт вместо постоянно обновляемой модели.{{/4}} {{5}}По трафику OrcaRouter, семидневная медиана времени до первого токена для Qwen3.8-Max составляет примерно 2–4 секунды, а по измерениям Artificial Analysis — около 45–48 выходных токенов в секунду: модель не медленная, но многословная, поэтому агентные задачи на ней могут расходовать неожиданно большие объёмы токенов, несмотря на невысокий тариф.{{/5}}

A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the flagship description, the price card at $2.00 per 1M input and $6.00 per 1M output tokens, a 1,000,000-token context window, and 7-day median time-to-first-token and traffic figures.

У Qwen3.8-2.4T-A95B нет установленной цены: цена — это ваша инфраструктура. Веса в BF16 занимают примерно 4,9 ТБ, и даже официальная сборка FP8 — около 2,4 ТБ, так что это оборудование масштаба стойки: минимальные документированные конфигурации для обслуживания начинаются примерно с восьми GPU B300 или GB300, а эталонным вариантом развёртывания служит полная стойка GB300 NVL72. Агрессивное квантование меняет нижнюю границу: сборка NVFP4 умещается примерно в 1,3 ТБ, а послойное 1-битное квантование от Unsloth сжимает модель примерно до 397 ГБ — именно это наконец делает возможным использование одного хорошо оснащённого узла. Но каждый из этих путей предполагает, что вы эксплуатируете GPU в масштабе дата-центра. Сторонние провайдеры, обслуживающие открытый чекпойнт, продадут вам токены дешевле, чем Max за токен, но в этом случае вы теряете мультимодальный ввод, режим без рассуждений, нативный инструментарий и пост-обучение 0902; независимых бенчмарков самого этого скачиваемого чекпойнта до сих пор не опубликовано. Собственная карточка модели от Alibaba откровенно описывает эту связь: в ней Qwen3.8-Max назван официальной версией на базе Qwen3.8-2.4T-A95B, которая добавляет к открытому ядру визуальный ввод, поддержку режима без рассуждений, контекст по умолчанию 1M и встроенные инструменты.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-2.4T-A95B, showing the Text Generation and Transformers tags and the card text explaining that Qwen3.8-Max is the official version built on Qwen3.8-2.4T-A95B with vision input, non-thinking support, a 1M default context, and built-in tools.

Независимые цифры против заявлений производителей

Честность источников здесь важнее, чем в большинстве сравнений, потому что у двух сторон очень разный возраст свидетельств. Qwen3.8-Max получил независимые оценки: результат Code Arena: WebDev 1,691 для сборки 0902 и Индекс интеллекта Artificial Analysis, равный 56, являются сторонними измерениями, а ценообразование, которое делает утверждение о парето-границе интересным, — это опубликованный тариф. Qwen3.8-2.4T-A95B пока этого не имеет — опубликованная Alibaba таблица бенчмарков описывает ядро класса Max, а не независимый прогон загружаемого чекпоинта, так что открытая сторона этого сравнения всё ещё в значительной степени «продавец утверждает, что ядро показывает такие результаты». Если вы выбираете между ними по возможностям, относитесь к громким цифрам открытых весов как к заявлениям, пока их не проверит третья сторона.

Кто должен выбирать

Решение выпадает из списка выше. Обращайтесь к размещенному Qwen3.8-Max — сегодня, а именно к сборке 0902, — когда вам нужны сентябрьское пост-обучение, ввод изображений или видео, режим без мышления, нативные инструменты и структурированный вывод или окно в миллион токенов без развертывания инфраструктуры. Это передовая позиция в области кодинга и агентных систем, и при цене $2/$6 с $0.25 за кэшированный ввод она агрессивно оценена за то, что предлагает.

Выбирайте Qwen3.8-2.4T-A95B, когда контроль важнее удобства: вам нужны веса на собственном оборудовании или у провайдера, которым вы уже управляете; вы хотите фиксированный контрольный снимок, который можно проверить и воспроизвести; или ваш постоянный объём делает стоимость за токен доминирующим фактором, и вы готовы запускать MoE на 2,4T. Примите список компромиссов — только текст, мышление всегда включено, нет встроенных инструментов, ещё нет пост-обучения 0902 — и проверьте условия лицензии для вашего диапазона выручки, потому что кастомная лицензия Qwen3.8-Max — это не Apache 2.0, и она добавляет требования для крупных коммерческих операторов.

Если ваша рабочая нагрузка высокообъёмна, работает на одном GPU или чувствительна к задержкам, возможно, ни одна из этих моделей не подойдёт — для таких задач предназначена родственная 27-миллиарднопараметровая модель того же поколения, Qwen3.8-27B, которая отдельно рассматривается в нашем сравнении Qwen3.8-27B vs Qwen3.8-Max.

Как попробовать оба варианта, не ставя всё на кон

Правильный способ принять такое решение — прогнать обе стороны на собственных промптах. И это как раз тот случай, когда маршрутизирующий слой оправдывает себя, а не прикручивается поверх как надстройка. Qwen3.8-Max и закреплённый снепшот Qwen3.8-Max-0902 находятся за одним OpenAI-совместимым эндпоинтом в OrcaRouter, поэтому переключение между обновляющимся флагманом и воспроизводимым чекпойнтом — это смена model-id, а не повторный деплой. Когда команда решает забрать открытые веса к себе, DSL маршрутизации может выступить фронтом для самохостингового эндпоинта vLLM или SGLang, обслуживающего Qwen3.8-2.4T-A95B, и встроить его в тот же граф вызовов: массовый трафик уходит на собственный деплоймент, а сложные промпты и мультимодальные запросы перетекают на хостируемый Qwen3.8-Max — с автоматическим фейловером между ними. Опробовать новый чекпойнт таким способом стоит правки конфигурации, а не миграции, а это именно то, что нужно, когда две стороны этого сравнения всё ещё движутся с разной скоростью.

Суть

Qwen3.8-Max и Qwen 3.8 — это не две модели, борющиеся за одну и ту же работу. Это одно ядро с 2,4 триллиона параметров, доступное как арендуемый API и как скачиваемые веса. Обновление от 2 сентября придало этим двум вариантам поставки разный смысл. Арендуя API, вы получаете пост-тренинг 0902, занявший лидирующую позицию в Code Arena: WebDev, а также зрение, режим без рассуждений, нативные инструменты и нативное окно на миллион токенов — по цене $2/$6 с $0,25 за кэшированный ввод. Запуская открытые веса, вы получаете ту же архитектуру, замороженную в состоянии от 12 августа: только текст, рассуждения всегда включены. Пока независимых результатов нет, и есть счёт за оборудование дата-центра. Если для вас важны сентябрьские улучшения в кодинге и агентных сценариях, сегодня они есть только у одного из двух названий. Если же важнее воспроизводимость и контроль, то только одно из двух названий вы сможете оставить себе.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно