Обзор Qwen3.8-Max: флагман Alibaba с 2,4 трлн параметров по цене $2/$6 — сборка 0902 лидирует в Code Arena WebDev
Guides & Insights

Обзор Qwen3.8-Max: флагман Alibaba с 2,4 трлн параметров по цене $2/$6 — сборка 0902 лидирует в Code Arena WebDev

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Alibaba Qwen представила Qwen3.8-Max на Всемирной конференции по искусственному интеллекту в Шанхае 19 июля 2026 года, и в течение двух недель это была самая обсуждаемая модель, цену которой никто не мог установить. Не было ни прайс-листа, ни таблицы бенчмарков, ни карточки модели, ни лицензии, ни количества активных параметров — только заголовок о 2,4 триллиона параметров и заявление о том, что модель уступает только Claude Fable 5.

3 августа 2026 года это изменилось. Qwen3.8-Max стала общедоступной: опубликован прайс-лист — $2 за миллион входных токенов и $6 за миллион выходных; эндпоинт, совместимый с OpenAI и DashScope; полная таблица бенчмарков и открытые веса, выпущенные 12 августа. Неделю спустя, 14 августа, модель заработала на DigitalOcean Serverless Inference — Alibaba назвала DigitalOcean своим «партнёром запуска в день ноль», — став первым крупным западным облаком, предоставившим её. 2 сентября Alibaba выпустила именное обновление, Qwen3.8-Max-0902, дополнительно дообученное на наборах Coding и Cowork, что, по словам Qwen, усиливает производительность при решении сложных корпоративных и научных задач. Этот обзор написан на основе фактов GA с учётом запуска в день ноль и сборки 0902; он отвечает на вопрос, который команды действительно задают теперь, когда модель можно приобрести: готова ли Qwen3.8-Max принимать продакшен-трафик или она всё ещё модель из списка наблюдения?

Краткий ответ: она продвинулась дальше, чем ожидало большинство, — особенно агрессивное ценообразование, которое задаёт новую ценовую планку для передовых решений, а обновление от 2 сентября удваивает ставку на то, в чём модель и раньше была сильна, — на программирование и совместную работу. Появившийся с тех пор независимый отчёт действительно хорош, но в нём есть оговорка, с которой стоит ознакомиться, прежде чем отправлять трафик.

TL;DR. Qwen3.8-Max теперь общедоступна по цене $2 / $6 за 1M токенов, ставка фиксирована для всего контекста в 1M токенов, без надбавки за длинные промпты — это делает её дешевле Kimi K3 ($3/$15) и Claude Opus 5 ($5/$25) по выходным токенам, которые являются основным фактором затрат в задачах на рассуждение. Alibaba опубликовала впечатляющую таблицу бенчмарков (Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1), а скачок в программировании по сравнению с предшественником огромен: FrontierSWE 73.5 против 40.7. Но таблица качества — собственная у Alibaba, и первый независимый арбитр — Artificial Analysis Intelligence Index — уже высказался: Qwen3.8-Max набирает 56 при $1.14 за задачу, вровень с Claude Opus 4.8 (56) и на одно очко позади лидера открытых весов Kimi K3 (57), при этом стоимость задачи на 25% выше. Число активных параметров больше не под вопросом: 95B активируется из 2.4T общих, что подтверждено в официальной карточке модели и наконец позволяет сторонним специалистам оценивать экономику инференса. С момента первой публикации этого обзора открылся и второй управляемый путь: Qwen3.8-Max вышла на DigitalOcean Serverless Inference 14 августа — DigitalOcean выступил партнёром Alibaba уровня Day 0 — и опубликовал показатели инференса: prefill масштабируется примерно до 16 000 токенов/сек, выходные токены — до ~1 937 токенов/сек при 256 параллельных запросах и нулевой ошибке. Это первые реальные данные о задержках от провайдера, отличного от Alibaba. 2 сентября Alibaba обновила флагман как Qwen3.8-Max-0902, дополнительно дообученный на данных Coding и Cowork; по словам Qwen, новый снапшот сильнее в сложных корпоративных и научных рабочих нагрузках — заявление вендора, независимых цифр для корпоративных и научных задач пока нет. Кодинг-составляющая сборки 0902 теперь имеет собственный независимый результат на арене: Qwen3.8-Max-0902 дебютировала на #1 в Code Arena: WebDev с 1 691 очком — на 22 больше, чем у предыдущей сборки, и впереди Claude Opus 5 и Kimi K3, — по данным Alibaba, ссылающейся на живой сторонний рейтинг. В ту же неделю история агентной коммерции обзавелась своей таблицей результатов: на CommerceAgentBench, новом бенчмарке команды Accio из Alibaba, построенном на репликах с сохранением состояния реального коммерческого ПО, Qwen3.8-Max показывает сильнейший результат среди моделей с открытыми весами — 156 совокупных прохождений в трёх тестовых конфигурациях, на два больше, чем у DeepSeek V4 Pro. Это таблица от вендора, а не от независимого арбитра. Вердикт: модель действительно можно покупать уже сейчас, и она достаточно дёшева, чтобы оправдать полноценную оценку, — но запускать её стоит продуманно и точечно, а не оптом.

Основные выводы

GA с 3 августа 2026 года. Эпоха превью и кредитных кампаний закончилась; теперь есть реальный прайс-лист и реальный эндпоинт.

$2 / $6 за 1 млн токенов, единый тариф для контекста в 1 млн. Большинство конкурентов взимают дополнительную плату за длинные промпты. Alibaba — нет, что имеет огромное значение для работы с длинными документами и большими репозиториями.

Таблица бенчмарков Alibaba впечатляет, но не проверена: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.

Главная новость — скачок поколений в программировании: FrontierSWE 73.5 (с 40.7) и DeepSWE 1.1 56.6 (с 21.6) — почти удвоение в обоих случаях.

Первый независимый результат уже получен: Qwen3.8-Max набирает 56 в AA Intelligence Index по цене $1.14 за задачу — на 10 пунктов больше, чем у Qwen3.7-Max (46), вровень с Claude Opus 4.8 (56), на одно очко позади Kimi K3 (57). На общем лидерборде LMArena публичного результата по-прежнему нет.

• Активные параметры подтверждены на уровне 95B — официальная карточка модели указывает 2,4T общих и 95B активируемых параметров, что закрывает самый большой открытый вопрос в расчётах стоимости обслуживания.

• Вышли открытые веса: Qwen3.8-2.4T-A95B (BF16) и Qwen3.8-2.4T-A95B-FP8 появились на Hugging Face 12 августа под специальной лицензией Qwen3.8-Max, а не под Apache 2.0. On-premise вариант Qwen3.8-27B вышел 14 августа под лицензией Apache 2.0.

Второй управляемый канал открылся 14 августа.Qwen3.8-Max теперь доступен в DigitalOcean Serverless Inference в качестве "Day 0 launch partner" от Alibaba — NVFP4 на NVIDIA HGX B300, $2/$6 с $0.20 за кэшированный ввод, обслуживается с родным для открытой контрольной точки контекстом в 262K токенов. Измеренные показатели DigitalOcean (prefill ~16K токенов/сек, ноль ошибок при 256 одновременных запросах) — это первые данные о производительности обслуживания на управляемой платформе за пределами Alibaba.

Обновление от 2 сентября: Qwen3.8-Max-0902. Alibaba дополнительно дообучил флагманскую модель на Coding и Cowork и предоставляет её на QwenCloud по той же цене $2/$6 и с тем же контекстом 1M. Qwen утверждает, что производительность в корпоративных и научных задачах стала выше — по-прежнему лишь заявления производителя —, а сторона кодинга в тот же день получила независимый результат на арене: сборка дебютировала на #1 в Code Arena: WebDev с результатом 1,691 (см. пункт о Code Arena ниже).

CommerceAgentBench: лидер среди моделей с открытыми весами, проведён вендором. На этой неделе команда Accio из Alibaba выпустила CommerceAgentBench — 107 задач с длинным горизонтом в репликах с сохранением состояния реального коммерческого и бизнес-ПО, оцениваемых по состоянию в тестовых средах Accio, OpenClaw и Pi. Qwen3.8-Max лидирует среди моделей с открытыми весами со 156 суммарными прохождениями, на два прохождения опережая DeepSeek V4 Pro; в общем зачёте лидирует закрытая модель Claude Opus 5 со 191 прохождением, причём таблица составлена самой Alibaba, а не независимым арбитром.

Code Arena: WebDev #1 — независимый результат арены сборки 0902. Qwen3.8-Max-0902 дебютировал на первом месте в лидерборде Code Arena: WebDev с результатом 1691 очко, что на 22 больше, чем у предыдущей сборки, и выше, чем у Claude Opus 5 и Kimi K3. Он также возглавляет парето-фронтир этого лидерборда по соотношению цены и производительности при средневзвешенной цене ~$5/MToken — около четверти средневзвешенной цены Claude Opus 5. Официальный аккаунт QwenCloud подтвердил эту позицию. В отличие от CommerceAgentBench, этот лидерборд — сторонний: арена со слепым голосованием людей, а не таблица Alibaba, хотя «дебют на #1» — это объявление Alibaba, фиксирующее позицию на конкретный момент времени.

Примечание о точности: таблица показателей Qwen3.8-Max в этом обзоре предоставлена Alibaba и не была независимо воспроизведена. Показатель Artificial Analysis Intelligence Index (56 при $1,14 за задание) независимо измерен организацией Artificial Analysis (AA) через официальный API Alibaba — это первый независимый арбитр модели. Цены взяты из тарифной карты GA Alibaba Model Studio. Репозитории с открытыми весами (Qwen3.8-2.4T-A95B и Qwen3.8-2.4T-A95B-FP8), показатель 95B активных параметров и текст лицензии относятся к первоисточнику: они взяты из собственной организации Qwen на Hugging Face; проверено 13 августа 2026 г. Доступность в DigitalOcean и её тарифная карта, замеры производительности сервинга и выборочная проверка GPQA с результатом 88 на квантованной сборке взяты из документации DigitalOcean и учебного руководства для сообщества, опубликованных вместе с анонсом от 14 августа; характеристика «Day 0 launch partner» — это формулировка из анонса Alibaba. Там, где мы ссылаемся на показатели конкурентов, они взяты из Artificial Analysis или от вендора, указанного в тексте. Сведения об обновлении Qwen3.8-Max-0902, анонсированном 2 сентября, во всём исходят от вендора: его спецификации, описание пост-обучения Coding-and-Cowork и заявленные улучшения для корпоративных и научных задач взяты из собственного анонса Qwen и страницы модели в QwenCloud, и ни один из этих показателей не воспроизведён независимо. Позиция Code Arena: WebDev, рассмотренная в разделе о бенчмарках, — единственное исключение: этот рейтинг представляет собой стороннюю арену со слепым голосованием, а не таблицу Alibaba, хотя «дебют на первом месте со счётом 1691» — это анонс Alibaba о позиции на конкретный момент времени, и баллы арены продолжают меняться по мере накопления голосов. Результат CommerceAgentBench, описанный ниже, относится к той же категории: бенчмарк создан и опубликован командой Accio из Alibaba International, поэтому его таблицы предоставлены Alibaba, — это бенчмарк с открытым исходным кодом, но не независимый арбитр в том смысле, в котором им является Artificial Analysis. Таблицы вендорских бенчмарков, как правило, оптимистичны — относитесь к ним как к гипотезе, которую стоит проверить на собственной рабочей нагрузке, а не как к окончательному рейтингу.

Что такое Qwen3.8-Max?

Qwen3.8-Max — флагман семейства Qw​en от Alibaba: разреженная модель смеси экспертов (sparse Mixture-of-Experts) с 2,4 триллиона параметров, контекстным окном на 1 млн токенов и нативной мультимодальной поддержкой ввода. Она принимает текст, изображения и видео, а возвращает текст. Модель поддерживает режим рассуждения, вызов функций, встроенные инструменты и структурированные выходные данные; она доступна через OpenAI-совместимую конечную точку /v1/chat/completions, поэтому большинству существующих интеграций достаточно сменить base URL, а не переписывать код. Текущий производственный снимок, выпущенный 2 сентября, — Qwen3.8-Max-0902, дополнительно дообученный на задачах Coding и Cowork.

Практические контекстные цифры немного точнее маркетинговых «1M». Облачные метаданные Alibaba указывают на окно на 983 616 токенов при включённом мышлении, максимальный вход примерно 991 тыс. токенов и максимальный выход 131 072 токена. Этот потолок вывода необычайно щедрый и важен для таких задач, как генерация кода целых файлов или составление длинных отчётов, где меньшие потолки вынуждают дробить и сшивать результат. Открытый чекпойнт, который сейчас предлагает DigitalOcean, — это другая конфигурация: в его карточке модели указано 262 144 токена изначально, с расширением примерно до 1 010 000, так что сторонние сервисы, работающие с открытой базовой моделью, обычно останавливаются на меньшем изначальном значении.

Количество активных параметров теперь обнародовано, и название репозитория несёт его в себе: A95B означает 95 миллиардов активированных. В официальной карточке модели Qwen3.8-2.4T-A95B указано «2.4T всего и 95B активированных». Это мелкозернистая смесь экспертов (Mixture-of-Experts) с 512 экспертами, из которых на каждый токен активны 10 маршрутизируемых плюс один общий. Это число важнее, чем заголовочные 2.4T. Для плотной модели общее количество параметров примерно определяет стоимость инференса; для модели MoE оно не значит почти ничего — значение имеет только число активных, потому что именно они реально выполняются на каждом токене. Модель 2.4T, активирующая 30B, совершенно иначе ведёт себя и по задержке, и по экономике обслуживания, чем модель, активирующая 200B. При 95B активных вычислительная нагрузка на токен оказывается того же порядка, что у плотной модели в районе отметки 90B, — то есть лишь долей того, что потребовала бы плотная модель 2.4T. Именно это число наконец делает вопрос о самостоятельном размещении ниже разрешимым.

Обновление от 2 сентября: Qwen3.8-Max-0902

2 сентября 2026 года Qwen выпустила своё первое именованное производственное обновление. Qwen3.8-Max-0902 сохраняет ту же разрежённую архитектуру MoE на 2,4 трлн параметров, те же 95 млрд активных параметров и то же окно контекста на 1 млн токенов, но получил дополнительный пост-тренинг по двум направлениям — Coding и Cowork — и уже доступен в API QwenCloud как qwen3.8-max-0902 (также указан как qwen3.8-max-2026-09-02). Это текущая рекомендованная сборка, а не побочная ветка: безымянная конечная точка qwen3.8-max от Alibaba теперь обслуживает снапшот 0902, поэтому вызов стандартного имени модели попадает на обновление, а идентификатор с датой предназначен для команд, которым нужно закрепить точную сборку. С 3 сентября снапшот также указан как отдельный маршрутизируемый идентификатор модели в сторонних управляемых API. Тарифы не изменились: $2 за 1 млн входных токенов, $6 за 1 млн выходных, с теми же тарифами на кэш.

Утверждения о производительности принадлежат Qwen. В анонсе и на странице модели QwenCloud описываются: способности к программированию, которые «открывают новые горизонты» в проектах инженерного масштаба и долгосрочной автономной разработке; «значительно улучшенная» совместная работа агентов при оркестрации множества инструментов и сквозном выполнении задач; а также — как выражается компания — более высокая производительность на сложных корпоративных задачах, научных исследованиях и длительных рабочих циклах. Первая независимая проверка состоялась в тот же день. Qwen3.8-Max-0902 дебютировал на первой строчке Code Arena: WebDev — сторонней арены со слепым голосованием для агентной веб-разработки, которая ранее называлась WebDev Arena, — набрав 1691 балл, что на 22 балла больше, чем у предыдущей сборки, и выше, чем у Claude Opus 5 и Kimi K3, по данным Alibaba со ссылкой на текущий рейтинг. Это место в тот же день подтвердил официальный аккаунт Qwen, указав на QwenCloud API. Что это доказывает и чего не доказывает, разбирается в разделе о бенчмарках ниже. Остальные заявленные преимущества обновления — корпоративные рассуждения, научная работа и общая автономность на длинных горизонтах — по-прежнему исходят от самого вендора, так что сохраняйте дисциплину, которая применялась к августовской таблице: рассматривайте их как гипотезу, пока прогон Artificial Analysis или реальная рабочая нагрузка не подтвердит их.

Интерес в обновлении заключается в том, что «Cowork» означает на практике. Qwen3.8-Max эпохи GA уже делал ставку на автономию с длинным горизонтом — 16-дневную сборку oh-my-cli, виртуальный бизнес на 2000 с лишним раундов, — а сборка 0902 показывает, что Alibaba удваивает усилия на этом направлении: агенты оркестрируют несколько инструментов и выполняют задачу от начала до конца, а не дают одноразовые ответы. На той же неделе команда Accio из Alibaba опубликовала CommerceAgentBench — бенчмарк, созданный для прямой оценки этого направления: 107 задач с длинным горизонтом в репликах с сохранением состояния реального коммерческого и делового ПО, где Qwen3.8-Max лидирует среди моделей с открытыми весами. Подробнее — в разделе о бенчмарках ниже. Командам, оценивающим модель для корпоративного использования, стоит проверять это заявление в первую очередь, поскольку именно его труднее всего подтвердить по таблице бенчмарков.

Цены: самое агрессивное в этом запуске

Alibaba Model Studio указывает Qwen3.8-Max по цене $2.00 за 1M входных токенов и $6.00 за 1M выходных токенов. Вывод включает токены размышлений, что важно, поскольку конфигурации с интенсивными рассуждениями тарифицируют свои внутренние размышления по ставке выходных токенов. Экономика кэша: попадания кэшированных входных токенов стоят $0.25 за 1M, явное создание кэша — $2.50, а явное чтение кэша — $0.17.

Структурно интересно здесь не ключевая цифра, а плоский тариф. Alibaba взимает одни и те же $2/$6 независимо от того, содержит ли ваш промпт 5 000 токенов или 900 000. Большинство конкурентов применяют надбавку за длинный контекст именно потому, что обслуживание промпта почти на миллион токенов дорого стоит. То, что Alibaba берёт эти расходы на себя, — это намеренный захват рынка, нацеленный ровно на те задачи, где длинный контекст и есть суть: ревью кода всего репозитория, анализ контрактов и поданных документов, исследовательский синтез множества документов.

Разобранный пример. Допустим, вы запускаете агента анализа репозитория: 200 000 входных токенов контекста кода и 8 000 выходных токенов за вызов.

За вызов: 0.2M × $2 = $0.40 вход, плюс 0.008M × $6 = $0.048 выход. ≈ $0.45 за вызов.

При 1 000 вызовов/день: ≈ $448/день, или примерно $13 400/месяц.

Тот же вызов к Claude Opus 5 при $5/$25: $1.00 + $0.20 = $1.20 — примерно в 2,7 раза больше.

При кэшировании промптов в стабильном контексте кода кэшированный ввод по цене $0.25 снижает входную стоимость с $0.40 до $0.05, доводя вызов до ≈ $0.10 — то есть почти в 4.5 раза меньше для повторного трафика.

Именно эта разница в кэше и есть источник настоящего бюджета. Если ваш агент на каждом шаге перечитывает практически неизменный контекст — а это характерно для большинства агентов для написания кода и поддержки — эффективная цена оказывается гораздо ближе к $0.25/$6, чем к $2/$6. Команды, пропускающие настройку кэша, регулярно переплачивают в 3–4 раза на этой модели.

Для сравнения по прейскурантным ценам: Qwen3.8-Max $2/$6; его собственный предшественник Qwen3.7-Max $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. По входу Qw​en лишь конкурентоспособен. По выходу — стороне, которая доминирует в расходах на рассуждения и агентную работу, — это самая дешёвая модель с заявленным статусом frontier в этом списке.

Независимое измерение Artificial Analysis вскрывает оборотную сторону этих дешёвых токенов. Согласно его Intelligence Index, Qwen3.8-Max стоит $1,14 за задачу — более чем вдвое больше, чем $0,53 у предшественника, и на 25% выше, чем $0,86 у Kimi K3, хотя у Kimi K3 в прайсе указано $3/$15 за токен. Разрыв поведенческий, а не повышение цены: модель в среднем делала 64 шага на задачу GDPval-AA против 14 у Qwen3.7-Max, а поскольку харнесс на каждом шаге заново отправляет полный диалог, входные токены выросли примерно в 15 раз, а выходные — примерно на 45%. Дешёвые токены не равны дешёвым агентам — многословие, на которое указывали тестировщики предварительной версии, теперь имеет измеримый ценник. Поскольку OrcaRouter пропускает цены из прайс-листа с нулевой наценкой через единый OpenAI-совместимый эндпоинт, вопрос «$1,14 против $0,86» можно проверить на одинаковых промптах без второго контракта.

Таблица бенчмарков и что именно измеряет каждое число

На GA Alibaba опубликовала таблицу, которую скрыла на превью. Заявленные результаты:

Terminal-Bench 2.1 — 86.6. Измеряет, может ли модель довести работу с реальной оболочкой до конца: выполнять команды, читать вывод, восстанавливаться после ошибок. Это наиболее близкий показатель того, «может ли она работать как агент программирования, а не как подсказчик кода».

GPQA Diamond — 92.6. Вопросы по физике, химии и биологии аспирантского уровня, составленные так, чтобы на них нельзя было найти ответы в открытых источниках. Высокий балл говорит о подлинном научном мышлении, а не о запоминании. 92.6 — лучший результат в данной области.

PaperBench — 93.0. Воспроизведение результатов из научных статей — чтение методологии и её повторная реализация. Вознаграждает устойчивое многошаговое понимание.

IFBench — 82.8. Выполнение инструкций в условиях ограничений: формат, длина и негативные инструкции. Примечательно, что это самый низкий результат в собственной таблице Alibaba, что согласуется с жалобой времен превью: модель настолько дотошна, что игнорирует ограничения по объему.

OSWorld-Verified — 86.1. Использование компьютера: управление реальным графическим интерфейсом рабочего стола для выполнения задач. Высокий результат здесь подтверждает позиционирование в качестве агента.

OmniDocBench 1.5 — 92.1.Разбор документов — таблицы, вёрстка, смешанный текст и изображения. Сочетается с контекстом 1M по фиксированной ставке, что делает документные пайплайны по-настоящему оправданными.

FrontierSWE — 73.5, что выше 40.7 у предшественника. DeepSWE 1.1 — 56.6, что выше 21.6.

Эти последние два момента заслуживают особого внимания. Почти двукратный прирост на сложных бенчмарках программной инженерии за одно поколение — это не обычные инкрементальные улучшения, и это согласуется с решением Alibaba продвигать эту модель для разработчиков, а не для пользователей чат-интерфейсов. Если показатель FrontierSWE подтвердится при независимом воспроизведении, Qwen3.8-Max — серьёзная модель для написания кода, а не просто большая модель.

Предостережение из предварительного обзора уменьшилось, но не исчезло.Приведённая выше таблица была составлена Alibaba на собственном испытательном стенде в условиях, которые никто другой не может проверить. Таблицы вендоров — это результат выбора, а не случайной выборки: лаборатории публикуют те бенчмарки, в которых они сильны. Но по состоянию на 6 августа уже есть настоящий независимый арбитр: Artificial Analysis оценил Qwen3.8-Max в 56 баллов по Intelligence Index при цене $1.14 за задачу(замер на официальном API Alibaba) — скачок на 10 пунктов по сравнению с 46 у предшественника, на уровне Claude Opus 4.8 (56) и с отставанием на один балл от Kimi K3 (57). В агентном лидерборде GDPval-AA от AA модель достигает 1739 Elo, обходя Kimi K3 (1685) и GPT-5.6 Sol (1730), впереди только Claude Opus 5 (1852). Предостережения самой AA столь же весомы: более ранний прогон дал 53 до устранения проблем с эндпоинтом, а повторное тестирование на официальном API — 56; AA-Omniscience потеряла 10 пунктов из-за уровня галлюцинаций, выросшего с 23% до 40%; стоимость одной задачи высока именно потому, что модель выполняет гораздо больше шагов. Общий лидерборд LMArena по-прежнему не имеет публичного результата.

Запуск DigitalOcean добавил третью точку данных, на этот раз для квантованной сборки, а не для флагманской модели. Собственная внутренняя выборочная проверка DigitalOcean весов NVFP4, которые она предоставляет, показала 88 на GPQA Diamond по сравнению с опубликованным компанией Alibaba результатом 92,6 для неквантованной флагманской модели. Сама DigitalOcean называет это сравнение «ориентировочным показателем, а не контролируемым сравнением» — различия идут по трём осям (базовая модель с открытыми весами вместо хостируемой флагманской, NVFP4 вместо BF16 и другой оценочный стек), — но это первая независимая проверка на реальном развёртывании этих весов и напоминание о том, что открытый чекпоинт не является побайтово тем же числом, что указано в таблице Alibaba.

CommerceAgentBench: таблица лидеров агентной коммерции

Наряду с обновлением команда Accio из Alibaba International выпустила CommerceAgentBench — бенчмарк, который оценивает именно ту долгосрочную многошаговую работу, которую Qwen постоянно продвигает. Агент начинает каждое задание в новом контейнере в одной из 14 офлайн-копий реального коммерческого и бизнес-ПО — публикация товаров, бронирование грузоперевозок, администрирование магазина, платёжные операции, анализ поставщиков — а оценка основана на состоянии: задание засчитывается только тогда, когда базовые mock-сервисы и создаваемые файлы действительно изменяются, поэтому агент, который описывает правдоподобный рабочий процесс, не меняя состояние, не получает ни одного балла. Набор включает 107 задач через интерфейсы CLI, браузера, файлов/документов и API/MCP, выполняемых с помощью трёх харнессов — Accio, OpenClaw и Pi, — а код харнессов (Apache 2.0) и данные задач (CC BY 4.0) открыты для изучения или повторного запуска.

В опубликованных таблицах Qwen3.8-Max показывает сильнейший результат среди моделей с открытыми весами: 56 из 107 задач на стенде Accio, 47 на OpenClaw и 53 на Pi — в сумме 156 прохождений, на два больше, чем у DeepSeek V4 Pro со 154. Весь отрыв моделей с открытыми весами обеспечивает стенд Accio; на OpenClaw и Pi модели идут вничью. Лидерство среди открытых весов — не общее лидерство: закрытая модель Claude Opus 5 опережает всех с 191 суммарным прохождением, на 35 больше. И таблица составлена самим Alibaba — Accio это команда Alibaba, а сам репозиторий отмечает ограничения аудита: стенд Accio носит только справочный характер и не воспроизводится из checkout (OpenClaw — путь с возможностью повторного запуска), результаты на уровне задач не имеют неизменяемых публичных контрольных сумм, а строки Qwen опирались на протокол воспроизведения содержимого рассуждений для сохранения сопоставимости. Это стоит рассматривать как заявленную вендором точку данных на той же агентной оси, к которой OSWorld-Verified и подход AA's GDPval-AA подходят с разных сторон, — её стоит проверить на собственных рабочих процессах, а не считать устоявшимся рейтингом.

Code Arena WebDev: независимый арбитр сборки 0902

Code Arena — это независимое доказательство, которого не хватало обновлению. Это сторонний лидерборд для агентной веб-разработки — проекта, ранее известного как WebDev Arena, — где слепые попарные голоса людей за то, какой вывод модели пользователь предпочёл бы задеплоить, преобразуются в рейтинг в стиле Эло. На доске WebDev Qwen3.8-Max-0902 дебютировал на первом месте с 1 691 очком, на 22 больше, чем у предыдущей сборки, и опередив Claude Opus 5 и Kimi K3. У этого места есть и преимущество по эффективности затрат: при смешанной ставке около $5 за миллион токенов — тарифная сетка $2/$6, взвешенная в сторону преимущественно выходного трафика, который реально создаёт генерация веб-приложений, — сборка 0902 является самой высокорейтинговой моделью на границе Парето этой доски, обходясь примерно в четверть смешанной цены Claude Opus 5 (~$20/M) и значительно дешевле ~$12/M у Kimi K3, поэтому эти две модели и находятся вне границы, несмотря на #2 и #3 по баллам. Alibaba объявила об этом результате 2 сентября, и официальный аккаунт Qwen подтвердил его, указав пользователям на QwenCloud; это измерение не принадлежит Alibaba: в отличие от таблицы бенчмарков выше или прогона CommerceAgentBench чуть выше, этот балл получен сторонней ареной на основе голосов человеческих предпочтений.

Две оговорки помогают сохранить честность. Во-первых, рейтинги арены отражают состояние на конкретный момент: 1 691 — это уровень, на котором находилась таблица, когда Alibaba объявила о дебюте, и он будет дрейфовать по мере накопления голосов, так что воспринимайте его как сильный сигнал о кодинге для веб-разработки, а не как вечную корону. Во-вторых, он охватывает только эту одну ось. Заявления обновлённой версии о корпоративных, научных и общих долгосрочных возможностях по-прежнему не имеют независимого рефери, поэтому таблица вендоров и индекс AA Index 56 на базовой модели остаются точками отсчёта для всего, что выходит за рамки агентной фронтенд-работы. В-третьих, фронтирная цена — это модельное допущение, а не новый прейскурант: показатель ~$5/MToken объединяет неизменные списки $2/$6 в предположении о преимущественно выходном использовании, так что трактуйте его как рейтинг экономической эффективности на условиях самой арены, а не как пересмотр цен со стороны Alibaba.

Открытые веса, Qwen3.8-27B и вопрос локального развертывания

Обещание Alibaba об открытых весах теперь выполнено. 12 августа 2026 года Qwen опубликовал на Hugging Face два репозитория — Qwen3.8-2.4T-A95B в BF16 и Qwen3.8-2.4T-A95B-FP8 — каждый с 213 файлами весов. Лицензия — это кастомная лицензия Qwen3.8-Max, а не Apache 2.0; поле лицензии на Hugging Face гласит «other». Условия разрешают использование, модификацию, распространение и дообучение, включая коммерческое использование, с указанием авторства, плюс два зависящих от масштаба порога: продукты с более чем 100 миллионами месячных активных пользователей или доходом свыше $20 млн в месяц должны заметно отображать название модели, а бизнесы Model-as-a-Service или AI-Work-Assistant с совокупной выручкой за последние двенадцать месяцев свыше $50 млн нуждаются в отдельной лицензии от Qwen. Большинство команд укладываются в эти пороги; если ваш бизнес их превышает, прочитайте текст лицензии, прежде чем строить что-либо на её основе. Счётчики загрузок подтверждают недавность: 978 в репозитории BF16 и 3 851 в репозитории FP8 на момент написания — мало для фронтирного релиза и согласуется с репозиторием, созданным 8 августа и открытым для публики только 12 августа, а не с тем, который уже неделю оставался видимым. Ещё одно честное замечание: открытый чекпоинт — это базовая модель, только текстовая, с всегда включённым режимом мышления, тогда как размещённый API Qwen3.8-Max добавляет ввод изображений, опциональный режим без мышления и полный контекст на 1M токенов — скачивая веса, вы получаете модель, а не все возможности API.

Самостоятельный хостинг флагманской модели по-прежнему недоступен большинству команд, но теперь эта недостижимость подкреплена известными расчётами. Полный набор весов с 2,4 трлн параметров занимает примерно 4,9 ТБ в формате BF16 и около 2,4 ТБ в FP8, поскольку каждый эксперт должен постоянно находиться в памяти, даже несмотря на то, что на каждый токен активируются лишь 95B параметров. При 4-битном квантовании это порядка 1,2 ТБ против примерно 141 ГБ на H200, так что вам потребуется восемь или более топовых ускорителей, прежде чем будет обслужен хотя бы один токен. Что даёт теперь раскрытое число активных параметров, так это оценку пропускной способности: при 95B активируемых параметров на токен вычислительные затраты на токен сопоставимы с плотной моделью класса ~90B — это лишь доля затрат, которые накладывала бы плотная модель на 2,4 трлн параметров, — поэтому после размещения весов в памяти стоимость на токен не является тем кошмаром, который внушает общее число параметров. Именно сочетание большого объёма памяти и умеренных вычислительных затрат на токен объясняет, почему Alibaba может устанавливать цену на выходные токены в $6 за 1 млн, и указывает командам, занимающимся самостоятельным хостингом, на узлы с несколькими GPU, работающие с чекпоинтами FP8, а не на какое-либо решение с одним GPU.

Выбор DigitalOcean для обслуживания — рабочий пример этой математики в продакшене. Он запускает модель с квантованием NVFP4 на GPU NVIDIA HGX B300 специально для того, чтобы веса объёмом 2,4T поместились на одном узле, избегая межузловой маршрутизации экспертов, — это живое воплощение 4-битной экономики, которую этот раздел рассматривал на бумаге. Компромисс ровно тот, что количественно оценён в точечной проверке GPQA выше: меньший объём ценой измеримой потери качества по сравнению с неквантованной флагманской моделью.

Именно это делает Qwen3.8-27B более значимым релизом для большинства читателей — и, в отличие от флагмана, его веса вышли по расписанию. 14 августа 2026 года Qwen опубликовала Qwen/Qwen3.8-27B на Hugging Face и ModelScope под лицензией Apache 2.0: плотная модель на 27B параметров, изначально мультимодальная, с нативным контекстом в 262K токенов, расширяемым до 1M, и настраиваемым режимом reasoning_effort. Дэниел Хан из Unsloth оценивал, что она будет работать примерно в 17 ГБ видеопамяти — в пределах одной просьюмерской карты, — и теперь это можно проверить: в официальном репозитории выложены safetensors в формате BF16 (около 55,6 ГБ в 18 шардах), а в репозиториях сообщества появляются GGUF-квантования. Так что схема релизов этого поколения теперь завершена: сначала, 12 августа, вышли веса флагмана на 2,4T, а двумя днями позже появилась небольшая модель для локального развертывания. Мы отслеживали её выход в нашем посте о дате релиза Qwen3.8-27B.

Где подходит Qwen3.8-Max: четыре сценария

1. Анализ длинных документов и контрактов. Это самое сильное соответствие. Фиксированная ставка на 1 млн токенов плюс OmniDocBench 92.1 означает, что вы можете пропустить документ на 400 страниц за один вызов без дополнительной платы и без разбиения на части. Конкуренты, взимающие надбавку за длинный контекст, делают ту же работу значительно дороже. На пути DigitalOcean имейте в виду, что этот путь обслуживает открытую базовую модель с контекстом 262K — всё ещё большой документ, но не полный миллион.

2. Агенты кодирования в масштабе репозитория.Terminal-Bench 86.6 и FrontierSWE 73.5 подтверждают это, а ценообразование на кэш делает итеративную работу над стабильной кодовой базой дешёвой. Прежде всего стоит проверить задержку при вашей собственной конкурентности, поскольку рецензенты времен предварительного просмотра находили модель тщательной, но медленной в длительных агентских прогонах, а GA-обслуживание — это совсем другое дело по сравнению с предварительным просмотром. Результат AA на GDPval-AA — лидирующие 1 739 Elo ценой 64 шагов на задачу — является независимым подтверждением обеих половин этого компромисса. Измерения DigitalOcean от 12 августа — масштабирование совокупной пропускной способности почти линейно до ~1 937 выходных токенов/сек при 256 параллельных запросах с нулевым количеством ошибок и без обнаруженного насыщения — являются первой точкой данных управляемой платформы по этому вопросу, хотя это собственные цифры DigitalOcean на собственном обслуживании, а не лобовое сравнение с Alibaba.

3. Конвейеры для документов и скриншотов. Видео- и графический ввод, а также OSWorld-Verified 86.1 делают его убедительным для рабочих процессов, которые читают экраны — автоматизация QA, триаж обращений по скриншотам, задачи, смежные с RPA. Опять же, мультимодальный ввод — это функция hosted-API; путь с открытой базой DigitalOcean поддерживает только текст.

4. Где мы бы это пока не размещали. Интерактивный UX, критичный к задержкам, и любые регулируемые нагрузки, требующие воспроизводимой оценки. Для первого вам нужна измеряемая пропускная способность, которую вы контролируете. Для второго воспроизводимость теперь имеет модельную карту и лицензию для цитирования, но таблица бенчмарков Alibaba всё ещё не воспроизведена — и регрессия Omniscience от AA (уровень галлюцинаций до 40%) напоминает, что независимая оценка работает в обе стороны.

Как получить доступ к Qwen3.8-Max

{{1}}Существует несколько практических путей. Прямое подключение через Alibaba Model Studio / DashScope — или через QwenCloud API от самой Qwen — даёт вам тот же прайс-лист, что приведён выше, и самый ранний доступ к новым датированным сборкам: сборка Qwen3.8-Max-0902 от 2 сентября сначала появилась именно там и лишь затем была развёрнута на остальных эндпоинтах. Цена такого решения — подключение нового вендора и управление ещё одним ключом.{{/1}} Qwen Chat и Qwen App — самый быстрый способ своими глазами оценить поведение модели, прежде чем писать код.{{/2}} Скачивание открытых весов с Hugging Face — четвёртый путь {{3}}для команд, которые хотят развернуть собственную инфраструктуру{{/3}} — с учётом упомянутых выше ограничений по размеру и лицензии. Работа через роутер — это вариант, {{4}}который большинству продакшн-команд стоит рассмотреть,{{/4}} поскольку он отделяет решение о миграции {{5}}от решения о выборе модели.{{/5}}

Начиная с 14 августа 2026 года появился по-настоящему новый вариант: Qwen3.8-Max доступен на DigitalOcean Serverless Inference, который Alibaba анонсировала как своего «партнёра по запуску в нулевой день» — это формулировка самой Alibaba, хотя сам листинг принадлежит DigitalOcean и самостоятелен. DigitalOcean обслуживает чекпоинт с открытыми весами (идентификатор модели платформы qwen3.8-max), квантованный в NVFP4 на GPU NVIDIA HGX B300 в техническом сотрудничестве с Inferact, как полностью управляемый serverless API: одна конечная точка, ценообразование на основе использования, никакой инфраструктуры для управления. Его тариф соответствует прайс-листу Alibaba — $2.00 вход / $6.00 выход за 1M, с кэшированным вводом по $0.20 — и он предоставляет присущий открытой базовой модели контекст 262K с постоянно включённым мышлением, а не мультимодальный режим хостингового флагмана на ~1M токенов. Этот потолок контекста важен, если ваша нагрузка тяготеет к длинному концу: полный режим на миллион токенов остаётся доступен только через API Alibaba.

Что путь DigitalOcean добавляет помимо географии, так это первые достоверные данные об инференсе от провайдера, отличного от Alibaba. Собственные измерения DigitalOcean на их production-эндпоинте, проведённые 12 августа, показывают, что prefill масштабируется линейно со скоростью примерно 16 000 токенов/сек — эмпирическое правило: TTFT ≈ (input ÷ 16 000) + 0,7 с, так что ~1,1 с при ~1 080 токенах и ~15,8 с при ~254K — а совокупная пропускная способность достигает ~1 937 выходных токенов/сек при 256 параллельных запросах с нулевым количеством ошибок и без обнаруженной точки насыщения. Это цифры DigitalOcean, полученные на их собственном развёртывании, а не контролируемое сравнительное испытание, но это первые данные о задержке и параллелизме для этой модели за пределами облака Alibaba, и они напрямую отвечают на опасение «тщательный, но медленный» из эпохи предварительной версии.

Qwen3.8-Max доступна на OrcaRouter под именем qwen/qwen3.8-max, а обновление от 2 сентября можно маршрутизировать под собственным датированным идентификатором — qwen/qwen3.8-max-0902; обе версии — по одному и тому же прейскурантному тарифу $2.00 / $6.00. OrcaRouter применяет наценку 0% и передаёт цены провайдера напрямую, поэтому любой из этих маршрутов стоит столько же, сколько и прямое обращение. Наша собственная телеметрия обслуживания сейчас показывает p50 времени до первого токена на уровне 1,64 секунды за 7-дневный период. Это собственное измерение задержки, а не заявление вендора, и его стоит сопоставить с сообщениями времён превью о «самой медленной модели, которой я пользовался»: они появились у одного рецензента, запускавшего часовые агентные сборки на превью-инфраструктуре, и их следует перепроверить на GA-обслуживании, а не повторять как актуальный факт.

Практическая ценность пути через роутер в том, что Qwen3.8-Max работает за тем же эндпоинтом, совместимым с OpenAI, что и модели, которые вы уже запускаете, так что оценка — это просто смена строки модели. Вы можете направить на него 5% продакшн-трафика, сравнить с действующей моделью на одинаковых промптах и сохранить фолбэк — именно такая позиция и нужна модели с неподтверждённой таблицей вендора. Та же позиция — правильный способ тестировать развёртывание на DigitalOcean: прогнать через него срез трафика с фолбэком, а не ставить продакшн-путь на двухнедельный сервинг-стек.

Ограничения и честные риски

Таблица поставщиков всё ещё не аудитирована. Независимая оценка получена (индекс AA 56), но собственная таблица бенчмарков Alibaba остаётся невоспроизведённой, а измерение AA фиксирует регрессию Omniscience: уровень галлюцинаций достигает 40%. Независимая оценка помогает, но не делает таблицу поставщиков аудируемой.

Путь DigitalOcean — это открытая база, а не флагман.Он обслуживает контрольную точку с контекстом 262K, только текст, всегда включённое мышление, NVFP4-квантование — и собственные результаты выборочных проверок DigitalOcean дают 88 по GPQA Diamond против опубликованных Alibaba 92.6; разрыв, который DigitalOcean называет индикативным, а не контролируемым. Если вам нужен полный мультимодальный API на миллион токенов, он по-прежнему размещён у Alibaba.

Qwen3.8-27B выпущен, но нумерация — от вендора. Веса 27B появились 14 августа под лицензией Apache 2.0, закрыв пробел в локальном развертывании, — однако результаты её бенчмарков заявлены только самой Alibaba и никем не воспроизведены, а квантования от сообщества на момент этого обновления всё ещё продолжали появляться.

• Пользовательская лицензия, а не Apache 2.0. Лицензия Qwen3.8-Max разрешает коммерческое использование с указанием авторства, но содержит два пороговых ограничения — заметное отображение названия модели при более 100 млн MAU или ежемесячной выручке от $20 млн, а также отдельную лицензию для бизнеса в сфере MaaS/AI-Work-Assistant с выручкой более $50 млн за последние двенадцать месяцев. Прочитайте её, прежде чем превысите эти пороги.

Многословие и дрейф инструкций. IFBench 82.8 — это самый слабый показатель в собственной таблице Alibaba, а тестировщики предварительной версии неоднократно наблюдали, как модель выходит за рамки — добавляя незапрошенные функции. Собственные цифры AA теперь дают этому количественную оценку: именно 64 шага на задачу GDPval-AA поднимают стоимость до $1.14, что на 25% выше, чем у Kimi K3. В демо это очаровательно, но дорого, когда вывод тарифицируется по $6/1M, и дестабилизирует, когда нужны точные форматы.

Ограничения контента. Как и другие передовые модели, размещённые в Китае, ответы на политически чувствительные темы ограничены. Актуально, если ваш продукт обрабатывает открытые запросы.

Токены мышления тарифицируются как выходные. При включённом режиме рассуждений реальные затраты превышают наивные оценки. Проводите измерения с конфигурацией рассуждений, с которой вы действительно будете выпускать продукт.

Часто задаваемые вопросы

Qwen3.8-Max уже доступна?

Да. Он стал общедоступным 3 августа 2026 года, с опубликованным прайс-листом и API, совместимым с OpenAI и DashScope. Текущий производственный снимок — Qwen3.8-Max-0902, выпущенный 2 сентября, — работает в API QwenCloud, и именно его теперь обслуживает стандартная конечная точка qwen3.8-max. Это изменение по сравнению с предварительным статусом от 19 июля, когда доступ был ограничен Qwen Chat, приложением Qwen и кампанией с кредитами Qoder.

Что такое Qwen3.8-Max-0902?

Qwen3.8-Max-0902 — это производственное обновление Qwen3.8-Max от 2 сентября 2026 года: та же флагманская модель на 2,4 трлн параметров с разреженной архитектурой MoE и контекстом в 1 млн токенов, дополнительно дообученная на данных Coding и Cowork и доступная в API QwenCloud по той же цене $2/$6. По словам Qwen, новая версия сильнее в сложных корпоративных и научных задачах — заявление вендора, пока не подтверждённое независимыми бенчмарками, — тогда как в области кодинга у неё уже есть независимый результат: #1 в таблице Code Arena: WebDev с 1691 очком и верхняя точка парето-границы «цена-производительность» при усреднённой ставке ~$5/MToken, согласно объявлению Alibaba о публикации модели в живом рейтинге и подтверждению со стороны собственного аккаунта QwenCloud компании Qwen.

Сколько стоит Qwen3.8-Max?

$2.00 за 1M входных токенов и $6.00 за 1M выходных токенов, по единой ставке для полного контекста в 1M токенов, без надбавки за длинный запрос. Попадания в кэш для входных данных — $0.25 за 1M, явное создание кэша — $2.50, чтение из кэша — $0.17. Токены рассуждений тарифицируются по ставке выходных токенов. В Intelligence Index от Artificial Analysis измеренная стоимость модели — $1.14 за задачу — см. раздел о ценообразовании, почему это выше расчёта по токенам. Бессерверное предложение DigitalOcean указывает те же $2/$6 с кэшированным вводом по $0.20.

Сколько параметров у Qwen3.8-Max?

Всего 2,4 триллиона параметров в разреженной конфигурации Mixture-of-Experts. Количество активных параметров — показатель, который фактически определяет стоимость обслуживания и задержку, — теперь подтверждено на уровне 95 миллиардов активированных параметров, согласно официальной карточке модели Qwen3.8-2.4T-A95B (512 экспертов; 10 маршрутизируемых плюс один общий активный на токен).

Открыты ли веса Qwen3.8-Max?

Да — с 12 августа 2026 года. Qwen опубликовала Qwen3.8-2.4T-A95B (BF16) и Qwen3.8-2.4T-A95B-FP8 на Hugging Face, каждая модель содержит 213 файлов весов. Лицензия — специальная лицензия Qwen3.8-Max (Hugging Face указывает её как «other»), а не Apache 2.0: она разрешает коммерческое использование с указанием авторства и содержит два порога, зависящих от масштаба. Открытый чекпоинт работает только с текстом, режим мышления всегда включён; хостируемый API добавляет зрение, опциональный режим без мышления и полный контекст на 1M токенов.

Проходил ли Qwen3.8-Max независимое бенчмарк-тестирование?

Да — по состоянию на 6 августа 2026 года. Artificial Analysis оценивает его в 56 баллов по своему Индексу интеллекта при цене $1,14 за задачу, измерение проводилось на официальном API Alibaba: на 10 пунктов выше Qwen3.7-Max (46), на уровне Claude Opus 4.8 (56) и на один пункт ниже Kimi K3 (57). Однако приведённая выше таблица бенчмарков по-прежнему основана на данных Alibaba и независимо не воспроизведена, а в общем лидерборде LMArena публичной оценки до сих пор нет. Картина в независимых аренах изменилась 2 сентября: обновление 0902 дебютировало на первом месте в Code Arena: WebDev той же платформы с 1 691 баллом — это результат стороннего слепого голосования, а не таблица Alibaba, — и граница цена/производительность Code Arena называет его самым высокорезультативным по стоимости на этой доске при смешанной цене ~$5/MToken. Выборочная проверка DigitalOcean его квантованной сборки (88 баллов на GPQA Diamond) — первая сторонняя проверка на реально развёрнутом сервисе, и она явно носит ориентировочный, а не контролируемый характер. Одно предостережение для колонки «независимые»: CommerceAgentBench, где Qwen3.8-Max лидирует среди моделей с открытыми весами, не является вторым независимым арбитром — Accio, которая создала и опубликовала его, это собственная команда Alibaba.

Qwen3.8-Max лучше, чем Qwen3.7-Max?

По собственным данным Alibaba, прогресс существенен: FrontierSWE 73.5 против 40.7 и DeepSWE 1.1 56.6 против 21.6 — это почти удвоение результатов на сложных задачах по программной инженерии. Кроме того, он дешевле предшественника: $2.50/$7.50. Независимо, AA оценивает скачок между поколениями в 10 пунктов по своему Intelligence Index (56 против 46). Оба заявления вендора всё же следует проверить на вашей рабочей нагрузке.

Могу ли я самостоятельно разместить Qwen3.8-Max?

Практически нет. Полный набор весов модели с 2,4 трлн параметров занимает примерно 4,9 ТБ в BF16 и около 2,4 ТБ в FP8, а в 4-битном формате — примерно 1,2 ТБ. Учитывая, что один H200 имеет около 141 ГБ видеопамяти, это восемь или более топовых GPU. При 95 млрд активных параметров на токен вычислительная нагрузка на токен сравнительно невелика, но ограничивающим фактором является объём памяти. То, что DigitalOcean выполняет инференс в формате NVFP4 на B300, — рабочее доказательство того, что 4-битное представление позволяет уместить модель на одном узле. Qwen3.8-27B — по сообщениям, около 17 ГБ видеопамяти — реалистичный вариант для локального развёртывания; её веса были опубликованы 14 августа 2026 года под лицензией Apache 2.0, так что теперь их можно скачать, а не просто ждать.

Что такое Qwen3.8-27B?

Значительно меньшая модель, анонсированная вместе с флагманом, позиционируется как практичный путь для локального развертывания. Это плотная модель с 27 млрд параметров, изначально мультимодальная, с собственным контекстом на 262 тыс. токенов, расширяемым до 1 млн, и она распространяется под лицензией Apache 2.0. Её веса появились на Hugging Face и ModelScope 14 августа 2026 года; Дэниел Хан из Unsloth сообщает, что она работает примерно в 17 ГБ видеопамяти — одна высокопроизводительная потребительская видеокарта. Заявленные результаты бенчмарков предоставлены Alibaba и не были независимо воспроизведены.

Является ли Qwen3.8-Max мультимодальной?

Да — он принимает на вход текст, изображения и видео, а возвращает текст. Он также поддерживает режим мышления, вызов функций, встроенные инструменты и структурированные выходные данные. Контрольная точка с открытыми весами работает только с текстом; мультимодальный ввод — это функция размещённого API, которой нет в варианте DigitalOcean.

Доступен ли Qwen3.8-Max на DigitalOcean?

Да — с 14 августа 2026 года. Serverless Inference от DigitalOcean обслуживает чекпоинт с открытыми весами (NVFP4 на NVIDIA HGX B300) по цене $2.00/$6.00 за 1M с $0.20 за кэшированный ввод, контекстом на 262K токенов, только текст, мышление всегда включено. Alibaba называет DigitalOcean своим «партнёром по запуску Day 0»; сам листинг принадлежит DigitalOcean и не зависит от этой формулировки. Измеренные показатели DigitalOcean: prefill ~16K токенов/сек и ~1,937 выходных токенов/сек при 256 одновременных запросах с нулевым количеством ошибок.

Могу ли я использовать Qwen3.8-Max через OrcaRouter?

{{1}}Да. Модель запущена как qwen/qwen3.8-max{{/1}}, а {{2}}снапшот от 2 сентября{{/2}} доступен под собственным датированным идентификатором — {{3}}qwen/qwen3.8-max-0902{{/3}} — по той же {{4}}прейскурантной цене $2.00/$6.00{{/4}}, с {{5}}наценкой 0%{{/5}}. Маршрутизация стоит столько же, сколько и прямое обращение, через тот же {{6}}OpenAI-совместимый эндпоинт{{/6}}, который вы уже используете. Наша {{7}}7-дневная телеметрия{{/7}} показывает {{8}}время до первого токена (p50) — 1,64 секунды{{/8}}.

Стоит ли мне перевести на него сегодня производственный трафик?

Не все сразу. Цена и первый независимый результат делают серьезную оценку недорогой и оправданной сейчас, но поскольку стоимость за задачу на 25% выше, чем у Kimi K3, дисциплинированный шаг — это разделение трафика между вашей текущей системой и новой на идентичных промптах, с запасным вариантом наготове, а не миграция. Путь DigitalOcean добавляет второе управляемое развертывание для тестирования, что делает оценку еще дешевле.

Суть

Qwen3.8-Max провела две недели в статусе самой интересной модели, которую никто не мог купить. С выходом в GA это совсем другое предложение: плоские $2/$6 за миллион токенов — агрессивная цена, тарифы на кэш делают итеративную работу агентов дешёвой, а скачок показателей на FrontierSWE и DeepSWE — если он воспроизводится — превращает её из демонстрации масштаба в настоящую модель для кодинга. Открытые веса, вышедшие под настоящей лицензией 12 августа, превратили обещание «открытые веса скоро» из обещания в факт, а анонсированный 14 августа путь через DigitalOcean с первого дня — с замеренными показателями сервинга и чтением из кэша за $0,20 — делает сценарий «попробовать дёшево» ещё убедительнее и даёт командам управляемый сторонний деплой для сравнения с собственным API Alibaba. Обновление Qwen3.8-Max-0902 от 2 сентября сохраняет эту логику: те же $2/$6 и контекст в 1 млн токенов, плюс дополнительный пост-тренинг на задачах кодинга и совместной работы, под которые модель и была изначально заточена. Обновление также добавило независимую таблицу лидеров по предпочтениям людей для этого кодинг-предложения: Qwen3.8-Max-0902 дебютировала на первом месте в разделе WebDev рейтинга Code Arena с 1691 очком, опередив Claude Opus 5 и Kimi K3, и при усреднённых ~$5 за миллион токенов она — модель с самым высоким результатом на парето-границе «цена/производительность» этого рейтинга. Результат CommerceAgentBench, который команда Accio из Alibaba опубликовала на той же неделе — Qwen3.8-Max лидирует среди моделей с открытыми весами на бенчмарке, построенном на реальных рабочих процессах электронной коммерции, — даёт тезису о совместной работе собственный конкретный рейтинг, пусть и созданный самим вендором.

Что изменилось — так это то, что и рефери, и веса наконец появились, — и вердикт по большей части хороший, но с реальными оговорками. AA ставит Qwen3.8-Max 56 баллов по Intelligence Index — это настоящий поколенческий скачок, который выводит её на один уровень с Claude Opus 4.8, хотя та же карта результатов показывает Kimi K3 на балл впереди при стоимости за задачу на 25% ниже и фиксирует падение Omniscience на 10 пунктов на фоне растущей частоты галлюцинаций. Вопрос об активных параметрах закрыт: 95B активных параметров, подтверждено на карточке модели. Опубликована и лицензия — собственная, а не Apache 2.0. Что не изменилось: собственные бенчмарки Alibaba по-прежнему никем не воспроизведены; стоимость за задачу по-прежнему высока, потому что модель прогоняет слишком много шагов; открытая база на DigitalOcean — это несколько иная модель, чем та, что дала флагманские цифры в заголовках (контекст 262K, NVFP4, выборочный GPQA 88 против 92,6); а заявленные метрики Qwen3.8-27B основаны на данных вендора, хотя её веса уже выпущены. Такое сочетание не делает Qwen3.8-Max плохой ставкой — при такой цене это почти обязательный эксперимент, — но оно означает, что правильная позиция тут — агрессивно тестировать, осознанно распределять запросы и держать запасной вариант. Теперь следить стоит вот за чем: сможет ли ваша рабочая нагрузка выдержать то количество шагов агента, из-за которого задача обходится в $1,14; удержится ли лидерство сборки 0902 в Code Arena: WebDev по мере накопления голосов; подтвердятся ли её преимущества в Coding и Cowork на реальных нагрузках; переживёт ли независимый прогон лидерство открытых весов в CommerceAgentBench — два совокупных прохода на собственном стенде Alibaba; выдержат ли проверку заявленные метрики 27B; и удержится ли измеренная пропускная способность деплоя на DigitalOcean под реальным трафиком. Именно это решит, было ли «уступает только Fable 5» позиционированием или пророчеством.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно