Титульная карточка Hero для Qwen3.8 Max Prime — уровня обслуживания Alibaba с пропускной способностью в 1,5–2 раза выше для флагмана Qwen3.8-Max, со спек-чипами, показывающими те же 2,4T общих и ~95B активных параметров, Prime — $3.301/$9.902, стандартный — $1.65/$4.951.
Guides & Insights

Qwen3.8 Max Prime: Alibaba разместила вторую тарифную сетку рядом со своим флагманом

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

22 сентября 2026 года на конференции Yunqi в Ханчжоу бизнес-направление MaaS компании Alibaba объявило об уровне обслуживания под названием Prime mode — 优速模式 — и добавило новый идентификатор модели в тарифную карту для него: qwen3.8-max-prime. Этот идентификатор не является новой моделью. Это Qwen3.8-Max — флагманская разреженная смесь экспертов с 2,4 трлн параметров, ставшая общедоступной 3 августа 2026 года, поставляемая через более быстрый канал. Qwen3.8 Max Prime имеет те же веса, то же контекстное окно, тот же инструментарий и те же лимиты использования, что и базовая модель. Отличаются пропускная способность и цена, причём цена примерно удваивается.

Это уже второй раз за семь недель, когда Alibaba меняет то, как продаётся Qwen3.8-Max, не меняя при этом сам продукт. 2 сентября компания выпустила обновление после постобучения, помеченное как Qwen3.8-Max-0902, с фокусом на программирование и агентные задачи, только через API. 22 сентября добавился скоростной тариф. Ни то, ни другое не было запуском, и если принять любое из них за запуск, это обойдётся вам дорого.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

Что на самом деле представляет собой режим Prime

В собственной документации Alibaba режим Prime описывается как канал для «сценариев, чувствительных к скорости вывода» — помощников по программированию на базе ИИ, многошагового рассуждения агентов, разговоров в реальном времени — и прямо указывается преимущество: TPS повышается до уровня, в 1,5–2 раза превышающего стандартный API. Новый параметр задавать не нужно. Вы переключаете значение model на Prime ID, и вы на быстрой дорожке.

Документация столь же недвусмысленно говорит о том, что не меняется: «Поддерживаемые моделью возможности и ограничения на использование такие же, как у оригинальной модели». Так что нет большего контекста, нет лучшего режима рассуждений, нет дополнительного набора инструментов. Это тот же стек обслуживания, только с большим запасом ресурсов за ним.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

Тарифную карту читайте внимательно.

На международной странице цен Aliba​ba два ID указаны рядом, что делает сравнение необычно простым. На миллион токенов:

• Ввод — qwen3.8-max-prime $3.301 vs qwen3.8-max $1.65

• Вывод — qwen3.8-max-prime $9.902 против qwen3.8-max $4.951

• Попадание в кэш — qwen3.8-max-prime $0.413 против ставки за чтение из кэша по standard ID, которую та же страница указывает как строку скидки

• Соотношение — 2,0× и на входе, и на выходе: не округлённое приближение, а буквальная арифметика опубликованных чисел

В китайском тарифном плане та же пропорция 2× сохраняется в юанях: ¥24 за входные данные и ¥72 за выходные на миллион для Prime ID против ¥12 и ¥36 для стандартного, а попадания в кэш — по ¥3.

Широко цитируемая стартовая цифра для Qwen3.8-Max — $2 за вход и $6 за выход за миллион. Именно под этим заголовком вышли августовские материалы, и сегодня это не та цифра, что указана в международном прайс-листе. Если вы моделируете расходы, используйте прайс-лист для вашего региона, а не заголовок о запуске, и проверьте его ещё раз, прежде чем принимать окончательное решение — Aliba​ba с 2 сентября дважды обновляла эту страницу.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

Правило троттлинга — вот настоящая фича.

Строка, которую большинство людей пропускает, имеет наибольшее значение для продакшена. Документация Alibaba Prime утверждает, что когда ваше использование достигает лимита скорости, если у платформы всё ещё есть свободные ресурсы, вас не будут ограничивать, поэтому фактически доступная вам пропускная способность не опустится ниже заявленного лимита.

Это мягкий потолок с жёстким полом, и по форме это отличается от стандартного лимита уровня. Это означает, что показатель 1,5–2× — обещание относительно пола, а не ограничение потолка: при конкуренции за ресурсы вы получаете лимит, а при незанятой мощности можете получить больше. Для агентного цикла, который запускает десятки последовательных вызовов, эта асимметрия ценнее, чем чистый множитель TPS, потому что именно хвостовая задержка самого медленного вызова определяет, завершится ли ваш рабочий процесс.

Динамические лимиты TPM для стандартных моделей разбиты на уровни в зависимости от месячных расходов в Model Studio — в той же серии документации базовый ID qwen3.8-max указан со значениями 5 000 000, 10 000 000 и 20 000 000 TPM на разных уровнях; лимиты обновляются ежемесячно. Prime не убирает эту структуру; он меняет то, как она проявляется.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

То, что ещё никто не измерил

Вот в чём честный пробел. Число 1,5–2× — заявлено производителем. Независимых измерений пропускной способности в режиме Prime мы найти не смогли, и это важно, потому что собственные независимые показатели стандартной сборки не льстят по части скорости.

Artificial Analysis, которая измеряет модели на собственном испытательном стенде, сейчас присваивает Qwen3.8-Max в сборке 0902 значение Intelligence Index, равное 45, при этом GPQA Diamond — 92,8%, Terminal-Bench Hard — 38,9%, а Humanity's Last Exam — 43,1%, а измеренная стоимость одной задачи составляет $5,41. Это независимые показатели для стандартного SKU, зафиксированные 2026-09-24. Они также напоминают о том, что индекс был пересмотрен после августовских публикаций о запуске, поэтому не стоит ставить старое значение индекса рядом с текущим и называть это трендом.

Чего у AA нет — так это строки Prime. Пока кто-то не измерит это, заявление о скорости принадлежит только Aliba​ba, и правильная позиция — проверить это на собственной рабочей нагрузке, а не полагать, что это верхняя граница диапазона.

Что это означает для решения о маршрутизации

Prime — это тарифный уровень, который Aliba​ba продаёт через свой собственный API, и это единственное место, где его можно получить. Мы не размещаем qwen3.8-max-prime здесь. А вот что OrcaRouter действительно маршрутизирует — так это стандартные Qwen3.8-Max и его датированный пин Qwen3.8-Max-0902, причём оба на том же ключе, что и остальное семейство Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — наряду с более чем 200 другими моделями, а цена из прайс-листа провайдера передаётся без наценки — 0%. Именно поэтому обновление от 2 сентября и любое будущее изменение тарифов Max появляются у нас в тот же день, что и у Aliba​ba.

На практике это разделение выглядит так. Пропускайте трафик по умолчанию по стандартному ID через роутер, где переключение при сбое защитит вас, если один из путей провайдера деградирует. Конкретные вызовы, где фактическая задержка и есть продукт — интерактивное завершение, агентный шаг с жёсткими временными рамками, — перенесите на Prime и оценивайте это решение относительно 2×, а не 1,5×.

Кому стоит перейти, а кому подождать

Переключайтесь, если ваши пользователи ждут токенов: автодополнение, ход чата, цикл правок кода, за которым наблюдает человек. В верхней части диапазона скорости Prime нейтрален по стоимости в расчёте на секунду устранённой задержки — вы платите ровно вдвое больше за ровно вдвое меньшее время. В нижней части диапазона вы платите 2× за 1,5×, то есть 33% надбавки за каждую сэкономленную секунду. Если ваша нагрузка — это пакетная задача, выполняемая за ночь, эта надбавка не даёт вам ничего, что вам было бы нужно.

Погодите, если ваша модель затрат строится на стартовом ценовом предложении $2/$6 или если в ваших запросах много входных данных. Утверждение поставщика о скорости касается TPS — выходных токенов в секунду, — а prefill — это отдельный этап конвейера. Запрос с длинным контекстом платит вдвое за входные токены независимо от того, приходит ли вывод быстрее. Измерьте этот случай, прежде чем мигрировать его.

И проверьте дату в своём прайс-листе. Qwen3.8-Max присутствует на рынке с 3 августа, уже один раз обновлялась и один раз переупаковывалась, а ей всё ещё всего семь недель. Новость — это тариф, а не модель.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube