Титульная карточка для «Qwen3.8-Max против Qwen3.7-Max» с подзаголовком «Два уровня Max, 16 пунктов индекса и промо, которое инвертирует цену», а в нижнем колонтитуле отмечено, что данные Qwen3.8-Max взяты из раскрытия Alibaba от 22 сентября 2026 года и Artificial Analysis, тогда как данные Qwen3.7-Max взяты из Artificial Analysis.
Guides & Insights

Qwen3.8-Max против Qwen3.7-Max: два тира Max, 16 пунктов индекса и промо-акция, которая инвертирует цену

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Четыре дня назад вендор сообщил нам, что Qwen3.8-Max — это не та модель, которую он выпустил в августе. В пресс-релизе от 22 сентября 2026 года, опубликованном на конференции Apsara в Ханчжоу, компания сообщила, что её флагман завершил 33 итеративных цикла полностью автоматизированного обучения и посттренировочной работы более чем за месяц, и что полученная сборка подняла её Artificial Analysis Intelligence Index с 40 до 45. Идентификатор модели не изменился. А число за ним — изменилось.

Это особенно важно в одном конкретном месте: при сравнении Qwen3.8-Max и Qwen3.7-Max — уровень Max, который он заменил. Qwen3.8-Max стал общедоступен 16 августа 2026 г.; Qwen3.7-Max вышел в мае. На бумаге это выглядит простым выбором поколения — новее флагман, выше балл, двигаемся дальше. Но цифры говорят кое-что более неудобное. Старый уровень в три-четыре раза быстрее, примерно в пять раз дешевле за выполненную задачу и идентичен новому на чистых бенчмарках знаний. Новый уровень мультимодален, значительно лучше справляется с агентной работой и дешевле по международной тарифной сетке. К какому из них вам стоит обращаться, зависит от вопроса, который большинство сравнений пропускает: покупаете ли вы знания или вызовы инструментов.

Что {{1}}Apsara{{/1}} на самом деле утверждает в своём раскрытии

Раскрытие информации — это заявление поставщика, опубликованное Alibaba на собственном пресс-сайте, и его следует воспринимать именно так. В нём говорится конкретно: за более чем месяц полностью автоматизированных запусков, охватывающих проектирование конвейера, валидацию данных, итеративное экспериментирование и диагностику ошибок, Qwen3.8-Max выполнила 33 цикла, а автономная оптимизация обучения плюс методы постобучения обеспечили движение оценки. Alibaba также описала второй эксперимент в области проектирования чипов, где модель провела более 60 часов самоулучшения в течение жизненного цикла проектирования, совершила более 10 000 вызовов инструментов EDA и создала модули шин чипов производственного класса, сократив площадь чипа на 42% без заявленных компромиссов по производительности. Всё это — рассказ Alibaba о собственной модели, не воспроизведённый никем за пределами компании.

Однако само изменение оценки не является заявлением вендора. Индекс принадлежит Artificial Analysis, и оценка 45 стоит на странице Qwen3.8 Max (0902) этой третьей стороны. Оценка 40, от которой он поднялся, находится на странице той же организации для сборки от 3 августа, которая теперь помечена как устаревшая и указывает на текущую. Таким образом, дельта — это заявленная вендором причина, связанная с независимо оценённым следствием, а это более сильная позиция, чем каждая из половин по отдельности. Кроме того, на момент написания это самые конкретные публичные доказательства того, что передовая лаборатория изменила измеренные возможности своего флагмана, не выпустив новый номер версии.

Ещё две вещи в этом релизе легко упустить, и обе критически важны. Во-первых, Alibaba подтвердила, что Qwen 4 находится в процессе обучения, а серии Qwen 4.5 и Qwen 5, по прогнозам, вырастут до 5–10 триллионов параметров. Во-вторых, есть датированный снимок обновлённой модели. Alibaba закрепила посттренировочную сборку как qwen3.8-max-0902 на 2 сентября, и она маршрутизируется отдельно. Эта закреплённая версия — практический ответ на всё, что подразумевает раскрытие об RSI, и мы к ней вернёмся.

Табло

Шесть измерений, обе стороны, при этом дисциплина работы с источниками остаётся явной, поскольку два столбца проверены не в равной степени.

• Контекстное окно — Qwen3.8-Max 1,000,000 токенов против Qwen3.7-Max 1,000,000 токенов (идентично)

• Максимальный объём вывода — 131 072 токена против 131 072 токенов согласно собственным страницам моделей Alibaba (идентично; обратите внимание, что на нашей странице каталога для Qwen3.7-Max указано 64 000 — расхождение, которое мы отмечаем, а не замалчиваем)

• Модальность ввода — текст, изображение и видео против только текста

• Международная цена по прайс-листу за 1 млн токенов — $2.00 за ввод / $6.00 за вывод против $2.50 за ввод / $7.50 за вывод; та же тарифная сетка уже взимает с обеих моделей $1.65 / $4.951 в Пекине, Франкфурте и Вирджинии

• Artificial Analysis Intelligence Index — 45 против 29

• Независимая скорость вывода — 39,7 токенов/с против 211,3 токенов/с, измеренная в рамках того же класса сравнения из 211 моделей, где Artificial Analysis оценивает более новую категорию как заметно медленную, а более старую — как заметно быструю

Последние две строки — это вся статья. В том же семействе индексов более новый уровень опережает на 16 пунктов. По скорости он отстаёт более чем в пять раз.

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

Откуда берутся 16 пунктов — и откуда нет

Разложите Индекс на части — и форма апгрейда становится ясной, и это не та форма, которую предлагает маркетинг.

Что касается знаний и рассуждений, обе модели практически равны. GPQA Diamond: 92,8 против 92,3. Humanity's Last Exam: 43,1 против 40,5. Воспроизведение длинного контекста: 80,33 против 79. SciCode: 52,1 против 49,5. Если ваша рабочая нагрузка — ответы на вопросы по большому корпусу, то этот скачок поколений — погрешность округления. Платить за него в разы больше было бы трудно оправдать.

В агентной работе и программировании разрыв открывается резко. Terminal-Bench 2.1: 88.76 против 74.53. Индекс программирования Artificial Analysis: 76.2 против 66. А самое большое расхождение в наборе — задача на использование банковских инструментов, где Qwen3.8-Max показывает 47.84 против Qwen3.7-Max: 11.75 — четырёхкратный разрыв именно в той способности, которую, как говорится в описании RSI, оптимизировали автоматизированные циклы: проектирование пайплайнов, валидация данных, итеративное экспериментирование, диагностика ошибок. Модель, которая месяц улучшает собственный цикл обучения, — это модель, которая стала лучше в циклах.

Одна честная оговорка по этим отдельным строкам. Обе страницы моделей относятся к одному семейству версий Intelligence Index (v4.3 и v4.3.2), что делает основное сравнение 45 против 29 корректным. Строки по отдельным бенчмаркам не принадлежат к одной когорте: показатели Qwen3.7-Max на уровне задач относятся к майскому окну оценки, тогда как показатели Qwen3.8-Max — из сентябрьской серии. Смотрите на направление движения, а не на третью значащую цифру.

Вопрос о цене — это два вопроса.

В международном прайс-листе Alibaba более новый Max дешевле той версии, которую он заменил: $2.00 / $6.00 для Qwen3.8-Max против $2.50 / $7.50 для Qwen3.7-Max за миллион токенов. Снижение на 20% по обоим направлениям при переходе к новому поколению — необычно и заслуживает отдельного упоминания. Экономика кэша также благоприятствует более новому уровню: неявный кэш — $0.25 против $0.50, чтение явного кэша — $0.17 против $0.25.

Это первый вопрос, и у него есть региональный ответ, который большинство публикаций нивелируют. Alibaba взимает за обе модели $1.65 за входные токены / $4.951 за выходные токены в Пекине, Франкфурте и Вирджинии. 20-процентный разрыв существует только на сингапурской международной карте. Если ваш трафик попадает в остальные три региона, входные и выходные токены сегодня стоят одинаково для обоих тарифов Max, и решение сводится к одним только возможностям — в этот момент более новая модель выигрывает во всём, кроме пропускной способности, и больше нечего считать.

Второй вопрос — это ловушка. Qwen3.7-Max в настоящее время не стоит $2.50 / $7.50. Его предоставляют по $1.25 / $3.75 — половина прайсовой цены, промо-тариф. Это делает уровень предыдущего поколения более дешёвым вариантом сегодня, с большим отрывом. Это также означает, что цена, которую вы можете измерить на этой неделе, — не та цена, на которую вы бы соглашались. На собственной странице модели Alibaba прямо указано, что опубликованная таблица показывает исходные цены «без учёта каких-либо ограниченных по времени промоакций» и направляет вас в консоль за текущими предложениями. Акция по определению — это тариф, который может закончиться. Если это произойдёт, Qwen3.7-Max не просто станет дороже, чем сегодня; он станет на 25% дороже, чем модель, которая его превосходит.

Мы транслируем тариф провайдера с наценкой 0%, поэтому и цена по прайс-листу, и акция действуют у нас в тот же день, когда меняются, — что удобно для сравнения и не поможет, если вы пытаетесь планировать бюджет. Строьте модель на основе карточки с прайсовой ценой, а промо-ставку рассматривайте как потенциальную выгоду.

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

Число, которое переворачивает аргумент о затратах

Цена токена — это не то, сколько стоит задача. Artificial Analysis публикует показатель стоимости одной задачи, который учитывает экономику кэша, объём рассуждений и длину ответа, и по этому показателю рейтинг переворачивается полностью: $5.41 за задачу в Intelligence Index у Qwen3.8-Max против $1.15 у Qwen3.7-Max. Надбавка в 4,7× при ставке за токен, которая либо на 20% ниже, либо такая же — в зависимости от вашего региона.

Разрыв в основном объясняется многословностью. В том же тесте новая модель сгенерировала {{2}}190 млн выходных токенов{{/2}}{{3}} против {{/3}}{{4}}120 млн{{/4}}{{5}} у другой, и она пространно рассуждает, прежде чем прийти к ответам. Если вы платите за выходные токены при большом объёме задач средней сложности, новая Max не является более дешёвой моделью ни при какой цене за токен ни по одному из тарифных планов. Она дороже, и цена за токен из прайс-листа — не тот инструмент, которым это следует решать.{{/5}}190 млн выходных токенов против 120 млн у другой, и она пространно рассуждает, прежде чем прийти к ответам. Если вы платите за выходные токены при большом объёме задач средней сложности, новая Max не является более дешёвой моделью ни при какой цене за токен ни по одному из тарифных планов. Она дороже, и цена за токен из прайс-листа — не тот инструмент, которым это следует решать.

Скорость и что показывают наши собственные данные о трафике

Разрыв в пропускной способности достаточно велик, чтобы менять архитектуру. Artificial Analysis оценивает Qwen3.8-Max в 39,7 токена в секунду — в своём резюме он называет эту модель заметно медленной — против 211,3 у Qwen3.7-Max, которую он называет заметно быстрой. Это разница между моделью, которую ставят за интерактивный интерфейс, и моделью, которую ставят за очередь, — и на Qwen3.8-Max это первое, что показывает вам наша собственная панель статистики.

Наша собственная телеметрия с тестовой площадки за семь дней до 25 сентября рассказывает чуть более нюансированную историю о задержке, и у неё есть оговорка: это наши измерения на нашей маршрутизации, а не контролируемый бенчмарк. Qwen3.8-Max показал медиану 2 611 мс до первого ответа при 54,7 токена в секунду с частотой ошибок 2,45%; закреплённая сборка 0902 показала медиану 3 360 мс при 46,2 токена в секунду с заметно более чистой частотой ошибок 0,66%. Qwen3.7-Max имел медиану 4 509 мс, но 169,8 токена в секунду с частотой ошибок 3,80%. Так что более старый уровень отвечает медленнее в начале, а затем стримит в три раза быстрее, при этом чаще даёт сбои. Если ваша нагрузка носит пиковый характер, этой разнице в частоте ошибок стоит уделить больше внимания, чем медиане.

Оба уровня доступны по одному ключу OrcaRouter вместе с закреплённым снапшотом, с автоматическим переключением при сбое между провайдерами. Для подобного сравнения это и есть практический смысл: проверка собственных промптов на обоих поколениях Max — это изменение конфигурации, а не второй контракт.

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

Теперь решающим фактором является воспроизводимость

Вот та часть раскрытия Apsara, которую никто не принял в расчёт. Живой идентификатор модели, измеренная способность которой за месяц выросла с 40 до 45, без изменения версии и без объявления на тот момент, представляет собой угрозу воспроизводимости. Если поведение вашего продукта зависит от изменяющегося идентификатора, у вас есть модель, которая может улучшиться — или сместиться — под замороженным набором для оценки, кэшированной библиотекой промптов или утверждённым набором регрессионных тестов.

Оба поколения предлагают датированные снапшоты, и это и есть средство защиты. Компания Alibaba документирует Qwen3.7-Max как функционально эквивалентный qwen3.7-max-2026-05-20, при этом есть дополнительные датированные сборки от 2026-05-17 и 2026-06-08. У Qwen3.8-Max есть qwen3.8-max-0902, сентябрьская сборка после дообучения, именно её и подразумевает 45. Если вы выпускаете что-либо, что должно воспроизводиться, закрепите датированный ID и рассматривайте плавающий как цель для стейджинга. Циклы RSI — это особенность плавающего ID; закрепление — это способ от них отказаться.

Есть одна деталь в названиях, о которой стоит знать, чтобы вы не ошиблись при чтении каталога. Alibaba указывает третью датированную форму, qwen3.8-max-2026-09-02, наряду с псевдонимом 0902; они относятся к одной и той же сборке. Исходный выпуск от 3 августа больше не маршрутизируется на нашей стороне — мы обслуживаем Qwen3.8-Max, его пин 0902 и Qwen3.7-Max.

Кто должен выбирать

Решение зависит не от того, какая модель лучше, а от того, что вы покупаете.

Остановитесь на Qwen3.7-Max если ваша рабочая нагрузка ориентирована только на текст, требует больших знаний, а не инструментов, и чувствительна к пропускной способности — массовая классификация, извлечение, поиск по длинному контексту, пакетное суммирование. На GPQA Diamond и при проверке длинного контекста он отстаёт от новой модели менее чем на балл, он стримит в три-четыре раза быстрее и стоит $1.15 за задачу против $5.41. Он также является правильным ответом для всех, кто хочет получить недорогое второе мнение в конфигурации слияния или маршрутизации, потому что по его промо-цене он относится к совершенно иной ценовой категории. Два предостережения: акция есть акция, и Artificial Analysis уже отметила модель как устаревшую, заменённую Qwen3.8-Max. Не берите на себя многолетние обязательства по нему.

Переходите на Qwen3.8-Max, если верно любое из следующего: вам нужен ввод изображений или видео, который Qwen3.7-Max вообще не принимает; ваша рабочая нагрузка носит агентный характер, с длинными цепочками вызовов инструментов или многошаговыми циклами кодирования, где 88,76 против 74,53 на Terminal-Bench 2.1 и четырёхкратный разрыв в использовании инструментов — это разница между релизом и его отсутствием; или ваша разработка ведётся по сингапурскому международному тарифному плану, где более новая модель просто на 20 % дешевле, и не нужно взвешивать никаких компромиссов. Закрепите qwen3.8-max-0902, если нужно, чтобы поведение оставалось неизменным.

Если вы находитесь в Пекине, Франкфурте или Вирджинии, выбор очевиднее, чем может показаться из любого сравнения: оба уровня Max стоят $1.65 / $4.951 за миллион токенов. Одинаково. При таких тарифах ничего не доплачивать за мультимодальный ввод, индекс выше на 16 пунктов и вчетверо лучший показатель использования инструментов — это не решение, это бесплатно — и единственной причиной оставаться на Qwen3.7-Max становится чистая пропускная способность.

Два вопроса, на которые стоит ответить напрямую

Означает ли 33-цикловый прогон обучения, что модель изменилась в условиях существующего API-трафика? Именно на это указывает раскрытие, и именно поэтому существует привязка к дате. Alibaba описывает улучшенную модель как «обновлённый Qwen3.8-Max» — это плавающий ID, а не новый. Если у вас были рабочие нагрузки на плавающем ID вплоть до конца сентября, их обслуживала модель, измеренные возможности которой менялись в течение этого периода. Alibaba не публиковала журнал изменений для промежуточных сборок, поэтому единственный надёжный способ узнать, с каким поведением вы имеете дело, — закрепить версию.

Проверено ли утверждение об RSI независимо? Оценка, которую он выдал, — да: Index принадлежит Artificial Analysis, и 45 стоит на их странице. Механизм, стоящий за этим, — это собственное описание Alibaba её собственного процесса обучения, без внешнего воспроизведения, без опубликованного протокола оценки и без третьей стороны, наблюдавшей за 33 циклами. Относитесь к «33 итеративным циклам» как к утверждению вендора, а к «45 после 40» — как к измеренной паре. Это утверждения разного рода, и именно это различие — причина, по которой заголовок стоит читать внимательно, а не повторять.

Следующее, за чем стоит следить, — это не Qwen 4. А то, переживёт ли акция Qwen3.7-Max с половинной ценой появление модели, призванной его заменить. Если нет, очень многие команды обнаружат, что сравнивали цену по прайс-листу со скидочной ценой и что старший из двух собратьев всё это время был более дорогим.