Qwen 3.8 против GLM-5.2: Первый бенчмарк, где они действительно пересекаются
Guides & Insights

Qwen 3.8 против GLM-5.2: Первый бенчмарк, где они действительно пересекаются

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Эти две модели — самое яркое выражение противоположных ставок в китайском ИИ с открытыми весами. У Zhipu GLM-5.2 — лёгкая и проверенная: всего 753B параметров, из которых только 40B активных, проверенный индекс искусственного интеллекта Artificial Analysis равен 51, веса доступны для скачивания с июня 2026 года, а опубликованная цена составляет $0.95 / $3.00. У Alibaba Qwen3.8-Max — максималистская ставка: ~2.4T параметров, нераскрытое количество активных и — до недавнего времени — вообще никаких цифр.

Общая доступность 3 августа 2026 года дала этому противостоянию то, чего нет ни у одной другой статьи в этой серии: бенчмарк, по которому у обеих моделей есть результат. Alibaba сообщает о Terminal-Bench 2.1 с показателем 86.6; по данным Artificial Analysis, GLM-5.2 проверен на 82.7 на этом же тесте. Впервые утверждение Qwen можно сопоставить с независимо измеренным показателем конкурента на идентичной основе — с важной оговоркой, что только один из двух показателей был получен рефери.

Заметка для разработчиков: самый быстрый способ разобраться — прогнать оба варианта на своих собственных запросах. OrcaRouter предоставляет доступ к более чем 200 моделям через одну конечную точку, совместимую с OpenAI, так что вы можете сравнить Qwen 3.8 Max и GLM-5.2 на одной и той же задаче, не подключая два SDK.

TL;DR вердикт. На единственном общем бенчмарке Qwen заявляет о преимуществе в 3,9 пункта на Terminal-Bench 2.1 (86,6 против 82,7) — реальный результат, если он воспроизводится, хотя цифра Qwen самозаявленная, а у GLM — проверенная. Во всём остальном GLM-5.2 имеет практические преимущества: он примерно в 2 раза дешевле по цене $0,95 / $3,00 против $2 / $6 у Qwen, его веса доступны для загрузки сегодня, его 40B активных параметров делают его реально развёртываемым, и он имеет независимый показатель индекса 51, тогда как у Qwen его нет. Qwen отвечает контекстом в 1M токенов по фиксированной цене, нативной мультимодальностью, которой у GLM нет, и более высоким потенциальным потолком. Отлаженный и проверенный по-прежнему побеждает большой и непроверенный в производстве — но разрыв сократился 3 августа.

Основные выводы

Первое прямое пересечение бенчмарков в серии: Terminal-Bench 2.1 — Qwen3.8-Max 86.6 (данные Alibaba) против GLM-5.2 82.7 (Artificial Analysis, проверено). Qwen лидирует на 3.9 балла, но эти две цифры не одинаково надежны.

GLM-5.2 примерно вдвое дешевле: $0.95 / $3.00 за 1M (AA blended ~$0.90) по сравнению с Qwen3.8-Max $2 / $6.

Активные параметры — вот настоящая архитектурная история: GLM-5.2 работает 40B активных из 753B общих. Alibaba до сих пор не раскрыла количество активных параметров Qwen, что делает её стоимость обслуживания немоделируемой.

Веса GLM доступны для скачивания уже сегодня; веса Qwen обещаны в течение недели, но лицензии или репозитория пока нет.

GLM-5.2 имеет проверенный индекс 51. Qwen3.8-Max остаётся без оценки — хотя его предшественник Qwen3.7-Max набрал 46, ниже GLM.

Уникальные возможности Qwen: окно на 1 млн токенов с фиксированной оплатой без надбавки за длинные запросы, плюс нативная поддержка ввода текста/изображений/видео и OmniDocBench 1.5 92.1. GLM-5.2 ориентирована на текст.

Примечание о точности: все показатели качества Qwen3.8-Max указаны Alibaba и не проверены третьими сторонами. Показатели GLM-5.2 взяты из Artificial Analysis. Сравнение самостоятельно заявленного результата с проверенным на одном и том же бенчмарке информативно, но не является окончательным выводом — харнесы вендора и харнесы оценщика различаются. Цены на Qwen соответствуют тарифной карте GA и заменяют июльскую скидку предварительной версии.

Характеристики и цена, бок о бок

Вот конкретные данные, каждая цифра привязана к своему источнику.

• Производитель / статус — Qwen3.8-Max: Alibaba; GA (3 августа 2026 г.); GLM-5.2: Zhipu; выпущен в июне 2026

Архитектура — Qwen3.8-Max: ~2.4T всего, разреженный MoE; GLM-5.2: 753B всего, разреженный MoE (Artificial Analysis)

• Активные параметры — Qwen3.8-Max: По-прежнему не раскрыты Alibaba; GLM-5.2: 40B активных (Artificial Analysis)

• Контекстное окно — Qwen3.8-Max: 1M токенов, фиксированная ставка (983,616 с режимом мышления; макс. вывод 131,072); GLM-5.2: 1M токенов (Artificial Analysis)

Terminal-Bench 2.1 — Qwen3.8-Max: 86.6 (по данным Alibaba); GLM-5.2: 82.7 (Artificial Analysis, проверено)

• AA Intelligence Index — Qwen3.8-Max: Пока не оценено; GLM-5.2: 51 (Artificial Analysis)

• Другие показатели, заявленные вендорами — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (данные Alibaba); GLM-5.2: результат измерен третьей стороной

• Модальности — Qwen3.8-Max: Текст, изображение, видео на входе → текст на выходе; GLM-5.2: ориентирован на текст

• Цены (вход / выход) — Qwen3.8-Max: $2.00 / $6.00 за 1M, фиксированно; кэшированный ввод $0.25; GLM-5.2: $0.95 / $3.00 за 1M (AA blended ~$0.90)

• Открытые веса — Qwen3.8-Max: Обещано в течение недели (лицензии пока нет); GLM-5.2: Да — доступно для скачивания сегодня

Это сравнение обрамляют два момента, и первый из них — самый полезный показатель данных во всей серии.

Во-первых, совпадение по Terminal-Bench действительно информативно. Terminal-Bench 2.1 измеряет, способна ли модель довести до конца работу в реальной оболочке — выполнять команды, читать вывод, восстанавливаться после ошибок. Это ближайший из доступных прокси для «может ли это работать как кодинг-агент, а не как подсказчик кода», и именно этот бенчмарк обе компании выбрали для отчёта. 86,6 у Qwen против аудированных 82,7 у GLM — это преимущество в 3,9 балла в пользу Qwen.

Оговорка важна, но не следует её преувеличивать. Стенды поставщика и оценочные стенды различаются scaffolding, политикой повторных попыток и конструированием промптов, и этот выбор может сдвинуть результат Terminal-Bench более чем на четыре пункта. Поэтому это не доказательство того, что Qwen — лучшая агентная модель. Что это действительно устанавливает, так это то, что заявленный Qwen показатель попадает в ту же конкурентную зону, что и у аудированной передовой модели с открытыми весами, а не в область неправдоподобных значений. Это существенно более сильная позиция, чем «без оценки».

Во-вторых, именно в сравнении архитектур GLM тихо побеждает. GLM-5.2 активирует 40B параметров из 753B. Это одно-единственное число говорит о стоимости её обслуживания, профиле задержек и о том, что хорошо оснащённая команда действительно может запустить её. Alibaba до сих пор не опубликовала количество активных параметров Qwen — а это значит, что при всей информации, которую несёт заголовок с 2.4T, никто за пределами Alibaba не может оценить, сколько стоит обслуживание Qwen3.8-Max или как бы она вела себя при самостоятельном развёртывании. При сравнении моделей со смесью экспертов это не сноска; это самое важное недостающее число.

Стройный и проверенный против большого и непроверенного

Кейс GLM-5.2 строится на последовательной инженерной позиции: делать больше меньшими средствами, публиковать цифры и выпускать веса. Модель с 40 млрд активных параметров недорога в обслуживании, быстра по своей архитектуре и разворачивается командой с серьёзным, но не абсурдным бюджетом на GPU. Её аудированный индекс — 51, а аудированный результат Terminal-Bench — 82,7, так что покупателю ни в чём не приходится верить на слово. А при цене $0.95 / $3.00 это примерно половина цены Qwen.

Кейс Qwen3.8-Max — это противоположная ставка: стройте самую большую модель, какую можете, и пусть способности оправдывают затраты. GA значительно усилил этот аргумент, потому что наконец-то появились цифры — GPQA Diamond 92.6 по науке уровня аспирантуры, OSWorld-Verified 86.1 по работе с GUI, FrontierSWE 73.5 против 40.7 у предшественника, и Terminal-Bench 86.6, о котором говорилось выше. Это цифры фронтирного уровня, и почти двукратный рост по FrontierSWE — это тот самый скачок между поколениями, который трудно полностью подделать.

Но остаются два пробела, и это те же два, что имели значение в июле. Нет независимой оценки — на Artificial Analysis и LMArena Qwen3.8-Max остаётся без оценки, так что все заявления о качестве исходят от самой Alibaba. И нет лицензии, так что обещание открытых весов пока нельзя оценить с коммерческой точки зрения.

Историческая привязка здесь работает против Qwen сильнее, чем в большинстве других сравнений: предшественник Qwen3.7-Max набрал 46 по индексу AA, ниже, чем 51 у GLM-5.2. Так что неявное утверждение Alibaba состоит не просто в том, что Qwen3.8-Max хорош, а в том, что он перескочил с уровня ниже GLM на уровень значительно выше него за одно поколение. Улучшение FrontierSWE придаёт этому некоторую достоверность. Независимая оценка позволила бы поставить точку.

Стоимость на практике: где оказывается 2×

Возьмём агентный пайплайн написания кода: 180 000 токенов контекста репозитория, 10 000 токенов вывода за один запуск.

GLM-5.2: 0.18M × $0.95 = $0.171, плюс 0.01M × $3.00 = $0.03. ≈ $0.20 за запуск.

Qwen3.8-Max: 0,18M × $2 = $0,36, плюс 0,01M × $6 = $0,06. ≈ $0,42 за запуск.

• При 3,000 запусков в день: GLM ≈ $603/день; Qwen ≈ $1,260/день — примерно $20,000/месяц разницы.

• При кэшированном вводе Qwen по $0.25/1M на стабильном репозитории его стоимость падает до ≈ $0.11, что фактически ниже некэшированной стоимости GLM.

Эта последняя строка — самое практически полезное во всём сравнении. Заявленная цена Qwen вдвое выше цены GLM, но её ставка за попадание в кэш ($0,25 за 1M) достаточно агрессивна, чтобы хорошо закэшированный пайплайн мог перевернуть расклад. Если ваш агент на каждом шаге перечитывает в основном неизменный контекст — а это описывает большинство агентов для написания кода — Qwen на практике может оказаться более дешёвым вариантом, несмотря на менее выгодный прайс-лист. Команды, которые не настраивают кэширование, заплатят вдвое больше ни за что.

Обе модели тарифицируют токены рассуждений как выходные, поэтому конфигурации с интенсивными рассуждениями стоят дороже этих оценок в обоих случаях.

Развертываемость: ось, которой владеет GLM

Обе являются китайскими моделями MoE с открытыми весами и заявленной поддержкой контекста в 1 млн токенов, что делает развертываемость самым резким практическим различием.

Веса GLM-5.2 доступны для загрузки с июня, и при 40B активных параметров это реалистичная цель для самостоятельного хостинга — поддается квантованию, обслуживается на разумном количестве GPU и уже опробована сообществом.

Веса Qwen3.8-Max обещаны в течение недели, но флагман — нереалистичная цель для кого бы то ни было: примерно 1,2 ТБ в 4-битном форматепротив примерно 141 ГБ на H200 означает восемь или более топовых ускорителей, а нераскрытое количество активных параметров делает итоговую производительность непредсказуемой. Добавьте отсутствующую лицензию — и самостоятельный хостинг флагмана пока не план.

Одновременно анонсированная Qwen3.8-27B — это настоящий ответ Alibaba на этой оси. Также она выпускается с открытыми весами и, по сообщениям, требует около 17 ГБ видеопамяти — одна топовая видеокарта, значительно меньше, чем у GLM-5.2, — и она напрямую конкурирует по развертыванию. Если ваш интерес к любой из моделей — запуск её самостоятельно, то сравнение Qwen 27B и GLM-5.2 — это то, что действительно будет иметь значение, и это гораздо более близкая борьба, чем 2.4T против 753B.

Часто задаваемые вопросы

Qwen 3.8 лучше, чем GLM-5.2?

На единственном бенчмарке, где они пересекаются, Qwen заявляет о преимуществе — Terminal-Bench 2.1: 86,6 против проверенных 82,7 у GLM. Но показатель Qwen является самоотчётным, а GLM был измерен Artificial Analysis, и различия в тестовых окружениях могут превышать разницу в четыре пункта. GLM-5.2 также имеет проверенный индекс 51, тогда как у Qwen вообще нет независимой оценки. GLM — более безопасный выбор; у Qwen — более высокий непроверенный потолок.

Как они соотносятся в Terminal-Bench 2.1?

Qwen3.8-Max показывает 86,6; Artificial Analysis измерила GLM-5.2 на 82,7. Это номинальное преимущество Qwen в 3,9 пункта и первое пересечение между ними на одном и том же бенчмарке. Воспринимайте это как свидетельство того, что Qwen конкурентоспособна в этом диапазоне, а не как доказательство её превосходства, поскольку только показатель GLM был получен независимо.

Что дешевле?

GLM-5.2 по прайс-листу — $0.95 / $3.00 за 1M (AA в среднем ~$0.90) против $2 / $6 у Qwen, примерно вдвое дешевле. Но кэшированный ввод у Qwen по $0.25 за 1M достаточно агрессивен, поэтому пайплайн с интенсивным кэшированием может в итоге оказаться дешевле на Qwen, чем на GLM без кэша.

Сколько активных параметров использует Qwen 3.8 Max?

Alibaba так и не опубликовала эту цифру, даже когда продукт стал общедоступным. Именно это число определяет стоимость обслуживания и задержку в модели смеси экспертов (Mixture-of-Experts), поэтому её отсутствие — это реальный пробел. GLM-5.2, напротив, документирован как 40B активных параметров из 753B общих.

Что из этого я на самом деле могу хостить самостоятельно?

GLM-5.2 сегодня — веса уже опубликованы, и 40B активных параметров делают модель удобной для запуска. Веса Qwen3.8-Max обещаны в течение недели, но флагманской модели требуется восемь или более GPU класса H200 с ~1,2 ТБ памяти в 4-битном формате, при этом лицензия ещё не опубликована. Одновременно анонсированная Qwen3.8-27B, по сообщениям, занимающая около 17 ГБ видеопамяти, является развёртываемым вариантом Qwen и лучше соответствует нише GLM.

Qwen 3.8 Max вышла из предварительной версии?

Да, 3 августа 2026 года, с опубликованным прайс-листом и конечной точкой, совместимой с OpenAI и DashScope. Июльская кампания по кредитам Qoder со скидкой 90% больше не описывает, как это продаётся.

Что предлагает Qwen, чего нет в GLM-5.2?

Нативная мультимодальность — ввод изображений и видео, с заявленным показателем OmniDocBench 92.1 для парсинга документов — и контекст на 1 млн токенов по фиксированной ставке без надбавки за длинные промпты{{1}}...{{/1}}. GLM-5.2 ориентирован на текст, поэтому для пайплайнов с документами, скриншотами или видео Qwen конкурирует с ним не столько напрямую, сколько выполняет другую задачу{{2}}...{{/2}}.

Итог

Qwen 3.8 vs GLM-5.2 — это противостояние, в котором общая доступность принесла больше всего по-настоящему новой информации. Впервые у Qwen есть результат на бенчмарке, который независимый оценщик также прогнал, и он оказывается выше GLM: Terminal-Bench 2.1 — 86,6 против 82,7. Это переводит Qwen из категории «без оценки» в категорию «вероятно, конкурентоспособный на измеренной территории», что является реальным прогрессом даже с учётом оговорки о самостоятельном отчёте.

Но GLM-5.2 сохраняет корону практичности, и держится она на неэффектных сильных сторонах: половина цены, аудированный индекс 51, 40B активных параметров, которые делают его экономику предсказуемой, а развёртывание осуществимым, и веса, которые можно скачать прямо сейчас. Ответы Qwen — контекст на миллион токенов по фиксированной ставке, нативная мультимодальность и более высокий потолок — значимы, но условны, и два июльских пробела остаются без изменений: нет независимой оценки и нет лицензии. Следите за тремя вещами: первой независимой оценкой Intelligence Index для Qwen3.8-Max, тем, воспроизведёт ли оценщик показатель 86.6 в Terminal-Bench, и выходом Qwen3.8-27B, где эти две философии действительно столкнутся. А пока GLM-5.2 — это то, что вы поставляете, а Qwen3.8-Max — то, что вы оцениваете, — с включённым кэшированием.

Сравнение в этой статье3

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно