
GLM-5.3-Flash, спустя пять недель: независимая оценка 42, прогон эксплойта уровня Mythos и GLM-агент, который перестроил собственный стек обслуживания
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов · 87 tok/s
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
GLM-5.3-Flash уже пять недель обслуживает продакшен-трафик, и 17 сентября 2026 года Zhipu AI сообщила кое-что о том, где именно: компания раскрыла, что каждый продакшен-запрос к GLM-5.3-Flash теперь выполняется на парке из более чем 100 000 AI-ускорителей китайского производства, что от первого запуска на этом оборудовании до обслуживания всей своей боевой нагрузки прошло менее двух недель, и что сквозная пропускная способность за тот же период выросла в 3,2 раза. Но самое примечательное — это то, кто выполнял работу. Большая часть работы была выполнена не командой инфраструктуры, а агентом, управляемым самим GLM-5.3, который анализировал узкие места, предлагал исправления и писал код для системы инференса, тогда как инженеры ставили цели, выстраивали среду обратной связи и проверяли всё, что затрагивало числовую семантику, параллелизм или риски для продакшена. GLM-5.3-Flash — это мультимодальная модель с 320 млрд общих параметров и 18 млрд активных (320B-A18B), которую Zhipu выпустила и открыла исходный код 26 августа 2026 года — тот самый анонимный «Ox Alpha», о котором компания сообщила в тот день, — а её более крупный собрат GLM-5.3 — это 743B-флагман, с которым её сопоставляли по цене. Ни одна из трёх цифр в сегодняшнем раскрытии не взята у нас или у кого-либо ещё: они принадлежат самой Zhipu. Флагман тоже больше не единственное сравнение, которое имеет значение: в ExploitBench, независимой оценке того, насколько далеко модель поднимается по реальной лестнице эксплойтов Chrome, GLM-5.3-Flash теперь показал результат на уровне Claude Mythos Preview, закрытой фронтирной модели, которую её разработчик предоставил только проверенным защитникам, при том что стоимость одной попытки у GLM-5.3-Flash — лишь малая доля от стоимости попытки у Claude Mythos Preview.
Это хорошая новость, и она реальна, но заявлена вендором. С тех пор как этот пост впервые вышел в день запуска, изменились ещё три вещи, причём две из них меняют картину не в лучшую сторону. Artificial Analysis теперь опубликовала собственное измерение модели, и её показатель не совпадает с показателем Zhipu. Стартовая скидка, благодаря которой эта модель была самой дешёвой из способных моделей на рынке, истекла по графику 9 сентября и не была продлена. А сторонняя оценочная организация Generality Labs опубликовала собственный прогон ExploitBench, в котором GLM-5.3-Flash набрала выше среднего по трём прогонам Claude Mythos Preview на одной и той же лестнице — примерно за шесть центов на доллар. Для всех, кто в конце августа сохранил эту модель в закладки как «дешёвую», арифметика сегодня уже не та, что была, и честный заголовок — смешанный: экономика обслуживания действительно улучшилась, цена выросла, потому что акция закончилась, широко цитируемый показатель интеллекта не выдержал первого контакта с независимым испытательным стендом, а сравнение возможностей, которое всё же сложилось в пользу модели, — это единственный нерецензированный прогон, о котором сами его авторы говорят, что не стоит делать чрезмерных выводов.
Zhipu — единственный источник данных о размере кластера, двухнедельном сроке и показателе 3,2x; независимого аудита ни для одного из них не существует, и сама компания заявляет, что не достигла рекурсивного самосовершенствования, описывая результат как цикл минимального масштаба, а не как настоящий. Что можно было проверить, мы проверили: единственный конкретный артефакт в отчёте, существующий вне стен Zhipu, — исправление точности в ядре Flash Linear Attention — действительно принят в upstream, и мы это подтвердили. Там, где приведённая ниже цифра исходит от Zhipu, это указано. Там, где она исходит от Artificial Analysis, вместо этого указано именно это. Там, где она исходит от Generality Labs — организации по оценке безопасности, стоящей за числами об эксплойтах в этом посте, — указано это, вместе с оговорками, которые её авторы приложили сами: один запуск, 41 баг, самостоятельно опубликованный метод, отсутствие воспроизведения третьей стороной и вопрос о контаминации, который они поднимают по собственной инициативе. Там, где число принадлежит Anthropic — единственные здесь цифры, происходящие из лаборатории, имеющей конкурентную заинтересованность в ответе, — в тексте указано, какую модель она на самом деле измеряла, потому что не все они относятся к этой модели.
Что на самом деле было выпущено
GLM-5.3-Flash — это модель со смесью экспертов общим объёмом 320B / 18B активных параметров и 45 слоями, из-за чего её активная нагрузка немного превышает половину от примерно 32B у GLM-5.2. Главная возможность — мультимодальность: она изначально принимает на вход текст, изображения и видео — первая среди моделей GLM-5, способная на это, — а не маршрутизирует зрение через отдельный адаптер. Контекст достигает 1 миллиона токенов, и Zhipu утверждает, что стоимость обслуживания длинного контекста составляет примерно треть от таковой у GLM-5.3.
Что касается архитектуры, Zhipu описывает её как первую открытую фронтирную модель, в которой гибридное разреженно-линейное внимание сочетается с Manifold-Constrained Hyper-Connections (mHC) для масштабирования, а механизм IndexPool сжимает четыре ключевых вектора индексатора в один взвешенный пул, чтобы сократить задержку на длинном контексте. Предобучение проводилось на мультимодальном корпусе из 30 триллионов токенов. Ничто из этого не проходило независимого аудита — это Zhipu описывает собственную модель — но утверждения об эффективности сервинга достаточно конкретны, чтобы их можно было проверить сейчас, когда веса доступны открытому стеку инференса, а материал от 17 сентября добавляет первую подробную картину того, как на самом деле была построена сервинг-часть.
Технические характеристики на день запуска, с первого взгляда:
• Параметры — 320B всего / 18B активных, 45 слоёв, MoE.
• Модальность — нативный ввод текста, изображений и видео; вывод текста.
• Окно контекста — до 1 000 000 токенов.
• Лицензия — MIT, открытые веса на Hugging Face с самого дня запуска.
• Цена — $0,15 / $0,50 за миллион токенов (ввод / вывод), $0,03 за миллион кэшированного ввода.

Эта карточка — снимок на день запуска, и две её строки изменились с 26 августа. Показатель AA Index по-прежнему остаётся собственным утверждением Zhipu и теперь противоречит независимым измерениям — подробнее об этом ниже. Указанная в ней цена со скидкой больше не действует; акция завершилась 9 сентября. Количество параметров, размер контекстного окна, лицензия и модальность — это неизменный актуальный факт, и именно для них в основном и нужна эта картинка.
Неделя Ox Alpha, и что на самом деле проверяла бесплатная раздача
Раскрытие положило конец неделе домыслов. 20 августа на сторонней платформе AI API появилась анонимная модель с контекстным окном в 1 млн токенов, поддержкой ввода текста, изображений и видео и нулевой ценой, и она быстро стала моделью, к которой чаще всего обращались, в недельных чартах этой платформы. Сообщество в течение 48 часов по отпечаткам определило, что она относится к семейству GLM от Zhipu, — та же схема «сначала анонимно, затем заявлено», которая ранее позволяла идентифицировать модели других китайских лабораторий, — и аналитики в большинстве своём предположили, что это Flash-вариант GLM-5.3. Объявление 26 августа подтвердило эту догадку: бесплатная неделя была намеренным тестом, и компания говорит, что анонимный запуск обработал более 62 трлн токенов за шесть дней на платформах для программирования, где он предлагался, и всё это обслуживалось на китайских чипах отечественного производства.
Та последняя оговорка в тот момент выглядела как сноска. Оказалось, что в ней и была суть. Бесплатная неделя была в первую очередь не маркетинговым трюком и даже не нагрузочным тестом модели; это был нагрузочный тест парка ускорителей под ней, проведённый в масштабе, при котором сбой был бы публичным и бесплатным. Три недели спустя Zhipu описывает тот же парк как обслуживающий 100% продакшн-трафика модели.

Логика ценообразования той недели всё ещё действует, с одной поправкой. Модель, которую неделю отдавали за $0, а затем вывели по цене в одну десятую от тарифа флагмана и с дополнительной скидкой 50%, была намеренным ходом по формированию рынка в бюджетном сегменте, а оговорка «ограниченное время» всегда была тем, за чем стоило следить. Мы отметили это как то, что могут отменить. Это отменили в запланированный срок — и об этом стоит сказать прямо, потому что истечение скидки — единственное изменение в этой истории, которое отражается в счёте.
Стек обслуживания, пересобранный агентом
Техническое описание Zhipu от 17 сентября — это первое подробное описание того, как GLM-5.3-Flash обслуживается на китайском кремнии, и его центральное утверждение состоит в том, что модель помогла оптимизировать систему, которая её запускает. Компания называет этот механизм плотной обратной связью: тесты на корректность, логи выполнения, трассировки, микробенчмарки и сквозные метрики были подключены так, чтобы агент мог проверять гипотезу локально, а не ждать полного развёртывания и нагрузочного тестирования после каждого изменения. Чтобы это работало, по словам Zhipu, обратная связь должна была быть локальной, дешёвой и объективно проверяемой — привязанной к конкретному ядру или пути кода, достаточно быстрой для итераций и истинной или ложной без участия человека.
После того как этот цикл заработал, агент нашёл и исправил три вещи, которые компания подробно описала:
• Путь с контекстным параллелизмом в ядре KDA терял точность по мере роста последовательностей, потому что tl.dot по умолчанию использовал TF32, несмотря на входные данные FP32, что усугубляло ошибку округления с увеличением длины контекста. Исправление фиксирует точность входных данных на tf32x3 с запасным вариантом ieee на платформах без поддержки TF32. Этот пункт самый интересный из трёх, потому что это единственное утверждение в описании, которое выходит за пределы собственной инфраструктуры Zhipu: изменение влито в upstream в Flash Linear Attention как PR #1180, и мы проверили и подтвердили, что оно было влито 27 августа 2026 года.
• Передача KV не перекрывалась по времени с планированием DeepEP. Ни внутриузловая диспетчеризация, ни внутриузловое комбинирование не освобождали Python GIL в используемой версии DeepEP, из-за чего поток передачи застревал позади них; англоязычные и китайскоязычные версии одного и того же материала оценивают возникшие в результате накладные расходы выше 20% и выше 30% соответственно. После исправления, по словам Zhipu, разрыв с её базовым уровнем, использующим только prefill, упал ниже 1%.
• Ядро декодирования пересчитывало одну и ту же нормализацию FP32 и гейтинг четыре раза подряд, по одному разу на тайл размерности V. Разделение работы по делению сократило время работы ядра на 9,6%, а объединение тайлов в один блок потоков — так что нормализация выполняется один раз — дало ускорение в 1,71 раза.
Вокруг этих исправлений находятся структурные изменения: ReplaySSM, который обменивает вычисления на внутрикристальную память, потому что у ускорителей её меньше, чем у GPU, для которых изначально был написан стек; внутриузловой тензорный параллелизм, чтобы снять то же давление; смешанное кэширование INT8, FP8 и BF16 для увеличения ёмкости; и дезагрегированная архитектура Encode-Prefill-Decode, которая планирует три стадии вывода отдельно, а не как один конвейер. Zhipu также честно называет ограничения — ограниченная внутрикристальная память и пропускная способность межсоединений, незрелое программное обеспечение, неполное покрытие ядер и скудная документация — и говорит, что не достигла рекурсивного самоулучшения, описывая результат как цикл минимального масштаба.
Читайте этот отчёт скептически, потому что стимулы очевидны. Zhipu не скажет, какую часть работы выполнил агент, а какую — инженеры, и нет внешнего аудита ни показателя пропускной способности, ни двухнедельного графика, ни размера кластера. Подача через плотную обратную связь тоже своекорыстна вполне конкретным образом: она заставляет самое впечатляющее на слух утверждение («наша модель улучшила саму себя») опираться на наименее проверяемые доказательства (внутренний цикл, который никто не может проверить). Что мешает этой истории быть чистым маркетингом — то, что её самое конкретное утверждение опровержимо и оказывается истинным: исправление ядра tf32x3 действительно находится в upstream-репозитории, датированное 27 августа, за три недели до пресс-цикла вокруг него.
Сколько это стоит, в реальных долларах
Тарифная сетка принадлежит Zhipu, и она проста: $0.15 за миллион входных токенов, $0.50 за миллион выходных токенов и $0.03 за миллион кэшированных входных токенов. Это каталожная цена на сегодня. Стартовая промоакция со скидкой 50% действовала до 9 сентября 2026 года и не была продлена, поэтому цифры $0.075 / $0.25 / $0.015, широко ходившие в конце августа, больше недоступны в собственном API поставщика. На фоне опубликованных для GLM-5.3 $1.40 / $4.40 Flash по каталожной цене всё ещё выходит примерно на уровне одной десятой — скидка была бонусом поверх цены, которая уже была главным преимуществом, а не самой ценой. Artificial Analysis рассчитывает смешанную ставку около $0.10 за миллион токенов при соотношении кэш-попаданий/входных/выходных токенов 7:2:1 и указывает скорость вывода примерно 117 токенов в секунду, которую описывает как заметно высокую, хотя AA отмечает, что показатели скорости относятся к собственному API модели, а не к тесту, проведённому AA.
Более широкая история затрат Zhipu — это причина, по которой цена может оставаться на таком уровне. В своих полугодовых результатах, опубликованных 31 августа, компания заявила, что стоимость инференса на один токен на её отечественном парке из 100 000 ускорителей снизилась на 80% с начала 2026 года, а валовая маржа API выросла с -0,4% до 24,6% благодаря масштабу, ценообразованию и более дешёвому сервингу. Это корпоративные показатели компании, отчитывающейся перед акционерами, и они не проверены нами; относитесь к ним как к указывающим направление, а не как к точным. Приведённое выше описание сервинга — это механизм, стоящий за утверждением, — меньше избыточных проходов ядра, меньше нагрузки на память, лучшее перекрытие, — и это более убедительная история, чем голая процентная цифра, даже если цитировать будут именно процент.
Заявления об эффективности в сравнении с флагманом не изменились: вычислительные затраты на attention снижены в 3,0 раза, а KV-кэш — в 4,4 раза меньше по сравнению с GLM-5.3, по данным вендора; при этом Zhipu признаёт, что её KV-кэш остаётся немного больше, чем у DeepSeek V4 Flash и Kimi K3. Заявленное на момент запуска 3-кратное сквозное улучшение производительности обслуживания на отечественных чипах теперь указывается как 3,2x, измеренное от первого запуска до полного продакшен-трафика. Обе цифры принадлежат Zhipu, а два сообщения, в которых они приводятся, разделены тремя неделями — ничто из этого не было воспроизведено за пределами компании.
Почему раскрытие имеет значение — и куда делась главная цифра
Вот исправление, которое важнее всего для всех, кто читал материалы о запуске и запомнил это число. В материалах Zhipu GLM-5.3-Flash указан на уровне 57 в Artificial Analysis Intelligence Index, что совпадает с Claude Opus 4.8. С тех пор Artificial Analysis опубликовала собственное измерение этой модели в Intelligence Index v4.3, и оно показывает 42 — против 47 у GPT-5.6 Sol (max) на той же версии. 57 никогда не было независимой цифрой; это была цифра Zhipu, и независимое измерение помещает модель примерно на пять пунктов ниже диапазона, прилегающего к фронтиру, и значительно ниже главного показателя, заявленного вендором. По тому же текущему индексу сам GLM-5.3 показывает 45, так что цифра 60 для флагманской модели, которая фигурировала в нашем материале о запуске, больше не соответствует тому, что Artificial Analysis публикует сегодня. Разрыв в 15 пунктов между заявлением и измерением — это не разница из-за округления, и это самое полезное, что читатель может вынести из этого обновления — с одной оговоркой, которую добавляет раздел ниже, потому что второе независимое измерение в этой истории указывает в противоположную сторону.
То, что остаётся в силе после этой поправки, уже, но всё ещё реально. GLM-5.3-Flash — это мультимодальная модель с открытыми весами, контекстом 1M и нативным вводом изображений и видео примерно за десятую часть каталожной цены своего флагманского собрата — комбинация, у которой нет прямого эквивалента среди передовых лабораторий США, чьи сопоставимые мультимодальные модели стоят существенно дороже и поставляются закрытыми. Собственная формулировка Zhipu — «передовой интеллект, стоимость flash» — как раз и пострадала: при измеренном показателе 42 это сильная бюджетная модель, а не передовая со скидкой. Независимое измерение также уверенно ставит её выше медианы для моделей с открытыми весами схожего размера, что является настоящим достижением для модели с 18B активных параметров и десятой частью затрат на инференс — просто это достижение иного рода, чем подразумевалось в материалах о запуске.
Другое независимое число — и оно оказалось в пользу модели
Если результат Artificial Analysis опустил GLM-5.3-Flash на ступеньку ниже, то этот — наоборот, и это самый странный факт в истории. ExploitBench, созданный в Carnegie Mellon, не спрашивает, может ли модель обрушить цель. Он оценивает восхождение: доступ к уязвимому коду, воспроизведение бага, создание переиспользуемых примитивов и, наконец, полный захват потока управления с выполнением произвольного кода, — и всё это механически оценивается на production V8 с включённой песочницей безопасности. Generality Labs прогнала GLM-5.3-Flash по 41 багу с бюджетом в 1 миллиард токенов на баг вместо обычного для бенчмарка лимита в 300 ходов — на том основании, что ходы плохо отражают то, что покупатель реально тратит, а доллары — это честное ограничение. GLM-5.3-Flash достигла полного выполнения произвольного кода в 13 из 41 случая и среднего показателя способностей в 64,8% от максимума лестницы. Три опубликованных прогона Claude Mythos Preview набрали 9, 10 и 11 по той же лестнице — в среднем 10, или 62,2%. Собственная формулировка Generality, напечатанная под графиком, такова: GLM-5.3-Flash «может быть на уровне Mythos в кибербезопасности» по этому измерению. Собственный прогон Anthropic в ExploitBench, опубликованный 29 сентября, сообщает о том же порядке при гораздо более низких абсолютных показателях — правда, для флагманской GLM-5.3, а не для Flash: он считает сквозные эксплойты на попытку, а не прогресс по лестнице, и ставит GLM-5.3 на 50 из 410 против 56 из 410 у Mythos Preview. Разное правило подсчёта, похожий порядок — именно поэтому показатель ExploitBench никогда не следует приводить без указания правила.
Причина, которая имеет значение, — это знаменатель, лежащий в её основе. В том прогоне выходные токены GLM-5.3-Flash оценивались в $0.25 за миллион — его стартовая цена со скидкой 50%, которая с тех пор истекла, — против исторических $125 за миллион у Claude Mythos Preview, то есть 500-кратная разница. При паритете по стоимости в прогоне было потрачено $16.81 на уязвимость против $297.17 у Mythos — отсюда и берётся цифра примерно 6%. Читайте утверждение внимательно, потому что версия, которая ходит по рукам, неверная. Дело не в том, что GLM-5.3-Flash лучше разрабатывает эксплойты, чем Claude Mythos Preview. Дело в том, что доллар токенов GLM-5.3-Flash покупает примерно столько же, сколько доллар токенов Mythos в этой конкретной задаче, и что вы можете позволить себе гораздо больше долларов первого.
Собственные оговорки Generality значат больше, чем заголовок. В них прямо говорится, что один запуск не устанавливает паритет по кибербезопасности в целом, что контаминация — открытый вопрос: возможно, ExploitBench каким-то образом использовался при обучении, — и что четыре из 41 образца завершились ошибкой, а их оценка была выставлена путём переноса последнего наблюдённого результата вперёд, что, если уж на то пошло, занижает оценку модели. Они также опубликовали 28 сентября продолжение, которое усложняет всё сравнение. При прогоне GLM-5.3-Flash через семь различных агентных харнессов с бюджетом в 250 миллионов токенов, на десяти образцах, отобранных так, чтобы охватить диапазон сложности, те же веса получили 10,6 при харнессе Codex — выше эталонного показателя Claude Mythos Preview в 10,02 — и 6,2 при харнессе Claude Code, что ниже даже исходной конфигурации бенчмарка с ограничением по числу ходов на уровне 6,4. Харнесс сдвинул оценку сильнее, чем сравнение моделей, и авторы говорят, что подвыборка из десяти образцов, вероятно, нерепрезентативна. То, что этот график широко разошёлся 2 октября с аргументом, будто масштабирование вычислений на этапе инференса стирает разрывы между уровнями моделей, — это утверждение об индустрии, а не вывод оценки: оценка показала, что дешёвая открытая модель, получив бюджет вместо ограничения по числу ходов, может дотянуться до специалиста по эксплойтам из передовой лаборатории на одной лестнице.
Это уже не история одной лаборатории. Оценка собственной Frontier Red Team от Anthropic, опубликованная 29 сентября, запустила GLM-5.3-Flash — младшего собрата — в сессии с человеком в контуре: когда модели передали публичные детали исправленной уязвимости Chrome и ещё одной, без существенных указаний, она связала их в надёжный эксплойт для ARM64, который обошёл усиление защиты на основе аутентификации указателей, за 20 минут внимания человека и восемь часов работы модели — $20.40 по тарифам API Zhipu. Та же оценка — источник приведённой выше цифры 50 из 410 в ExploitBench, и в этой части измерялась GLM-5.3, флагманская модель на 743B, а не Flash, — различие, которое освещение отчёта по большей части сгладило. Две независимые стороны, разные испытательные стенды, разные бюджеты, одно и то же направление. Оба также являются единичными прогонами одной лаборатории, и ни один не представляет собой воспроизведённый результат, и только прогон Generality сообщает долларовую сумму для Flash, а не для флагмана. Практическое прочтение — то, что Anthropic прямо заявляет: веса можно скачать, на аблитерацию GLM-5.3-Flash ушло примерно 600 GPU-часов, а модель, работа которой стоит меньше доллара в час, — это проблема доступности иного рода, чем модель за программой проверки.
Попробуйте, и как вписывается слой маршрутизации
Доступ прост. Собственный API Zhipu предоставляет его по указанному выше прайсовому тарифу, веса под лицензией MIT размещены на Hugging Face по адресу zai-org/GLM-5.3-Flash в форматах FP8 и BF16, а продукты Zhipu для программирования — ZCode и GLM Coding Plan — включают его в себя. Для самостоятельного хостинга его поддерживают как vLLM, так и SGLang. Два практических замечания, если вы пойдёте этим путём: в кукбуке SGLang есть предупреждение об открытом изменении — на сборках transformers до 5.13 визуальный ввод может молча отбрасываться, это не вызовет ошибки и просто даст вам текстовое прочтение запроса с изображением; а путь AMD всё ещё не оформлен в виде рецепта. Исходный PR по включению поддержки gfx950 в день запуска (sgl-project/sglang #37653) был закрыт без слияния 6 сентября и заменён более широким набором pull-request'ов gfx950 day-zero — mHC через AITER, индексатор DSA k-pool, обслуживание FP8 и MXFP4 — несколько из которых всё ещё были открыты 17 сентября. Включение поддержки на оборудовании класса MI350X находится в процессе, но ещё не выпущено, и по-прежнему нет независимых показателей пропускной способности AMD.
Что касается маршрутизации, ситуация с момента запуска изменилась: GLM-5.3-Flash теперь в реестре OrcaRouter, наряду с остальными моделями линейки GLM. Мы транслируем каталожную цену провайдера с наценкой 0% и без надбавки роутера — и это именно тот механизм, который важен для модели, чья цена только что изменилась: скидка, истекающая на стороне Zhipu, становится ценой, которую вы платите здесь, в тот же день, без второго контракта, который нужно пересматривать, и без изменений в коде. Такая сквозная передача цены работает в обе стороны, и об этом стоит сказать прямо: истёкшая акция — это реальное повышение цены в вашем счёте, и здесь оно происходит в тот же момент, что и у апстрима. Если вы сравниваете Flash с GLM-5.3 или другой бюджетной моделью, обе доступны по одному ключу с автоматическим переключением между провайдерами — это дешёвый способ попробовать модель, независимые оценки которой ещё не устоялись, не ставя на неё продакшн-путь. Это также подходящая конфигурация для результата выше, и по причине более прямой, чем удобство: одни и те же веса набрали 10.6 или 6.2 на одном и том же бенчмарке в зависимости от того, какой агентный харнесс ими управлял, так что покупатель фактически тестирует комбинацию «скаффолд плюс модель», и заменить модель за фиксированным скаффолдом по одному ключу дешевле, чем сделать окончательный выбор в пользу одной из них.

Что посмотреть дальше
Четыре вещи определяют остаток этой истории. Во-первых, сдвинется ли 42: модель широко используется публично с августа, поэтому если внутренняя оценка Zhipu и стенд AA расходятся по структурной причине — учёт токенов рассуждений, многословность, оценка, которой поставщик придал большой вес, — это должно проявиться при пересмотре индекса, а не как разовый разрыв. Во-вторых, воспроизведётся ли результат по эксплойтам. Generality Labs один раз прогнала 41 баг на собственном стенде и прямо об этом говорит; последующая работа по стендам показывает, что одни и те же веса смещаются на четыре пункта только из-за выбора стенда, так что числом, которое решило бы вопрос, был бы повторный прогон этих 41 другой командой при фиксированном в долларах бюджете и неизменном стенде. В-третьих, получит ли версия о собственных чипах второй источник. Zhipu — единственная сторона, способная назвать размер кластера, двухнедельный срок и 3.2x, а единственное независимо проверяемое утверждение в ней — исправление ядра, влитое в основную ветку, — небольшое. В-четвёртых, цена: скидка исчезла, и интересный вопрос в том, вернётся ли она в виде акции, когда Zhipu понадобится объём, или же цена по прайс-листу теперь стала нижней границей.
Сквозная линия здесь в том, что GLM-5.3-Flash просят доказать сразу две разные вещи — что дешёвая модель может быть достаточно хорошей и что китайские ускорители способны обслуживать её в масштабе, — а обнародование 17 сентября — это ответ Zhipu на второй вопрос, представленный моделью, которая помогла его написать. У первого вопроса теперь есть два независимых числа, и они указывают в противоположные стороны: 42 в индексе интеллекта, намного ниже заявленного вендором главного показателя, и прогон эксплойта, который оказывается на уровне специалиста фронтирной лаборатории при двадцатой части стоимости. Оба могут быть верны одновременно, и именно разрыв между ними — а не любое из этих чисел — и есть то место, где на самом деле принимаются решения.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
