
GLM 5.5 или GLM 5.3-Vision? Анонимная модель, совпадающая с отпечатком Z.ai, только что всплыла.
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 150 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
{{1}}Неопознанная модель{{/1}}, чей серверный профиль — скорость, время до первого токена, доля попаданий в кэш — совпадает со стеком GLM от Z.ai, привлекла внимание аналитиков по вычислительным мощностям, и рабочая гипотеза состоит в том, что она может называться GLM 5.3-Vision или GLM 5.5. 20 августа аналитик по вычислениям и мощностям teortaxesTex написал, что {{2}}анонимная модель, за которой он следит{{/2}}, — «точно не DeepSeek, по крайней мере», что «пока ничто не исключает GLM» и что «скорость, ttft, доля попаданий в кэш тоже совпадают с GLM». Его вывод: ожидается, что модель назовут GLM 5.3-Vision или 5.5, и она наберёт примерно 61 балл в Artificial Analysis Intelligence Index — на один балл выше, чем сейчас у выпущенного GLM-5.3. Ничто здесь не подтверждено. Нет ни карточки модели, ни анонса от Z.ai, ни API, и эта страница рассматривает наблюдение как то, чем оно является: {{3}}ранний, неповторённый сигнал утечки{{/3}}, за которым стоит следить именно потому, что GLM-5.5 весь месяц ожидался как флагман Z.ai и так и не появился. Через пять дней после того поста появилась вторая, на этот раз полностью проверяемая точка данных: 25 августа vLLM — среда выполнения инференса, стоящая за большинством крупномасштабных серверных моделей — открыла pull request с пометкой Do-Not-Merge, добавляющий поддержку masked-MHA ядра для размерностей голов GLM-5. Он не называет никакой вариант и не доказывает запуск; это подготовка серверного стека — {{4}}та фоновая активность, которую оставляет после себя новая модель.{{/4}}
Что на самом деле говорит сигнал
Источник — одиночный пост в X от teortaxesTex, датированный 20 августа, — тот же аккаунт, чей сигнал о сроках «примерно неделя» по запуску GLM-5.3 в августе сбылся день в день. Формулировка явно указывает на уровень доказательности: «сильные доказательства (не воспроизведено)». Аналитик исключает DeepSeek, не находит ничего, что противоречило бы GLM, и приводит три измерения на уровне serving — пропускную способность, время до первого токена и коэффициент попаданий в кэш — как соответствующие стеку Z.ai. Затем два возможных названия и прогнозируемый балл: «Сейчас я ожидаю, что это будет называться GLM 5.3-Vision или 5.5, и наберёт примерно 61 балл на AA».
Рассмотрите каждую часть по отдельности. Утверждения об идентичности (не DeepSeek, а GLM) — это вывод по отпечатку того, как обслуживается модель, а не карточка модели. Оценка — это ожидание, а не измерение. Названия — это догадки. Сигнал ценнее шума потому, что он по направлению согласуется со всем остальным, что мы знаем о дорожной карте Z.ai в этом месяце: GLM-5.3 вышла только с текстом, самым громким запросом сообщества было зрение, а GLM-5.5, по сообщениям нескольких изданий (через JPMorgan, Reuters, CGTN и записку Goldman от 18 августа), должна появиться «в августе» — сейчас финал месяца.
Почему важен отпечаток сервера
Время до первого токена и частота попаданий в кэш — это инфраструктурные сигнатуры. Они определяются не тем, какое имя модели вызывает промпт, а тем, как провайдер строит свой инференс-стек (планировщик, структура кэша, политика батчинга). Когда аналитик говорит, что TTFT и частота попаданий в кэш анонимной модели совпадают с GLM, он утверждает, что обслуживающий стек, стоящий за ней, ведёт себя как у Z.ai, — а это самое близкое к отпечатку пальца, что можно получить без весов или карточки модели. Это не доказательство. Другой вендор мог бы воспроизвести тот же стек, или Z.ai могла бы обслуживать модель для партнёра. Но это конкретное и проверяемое утверждение, и оговорка «не воспроизвели» даёт понять, что аналитик не выдаёт его за установленный факт.
Исключение DeepSeek тоже имеет значение. DeepSeek V4 Pro вышел в общий доступ 13 августа, и его сборка Flash стала вторым высокоскоростным китайским релизом с открытыми весами в этом месяце. Анонимная модель, которая исключает DeepSeek, но указывает на GLM, сужает круг до пайплайна Z.ai — а в пайплайне Z.ai есть два вероятных кандидата, что как раз и есть та развилка, которую называет сигнал.
Второй сигнал: стек обслуживания строится для внимания GLM-5
25 августа появилась вторая точка данных — на этот раз полностью проверяемая. vLLM, среда выполнения инференса, которая стоит за обслуживанием большинства крупномасштабных моделей, получила pull request #53785 под названием «[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions». Проверка по репозиторию подтверждает: PR включает путь prefill с masked-MHA для геометрии внимания GLM-5 — 64 головы, ранг KV 512, размерность голов QK 192+64 и размерность голов V 256, то есть конфигурация QK/V 256/256, согласно описанию PR. Он зависит от изменения FlashAttention, добавляющего поддержку масок для размерности голов 256, временно закрепляет FlashAttention за коммитом форка (именно для этого и предназначена пометка Do Not Merge), а также добавляет измеренные пороговые значения маршрутизации для нового пути: пределы чисто prefill для FlashMLA — 8K / 20K / 48K / 112K токенов при TP 1/2/4/8 — и округлённый предел 64K для FlashInfer при TP8. Автор отмечает, что ни один другой открытый PR не покрывал поддержку masked-MHA для GLM-5.
Воспринимайте это как то, чем оно и является: подготовка serving-стека, а не анонс. PR не называет ни GLM 5.5, ни GLM 5.3-Vision — в нём сказано «GLM-5», — а включение prefill-пути с masked-MHA для размерностей голов GLM-5 — это инфраструктурная работа над семейством, которое экосистема vLLM уже обслуживает через sparse-MLA-путь (собственная линейка GLM-5.3 обслуживается там и сегодня). Это также не единичный случай: родственные PR в этом месяце охватили проверки размерностей MLA в FlashInfer для GLM-5, Triton-фолбэк на sparse-MLA для моделей класса GLM-5 и заявленную поддержку размерностей во FlashAttention. Две детали удерживают это на радаре трекеров утечек. Первая — геометрия, на которую он нацелен: 64 головы, KV rank 512, 256/256 QK/V — отличается от DeepSeek'овских 192/128; это то же разделение «не DeepSeek, а GLM», которое вырисовывает фингерпринт анонимной модели, теперь видимое и на уровне attention-ядра. Вторая — тайминг: PR открыт 25 августа, в том же августовском окне, в котором GLM-5.5 ждали весь месяц. Ничто из этого не доказывает, что анонимная модель — GLM следующего поколения: с тем же успехом это может быть инженерная работа над уже выпущенной моделью. Но это та фоновая активность, которую serving-экосистема ведёт перед выходом модели, и она проверяема так, как не проверяем ни один пост в X.
Два имени, одна развилка: GLM 5.3-Vision против GLM 5.5
Две кандидатные идентичности — это действительно разные продукты, и утечка не проясняет, какая из них находится на плате.
• GLM 5.3-Vision стал бы вариантом модели с поддержкой зрения, выпущенной 14 августа. GLM-5.3 поддерживает только текстовый ввод — Artificial Analysis указывает, что это текст на входе, текст на выходе, без поддержки изображений — и этот пробел является самым громким недовольством сообщества. Когда Тан Цзе из Z.ai провёл глобальную кампанию по сбору отзывов, комментарии оказались практически единодушными в пользу поддержки зрения, и у Z.ai уже есть необходимые компоненты (мультимодальная модель GLM-5V-Turbo и энкодер CogVLM), которые ещё не интегрированы в флагманскую линейку. Вариант 5.3-Vision стал бы самым быстрым способом закрыть этот пробел.
• GLM 5.5 — это и есть флагман. Сообщённые, но неподтверждённые характеристики указывают на базу более одного триллиона параметров (по сравнению с 743B у GLM-5.3), сохранённый контекст в 1M токенов, открытые веса и более сильный акцент на агентность и код. Все аналитические заметки в этом месяце называют 5.5 главной моделью — тем инструментом, который, как намекнул соучредитель Z.ai Тан Цзе, сократит разрыв с закрытыми моделями класса Fable. Релиз ожидается в августе, и на момент написания статьи модель ещё не выпущена.
Один и тот же отпечаток не может сказать, какой из двух это — 5.3 с настройкой на зрение и свежий флагман могут работать на одном и том же серверном стеке. Эта неоднозначность и есть честное состояние сигнала, и два названия в посте аналитика отражают её, а не разрешают.
Двухколоночный сравнительный табло под названием «GLM 5.5 vs GLM-5.3 — табло». Левая колонка GLM 5.5 (утечка): «AA Index ~61 (прогнозируемый, непроверенный)», «Статус: не выпущен», «Размер >1T параметров (слухи)», «Зрение: ожидается», «Контекст: 1M (ожидается)», «Цена: TBD». Правая колонка GLM-5.3 (выпущен): «AA Index 60», «Статус: API доступен 19 августа», «Размер 743B MoE / 40B активных», «Зрение: только текст», «Контекст: 1M», «Цена: $1.40 / $4.40». Внизу: «Показатели GLM 5.5 — непроверенные прогнозы; GLM-5.3 по данным Artificial Analysis.»

Что означало бы ~61 по индексу AA Intelligence Index?
Прогнозируемый балл — самая яркая деталь утечки. Индекс Artificial Analysis Intelligence (v4.1.1) в настоящее время ставит GLM-5.3 на 60 — вровень с Kimi K3 за лучший показатель среди открытых весов, и на 7 баллов выше, чем 53 у GLM-5.2. На один балл выше, на 61, начинается территория GPT-5.6 Sol, при этом Claude Fable 5 — 62, а Claude Opus 5 — 63. Проще говоря: модель семейства GLM, набравшая 61 балл, стала бы самым высоким показателем среди открытых весов в индексе, сама по себе выше Kimi K3 и GLM-5.3, и фактически на линии закрытых моделей.
Стоит подчеркнуть, чем 61 не является. Это ожидание teortaxesTex относительно того, что покажет независимая оценка, а не опубликованный балл Artificial Analysis и не показатель вендора. Прогноз может быть неверным в любую сторону: vision-вариант может потерять одно-два очка на тексто-ориентированном индексе, а флагман с >1T параметров может оказаться выше или ниже в зависимости от того, как скажется его пост-обучение. Ценность числа — в утверждении, которое оно в себе несёт: кем бы ни оказалась эта анонимная модель, ожидается, что она побьёт текущего лидера среди моделей с открытыми весами, а не просто сравняется с ним.

Что подтверждено, а что нет
Содержите журнал в чистоте, потому что от этого зависит жизнь или смерть утечки.
Подтверждено: GLM-5.3 реален, выпущен 14 августа, API работает 18/19 августа, набрал 60 баллов по индексу интеллекта AA (независимо измерено Artificial Analysis), цена $1.40 / $4.40 за 1 млн токенов, только текстовый ввод, открытые веса подтверждены на пятницу, 28 августа. Эти факты не зависят от утечки.
• Подтверждено: GLM-5.5 всё ещё не выпущен. На момент написания нет ни карточки модели, ни цен, ни доступности; августовское окно и показатель >1T параметров — это данные аналитиков, а не обязательства Z.ai.
• Не подтверждено: что анонимная модель существует как отдельный продукт, что это GLM, что её название будет GLM 5.3-Vision или 5.5 и что она набирает 61 балл. Все четыре основаны на единственном невоспроизведённом посте одного аналитика.
• Также не подтверждено: отличается ли эта анонимная модель вообще от самой GLM-5.3. Живой эндпоинт GLM-5.3 под алиасом без маркировки имел бы тот же отпечаток сервинга. Пока название, карточка модели или публикация весов не прояснят это, интерпретация «новая модель» — сильный априор, но не факт.
Что посмотреть дальше
• Пятница, 28 августа — веса GLM-5.3. Если анонимная модель на самом деле является переименованной 5.3 или 5.3-Vision, публикация весов и карточка модели быстро всё прояснят.
• Второе подтверждающее наблюдение. Отпечаток одного аналитика — это гипотеза; второе независимое прочтение той же анонимной записи или упоминание в списке Artificial Analysis превращает её в доказательство.
• Любое заявление Z.ai. Сообщалось, что GLM-5.5 ожидается в августе, а месяц почти подошёл к концу. Официальное название, страница с ценами или запись в журнале изменений API — вот событие, которое превращает эту утечку в историю о запуске.
• Сбудется ли показатель AA на отметке 61. Если анонимная модель реальна и относится к семейству GLM, независимый индексный балл около 61 станет первым показателем среди моделей с открытыми весами, превысившим 60.
• Получит ли работа по attention в vLLM привязку к названию модели. PR #53785 нацелен на размерности головок «GLM-5» без упоминания 5.3-Vision или 5.5; merge, запись в supported-models или model card, связывающая эту геометрию с конкретным названием, станет самым весомым сигналом на данный момент.
Как действовать при подобной утечке
Утечка — это повод подготовиться, а не переходить на новую платформу. Если следующая модель семейства GLM окажется на вершине (или рядом) рейтинга открытых весов, практический вопрос — направлять ли на неё реальный трафик — и непроверенная модель с заявлениями вендора и прогнозом одного аналитика — это именно тот случай, когда нужна страховочная сетка, а не ставка. GLM-5.3, вышедшая на прошлой неделе, уже работает на OrcaRouter — на странице модели указано $1.26 / $3.96 за 1M токенов, это 10% скидка при запуске от цены вендора $1.40 / $4.40, переданной без наценки — и схема маршрутизации — это то, что 5.5 или 5.3-Vision унаследуют в день выхода. Направьте часть трафика на новую модель через роутер с автоматическим переключением на проверенную модель — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — и вы получите сигнал о качестве на собственной нагрузке, а не слайды из презентации. Если прогноз из утечки верен, вы узнаете первыми; если ошибочен — переключение поглотит ошибку, и ничего не сломается. Тот же ключ, без второго контракта, и не нужно выбирать между двумя кандидатами, пока это не сделает Z.ai.
Следующая GLM уже на подходе — единственный открытый вопрос — под каким именем она выйдет. GLM 5.3-Vision означал бы, что Z.ai закрывает самый критикуемый пробел в только что выпущенной модели; GLM 5.5 — это был бы триллионный флагман, на который указывал весь месяц. Анонимная запись teortaxesTex, чей отпечаток зафиксирован 20 августа, — первый конкретный объект, похожий на любой из этих вариантов, и её прогнозируемые 61 балл по AA Intelligence Index вывели бы её вперёд всех моделей с открытыми весами, представленных сейчас в рейтинге. Через пять дней после отпечатка сдвинулся и инференс-стек: работа vLLM над вниманием GLM-5 — это как раз та подготовительная основа, которую оставляет после себя новая модель, хотя в ней и не указан вариант. Ничто из этого не подтверждено, и эта страница обновится в тот момент, когда название, карточка или веса всё прояснят. А пока самый безопасный ход — подготовить маршрутизацию, а не ставить стек на отпечаток.

