
Ox Alpha: Полное техническое описание стелс-модели, теперь выпускаемой как GLM-5.3-Flash
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 316 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 196 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Ox Alpha — это анонимное название, под которым GLM-5.3-Flash демонстрировался в предварительном доступе; оно было раскрыто 26 августа 2026 года, и это не модель, которую можно вызвать сегодня. Предварительный листинг, носивший имя Ox Alpha, больше её не обслуживает; у самой модели есть страница вендора, веса под лицензией MIT, опубликованная тарифная сетка и документированный набор эндпоинтов API — и всё это принадлежит Z.ai. Эта страница — справочник по этой модели: рамки возможностей, модальности, тарифная сетка, состав эндпоинтов, каждая опубликованная цифра бенчмарка с привязанными к ней ревизией или тестовым стендом, а также — поскольку этот псевдоним по-прежнему выдаёт скудный и сбивающий с толку результат поиска — прямое изложение того, что нигде не документировано. Всё нижеследующее было прочитано 28 сентября 2026 года в собственной документации по модели и на странице цен Z.ai, в карточке модели Z.ai на Hugging Face, в Artificial Analysis и в нашем собственном каталоге; цифры, публикуемые вендором, и цифры, измеренные независимой стороной, помечены отдельно, и ничто здесь не выводится из сходства.
Что сегодня обозначает название Ox Alpha
Псевдоним снят с использования, и именно вендор его снял. Собственная документация Z.ai для GLM-5.3-Flash гласит, что модель перед выпуском тестировалась анонимно под именем ox-alpha, чтобы собрать отзывы пользователей, и что этот анонимный запуск стал самой популярной моделью той недели. Датируемые привязки коротки и конкретны: в скрытом листинге Ox Alpha значился как выпущенный 20 августа 2026 года, а раскрытие состоялось 26 августа — та же дата, что указана на странице документации Z.ai, и та же дата выпуска, которую фиксирует наш собственный каталог для z-ai/glm-5.3-flash.
Из этого вытекают две вещи, и обе важны для читателя, который искал это имя.
• Псевдоним — это не маршрут. Наш каталог возвращает «модель не найдена» при поиске stealth/ox-alpha, по состоянию на 2026-09-28. Под этим именем нечего вызывать, потому что продукт вендора носит имя вендора.
• Под этим алиасом также нет репозитория с весами, принадлежащего вендору. Поиск ox-alpha на Hugging Face выдаёт загрузки сообщества, созданные в период скрытого запуска в конце августа 2026 года, а также репозиторий от 27 сентября 2026 года, содержащий только карточку модели: весов в нём нет, и он указывает на официальный релиз Z.ai. Имя репозитория — это просто метка, выбранная тем, кто его загрузил; оно ничего не документирует. Собственная организация Z.ai публикует модель как zai-org/GLM-5.3-Flash, причём репозиторий создан 2026-08-25 по UTC.
Вопрос о провайдере, доминировавший в течение анонимной недели, закрыт, и закрыт обычным образом: лаборатория вышла вперёд и поставила своё имя на модель. Остаётся спецификация — именно ей посвящена эта страница. История обнаружения — отпечатки, предшествовавшие раскрытию, родословная анонимной модели, к которой она относится, и сопутствующее раскрытие информации о серверном оборудовании — находится в нашей более ранней статье о расследовании Ox Alpha, и эта страница не пересматривает ничего из этого.
Конверт, как его описывает поставщик

Это цифры, о которых сообщила Z.ai, взятые со страницы документации самого вендора от 28.09.2026, и три из четырёх измерений оболочки независимо подтверждены — запись модели Artificial Analysis содержит те же 320B общих, 18B активных, контекст в 1,000,000 токенов и лицензию MIT, а наша собственная карточка каталога содержит ограничения по контексту и выводу.
• Контекстное окно — 1 000 000 токенов (документация Z.ai; Artificial Analysis; наша собственная карточка каталога, в которой указано 1 000 000)
• Максимальный вывод — 128K токенов (документация Z.ai); в нашей карточке указано 128 000
• Ввод — текст, изображение, видео и файл (документация Z.ai, прочитано 2026-09-28); в нашей карточке перечислены текст, изображение и видео, а ввод файлов не заявлен
• Вывод — только текст, для каждого источника
• Параметры — 320B всего, из них 18B активируются на каждый токен (документация Z.ai и карточка модели; Artificial Analysis независимо указывает 320B и 18B)
• Лицензия — MIT, веса опубликованы на Hugging Face (карточка модели от производителя; Artificial Analysis классифицирует модель как открытые веса под разрешительной лицензией)
• Архитектура — гибрид разреженного и линейного внимания, который Z.ai описывает как первую открытую фронтирную модель, объединяющую оба подхода, сокращая вычисления внимания в 3,01 раза и KV-кэш в 4,44 раза по сравнению с GLM-5.3, плюс шаг IndexPool, сжимающий четыре ключевых вектора индексатора в один на длинном контексте, и Manifold-Constrained Hyper-Connections для эффективности масштабирования. Всё заявлено вендором; независимого архитектурного аудита, на который можно сослаться, нет.
• Предварительное обучение — мультимодальный корпус из 30 триллионов токенов (по данным Z.ai). Поставщик не публикует ни общий показатель вычислительных ресурсов для обучения, ни разбивку параметров по слоям, помимо заголовочных 320B/18B.
Одно из заявлений о масштабах с момента запуска сузилось, и цитировать следует именно текущую документацию. Раскрытие сведений об оборудовании для инференса, распространявшееся в августе, оценивало мощность анонимной недели примерно в 100 000 китайских чипов отечественного производства. Документация Z.ai в её нынешнем виде говорит, что модель обслуживалась «на десятках тысяч ускорителей отечественной разработки», с трёхкратным улучшением сквозного обслуживания по сравнению с собственной базовой конфигурацией поставщика на том же оборудовании и стоимостью за токен, которую поставщик описывает как сопоставимую с массовыми GPU NVIDIA. Десятки тысяч — это то, что указано на странице сейчас; более крупная цифра относится ко временам запуска. И то и другое — заявления компании, ни одно из них не проходило независимый аудит, а направление пересмотра — вниз.
Прайс-лист, и почему именно фактическое число показов имеет значение
На странице цен Z.ai модель GLM-5.3-Flash указана по цене $0,15 за миллион входных токенов, $0,03 за миллион кэшированных входных токенов и $0,50 за миллион выходных токенов, а родственный тариф FlashX — по $0,37 / $0,075 / $1,25. Это прейскурантная цена поставщика, взятая с его собственной страницы 28 сентября 2026 года.
Фактически применённый сегодня на нашем маршруте тариф ниже, и в этом практическая суть данного раздела. По состоянию на 2026-09-28 карточка OrcaRouter для z-ai/glm-5.3-flash указывает цену на ввод $0.075 за миллион токенов, на вывод — $0.25 за миллион, а на чтение из кэша — $0.0173 за миллион. Это вдвое ниже заявленной цены поставщика, для той же модели, в тот же день — скидочная цифра, а не рекламная, причём на карточке нет никакой пометки об акции. В нашем более раннем материале об этой модели уже отмечался тот же разрыв после закрытия указанного промо-окна; это наблюдение остаётся верным и сегодня, и причину мы по-прежнему не можем установить, поэтому мы сообщаем фактически применённую цифру, а причину оставляем открытой.
Кэшированный ввод — это то, где три источника заметно расходятся, что служит полезным напоминанием: «$0.03» в таблице не обязательно является ценой, которую кто-то платит. На странице поставщика указано $0.03 за миллион кэшированных входных токенов; запись модели Artificial Analysis содержит цену попадания в кэш $0.026; наш маршрут обслуживает чтения из кэша по $0.0173. Все три прочитаны 2026-09-28 или незадолго до этой даты, все три предоставлены поставщиком или платформой. Мы указываем прейскурантную цифру поставщика как прейскурантную, а обслуживаемую цифру — как то, что фактически выставляется вызывающей стороне.
Выполните расчёт на примере типичного задания агента — 100 000 входных токенов и 10 000 выходных токенов, без попаданий в кэш:
• По тарифу из списка поставщика — 100 000 токенов × $0,15/1 млн = $0,015, плюс 10 000 × $0,50/1 млн = $0,005, итого $0,020 за вызов
• При тарифе, по которому наш маршрут работает сегодня — $0.0075 плюс $0.0025, то есть $0.010 за вызов, ровно половина
Именно поэтому перед тем, как оценивать масштаб рабочей нагрузки, стоит проверять фактическую цену, а не прейскурантную: для агента с длинным горизонтом работы, который выполняет тысячи вызовов в день, разница между этими двумя числами — это разница между двумя бюджетами. OrcaRouter передаёт прейскурантную цену провайдера без наценки — 0%, поэтому скидка, которую проводит вендор, отражается в нашем счёте, а не поглощается где-то посередине.
Модальности и поверхность конечных точек
Вендор документирует одну форму интерфейса и два кода моделей: glm-5.3-flash и glm-5.3-flashx, обе обслуживаются через Chat Completion API. Изображения передаются как блок контента с типом image_url в массиве content сообщения, принимая либо URL — что рекомендует вендор — либо data URL в формате base64, причём в одном сообщении можно отправить несколько блоков изображений. Поддерживается стриминг, и Z.ai рекомендует включать stream и tool_stream вместе для стриминговых запросов. Вызов инструментов, кэширование контекста и структурированный вывод JSON — всё это документированные возможности; thinking поддерживается, но, как объясняется в следующем разделе, не является необязательным.
FlashX — это отдельный уровень обслуживания той же модели, а не отдельная возможность: Z.ai указывает для него 200 токенов в секунду и заявляет, что он пока недоступен в GLM Coding Plan. Это не тот уровень, который представлен в нашем каталоге, и не то, что описывают цифры на этой странице.
На нашем маршруте набор конечных точек уже, и его стоит указать точно. Карточка z-ai/glm-5.3-flash предоставляет POST /v1/chat/completions — только chat completions, без второго эндпоинта протокола — и принимает reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens и stop. Чипы возможностей на карточке — vision, tools, JSON и reasoning. Контекст — 1 000 000 токенов, максимальный вывод — 128 000, что соответствует документации поставщика.
Усилие и мышление: настройки, которые определяют каждое число в бенчмарках
Это та часть спецификации, которая больше всего меняет то, как вы читаете оценки, и производитель описывает её точно. GLM-5.3-Flash принимает параметр усилие_рассуждения с тремя уровнями — low, high и max — и по умолчанию он равен max, если вы ничего не передаёте или если вы передаёте что-либо, что не является low или high. Рассуждение нельзя отключить: производитель утверждает, что thinking.type поддерживает только enabled. Флаг clear_thinking в шаблоне чата по умолчанию имеет значение false, и Z.ai рекомендует явно передавать его как true для чат-сценариев. Рекомендуемые производителем настройки сэмплирования — temperature 1 и top_p 0.95, и он прямо заявляет, что при воспроизведении бенчмарков и таблиц лидеров следует сохранять максимальное усилие по умолчанию.
Сопоставьте эти два факта, и вывод для любого, кто сравнивает числа, неизбежен: оценка, приведённая без уровня усилий, не является полным измерением, потому что настройки low, high и max — это разные рабочие точки одной и той же модели, а значение по умолчанию — самое дорогое из трёх. В нашей карточке среди поддерживаемых параметров указаны reasoning и reasoning_effort, так что эта настройка доступна через маршрут, а не только через вендора.
Бенчмарк-лист с приложенной правкой
Z.ai публикует таблицу бенчмарков для GLM-5.3-Flash, и она полностью основана на данных самого производителя — независимый отчёт Artificial Analysis не воспроизводит эти строки. Ключевые показатели вендора по программированию и агентным задачам — это DeepSWE v1.1 с 63,4 против 46,2 у GLM-5.2 и AutomationBench v1.0.6 с 48,8 против 26,2 у GLM-5.2. Остальная часть таблицы, как она представлена в нашем собственном каталоге с Z.ai в качестве указанного источника: Humanity's Last Exam с инструментами — 55,3, Agents' Last Exam — 26,3, NL2Repo — 56,3, Chartography с инструментами — 78, CharXiv reasoning с инструментами — 89,4, а на стороне зрения — MMVU 80,5, MVBench 77,8 и BabyVision 53,4.
Две строки от вендоров заслуживают того, чтобы их сноски были включены прямо в предложение, ведь именно их читатель чаще всего процитирует без этих сносок. Внутренняя оценка кодинга от Z.ai, Z.ai Code Bench v1.0, ставит GLM-5.3-Flash на 29.0 при максимальном уровне усилий против Claude Opus 4.8 с 29.5 — почти ничья на собственном стенде вендора, запущенном на Claude Code 2.1.207, по данным самого вендора. Это не независимое сравнение и не сравнение при сопоставимых усилиях, проведённое третьей стороной; это Z.ai проводит бенчмарк своей модели против конкурента на собственной оценке. А вендор приводит значение Artificial Analysis Intelligence Index, равное 57, при $0.045 за задачу, указывая ревизию как v4.1.1.
Эту последнюю цифру нужно отделять от того, что Artificial Analysis публикует сегодня, ведь их нельзя поставить рядом как одно изменение. На собственной странице Artificial Analysis, посвящённой GLM-5.3-Flash, прочитанной 2026-09-28, указан Intelligence Index 41.8 по индексу v4.3.2, зафиксированный при максимальном усилии. В v4.3.2 входят десять оценок — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1, — а в v4.1.1 они не входили. Две версии индекса, два набора задач, две цифры. Ни одна из них не ошибочна; это не одно и то же измерение, и приводить 57 рядом с 41.8 так, будто модель сдвинулась, было бы ошибкой в любую сторону.
Что независимая запись действительно подтверждает, так это скорее общие характеристики, а не оценки: Artificial Analysis независимо фиксирует 320 млрд общих параметров, 18 млрд активируемых, контекстное окно в 1 000 000 токенов, лицензию MIT, открытые веса и дату релиза 2026-08-26, а также указывает вендорские цены: $0.15 на входе и $0.50 на выходе за миллион токенов при цене попадания в кэш $0.026. Там, где поставщик публикует оценку, а независимая сторона — нет, мы об этом сообщаем; там, где независимая сторона подтверждает характеристику, это самый сильный класс фактов на этой странице.
Здесь нет сопоставимого прямого сравнения на равных, и сказать об этом полезнее, чем состряпать его. Никто не публиковал прогон GLM-5.3-Flash против Claude Opus 4.8, GPT-6 Sol или Grok 4.7 при заявленном уровне усилий на общем тестовом стенде — собственное сравнение Z.ai проводилось на своём стенде, при максимальном уровне усилий, против настроек конкурента по умолчанию. Пока это не изменится, честное сравнение этой модели с чем угодно другим возможно по цене, диапазону возможностей и поверхности эндпоинтов — это три вещи на этой странице, которые все могут прочитать по одним и тем же числам.
Что не задокументировано, сказано прямо
Справочная страница для модели с тонкой информационной поверхностью полезна только в том случае, если она честно говорит о пробелах, а у этой их несколько.
• Дата отсечения знаний вендором не указана. Документация Z.ai и карточка модели на Hugging Face её не приводят, а в записи Artificial Analysis это поле оставлено пустым. Оценки из периода скрытого запуска — это работа сообщества, а не цифра вендора, и эта страница не повторяет ни одну из них так, будто она ею является.
• Для большей части таблицы бенчмарка нет сносок о харнессе. В карточке модели всё же есть сноски для запуска HLE с инструментами — temperature 1.0, top_p 0.95, максимальная длина генерации 163 840 токенов, оценка при контексте до 300 000 токенов со стратегией управления контекстом и GPT-5.6 Luna при среднем уровне усилий в роли модели-судьи — а также для NL2Repo и DeepSWE, которые, по словам вендора, были запущены с использованием харнесса mini-swe-agent. В остальных строках указаны только голые проценты без привязки к харнессу или уровню усилий.
• Разброс цен на кэшированный ввод не объясняется. Три цифры для одного и того же объёма на одной и той же модели, и ни один источник не указывает, почему они различаются.
• Независимый бенчмарк периода анонимного обслуживания отсутствует. Скрытый листинг исчез; что бы он ни измерял, это уже невозможно измерить снова, и ни одна третья сторона не опубликовала прогон против этого псевдонима, пока он был активен.
• Сравнение с третьими сторонами при сопоставимых трудозатратах не проводилось по указанной выше причине.
• Нет подтверждения от производителя относительно количества чипов на момент запуска. В документации говорится о десятках тысяч отечественных ускорителей; цифра 100 000 на странице не указана.
Подводим итог: что предлагает наш каталог, проверено сегодня.

Модель, лежащая в основе Ox Alpha, доступна в нашем каталоге под собственным именем — это проверено сегодня, а не предположено. Чтение API моделей OrcaRouter для z-ai/glm-5.3-flash 2026-09-28 вернуло карточку в полном виде: контекст 1 000 000 токенов, максимальный вывод — 128 000 токенов, ввод текста, изображений и видео с выводом текста, чипы возможностей vision, tools, JSON и reasoning, дата выпуска — 2026-08-26, не помечена как устаревшая и не исключена из каталога, цена — $0,075 за миллион входных токенов, $0,25 за миллион выходных токенов и $0,0173 за миллион кэшированных входных токенов, через единственный эндпоинт POST /v1/chat/completions.
Наше собственное семидневное измерение в playground на той карточке за тот же период даёт следующие показатели: 61,8 выходных токенов в секунду, p50 времени до первого токена — 7,39 секунды и доля ошибок 1,47%. Это собственные данные о нашем сервинге, а не цифры вендора и не независимые бенчмарки, и именно поэтому они — единственные показатели скорости на этой странице.
Сам алиас не находится на маршруте. Если вы попали сюда, поискав Ox Alpha, вызывать нужно модель z-ai/glm-5.3-flash, а формат запроса — тот, что описан выше. Он использует тот же ключ, что и всё остальное в каталоге, — один API для 200+ моделей, цена провайдера передаётся как есть, без наценки сверху, а также автоматическое переключение при сбое провайдера, так что модель, которую вы тестируете, не обязана быть той моделью, от которой зависит ваш продакшн-путь.

Одно уточнение о том, чем является эта страница, — поскольку читатель, пришедший по названию самой модели, заслуживает этого. Это справочная страница для модели, которая уже есть в каталоге, а не отчёт о запуске: GLM-5.3-Flash появилась 26 августа 2026 года, и её место здесь объясняется тем, что название Ox Alpha продолжают искать, а отдельной страницы, на которую можно было бы попасть, нет, — а не свежестью релиза. Дата выше используется для датировки модели, а не как новость. Что могло бы изменить эту страницу — это одно из четырёх: независимый прогон бенчмарка с указанным уровнем усилий, указанная производителем дата отсечки знаний, изменение ставки за обслуживание или решение Z.ai сообщить, каким на самом деле было количество чипов на момент запуска. Пока одно из этого не произойдёт, приведённая выше спецификация — это всё, что документирует производитель, а пробелы, перечисленные в предыдущем разделе, являются такой же частью ответа, как и числа.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
