Главная титульная карточка для Ox Alpha, анонимной фронтирной модели, на которой изображён чип модели в форме вопросительного знака с входящими потоками текста, изображений и видео и исходящими блоками токенов, с тремя плашками с надписями «1M токенов контекста», «Бесплатно в течение недели» и «Создатель неизвестен», а также логотип OrcaRouter, вкомпонованный в правый нижний угол.
Guides & Insights

Ox Alpha раскрыт: Z.AI выпускает его с открытыми весами как GLM-5.3-Flash

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Вечером в среду, 26 августа, тайна завершилась так, как и предсказывала форензика. Z.AI — пекинская лаборатория, стоящая за серией GLM, — выпустила модель, которую она тестировала под маской, как продукт с открытыми весами, под названием GLM-5.3-Flash, ровно то суб-имя, на котором сошлись форензика токенизатора и рынки предсказаний. Ox Alpha, анонимная модель, которая возглавляет чарты использования с момента появления 20 августа, теперь является опубликованной моделью, которую можно самостоятельно развернуть: лицензия MIT, 320B всего параметров с 18B активных на токен, окно контекста на 1 048 576 токенов и ввод текста/изображений/видео, заявленный в описании, а также веса на Hugging Face. Это раскрытие также ответило на главную загадку анонимной недели — как модель, которой никто не владел, могла обрабатывать 100 триллионов токенов в день: Z.AI утверждает, что обслуживание целиком выполнялось на примерно 100 000 отечественных китайских ИИ-чипах — впервые китайские микросхемы несли глобальный трафик фронтирного масштаба. Эта мощность также породила самую популярную неверную догадку недели — при таком масштабе многие наблюдатели, подогреваемые загадочными постами исследователей Google DeepMind, утверждали, что Ox Alpha должна быть Gemini, работающей на оборудовании NVIDIA; раскрытие исправило и это. В ту же ночь Alibaba выпустила Qwen3.8-Flash-Next, предварительную версию с открытыми весами своей архитектуры Qwen4 — за один вечер два релиза открытых весов фронтирного класса от китайских лабораторий. Все четыре анонимных релиза до Ox Alpha в итоге были приписаны китайским лабораториям: модель Zhipu AI GLM-5, модель Xiaomi MiMo-V2-Pro, модель Ant Group Lingxi Ling-2.6-flash, и модель Meituan LongCat-2.0. Ox Alpha больше не является экспериментом, доступным только на платформе; это модель, которую разработчики могут развернуть самостоятельно.

Каждая цифра в этом материале — либо собственное заявление оператора, либо данные из листинга самой платформы, либо публичное объявление, либо результат снятия отпечатков сообществом. Показатели DeepSWE — это независимые измерения сообщества, проведённые исследователем Беном Дэвисом: полный прогон из 113 задач, а не официальная запись в лидерборде, хотя результат ~63% теперь почти совпадает с опубликованным самой Z.AI показателем DeepSWE v1.1 — 63,4. Вопрос идентичности закрыт: 26 августа Z.AI выпустила Ox Alpha как модель с открытыми весами под названием GLM-5.3-Flash — лицензия MIT, 320B всего параметров, из них 18B активных, — подтвердив суб-имя, к которому сошлись результаты криминалистического анализа токенизатора и видеоэнкодера. Архитектура, количество параметров и цены теперь опубликованы компанией; то, что остаётся заявленным вендором, а не независимо проверенным, — это набор бенчмарков и утверждение Z.AI о том, что в анонимную неделю инференс выполнялся примерно на 100 000 отечественных китайских ИИ-чипов, с себестоимостью за токен, сопоставимой с массовым оборудованием NVIDIA. Это заявление компании, повторённое несколькими изданиями, а не проверенная цифра. Ранняя гипотеза о Gemini — которую породила мощность в 100 трлн токенов в день и подкрепили загадочные посты исследователей Google DeepMind — оказалась неверной, и релиз закрыл этот вопрос. Оценка качества, приписываемая аналитику teortaxesTex, — и его предположение, что дополнительно обученная Ox Alpha могла бы стать рабочей лошадкой для более сильной GLM 5.5, — является личным суждением аналитика из поста в соцсети, а не независимым измерением и не заявлением Zhipu. Описанная ниже демонстрация зацикленной анимации — тоже сообщение из сообщества: пост разработчика в X, повторённый на китайских форумах разработчиков. Это не заявление вендора о возможностях, и оператор не анонсировал такой функции.

Что мы знаем — и чего не знаем

Быстрая версия:

Оператор описывает Ox Alpha как «передовую модель, созданную для эффективного написания кода, длительной агентной работы и реального производственного использования» — модель рассуждений, предназначенную для долгосрочной разработки программного обеспечения и рабочих процессов, сочетающих текст с визуальным контекстом.

• Он имеет контекстное окно в 1 048 576 токенов (1M), лимит вывода в 131 072 токена и принимает на вход текст, изображения и видео — первый из анонимных релизов, заявивших о поддержке видеоввода, и возможность, которую релиз GLM-5.3-Flash подтверждает как встроенную, а не прикрученную.

• Это было бесплатно в течение недели: $0 за миллион токенов на входе и выходе, при этом оператор заявлял о «щедрых лимитах скорости, почти неограниченном использовании» и 100 триллионах токенов в день пропускной способности — возможности, которые, как позже говорилось в разоблачении, были обеспечены примерно на 100 000 китайских чипах отечественного производства.

• Подтверждено: 26 августа Z.AI выпустила Ox Alpha как модель с открытыми весами под названием GLM-5.3-Flash — лицензия MIT, всего 320B параметров, из которых активны 18B — ровно то, на чём сошлись токенизатор под-имени, видео-энкодер и анализ кодов ошибок, а также рынки предсказаний. Независимый аналитик teortaxesTex оценивает её примерно на уровне GLM-5.3, не считая визуальной части, и предполагает, что дальнейшее обучение Ox Alpha может стать рабочей лошадкой для гораздо более сильной GLM 5.5.

• Теперь у flash-мультимодального чтения есть демо: когда попросили создать зацикленную анимацию пеликана на велосипеде, который открывает телефон с той же анимацией, Ox Alpha ответил самодостаточной зацикленной анимацией в виде одного HTML/SVG-файла — это демо от сообщества, а не заявление вендора.

• Ранние данные об активности на платформе уже показывают реальный производственный трафик, включая агента для написания кода от Nous Research и редактор Zed.

• Компания теперь выпустила его — 26 августа Z.AI выпустила Ox Alpha как GLM-5.3-Flash с открытыми весами под лицензией MIT, разом закрыв вопросы об идентичности, характеристиках и цене: 320 млрд общих параметров при 18 млрд активных, нативно мультимодальная, с каталожной ценой Z.AI $0,15 за вход / $0,50 за выход за миллион токенов и стартовой акцией со скидкой 50%, заявленной как действующая только до 9 сентября, — хотя с этой даты прошло уже восемь дней, и по-прежнему применяется именно тариф со скидкой. Z.AI также раскрыла, что обслуживание в анонимную неделю на уровне 100 трлн токенов в день работало примерно на 100 000 чипах китайского производства — впервые в таком масштабе. В раскрытие не вошёл независимый бенчмарк — таблица оценок модели составлена по данным производителя, — поэтому самым репрезентативным независимым показателем остаётся полный прогон DeepSWE из 113 задач, выполненный Беном Дэвисом, с результатом примерно 63% — на уровне GPT-5.6 Sol mid.

Что такое Ox Alpha

В описании платформы Ox Alpha характеризуется как «модель рассуждений, предназначенная для программирования, длительной агентной работы и производственных нагрузок — многоэтапной разработки ПО, сложных рассуждений и рабочих процессов, сочетающих текст с визуальным контекстом». Это конкретное позиционирование: она создана для долгих агентных циклов и кода, а не для обычного чата. Контекст в 1 млн токенов — это выдаёт её предназначение: такого объёма достаточно для многочасовой агентной сессии или большого репозитория, а лимит вывода в 131 тыс. токенов позволяет генерировать длинные результаты за один проход. Она поддерживает вызов инструментов и функций, а также структурированный вывод в JSON — это остальная часть чек-листа агентных возможностей.

A single-column scoreboard for Ox Alpha listing: context window 1M (1,048,576) tokens, max output 131,072 tokens, input text/image/video, independent benchmarks none yet, price free for one week, throughput 56 tokens/s (P50, platform-measured), with a footer reading 'Operator + platform-reported; no independent scores yet', and the OrcaRouter logo in the bottom-right corner.

Видеовход — самый отличительный пункт в спецификации. Ни одна из более ранних анонимных моделей его не анонсировала, а модель, способная принимать видеокадры наряду с текстом и изображениями, ориентирована на иной класс задач, чем предшествовавшие ей чат-ориентированные релизы. Кроме того, как позже покажет криминалистический анализ, это один из самых сильных маркеров идентичности, которые может нести модель. Всё это — описание, характеристики, показатели скорости — взято из списка оператора и платформы. Релиз GLM-5.3-Flash подтвердил основные характеристики (320B-A18B, нативная мультимодальность); показатели скорости и ёмкости остаются заявлениями вендора.

Мультимодальная история получила на этой неделе конкретную демонстрацию. Разработчик Chetaslua — чей серверный зондаж является частью следов fingerprinting-анализа — опубликовал тест, в котором попросил Ox Alpha {{1}}создать зацикленную анимацию, где пеликан едет на велосипеде и открывает телефон, на котором воспроизводится та же самая анимация: самоссылающийся цикл внутри цикла{{/1}}. В его отчёте модель выдаёт однофайловую HTML/SVG-анимацию — {{2}}пеликан с двухсегментными ногами, которые по-настоящему крутят педали, скорость колёс синхронизирована со скоростью движения, параллакс-фон и завершающий аккорд — телефон внутри цикла{{/2}}. Китайские форумы разработчиков отдельно прогнали собственные промпты про пеликана на велосипеде и обсудили результат, так что демо — это не единичное непроверяемое утверждение. Поскольку на выходе получается код, это согласуется со спецификацией платформы «только текст на выходе»: {{3}}мультимодальное понимание и креативная генерация кода работают вместе, а не нативный видеосинтез{{/3}}. Вывод Chetaslua о том, что это и есть отдача от мультимодальности и что вместе с ней появится способная open-source-модель, — это его собственный прогноз, а не заявление вендора; {{4}}оператор ничего не анонсировал{{/4}}.

Акция «бесплатно в течение недели»

Акция была агрессивной: бесплатная в течение недели, с «щедрыми лимитами, почти неограниченным использованием» и заявленной пропускной способностью 100 триллионов токенов в день, а также с комментарием оператора, приглашающим пользователей «посмотреть, на что вы способны». Если понимать буквально, 100 триллионов токенов в день вывели бы этого оператора в число крупнейших провайдеров инференса в мире — это заявление читается не столько как спецификация, сколько как вызов устроить стресс-тест, что укладывается в общую схему: анонимные релизы — это способ лаборатории получить реальный трафик масштаба frontier, не афишируя своего имени. Подтверждённая трактовка сделала заявление о масштабе конкретным, а не просто более правдоподобным: Z.AI сообщила, что обслуживание 100 триллионов токенов в день осуществлялось примерно на 100 000 отечественных китайских ИИ-чипах — впервые релиз уровня frontier обслуживался в таком масштабе без оборудования NVIDIA. Это раскрытие по-прежнему остаётся заявлением компании, которое сейчас повторяют многие издания, но независимо не проверено; оно также содержит второе, более мягкое утверждение вендора: по словам Z.AI, стоимость одного токена на отечественном кластере сопоставима с массовыми GPU NVIDIA.

Обратной стороной «бесплатно на неделю» было то, что цена, которая за этим последует, оставалась неизвестной — раскрытие ответило на этот вопрос. Опубликованная прайс-листовая цена Z.AI для GLM-5.3-Flash составляет $0.15 за миллион входных токенов, $0.50 за миллион выходных токенов и $0.03 за миллион кэшированных входных токенов. Сообщалось, что стартовая акция со скидкой 50% продлится до 9 сентября 2026 года, снижая цену до $0.075 / $0.25. Спустя восемь дней после этой даты скидочный тариф всё ещё является действующим: при повторном чтении 17 сентября 2026 года страница модели z-ai/glm-5.3-flash указывает цену входных данных $0.075, выходных — $0.25, а чтения из кэша — $0.0173 за миллион токенов, при этом никакой пометки об акции на ней нет. По сравнению с прайс-листовыми $1.40 / $4.40 для GLM-5.3 это примерно одна двадцатая. Практическое следствие состоит в том, что дата окончания 9 сентября устарела, а не сохраняет обязательную силу — разработчик, рассчитывающий бюджет исходя из $0.15 / $0.50, ориентируется на цифру, которую сейчас никому не выставляют. Чего страницы с ценами не проясняют, так это почему. В собственном списке моделей Z.AI для GLM-5.3-Flash по-прежнему указаны $0.15 / $0.50, поэтому было ли продвижение продлено, сделано постоянным или просто оставлено действующим — это не то, что мы можем подтвердить источником; скидочный тариф — это наблюдаемый факт на эту дату, а причина остаётся открытой.

Первый полный бенчмарк — и он на уровне GPT-5.6 Sol mid.

Ox Alpha до сих пор отсутствует в независимых трекерах, таких как Artificial Analysis или LMArena, — слово «фронтир» принадлежит самому оператору, а показатели, которые Z.AI опубликовала вместе с релизом GLM-5.3-Flash (DeepSWE v1.1 — 63,4; AutomationBench — 48,8; Artificial Analysis Intelligence Index — 57), заявлены вендором, а не являются независимыми оценками. С момента запуска изменилось главное: начали распространяться независимые замеры сообщества — и картина прояснилась. На Kingbench ранние прогоны дали Ox Alpha 87,5 — чуть ниже 91,25 у GLM-5.3. На DeepSWE независимый исследователь Бен Дэвис сначала прогнал подмножество из 10 задач и сообщил о 80% Pass@1 — выше, чем у Claude Fable 5 (65%), GLM-5.3 и Grok 4.6 (62%) и GPT-5.6 Sol (52%). С тех пор он завершил полный прогон по всему набору DeepSWE из 113 задач, и уточнённый результат составил примерно 63% — более или менее на уровне GPT-5.6 Sol mid. Цифра в 80% была броской, но десять задач — это менее 9% бенчмарка; сам Дэвис отметил, что именно показатель на полном наборе «имеет гораздо больше смысла». Это замеры сообщества, а не бенчмарк вендора и не официальный балл в лидерборде — но полный прогон остаётся самым репрезентативным показателем из всех, что кто-либо получил на этой модели, и теперь он почти совпадает с показателем DeepSWE v1.1, который сама Z.AI предоставила как вендор, — 63,4. Это полезная перекрёстная проверка, даже если цифра компании — это утверждение, а не измерение.

Сейчас одно сравнение важнее, чем на момент запуска. DeepSeek V4 Pro 0813 — GA-сборка флагмана DeepSeek, выпущенная 13 августа, — показывает DeepSWE 62,7 на собственной бенчмарк-карте DeepSeek против 12,8 у более ранней DeepSeek V4 Pro Preview. Обе цифры предоставлены вендором и на момент написания не воспроизведены независимой лабораторией. Если рассматривать это вместе с ~63% GLM-5.3-Flash на полном наборе сообщества и собственным DeepSWE v1.1 от Z.AI (63,4), показатель DeepSeek 62,7 помещает два самых известных китайских заявления о кодинг-агентах в один диапазон низких 60-х. Десятибалльный разрыв, который выглядел визитной карточкой Ox Alpha, был измерен против DeepSeek V4 Flash 0731, более дешевой компактной модели; против флагмана DeepSeek GLM-5.3-Flash оказывается на одном уровне, а не на десять пунктов впереди.

Второй урок касается самого числа. Аналитик teortaxesTex — который отслеживает эти оценки с анонимной недели — отмечает, что первый отчёт об Ox Alpha тоже давал 80% DeepSWE: то был бросающийся в глаза поднабор Дэвиса из 10 задач, а итоговый результат по полному набору из 113 задач составил 63%. Поскольку официальные 62,7 у DeepSeek V4 Pro 0813 находятся в том же диапазоне, его наблюдение состоит в том, что ничто пока не приблизилось к легитимно воспроизведённым 80% — цифра 80% постоянно появляется в начале публичной жизни модели и неизменно оседает на низких 60-х, когда прогоняют полный набор. Это его аналитическое прочтение, а не измерение, но это правильный взгляд на следующий заголовок о DeepSWE, включая любой о самом GLM-5.3-Flash.

A screenshot of the Artificial Analysis models leaderboard as of August 21, 2026, showing the Intelligence section led by Claude Opus 5 and Claude Fable 5, the largest context-window highlights, and the output-speed rankings — a frontier leaderboard Ox Alpha has no independent score on yet.

Помимо прочего, существует и использование. Данные об активности платформы показывают реальный производственный трафик уже в первые часы — включая Hermes Agent, агентный проект для программирования от Nous Research, и редактор Zed. Оба — это ровно те сценарии «длительной агентной работы и программирования», под которые позиционируется модель. Это не показатель, но это сигнал: разработчики с реальными нагрузками решили, что бесплатная, передового класса, анонимная авантюра стоит того, чтобы её подключить. До того как завершился полный прогон DeepSWE, это раннее принятие было единственным свидетельством; показатель ~63% на полном наборе теперь даёт модели якорный ориентир для сопоставления.

Мелкий шрифт о хранении данных

Анонс бесплатной недели рекламирует «нулевое хранение данных». В описании модели на платформе представлена более оговоренная версия: промпты и завершения сохраняются провайдером, но не используются для обучения, в соответствии с условиями платформы для скрытых моделей. Эта разница имеет значение, если вы собираетесь вставить проприетарный код в окно на 1 млн токенов, принадлежащее провайдеру, который оставался анонимным, пока Z.AI не выступил с заявлением 26 августа. Относитесь к «нулевому хранению данных» как к маркетингу, пока Z.AI не опубликует условия, где это будет сказано прямо, — и направляйте всё, что вы не хотели бы видеть в журналах, через отдельную атрибутируемую модель.

Практическое руководство по анонимной модели

Ox Alpha — пятый анонимный релиз за шесть месяцев, и предыдущие четыре завершались одинаково: анонимный дебют, всплеск бесплатного трафика, а затем компания выходит вперёд:

• Pony Alpha (февраль 2026) — подтверждено компанией Zhipu AI примерно через пять дней после запуска как GLM-5, её флагманская модель MoE с 744 миллиардами параметров.

• Hunter Alpha (11 марта) — бесплатная модель с триллионом параметров и контекстом в 1M, ставшая главной спекулятивной историей весны: её широко считали Deep​Seek V4, но оказалось, что это Xiaomi MiMo-V2-Pro, а сопутствующая Healer Alpha — MiMo-V2-Omni.

• Elephant Alpha (апрель) — бесплатная текстовая модель, ориентированная на эффективность, которую Ant Group примерно через две недели после её появления назвала Lingxi Ling-2.6-flash.

• Owl Alpha (конец апреля) — агентно-ориентированная модель с нативным вызовом инструментов и контекстом ~1M, которую Meituan 30 июня подтвердила как LongCat-2.0; первая модель с триллионом параметров, полностью обученная и обслуживаемая на отечественных китайских чипах.

• Ox Alpha (20 августа) — раскрыт 26 августа как GLM-5.3-Flash, модель с открытыми весами, лицензией MIT и архитектурой 320B-A18B; название, лицензия и характеристики стали официальными в тот же день, когда маска была снята.

A two-column scorecard titled 'The anonymous models — and their reveals', listing Pony Alpha revealed as GLM-5 by Zhipu AI, Hunter Alpha as MiMo-V2-Pro by Xiaomi, Elephant Alpha as Lingxi Ling-2.6-flash by Ant Group, Owl Alpha as LongCat-2.0 by Meituan, and Ox Alpha marked '??? — unclaimed', with a footer noting reveals per each lab's public announcement and Ox Alpha unclaimed as of August 21, 2026, and the OrcaRouter logo in the bottom-right corner.

Зачем запускать хорошую модель под маской? Стандартное прочтение, которое цикл Hunter Alpha сделал предметным, таково: анонимность убирает брендовую предвзятость из оценок, а бесплатное использование краудсорсит данные реального тестирования в масштабе frontier, пока все спорят о владельце. Как выразился один из анализов этого паттерна: «отсутствие бренда — это и есть маркетинг». Дополнительный выигрыш — скорость: анонимная модель может за часы добраться до глобальной аудитории разработчиков без мероприятия по запуску, а сама загадка становится дистрибуцией.

Кто такой Ox Alpha?

До релиза 26 августа ни одна компания не признала её своей, а Zhipu AI ничего не говорила. Но ситуация с неопровержимыми уликами изменилась в течение 48 часов после дебюта модели, и именно приведённый ниже анализ объясняет, почему разоблачение — как GLM-5.3-Flash — вызвало так мало удивления. Поначалу заявленная пропускная способность играла против улик: 100 триллионов токенов в день выглядели как почерк лаборатории топ-уровня на чипах NVIDIA, и теория о том, что Ox Alpha — новый Gemini, подогреваемая загадочными постами исследователей Google DeepMind, набирала серьёзные обороты, пока улики токенизатора, а затем и собственный релиз Z.AI не поставили в ней точку. Самый сильный сигнал — токенизатор. Созданный сообществом инструмент снятия отпечатков modelprint прогнал против Ox Alpha девять инфраструктурных проверок и обнаружил, что модель совпадает с GLM-5.3 от Z.ai по шести из них, причём все четыре нормализованных показателя токенизатора совпали с семейством GLM, тогда как лучший кандидат вне этого семейства сумел добиться лишь двух из четырёх. Независимый исследователь Бен Дэвис сообщил, что количество токенов Ox Alpha точно совпало с GLM-5.3 на 25 тестовых промптах, с единственной постоянной разницей в +75 токенов, которую он объяснил скрытой обёрткой. Совпадение токенизатора — самый трудный для подделки сигнал идентичности: модель не может изменить способ сегментации текста без переобучения.

Видео-путь — это вторая сигнатура. Потребление видеотокенов у Ox Alpha точно совпало с GLM-5V-Turbo на четырёх контрольных образцах — те же механики выборки кадров, масштабирования длительности и разрешения, — тогда как MiMo v2.5, Qwen 3.8 Max и GLM-4.6V все показали расхождения. Это сильный признак того, что обработка видео встроена глубоко в модель, а не является прикрученной опцией. Остальная часть стека отпечатков согласуется с этим же прочтением: Ox Alpha отклоняет аудиовход так же, как GLM-5V, использует характерный код ошибки GLM "1301", выдаёт похожий стиль вывода (около 1,3 эмодзи на 1 000 символов), несёт те же ограниченные параметры и конфигурацию API, которые появились в листинге GLM-5.3 на платформе за два дня до запуска Ox Alpha, и имеет границу знаний около ноября 2025 года.

У этой идентификации есть прецедент в практике самой Zhipu: Pony Alpha, анонимный февральский релиз, оказалась GLM-5, о чём заявили примерно через пять дней после запуска. Аналитическая трактовка, распространявшаяся на этой неделе, — что Ox Alpha — это GLM-5.3, предположительно Flash-модель — нашла отклик у Pliny the Liberator, который сказал, что его агент подтвердил: «Ox-alpha — от Zai, из семейства GLM-5.X». Независимый аналитик teortaxesTex приходит к тому же выводу по качеству и добавляет утверждение о сроках: он оценивает Ox Alpha примерно на уровне GLM-5.3, если не считать vision, и считает самым поразительным аспектом оперативность: текстовая GLM-5.3 была сжата и выпущена с работающим vision в течение нескольких дней после запуска 14 августа. Это суждение одного аналитика, а не независимая оценка, и он утверждает, что оно должно заставить задуматься о нарративе «Китай выпускает модели сразу с пылу с жару». Его последний пост добавляет к этой трактовке предположение о дорожной карте: цикл обновления GLM-5 может быть коротким; Ox Alpha достаточно близка к GLM-5.3, чтобы использование её в качестве субагента едва ли имело смысл — «просто запустите ox @4 вместо этого» — его краткая формулировка для запуска модели напрямую; а дообученная Ox Alpha имела бы большой смысл как рабочая лошадка — как он выразился, «вьючное животное» — для гораздо более сильной GLM 5.5. Это предположение одного аналитика о дорожной карте, а не заявление Zhipu. Вопрос с под-названием, напротив, решён: 26 августа Z.AI выпустила Ox Alpha как GLM-5.3-Flash. Нюанс, из-за которого ярлык Flash оставался лишь «предполагаемым», — GLM-5.3 запущена 14 августа как текстовая модель, в то время как Ox Alpha заявляет видеовход — это именно то, что релиз разрешил: GLM-5.3-Flash — это отдельная, изначально мультимодальная модель, а не та же текстовая. Альтернативные теории — команда MiMo из Xiaomi, DeepSeek — выдвигались и в значительной степени были отклонены на основании данных о токенизаторе и видеовходе, и релиз окончательно решает вопрос о семействе.Аргумент Дэвиса о том, почему стоит обращать внимание на ярлык Flash, оказался практическим: поскольку Ox Alpha действительно является моделью GLM-5.3-Flash, работающей на уровне GPT-5.6 Sol mid, теперь её можно запускать локально — веса доступны на Hugging Face, а SGLang, vLLM и TokenSpeed её обслуживают — что для любого, кто готов её хостить, превращает передовую модель кодирования среднего уровня в разовые аппаратные затраты, а не в счёт за каждый токен.

Геополитическая рамка принадлежит аналитикам, а не свидетельствам: «Это оказывает ещё более колоссальное давление на американские Frontier Labs, и разрыв с Китаем сокращается». Это интерпретация того, что бесплатная модель уровня Zhipu, работающая в масштабе frontier, означает для конкурентного порядка, — и раскрытие аппаратных данных даёт этой интерпретации преимущество, которого у аналитиков не было. Обслуживание 100 триллионов токенов в день на примерно 100 000 отечественных чипов — первая масштабная демонстрация того, что китайский стек без кремния NVIDIA способен пропускать трафик frontier-инференса; это тот самый сценарий, о котором генеральный директор NVIDIA Дженсен Хуанг предупреждал в подкасте Dwarkesh этой весной, утверждая, что экспортные ограничения ускорят создание не зависящего от NVIDIA китайского стека и что frontier-модель, которая лучше всего работает на отечественном китайском оборудовании, станет «ужасным исходом» для Соединённых Штатов. Показатель паритета затрат Z.AI — пока лишь утверждение вендора, но само событие реально. Тем же вечером эта мысль обрела конкретную форму и на стороне моделей: когда Z.AI выпустила GLM-5.3-Flash, Alibaba представила Qwen3.8-Flash-Next — свою предварительную версию с открытыми весами архитектуры Qwen4. Два китайских релиза frontier-класса с открытыми весами за одну ночь — конкретное воплощение того, что наблюдатели назвали «большим днём для китайского открытого исходного кода».

Стоит ли вам развивать это на этой неделе?

Бесплатная неделя закончилась, но тест всё ещё дёшев: тариф, фактически применявшийся 17 сентября, — $0,075 на вход / $0,25 на выход за миллион токенов, а не прайс-листовые $0,15 / $0,50 — 50%-ная промоакция к запуску, которую обещали завершить 9 сентября, всё ещё действует восемь дней спустя. Если вы занимаетесь долгосрочными агентными задачами, пишете код на длинных контекстах или запускаете конвейеры с большим объёмом видео, это ровно то пересечение, на котором позиционируется Ox Alpha — а поскольку веса открыты, вы можете прогнать тест на собственном железе, а не по милости анонимной платформы. Два предостережения. Во-первых, ярлык «передовой» — всё ещё заявка: карточку результатов GLM-5.3-Flash сообщает сам вендор, а единственная твёрдая независимая цифра — результат Дэвиса ~63% в DeepSWE — сильна, но далека от вирусных 80% на раннем подмножестве из 10 задач. Во-вторых, цена $0 была ограничена по времени, а анонс назначил цену тому, что наступит после — дёшево для таких возможностей, но уже не бесплатно. Что убирает релиз с открытыми весами — это зависимость: файлы опубликованы, так что модель можно развернуть у себя, а не арендовать. Это форма теста, а не зависимости.

Безопасный для продакшена способ запустить такой тест — это цепочка резервирования: экспериментальная модель отвечает, пока она работоспособна, а запрос переключается на проверенную модель в тот момент, когда она зависает, выдаёт ошибку или исчезает. Именно для этого и нужен слой маршрутизации. Это раскрытие делает выбор резервной модели тривиальным: Ox Alpha — это GLM-5.3-Flash, и сама модель доступна на OrcaRouter под своим настоящим именем по цене $0.075 за вход / $0.25 за выход за миллион токенов, а чтение из кэша — $0.0173 — стартовая цена со скидкой 50%, которая, как было заявлено, должна была закончиться 9 сентября и по состоянию на 17 сентября всё ещё остаётся ценой на странице, а не каталожными $0.15 / $0.50. Доступ к ней предоставляется с наценкой 0%, один API для более чем 200 моделей, с автоматическим переключением при сбое, чтобы всплеск трафика на неделе запуска не стал вашим простоем. Поставьте новую модель впереди, а проверенную резервную — позади неё в цепочке; когда цена меняется, число, которое вы видите на OrcaRouter, — это число, которое вы платите, в тот же день. Или полностью откажитесь от API — веса открыты, поэтому вариант с самостоятельным хостингом GLM-5.3-Flash за той же цепочкой тоже возможен.

Что посмотреть

Шесть вещей расскажут остальное. Независимый бенчмарк: карточка результатов GLM-5.3-Flash заявлена вендором, прогон DeepSWE у Davis с ~63% — пока единственная надёжная независимая цифра, официальный результат 62,7 у DeepSeek V4 Pro 0813 теперь находится в том же диапазоне, а запись в Artificial Analysis или LMArena — либо независимое прямое сравнение — станет финальной проверкой того, является ли «frontier» фактом или рекламным слоганом. Ценовая траектория: вопрос о постоянном тарифе уже имеет ответ по имеющимся данным — сообщалось, что промоакция со скидкой 50% завершится 9 сентября, однако 17 сентября по-прежнему применяется скидочная ставка $0.075 / $0.25, поэтому именно промо-цифра, а не каталожная цена $0.15 / $0.50, должна закладываться в бюджет; нерешённым остаётся вопрос о причине, поскольку собственный каталожный прайс Z.AI не изменился. Заявление о железе: Z.AI говорит, что анонимная неделя отработала примерно на 100 000 локальных чипов при паритете затрат с NVIDIA — первая публичная проверка этого в масштабе состоит в том, выдержит ли заявление независимую проверку и станет ли локальный стек стандартом по умолчанию для линейки GLM. Арифметика внедрения: превратится ли трафик, который Ox Alpha под маской привлёк, выйдя в лидеры платформ, в развёртывания на собственных серверах и через API теперь, когда у него есть имя, лицензия и цена. Продолжение: отведёт ли GLM-5.3-Flash Ox Alpha роль промежуточной ступени — намёк teortaxesTex в том, что дополнительно обученная версия станет рабочей лошадкой для значительно более сильной GLM 5.5, что сделало бы этот релиз фундаментом следующей GLM. И реакция: поскольку Qwen3.8-Flash-Next вышел в ту же ночь, а за ним стоит раскрытие информации о локальных чипах, американские фронтирные лаборатории — и дебаты об экспортном контроле — находятся под давлением и должны ответить; следите за тем, появится ли по другую сторону разрыва быстрый ответный релиз, ценовой ход или политическая реакция.

Честный вердикт: Ox Alpha был необычно дешёвым экспериментом в обоих направлениях. Платформа проверяла, сможет ли анонимная модель фронтирного класса за $0 за неделю отвоевать реальный продакшн-трафик — и смогла, достаточно убедительно, чтобы Z.AI не только раскрылась на шестой день, но и в ту же ночь выпустила веса как открытую модель. Теперь вам предстоит проверить, достойна ли модель места в вашем стеке, уже без риска анонимности: GLM-5.3-Flash — это именованная, лицензированная по MIT, развёртываемая самостоятельно модель по опубликованной цене, и на аппаратный вопрос тоже нашёлся ответ — Z.AI утверждает, что обслуживание 100T токенов в день работало примерно на 100 000 китайских чипов отечественного производства; заявлено компанией, но теперь широко освещается. Что ещё предстоит узнать: выдержит ли «фронтир» независимое измерение, подтвердится ли на масштабе заявление Z.AI о паритете затрат на отечественных чипах, почему 50%-я стартовая акция всё ещё остаётся ценой, по которой предоставляется сервис, восемь дней спустя после заявленной даты её окончания 9 сентября, и делает ли это раскрытие GLM-5.3-Flash рабочей лошадкой для более сильной GLM 5.5, как намекает teortaxesTex. Проведите эксперимент, но так, чтобы под ним был запасной вариант.

Сравнение в этой статье4

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube