Титульная карточка для «Fugu Max против GLM-5.3» с подзаголовком «Модель ценности подорвана моделью объёма», тремя бейджами-пилюлями с надписями «$6.00 против $3.96 за вывод», «7 962,7 млн токенов за 7 дней», «$2.00 против $1.26 за ввод», нижней строкой «Sakana AI против Z.ai — сентябрь 2026» и логотипом OrcaRouter в правом нижнем углу.
Engineering & Research

Fugu Max против GLM-5.3: модель ценности подрывается моделью объёма

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Fugu Max была нацелена на победу по стоимости, а GLM-5.3 дешевле по обоим параметрам. Координатор Sakana AI был запущен 11 сентября 2026 года по цене $2.00 за миллион входных токенов и $6.00 за миллион выходных токенов — он создан для маршрутизации каждой задачи к самой дешёвой модели, способной с ней справиться. GLM-5.3 от Z.ai, представленная с 18 августа 2026 года, стоит на OrcaRouter на уровне $1.26 за вход и $3.96 за выход за миллион — от трети до двух пятых ниже Fugu Max по обоим показателям, и всё это от одной текстовой модели с опубликованным окном контекста 1M и пределом вывода 128K. GLM-5.3 также, по совпадению, является самой загруженной моделью в нашем каталоге со значительным отрывом. Это сочетание — дешевле за токен и наглядно выдерживающее продакшн-трафик в масштабе — делает данное сравнение тем случаем, где премию за оркестрацию оправдать труднее всего.

Дешевле по обеим осям, с опубликованной спецификацией

Это сравнение невыгодно для Fugu Max ещё до того, как в дело вступают какие-либо бенчмарки, потому что речь не оtrade-off между возможностями и ценой. GLM-5.3 — сам по себе флагман, близкий к передовому уровню: Z.ai описывает её как обеспечивающую примерно 50%-е улучшение в программировании по сравнению с GLM-5.2 и не уступающую Mythos 5 по отдельным возможностям в области кибербезопасности. Это не бюджетная модель, предлагаемая как дешёвая альтернатива. Это флагман, который, так уж вышло, стоит меньше, чем оптимизированный по затратам оркестратор.

Цена ввода — Fugu Max $2.00 за 1 млн токенов против GLM-5.3 $1.26 за 1 млн токенов

• Цена за выходные токены — Fugu Max $6.00 за 1 млн токенов против GLM-5.3 $3.96 за 1 млн токенов

• Кэшированный ввод — Fugu Max $0,25 за 1 млн токенов против кэширования GLM-5.3, цена которого представляет собой скидку от базовой ставки за ввод

• Контекст — Fugu Max не опубликован vs GLM-5.3 1M токенов

• Потолок вывода — Fugu Max не опубликован против 128K токенов у GLM-5.3

• Модальность — Fugu Max не опубликован, а GLM-5.3 — только текстовая; это задокументировано.

• Теги возможностей — у Fugu Max ничего не опубликовано, в отличие от GLM-5.3: использование инструментов, режим JSON, рассуждения

• Показатели бенчмарков — Fugu Max: заявлены шесть побед без баллов против GLM-5.3; DeepSWE по данным вендора — 46,2–66,9 по сравнению с предыдущим поколением; плюс опубликованная оценка интеллекта Artificial Analysis

• Веса — Fugu Max закрытая, пул не раскрыт, в отличие от GLM-5.3 от лаборатории с историей открытых весов

• Наблюдаемый трафик на OrcaRouter — Fugu Max: нет, не передано, в отличие от GLM-5.3 — 7 962,7 млн токенов за последние семь дней

Обратите внимание, что последние две строки делают в совокупности. GLM-5.3 происходит из линии с открытыми весами — это сильнейшая из доступных форм аргумента о независимости от поставщика, который Sakana продаёт как всю концепцию Fugu Max. А ещё у него наблюдаемый показатель трафика на порядок превышает большинство моделей, которые мы обслуживаем. Если вопрос звучит как «что мне запускать для продакшн-работы с большим объёмом текста по низкой цене», доказательства указывают не на оркестратор.

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

Аргумент объёма, и почему это не просто конкурс популярности

Объём трафика — не показатель качества, и не следует воспринимать его как таковой. Что действительно демонстрируют 7,96 млрд токенов за семь дней, так это то, что GLM-5.3 использовалась в производственном масштабе множеством независимых команд на реальных рабочих нагрузках и не вызвала массовой миграции с неё. Это слабый сигнал о качестве и сильный сигнал об операционной пригодности: задержка стабильна, пропускная способность держится, API ведёт себя под нагрузкой, а режимы отказа известны достаточно большой аудитории, чтобы становиться публично известными. У модели, выпущенной на той же неделе, что и Fugu Max, за этим ничего не стоит.

Строка о задержке делает этот аргумент ещё убедительнее. GLM-5.3 демонстрирует медианное (p50) время до первого токена в 4,33 секунды на обслуживаемом нами трафике. Для агентной работы — а именно на неё нацелены оба этих продукта — время до первого токена накапливается при каждом ходе каждого субагента, которого запускает координатор. Более дешёвый оркестратор, запускающий четырёх агентов, не становится дешевле, если каждый из них ждёт несколько секунд, прежде чем выдать хоть что-либо, и эта стоимость никогда не появляется в тарифной карточке.

Контраргумент Fugu Max заключается в том, что его координатор направляет запросы к самой экономной подходящей модели, что в принципе означает, что многие задачи вообще не задействуют дорогостоящий бэкенд. Расширение пула Sakana в этом релизе добавило модели с открытыми весами и специализированные модели, включая семейство NVIDIA Nemotron, благодаря сотрудничеству с NVIDIA, так что дешёвые ступени этой лестницы реальны. Вопрос в том, дешевле ли эти ступени, чем $3.96 за миллион выходных токенов. Для большинства текстовых задач — нет; это низкая планка, и модели с открытыми весами, работающие по хостинговым тарифам, обычно преодолевают её лишь с небольшим отрывом.

Вопросы, которые стоит задать перед выбором

Дешевле ли оркестратор, чем одна модель с открытыми весами? По умолчанию — нет, и интуиция подсказывает обратное. Оркестрация добавляет токены синтеза координатора и, при запусках с несколькими агентами, вывод каждого агента в команде. Ценообразование Fugu от Sakana устраняет наихудший сценарий, выставляя единый смешанный тариф на основе участвующей модели верхнего уровня, а не суммируя агентов, — и это настоящая уступка. Но базовая ставка, которую вы смешиваете, — это $6.00 за вывод, а единственная модель, к которой вы бы иначе обратились, стоит $3.96. Оркестрация экономит деньги, когда предотвращает повторные попытки, а не когда добавляет параллелизм ради самого параллелизма.

Имеет ли ограничение только текстом значение для любого из них? Для GLM-5.3 оно задокументировано, так что это ограничение, которое можно учесть при планировании — ни зрения, ни аудио, ни видео, и в каталоге это указано. Для Fugu Max модальность просто не опубликована. Это хуже, чем ограничение, потому что невозможно узнать, сработает ли конвейер, отправляющий PDF, пока не попробуешь. Незаявленное ограничение — не то же самое, что отсутствующее.

Что происходит с каждым из них, когда меняются базовые модели? GLM-5.3 — это одна модель одной версии, обученная и обслуживаемая Z.ai. Если Z.ai меняет цены, изменение отражается на вашем ключе в тот же день через OrcaRouter с наценкой 0%, и вы можете это увидеть и отреагировать. Поведение Fugu Max — это функция пула, участников которого Sakana не раскрывает, поэтому прекращение поддержки или изменение цены передовой лабораторией незаметно меняет то, что вы покупаете, при этом название продукта не меняется. Sakana представляет это как устойчивость. Это устойчивость для поставщика и непрозрачность для покупателя.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Где на самом деле принимаются решения о маршрутизации

Оба этих варианта, по сути, представляют собой решения о маршрутизации — Fugu Max принимает их внутри непрозрачного координатора, а вы принимаете их на уровне API. OrcaRouter — это второй случай: один API для более чем 200 моделей с DSL для маршрутизации, который позволяет явно выразить политику, автоматическое переключение при деградации пути провайдера и объединение моделей, когда вы хотите осознанно комбинировать результаты, а не доверять это чёрному ящику. GLM-5.3 присутствует в этом каталоге по прайсовой цене Z.ai с наценкой 0%, а это значит больше, чем обычно, для модели с таким объёмом трафика за ней: тариф, который вы видите, — это тариф, который публикует Z.ai, переданный без изменений.

Практическая разница — в возможности аудита. Когда Fugu Max выбирает модель для вашего запроса, вы ничего не узнаёте о том, какая это была модель и почему. Когда вы сами пишете политику маршрутизации, решение находится в вашем репозитории, его может проверить любой, кто проверяет ваш код, и его можно изменить, не дожидаясь поставщика. Для команд, на которые возложены какие-либо обязательства по соблюдению нормативных требований или учёту затрат, это не философское различие.

Вердикт

GLM-5.3 побеждает в этом сравнении по параметрам, которые важнее всего для производственной команды: он дешевле на входе и выходе, его окно контекста и предельный объём вывода опубликованы, ограничения по модальностям указаны, он поддерживает использование инструментов, режим JSON и рассуждения как документированные возможности, он происходит из линии открытых весов, и у него есть показатель трафика за семь дней, приближающийся к восьми миллиардам токенов. Нет такого прочтения публичных данных, при котором Fugu Max был бы лучше обоснованной покупкой при такой цене.

Fugu Max приводит один аргумент, и он весомый: для задач, где второй проход координатора ловит ошибку, которую первый проход уже отправил бы, стоимость за завершённую задачу может оказаться выгоднее стоимости за токен. Это оправдывает ограниченный пилот, если ваша работа проверяема, высокообъёмна и вы находитесь за пределами ЕС/ЕЭЗ — с заранее установленным потолком выходных токенов и измерением количества токенов на завершённую задачу. В противном случае ответ — одна модель, которая стоит на треть меньше и уже месяц работает под продакшн-нагрузкой, и она доступна на OrcaRouter по прейскурантной цене Z.ai с передачей тарифа провайдера.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно