Um cartão de título hero para "Fugu Max vs GLM-5.3" com o subtítulo "O modelo de valor é desbancado pelo modelo de volume", três selos em formato de pílula com os dizeres "$6.00 vs $3.96 de saída", "7,962.7M tokens por 7d" e "$2.00 vs $1.26 de entrada", uma linha de rodapé com os dizeres "Sakana AI vs Z.ai - setembro de 2026", e o logotipo do OrcaRouter no canto inferior direito.
Engineering & Research

Fugu Max vs GLM-5.3: o modelo de valor é solapado pelo modelo de volume

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Fugu Max foi precificado para vencer em custo, e o GLM-5.3 é mais barato nos dois eixos. O coordenador da Sakana AI foi lançado em 11 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, criado para encaminhar cada tarefa ao modelo mais barato capaz de lidar com ela. O GLM-5.3 da Z.ai, listado desde 18 de agosto de 2026, está a US$ 1,26 de entrada e US$ 3,96 de saída por milhão na OrcaRouter — entre um terço e dois quintos abaixo do Fugu Max em ambos, a partir de um único modelo apenas de texto com uma janela de contexto publicada de 1M e um teto de saída de 128K. O GLM-5.3 também é, por acaso, o modelo mais movimentado do nosso catálogo, com uma margem considerável. Essa combinação — mais barato por token e comprovadamente carregando tráfego de produção em escala — faz deste o confronto em que o prêmio de orquestração é mais difícil de justificar.

Mais barato nos dois eixos, com a especificação publicada.

A comparação é desconfortável para o Fugu Max antes mesmo de qualquer benchmark entrar em cena, porque não se trata de trocar capacidade por preço. O GLM-5.3 é, por si só, um flagship próximo da fronteira — a Z.ai o descreve como proporcionando cerca de 50% de melhoria em codificação em relação ao GLM-5.2 e igualando o Mythos 5 em capacidades selecionadas de cibersegurança. Não é um modelo de baixo custo sendo oferecido como alternativa barata. É um flagship que, por acaso, tem preço abaixo de um orquestrador otimizado para custos.

• Preço de entrada — Fugu Max $2.00 por 1M de tokens vs GLM-5.3 $1.26 por 1M de tokens

• Preço de saída — Fugu Max US$ 6,00 por 1M de tokens vs. GLM-5.3 US$ 3,96 por 1M de tokens

• Entrada em cache — Fugu Max $0,25 por 1M de tokens vs. o cache do GLM-5.3 precificado como desconto sobre a tarifa base de entrada

• Contexto — Fugu Max não publicado vs GLM-5.3 1M tokens

• Limite de saída — Fugu Max não publicado vs GLM-5.3 128K tokens

• Modalidade — Fugu Max não publicado vs GLM-5.3 apenas texto, documentado como tal

• Tags de capacidade — Fugu Max nenhuma publicada vs GLM-5.3 uso de ferramentas, modo JSON, raciocínio

• Números de benchmark — seis vitórias alegadas do Fugu Max sem pontuações vs. DeepSWE 46,2 a 66,9 relatado pelo fornecedor do GLM-5.3 em relação à geração anterior, além de uma pontuação de inteligência publicada da Artificial Analysis

• Pesos — Fugu Max fechado, pool não divulgado vs GLM-5.3 de um laboratório com linhagem de pesos abertos

• Tráfego observado no OrcaRouter — Fugu Max nenhum, não transportado vs GLM-5.3 7.962,7M tokens nos últimos sete dias

Repare no que as duas últimas linhas fazem em conjunto. O GLM-5.3 vem de uma linhagem com pesos abertos, que é a forma mais forte disponível do argumento de independência de fornecedor que a Sakana está vendendo como a premissa inteira do Fugu Max. E ele tem um volume de tráfego observável uma ordem de magnitude acima da maioria dos modelos que servimos. Se a pergunta é "o que eu executo para trabalho de produção com uso intensivo de texto a um preço baixo", as evidências apontam para outro lugar que não o orquestrador.

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

O argumento do volume, e por que ele não é apenas um concurso de popularidade

Um número de tráfego não é um número de qualidade, e não deve ser lido como tal. O que 7,96 bilhões de tokens em sete dias demonstra é que o GLM-5.3 foi executado em escala de produção por muitas equipes independentes, em cargas de trabalho reais, e não gerou uma migração em massa para longe dele. Isso é um sinal fraco sobre a qualidade e um sinal forte sobre a aptidão operacional: a latência é estável, a vazão se mantém, a API se comporta sob carga, e os modos de falha são conhecidos por uma população grande o suficiente para que se tornem públicos. Um modelo lançado na mesma semana que o Fugu Max não tem nada disso por trás.

A linha de latência reforça o ponto. O GLM-5.3 apresenta um p50 de tempo até o primeiro token de 4,33 segundos no tráfego que atendemos. Para trabalho com agentes — a carga de trabalho à qual ambos estes produtos se destinam —, o tempo até o primeiro token se acumula a cada turno de cada subagente que o coordenador gera. Um orquestrador mais barato que gera quatro agentes não é mais barato se cada um espera vários segundos antes de emitir qualquer coisa, e esse custo nunca aparece em uma tabela de preços.

O contra-argumento do Fugu Max é que seu coordenador encaminha cada solicitação para o modelo capaz mais leve, o que, em princípio, significa que muitas tarefas nunca chegam a tocar em um backend caro. A expansão do pool da Sakana neste lançamento adicionou modelos de pesos abertos e especializados, incluindo a família NVIDIA Nemotron por meio de uma colaboração com a NVIDIA, então os degraus baratos dessa escada são reais. A questão é se os degraus são mais baratos que US$ 3,96 por milhão de tokens de saída. Para a maioria das tarefas de texto, não são — esse é um patamar baixo, e modelos de pesos abertos executados a tarifas de hospedagem geralmente só superam esse patamar por uma pequena margem.

Perguntas que vale a pena fazer antes de escolher

Um orquestrador é mais barato que um único modelo de pesos abertos? Não por padrão, e a intuição segue na direção errada. A orquestração acrescenta os tokens de síntese de um coordenador e, em execuções multiagente, a saída de cada agente da equipe. O preço do Sakana's Fugu elimina o pior caso ao cobrar uma tarifa única combinada com base no modelo participante de nível mais alto, em vez de empilhar agentes, o que é uma concessão genuína. Mas a tarifa-base que você está combinando é de $6.00 de saída, e o único modelo que você chamaria de outra forma é $3.96. A orquestração economiza dinheiro quando evita novas tentativas, não quando adiciona paralelismo por si só.

Uma limitação de apenas texto importa para algum dos dois? Para o GLM-5.3, isso está documentado, portanto é uma restrição com a qual você pode planejar — sem visão, sem áudio, sem vídeo, e o catálogo diz isso. Para o Fugu Max, a modalidade simplesmente não é publicada. Isso é pior do que uma limitação, porque você não consegue saber se um pipeline que envia um PDF vai funcionar até testá-lo. Uma restrição não declarada não é o mesmo que uma restrição ausente.

O que acontece com cada um quando os modelos subjacentes mudam? O GLM-5.3 é um modelo em uma versão, treinado e servido pela Z.ai. Se a Z.ai mudar os seus preços, a mudança é aplicada à sua chave no mesmo dia pelo OrcaRouter com 0% de acréscimo, e você pode vê-la e responder. O comportamento do Fugu Max é função de um conjunto cujos membros a Sakana não divulga, de modo que a descontinuação ou a mudança de preço de um laboratório de fronteira altera silenciosamente o que você está comprando sem que o nome do produto mude. A Sakana apresenta isso como resiliência. É resiliência para o fornecedor e opacidade para o comprador.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Onde as decisões de roteamento realmente são tomadas

Ambas são, na prática, decisões de roteamento — o Fugu Max toma-as dentro de um coordenador opaco, e você toma-as na camada de API. O OrcaRouter é do segundo tipo: uma API para mais de 200 modelos com uma DSL de roteamento que permite expressar a política explicitamente, failover automático quando um caminho de provedor se degrada, e fusão de modelos quando você quer combinar resultados de forma deliberada, em vez de confiar que uma caixa-preta o faça. O GLM-5.3 está nesse catálogo pelo preço de tabela da Z.ai com 0% de markup, o que vale mais do que o habitual para um modelo com tanto tráfego por trás: a tarifa que você vê é a tarifa que a Z.ai publica, repassada sem alterações.

A diferença prática está na auditabilidade. Quando o Fugu Max escolhe um modelo para a sua solicitação, você não descobre nada sobre qual foi escolhido nem por quê. Quando você mesmo escreve a política de roteamento, a decisão fica no seu repositório, revisável por quem revisa o seu código, e pode ser alterada sem esperar por um fornecedor. Para equipes sujeitas a qualquer tipo de obrigação de conformidade ou contabilidade de custos, isso não é uma diferença filosófica.

O veredito

O GLM-5.3 vence esta comparação nos termos que mais importam para uma equipe de produção: é mais barato na entrada e na saída, sua janela de contexto e teto de saída são publicados, seus limites de modalidade são declarados, ele traz uso de ferramentas, modo JSON e raciocínio como capacidades documentadas, vem de uma linhagem de pesos abertos e tem um número de tráfego de sete dias se aproximando de oito bilhões de tokens. Não há leitura das evidências públicas segundo a qual o Fugu Max seja a compra mais bem fundamentada nesse ponto de preço.

O Fugu Max defende um argumento, e é um argumento válido: em tarefas em que uma segunda passagem de um coordenador deteta um erro que a primeira passagem teria deixado passar, o custo por tarefa concluída pode superar o custo por token. Isso justifica um piloto de âmbito limitado se o seu trabalho for verificável, de grande volume e estiver fora da UE/EEE — com um limite máximo de tokens de saída definido antecipadamente e uma medição de tokens por tarefa concluída. Caso contrário, a resposta é o modelo único que custa um terço menos e que está a funcionar sob carga de produção há um mês, e está disponível no OrcaRouter ao preço de tabela da Z.ai, com a tarifa do fornecedor repassada.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente