
Fugu Max vs GLM-5.3: o modelo de valor é solapado pelo modelo de volume
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
O Fugu Max foi precificado para vencer em custo, e o GLM-5.3 é mais barato nos dois eixos. O coordenador da Sakana AI foi lançado em 11 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, criado para encaminhar cada tarefa ao modelo mais barato capaz de lidar com ela. O GLM-5.3 da Z.ai, listado desde 18 de agosto de 2026, está a US$ 1,26 de entrada e US$ 3,96 de saída por milhão na OrcaRouter — entre um terço e dois quintos abaixo do Fugu Max em ambos, a partir de um único modelo apenas de texto com uma janela de contexto publicada de 1M e um teto de saída de 128K. O GLM-5.3 também é, por acaso, o modelo mais movimentado do nosso catálogo, com uma margem considerável. Essa combinação — mais barato por token e comprovadamente carregando tráfego de produção em escala — faz deste o confronto em que o prêmio de orquestração é mais difícil de justificar.
Mais barato nos dois eixos, com a especificação publicada.
A comparação é desconfortável para o Fugu Max antes mesmo de qualquer benchmark entrar em cena, porque não se trata de trocar capacidade por preço. O GLM-5.3 é, por si só, um flagship próximo da fronteira — a Z.ai o descreve como proporcionando cerca de 50% de melhoria em codificação em relação ao GLM-5.2 e igualando o Mythos 5 em capacidades selecionadas de cibersegurança. Não é um modelo de baixo custo sendo oferecido como alternativa barata. É um flagship que, por acaso, tem preço abaixo de um orquestrador otimizado para custos.
• Preço de entrada — Fugu Max $2.00 por 1M de tokens vs GLM-5.3 $1.26 por 1M de tokens
• Preço de saída — Fugu Max US$ 6,00 por 1M de tokens vs. GLM-5.3 US$ 3,96 por 1M de tokens
• Entrada em cache — Fugu Max $0,25 por 1M de tokens vs. o cache do GLM-5.3 precificado como desconto sobre a tarifa base de entrada
• Contexto — Fugu Max não publicado vs GLM-5.3 1M tokens
• Limite de saída — Fugu Max não publicado vs GLM-5.3 128K tokens
• Modalidade — Fugu Max não publicado vs GLM-5.3 apenas texto, documentado como tal
• Tags de capacidade — Fugu Max nenhuma publicada vs GLM-5.3 uso de ferramentas, modo JSON, raciocínio
• Números de benchmark — seis vitórias alegadas do Fugu Max sem pontuações vs. DeepSWE 46,2 a 66,9 relatado pelo fornecedor do GLM-5.3 em relação à geração anterior, além de uma pontuação de inteligência publicada da Artificial Analysis
• Pesos — Fugu Max fechado, pool não divulgado vs GLM-5.3 de um laboratório com linhagem de pesos abertos
• Tráfego observado no OrcaRouter — Fugu Max nenhum, não transportado vs GLM-5.3 7.962,7M tokens nos últimos sete dias
Repare no que as duas últimas linhas fazem em conjunto. O GLM-5.3 vem de uma linhagem com pesos abertos, que é a forma mais forte disponível do argumento de independência de fornecedor que a Sakana está vendendo como a premissa inteira do Fugu Max. E ele tem um volume de tráfego observável uma ordem de magnitude acima da maioria dos modelos que servimos. Se a pergunta é "o que eu executo para trabalho de produção com uso intensivo de texto a um preço baixo", as evidências apontam para outro lugar que não o orquestrador.

O argumento do volume, e por que ele não é apenas um concurso de popularidade
Um número de tráfego não é um número de qualidade, e não deve ser lido como tal. O que 7,96 bilhões de tokens em sete dias demonstra é que o GLM-5.3 foi executado em escala de produção por muitas equipes independentes, em cargas de trabalho reais, e não gerou uma migração em massa para longe dele. Isso é um sinal fraco sobre a qualidade e um sinal forte sobre a aptidão operacional: a latência é estável, a vazão se mantém, a API se comporta sob carga, e os modos de falha são conhecidos por uma população grande o suficiente para que se tornem públicos. Um modelo lançado na mesma semana que o Fugu Max não tem nada disso por trás.
A linha de latência reforça o ponto. O GLM-5.3 apresenta um p50 de tempo até o primeiro token de 4,33 segundos no tráfego que atendemos. Para trabalho com agentes — a carga de trabalho à qual ambos estes produtos se destinam —, o tempo até o primeiro token se acumula a cada turno de cada subagente que o coordenador gera. Um orquestrador mais barato que gera quatro agentes não é mais barato se cada um espera vários segundos antes de emitir qualquer coisa, e esse custo nunca aparece em uma tabela de preços.
O contra-argumento do Fugu Max é que seu coordenador encaminha cada solicitação para o modelo capaz mais leve, o que, em princípio, significa que muitas tarefas nunca chegam a tocar em um backend caro. A expansão do pool da Sakana neste lançamento adicionou modelos de pesos abertos e especializados, incluindo a família NVIDIA Nemotron por meio de uma colaboração com a NVIDIA, então os degraus baratos dessa escada são reais. A questão é se os degraus são mais baratos que US$ 3,96 por milhão de tokens de saída. Para a maioria das tarefas de texto, não são — esse é um patamar baixo, e modelos de pesos abertos executados a tarifas de hospedagem geralmente só superam esse patamar por uma pequena margem.
Perguntas que vale a pena fazer antes de escolher
Um orquestrador é mais barato que um único modelo de pesos abertos? Não por padrão, e a intuição segue na direção errada. A orquestração acrescenta os tokens de síntese de um coordenador e, em execuções multiagente, a saída de cada agente da equipe. O preço do Sakana's Fugu elimina o pior caso ao cobrar uma tarifa única combinada com base no modelo participante de nível mais alto, em vez de empilhar agentes, o que é uma concessão genuína. Mas a tarifa-base que você está combinando é de $6.00 de saída, e o único modelo que você chamaria de outra forma é $3.96. A orquestração economiza dinheiro quando evita novas tentativas, não quando adiciona paralelismo por si só.
Uma limitação de apenas texto importa para algum dos dois? Para o GLM-5.3, isso está documentado, portanto é uma restrição com a qual você pode planejar — sem visão, sem áudio, sem vídeo, e o catálogo diz isso. Para o Fugu Max, a modalidade simplesmente não é publicada. Isso é pior do que uma limitação, porque você não consegue saber se um pipeline que envia um PDF vai funcionar até testá-lo. Uma restrição não declarada não é o mesmo que uma restrição ausente.
O que acontece com cada um quando os modelos subjacentes mudam? O GLM-5.3 é um modelo em uma versão, treinado e servido pela Z.ai. Se a Z.ai mudar os seus preços, a mudança é aplicada à sua chave no mesmo dia pelo OrcaRouter com 0% de acréscimo, e você pode vê-la e responder. O comportamento do Fugu Max é função de um conjunto cujos membros a Sakana não divulga, de modo que a descontinuação ou a mudança de preço de um laboratório de fronteira altera silenciosamente o que você está comprando sem que o nome do produto mude. A Sakana apresenta isso como resiliência. É resiliência para o fornecedor e opacidade para o comprador.

Onde as decisões de roteamento realmente são tomadas
Ambas são, na prática, decisões de roteamento — o Fugu Max toma-as dentro de um coordenador opaco, e você toma-as na camada de API. O OrcaRouter é do segundo tipo: uma API para mais de 200 modelos com uma DSL de roteamento que permite expressar a política explicitamente, failover automático quando um caminho de provedor se degrada, e fusão de modelos quando você quer combinar resultados de forma deliberada, em vez de confiar que uma caixa-preta o faça. O GLM-5.3 está nesse catálogo pelo preço de tabela da Z.ai com 0% de markup, o que vale mais do que o habitual para um modelo com tanto tráfego por trás: a tarifa que você vê é a tarifa que a Z.ai publica, repassada sem alterações.
A diferença prática está na auditabilidade. Quando o Fugu Max escolhe um modelo para a sua solicitação, você não descobre nada sobre qual foi escolhido nem por quê. Quando você mesmo escreve a política de roteamento, a decisão fica no seu repositório, revisável por quem revisa o seu código, e pode ser alterada sem esperar por um fornecedor. Para equipes sujeitas a qualquer tipo de obrigação de conformidade ou contabilidade de custos, isso não é uma diferença filosófica.
O veredito
O GLM-5.3 vence esta comparação nos termos que mais importam para uma equipe de produção: é mais barato na entrada e na saída, sua janela de contexto e teto de saída são publicados, seus limites de modalidade são declarados, ele traz uso de ferramentas, modo JSON e raciocínio como capacidades documentadas, vem de uma linhagem de pesos abertos e tem um número de tráfego de sete dias se aproximando de oito bilhões de tokens. Não há leitura das evidências públicas segundo a qual o Fugu Max seja a compra mais bem fundamentada nesse ponto de preço.
O Fugu Max defende um argumento, e é um argumento válido: em tarefas em que uma segunda passagem de um coordenador deteta um erro que a primeira passagem teria deixado passar, o custo por tarefa concluída pode superar o custo por token. Isso justifica um piloto de âmbito limitado se o seu trabalho for verificável, de grande volume e estiver fora da UE/EEE — com um limite máximo de tokens de saída definido antecipadamente e uma medição de tokens por tarefa concluída. Caso contrário, a resposta é o modelo único que custa um terço menos e que está a funcionar sob carga de produção há um mês, e está disponível no OrcaRouter ao preço de tabela da Z.ai, com a tarifa do fornecedor repassada.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
