
Fugu Ultra v2 vs GLM 5.2: Você Paga pela Coordenação, Não pelos Parâmetros
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Coloque os dois cartões de preços lado a lado e a comparação parece um erro. Fugu Ultra v2, que a Sakana AI anunciou a 11 de setembro de 2026, cobra 5 dólares por milhão de tokens de entrada e 30 dólares por milhão de tokens de saída. GLM 5.2, o modelo principal da Z.ai, de 16 de junho de 2026, cobra 1,40 e 4,40 dólares. Ambos alegam uma janela de contexto na casa do milhão de tokens. Ambos se dirigem exatamente ao mesmo comprador — a equipa que executa trabalho agêntico longo, com múltiplos passos e à escala de repositórios. Um custa cerca de 3,6× o preço de entrada e 6,8× o preço de saída do outro, e o mais barato é aquele que se pode descarregar e manter. Por isso, toda a comparação se reduz a uma única questão: o que é que o dinheiro extra está realmente a comprar, e está a comprar algo que um único modelo não pode ser?
Eles não são o mesmo tipo de objeto.
A razão pela qual a diferença de preço existe é que essas duas coisas resolvem tarefas de longo horizonte com mecanismos completamente diferentes, e a diferença aparece antes mesmo de você rodar um benchmark.
• Fugu Ultra v2 — um sistema de orquestração, não um modelo de base. É o nível que maximiza a capacidade da linha Fugu da Sakana AI: um único endpoint compatível com a OpenAI que decompõe uma tarefa recebida e distribui as partes por um conjunto de outros modelos, alguns de pesos abertos e outros especializados. O próprio enquadramento da Sakana é que ele "eleva o desempenho máximo a um patamar mais alto do que nunca, sem a dependência indispensável dos modelos de fronteira que orquestra." Você está comprando um agendador, e paga por cada token que esse agendador gasta pensando, incluindo os tokens de orquestração internos.
• GLM 5.2 — um único modelo Mixture-of-Experts. A Z.ai o publica como um modelo de texto de entrada / texto de saída com uma janela de contexto de 1M tokens "realmente utilizável" e até 128K tokens de saída, raciocínio híbrido controlado por reasoning_effort, e chamada nativa de ferramentas. A arquitetura relatada é de aproximadamente 753B parâmetros totais com cerca de 40B ativos por token, embora a Z.ai não tenha confirmado a contagem de ativos especificamente para o 5.2 — trate esse número como herdado do GLM-5.1.
Essa é a bifurcação na estrada. Uma delas é uma coisa que você chama; a outra é uma coisa que chama coisas.
O que o Fugu Ultra v2 não nos diria
A página de anúncio da Sakana é incomumente franca sobre uma coisa e incomumente silenciosa sobre outra, e ambas importam para uma decisão de compra.
A parte franca: a empresa afirma sem rodeios que Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra não estão no pool de modelos do Fugu Ultra v2, mesmo enquanto afirma superá-los em benchmarks. A justificativa apresentada é a resiliência — um pool substituível de modelos abertos e especializados que não pode ser revogado, ter o preço alterado ou ser cortado por um fornecedor ou por uma mudança geopolítica. A data de corte de treinamento está listada como 20260828. Não importa o que você pense do argumento, trata-se de uma postura arquitetural real, e é a razão mais clara para escolher o Fugu Ultra v2 em vez de uma stack que você mesmo montou.
A parte discreta: o anúncio não informa uma janela de contexto, nem informa o preço por token do Fugu Ultra v2 na própria página. Listagens de modelos de terceiros indicam que a janela é de 1M tokens e que as tarifas são $5 / $0,50 em cache / $30, com uma faixa de reprecificação acima de aproximadamente 272K tokens de entrada que passa para cerca de $10 / $1,00 / $45. Esses são os números que o restante deste artigo usa, mas são listagens, não documentação do fornecedor — confirme-os na tabela de preços ativa da Sakana antes de fazer seu orçamento com base neles.
A questão de custo que ninguém responde por token
O preço por token é a unidade errada para esta comparação, e todas as páginas que atualmente ranqueiam para isso cometem o mesmo erro. A conta de um orquestrador não é o tamanho do seu prompt multiplicado por uma tarifa; é o tamanho do seu prompt, mais cada subchamada que ele decide fazer, mais os tokens de raciocínio dos modelos que ele aluga, tudo com um acréscimo correspondente à taxa do próprio orquestrador.
A Sakana reconhece isto diretamente: os tokens de orquestração consumidos internamente são cobrados como tokens de entrada e saída comuns. O que significa que a forma honesta de comparar o Fugu Ultra v2 com o GLM 5.2 é o custo por tarefa concluída, e nenhum dos fornecedores publica esse número.
Alguns pontos estruturais que de fato se sustentam, independentemente:
• Preço de entrada — Fugu Ultra v2 $5,00 / 1M vs GLM 5.2 $1,40 / 1M no OrcaRouter à tarifa do provedor da Z.ai. O Fugu custa 3,6× antes mesmo de fazer uma única subchamada.
• Preço de saída — Fugu Ultra v2 $30,00 / 1M vs GLM 5.2 $4,40 / 1M. Este é o número que dói, porque os agentes emitem muita saída, e um orquestrador emite saída que você não pediu.
• Entrada em cache — O Fugu Ultra v2 lista US$ 0,50 / 1M; o GLM 5.2 faz cache a US$ 0,26 / 1M, um desconto de 81% sobre sua própria tarifa de entrada. É nos loops repetidos de agentes sobre um prompt de sistema estável que a vantagem do GLM 5.2 se acumula com mais força.
• Reprecificação de contexto longo — O nível reportado do Fugu Ultra v2 acima de ~272K de entrada move toda a solicitação para aproximadamente o dobro da tarifa de entrada e 1,5× a tarifa de saída. O GLM 5.2 não tem nenhum escalonamento por contexto: $1,40 / $4,40 fixos, até 1M.
Essa última linha é a que deve ser circulada. Uma execução de agente de horizonte longo passa a maior parte de sua vida além de 272K tokens. A tarifa fixa do GLM 5.2 vale dinheiro de verdade exatamente onde a do Fugu Ultra v2 dobra.

Os benchmarks quase não tocam
Eis a coisa genuinamente estranha nesta comparação, e aquilo que nenhuma página de ranking atual diz claramente: estes dois modelos quase nunca são medidos no mesmo teste.
A Sakana relata o Fugu Ultra v2 como o melhor ou empatado em primeiro lugar em cinco de oito benchmarks — GDP.pdf, Chartography, SWEFish, DeepSWE e Toolathon — e entre os dois melhores em sete de oito. Os dois números de destaque que apresenta são Chartography em 48,3, contra Opus 5 em 27,3 e Fable 5 em 29,5, e DeepSWE em 74,3. SWEFish e Toolathon são benchmarks internos da própria Sakana. Tudo é reportado pelo fornecedor e nada foi reproduzido de forma independente até a publicação.
Os números da Z.ai para o GLM 5.2 vêm de uma prateleira completamente diferente: Terminal-Bench 2.1 em 81.0, SWE-bench Pro em 62.1, GPQA-Diamond em 91.2, AIME 2026 em 99.2, HLE em 40.5 — também relatados pelo fornecedor. Do lado independente, o GLM 5.2 apresenta um AA Coding Index de 68.8 e um Intelligence Index de 39 na página de reavaliação da Artificial Analysis, onde é sinalizado como uma estimativa provisória, classificado em 7º de 113. Citações mais antigas de 51 ou 53 para o GLM 5.2 vêm de uma escala de índice superada e não devem ser citadas.
Então, se você quer um número claro em uma comparação direta, não existe. O mais próximo de um eixo em comum é que ambos são fortes em codificação agêntica, e a leitura honesta é que cada empresa publicou resultados nos testes em que se sai bem. Isso é um motivo para fazer sua própria avaliação, e não para escolher o número mais alto.
Uma coisa que vale a pena assinalar para quem está a comprar o GLM 5.2 hoje: já não é o modelo mais recente da Z.ai. O GLM-5.3 chegou por volta de 14 de agosto de 2026 com o mesmo preço de tabela, mas sob uma licença personalizada que restringe grandes fornecedores de cloud — o que faz do GLM 5.2 o último totalmente licenciado sob a licença MIT carro-chefe da Z.ai, e a razão pela qual ainda tem um argumento de compra distinto.

A licença é o divisor mais nítido.
Deixe os benchmarks de lado e a diferença estrutural é mais evidente do que qualquer pontuação.
O GLM 5.2 é disponibilizado como pesos abertos sob licença MIT no Hugging Face, sem restrições regionais. Você pode baixá-lo, executá-lo no seu próprio hardware, fazer fine-tuning nele e distribuí-lo dentro de um produto sem pedir permissão a ninguém nem pagar qualquer tarifa por token. A Z.ai o treinou — notavelmente, segundo a própria afirmação da empresa, inteiramente em aceleradores Huawei Ascend, e não em Nvidia.
Fugu Ultra v2 não oferece nada disso. É um serviço hospedado: uma política de orquestração sobre um conjunto de modelos cuja composição a Sakana descreveu apenas nas margens. Você não pode baixá-lo, inspecioná-lo, fixá-lo ou executá-lo em ambiente isolado. O que você obtém, em vez disso, é a abstração — um único endpoint cujo comportamento é, em princípio, resiliente ao desaparecimento de qualquer modelo upstream. Isso é um benefício genuíno para um sistema de produção que não pode se dar ao luxo de uma dependência desaparecer. Também é um custo genuíno, porque você trocou o controle por isso.
Se a sua restrição é “o modelo não deve mudar debaixo de mim”, apenas uma destas respostas atende. Se a sua restrição é “o modelo não deve ser removível por outra pessoa”, apenas a outra atende.
Velocidade, e o que os testadores disseram sobre o último.
GLM 5.2 não é rápido em termos mensuráveis: a Artificial Analysis registrou cerca de 66,3 tokens por segundo, com um tempo até o primeiro token de aproximadamente 4,03 segundos, o que é modesto para um modelo de classe frontier, e os próprios usuários da Z.ai reclamaram de congestionamento no serviço durante horários de pico.
A Sakana não publica números de latência ou throughput para o Fugu Ultra v2, o que por si só é informativo — um sistema que despacha para múltiplos modelos tem um perfil de latência que depende inteiramente daquilo que decide chamar, de modo que um único número de throughput seria quase sem sentido. Para o Fugu Ultra anterior, testadores relataram publicamente execuções que se estendiam por cerca de 30 minutos e custos muito acima da tarifa de um único modelo no mesmo trabalho. Esse é o modelo de junho de 2026 e não uma evidência sobre o v2 — mas é o modo de falha a testar, e a razão pela qual uma comparação por token favorece os orquestradores.

Como você realmente chamaria cada um desses
O GLM 5.2 já está disponível no OrcaRouter hoje com as próprias tarifas de provedor da Z.ai — US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de tokens de saída, repassadas sem nenhuma margem adicionada, então qualquer redução que a Z.ai faça chega aqui no mesmo dia. Ele é compatível com a OpenAI, portanto migrar para ele é só uma mudança de URL base e de ID do modelo no SDK que você já usa, e você pode colocá-lo atrás de uma cadeia de failover ou de uma regra de roteamento em vez de apostar um caminho de produção em um único provedor.
O Fugu Ultra v2 não é algo que roteamos. Ele está disponível na própria API compatível com OpenAI da Sakana AI, e uma única alteração de parâmetro move uma integração existente do Fugu para ele. Se você está avaliando-o em comparação com o GLM 5.2, o arranjo prático é manter o GLM 5.2 no seu gateway existente e chamar o Fugu Ultra v2 diretamente da Sakana enquanto você decide — os dois são compatíveis com OpenAI, então podem ficar no mesmo caminho de código por trás de uma flag.
Qual escolher
Escolha o GLM 5.2 se você quer algo conhecido a um preço conhecido: pesos com licença MIT que você poderia auto-hospedar amanhã, um valor fixo de $1,40 / $4,40 sem penalidade de contexto longo, uma janela de 1M genuinamente utilizável e um desconto que se acumula em loops de agentes em cache. Aceite que ele é somente texto, que está uma geração atrás do GLM-5.3 e que sua pontuação no índice independente é provisória.
Escolha Fugu Ultra v2 se o que você está comprando é resiliência mais capacidade máxima em trabalho difícil de várias etapas, e você está disposto a pagar pela coordenação por token e a abrir mão da capacidade de inspecionar ou auto-hospedar aquilo que está chamando. A própria alegação do fornecedor é que ele alcança resultados de nível de fronteira sem depender de modelos de fronteira — uma proposta real e incomum, e que, até hoje, exatamente ninguém fora da Sakana conseguiu verificar.
O que não faríamos seria escolher entre eles na tabela de benchmark. Os testes mal se sobrepõem, ambas as empresas publicaram nos seus próprios pontos mais fortes, e o número decisivo — custo por tarefa de longo horizonte concluída — é o único que nenhuma das empresas colocou numa página.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
