Um cartão de título de destaque com o texto 'Fugu Max vs Qwen3.8-Max' e o subtítulo 'Mesmo preço, mesmo benchmark, um número', três badges em formato de pílula com os textos '$2.00 / $6.00 em ambos', 'Terminal Bench 2.1: 86.6 vs não informado' e 'Pontuação independente: nenhuma vs 40', uma linha de rodapé com o texto 'Sakana AI, setembro de 2026 vs Alibaba, agosto de 2026', e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Fugu Max vs Qwen3.8-Max: Mesmo Preço, Mesmo Benchmark, Um Número Publicado

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Fugu Max e Qwen3.8-Max têm o mesmo preço de tabela: US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída. A Sakana AI lançou o Fugu Max em 11 de setembro de 2026, e a Alibaba vem oferecendo o Qwen3.8-Max desde o início de agosto, e os dois fornecedores chegaram a uma tabela de preços idêntica partindo de direções opostas — um precificando uma política de roteamento, o outro precificando um modelo de 2,4 trilhões de parâmetros. O empate elimina completamente o preço da decisão, o que é incomumente limpo. O que resta são as evidências, e os dois lados divergem aí mais do que em qualquer outro ponto. As tabelas de ambos os fornecedores mencionam o Terminal Bench 2.1. A Alibaba informa 86,6 para o Qwen3.8-Max. A Sakana diz que o Fugu Max obtém a melhor pontuação geral no Terminal Bench 2.1 e não informa número algum — nem para esse teste nem para os outros cinco que afirma vencer.

O único benchmark que ambos os lados citam

Isto é o confronto inteiro comprimido em uma única linha, por isso vale a pena ser preciso a respeito.

O comunicado da Sakana lista seis benchmarks nos quais o Fugu Max obtém a melhor pontuação geral: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish. Cinco são avaliações públicas reconhecidas e o sexto, SWEFish, é o benchmark de programação da própria Sakana. Para nenhum dos seis, o comunicado informa um valor, uma margem ou o número de um concorrente para colocá-lo ao lado. A alegação paralela — de que o Fugu Max expande a fronteira de Pareto de custo-desempenho em sete de dez benchmarks — é igualmente uma declaração sobre a posição em um gráfico, e não sobre um ponto em um eixo.

As linhas publicadas da Alibaba para o Qwen3.8-Max incluem Terminal-Bench 2.1 em 86,6, OSWorld-Verified em 86,1, GPQA Diamond em 92,6 e SWE-bench Pro em 67,7. Tudo relatado pelo fornecedor, tudo números. Assim, no único teste que ambas as empresas escolheram nomear, uma publicou um número e a outra publicou uma classificação. Não se pode concluir disso qual sistema é melhor — o “melhor no geral” da Sakana pode significar 91 ou 87. O que se pode concluir é que, até o momento da publicação, nenhuma evidência pública responde à pergunta, e o fornecedor que faz a alegação mais ampla é justamente o que se recusa a quantificá-la.

Preços idênticos, construção oposta

• Entrada — Fugu Max $2,00 por 1M de tokens vs Qwen3.8-Max $2,00 por 1M de tokens

• Saída — Fugu Max US$ 6,00 por 1M de tokens vs Qwen3.8-Max US$ 6,00 por 1M de tokens

• Entrada em cache — Fugu Max US$ 0,25 por 1 milhão de tokens vs. Qwen3.8-Max US$ 0,25 por 1 milhão de tokens, e a Artificial Analysis mede de forma independente um desconto de cache de 88% do lado do Qwen

• Sobretaxa para prompts longos — Fugu Max: nenhum nível declarado no comunicado, vs. Qwen3.8-Max: tarifa fixa até a janela, sem sobretaxa

• Contexto e janela de saída — a Fugu Max não publica nenhum dos dois números, ao contrário do Qwen3.8-Max, que tem uma janela de 1M de tokens com um teto de saída de aproximadamente 128K

• Modalidade de entrada — texto do Fugu Max, com as capacidades do próprio pool por trás dele, vs. texto, imagem, vídeo e PDF do Qwen3.8-Max

• Arquitetura — Fugu Max, um coordenador treinado sobre um conjunto não divulgado, expandido para Max com modelos de pesos abertos e especializados, incluindo a família NVIDIA Nemotron, por meio de uma colaboração com a NVIDIA vs. Qwen3.8-Max, um modelo esparso de mistura de especialistas com aproximadamente 2,4 trilhões de parâmetros totais e cerca de 95 bilhões ativos por token

• Pesos — Fugu Max fechado, participação no pool não divulgada intencionalmente vs. Qwen3.8-Max pesos abertos publicados para o checkpoint da classe Max sob uma licença personalizada

• Avaliação independente — Fugu Max: nenhuma publicada, e não existe página da Artificial Analysis para qualquer modelo Fugu, enquanto o Qwen3.8-Max é uma entrada ativa da Artificial Analysis com números publicados de velocidade, verbosidade e custo por tarefa

Quatro dessas linhas dizem “não publicado” do lado do Fugu e trazem um número do lado do Qwen. Quando as taxas são idênticas, essa é toda a comparação: o mesmo dinheiro compra um sistema que você consegue descrever e outro que não.

A two-column scoreboard titled 'Fugu Max vs Qwen3.8-Max - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, Terminal Bench 2.1 best with no figure, evidence vendor-reported only. Qwen3.8-Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context 1M with a 128K output ceiling, Terminal Bench 2.1 at 86.6, evidence Artificial Analysis Index 40 and $2.67 per task. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Qwen3.8-Max rows Alibaba-reported and per Artificial Analysis.' OrcaRouter logo bottom-right.

Uma coluna tem um terceiro por trás dela

A Artificial Analysis atribui ao Qwen3.8-Max uma pontuação de 40 no Índice de Inteligência v4.3 reformulado, ocupando a posição #30 de 200, com um custo de US$ 2,67 por tarefa do Índice de Inteligência e 37,8 tokens de saída por segundo — velocidade lenta o suficiente para ficar na #154 posição de 200. O mesmo registro contabiliza 180 milhões de tokens de saída gerados ao longo do índice, mais que o dobro dos 89 milhões do modelo mediano, e um desconto de cache de 88 por cento.

Duas correções se aplicam antes que qualquer parte disso seja citada. A primeira é que o número amplamente divulgado de 58 — ou 58,1, ou 58,4 — para o Qwen3.8-Max é anterior à recalibração do índice pela Artificial Analysis em setembro de 2026, e a página ao vivo exibe o selo Updated, que marca uma pontuação revisada. Os textos mais antigos também traziam um custo de esforço diferente em relação à escala anterior: 64 turnos por tarefa, contra 14 da geração anterior do Qwen, a cerca de US$ 1,14 por tarefa do Intelligence Index; a página atual mostra US$ 2,67. A segunda é um alerta genuíno, e não um artefato de escala: a Artificial Analysis mediu separadamente a taxa de alucinação do Qwen3.8-Max subindo de 23% para 40% em relação à geração anterior. Para um modelo comercializado como capaz de trabalho autônomo de várias etapas, isso é um custo que se orça em verificadores, não uma nota de rodapé.

O Fugu Max não tem nenhum tipo de registro independente. Todos os números associados a ele vêm da Sakana e, até o momento em que escrevo, não existe nenhuma página do Artificial Analysis para o Fugu Max ou para qualquer um de seus modelos irmãos. Isso não é uma acusação — um modelo lançado há poucas horas não terá cobertura de terceiros —, mas significa que as duas colunas não são igualmente verificáveis, e isso continuará assim até que alguém fora da Sakana o execute.

Duas maneiras de gastar demais

Ambos esses sistemas deslocaram o custo de uma resposta para longe do custo de um token, e o fazem em direções opostas. O Qwen3.8-Max é econômico no token e pródigo na resposta: 180 milhões de tokens de saída no Intelligence Index, o dobro da mediana, a US$ 2,67 por tarefa. Ele trabalha por muito tempo em vez de ser grande, e o desconto de cache de 88 por cento é a alavanca que controla a conta — uma longa execução de agente que fica relendo o mesmo contexto continua barata; uma que fica gerando texto novo, não.

Fugu Max é caro por token e imprevisível na resposta. Seu coordenador gera subagentes, cada um dos quais escreve raciocínio e texto de saída cobrados a US$ 6,00 por milhão, além da síntese do próprio coordenador. A Sakana garante que execuções multiagente sejam cobradas a uma tarifa combinada atrelada ao modelo participante de nível mais alto e que adicionar agentes não multiplique a conta, o que elimina a explosão de fan-out no pior caso que torna sistemas multiagente ingênuos inviáveis financeiramente. Isso não elimina o volume. E, quanto à questão do volume, o comunicado de lançamento é omisso de uma forma que importa: o próprio material da Sakana afirma que trocar de modelo no meio da tarefa pode reduzir a reutilização do cache de contexto e gerar tokens extras de orquestração, e confirma que a empresa não divulgou a taxa de acerto de cache do Max nem seu custo total de tokens por tarefa.

Então, a mesma taxa de $2,00 / $6,00 é um número previsível de um lado e um múltiplo ilimitado com um piso do outro. A verbosidade do Qwen3.8-Max é mensurável antes de você se comprometer; a do Fugu Max não é.

O teste da escotilha de escape

É aqui que o habitual argumento de lock-in se inverte, e é a coisa mais útil no pareamento.

O argumento da Sakana para o Fugu Max é a resiliência. Um pool que abrange modelos de pesos abertos e especializados, ampliado para o Max com a família NVIDIA Nemotron, significa que a descontinuação, o reajuste de preços ou a retirada regional de um único fornecedor de ponta não pode derrubar seu produto — uma proteção real, e uma que a empresa faz questão de vender. Mas a proteção não é verificável de fora. Você não consegue ver o pool, não consegue incluir ou excluir um membro, não consegue auto-hospedar nenhuma parte dele e não consegue executá-lo na UE/EEE de forma alguma. Uma promessa sobre um pool que você não tem permissão para inspecionar é uma garantia mais fraca do que parece.

O Qwen3.8-Max apresenta o argumento no sentido inverso. É o modelo de um único fornecedor e, portanto, está exposto às decisões de um único fornecedor — mas a Alibaba publicou pesos abertos para o checkpoint Max-class Qwen3.8-2.4T-A95B sob uma licença personalizada, o que significa que a válvula de escape é real, e não retórica: se os preços ou os termos mudarem, o modelo pode ser servido a partir da sua própria infraestrutura. Para uma equipe cujo medo real é que um fornecedor puxe o tapete, um checkpoint baixável supera uma descrição de um pool.

Chamando qualquer um

O Qwen3.8-Max está no nosso catálogo a $2,00 de entrada e $6,00 de saída por milhão de tokens, que é o preço de tabela da Alibaba com 0% de markup repassado, de modo que uma mudança de preço do fornecedor chega à mesma chave no mesmo dia, em vez de seguir um cronograma de migração. É compatível com OpenAI na mesma URL base que o resto do catálogo, o que significa que você pode colocá-lo atrás de uma regra de roteamento condicional, de uma cadeia de failover ou de um painel de fusão de modelos sem um segundo contrato ou alteração de código — e o failover automático cobre um caminho de provedor com limitação de taxa ou degradado. Ele movimentou 127,7 milhões de tokens pelo gateway nos últimos sete dias.

Fugu Max não está no OrcaRouter. Ele chega até você por meio da API compatível com OpenAI da própria Sakana e de várias plataformas de terceiros, e a empresa afirma que uma integração Fugu existente é atualizada com a mudança de um único parâmetro. Como ambos falam o mesmo formato de requisição, a maneira mais barata de resolver a lacuna de benchmark é parar de esperar que a Sakana a publique: execute os dois atrás de uma única flag na sua própria carga de trabalho e conte os tokens de saída por tarefa concluída. Essa é a medição que nenhum dos fornecedores forneceu.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the argument that the industry has raced along a single axis of bigger and more expensive foundation models while the frontier that matters is two-dimensional, capability on one axis and cost on the other.

Qual deles, e quando?

O Qwen3.8-Max é a escolha que você pode auditar, precificar e abandonar. Pela mesma tabela de preços, ele oferece uma janela de 1M de tokens sem sobretaxa para prompts longos, entrada de imagem, vídeo e PDF, um checkpoint da classe Max para download, uma entrada independente e ativa que mede os fatores que determinam a sua conta, e 88 por cento de desconto na entrada em cache. Seus custos são igualmente específicos: ele é lento, a 37,8 tokens por segundo, ficando perto do fim da fila em velocidade, é enormemente prolixo, com 180 milhões de tokens no índice, e sua taxa de alucinação medida praticamente dobrou em relação à geração anterior — o que é uma preocupação séria justamente para o trabalho autônomo para o qual ele é vendido. Use o desconto de cache sem moderação e reserve orçamento para um verificador.

Fugu Max é a aposta de que a coordenação supera a capacidade. Se o seu trabalho é de horizonte longo e verificável, e um coordenador que gera um verificador conclui tarefas nas quais um único modelo falha duas vezes, então os tokens de orquestração são mais baratos que as retentativas, e a tabela de preços idêntica não é um empate de forma alguma. O que você está comprando é persistência, num sistema cujo pool você não consegue fixar, cuja janela de contexto não é publicada e cujas seis vitórias em benchmarks não têm valores associados — de um fornecedor que escolheu nomear o teste e omitir o número.

Ambos os produtos custam o mesmo por token. Só um deles mostra o que você recebe em troca.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the Featured badge, the identifier qwen/qwen3.8-max, by Qwen dated 2026-08-03, vision, tools, JSON and reasoning capability tags, a 1M-token context window with text, image and video input, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 TTFT of 10.00 seconds, traffic of 127.7 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente