
Fugu Ultra v2 vs Qwen3.8-Max: por que a etiqueta de preço é o número errado
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O Fugu Ultra v2 custa $30,00 por milhão de tokens de saída. O Qwen3.8-Max custa $6,00. Isso é uma diferença de cinco para um, e se você escolher entre estes dois sistemas agênticos com base nessa proporção, vai escolher mal — porque nenhum deles é, na verdade, cobrado da forma que a sua tabela de preços sugere. Segundo a própria medição da Artificial Analysis, o Qwen3.8-Max gerou 180 milhões de tokens de saída para completar o Intelligence Index, mais do que o dobro dos 89 milhões do modelo mediano, a um custo de $2,67 por tarefa. É um modelo econômico por token e pródigo por resposta. O Fugu Ultra v2 da Sakana AI, lançado em 11 de setembro de 2026, tem a forma oposta: um conjunto não divulgado de modelos de outros laboratórios que ele cria e coordena por solicitação, cobrado a uma taxa combinada que, segundo a Sakana, não se multiplica à medida que se adicionam agentes. Um é um único modelo de 2,4 trilhões de parâmetros que pensa em voz alta durante muito tempo. O outro é um pequeno coordenador que contrata ajuda. Comparar os seus preços de token não lhe diz quase nada sobre qual é mais barato de executar.
Duas maneiras opostas de ser caro
Comece pelo mecanismo, porque ele explica todas as outras diferenças nesta comparação.
Qwen3.8-Max é um modelo esparso de mistura de especialistas — 2,4 trilhões de parâmetros totais, cerca de 95 bilhões ativos por token — que alcança resultados próximos da fronteira trabalhando por mais tempo, em vez de ser maior. O Artificial Analysis o mediu em 37,8 tokens de saída por segundo, classificando-o na 154ª posição entre 200 modelos em velocidade, com 180 milhões de tokens de saída emitidos ao longo do Intelligence Index (70ª posição entre 200 em verbosidade). Seu custo por tarefa do Intelligence Index é de US$ 2,67, e seu desconto de cache é excepcionalmente profundo, de 88%, que é a alavanca que de fato controla a conta aqui: uma longa execução de agente que continua relendo o mesmo contexto é barata, e uma que continua gerando texto novo não é.
O Fugu Ultra v2 aborda o mesmo problema pelo outro lado. É um orquestrador — um pequeno coordenador treinado, com cerca de 7 bilhões de parâmetros, segundo relatos, que lê uma solicitação, monta uma equipe de agentes com os papéis de Pensador, Trabalhador e Verificador do trabalho TRINITY da Sakana, e então sintetiza uma resposta. Sua fatura de tokens é a soma do que seus subagentes produzem mais o texto de síntese do próprio coordenador. A Sakana afirma em suas FAQ de preços que é cobrada uma tarifa combinada vinculada ao modelo de topo envolvido e que adicionar agentes não multiplica a fatura, o que elimina a clássica explosão multiagente em que o fan-out multiplica o custo. O que não elimina é o volume. A $30,00 por milhão de tokens de saída, o número que importa é quantos agentes foram executados e quanto escreveram, e esse é um número que nem você nem a Sakana conseguem prever a partir da página de preços.
Essa é a forma honesta de enquadrar a diferença de preço: trata-se de uma tarifa, não de um total. Uma tarifa cinco vezes mais alta aplicada a uma carga de trabalho cujo volume de produção você não consegue prever não é cinco vezes o custo — é um múltiplo sem limite com um piso previsível.

A ficha técnica, e a única linha que decide a questão
• Preço — Fugu Ultra v2 $5,00 entrada / $30,00 saída por 1M de tokens vs. Qwen3.8-Max $2,00 entrada / $6,00 saída
• Entrada em cache — Fugu Ultra v2 $0,50 por 1M vs. Qwen3.8-Max $0,25 por 1M de leitura, e um desconto de cache de 88% medido pela Artificial Analysis
• Sobretaxa de contexto longo — a entrada do Fugu Ultra v2 dobra para $10.00 e a saída para $45.00 acima de 272K tokens, enquanto o Qwen3.8-Max não tem sobretaxa de prompt longo, com preço fixo até o limite da janela
• Janela de contexto — Fugu Ultra v2 1M tokens vs Qwen3.8-Max 1M tokens
• Teto de saída — Fugu Ultra v2 não divulgado como um valor único vs Qwen3.8-Max cerca de 128K tokens
• Modalidade de entrada — texto do Fugu Ultra v2, com as próprias capacidades do pool por trás dele, vs. texto, imagem, vídeo e PDF do Qwen3.8-Max
• Pesos — Fugu Ultra v2 fechados, participação no pool não divulgada por design vs Qwen3.8-Max pesos abertos publicados para o checkpoint da classe Max sob uma licença personalizada
• Disponibilidade regional — Fugu Ultra v2 não é vendido na UE/EEE, enquanto o Qwen3.8-Max está disponível sem restrição regional
• Avaliação independente — Fugu Ultra v2: nenhuma publicada, e não existe página do Artificial Analysis para nenhum modelo Fugu, em comparação com o Qwen3.8-Max, uma entrada ativa no Artificial Analysis com números publicados de velocidade, verbosidade e custo por tarefa
Leia as duas últimas linhas em conjunto e o confronto fica mais nítido. O Qwen3.8-Max é um modelo que você pode fixar por versão, cuja licença pode ler, cujo checkpoint pode baixar e que pode conferir no placar de um terceiro. O Fugu Ultra v2 é um sistema que você não pode inspecionar, não pode auto-hospedar, não pode comprar na Europa e não pode verificar com ninguém fora da Sakana. A sobretaxa de 272K agrava isso: acima desse limite, a tarifa de entrada do Fugu Ultra v2 dobra e a de saída sobe 50%, enquanto a tarifa do Qwen3.8-Max não se altera. Para o trabalho de longo horizonte com documentos e repositórios para o qual os dois sistemas foram criados, o preço anunciado mais barato também é o mais estável.
O número do Qwen3.8-Max que todos citam está desatualizado
Se você leu sobre este modelo em qualquer lugar nas últimas duas semanas, provavelmente viu um Índice de Inteligência do Artificial Analysis de 58, ou 58,1, ou 58,4. Esses números eram reais e não são mais atuais. O Artificial Analysis recalibrou seu índice para a v4.3 em 7 de setembro de 2026, comprimindo as pontuações de modo geral, e a página ao vivo do Qwen3.8-Max agora exibe 40, posicionando-o em #30 de 200 modelos — com o selo "Atualizado" que indica uma pontuação reformulada. As análises mais antigas também traziam o custo de esforço medido na escala anterior: 64 turnos por tarefa contra 14 da geração Qwen anterior, e cerca de US$ 1,14 por tarefa do Índice de Inteligência. A página atual mostra US$ 2,67 por tarefa, 37,8 tokens de saída por segundo e 180 milhões de tokens de saída no índice.
Duas coisas decorrem disso. Primeiro, na escala recalibrada, o Qwen3.8-Max fica na mesma faixa que o restante do segundo escalão da fronteira, em vez de estar no mesmo nível dela, e qualquer comparação que você leia que o classifique em relação ao Claude Opus 5 ou ao Kimi K3 com base em um 58 está comparando instantâneos de escalas diferentes. Segundo, e de forma mais útil para este confronto, a correção é unidirecional: o Qwen3.8-Max tem um número que pode estar errado e depois ser corrigido. O Fugu Ultra v2 não tem número. Todos os números de Fugu neste artigo vêm da avaliação da própria Sakana e, em 11 de setembro, não há página do Artificial Analysis para o Fugu Ultra v2 nem para qualquer outro modelo Fugu — a URL retorna 404. Quando um fornecedor publica um placar e nenhum terceiro independente executou o modelo, o placar é o registro completo.
Onde eles realmente se sobrepõem, e onde não
A Sakana informa que o Fugu Ultra v2 é o melhor ou está empatado no primeiro lugar em cinco de oito benchmarks — GDP.pdf, Chartography, SWEFish, DeepSWE e Toolathon — e está entre os dois primeiros em sete de oito. Os dois números concretos no comunicado são Chartography com 48,3, contra 27,3 do Claude Opus 5 e 29,5 do Claude Fable 5 na mesma tabela, e DeepSWE com 74,3. As próprias linhas publicadas pela Alibaba para o Qwen3.8-Max incluem Terminal-Bench 2.1 com 86,6, OSWorld-Verified com 86,1, GPQA Diamond com 92,6 e SWE-bench Pro com 67,7.
Observe o que essas duas listas têm em comum: nada. Nem um único benchmark aparece nas duas tabelas de fornecedores. Não há nenhuma linha em que você possa colocar um número da Sakana e um número da Alibaba lado a lado e apontar um vencedor, o que significa que a resposta honesta para "qual é melhor em agentes de programação" é que nenhuma evidência publicada responde a isso. O que existe é um sistema com oito linhas escolhidas pelo fornecedor e nenhuma verificação externa, e um sistema com linhas de fornecedor mais uma entrada independente que mede custo e velocidade, em vez de capacidade em um confronto direto. Isso é uma lacuna nas evidências, não uma lacuna nos modelos, e deveria mudar a forma como você compra: você não pode escolher entre eles com base em benchmarks, então escolha pelas propriedades que você consegue de fato verificar.

Pesos abertos versus um conjunto não divulgado
É aqui que o habitual argumento do lock-in se inverte, e é a coisa mais interessante do emparelhamento.
O argumento de venda da Sakana para o Fugu Ultra v2 é a soberania. Um pool intercambiável de modelos abertos e especializados significa que nenhuma decisão de precificação, cronograma de descontinuação ou mudança de política de um único fornecedor pode derrubar seu produto, e o lançamento deixa isso explícito ao observar que a composição do pool mudou na v2. A empresa também afirma claramente que as pontuações do Fugu Ultra v2 foram alcançadas sem Claude Fable 5, Claude Fable 5.1 ou GPT-6 Astra no pool de agentes — alegando vitórias sobre os três modelos mais fortes disponíveis, ao mesmo tempo que confirma que não chama nenhum deles. Independentemente do que o pool contenha, ele não é o topo do mercado, segundo as próprias contas da Sakana.
Mas o hedge tem um custo que não está na lista de preços. Você não pode ver o pool, não pode escolher se um membro entra ou sai do nível Ultra, não pode auto-hospedar nada disso e não pode executá-lo na UE/EEE de forma alguma — a orquestração baseada em Singapura sobre os pesos de outros laboratórios é um perfil de risco diferente de possuir os pesos. O Qwen3.8-Max inverte isso exatamente. É o modelo de um único fornecedor e, portanto, exposto às decisões de um único fornecedor, mas a Alibaba publicou pesos abertos para o checkpoint Qwen3.8-2.4T-A95B da classe Max sob uma licença personalizada, o que significa que a válvula de escape é real, e não retórica: se os preços ou os termos mudarem, o modelo pode ser servido a partir da sua própria infraestrutura. Para uma equipe cujo medo real é que um fornecedor puxe o tapete, um checkpoint baixável é uma garantia mais forte do que uma promessa sobre um pool que você não tem permissão para inspecionar.
Há um ponto de segunda ordem para quem executa agentes nos dois. O Qwen3.8-Max está no nosso catálogo a $2.00 de entrada e $6.00 de saída, que é o preço de tabela da Alibaba com 0% de margem repassada — uma mudança de preço do fornecedor chega na mesma chave no mesmo dia, e o failover automático cobre um caminho de provedor com limite de taxa ou degradado. O Fugu Ultra v2 não está no OrcaRouter. Ele chega até você pela própria API compatível com OpenAI da Sakana e por várias plataformas de terceiros, e migrar de um Fugu anterior é uma mudança de parâmetro de uma única linha. Um roteador não substitui um coordenador, e um coordenador não substitui a capacidade de fazer failover; se você quer as duas propriedades, está rodando sistemas de dois fornecedores e deve orçar para duas faturas.
Qual deles você deve escolher
Escolha o Qwen3.8-Max se você precisa de um modelo que possa prever, verificar e do qual possa escapar. Sua taxa de saída é um terço da do Fugu Ultra v2 na tabela, ele não tem queda abrupta em contexto longo, aceita imagens, vídeo e PDFs, enquanto a modalidade do pool da Fugu é o que quer que os agentes subjacentes venham a suportar, publica um checkpoint ao qual você pode recorrer, é vendido em todo lugar e tem uma entrada independente ao vivo que mede as coisas que realmente determinam sua conta — 37,8 tokens por segundo e um número de custo por tarefa que você pode modelar antes de se comprometer. Suas fraquezas são igualmente específicas e merecem ser citadas: ele é lento, está na posição #154 de 200 em velocidade, é enormemente verboso, com 180 milhões de tokens no índice, e a Artificial Analysis mediu separadamente sua taxa de alucinação subindo de 23% para 40% em relação à geração anterior, o que é uma preocupação séria justamente para o trabalho autônomo de múltiplas etapas para o qual ele é comercializado. Inclua no orçamento um verificador e use o desconto de cache profundo de forma agressiva.
Escolha o Fugu Ultra v2 se o seu trabalho for de longo horizonte e verificável, o seu orçamento for exploratório e não de produção, e estiver fora da UE/EEE. O argumento estrutural a favor de um coordenador é real e os próprios exemplos do fornecedor apontam para isso de forma consistente — uma execução de investigação automatizada com 123 experiências ao longo de catorze horas numa única H100, um solucionador de cubo de Rubik em Python puro que completou todos os 300 cubos embaralhados, ao passo que duas linhas de base de fronteira anonimizadas falharam por completo. São exemplos selecionados pelo fornecedor com linhas de base anonimizadas e provam menos do que aparentam, mas o padrão é coerente: em tarefas em que a correção é verificável e a parte difícil é a persistência, criar um verificador é melhor do que pedir a um único modelo que se esforce mais. O que está a comprar é essa persistência, a uma taxa cinco vezes a do Qwen3.8-Max, num sistema cuja qualidade não pode auditar e cujo pool não pode fixar. Faça um piloto com âmbito definido, instrumente os tokens de saída por tarefa concluída em vez de por token, e defina um limite antes da primeira execução.

O motivo de a etiqueta de preço estar com o número errado é que ambos esses produtos deslocaram o custo de uma resposta para longe do custo de um token. O Fugu Ultra v2 faz isso espalhando a carga por modelos que não nomeia. O Qwen3.8-Max faz isso pensando por 180 milhões de tokens. Se você já sabe seu volume de tokens por tarefa, a aritmética é trivial e você deveria fazê-la. A maioria das equipes não sabe esse número e, para elas, a decisão se reduz a algo mais simples: o Qwen3.8-Max é a escolha que você pode auditar, precificar e abandonar, e o Fugu Ultra v2 é a escolha que aposta que a coordenação supera a capacidade. Ambas são defensáveis. Apenas uma delas vem com as provas.
