
Fugu Max vs. Grok 4.6: Tabelas de Preços Idênticas, Uma Pontuação Publicada
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Fugu Max e Grok 4.6 custam exatamente o mesmo. A Sakana AI lançou o Fugu Max em 11 de setembro de 2026, com preço de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída — e essa é, linha por linha, a tabela de preços que a SpaceXAI vem cobrando pelo Grok 4.6 desde o lançamento em 12 de agosto. A coincidência é o fato mais útil neste confronto, porque elimina o preço da discussão. Quando dois produtos cobram de forma idêntica, a única questão que resta é o que se recebe pelo dinheiro, e aí os dois se separam completamente. O Grok 4.6 é um modelo único que você pode fixar por versão, consultar uma tabela de benchmarks e verificar em um índice independente. O Fugu Max é um coordenador treinado que despacha cada tarefa para o modelo mais barato de seu pool, e o anúncio da Sakana afirma que ele obtém a melhor pontuação geral em seis benchmarks sem divulgar um número de nenhum deles. Uma dessas compras é mensurável antes de você fazê-la. A outra não é.
Dois produtos, uma tabela de preços
• Entrada — Fugu Max $2.00 por 1M de tokens vs Grok 4.6 $2.00 por 1M de tokens
• Saída — Fugu Max $6,00 por 1M de tokens vs Grok 4.6 $6,00 por 1M de tokens
• Entrada em cache — Fugu Max $0,25 por 1M tokens vs Grok 4.6 $0,50 por 1M tokens, a única linha em que os dois preços diferem de alguma forma
• Janela de contexto — Fugu Max não divulgada pelo fornecedor vs Grok 4.6 500.000 tokens, sem alteração em relação ao Grok 4.5
• Reprecificação de prompts longos — Fugu Max não informa tier no comunicado, enquanto o Grok 4.6 dobra para US$ 4,00 / US$ 12,00 assim que uma única requisição ultrapassa 200.000 tokens, aplicado à requisição inteira, e não apenas ao excedente
• Controlo de raciocínio — Fugu Max não exposto vs. Grok 4.6: quatro níveis de esforço, de baixo a xhigh, com predefinição para alto e não desativável
• Arquitetura — Fugu Max, um coordenador treinado sobre um pool não divulgado que inclui modelos de pesos abertos e especializados, ampliado para o Max com a família NVIDIA Nemotron por meio de uma colaboração com a NVIDIA, vs. Grok 4.6, um modelo em uma única versão
• Avaliação independente — Fugu Max: nenhuma publicada, e não existe página do Artificial Analysis para nenhum modelo Fugu; versus Grok 4.6, um Artificial Analysis Intelligence Index ao vivo de 44, classificado em #20 de 200
A coluna barata é a imprevisível.
Veja onde o Fugu Max realmente ganha no preço: a leitura de cache, que custa metade da do Grok 4.6. É uma vantagem real e é exatamente o lugar errado para se construir um modelo de custos, porque o preço de cache só compensa em proporção à sua taxa de acerto de cache — e a Sakana não publica uma para o Fugu Max. O lançamento também não informa uma janela de contexto, nem um nível de contexto longo, nem um teto de saída. Então a única coluna em que o Fugu Max cobra menos que o Grok 4.6 é um desconto de tamanho desconhecido aplicado a uma parcela desconhecida dos seus tokens.
As fraquezas do Grok 4.6 são, pelo menos, visíveis. Seu limiar de 200.000 tokens é agressivo — ele reprecifica toda a requisição, de modo que um prompt de 250.000 tokens é cobrado à taxa dobrada desde o primeiro token, e não a partir do 200.001º. Mas você consegue ver o precipício, medir seus prompts em relação a ele e decidir se deve dividir em partes. É essa a diferença de natureza aqui: um sistema publica uma tabela de preços com um formato em torno do qual você pode planejar, e o outro publica uma tarifa de manchete sem tabela alguma anexada.
Seis vitórias e nem um ponto.
Os benchmarks que a Sakana cita são Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish. Cinco deles são avaliações públicas reconhecidas. O sexto, SWEFish, é o benchmark de programação da própria Sakana, o que significa que uma das seis vitórias alegadas é medida num teste que o fornecedor escreveu e não divulgou. Quanto aos outros cinco, o comunicado diz que o Fugu Max alcança a melhor pontuação geral e fica por aí — sem pontuação, sem margem, sem o número de nenhum concorrente para colocar ao lado.
Compare isso com a tabela que a SpaceXAI publicou para o Grok 4.6, que é informada pelo fornecedor do início ao fim, mas é ao menos uma tabela: GDPVal-AA v2 em 1.753, AA-Briefcase em 1.577, DeepSWE v1.1 em 65,9%, CursorBench v3.2 em 69,9% e GPQA Diamond em 94,9%. O material de lançamento também relata aproximadamente 53 turnos e cerca de meio bilhão de tokens de entrada para resolver tarefas de horizonte longo no AA-Briefcase, em comparação com aproximadamente 103 turnos e dois bilhões de tokens para um modelo de fronteira concorrente — um argumento, novamente informado pelo fornecedor, de que o Grok é barato por trabalho concluído mesmo a uma taxa modesta por token.
Dois desses números do Grok precisam ser tratados antes que você os cite. O primeiro é que sua pontuação principal de 94,9% no GPQA Diamond vem de um benchmark que a Artificial Analysis aposentou por saturação, então ele não separa mais os modelos de fronteira como antes. O segundo é o número que você verá em coberturas mais antigas: um Índice de Inteligência da Artificial Analysis de 61 para o Grok 4.6. Essa era a escala anterior à reavaliação. A Artificial Analysis recalibrou o índice em setembro de 2026, e o valor atual é 44, em 20º lugar entre 200, com um custo de US$ 1,86 por tarefa do Índice de Inteligência. Qualquer pessoa que classifique o Grok 4.6 em relação ao Claude Fable 5 ou ao GPT-5.6 Sol com base em 61 está comparando leituras de dois instrumentos diferentes.

O que o preço do token de um orquestrador não inclui
A própria cobertura da Sakana sobre o lançamento admite o problema estrutural. Como o Fugu Max alterna entre modelos dentro de uma única tarefa, ele "pode reduzir a reutilização do cache de contexto e também gerar tokens extras de orquestração" — e a empresa não divulgou a taxa de acertos de cache resultante nem um custo total de tokens por tarefa. Todo agente que o coordenador gera escreve raciocínio e texto de saída, e tudo isso é cobrado a US$ 6,00 por milhão. A tarifa é idêntica à do Grok 4.6. O volume não é, e o volume é a variável que uma página de preços não consegue mostrar a você.
Os dois fornecedores estão empurrando você na direção da mesma correção — pare de comparar tarifas, comece a comparar o custo por trabalho concluído —, mas só um deles lhe dá um número por onde começar. O Grok 4.6 chega com um perfil publicado de turnos e tokens. O Fugu Max chega com a instrução de medir você mesmo.
Há uma leitura justa do silêncio do Fugu Max, e ela merece ser dita. O Max é o nível otimizado para custos da linha Fugu, lançado no mesmo dia que o Fugu Ultra v2, que é o avanço de capacidade a $5,00 de entrada e $30,00 de saída. O argumento visual da Sakana para o Max é um gráfico de Pareto — capacidade contra custo — e, num gráfico de Pareto, uma pontuação bruta de benchmark é irrelevante; a pontuação por dólar é a alegação inteira. Se é esse o argumento, imprimir seis pontuações vencedoras sem os respetivos custos seria o gráfico enganoso, e não o que falta. O que o lançamento ainda deve a um comprador é um denominador, e não o fornece.
Onde o Grok 4.6 está genuinamente exposto
O trabalho em terminal é a superfície publicada mais fraca do Grok 4.6. Sua pontuação no Terminal-Bench v3.0 está em 26%, muito atrás da liderança do setor. Cuidado com o número adjacente: o mesmo modelo registra 88,4% no Terminal-Bench v2.1, e esses são testes diferentes. Você verá os dois misturados na cobertura, e a mistura favorece consideravelmente o Grok.
A segunda exposição é que o raciocínio não pode ser desativado. Os tokens de pensamento são cobrados em cada solicitação, então o custo efetivo de saída do Grok 4.6 depende de quão intensamente o modelo decide pensar sobre o seu prompt. O ajuste de esforço dá a você controle na extremidade inferior, mas não há configuração zero.
Em contrapartida, o Grok 4.6 tem algo que o Fugu Max atualmente não pode oferecer a preço algum: um número. Cada linha acima pode ser verificada por terceiros, e a entrada da Artificial Analysis significa que uma já o foi. As seis vitórias do Fugu Max foram publicadas no mesmo dia que o modelo, pela empresa que o criou, e, até ao momento em que escrevo, ninguém fora da Sakana o executou.
Chamando um, pilotando o outro
O Grok 4.6 está no OrcaRouter pelo preço de tabela da SpaceXAI — $2,00 por milhão de entrada, $0,50 em caso de acerto de cache, $6,00 por milhão de saída — repassado com 0% de margem, de modo que uma alteração de preço do fornecedor chega ao nosso gateway no mesmo dia, e não conforme um cronograma de migração. É compatível com a OpenAI na mesma URL base que o resto do catálogo, o que significa que você pode colocá-lo em uma cadeia de failover ou atrás de uma regra de roteamento condicional em vez de fixar um provedor em um caminho de produção, e pode testá-lo em A/B contra outro modelo sem um segundo contrato. Ele movimentou 46,6 milhões de tokens pelo gateway nos últimos sete dias.
Fugu Max não está no nosso catálogo. Ele chega até você através da própria API compatível com OpenAI da Sakana e de várias plataformas de terceiros, e a empresa diz que uma integração Fugu existente é atualizada para ele com uma única alteração de parâmetro. Como ambos falam o mesmo formato de requisição, uma avaliação que os coloca atrás de uma única flag é uma troca de URL base, não uma reescrita — que é a maneira correta de resolver esse argumento em particular, já que o argumento é sobre tokens por tarefa concluída e apenas sua própria carga de trabalho pode produzir esse número.

Qual comprar
O Grok 4.6 é o padrão defensável. Com uma tabela de preços idêntica à do Fugu Max, ele oferece a você uma janela de contexto de 500K com a qual é possível planejar, uma versão que você pode fixar, quatro níveis de controle de raciocínio, uma posição independente em um índice na 44ª colocação, com um número de custo por tarefa ao lado, e meses de medição por terceiros. Seus custos são específicos e conhecidos: o precipício de reajuste de preços aos 200K, o raciocínio que sempre é cobrado, e um perfil de trabalho em terminal que fica atrás do mercado.
Fugu Max é a aposta mais interessante e, com base nas evidências disponíveis, a menos inspecionável. O argumento de design é sólido — se um coordenador escolher de forma confiável o modelo mais barato capaz de concluir sua tarefa, seu custo mediano por trabalho concluído cai mesmo quando sua tabela de preços não cai. Mas, a US$ 2,00 / US$ 6,00, a tarifa por token não é onde reside a vantagem do Fugu Max; essa tarifa é exatamente a do Grok 4.6. A vantagem tem de vir de gastar menos tokens, e a Sakana não publicou a medição que demonstraria que isso acontece.
Então faça a comparação do jeito que os dois fornecedores estão pedindo. Coloque o Grok 4.6 no seu gateway, chame o Fugu Max por trás de uma feature flag e conte os tokens de saída por tarefa concluída em trabalho parecido com o seu. Se o Fugu Max terminar com menos tokens do que um único modelo à mesma tarifa, o desconto de cache e a coordenação são dinheiro de verdade, e a troca se justifica. Se não terminar, você está pagando tarifas idênticas por um sistema cuja composição pode mudar por baixo de você sem que o número da versão mude.
Para tudo o que você pode decidir neste trimestre sem essa medição, comece pelo modelo que tem um placar.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
