
Fugu Ultra v2 vs Grok 4.6: Cinco Vezes o Preço de Saída, Um Único Benchmark Compartilhado
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Há exatamente um benchmark no qual Fugu Ultra v2 e Grok 4.6 ambos publicam um número, e é o DeepSWE: a Sakana AI relata 74,3 para o Fugu Ultra v2 em seu anúncio de 11 de setembro de 2026, enquanto o material de lançamento da xAI para o Grok 4.6 coloca sua própria pontuação no DeepSWE v1.1 em 65,9%. Isso é uma diferença de 8,4 pontos, e é a única comparação limpa que as duas empresas oferecem. Todo o resto que você poderia alinhar — Chartography e SWEFish da Sakana contra GPQA Diamond e CursorBench do Grok — é medido em instrumentos diferentes por laboratórios diferentes. Então a pergunta honesta não é "qual é mais inteligente". É se a vantagem alegada do Fugu Ultra v2 vale pagar US$ 30 por milhão de tokens de saída, quando o Grok 4.6 cobra US$ 6.
Duas respostas diferentes para o mesmo problema
Grok 4.6 é um único modelo, e é o atual carro-chefe da linha Grok — listado como "Latest" na documentação de desenvolvedor do próprio fornecedor, sucedendo o Grok 4.5 com a mesma janela de contexto de 500.000 tokens, a mesma superfície de entrada de texto/imagem/arquivo e os mesmos preços base. Ele tem um corte de conhecimento de 1 de fevereiro de 2026 e expõe esforço de raciocínio entre low, medium, high e xhigh, com high como padrão. Um detalhe que surpreende as pessoas: o raciocínio não pode ser desativado. Os tokens de raciocínio são cobrados em todas as solicitações, o que faz com que o custo real de saída do Grok 4.6 dependa de quão intensamente ele decide pensar.
Fugu Ultra v2 não é de modo algum um modelo no sentido habitual. É o nível de capacidade máxima da linha de orquestração da Sakana AI — um único endpoint compatível com OpenAI que decompõe uma tarefa e a distribui por um conjunto de outros modelos, alguns de pesos abertos, outros especializados. A formulação da Sakana é que ele alcança resultados de nível de fronteira "sem a dependência indispensável dos modelos de fronteira que orquestra", e afirma claramente que Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra estão excluídos desse conjunto. Você está pagando pela camada de agendamento e por cada token que os subagentes consomem.
Essa distinção não é cosmética. É o que explica inteiramente a existência da diferença de preço, e é a única coisa que torna essa diferença defensável.
As tabelas de tarifas, incluindo a parte que se repete
• Entrada — Fugu Ultra v2 US$ 5,00 por 1M vs. Grok 4.6 US$ 2,00 por 1M. O Fugu é 2,5× antes que quaisquer subchamadas aconteçam.
• Saída — Fugu Ultra v2 $30,00 por 1M vs Grok 4.6 $6,00 por 1M. Uma diferença de 5×, e a que decide a maioria das faturas.
• Entrada em cache — $0.50 por 1M em ambos. Idênticos. Dois fornecedores sem nada mais em comum chegaram ao mesmo preço de leitura de cache, o que faz dos loops de agentes com uso intenso de cache a única carga de trabalho em que os dois são genuinamente comparáveis linha por linha.
• Reajuste de preços para contexto longo — O Grok 4.6 dobra para $4,00 / $12,00 assim que um prompt ultrapassa 200.000 tokens, e o reajuste se aplica à requisição inteira, não apenas ao excedente. A faixa reportada do Fugu Ultra v2 acima de aproximadamente 272.000 tokens de entrada passa para cerca de $10,00 / $45,00, também sobre a requisição inteira. Ambos penalizam prompts longos; o Grok começa a penalizar 72 mil tokens mais cedo.
• Janela de contexto — Grok 4.6 500K tokens vs. Fugu Ultra v2 1M, conforme relatado em listagens de terceiros. A página de anúncio da Sakana não informa nenhum número de contexto, então trate seu 1M como não confirmado pelo fornecedor.
A polêmica do contexto longo tem dois lados e vale a pena fazer as contas. Um prompt de 300 mil tokens custa US$ 4,00 por milhão de tokens de entrada no Grok 4.6 e cerca de US$ 10,00 no Fugu Ultra v2. Um prompt de 150 mil tokens custa US$ 2,00 no Grok e US$ 5,00 no Fugu. O modelo da Sakana é mais caro em qualquer comprimento de prompt — a única questão é com que frequência ele precisa ser chamado.

O argumento para pagar 5× pela produção
O argumento a favor de um orquestrador não é que ele seja mais barato por token. É que ele precisa de menos tentativas, e que os tokens que ele gasta com coordenação são mais baratos do que os tokens que você gastaria falhando.
Esse é um argumento válido, e a Sakana está deixando isso explícito: o Fugu Ultra v2 é voltado para trabalhos complexos de várias etapas — pesquisa autônoma, desenvolvimento full-stack — nos quais o modo de falha de um único modelo é descarrilar no meio de uma execução longa. Se uma taxa de saída de US$ 30 faz você concluir uma tarefa na primeira passagem em vez da terceira, o prêmio por token é irrelevante.
Há evidências de apoio vindas do próprio lado do fornecedor, embora sejam favoráveis ao fornecedor e devam ser lidas como tal. O material de lançamento do Grok 4.6 da xAI cita cerca de 53 turnos e aproximadamente 0,5 bilhão de tokens de entrada para resolver tarefas de longo horizonte, contra aproximadamente 103 turnos e 2,0 bilhões de tokens de entrada de um modelo de fronteira concorrente — um argumento de que o próprio Grok é econômico por tarefa mesmo a um preço baixo por token. Ambas as empresas estão fazendo o mesmo movimento: afastando você da tabela de preços e em direção ao custo por trabalho concluído.
O que significa que o número decisivo é aquele que nenhum fornecedor divulga, e que você mesmo precisa medir: tokens consumidos, do início ao fim, em uma tarefa parecida com a sua.
Onde cada um é genuinamente fraco
O ponto fraco divulgado do Grok 4.6 é o trabalho em terminal. Sua pontuação no Terminal-Bench v3.0 está em 26%, bem atrás do topo do segmento, mesmo que o mesmo modelo registre uns muito mais fortes 88,4% no Terminal-Bench v2.1, mais antigo — são testes diferentes, e misturá-los é um erro que você verá em muitas matérias. Ele também tem a maior pontuação no GPQA Diamond de sua coorte, com 94,9%, mas o GPQA Diamond foi retirado do índice da Artificial Analysis por estar saturado, então uma pontuação alta ali já não discrimina entre modelos de ponta como fazia há um ano.
Do lado independente, a Artificial Analysis atribui ao Grok 4.6 uma pontuação de 44 em seu Índice de Inteligência v4.3, classificado em #20 de 200, com um custo por tarefa de US$ 1,86. O número frequentemente divulgado de 61 vem de uma escala de índice superada e não deve ser citado sem que se diga qual versão o produziu.
O ponto fraco do Fugu Ultra v2 é a verificação. Na data da publicação, nada do que a Sakana alegou sobre ele — os cinco resultados de melhor desempenho ou empatados em primeiro, a pontuação de 48,3 no Chartography contra 27,3 do Opus 5 e 29,5 do Fable 5, e os 74,3 no DeepSWE — foi reproduzido de forma independente. Também não há nenhum número publicado de latência ou vazão, o que importa mais para um orquestrador do que para um modelo único, porque seu tempo de resposta depende inteiramente do que ele decide chamar. Para o Fugu Ultra anterior, testadores relataram publicamente execuções que se estendiam por cerca de 30 minutos; esse é o modelo de junho de 2026, não o v2, mas é o modo de falha a ser testado antes de você comprometer um caminho de produção.

Uma nota sobre o nome do fornecedor
Um detalhe que vale a pena saber antes de procurar o Grok 4.6 em um console de desenvolvedor: o modelo é consistentemente chamado Grok 4.6, mas a marca do fornecedor em torno dele está em constante mudança. A própria documentação da xAI agora traz o nome SpaceXAI, uma mudança que a maior parte da cobertura de lançamento ainda não acompanhou. Os identificadores do modelo e a superfície da API permanecem inalterados — o Grok 4.6 é um modelo OpenAI Responses de primeira classe e se encaixa em loops existentes de chamada de ferramentas sem uma camada de tradução — mas, se você estiver procurando uma ficha do modelo e a marca parecer errada, não é culpa sua.
Chamar qualquer um destes na prática
O Grok 4.6 está no OrcaRouter à tarifa do próprio provedor — $2,00 por milhão de tokens de entrada e $6,00 por milhão de tokens de saída, repassados sem nenhum markup, então uma mudança de preço do fornecedor chega aqui no mesmo dia, em vez de seguir um cronograma de migração. Ele é compatível com OpenAI na mesma URL base de todo o resto do catálogo, o que significa que você pode colocá-lo atrás de uma cadeia de fallback ou de uma regra de roteamento em vez de codificá-lo diretamente, e pode fazer testes A/B dele contra outro modelo sem um segundo contrato ou alteração no código.
O Fugu Ultra v2 não é roteado por nós. Ele está disponível na própria API compatível com OpenAI da Sakana AI, e a empresa afirma que uma integração existente do Fugu migra para ele com uma única alteração de parâmetro. Se você quiser comparar os dois na sua carga de trabalho, a opção mais barata é deixar o Grok 4.6 no seu gateway e chamar o Fugu Ultra v2 diretamente da Sakana por trás de uma feature flag — os dois usam o mesmo formato de requisição, então o mesmo harness de testes funciona nos dois.

O veredito
Grok 4.6 é o padrão racional para a maioria das equipes, e não chega perto em preço. A $2.00 / $6.00 com leitura de cache de $0.50 e uma janela de 500K, ele lida com raciocínio em documentos longos, agentes de programação e trabalho com arquivos multimodais a um quinto da taxa de saída do Fugu Ultra v2, e é avaliado de forma independente e submetido a benchmarks independentes. Sua exposição é o comprimento do prompt — o limite de 200K dobra toda a requisição — e ciclos de agentes com uso intenso de terminal, onde suas pontuações publicadas não são competitivas.
Fugu Ultra v2 só vale o seu preço premium se você tiver um tipo específico de carga de trabalho: tarefas longas, com várias etapas e com muita autonomia, em que um único modelo tende a descarrilar, e em que você também quer a propriedade arquitetural que a Sakana está vendendo — um nível de capacidade que não depende de nenhum fornecedor de ponta continuar disponível ou continuar barato. Isso é algo legítimo de se desejar. Mas é uma afirmação, ainda não uma medição, e a lacuna do DeepSWE que faz com que pareça credível é um único benchmark de um único fornecedor no dia do lançamento.
Se você não consegue dizer quais das suas tarefas falham atualmente na segunda ou terceira tentativa, ainda não tem o número que justificaria a diferença de preço. Meça isso primeiro. As tabelas de preços já dizem todo o resto.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
