
Fugu Ultra v2 vs Gemini 3.1 Pro: o adversário que já pode estar dentro da máquina
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Existe uma versão da comparação Fugu Ultra v2 vs Gemini 3.1 Pro em que o Gemini vence independentemente do rumo do benchmark — porque pode estar fazendo parte do trabalho. O sistema de orquestração da Sakana AI, lançado em 11 de setembro de 2026, não divulga quais modelos coordena; o conjunto relatado do Fugu Ultra de junho incluía o Gemini 3.1 Pro, entre outros, e a versão 2.0 só nos diz o que removeu, nomeando Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra como excluídos. O Gemini 3.1 Pro do Google é um único modelo multimodal de fronteira com contexto de 1 milhão de tokens que lida com texto, imagens, PDFs, áudio e vídeo, com disponibilidade geral desde maio de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 12,00 por milhão de tokens de saída. Um deles é um modelo que você pode inspecionar. O outro é um sistema cujas vitórias em benchmarks podem passar pelo primeiro, e nenhum dos fornecedores dirá se isso acontece.
O que cada sistema realmente é
Gemini 3.1 Pro é legível de uma maneira que se tornou rara entre os lançamentos de fronteira. É um transformer esparso de mistura de especialistas do Google DeepMind, lançado pela primeira vez em prévia em 19 de fevereiro de 2026, com uma fonte datando a disponibilidade geral para maio de 2026 — nossa própria listagem o apresenta sob o ID de modelo de prévia. Ele possui uma janela de entrada de 1M de tokens e um teto de saída de 65K tokens, aceita texto, imagens, PDFs, áudio, vídeo e código, e expõe um controle de raciocínio de três níveis — baixo, médio ou alto — com alto como padrão da API. O Google relata 77,1% no ARC-AGI-2, mais que o dobro dos 31,1% da geração anterior; 94,3% no GPQA Diamond; 80,6% no SWE-bench Verified; 68,5% no Terminal-Bench 2.0; 85,9% no BrowseComp; e 44,4% no Humanity's Last Exam sem ferramentas, subindo para 51,4% com busca e execução de código. Esses são números do fornecedor. Seu corte de conhecimento é janeiro de 2025, o que vale sinalizar se seu trabalho depende de eventos recentes.
Fugu Ultra v2 é um coordenador. É um modelo treinado, com cerca de 7B parâmetros segundo relatos, que lê uma solicitação, monta uma equipe de agentes com os papéis Thinker, Worker e Verifier extraídos da pesquisa TRINITY da Sakana e sintetiza uma resposta por trás de um endpoint compatível com OpenAI. Ele não tem uma lista de modalidades publicada própria — tudo o que consegue ver, ele vê porque um modelo em seu pool consegue vê-lo. Seu contexto é de 1M tokens, com um salto acentuado de preços em 272K, onde as tarifas dobram para US$ 10 de entrada e US$ 45 de saída. Seu limite máximo de saída não é publicado. Seu pool não é divulgado, suas decisões de roteamento são "não expostas por design", e, para o nível Ultra, o pool é fixo, portanto você não pode excluir um provedor.
Essa assimetria é o confronto inteiro. O Gemini 3.1 Pro é um componente que você pode comprar diretamente e analisar racionalmente. O Fugu Ultra v2 é uma montagem cujas peças você não consegue ver e cujas alegações de benchmark mais fortes podem ser, em parte, resultados do próprio Gemini combinados com os de outra pessoa.

A comparação onde os dois se sobrepõem
Muito pouca da evidência publicada alinha os dois sistemas na mesma linha. Os números da Gemini 3.1 Pro abaixo são da própria Google; os da Fugu Ultra v2 são da própria Sakana; quando um agregador de terceiros publica uma linha compartilhada, ela é marcada e vem com uma ressalva de que é indicativa, e não decisiva.
• Raciocínio multimodal (CharXiv, linha compartilhada) — Fugu Ultra v2 86,6% vs Gemini 3.1 Pro 80,2%, segundo o BenchLM, que classifica a categoria como direcional e se recusa a nomear um vencedor
• TerminalBench 2.1 — nenhum valor do Fugu Ultra v2 v2.0 vs. Gemini 3.1 Pro; nenhum valor publicado comparável; o Fugu Ultra de junho reportou 82,1% contra 70,3% do Gemini 3.1 Pro em agregação de terceiros
• SWE-Bench Pro — não há número publicado comparável para o Fugu Ultra v2 v2.0 vs. Gemini 3.1 Pro; o Fugu Ultra de junho reportou 73,7% contra 54,2% do Gemini 3.1 Pro
• ARC-AGI-2 — sem número para o Fugu Ultra v2 vs. Gemini 3.1 Pro 77,1%, segundo o fornecedor
• Humanity's Last Exam — sem número do Fugu Ultra v2 v2.0 vs. Gemini 3.1 Pro: 44,4% sem ferramentas, 51,4% com, segundo o fornecedor
• Cobertura de modalidades — Fugu Ultra v2 herda o que seu pool suportar, não divulgada vs. Gemini 3.1 Pro: texto, imagem, PDF, áudio, vídeo e código, documentada
• Preço de entrada / saída — Fugu Ultra v2 US$ 5,00 / US$ 30,00 por 1M, dobrando acima de 272K vs. Gemini 3.1 Pro US$ 2,00 / US$ 12,00 por 1M até 200K, US$ 4,00 / US$ 18,00 acima de 200K, entrada em cache US$ 0,20 / US$ 0,40
• Contexto e saída — Fugu Ultra v2 com contexto de 1M, teto de saída não divulgado vs Gemini 3.1 Pro com entrada de 1M, saída de 65K
• Pesos e acesso — Fugu Ultra v2 fechado, UE/EEE excluídos vs Gemini 3.1 Pro proprietário, mas amplamente disponível em todas as superfícies Google
A linha multimodal é a que deve ser tratada com cuidado, porque é a mais citada e a menos sólida. A agregação CharXiv do BenchLM coloca o Fugu Ultra v2 à frente por 6,4 pontos normalizados — e a mesma página afirma claramente que linhas direcionais nunca recebem um vencedor, que o Gemini não teve resultados medidos nas categorias agêntica, de codificação, de conhecimento ou multilíngue, e que o Fugu não teve nenhum em matemática ou multilíngue. Uma categoria em que apenas um lado foi medido na maioria das linhas não pode produzir um veredito. Se você não levar mais nada desta comparação, leve isto: especificamente no trabalho multimodal, as evidências publicadas não sustentam uma conclusão em nenhum dos sentidos, e a única linha que existe não é, de forma explícita, um resultado consolidado.
A possibilidade que muda o quadro
A Sakana não vai dizer o que está no pool. Isso é uma escolha de design documentada, não um descuido — o FAQ diz que as informações de roteamento não são expostas por design, e não há mecanismo para inspecioná-las. O que sabemos da geração de junho é que os membros do pool relatados incluíam o Gemini 3.1 Pro ao lado de outros modelos de fronteira. A versão 2.0 mudou o pool, e a Sakana descreveu a mudança apenas por subtração: Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra estão fora. Nada no comunicado diz que o Gemini ainda está dentro.
Se o Gemini 3.1 Pro estiver no pool, decorrem três consequências, e todas as três são práticas, não filosóficas. Primeiro, parte do desempenho multimodal do Fugu Ultra v2 é o desempenho do Gemini, combinado com o de outros modelos — o que significa que você está pagando um sobrepreço de coordenação além de uma taxa por token que poderia pagar diretamente. Segundo, o Fugu Ultra v2 a US$ 30 por milhão de tokens de saída, contra o Gemini 3.1 Pro a US$ 12, é um sobrepreço pela montagem, não pela capacidade bruta; se sua tarefa é uma única pergunta multimodal, o Gemini responde mais barato, e você consegue ver exatamente qual modelo respondeu. Terceiro, e mais útil, o benchmark honesto de um orquestrador não é “ele supera seus componentes?”, mas “ele supera seu melhor componente quando você o usa sozinho?”. A arquitetura da Sakana baseia-se na alegação de que ele supera seu melhor componente, em tarefas verificáveis. Vale a pena testar essa alegação na sua própria carga de trabalho antes de aceitá-la com base em um benchmark de leitura de gráficos.
Há uma versão em que a resposta é não e o orquestrador ainda assim conquista seu lugar. Se o Gemini estiver no pool e a pontuação de Chartography do Fugu Ultra v2, de 48,3 contra os 27,3 do Claude Opus 5, se sustentar, então o que a Sakana construiu é uma camada de coordenação que, de forma confiável, extrai mais do mesmo modelo do que você obtém ao chamá-lo uma vez. Isso é um produto de verdade, e a única questão em aberto é se a margem cobre o preço. Ninguém publicou o experimento.

Onde estão as arestas honestas
As vantagens do Gemini 3.1 Pro são concretas. Ele custa cerca de dois quintos do preço do Fugu Ultra v2 na entrada e na saída, e, ao contrário do Fugu, suas tarifas não dobram após um limite de contexto — o degrau em 200K é mais suave do que o penhasco de 272K. Ele documenta suas modalidades em vez de herdá-las, o que significa que trabalho com áudio e vídeo é um recurso suportado, e não uma esperança. Ele tem um teto de saída publicado. Ele está disponível por meio das próprias superfícies do Google e, assim como os outros modelos com os quais o Fugu Ultra v2 é comparado, ele pode ser chamado no OrcaRouter — como google/gemini-3.1-pro-preview, ao preço de tabela do Google com 0% de markup, então uma mudança de preço do Google chega à mesma chave no mesmo dia em que é anunciada.
As vantagens do Fugu Ultra v2 são mais restritas e reais. Ele ataca um problema difícil mais de uma vez, com um papel de Verifier verificando o trabalho, e é por isso que suas alegações mais fortes se baseiam em benchmarks em que a correção é verificável — Chartography, DeepSWE, Toolathon — e não na recuperação de conhecimento. Os estudos de caso publicados pela Sakana seguem a mesma direção: uma íris mecânica de CAD que abre e fecha corretamente onde outros modelos deixaram lacunas e ligações fracas; um solucionador de cubo de Rubik em Python puro que terminou todos os 300 cubos embaralhados, enquanto duas baselines de fronteira anonimizadas travaram completamente. Essas baselines são anonimizadas e escolhidas pelo fornecedor, então trate-as como ilustração, não como prova. Mas o padrão é consistente em todo o lançamento, e descreve uma capacidade genuína que uma única chamada de modelo não tem: persistência em um problema até que a resposta passe em uma verificação.
Considere também as restrições. O Fugu Ultra v2 não é vendido na UE nem no EEE, e a Sakana declara explicitamente que está trabalhando para alcançar a conformidade com o RGPD. O Gemini 3.1 Pro não tem essa restrição e tem um histórico muito mais longo de avaliação independente.

O veredito
Para a maioria dos trabalhos multimodais, o Gemini 3.1 Pro é a escolha certa, e não é nem de perto. É mais barato por token, mais barato por documento, tem documentação para áudio e vídeo, tem um teto de contexto que não dobra a sua fatura no meio da execução e — a parte que mais importa aqui — você consegue ver o que lhe respondeu. Se você precisa de um único modelo para ler um PDF, assistir a um clipe e responder a uma pergunta, não há argumento para encaminhar isso através de um pool não divulgado a duas vezes e meia o preço de saída.
O Fugu Ultra v2 é a escolha certa para um formato de trabalho específico e muito mais restrito: tarefas de longo horizonte com uma resposta verificável, em que tentar resolver um problema de três maneiras e verificar o resultado é melhor do que tentar uma vez, e em que o ganho marginal de qualidade vale o múltiplo. Ele fica totalmente fora de consideração se você tiver usuários da UE ou do EEE no escopo.
A pergunta incômoda que o confronto deixa em aberto é aquela que ninguém mediu. Se o Gemini 3.1 Pro está dentro do pool — e a única resposta honesta hoje é que a Sakana não disse que não está — então parte do que você está comprando com o Fugu Ultra v2 é o Gemini 3.1 Pro com uma camada de coordenação por cima, a um preço que implica que a camada vale aproximadamente duas vezes e meia o modelo. Isso bem pode ser verdade. A arquitetura da Sakana foi construída para tornar isso verdade. Mas é uma hipótese com um placar do fornecedor por trás dela e nenhum teste independente, e até que alguém faça esse teste, o modelo que você consegue ver é o que você consegue defender.
