Um card de título hero para Fugu Ultra v2 vs Claude Opus 5, com o subtítulo 'Mesmo preço de entrada, duas apostas diferentes', selos em formato de pílula com os dizeres 'US$ 5,00 de entrada para ambos', 'Chartography 48,3 vs 27,3' e 'contexto de 1M', uma linha de rodapé 'Sakana AI vs Anthropic - setembro de 2026', e o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Fugu Ultra v2 vs Claude Opus 5: mesmo preço de entrada, duas apostas diferentes

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anth​ropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.

A coincidência que molda tudo

Comece pelo que os dois produtos têm em comum, porque isso é mais do que o preço de destaque.

• Preço de entrada — Fugu Ultra v2 $5,00 por 1M de tokens vs Claude Opus 5 $5,00 por 1M de tokens

• Preço de saída — Fugu Ultra v2 $30,00 por 1M de tokens vs Claude Opus 5 $25,00 por 1M de tokens

• Entrada em cache — Fugu Ultra v2 $0.50 por 1M acima da tarifa base vs Claude Opus 5, que precifica o cache como um desconto de até 90% sobre a entrada em cache

• Contexto — Fugu Ultra v2 1M tokens, com taxas dobrando acima de 272K vs Claude Opus 5 1M tokens, fixas

• Teto de saída — Fugu Ultra v2 não publicado como um valor único vs Claude Opus 5 128K tokens

• Disponibilidade — Fugu Ultra v2 não comercializado na UE/EEE vs Claude Opus 5 geralmente disponível sob os termos padrão da API

• Evidências — benchmarks do Fugu Ultra v2 relatados pelo fornecedor, ainda sem avaliação independente, versus benchmarks do Claude Opus 5 relatados pelo fornecedor, além de meses de posições em rankings de terceiros

É nessa última linha que a disputa realmente vira. Com o mesmo preço de entrada, você está escolhendo entre um sistema cujas pontuações você precisa aceitar pela fé e um modelo cujas pontuações outras pessoas reproduziram. O limite de 272K agrava isso: acima desse limite, a tarifa de entrada do Fugu Ultra v2 dobra para US$ 10, e a de saída para US$ 45, enquanto a tarifa do Claude Opus 5 não muda. Para execuções de agentes com contexto longo — exatamente a carga de trabalho para a qual o Fugu Ultra v2 foi criado —, a vantagem de preço do valor anunciado mais baixo desaparece justamente onde o sistema deveria brilhar.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

O que cada um realmente é

Claude Opus 5 is Anth​ropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anth​ropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.

O Fugu Ultra v2 não é isso, e a diferença não é cosmética. Ele é um coordenador — um pequeno modelo treinado, com cerca de 7 bilhões de parâmetros, segundo relatos, que lê seu pedido, monta uma equipe de agentes, atribui os papéis de Thinker, Worker e Verifier a partir do trabalho TRINITY da Sakana e sintetiza uma resposta final. Os modelos subjacentes não são divulgados, as decisões de roteamento não são expostas por design e, para o nível Ultra, o pool é fixo: você não pode excluir um fornecedor. A própria definição da Sakana para a versão 2 é que o corte de treinamento passou para 28 de agosto de 2026 e a composição do pool mudou — especificamente para excluir Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra.

Essa exclusão é o detalhe mais revelador do comunicado. O Fugu Ultra v2 está alegando vitórias em benchmarks sobre os três modelos mais fortes disponíveis, ao mesmo tempo que confirma que não chama nenhum deles. Seja o que for que o pool contenha, não é o topo do mercado segundo a própria contabilidade da Sakana. O argumento é que a coordenação supera a capacidade. Essa é uma tese real e, em tarefas verificáveis com um verificador barato, é uma tese com evidências por trás. Não é a mesma afirmação que "este sistema é mais inteligente que o Claude Opus 5", e o placar está organizado de modo que os dois sejam fáceis de confundir.

O placar que a Sakana escolheu

Todos os números abaixo são da própria avaliação da Sakana do Fugu Ultra v2. Os números do Claude Opus 5 são conforme medidos pela Sakana na mesma comparação, exceto quando indicado. Nenhuma parte independente reproduziu a coluna do Fugu e, até o momento desta redação, não há entrada do Artificial Analysis para qualquer modelo Fugu.

• Chartography — Fugu Ultra v2 48.3 vs Claude Opus 5 27.3 — segundo o fornecedor, uma diferença de 21 pontos

• DeepSWE — Fugu Ultra v2 74,3 vs. nenhum valor publicado para o Claude Opus 5 na mesma tabela — informado pelo fornecedor

• Posicionamento em benchmarks — Fugu Ultra v2 melhor ou empatado em primeiro em cinco de oito, entre os dois primeiros em sete de oito — segundo o fornecedor

• SWE-bench Verified — sem valor para o Fugu Ultra v2 vs Claude Opus 5 96,0% — relatado pela Anthropic

• SWE-bench Pro — sem valor para o Fugu Ultra v2 vs Claude Opus 5 79,2% — reportado pela Anthropic

• ARC-AGI 3 — sem valor para o Fugu Ultra v2 vs Claude Opus 5 ~30,2% — relatado pela Anthropic

Leia isso como um panorama, e não como um ranking. A Sakana publicou um placar de oito benchmarks no qual vence cinco, e os resultados mais fortes publicamente documentados do Claude Opus 5 — as linhas do SWE-bench, o ARC-AGI 3 — simplesmente não estão nele. Isso não é uma acusação de má-fé; é o que um placar de fornecedor costuma parecer, inclusive o de qualquer fornecedor. Mas isso significa que você não pode concluir, a partir do lançamento, que o Fugu Ultra v2 supera o Claude Opus 5 em engenharia de software, porque os dois sistemas não foram medidos nas mesmas linhas com frequência suficiente para se afirmar isso. Na única linha em que ambos aparecem e ambos os números são públicos — Chartography —, o Fugu Ultra v2 alega uma grande vitória. Nas linhas mais amplas de raciocínio e programação, apenas um lado publicou.

A two-column scoreboard for Fugu Ultra v2 vs Claude Opus 5 titled 'Fugu Ultra v2 vs Claude Opus 5 - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Chartography 48.3, Evidence vendor-reported only, Weights closed, pool undisclosed, Context 1M, doubles past 272K. Right column Claude Opus 5: Input price $5.00 / 1M, Output price $25.00 / 1M, Chartography 27.3, Evidence independent evals, Weights closed, single model, Context 1M, flat. Footer 'Fugu figures vendor-reported by Sakana; Opus 5 rows as measured by Sakana, plus Anthropic-reported evals.', with the OrcaRouter logo bottom-right.

Custo por tarefa, não custo por token

A conta de tokens de um orquestrador não é a sua taxa por token. O Fugu Ultra v2 instancia agentes, cada um contribuindo com tokens de raciocínio e de saída, e o próprio coordenador produz texto de síntese. O FAQ de preços da Sakana faz um compromisso genuinamente útil aqui — você é cobrado a uma única tarifa combinada com base no modelo de ponta envolvido, e adicionar agentes não multiplica a conta — o que elimina a multiplicação de fan-out no pior caso que torna configurações ingênuas de múltiplos agentes caras. Mas isso não elimina o volume. A quantidade de tokens de saída cobrada ainda é uma função de quantos agentes foram executados e de quanto eles escreveram, e a US$ 30 por milhão esse volume é a variável que você não consegue prever na página de preços.

O formato de custo do Claude Opus 5 é o inverso. Uma chamada, um modelo, um botão de esforço que você controla, e uma tarifa de saída de US$ 25, com processamento em lote disponível com 50% de desconto para trabalhos que não exigem tempo real. Você consegue prever isso. Para uma carga de trabalho que você executa dez mil vezes por dia, a previsibilidade vale muito mais do que uma margem de benchmark em uma tarefa de leitura de gráficos.

This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anth​ropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.

Onde o Fugu Ultra v2 realmente vence

Dê ao sistema o que é devido. O resultado do Chartography, se se mantiver, é o tipo de vitória que os modelos individuais têm dificuldade em falsificar: o raciocínio visual sobre documentos estruturados recompensa tentar uma leitura, verificá-la contra o documento e tentar novamente — que é exatamente para isso que serve um papel de Verificador. A mesma lógica aplica-se ao Toolathon e ao DeepSWE, onde a resposta pode ser testada em vez de discutida. Os estudos de caso publicados pela Sakana inclinam-se na mesma direção: uma execução do AutoResearch com 123 experiências ao longo de quatorze horas numa H100, um solucionador de cubo de Rubik em Python puro que terminou todos os 300 cubos embaralhados, onde duas linhas de base de ponta anonimizadas falharam completamente, uma íris mecânica de CAD que realmente abre e fecha. Estes são exemplos selecionados pelo fornecedor com linhas de base anonimizadas, pelo que provam menos do que aparentam. Mas o padrão é consistente e aponta para uma categoria real: tarefas em que a correção é verificável e a parte difícil é a persistência.

Há também um argumento estrutural que nada tem a ver com benchmarks. O Claude Opus 5 é o modelo de um fornecedor, sujeito às decisões de precificação, ao cronograma de descontinuação e à política desse mesmo fornecedor. O Fugu Ultra v2 foi projetado para sobreviver a qualquer uma dessas mudanças isoladamente, e a Sakana deixa explícito que é exatamente esse o ponto — aprisionamento a fornecedor, revogações de API, controles de exportação. Num mercado em que modelos foram retirados de regiões com pouca antecedência, isso não é hipotético. É um hedge, e hedges custam dinheiro: US$ 5 a mais por milhão de tokens de saída é, aproximadamente, o preço desse hedge.

O veredito

Claude Opus 5 vence a decisão que a maioria das equipes realmente está tomando. Tem meses de avaliação independente por trás, uma janela de 1M tokens que não dobra de preço no meio do seu documento, um teto de saída de 128K, um preço publicado que você pode prever, um botão de esforço que permite comprar raciocínio só quando a tarefa merece, e resultados de terceiros nos benchmarks exatos — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — que as equipes de agentes e de código mais se importam. Fugu Ultra v2 vence uma questão mais restrita e mais interessante: se um coordenador com um conjunto menor pode superar um modelo de ponta em tarefas nas quais a resposta pode ser verificada. O próprio placar da Sakana diz que sim em cinco de oito linhas, e a exclusão do conjunto mostra que a vitória veio sem os três melhores modelos do mundo.

If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anth​ropic's list price with the provider's rate passed through untouched.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the endpoint list for /v1/chat/completions and /v1/messages, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the capability tags Vision, Tools, JSON and Reasoning, the 1M token context and 128K max output, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente