Um cartão de título hero para o Fugu Ultra v2, intitulado “Fugu Ultra v2”, com o subtítulo “O pool ficou menor e a pontuação subiu”, selos em pílula com os textos “Chartography 48.3”, “DeepSWE 74.3” e “$5 / $30 por 1M”, uma linha de rodapé “Sakana AI – lançado em 11 de setembro de 2026”, e o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

Sakana Fugu Ultra v2, explicado: o pool ficou menor e a pontuação aumentou

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Fugu Ultra v2 é um tipo estranho de atualização: a Sakana AI o lançou em 11 de setembro de 2026 com um conjunto de modelos que não contém mais Claude Fable 5, Claude Fable 5.1 nem GPT-6 Astra — três dos sistemas mais fortes disponíveis atualmente — e ainda afirma superar todos os três. O novo carro-chefe de nível de qualidade do laboratório de Tóquio, lançado no mesmo dia que um irmão mais barato chamado Fugu Max, é o melhor ou está empatado em primeiro em cinco de oito benchmarks na avaliação da própria Sakana, incluindo 48,3 em Chartography contra 27,3 do Claude Opus 5 e 29,5 do Claude Fable 5, e 74,3 em DeepSWE. Nenhum desses números foi reproduzido de forma independente, e ainda não há página do Artificial Analysis para nenhum modelo Fugu. Essa lacuna é a história: o que estão pedindo que você compre é uma camada de coordenação cujo argumento de venda inteiro é que ela não precisa dos melhores modelos para produzir as melhores respostas.

A Sakana AI foi fundada em 2023 por Llion Jones, coautor do artigo Transformer, e David Ha. A linha Fugu foi lançada em junho de 2026 como um sistema multiagente entregue como um único modelo: você chama um endpoint compatível com a OpenAI, e por trás dele um coordenador treinado decompõe a solicitação, cria agentes e sintetiza o resultado. A pesquisa é real e publicada — TRINITY (arXiv 2512.04695) evoluiu um coordenador leve que atribui papéis de Pensador, Trabalhador e Verificador; Conductor (arXiv 2512.04388) aprendeu coordenação em linguagem natural entre agentes; o relatório técnico do Fugu está em arXiv 2606.21228. O que a Sakana nunca publicou é aquilo que todos realmente querem: a identidade dos modelos no pool, e as decisões de roteamento por tarefa.

O que realmente mudou em relação ao Fugu Ultra de junho?

A Versão 2.0 é uma atualização pontual cerca de onze semanas após a original, não uma nova arquitetura. A própria descrição do fornecedor é que o Fugu Ultra v2 e o Fugu Max são "a mesma arquitetura central de orquestração" ajustada para duas missões diferentes: o Max empurra a fronteira de custo-desempenho para baixo, o Ultra empurra a capacidade máxima para cima. O ID do modelo é fugu-ultra-v2.0, e a Sakana diz que migrar de um Fugu anterior é uma alteração de parâmetro de uma linha, sem migração de SDK — o que é a coisa mais amigável ao consumidor nesse lançamento.

As mudanças substantivas são as duas que servem de moldura. Primeiro, o corte de treinamento passou para 20260828, então o coordenador foi recalibrado em relação à geração atual de modelos de fronteira. Segundo, e muito mais interessante, a composição do pool mudou de uma forma que a Sakana optou por divulgar: Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra estão explicitamente excluídos. O argumento da Sakana é que isso prova que as pontuações não dependem de um único modelo de fronteira proprietário, o que importa se a sua preocupação for lock-in de fornecedor, revogação de APIs ou um modelo desaparecer por trás de controles de exportação.

Há uma consequência de segunda ordem sobre a qual a Sakana não se detém. Se o conjunto exclui os três modelos disponíveis mais fortes, então as comparações de benchmark com o Fable 5 e o Fable 5.1 estão sendo feitas com sistemas que o orquestrador não conseguiria chamar mesmo se quisesse. A comparação é legítima — é uma afirmação sobre a arquitetura, não sobre acesso —, mas não é um teste em condições iguais de quem tem o melhor modelo. É um teste de se a coordenação supera a capacidade bruta. Essa é uma pergunta genuinamente interessante. Simplesmente não é a pergunta que o placar sugere à primeira vista.

A single-column scoreboard for Fugu Ultra v2 titled 'Fugu Ultra v2 - the scoreboard' listing Best or joint-best 5 of 8 benchmarks, Chartography 48.3, DeepSWE 74.3, Agent pool excludes Fable 5, Fable 5.1, GPT-6 Astra, Price $5.00 / $30.00 per 1M, and Independent evaluation none published, with a footer 'All figures vendor-reported by Sakana AI, September 2026; no independent evaluation.' and the OrcaRouter logo in the bottom-right corner.

Os números, e quem os produziu

Todos os números desta seção são reportados pelo fornecedor. A Sakana não divulgou nenhum harness de avaliação, nenhuma grade de pontuações por tarefa e nenhuma receita de reprodução, e o design de orquestração torna a replicação independente mais difícil, não mais fácil: reproduzir uma pontuação exige acesso a todos os modelos do pool nas mesmas versões e com a mesma topologia, e, por design, a topologia varia a cada solicitação.

• Cartografia de gráficos (raciocínio visual sobre gráficos e documentos estruturados) — Fugu Ultra v2 48,3, Claude Opus 5 27,3, Claude Fable 5 29,5 — informado pelo fornecedor

• DeepSWE (engenharia de software do mundo real) — Fugu Ultra v2 74,3 — relatado pelo fornecedor, diz-se que supera modelos que custam de três a cinco vezes mais por token

• Melhor colocação, isolada ou empatada — cinco de oito benchmarks: GDP.pdf, Chartography, SWEFish, DeepSWE e Toolathon — relatado pelo fornecedor

• Colocação entre os dois primeiros — sete de oito benchmarks — relatado pelo fornecedor

• Fugu Ultra anterior (junho de 2026, para referência de escala) — LiveCodeBench 93,2, GPQA-Diamond 95,5, TerminalBench 82,1, SWE-Bench Pro 73,7 — informado pelo fornecedor

A linha Chartography merece a ênfase que está recebendo, porque é a única categoria em que a diferença para um modelo de ponta atual e identificado não é marginal. Uma diferença de 21 pontos em relação ao Claude Opus 5 num benchmark de raciocínio visual é o tipo de número que costuma aparecer num ranking independente em questão de dias. Até o momento em que escrevo, nenhum apareceu. Trate a linha como uma hipótese com um valor em dólares atrelado, não como um resultado consolidado.

Preços: inalterados desde junho e francamente caros na saída

O Fugu Ultra v2 custa US$ 5 por milhão de tokens de entrada, US$ 30 por milhão de tokens de saída e US$ 0,50 por milhão de tokens de entrada em cache. Acima de 272.000 tokens de contexto, esses valores passam a ser US$ 10, US$ 45 e US$ 1,00, respectivamente. O Fugu Max tem uma estrutura completamente diferente: US$ 2 de entrada, US$ 6 de saída, US$ 0,25 em cache, com preço fixo independentemente do comprimento do contexto, além de US$ 0,007 por pesquisa na web ou chamada de fetch.

Duas coisas nessa tabela de preços merecem uma leitura atenta. A primeira é que a saída é seis vezes a entrada — uma proporção agressiva que precifica a verbosidade do modelo, e orquestração é um negócio verboso. Um coordenador que cria agentes e sintetiza as respostas deles emite muitos tokens, e você paga por todos eles a US$ 30 por milhão. A alegação de eficiência da Sakana diz respeito ao pool subjacente, não à quantidade de texto que o sistema produz em seu nome, e esses são números diferentes. Faça o orçamento com base na contagem observada de tokens, não na tarifa divulgada.

O segundo é o penhasco de 272K. Dobrar a taxa por token acima de um limite é uma forma legítima de precificar trabalho com contexto longo, mas significa que o custo efetivo de uma execução de agente com contexto longo não é o número na página de preços. Se sua carga de trabalho estiver próxima do limite, a aritmética muda substancialmente em qualquer um dos lados dele.

Os níveis de assinatura do Fugu — US$ 20 Standard, US$ 100 Pro, US$ 200 Max por mês, com franquias de 10x e 20x — todos incluem acesso ao Fugu, Fugu Ultra e Fugu Max. A Sakana também precifica o modelo Fugu base pelo nível mais alto presente no conjunto para uma determinada solicitação, e declara claramente que adicionar mais agentes não multiplica a conta. Isso é uma diferença real em relação ao modelo de custo de fan-out que você obteria ao chamar vários modelos de fronteira por conta própria.

O que a Sakana não vai te dizer

Pergunte quais modelos responderam à sua pergunta e a FAQ é direta: "esta informação de encaminhamento não é exposta por design." Os pools Ultra e Max são fixos, por isso não pode desativar um fornecedor; apenas o modelo base Fugu suporta exclusões por modelo nas configurações da consola. Os clientes empresariais podem negociar configurações personalizadas.

Essa opacidade é o cerne das críticas que a linha Fugu tem atraído desde junho, e é uma crítica justa, não hostil. Quando um orquestrador obtém uma boa pontuação ao combinar os modelos de outros laboratórios, a pontuação pertence ao sistema — o que é algo real e defensável de se vender —, mas não se transfere para nenhum modelo individual, e não pode ser auditada. Os revisores fizeram o ponto sem rodeios: o Fugu não superou o carro-chefe, ele contratou o carro-chefe. Em tarefas verificáveis com um verificador barato, como um benchmark de programação com uma suíte de testes, um comitê realmente pode superar seu melhor membro. Em tarefas sem um, um painel que amostra vários modelos de fronteira e relata o melhor resultado está, em parte, relatando sorte. As próprias escolhas de categoria da Sakana — Chartography, DeepSWE, Toolathon — inclinam-se para o lado verificável, que é o lugar certo para fazer a alegação e também a razão pela qual a alegação não pode ser generalizada de graça.

Testadores independentes também sinalizaram a variação de latência como o custo prático da orquestração: em tarefas difíceis, o coordenador delibera; e, em tarefas fáceis, essa deliberação é puro overhead. Segundo relatos, a tarefa de shader de um pesquisador levou cerca de trinta minutos, com a qualidade avaliada apenas como aceitável.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, the 'Start Using Sakana Fugu' and 'Contact Us' buttons, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Onde você pode realmente obter isso

O Fugu Ultra v2 já está disponível por meio da própria API compatível com OpenAI da Sakana — aponte um cliente existente para o endpoint com uma chave de API e altere uma linha — e por meio de várias plataformas de terceiros. O OrcaRouter não disponibiliza os modelos Fugu; se você quiser chamar o Fugu Ultra v2, a própria API do fornecedor é o caminho direto.

Vale notar qual é a alternativa com a qual a Sakana está competindo implicitamente. O pool que faz o Fugu Ultra v2 funcionar é montado a partir de modelos que hoje podem ser chamados individualmente, e os adversários com que ele é comparado são os que as equipes já usam. Claude Opus 5, DeepSeek V4 Pro e Gemini 3.1 Pro estão todos no OrcaRouter pelos preços de tabela de seus provedores, com 0% de markup, o que significa que um corte de preço de qualquer um desses fornecedores entra em vigor do nosso lado no mesmo dia em que é anunciado. Se o motivo pelo qual você está considerando um orquestrador é a resiliência — não querer que um caminho de produção dependa do uptime de um único fornecedor ou da política de um único fornecedor —, então uma camada de roteamento com failover automático entre provedores resolve parte desse problema no nível do modelo, e o Fugu Ultra v2 resolve uma parte diferente no nível do raciocínio. Uma única API para mais de 200 modelos com failover não substitui um coordenador treinado, e um coordenador treinado não substitui não depender de um único fornecedor. Algumas equipes vão querer os dois.

A pegadinha da conformidade

Fugu não está disponível na União Europeia nem no Espaço Económico Europeu. A formulação do fornecedor é explícita: ainda não está disponível na UE/EEE enquanto trabalha para cumprir o RGPD e regulamentos específicos da UE e, noutros locais, o acesso pode ser limitado por condições de rede ou regras locais. Se a sua organização tiver entidades na UE no âmbito de aplicação, isto exclui a linha Fugu de qualquer consideração, independentemente do desempenho em benchmarks, o que vale a pena saber antes da avaliação, e não depois dela.

A screenshot of the OrcaRouter models catalogue page (captured September 11, 2026, English UI), showing the OrcaRouter navigation with Models, Leaderboard, Offers and Developers entries, the search field, and the 'Get API key' button over the browsable model catalogue.

O que assistir

Três coisas fariam o Fugu Ultra v2 passar de uma alegação interessante para uma escolha estrutural. Uma avaliação independente — uma entrada na Artificial Analysis, uma posição na LMArena, qualquer coisa com uma estrutura de avaliação por trás — resolveria a questão da Chartography em uma semana. Números reproduzidos por terceiros nos benchmarks de codificação verificáveis confirmariam o ganho em nível de sistema que a arquitetura prevê. E um pool divulgado, ou mesmo parcial, permitiria aos compradores refletir sobre exatamente quais pontos únicos de falha estão aceitando ao encaminhar tráfego de produção por meio de um coordenador que não conseguem inspecionar.

Até lá, a posição honesta é esta. O Fugu Ultra v2 é a tentativa mais séria até agora de vender orquestração como um produto, e não como uma demonstração de pesquisa, vinda de um laboratório com trabalhos publicados que a respaldam, a um preço que torna o prêmio da orquestração explícito em vez de oculto. Se sua carga de trabalho for de horizonte longo, verificável e restrita a uma região onde a Sakana possa atendê-lo, vale a pena um piloto com escopo definido e contabilização de tokens ativada. Se não for, os modelos com os quais o Fugu Ultra v2 é medido estão a uma chamada de API de distância, pelo preço de tabela, com os comprovantes para provar do que são capazes.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente