Um cartão de título principal para "Fugu Max vs DeepSeek V4 Pro", com o subtítulo "A opção otimizada para custos é a cara", três badges em formato de pílula com os dizeres "$6,00 vs $2,18 de saída", "MoE de 1,6T, 49B ativos", "teto de saída de 384K", uma linha de rodapé com "Sakana AI vs DeepSeek - setembro de 2026", e o logotipo da OrcaRouter no canto inferior direito.
Engineering & Research

Fugu Max vs DeepSeek V4 Pro: o otimizado para custo é o caro

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Fugu Max foi criado para ser a opção barata, e, mesmo assim, o DeepSeek V4 Pro o supera em preço. A Sakana AI lançou o Fugu Max em 11 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, posicionando-o como um coordenador que amplia a fronteira de custo-desempenho ao encaminhar cada tarefa para o modelo mais enxuto de seu pool. O DeepSeek V4 Pro, listado desde abril de 2026, está em US$ 0,73 de entrada e US$ 2,18 de saída por milhão na tarifa medida da OrcaRouter — cerca de um terço do que o Fugu Max cobra em ambos os eixos, vindo de um único modelo de mistura de especialistas com pesos abertos, com teto de saída de 384K e nenhuma camada de orquestração. Essa inversão é toda a comparação. Todo o resto sobre este par é uma questão sobre o que a orquestração lhe oferece quando a linha de base que você está tentando superar em preço já é mais barata do que você.

Duas maneiras de reduzir uma conta, e uma delas já é mais baixa.

O argumento da Sakana a favor do Fugu Max é que um coordenador pode reduzir gastos ao não pagar preços de fronteira por tarefas que não exigem capacidade de fronteira. É um argumento sólido. O problema é o modelo contra o qual ele está sendo feito. O DeepSeek V4 Pro é um mixture-of-experts de 1,6 trilhão de parâmetros, com 49 bilhões de parâmetros ativos por token, que é a mesma ideia de redução de custos executada um nível abaixo — você paga pelos parâmetros que um token realmente ativa, não pelo tamanho da rede. Ambos os produtos são respostas a "como deixamos de pagar por capacidade que não usamos". Um deles cobra US$ 2,18 por milhão de tokens de saída pelo privilégio.

• Preço de entrada — Fugu Max US$ 2,00 por 1M de tokens vs. DeepSeek V4 Pro US$ 0,73 por 1M de tokens medidos

• Preço de saída — Fugu Max US$ 6,00 por 1M de tokens vs DeepSeek V4 Pro US$ 2,18 por 1M de tokens medidos

• Entrada em cache — Fugu Max US$ 0,25 por 1M de tokens vs. entrada com cache hit do DeepSeek V4 Pro com preço muito abaixo de sua tarifa base, com a tarifa de tabela publicada pelo fornecedor situando-se abaixo de US$ 1,00 por 1M

• Contexto — Fugu Max não publicado vs DeepSeek V4 Pro 1M tokens

• Teto de saída — Fugu Max não publicado vs DeepSeek V4 Pro 384 mil tokens

• Modalidade — Fugu Max não publicado vs DeepSeek V4 Pro somente texto, com uso de ferramentas, modo JSON e raciocínio

• Arquitetura — Fugu Max, um coordenador treinado sobre um conjunto não divulgado, vs. DeepSeek V4 Pro, um único modelo MoE, linhagem de pesos abertos

• Números de benchmark — Fugu Max: seis vitórias alegadas sem pontuações, contra 87,9 no Terminal Bench 2.1, 92,8 no GPQA Diamond e 96,4 no SWE-bench Vals, reportados pelo fornecedor do DeepSeek V4 Pro

Há um número nessa lista que merece ser destacado. O Deep​Seek reporta 87,9 no Terminal Bench 2.1. O Fugu Max alega ter a "melhor pontuação geral" no Terminal Bench 2.1. Mesmo benchmark, mesma janela de lançamento, um lado publica um número e o outro publica a palavra "melhor". Essa é a ilustração mais nítida da assimetria de evidências neste par, e não se trata de um detalhe — é a razão inteira pela qual a diferença de preço não encerra a discussão.

A two-column scoreboard titled "Fugu Max vs DeepSeek V4 Pro - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Cached input $0.25 / 1M, Context not published, Terminal Bench 2.1 best overall with no figure, Weights closed and pool undisclosed. Right column DeepSeek V4 Pro: Output price $2.18 / 1M, Input price $0.73 / 1M, Cached input below base rate, Context 1M tokens, Terminal Bench 2.1 87.9, Weights open-weights lineage. Footer reading "Fugu Max rows vendor-reported by Sakana AI with no scores published; DeepSeek rows vendor-reported, metered rate on OrcaRouter.", with the OrcaRouter logo bottom-right.

O que a orquestração traz quando a linha de base já é barata

O argumento a favor de pagar mais pelo Fugu Max tem de se basear em trabalho com o qual um único modelo se sai mal, e existe uma categoria real disso. Tarefas de horizonte longo em que um passo em falso se acumula — refatorações de vários arquivos, mudanças na escala de um repositório, qualquer coisa em que um verificador que confere a saída do worker valha mais do que um worker mais forte — são exatamente para o que serve um arranjo Thinker/Worker/Verifier. A própria definição da Sakana para a linha Fugu é que detectar um erro numa segunda passagem sai mais barato do que acertar de primeira. Nessas tarefas, uma tarifa de saída de US$ 6,00 que termina em uma única tentativa pode superar uma tarifa de US$ 2,18 que precisa de três.

Esse argumento tem uma forma testável e a Sakana não o executou em público. A comparação que você desejaria é o custo por tarefa concluída em um benchmark que ambos os sistemas tentam — o Terminal Bench 2.1 está bem ali, ele é agêntico e baseado em terminal por construção, e apenas um dos dois fornecedores publicou um número para ele. Até que essa lacuna seja fechada, a posição honesta é que a vantagem de custo do Fugu Max é afirmada no nível dos tokens e não comprovada no nível das tarefas, enquanto a do DeepSeek V4 Pro é direta: os próprios tokens custam um terço.

Há um ponto de segunda ordem sobre a composição do pool que importa mais para este confronto do que para a maioria. O pool do Fugu Max foi ampliado nesta versão para incluir modelos de pesos abertos e especializados, com a família NVIDIA Nemotron nomeada por meio de uma colaboração com a NVIDIA. Pesos abertos no pool significam que o degrau mais barato da escada da Sakana não está exposto às decisões de precificação de outro laboratório. O DeepSeek V4 Pro, sendo ele próprio de pesos abertos, não está exposto às decisões de precificação de ninguém além da DeepSeek — e é o degrau. O argumento de resiliência que a Sakana faz para a orquestração aplica-se diretamente ao DeepSeek e apenas indiretamente ao fornecimento subjacente do Fugu Max.

O caching é onde as cargas de trabalho dos agentes realmente ficam caras

A taxa base de nenhum dos fornecedores é a taxa que um loop de agente paga. Execuções longas de agentes reenviam um prefixo grande e em grande parte inalterado a cada turno, e é a taxa de acerto de cache que determina a conta real. O Fugu Max lista entrada em cache a US$ 0,25 por milhão, o que é um número genuíno e agressivo — um oitavo de sua própria taxa base de entrada. O DeepSeek V4 Pro precifica a entrada com acerto de cache muito abaixo de sua base publicada, e sua taxa de saída é definida em cerca de três vezes sua entrada, em vez da proporção de quatro a cinco vezes usada pela maioria dos fornecedores, o que comprime especificamente o custo de loops com uso intenso de geração.

O que você não pode fazer hoje é calcular a comparação de forma confiável a partir da tabela de tarifas de qualquer um dos fornecedores, porque a tarifa em cache do Fugu Max se aplica a uma contagem de tokens que você não consegue prever. Um orquestrador decide quantos agentes são executados; o contexto de cada agente contribui; o coordenador adiciona o seu próprio. O compromisso de preços da Sakana para a linha Fugu — uma tarifa combinada baseada no modelo participante de nível superior, com os agentes não acumulando a conta — elimina o pior cenário, o que é uma concessão real e digna de crédito. Isso não torna o volume conhecido de antemão. A conta do DeepSeek V4 Pro é uma função dos tokens que você envia e dos tokens que você recebe, e nada mais.

Essa previsibilidade é uma propriedade de roteamento tanto quanto uma propriedade do modelo. O DeepSeek V4 Pro está no OrcaRouter pelo preço de tabela do provedor com 0% de markup, então uma revisão de tarifas do Deep​Seek chega à sua chave existente no mesmo dia, em vez de na sua próxima renovação de contrato, e o failover automático protege você quando um caminho de provedor está sujeito a limite de taxa. Essa última parte tem um peso incomum especificamente para este modelo: o Deep​Seek já revisou seus preços uma vez neste ciclo, com faixas de pico e fora de pico cujos valores finais variam entre as fontes. Quando a tabela de preços de um fornecedor muda, o roteador é a diferença entre absorver a mudança e descobri-la em uma fatura.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

O que não conseguimos verificar

Três coisas no lançamento do Fugu Max não puderam ser verificadas com nada fora dos próprios materiais da Sakana, e elas estão listadas aqui em vez de serem minimizadas. Primeiro, as seis vitórias em benchmarks não trazem números — Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish são citados como vitórias sem pontuações associadas, e o SWEFish é um benchmark interno da Sakana. Segundo, a janela de contexto, o teto de saída e as modalidades suportadas do Fugu Max não são publicados, então as linhas de modalidade e de teto acima comparam uma especificação entregue com o silêncio. Terceiro, não existe avaliação independente de nenhum modelo Fugu, e não há entrada do Artificial Analysis para o Fugu Max.

Para o DeepSeek V4 Pro, a situação é inversa. O fornecedor apresenta uma longa lista de números — Terminal Bench 2.1 87.9, GPQA Diamond 92.8, SWE-bench Vals 96.4, HLE 42.7 e 60.0 em duas configurações, MCP Atlas 73.6, Toolathlon-Verified 74.1, CyberGym 83.3 — e todos eles também são relatados pelo fornecedor. A diferença não está em um fornecedor ser mais confiável. Está em que, quando ambos os lados publicam números, a discordância é possível, e uma discordância pode ser investigada. Uma afirmação sem número não pode ser verificada, apenas aceita ou ignorada.

Uma ressalva adicional sobre os preços da DeepSeek acima: nossa própria página do modelo traz dois valores — uma tarifa de uso medido de US$ 0,73 de entrada e US$ 2,18 de saída por milhão nos cartões de preço, e uma descrição mais antiga de US$ 0,44 de entrada e US$ 0,87 de saída por milhão. A DeepSeek também anunciou faixas de horário de pico e fora de pico sobre cujas tarifas finais as fontes divergem. Considere US$ 0,73 e US$ 2,18 como a tarifa que lhe será efetivamente cobrada por nosso intermédio hoje e confirme na tabela de preços publicada antes de basear um orçamento nisso.

Conclusão

DeepSeek V4 Pro vence esta comparação nos termos que a Fugu Max escolheu. É mais barato na entrada e na saída, tem uma janela de contexto publicada e um teto de saída de 384K, reporta um número real no benchmark que a Fugu Max alega liderar, e sua linhagem é de pesos abertos, que é a forma mais forte disponível do argumento de independência de fornecedor que a Sakana está vendendo. Se sua carga de trabalho é intensiva em tokens e sua prioridade é o menor custo por token defensável de um modelo que você pode fixar, não há comparação.

O Fugu Max vence numa questão mais restrita que o DeepSeek V4 Pro não responde de todo: se um coordenador que monta a sua própria equipa de agentes consegue concluir trabalho difícil e de longo horizonte em menos tentativas do que um único modelo. Vale a pena fazer um piloto se tiver trabalho verificável e tolerante a falhas e estiver fora da UE/EEE. Calcule o custo em tokens por tarefa concluída, defina primeiro um limite máximo, e compare-o com o endpoint DeepSeek V4 Pro no OrcaRouter ao preço de tabela do fornecedor — uma chave, 0% de markup, e uma tarifa que acompanha a do próprio fornecedor.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, captured September 11, 2026, English UI), showing the FLAGSHIP and Featured badges, the deepseek/deepseek-v4-pro model ID, the Tools, JSON and Reasoning tags, the listing date 2026-04-24, the /v1/chat/completions and /v1/responses endpoints, the pricing tiles reading INPUT $0.73 and OUTPUT $2.18 per 1M tokens with p50 TTFT 919ms and 6,313.7M tokens of 7-day traffic, the 1M token context with 384K max output and text-only input, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente