Um cartão de título principal para Fugu Ultra v2 vs DeepSeek V4 Pro com o subtítulo 'A questão do preço de saída 34x', badges em pílula com os dizeres 'DeepSWE 74.3 vs 62.7', 'Saída de $30.00 vs $0.87' e 'Pesos abertos vs fechados', uma linha de rodapé 'Sakana AI vs DeepSeek - setembro de 2026', e o logotipo da OrcaRouter no canto inferior direito.
Engineering & Research

Fugu Ultra v2 vs. DeepSeek V4 Pro: a questão do preço de saída 34x

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Fugu Ultra v2 charges roughly thirty-four times DeepSeek V4 Pro's list price for the text it writes. That is not a typo and it is not a rounding artifact: Sakana AI's new orchestrator lists at $30.00 per million output tokens, Deep​Seek reports $0.87 per million, and on the one benchmark both vendors publish a number for, the gap in performance is nothing like thirty-four times. Sakana claims 74.3 on DeepSWE for Fugu Ultra v2, released September 11, 2026; Deep​Seek reports 62.7 for DeepSeek V4 Pro, the open-weight model it shipped in August. An 11.6-point vendor-reported edge for a 34x output price is the entire comparison in one line — and the honest question is not whether Fugu Ultra v2 is better, but whether it is nineteen dollars per million tokens better, and for whom.

Duas respostas para o mesmo problema, construídas a partir de extremos opostos

DeepSeek V4 Pro e Fugu Ultra v2 são ambas respostas à mesma ansiedade — a dependência de um único fornecedor fechado de ponta — e dificilmente poderiam ser mais diferentes no método.

DeepSeek V4 Pro is a model. Launch coverage dates the official version's API rollout — the DeepSeek-V4-Pro-0813 build — to around August 12 to 13, 2026, superseding the April 24 preview. It is a mixture-of-experts system reported at 1.5 to 1.6 trillion total parameters with about 49 billion activated per token, carrying a 1M-token context window and a 384K-token maximum output. It reasons in thinking and non-thinking modes with three effort levels, speaks both the Ope​nAI and Anth​ropic API protocols, and added a native Responses API aimed squarely at Codex-style agent harnesses. Critically, the weights were published under MIT, which means the resilience argument is settled by possession: nobody can revoke your copy.

Fugu Ultra v2 não é um modelo. É um coordenador treinado, com cerca de 7B parâmetros segundo relatos, que decompõe uma solicitação em um pool de modelos não divulgados, atribui papéis de Thinker, Worker e Verifier e sintetiza uma resposta por trás de um único endpoint compatível com OpenAI. Seu argumento de resiliência é arquitetural, não jurídico: como o pool pode ser trocado, o sistema pode sobreviver a qualquer fornecedor individual que altere os termos. A versão 2.0, lançada junto com o Fugu Max, moveu a data de corte de treinamento para 28 de agosto de 2026 e — notavelmente — removeu completamente do pool Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra, enquanto ainda alega vitórias sobre eles.

So the comparison is possession versus coordination. Deep​Seek hands you a model you can download, audit, fine-tune and serve yourself at whatever margin your own hardware allows. Sakana hands you a system that decides how to attack each problem, at a rate that funds running several frontier models on your behalf.

A two-column scoreboard for Fugu Ultra v2 vs DeepSeek V4 Pro titled 'Fugu Ultra v2 vs DeepSeek V4 Pro - the scoreboard'. Left column Fugu Ultra v2: Output price $30.00 / 1M, Input price $5.00 / 1M, DeepSWE 74.3, Weights closed, Output ceiling not published, Context 1M. Right column DeepSeek V4 Pro: Output price $0.87 / 1M, Input price $0.435 / 1M, DeepSWE 62.7, Weights open, MIT, Output ceiling 384K, Context 1M. Footer 'Both columns vendor-reported; DeepSeek API rates as reported August 2026, pricing revision pending.', with the OrcaRouter logo bottom-right.

O que 34x realmente compra

Benchmarks first, with the sourcing front and centre. Every Deep​Seek figure below is the vendor's own and predates the peak/off-peak pricing revision Deep​Seek announced for mid-August, whose final numbers sources still disagree on — one report puts peak output near ¥27 per million, another near ¥12, against a ¥6 base. Verify against Deep​Seek's published rate card before you model a budget. Every Fugu figure is Sakana's own, and no independent party has reproduced any of them; there is still no Artificial Analysis entry for a Fugu model.

• DeepSWE — Fugu Ultra v2 74,3 (segundo o fornecedor) vs. DeepSeek V4 Pro 62,7 (segundo o fornecedor)

• Terminal Bench 2.1 — nenhum número do Fugu Ultra v2 publicado pela Sakana, em comparação com o 87,9 do DeepSeek V4 Pro (relatado pelo fornecedor)

• SWE-bench (Vals) — sem valor para o Fugu Ultra v2 vs. DeepSeek V4 Pro 96,4 (informado pelo fornecedor)

• Humanity's Last Exam — sem número para o Fugu Ultra v2 v2.0 vs. DeepSeek V4 Pro 42,7 sem ferramentas, 60,0 com ferramentas (segundo o fornecedor)

• GPQA Diamond — sem valor para o Fugu Ultra v2 v2.0 vs. DeepSeek V4 Pro 92,8 (informado pelo fornecedor)

• Preço de saída — Fugu Ultra v2 $30,00 por 1M, subindo para $45,00 acima de 272K de contexto vs. DeepSeek V4 Pro aproximadamente $0,87 por 1M de tabela, com uma tarifa medida que vem sendo mais alta

Two caveats on that price row, because the whole comparison rests on it. First, Deep​Seek's figure is the list rate reported in launch coverage and restated in our own model description, but the metered rate on our listing has run at $2.18 per million output and $0.73 per million input — cache behaviour and mix move the effective number, so the honest multiple is somewhere between roughly 14x and roughly 34x depending on how much of your input is cached. Even at the floor of that range, output costs more than a dozen times as much. Second, Deep​Seek has already announced a peak/off-peak pricing revision whose final figures sources still disagree on — one report puts peak output near ¥27 per million, another near ¥12, against a ¥6 base. Verify against the published rate card before you model a budget.

• Preço de entrada — Fugu Ultra v2 US$ 5,00 por 1M, dobrando acima de 272K, vs. DeepSeek V4 Pro aproximadamente US$ 0,435 por 1M em caso de cache miss, cerca de 120x mais barato em caso de cache hit

• Pesos — Fugu Ultra v2 fechado, pool não divulgado, roteamento não exposto por design vs DeepSeek V4 Pro aberto sob MIT, auto-hospedável

• Contexto e saída — Fugu Ultra v2 com contexto de 1M, limite de saída não divulgado vs DeepSeek V4 Pro com contexto de 1M, limite de saída de 384K

The overlap problem is obvious: the two systems barely appear on the same rows. Sakana publishes five wins out of eight benchmarks it selected; Deep​Seek publishes a wider board that includes deep agentic coverage — MCP Atlas 73.6, Toolathlon-Verified 74.1, CyberGym 83.3, NL2Repo 61.5, CorpusQA 62.0 on long context — where Fugu Ultra v2 has no published number at all. The single row you can line up, DeepSWE, is the one where Fugu claims its largest software-engineering advantage. A reader comparing the two releases is comparing two different exams.

O multiplicador de verbosidade

O preço de saída não é um imposto linear sobre a orquestração; é um multiplicador sobre uma quantidade que a orquestração aumenta. O Fugu Ultra v2 cria agentes, cada um produzindo tokens de raciocínio e de saída, antes que um coordenador os sintetize. O FAQ de preços da Sakana traz um compromisso genuinamente amigável ao consumidor — você paga uma única tarifa combinada com base no modelo de nível superior do pool, e adicionar agentes não multiplica a conta — o que limita o pior caso. Isso não limita o volume. A $30 por milhão de tokens de saída, uma execução multiagente que emite quatro vezes o texto de uma chamada de modelo único custa quatro vezes mais, e o multiplicador se acumula com uma taxa de saída 34 vezes maior.

A estrutura de custos do DeepSeek V4 Pro recompensa o comportamento oposto. Um acerto de cache na entrada é cerca de duas ordens de magnitude mais barato do que uma falta, o que torna o trabalho repetido com contexto longo — o mesmo repositório, o mesmo conjunto de documentos, o mesmo prompt de sistema — drasticamente mais barato do que a tarifa nominal sugere. Para um loop de agente que relê o mesmo contexto a cada turno, é aí que o custo efetivo recai, e é uma vantagem estrutural que nenhum orquestrador consegue contornar.

Junte os dois e a decisão se torna concreta. Se o Fugu Ultra v2 entrega uma vantagem de 11,6 pontos no DeepSWE e emite três vezes mais tokens de saída do que uma única chamada, você está pagando cerca de cem vezes mais por tarefa concluída por um ganho de dez a quinze pontos em um único benchmark. Essa troca é defensável para pesquisa e problemas de engenharia irredutivelmente difíceis, em que o ponto marginal é o jogo inteiro, e indefensável para um pipeline que roda cem mil vezes por dia.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Para quem cada um é na verdade

Escolha o DeepSeek V4 Pro se qualquer uma das seguintes condições for verdadeira: sua carga de trabalho é de alto volume e sensível a custos; você precisa de uma saída mais longa do que o teto que um orquestrador lhe dará; você exige um sistema que possa auditar, fazer ajuste fino ou servir no seu próprio hardware por razões de residência de dados; ou você precisa que o preço seja um número que você possa calcular, e não um número que você observe. A licença aberta MIT não é um recurso de marketing — é a forma mais forte do argumento de resiliência que qualquer um dos dois sistemas está apresentando, porque não depende da boa vontade contínua de nenhum fornecedor. Ele também é, a aproximadamente US$ 0,87 por milhão de tokens de saída, barato o suficiente para que a experimentação não custe nada.

Escolha o Fugu Ultra v2 se o ponto marginal valer um múltiplo, o trabalho for de horizonte longo e a correção for verificável — programação com uma suíte de testes, raciocínio estruturado sobre documentos, análise em várias etapas em que um papel de Verificador consegue detetar um erro que uma única passagem deixaria passar. Os próprios estudos de caso da Sakana apontam exatamente para isto: uma execução autónoma de pesquisa de quatorze horas, um solucionador de cubo de Rubik que concluiu todos os 300 embaralhamentos, enquanto duas baselines anonimizadas falharam por completo. Tenha em conta que essas baselines são anonimizadas e selecionadas pelo fornecedor, o que as enfraquece como evidência e não as torna falsas. Tenha também em conta a restrição que encerra a discussão para algumas equipes: o Fugu Ultra v2 não é vendido na UE nem no EEE, e a Sakana declara isso claramente.

One practical note if you intend to run either. Fugu Ultra v2 is not on OrcaRouter — it comes through Sakana's own OpenAI-compatible API and several third-party platforms, and upgrading from an earlier Fugu is a single-line parameter change. DeepSeek V4 Pro is on OrcaRouter at the provider's list price with 0% markup, which matters here more than usual: Deep​Seek has already announced one pricing revision this cycle, and on a pass-through router a vendor price change is live on the same key the same day rather than after a renegotiation. If you want to benchmark both against your own workload before committing, the cheaper side of the comparison is the one you can call at list price with automatic failover behind it.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the '1.6T total / 49B active params, 1M context, top-tier reasoning + agentic tool use' summary, the 1M token context and 384K max output fields, the pricing tiles reading INPUT $0.73 and OUTPUT $2.18 per 1M tokens with p50 TTFT 919ms, and the description stating transparent pricing at $0.44 per 1 million input tokens and $0.87 per 1 million output tokens.

O veredito

Isto não é um confronto parelho em termos econômicos nem decisivo em termos de capacidade. O DeepSeek V4 Pro é a opção padrão melhor por uma ampla margem: pesos abertos que você pode manter, um teto de saída de 384K, um contexto de 1M, pontuações publicadas de contexto longo e um preço de saída de aproximadamente um trinta e quatro avos do preço do Fugu Ultra v2. O Fugu Ultra v2 é o instrumento melhor para uma classe estreita de problemas caros, e a alegação da Sakana — de que um pool fixo que exclui os três modelos mais fortes ainda pode superá-los em trabalho verificável — é o argumento arquitetural mais interessante no campo atualmente, e o que tem menos evidência independente por trás.

A solução prática não é escolher. Execute o DeepSeek V4 Pro como padrão porque ele é barato, aberto e rápido, e mantenha o Fugu Ultra v2 em reserva para as tarefas em que um aumento de custo de cem vezes ainda é menor que o custo de estar errado. O que você não deve fazer é ler o quadro de oito benchmarks da Sakana como evidência de que o orquestrador caro substituiu o modelo aberto barato. Na única linha que eles compartilham, ele está 11,6 pontos à frente por 34 vezes o preço de saída. Se isso é uma pechincha ou uma armadilha depende inteiramente de para qual problema você o aponta.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente