
Fugu Ultra v2 vs. DeepSeek V4 Pro: a questão do preço de saída 34x
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Fugu Ultra v2 charges roughly thirty-four times DeepSeek V4 Pro's list price for the text it writes. That is not a typo and it is not a rounding artifact: Sakana AI's new orchestrator lists at $30.00 per million output tokens, DeepSeek reports $0.87 per million, and on the one benchmark both vendors publish a number for, the gap in performance is nothing like thirty-four times. Sakana claims 74.3 on DeepSWE for Fugu Ultra v2, released September 11, 2026; DeepSeek reports 62.7 for DeepSeek V4 Pro, the open-weight model it shipped in August. An 11.6-point vendor-reported edge for a 34x output price is the entire comparison in one line — and the honest question is not whether Fugu Ultra v2 is better, but whether it is nineteen dollars per million tokens better, and for whom.
Duas respostas para o mesmo problema, construídas a partir de extremos opostos
DeepSeek V4 Pro e Fugu Ultra v2 são ambas respostas à mesma ansiedade — a dependência de um único fornecedor fechado de ponta — e dificilmente poderiam ser mais diferentes no método.
DeepSeek V4 Pro is a model. Launch coverage dates the official version's API rollout — the DeepSeek-V4-Pro-0813 build — to around August 12 to 13, 2026, superseding the April 24 preview. It is a mixture-of-experts system reported at 1.5 to 1.6 trillion total parameters with about 49 billion activated per token, carrying a 1M-token context window and a 384K-token maximum output. It reasons in thinking and non-thinking modes with three effort levels, speaks both the OpenAI and Anthropic API protocols, and added a native Responses API aimed squarely at Codex-style agent harnesses. Critically, the weights were published under MIT, which means the resilience argument is settled by possession: nobody can revoke your copy.
Fugu Ultra v2 não é um modelo. É um coordenador treinado, com cerca de 7B parâmetros segundo relatos, que decompõe uma solicitação em um pool de modelos não divulgados, atribui papéis de Thinker, Worker e Verifier e sintetiza uma resposta por trás de um único endpoint compatível com OpenAI. Seu argumento de resiliência é arquitetural, não jurídico: como o pool pode ser trocado, o sistema pode sobreviver a qualquer fornecedor individual que altere os termos. A versão 2.0, lançada junto com o Fugu Max, moveu a data de corte de treinamento para 28 de agosto de 2026 e — notavelmente — removeu completamente do pool Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra, enquanto ainda alega vitórias sobre eles.
So the comparison is possession versus coordination. DeepSeek hands you a model you can download, audit, fine-tune and serve yourself at whatever margin your own hardware allows. Sakana hands you a system that decides how to attack each problem, at a rate that funds running several frontier models on your behalf.

O que 34x realmente compra
Benchmarks first, with the sourcing front and centre. Every DeepSeek figure below is the vendor's own and predates the peak/off-peak pricing revision DeepSeek announced for mid-August, whose final numbers sources still disagree on — one report puts peak output near ¥27 per million, another near ¥12, against a ¥6 base. Verify against DeepSeek's published rate card before you model a budget. Every Fugu figure is Sakana's own, and no independent party has reproduced any of them; there is still no Artificial Analysis entry for a Fugu model.
• DeepSWE — Fugu Ultra v2 74,3 (segundo o fornecedor) vs. DeepSeek V4 Pro 62,7 (segundo o fornecedor)
• Terminal Bench 2.1 — nenhum número do Fugu Ultra v2 publicado pela Sakana, em comparação com o 87,9 do DeepSeek V4 Pro (relatado pelo fornecedor)
• SWE-bench (Vals) — sem valor para o Fugu Ultra v2 vs. DeepSeek V4 Pro 96,4 (informado pelo fornecedor)
• Humanity's Last Exam — sem número para o Fugu Ultra v2 v2.0 vs. DeepSeek V4 Pro 42,7 sem ferramentas, 60,0 com ferramentas (segundo o fornecedor)
• GPQA Diamond — sem valor para o Fugu Ultra v2 v2.0 vs. DeepSeek V4 Pro 92,8 (informado pelo fornecedor)
• Preço de saída — Fugu Ultra v2 $30,00 por 1M, subindo para $45,00 acima de 272K de contexto vs. DeepSeek V4 Pro aproximadamente $0,87 por 1M de tabela, com uma tarifa medida que vem sendo mais alta
Two caveats on that price row, because the whole comparison rests on it. First, DeepSeek's figure is the list rate reported in launch coverage and restated in our own model description, but the metered rate on our listing has run at $2.18 per million output and $0.73 per million input — cache behaviour and mix move the effective number, so the honest multiple is somewhere between roughly 14x and roughly 34x depending on how much of your input is cached. Even at the floor of that range, output costs more than a dozen times as much. Second, DeepSeek has already announced a peak/off-peak pricing revision whose final figures sources still disagree on — one report puts peak output near ¥27 per million, another near ¥12, against a ¥6 base. Verify against the published rate card before you model a budget.
• Preço de entrada — Fugu Ultra v2 US$ 5,00 por 1M, dobrando acima de 272K, vs. DeepSeek V4 Pro aproximadamente US$ 0,435 por 1M em caso de cache miss, cerca de 120x mais barato em caso de cache hit
• Pesos — Fugu Ultra v2 fechado, pool não divulgado, roteamento não exposto por design vs DeepSeek V4 Pro aberto sob MIT, auto-hospedável
• Contexto e saída — Fugu Ultra v2 com contexto de 1M, limite de saída não divulgado vs DeepSeek V4 Pro com contexto de 1M, limite de saída de 384K
The overlap problem is obvious: the two systems barely appear on the same rows. Sakana publishes five wins out of eight benchmarks it selected; DeepSeek publishes a wider board that includes deep agentic coverage — MCP Atlas 73.6, Toolathlon-Verified 74.1, CyberGym 83.3, NL2Repo 61.5, CorpusQA 62.0 on long context — where Fugu Ultra v2 has no published number at all. The single row you can line up, DeepSWE, is the one where Fugu claims its largest software-engineering advantage. A reader comparing the two releases is comparing two different exams.
O multiplicador de verbosidade
O preço de saída não é um imposto linear sobre a orquestração; é um multiplicador sobre uma quantidade que a orquestração aumenta. O Fugu Ultra v2 cria agentes, cada um produzindo tokens de raciocínio e de saída, antes que um coordenador os sintetize. O FAQ de preços da Sakana traz um compromisso genuinamente amigável ao consumidor — você paga uma única tarifa combinada com base no modelo de nível superior do pool, e adicionar agentes não multiplica a conta — o que limita o pior caso. Isso não limita o volume. A $30 por milhão de tokens de saída, uma execução multiagente que emite quatro vezes o texto de uma chamada de modelo único custa quatro vezes mais, e o multiplicador se acumula com uma taxa de saída 34 vezes maior.
A estrutura de custos do DeepSeek V4 Pro recompensa o comportamento oposto. Um acerto de cache na entrada é cerca de duas ordens de magnitude mais barato do que uma falta, o que torna o trabalho repetido com contexto longo — o mesmo repositório, o mesmo conjunto de documentos, o mesmo prompt de sistema — drasticamente mais barato do que a tarifa nominal sugere. Para um loop de agente que relê o mesmo contexto a cada turno, é aí que o custo efetivo recai, e é uma vantagem estrutural que nenhum orquestrador consegue contornar.
Junte os dois e a decisão se torna concreta. Se o Fugu Ultra v2 entrega uma vantagem de 11,6 pontos no DeepSWE e emite três vezes mais tokens de saída do que uma única chamada, você está pagando cerca de cem vezes mais por tarefa concluída por um ganho de dez a quinze pontos em um único benchmark. Essa troca é defensável para pesquisa e problemas de engenharia irredutivelmente difíceis, em que o ponto marginal é o jogo inteiro, e indefensável para um pipeline que roda cem mil vezes por dia.

Para quem cada um é na verdade
Escolha o DeepSeek V4 Pro se qualquer uma das seguintes condições for verdadeira: sua carga de trabalho é de alto volume e sensível a custos; você precisa de uma saída mais longa do que o teto que um orquestrador lhe dará; você exige um sistema que possa auditar, fazer ajuste fino ou servir no seu próprio hardware por razões de residência de dados; ou você precisa que o preço seja um número que você possa calcular, e não um número que você observe. A licença aberta MIT não é um recurso de marketing — é a forma mais forte do argumento de resiliência que qualquer um dos dois sistemas está apresentando, porque não depende da boa vontade contínua de nenhum fornecedor. Ele também é, a aproximadamente US$ 0,87 por milhão de tokens de saída, barato o suficiente para que a experimentação não custe nada.
Escolha o Fugu Ultra v2 se o ponto marginal valer um múltiplo, o trabalho for de horizonte longo e a correção for verificável — programação com uma suíte de testes, raciocínio estruturado sobre documentos, análise em várias etapas em que um papel de Verificador consegue detetar um erro que uma única passagem deixaria passar. Os próprios estudos de caso da Sakana apontam exatamente para isto: uma execução autónoma de pesquisa de quatorze horas, um solucionador de cubo de Rubik que concluiu todos os 300 embaralhamentos, enquanto duas baselines anonimizadas falharam por completo. Tenha em conta que essas baselines são anonimizadas e selecionadas pelo fornecedor, o que as enfraquece como evidência e não as torna falsas. Tenha também em conta a restrição que encerra a discussão para algumas equipes: o Fugu Ultra v2 não é vendido na UE nem no EEE, e a Sakana declara isso claramente.
One practical note if you intend to run either. Fugu Ultra v2 is not on OrcaRouter — it comes through Sakana's own OpenAI-compatible API and several third-party platforms, and upgrading from an earlier Fugu is a single-line parameter change. DeepSeek V4 Pro is on OrcaRouter at the provider's list price with 0% markup, which matters here more than usual: DeepSeek has already announced one pricing revision this cycle, and on a pass-through router a vendor price change is live on the same key the same day rather than after a renegotiation. If you want to benchmark both against your own workload before committing, the cheaper side of the comparison is the one you can call at list price with automatic failover behind it.

O veredito
Isto não é um confronto parelho em termos econômicos nem decisivo em termos de capacidade. O DeepSeek V4 Pro é a opção padrão melhor por uma ampla margem: pesos abertos que você pode manter, um teto de saída de 384K, um contexto de 1M, pontuações publicadas de contexto longo e um preço de saída de aproximadamente um trinta e quatro avos do preço do Fugu Ultra v2. O Fugu Ultra v2 é o instrumento melhor para uma classe estreita de problemas caros, e a alegação da Sakana — de que um pool fixo que exclui os três modelos mais fortes ainda pode superá-los em trabalho verificável — é o argumento arquitetural mais interessante no campo atualmente, e o que tem menos evidência independente por trás.
A solução prática não é escolher. Execute o DeepSeek V4 Pro como padrão porque ele é barato, aberto e rápido, e mantenha o Fugu Ultra v2 em reserva para as tarefas em que um aumento de custo de cem vezes ainda é menor que o custo de estar errado. O que você não deve fazer é ler o quadro de oito benchmarks da Sakana como evidência de que o orquestrador caro substituiu o modelo aberto barato. Na única linha que eles compartilham, ele está 11,6 pontos à frente por 34 vezes o preço de saída. Se isso é uma pechincha ou uma armadilha depende inteiramente de para qual problema você o aponta.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
