Cartão de destaque para o confronto entre Fugu Ultra v2 e Kimi K3, mostrando um modelo que encaminha tokens para especialistas ao lado de um orquestrador que encaminha tarefas para modelos.
Guides & Insights

Fugu Ultra v2 vs Kimi K3: Dois Roteadores, Duas Altitudes

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Ambos os sistemas são roteadores, e essa é a primeira coisa que a maioria das análises deixa passar. Kimi K3 é um modelo Mixture-of-Experts de 2,8 trilhões de parâmetros que ativa cerca de 104 bilhões de parâmetros por token — o que significa que, a cada token que gera, ele toma uma decisão de roteamento, selecionando 16 de seus 896 especialistas para fazer o trabalho. Fugu Ultra v2, anunciado pela Sakana AI em 11 de setembro de 2026, é um roteador em um nível totalmente diferente: ele recebe uma tarefa, a divide e distribui as partes por um conjunto de modelos separados. Um roteia dentro de uma passagem direta; o outro roteia por toda uma frota. Entender que são a mesma ideia em duas escalas é a maneira mais rápida de ver por que seus preços diferem em 2× na entrada e 5× na saída.

Os dois roteadores, lado a lado

Kimi K3 — o carro-chefe da Moonshot AI, lançado em meados de julho de 2026, com pesos abertos publicados em 27 de julho de 2026. A arquitetura é incomum até mesmo para os padrões de 2026: 69 camadas de Kimi Delta Attention intercaladas com 24 camadas de Gated MLA, Attention Residuals, um design "Stable LatentMoE" e um codificador de visão MoonViT-V2 com 401 milhões de parâmetros. Os pesos são distribuídos em MXFP4 com ativações MXFP8 sob treinamento com reconhecimento de quantização. Sua API hospedada expõe o esforço de raciocínio com exatamente um valor suportado — max.

Fugu Ultra v2 — a camada de orquestração de capacidade máxima da Sakana AI, e não um modelo de base no sentido habitual. É um único endpoint compatível com OpenAI que decompõe tarefas e as distribui por um conjunto de modelos de pesos abertos e especializados. A Sakana afirma que Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra estão excluídos desse conjunto, e indica uma data de corte de treinamento de 20260828. Não há uma contagem de parâmetros publicada, porque não há parâmetros para contar da forma como se faria para o K3 — a capacidade reside na política de agendamento.

A consequência é que o K3 é um componente e o Fugu Ultra v2 é uma montagem. Isso torna esta comparação incomum: esses dois não são apenas concorrentes, são ingredientes potenciais. Um modelo como o K3 é exatamente o tipo de sistema de pesos abertos, contexto longo e chamada de ferramentas que um orquestrador plausivelmente alugaria. A Sakana não publica a composição do pool, então se o K3 está dentro do Fugu Ultra v2 é desconhecido — mas, se estiver, parte do que você paga pela tarifa do Fugu são os tokens do K3 com um acréscimo.

O que a diferença de preço realmente é

Entrada — Fugu Ultra v2 a um valor reportado de US$ 5,00 por 1M (listagens de terceiros; a página de anúncio da Sakana não publica suas próprias tarifas) vs. Kimi K3 a US$ 3,00 por 1M, com acertos de cache a US$ 0,30.

Saída — Fugu Ultra v2 a um preço noticiado de US$ 30,00 por 1M vs. Kimi K3 a US$ 15,00 por 1M. Metade do preço, por um modelo que você também pode baixar.

Entrada em cache — Fugu Ultra v2 $0.50 por 1M vs Kimi K3 $0.30 por 1M em um acerto de cache. Em um loop de agente longo com um prompt de sistema estável, essa diferença se acumula a cada turno.

Faixas de contexto — Kimi K3 é uniforme em toda a sua janela de 1.048.576 tokens, sem penalidade de contexto longo. A faixa reportada da Fugu Ultra v2 acima de aproximadamente 272.000 tokens de entrada move a solicitação inteira para cerca de US$ 10,00 / US$ 45,00.

Essa última linha é a que decide as contas de verdade. Uma execução de agente de horizonte longo passa a maior parte da sua vida além dos 272K tokens, que é exatamente onde a tarifa fixa do K3 permanece fixa e a do Fugu Ultra v2 dobra. Se a sua carga de trabalho se parece com isso, a diferença efetiva do lado da entrada fica mais próxima de 3,3× do que de 1,7×.

Two-column comparison scoreboard for Fugu Ultra v2 and Kimi K3 covering type, release date, input price ($5.00 vs $3.00 per million tokens), output price ($30.00 vs $15.00), cached input ($0.50 vs $0.30) and long-context pricing (reprices above roughly 272K vs flat to 1M).

O único número que eles compartilham

Ambos os fornecedores relatam o DeepSWE, e a comparação é menos lisonjeira para o Fugu do que o enquadramento de seu lançamento sugere. A Sakana lista o Fugu Ultra v2 com 74,3. A Moonshot lista o Kimi K3 com 67,5 — relatado pelo fornecedor, segundo a ficha do modelo. Isso é uma diferença de 6,8 pontos em um benchmark de agente de codificação, o que é real, mas é um teste entre um conjunto publicado muito maior, e é o mesmo teste em que a Sakana lidera por 1,6 ponto contra o GPT-5.6 Sol. Um benchmark em que três fornecedores diferentes ficam todos agrupados dentro de sete pontos está medindo algo real, mas não os separa de forma decisiva.

Além disso, os dois divulgam em prateleiras completamente diferentes. Os números do K3 da Moonshot incluem Terminal-Bench 2.1 em 88,3, GPQA Diamond em 93,5, HLE-Full em 43,5 (56,0 com ferramentas), SWE-Marathon em 42,0, OSWorld-Verified em 84,8 e MCPMark-Verified em 94,5 — todos relatados pelo fornecedor, todos na ficha do modelo. Os oito da Sakana para o Fugu Ultra v2 incluem dois benchmarks internos, SWEFish e Toolathon, que ninguém fora da Sakana consegue reproduzir.

De forma independente, apenas um deles chegou a ser medido. O Kimi K3 marca 44 no Artificial Analysis Intelligence Index v4.3 — segundo entre modelos de pesos abertos, atrás do GLM-5.3 com 45 — e 93,40% no SWE-bench Verified sob o harness agêntico padronizado da Vals AI, atrás do Claude Opus 5 e do DeepSeek V4 Pro, mas próximo. Também lidera a Frontend Code Arena com 1679 Elo, à frente do Fable 5 com 1631 e do GPT-5.6 Sol com 1618. Se você viu o K3 citado com 57 ou 60, essa é a escala de índice substituída e não deve ser repetida.

O Fugu Ultra v2 não tem nenhuma pontuação independente de qualquer tipo. Foi anunciado em 11 de setembro de 2026 e ninguém fora da Sakana o executou.

Velocidade: uma medida, uma não

Kimi K3 é lento, e isso é medido, não apenas alegado: o Artificial Analysis registra 37,9 tokens por segundo, com tempo até o primeiro token de 3,80 segundos, e o classifica como notavelmente verboso. Para um modelo construído em torno de codificação agêntica de longo horizonte, a vazão é uma restrição real — um modelo lento em um loop longo custa tempo de relógio, não apenas dinheiro.

A Sakana não publica nenhum número de latência ou de throughput para o Fugu Ultra v2. Para um orquestrador, isso é discutivelmente honesto em vez de evasivo, porque o tempo de resposta depende inteiramente de quais modelos ele decide chamar e de quantas passagens faz. Mas também significa que você não pode modelar o custo em tempo de relógio de mudar para ele sem medir por conta própria. Para o Fugu Ultra anterior, testadores relataram publicamente execuções que se aproximavam de 30 minutos; esse é o modelo de junho de 2026 e não é evidência sobre o v2, mas é o número a ser superado quando você fizer benchmark.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

Pesos abertos, com uma ressalva que vale a pena ler

Os pesos do Kimi K3 podem ser descarregados, o que constitui uma diferença genuína em relação ao modelo exclusivamente alojado do Fugu Ultra v2 — mas a licença é mais restrita do que a expressão «pesos abertos» costuma implicar. O K3 é distribuído ao abrigo da Licença Kimi K3, e não de uma licença MIT ou Apache aprovada pela OSI, e a alegação amplamente repetida de que se trata de uma «MIT modificada» é contestada. Os termos exigem um acordo separado com a Moonshot para empresas de model-as-a-service com receitas superiores a 20 milhões de dólares em quaisquer doze meses consecutivos, além de atribuição para produtos com mais de 100 milhões de utilizadores mensais ou 20 milhões de dólares de receita mensal. O uso interno é isento.

Então, a forma honesta de enquadrar isto é: o K3 oferece pesos que pode ter em mãos, inspecionar, ajustar finamente e auto-hospedar, sujeitos a uma condição comercial atrelada à receita. O Fugu Ultra v2 não oferece nada disso — nem pesos, nem conjunto inspecionável, nem auto-hospedagem — mas também não impõe qualquer condição baseada em receita, porque não há nada para licenciar. Qual dessas duas é mais permissiva depende inteiramente de a sua empresa ser o tipo de empresa a que a licença K3 se dirige.

Uma ressalva prática se o plano for auto-hospedagem: o checkpoint do K3 tem aproximadamente 1,5 terabytes, e o fornecedor recomenda 64 ou mais aceleradores. "Pesos abertos" aqui significa uma decisão de cluster de inferência, não de laptop. Para a maioria das equipes, a API é o caminho sensato de qualquer forma — e é por isso que o suporte day-0 ao vLLM e ao SGLang importa mais do que o download.

O que o nosso próprio tráfego diz

Um dado que nenhum dos fornecedores publica, e que vale mais do que parece: no gateway OrcaRouter, o Kimi K3 é, com grande margem, o modelo mais usado entre todos os discutidos neste artigo, movimentando aproximadamente 3,27 bilhões de tokens nos últimos sete dias.

Isso não é um benchmark e não resolve nada sobre qualidade. Mas é uma grande amostra daquilo que os desenvolvedores realmente escolhem quando a decisão não lhes custa nada além do preço dos tokens, e indica que a combinação do K3 de uma janela fixa de 1M, pesos abertos e uma forte colocação na arena de programação já conquistou uma parcela substancial do trabalho agêntico real de contexto longo. O Fugu Ultra v2 não tem um sinal comparável, porque foi lançado hoje.

Screenshot of the OrcaRouter model page for Kimi K3 showing the kimi/kimi-k3 identifier, a 1M token context window, and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Chegando a cada um deles

O Kimi K3 está no OrcaRouter com a tarifa do próprio Moonshot — US$ 3,00 por milhão de entrada, US$ 0,30 em caso de acerto de cache, US$ 15,00 por milhão de saída — repassada sem nenhuma margem, então uma mudança de preço do fornecedor chega aqui no mesmo dia, e não conforme um cronograma de migração. Ele é compatível com a OpenAI na mesma URL base que o restante do catálogo e, como fica atrás do mesmo gateway que todo o resto, você pode colocá-lo em uma cadeia de failover ou rotear para ele condicionalmente, em vez de fixar um único provedor em um caminho de produção. Isso importa mais do que o habitual aqui: um modelo de 2,8T de parâmetros servido a 37,9 tokens por segundo é exatamente o tipo de dependência por trás da qual vale a pena ter um fallback.

O Fugu Ultra v2 não é roteado por nós. Ele está disponível na API compatível com OpenAI da própria Sakana AI, e a empresa diz que integrações existentes do Fugu migram para ele com a alteração de um único parâmetro. Ambos os modelos usam o mesmo formato de requisição, então uma avaliação que os coloca atrás de uma única flag é uma troca de base URL, não uma reescrita.

Qual escolher

Kimi K3 é a compra mais defensável para quase todas as cargas de trabalho. Custa metade do preço do Fugu Ultra v2 tanto na entrada quanto na saída, mantém-se estável ao longo de uma janela de 1M, sem queda abrupta em contextos longos, tem pontuação independente de 44 no índice atual da Artificial Analysis, é auto-hospedável sob uma licença condicionada à receita e já é, com ampla margem, o modelo com mais tráfego nesta comparação. Seus custos são a velocidade e a verbosidade: 37,9 tokens por segundo é genuinamente lento para loops agênticos, e a licença é rigorosa se você for uma grande empresa de modelo como serviço.

Fugu Ultra v2 é a compra certa se você quer a propriedade específica que a Sakana está vendendo — um nível de capacidade que decompõe trabalho difícil de várias etapas por um pool que exclui estruturalmente os fornecedores de ponta, de modo que nenhum modelo upstream isolado possa ser revogado, ter seu preço alterado ou ser cortado debaixo de seus pés. Sua vantagem no DeepSWE sobre o K3 é real e relatada pelo fornecedor; sua colocação entre os dois primeiros em sete de oito benchmarks e em testes que, em parte, não existem em nenhum outro lugar também é relatada pelo fornecedor.

O que se deve notar é que ambas são decisões de roteamento, e pede-se que você escolha uma altitude. O K3 roteia tokens para especialistas dentro de um modelo que você pode baixar e controlar. O Fugu Ultra v2 roteia tarefas para modelos que você não pode ver. A segunda é uma ideia maior e mais poderosa. É também aquela que você só pode aceitar pela fé — e custa cinco vezes mais por token ter essa fé.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente