
Fugu Max vs Kimi K3: Sakana Escolheu Este Critério, Então Vamos Lê-lo
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
O lançamento do Fugu Max pela Sakana AI nomeia exatamente três modelos para justificar seu preço, e o Kimi K3, da Moonshot AI, é um deles. A alegação é que o preço de saída do Fugu Max fica de 40 a 60 por cento abaixo desses três, o que faz do Kimi K3 — não o Grok 4.6, nem o Qwen3.8-Max — a referência que a própria Sakana escolheu para custo-benefício. Isso é uma coisa incomumente generosa para um fornecedor fazer: ele lhe entrega uma régua e diz onde segurá-la. Então esta página faz o óbvio e a segura. O Fugu Max foi lançado em 11 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída. O Kimi K3 está listado a US$ 3,00 e US$ 15,00. A alegação de 60 por cento na saída está aritmeticamente correta. O que a frase não menciona é que o modelo que está sofrendo o corte de preço publica um histórico completo de resultados medidos de forma independente, e o modelo que faz o corte de preço não publica nenhum.
A frase de 40 a 60 por cento, examinada
• Entrada — Fugu Max US$ 2,00 por 1 milhão de tokens vs. Kimi K3 US$ 3,00 por 1 milhão de tokens, uma economia de 33 por cento, em vez dos 40 a 60 por cento que o comunicado destaca
• Saída — Fugu Max US$ 6,00 por 1 milhão de tokens vs. Kimi K3 US$ 15,00 por 1 milhão de tokens, o que é 60 por cento abaixo do topo da faixa declarada pela Sakana
• Entrada em cache — Fugu Max $0,25 por 1M de tokens vs Kimi K3 $0,30 por 1M de tokens, uma diferença pequena o suficiente para que loops com uso intenso de cache não a percebam
• Janela de contexto — Fugu Max sem número divulgado no comunicado vs Kimi K3 1.048.576 tokens
• Reajuste de preços para prompts longos — Fugu Max sem faixa declarada vs. Kimi K3 com preço fixo em toda a janela, sem sobretaxa em qualquer comprimento
• Implantação — Fugu Max somente API do fornecedor, participação no pool não divulgada vs pesos baixáveis do Kimi K3 sob a Licença Kimi K3
• Avaliação independente — Fugu Max: nenhuma, e não existe página da Artificial Analysis para qualquer modelo Fugu, versus Kimi K3, um Índice de Inteligência da Artificial Analysis de 44 e 93,40% padronizados no SWE-bench Verified da Vals AI
Repare na forma daquela primeira linha. O intervalo em destaque, de 40 a 60 por cento, é o intervalo entre três concorrentes nomeados, e o Kimi K3 é o que produz os 60. Considerando apenas o input, a comparação é de 33 por cento, o que continua a ser uma economia real, mas uma frase diferente. Isto não é uma crítica aos preços — $2,00 e $6,00 são números genuinamente baixos para um sistema que alega resultados próximos da fronteira. É uma observação sobre qual número no anúncio está a fazer o trabalho de persuasão e sobre como o parágrafo está organizado em torno dele.
O Kimi K3 está no nosso catálogo à tarifa praticada pela própria Moonshot — $3,00 por milhão de entrada, $0,30 num acerto de cache, $15,00 por milhão de saída — repassada com 0% de margem, por isso, se a Moonshot alterar os seus preços a nova tarifa fica ativa na mesma chave no próprio dia em vez de num ciclo de migração. Isto importa aqui mais do que o habitual, porque um corte de preço a montante é precisamente o que erode ou alarga a diferença de 60 por cento em que toda esta comparação assenta.
O que o critério publica
O histórico do Kimi K3 é o oposto de esparso. O próprio model card da Moonshot reporta Terminal-Bench 2.1 com 88,3, GPQA Diamond com 93,5, HLE-Full com 43,5 subindo para 56,0 com ferramentas, SWE-Marathon com 42,0, OSWorld-Verified com 84,8, MCPMark-Verified com 94,5 e DeepSWE com 67,5. Tudo divulgado pelo fornecedor, e há muito disso.
A camada independente também existe, que é a parte que importa para esta comparação. A Artificial Analysis pontua o Kimi K3 com 44 no v4.3 Intelligence Index — segundo entre modelos de pesos abertos, atrás do GLM-5.3, com 45 — com throughput registrado de 37,9 tokens de saída por segundo e tempo até o primeiro token de 3,80 segundos. O harness agêntico padronizado da Vals AI o coloca em 93,40% no SWE-bench Verified, atrás do Claude Opus 5 e do DeepSeek V4 Pro, mas próximo. Ele também lidera a Frontend Code Arena com 1679 Elo, à frente do Claude Fable 5, com 1631, e do GPT-5.6 Sol, com 1618. Uma ressalva: se você viu o Kimi K3 ser citado com 57 ou 60 no Intelligence Index, esses são números pré-reformulação, de antes de a Artificial Analysis recalibrar a escala em setembro de 2026, e não devem ser repetidos junto com os números atuais.
Há também um sinal de uso, e ele vem do nosso próprio gateway, não do marketing de ninguém: o Kimi K3 movimentou aproximadamente 3,27 bilhões de tokens pelo OrcaRouter nos últimos sete dias, o maior tráfego entre todos os modelos desta comparação. Isso não é uma medida de qualidade. É uma grande amostra daquilo a que os desenvolvedores recorrem quando o único custo de escolha é o preço do token, e mostra que a janela fixa de 1M e os pesos abertos já conquistaram uma parcela substancial do trabalho real de horizonte longo.

O placar sem números
A Sakana relata que o Fugu Max obtém a melhor pontuação geral em seis benchmarks: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish. Também afirma que o Max amplia a fronteira de Pareto de custo-desempenho em sete dos dez benchmarks. Ambas são afirmações sobre posição em um gráfico. Nenhuma delas vem acompanhada de um valor, de uma margem ou do número de um concorrente ao lado.
As duas listas mal se tocam, o que é o problema prático. O Kimi K3 reporta 88,3 no Terminal-Bench 2.1; a Sakana diz que o Fugu Max obtém o melhor resultado geral no Terminal Bench 2.1 e não publica nada para comparar com ele. Essa única linha é a ilustração mais clara de todo o confronto: os dois fornecedores citam o mesmo teste, um publica um número, e o outro publica a palavra "best". Enquanto a Sakana não publicar o número, nenhuma evidência publicada responde se o Fugu Max supera o Kimi K3 no benchmark que a Sakana escolheu usar como principal.
Há uma leitura justa do lançamento que vale a pena enunciar. Fugu Max é o nível de custo — lançado no mesmo dia que o Fugu Ultra v2, que é o avanço de capacidade a US$ 5,00 de entrada e US$ 30,00 de saída — e seu argumento é traçado num gráfico de Pareto onde a pontuação por dólar, e não a pontuação, é a alegação. Nesse enquadramento, um número de benchmark puro seria a estatística menos honesta. O problema é que o lançamento também omite o denominador: a própria cobertura da Sakana admite que trocar de modelo no meio da tarefa pode reduzir a reutilização do cache de contexto e gerar tokens de orquestração extras, e confirma que a empresa não divulgou a taxa de acerto de cache do Max nem seu custo total de tokens por tarefa. Portanto, a única medição que resolveria um argumento de nível de custo é a que não foi fornecida.
Pesos que você pode segurar, ou um pool que você não consegue ver
É aqui que os dois produtos deixam completamente de ser comparáveis.
O Kimi K3 é distribuído com pesos baixáveis, o que é uma verdadeira válvula de escape: se os preços ou os termos mudarem, o modelo pode ser servido a partir da sua própria infraestrutura. A licença é mais restrita do que "pesos abertos" normalmente implica. Trata-se da Licença Kimi K3, e não de uma concessão aprovada pela OSI, e a descrição frequentemente repetida dela como MIT modificada é contestada. Os termos exigem um acordo separado com a Moonshot para empresas de modelo como serviço com receita acima de US$ 20 milhões em quaisquer doze meses consecutivos, além de atribuição para produtos com mais de 100 milhões de usuários mensais ou US$ 20 milhões de receita mensal, com uso interno isento. E a escala prática é real: o checkpoint tem aproximadamente 1,5 terabytes e a Moonshot recomenda 64 ou mais aceleradores, de modo que a auto-hospedagem é uma decisão de cluster de inferência, e não de laptop.
O Fugu Max não oferece nada disso — nem pesos, nem um pool inspecionável, nem opção de auto-hospedagem — e, em troca, não impõe qualquer condição de licença, porque não há nada para licenciar. O benefício declarado pela Sakana é o inverso do controlo: um pool que abrange modelos de pesos abertos e especializados, ampliado para o Max com a família NVIDIA Nemotron, significa que a depreciação ou a reprecificação de um único fornecedor a montante não pode derrubar o seu produto. Isto é uma verdadeira proteção. Também é impossível de verificar do exterior, porque a composição não é publicada deliberadamente, e significa que um resultado do Fugu Max tem uma data de validade que um resultado do Kimi K3 não tem.
Pesos abertos e um pool não divulgado são duas respostas diferentes para o mesmo medo. Uma diz que você pode sair. A outra diz que não há nada a deixar.
Onde a janela plana decide isso
O contexto de 1.048.576 tokens do Kimi K3 é uniforme — sem camada de contexto longo, sem sobretaxa em nenhuma extensão. O anúncio do Fugu Max não declara janela alguma, então não há nada com que compará-lo e nada com que planejar. Para a codificação agêntica de horizonte longo à qual ambos os produtos se destinam, em que as sessões passam a maior parte de sua vida em profundidade no contexto, essa assimetria importa mais do que a tabela de preços.
Velocidade é a imagem espelhada do mesmo problema. Os 37,9 tokens por segundo do Kimi K3, com um tempo até ao primeiro token de 3,80 segundos, são medidos, e é lento — genuinamente uma limitação para um modelo construído em torno de longos ciclos, e a Artificial Analysis assinala-o como notavelmente verboso. A Sakana não publica qualquer valor de latência ou de débito para o Fugu Max, o que, para um orquestrador, é discutivelmente honesto em vez de evasivo: o tempo de resposta depende dos modelos que escolhe e de quantas passagens faz. Mas isso significa que não consegue modelar o custo em tempo de relógio da troca sem o medir por si mesmo. Para o anterior Fugu Ultra, os utilizadores relataram publicamente execuções que se aproximavam dos 30 minutos. Esse é o modelo de junho de 2026 e não constitui evidência sobre o Max, mas é o número a bater quando fizer o seu benchmark.

O veredito, nos próprios termos da Sakana
A Sakana escolheu o Kimi K3 como um dos três modelos em relação aos quais o Fugu Max custa menos e, no preço de saída, a afirmação se sustenta: US$ 6,00 contra US$ 15,00 é 60% abaixo, exatamente o limite superior da faixa declarada. Tomando o comunicado ao pé da letra, o Fugu Max é o produto mais barato.
Agora aplique a régua que o lançamento evitou. O Kimi K3 é 33% mais caro na entrada e 150% mais caro na saída — e, por esse valor, oferece uma janela de 1M de tokens sem um penhasco de reprecificação, um checkpoint baixável sob uma licença condicionada à receita, uma posição independente de 44 no Intelligence Index, uma pontuação padronizada de 93,40% no SWE-bench Verified, o primeiro lugar na Frontend Code Arena e o tráfego real mais intenso de todos os modelos desta comparação. O Fugu Max oferece uma tarifa mais baixa nos dois lados do token, seis vitórias não quantificadas em benchmarks, uma taxa de cache metade da do K3, sem taxa de acerto publicada, e um pool que você não consegue inspecionar.
A conclusão honesta é que a Sakana escolheu uma régua que a favorece no preço e não lhe deu nada para verificar em capacidade. Se sua carga de trabalho for de alto volume e suas tarefas forem do tipo que um coordenador consegue decompor de forma confiável, a diferença de tarifa é dinheiro de verdade, e o Fugu Max merece um piloto com escopo definido e contabilização de tokens ativada desde a primeira requisição. Se você precisa de uma decisão de produção que consiga defender neste trimestre — uma janela com a qual possa planejar, uma pontuação que possa apontar e um modelo que você ainda poderia executar se o fornecedor desaparecesse — o Kimi K3 é a resposta, e ele está no OrcaRouter pelo preço de tabela da Moonshot, com a tarifa do provedor repassada sem alterações.

