
Intern-S2-397B vs. Kimi K3: O Modelo Científico de 397B e o Gigante de Raciocínio de 2,8T
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Intern-S2-397B e Kimi K3 ficam em lados opostos da linha dos pesos abertos que definirá o restante de 2026: o especialista científico baixável versus o generalista de contexto longo comprovado de forma independente. O Intern-S2-397B é o modelo multimodal científico de 403 bilhões de parâmetros que a InternLM lançou sob Apache-2.0 em 13 de setembro de 2026 — sem tabela de preços, sem pontuação independente e com um caminho de visão treinado em páginas brutas de literatura científica. O Kimi K3 é o carro-chefe de mistura de especialistas de 2,8 trilhões de parâmetros da Moonshot AI, lançado em julho de 2026 a US$ 3,00 por milhão de tokens de entrada e US$ 15,00 por milhão de tokens de saída, que abriu seus pesos em 27 de julho sob uma licença MIT Modificada e passou por seis semanas de avaliação independente. O incomum nesse confronto é que ambos os modelos têm a mesma ambição de longo horizonte — continuar trabalhando em uma tarefa grande e bagunçada — e a resolvem em direções opostas.
Ambos ambiciosos, mecanismos opostos
A ambição é compartilhada: cada modelo quer ser aquilo que segue em frente quando a tarefa é longa. Eles conseguem isso de maneiras diferentes, e a diferença é arquitetônica.
A resposta do Kimi K3 é o contexto. Uma janela de 1.048.576 tokens tanto na entrada quanto na saída significa que um repositório inteiro, uma sala de dados inteira ou um loop de agente de cinquenta etapas pode caber em uma única conversa. A pilha de inferência Mooncake da Moonshot supostamente mantém taxas de acerto de cache acima de 90% em cargas de trabalho de programação, e é assim que um preço de saída de US$ 15 por milhão se torna viável na prática. O Kimi K3 expõe um controle de nível superior reasoning_effort e não aceita parâmetros de amostragem, raciocina na profundidade máxima por padrão e espera que você reproduza reasoning_content e tool_calls anteriores literalmente em loops de ferramentas multiturno, ou a qualidade degrada.
A resposta do Intern-S2-397B é especialização mais controle no nível de pesos. Seu contexto — raciocínio de texto de 256K e multimodal de 64K, ambos os números do model card — é uma categoria diferente de janela, suficiente para um artigo substancial ou uma longa sessão de pesquisa, mas não para um conjunto de trabalho de um milhão de tokens. O que ele oferece, em vez disso, é um caminho de visão que lê literatura científica nativamente — figuras, layout, notação simbólica e prosa em conjunto — e uma entrada de séries temporais que produz previsões, além de um raciocínio que vem ativado por padrão e pode ser alternado por solicitação. Se sua tarefa longa for científica, o modelo foi treinado exatamente para isso; se sua tarefa longa for uma base de código, este não é o modelo com a janela de um milhão de tokens para isso.
• Contexto — Kimi K3: 1.048.576 tokens de entrada e saída vs Intern-S2-397B: 256K de texto / 64K multimodal.
• Escala — Kimi K3: 2,8T no total, ~104B ativos por token vs Intern-S2-397B: 403B no total, 512 especialistas / 10 ativos.
• Superfície de controle — Kimi K3: dial reasoning_effort, sem parâmetros de amostragem vs Intern-S2-397B: alternância enable_thinking mais controle total em nível de pesos sob Apache-2.0.
• Entradas — Kimi K3: texto, imagem vs Intern-S2-397B: texto, imagem, séries temporais.
• Pesos — Kimi K3: aberto sob Modified MIT (27 de julho) vs Intern-S2-397B: aberto sob Apache-2.0 (13 de setembro).
• Evidência independente — Kimi K3: seis semanas de pontuações de terceiros vs. Intern-S2-397B: nenhuma ainda.
A assimetria de evidências é a verdadeira diferença
O Kimi K3 passou pelo crivo independente e saiu com pontuações nas quais dá para se basear. O Artificial Analysis o coloca na casa dos 40 e poucos em seu atual Índice de Inteligência, com um GPQA Diamond no início dos 90, um HLE na casa dos 40 e poucos, uma recuperação de contexto longo medida de forma independente de 88,7 e uma pontuação de codificação na casa dos 70 e poucos. Ele ocupa o primeiro lugar no Frontend Code Arena (Elo na casa dos 1670) e marcou 91,2 no BrowseComp, o maior número nesse benchmark de recuperação de longo horizonte — embora a própria Moonshot alerte que o K3 "ainda fica atrás dos modelos proprietários mais poderosos", e vários de seus números divulgados no lançamento continuem sendo informados pelo fornecedor.
A evidência do Intern-S2-397B é a sua própria tabela de lançamento, executada através do OpenCompass, VLMEvalKit e AgentCompass, publicada horas antes de você ler isto. Cada número é do próprio fornecedor e não foi reproduzido: MMLU Pro 89,77, MMMU Pro 81,68, HMMT-2026 93,56, SWE-bench-Pro 68,54, e TerminalBench 2.1 em 64,04 — um valor que a ficha mostra perdendo para uma geração fechada mais antiga por uma ampla margem. As suas linhas científicas são os números que sustentam o argumento de um especialista: 55,71 em Biology-Instructions, 63,28 em SciReasoner 1.5, 53,95 em Mol-Instructions, 62,35 em MolecularIQ. As duas bases de evidência não se tocam, e é por isso que o enquadramento honesto deste confronto não é "quem vence", mas "que tipo de evidência a sua carga de trabalho precisa".

Quanto custa cada um, edição open-weights
Ambos os modelos têm pesos abertos, o que desloca a questão de custo da habitual narrativa de cobrança por uso versus gratuidade para uma comparação entre duas propostas de hospedagem. O Kimi K3 tem um preço de API publicado — US$ 3,00 / US$ 15,00 por milhão de tokens na tabela da Moonshot, repassado no OrcaRouter com 0% de margem, além do preço de leitura de cache — e também é baixável: um lançamento de pesos abertos em 96 shards que exige hardware da classe de supernó, 64 ou mais aceleradores, para servir. O público prático de um K3 auto-hospedado são equipes com orçamentos de datacenter. O Intern-S2-397B não tem preço de API publicado; o model card aponta para a API oficial da Intern, e a economia real está na auto-hospedagem: cerca de 807 GB de pesos distribuídos em 188 shards em BF16, um nó multi-GPU de peso, com uma versão em FP8 que reduz a pegada pela metade.
Ambos os modelos são chamáveis através da mesma interface, se fizer o encaminhamento: O Kimi K3 está no OrcaRouter ao preço de tabela da Moonshot, com 0% de margem, enquanto o Intern-S2-397B não está encaminhado — um checkpoint Apache-2.0 novíssimo, sendo o seu caminho até ele a API do próprio fornecedor ou uma implementação auto-hospedada. O valor do encaminhamento neste confronto está em manter o tráfego generalista de contexto longo na chave que já tem e o trabalho científico em lote no modelo que executa, com failover automático entre os dois. A DSL transforma essa fronteira numa configuração, em vez de numa segunda integração.

O veredito
Escolha o Kimi K3 quando o trabalho for de generalista de contexto longo — codificação de repositório inteiro, loops de agente sustentados, trabalho de conhecimento que precisa de um milhão de tokens de memória de trabalho — e você quiser um placar independente por trás disso. É o modelo com as evidências mais fortes em todos os sentidos, seus pesos abertos são reais (Modified MIT, 27 de julho), e, se você já opera infraestrutura da classe supernode, a economia por token com caching é favorável.
Escolha o Intern-S2-397B quando a tarefa for científica: artigos repletos de figuras, diagramas moleculares, literatura digitalizada, sinais de séries temporais e dados que precisam permanecer dentro do seu perímetro ou pesos que você deseja ajustar finamente com resultados proprietários. O Apache-2.0 torna isso possível, nenhuma API alugada torna, e as linhas científicas no cartão são de uma espécie diferente daquilo para que um generalista jamais foi ajustado. Reserve orçamento para o hardware, faça sua própria avaliação e trate cada número publicado sobre ele como uma alegação até que alguém de fora da InternLM reproduza um.

