
Intern-S2-397B vs Grok 4.6: Quem dá as cartas
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Intern-S2-397B e Grok 4.6 foram lançados com cerca de um mês de diferença e respondem à mesma pergunta de fundo de maneiras opostas: quem fica no controle do raciocínio. Grok 4.6, o carro-chefe da xAI que entrou no ar em 12 de agosto de 2026, vende a você um botão — um controle configurável de esforço de raciocínio em uma API fechada com preço de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com uma janela de 500.000 tokens e as ferramentas do lado do servidor da xAI cobradas à parte. Intern-S2-397B, o modelo multimodal científico de 403 bilhões de parâmetros que a equipe InternLM do Shanghai AI Laboratory lançou sob Apache-2.0 em 13 de setembro, entrega a máquina inteira — pesos, alternância de pensamento, caminho de visão, cabeça de séries temporais — e espera que você a execute por conta própria. Um é alugado com botões; o outro é possuído de forma definitiva. A comparação que importa aqui não é qual pontua mais em uma tabela de benchmark; é qual tipo de controle sua carga de trabalho realmente precisa, e quanto cada tipo custa.
Dois mostradores diferentes
A forma mais clara de distinguir esses dois é observar onde ficam os controles de raciocínio. O Grok 4.6 expõe uma configuração de esforço de raciocínio por meio da API da xAI, e ao redor dela há um conjunto de ferramentas do lado do servidor — chamada de funções, busca na web, busca no X, execução de código — que a xAI opera e cobra separadamente. Você ajusta o esforço, encadeia as ferramentas que ela oferece e nunca toca em um peso. O comportamento do modelo é propriedade da xAI e problema da xAI; sua alavanca é um parâmetro na solicitação.
O Intern-S2-397B oferece a você um conjunto diferente de alavancas, e elas estão mais abaixo na pilha. O raciocínio fica ativado por padrão e você o desativa por solicitação com enable_thinking=False. Como o modelo é Apache-2.0, você também pode pegar os pesos e ajustar o próprio comportamento de raciocínio com seus dados, e então servir o resultado no LMDeploy, vLLM ou SGLang. Sua superfície de entrada é mais ampla do que uma API de texto e imagem: ela aceita sinais de séries temporais e produz previsões, uma capacidade atualmente integrada apenas via LMDeploy, e foi treinado para trabalho de agente de longo horizonte em ambientes isolados. A contrapartida é igualmente clara — esse nível de controle só faz sentido se você estiver disposto a operar o hardware e a pilha de serviço que vêm com ele.
• Controle de raciocínio — Grok 4.6: ajuste de esforço de raciocínio em uma API fechada vs. Intern-S2-397B: alternância de enable_thinking mais controle total no nível de pesos sob Apache-2.0.
• Ferramentas — Grok 4.6: busca na web do lado do servidor da xAI, busca no X e execução de código, com cobrança separada vs. Intern-S2-397B: chamada de ferramentas que você mesmo integra, além de um caminho de previsão de séries temporais via LMDeploy.
• Entradas — Grok 4.6: texto, imagem, arquivo vs Intern-S2-397B: texto, imagem, série temporal.
Contexto — Grok 4.6: 500.000 tokens vs Intern-S2-397B: 256K de raciocínio de texto, 64K multimodal, ambos os números provenientes do cartão do modelo.
• Preço — Grok 4.6: $2,00 / $6,00 por 1M, escalonando para $4,00 / $12,00 acima de 200K tokens vs Intern-S2-397B: sem tabela de preços; auto-hospedagem ou a API oficial do Intern.
O que os números realmente abrangem
Todos os números do Intern-S2-397B abaixo são do próprio InternLM, executados no OpenCompass, no VLMEvalKit e no AgentCompass e publicados junto com os pesos, sem reprodução independente. Os números do Grok 4.6 são outro tipo de coisa: acumularam-se pela arena pública e pela Artificial Analysis depois que o modelo entrou em operação, então carregam um rótulo de terceiros.
No lado das medições independentes, o Grok 4.6 está em 44 no atual Índice de Inteligência da Artificial Analysis, com um GPQA Diamond de 94,9, um Humanity's Last Exam de 61,0 e uma pontuação de programação de 76,8, e a Artificial Analysis situa o valor do TerminalBench 2.1 dele perto de 80,3. Do lado do fornecedor, a ficha do Intern-S2-397B reporta 89,77 no MMLU Pro, 93,56 no HMMT-2026, 81,68 no MMMU Pro e 68,54 no SWE-bench-Pro, ao lado de linhas científicas em que ele parece de outra espécie: 55,71 no Biology-Instructions, 63,28 no SciReasoner 1.5, 53,95 no Mol-Instructions, 62,35 no MolecularIQ. O único número na tabela do fornecedor que deveria fazer um criador de agentes recuar é o TerminalBench 2.1 em 64,04 — um valor que os próprios criadores do modelo relatam perder para uma geração fechada mais antiga por uma margem ampla, exatamente no segmento de trabalho em terminal em que um modelo de fronteira alugado como o Grok 4.6 é mais forte.
Leia essa divisão como um retrato, não como um ranking. O Intern-S2-397B é um especialista científico que é um modelo geral competente; o Grok 4.6 é um generalista que tem um interesse passageiro por ciência. Que as linhas científicas estejam desequilibradas é esperado — nenhum modelo carro-chefe generalista foi pré-treinado em páginas brutas de literatura científica com figuras, layout e notação simbólica em conjunto, e é precisamente esse o paradigma em torno do qual o Intern-S2-397B foi construído. Nada em qualquer uma das duas bases de evidências sustenta que "o Intern-S2-397B é tão bom quanto o Grok 4.6 em raciocínio arbitrário", e nada nas evidências do Grok 4.6 sugere que ele tenha sido ajustado para análise de sequências multi-ômicas.
O preço do controle
O Grok 4.6 tem um preço que você pode colocar numa planilha: US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com a tarifa subindo para US$ 4,00 / US$ 12,00 assim que um prompt ultrapassa 200.000 tokens, além de um nível de prioridade opcional para respostas mais rápidas. Ele está disponível pelo OrcaRouter pelo preço de tabela da xAI repassado com 0% de markup, então uma mudança de tarifa na xAI chega aqui no mesmo dia, sem delta de intermediário — o dial que você aluga permanece com o preço que o fornecedor define.
O Intern-S2-397B não tem nenhuma tarifa por token publicada. A ficha do modelo menciona uma API Intern oficial, mas a comparação econômica que as pessoas realmente querem fazer é com as opções auto-hospedadas: um checkpoint de 403B parâmetros, cerca de 807 GB de pesos distribuídos em 188 shards em BF16, ou seja, um nó multi-GPU de respeito, com a versão FP8 reduzindo a pegada aproximadamente pela metade. Se você já tem essa capacidade, o custo marginal da próxima consulta científica se aproxima da eletricidade, e é exatamente esse o ponto da posição Apache-2.0. Se você não tem, o modelo "gratuito" é um piloto de despesa de capital, não uma rubrica orçamentária.
O que um roteador proporciona nesta combinação específica é a costura, e não o preço. O Grok 4.6 fica na chave que você já tem para tráfego geral de produção; o Intern-S2-397B não é roteado no OrcaRouter — ele é um checkpoint totalmente novo, e seu caminho até ele é a API do próprio fornecedor ou uma implantação auto-hospedada. Encaminhe o raciocínio geral e sensível à latência para o modelo medido, mantenha o trabalho científico em lote no modelo que você executa e deixe o failover automático cobrir você quando o endpoint de qualquer um dos lados estiver indisponível. A fronteira entre eles se torna uma regra de roteamento em vez de uma segunda integração.

Qual escolher
Escolha o Grok 4.6 quando a tarefa for geral, o raciocínio precisar voltar rápido e correto, e você não quiser ser dono da stack que o produz. Sua janela de 500K, seu GPQA Diamond medido em 94,9 e seu conjunto de ferramentas são recursos de produção, e o medidor de $2/$6 é o que você paga por não operar nada.
Escolha o Intern-S2-397B quando a entrada for científica — um artigo repleto de figuras, um diagrama molecular, um sinal de série temporal — e quando o raciocínio tiver de acontecer sobre dados que não podem sair do seu ambiente, ou sobre um comportamento que você mesmo queira ajustar. A Apache-2.0 torna isso possível; nenhuma API alugada faz isso. Inclua o hardware no orçamento, não espere um placar independente tão cedo e trate cada número em sua ficha como uma alegação até que alguém fora da InternLM reproduza um.


