Um cartão de destaque gerado que compara o Intern-S2-397B e o Grok 4.6, mostrando à esquerda um modelo científico de pesos abertos com um botão de raciocínio rotulado enable_thinking e uma forma de onda de série temporal, e à direita um endpoint de nuvem fechado com um seletor de esforço de raciocínio e ícones de ferramentas do lado do servidor, rotulado com o contraste entre o controle auto-hospedado do Apache-2.0 e uma API medida de $2 / $6, com o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Intern-S2-397B vs Grok 4.6: Quem dá as cartas

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Intern-S2-397B e Grok 4.6 foram lançados com cerca de um mês de diferença e respondem à mesma pergunta de fundo de maneiras opostas: quem fica no controle do raciocínio. Grok 4.6, o carro-chefe da xAI que entrou no ar em 12 de agosto de 2026, vende a você um botão — um controle configurável de esforço de raciocínio em uma API fechada com preço de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com uma janela de 500.000 tokens e as ferramentas do lado do servidor da xAI cobradas à parte. Intern-S2-397B, o modelo multimodal científico de 403 bilhões de parâmetros que a equipe InternLM do Shanghai AI Laboratory lançou sob Apache-2.0 em 13 de setembro, entrega a máquina inteira — pesos, alternância de pensamento, caminho de visão, cabeça de séries temporais — e espera que você a execute por conta própria. Um é alugado com botões; o outro é possuído de forma definitiva. A comparação que importa aqui não é qual pontua mais em uma tabela de benchmark; é qual tipo de controle sua carga de trabalho realmente precisa, e quanto cada tipo custa.

Dois mostradores diferentes

A forma mais clara de distinguir esses dois é observar onde ficam os controles de raciocínio. O Grok 4.6 expõe uma configuração de esforço de raciocínio por meio da API da xAI, e ao redor dela há um conjunto de ferramentas do lado do servidor — chamada de funções, busca na web, busca no X, execução de código — que a xAI opera e cobra separadamente. Você ajusta o esforço, encadeia as ferramentas que ela oferece e nunca toca em um peso. O comportamento do modelo é propriedade da xAI e problema da xAI; sua alavanca é um parâmetro na solicitação.

O Intern-S2-397B oferece a você um conjunto diferente de alavancas, e elas estão mais abaixo na pilha. O raciocínio fica ativado por padrão e você o desativa por solicitação com enable_thinking=False. Como o modelo é Apache-2.0, você também pode pegar os pesos e ajustar o próprio comportamento de raciocínio com seus dados, e então servir o resultado no LMDeploy, vLLM ou SGLang. Sua superfície de entrada é mais ampla do que uma API de texto e imagem: ela aceita sinais de séries temporais e produz previsões, uma capacidade atualmente integrada apenas via LMDeploy, e foi treinado para trabalho de agente de longo horizonte em ambientes isolados. A contrapartida é igualmente clara — esse nível de controle só faz sentido se você estiver disposto a operar o hardware e a pilha de serviço que vêm com ele.

• Controle de raciocínio — Grok 4.6: ajuste de esforço de raciocínio em uma API fechada vs. Intern-S2-397B: alternância de enable_thinking mais controle total no nível de pesos sob Apache-2.0.

• Ferramentas — Grok 4.6: busca na web do lado do servidor da xAI, busca no X e execução de código, com cobrança separada vs. Intern-S2-397B: chamada de ferramentas que você mesmo integra, além de um caminho de previsão de séries temporais via LMDeploy.

• Entradas — Grok 4.6: texto, imagem, arquivo vs Intern-S2-397B: texto, imagem, série temporal.

Contexto — Grok 4.6: 500.000 tokens vs Intern-S2-397B: 256K de raciocínio de texto, 64K multimodal, ambos os números provenientes do cartão do modelo.

• Preço — Grok 4.6: $2,00 / $6,00 por 1M, escalonando para $4,00 / $12,00 acima de 200K tokens vs Intern-S2-397B: sem tabela de preços; auto-hospedagem ou a API oficial do Intern.

O que os números realmente abrangem

Todos os números do Intern-S2-397B abaixo são do próprio InternLM, executados no OpenCompass, no VLMEvalKit e no AgentCompass e publicados junto com os pesos, sem reprodução independente. Os números do Grok 4.6 são outro tipo de coisa: acumularam-se pela arena pública e pela Artificial Analysis depois que o modelo entrou em operação, então carregam um rótulo de terceiros.

No lado das medições independentes, o Grok 4.6 está em 44 no atual Índice de Inteligência da Artificial Analysis, com um GPQA Diamond de 94,9, um Humanity's Last Exam de 61,0 e uma pontuação de programação de 76,8, e a Artificial Analysis situa o valor do TerminalBench 2.1 dele perto de 80,3. Do lado do fornecedor, a ficha do Intern-S2-397B reporta 89,77 no MMLU Pro, 93,56 no HMMT-2026, 81,68 no MMMU Pro e 68,54 no SWE-bench-Pro, ao lado de linhas científicas em que ele parece de outra espécie: 55,71 no Biology-Instructions, 63,28 no SciReasoner 1.5, 53,95 no Mol-Instructions, 62,35 no MolecularIQ. O único número na tabela do fornecedor que deveria fazer um criador de agentes recuar é o TerminalBench 2.1 em 64,04 — um valor que os próprios criadores do modelo relatam perder para uma geração fechada mais antiga por uma margem ampla, exatamente no segmento de trabalho em terminal em que um modelo de fronteira alugado como o Grok 4.6 é mais forte.

Leia essa divisão como um retrato, não como um ranking. O Intern-S2-397B é um especialista científico que é um modelo geral competente; o Grok 4.6 é um generalista que tem um interesse passageiro por ciência. Que as linhas científicas estejam desequilibradas é esperado — nenhum modelo carro-chefe generalista foi pré-treinado em páginas brutas de literatura científica com figuras, layout e notação simbólica em conjunto, e é precisamente esse o paradigma em torno do qual o Intern-S2-397B foi construído. Nada em qualquer uma das duas bases de evidências sustenta que "o Intern-S2-397B é tão bom quanto o Grok 4.6 em raciocínio arbitrário", e nada nas evidências do Grok 4.6 sugere que ele tenha sido ajustado para análise de sequências multi-ômicas.

O preço do controle

O Grok 4.6 tem um preço que você pode colocar numa planilha: US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com a tarifa subindo para US$ 4,00 / US$ 12,00 assim que um prompt ultrapassa 200.000 tokens, além de um nível de prioridade opcional para respostas mais rápidas. Ele está disponível pelo OrcaRouter pelo preço de tabela da xAI repassado com 0% de markup, então uma mudança de tarifa na xAI chega aqui no mesmo dia, sem delta de intermediário — o dial que você aluga permanece com o preço que o fornecedor define.

O Intern-S2-397B não tem nenhuma tarifa por token publicada. A ficha do modelo menciona uma API Intern oficial, mas a comparação econômica que as pessoas realmente querem fazer é com as opções auto-hospedadas: um checkpoint de 403B parâmetros, cerca de 807 GB de pesos distribuídos em 188 shards em BF16, ou seja, um nó multi-GPU de respeito, com a versão FP8 reduzindo a pegada aproximadamente pela metade. Se você já tem essa capacidade, o custo marginal da próxima consulta científica se aproxima da eletricidade, e é exatamente esse o ponto da posição Apache-2.0. Se você não tem, o modelo "gratuito" é um piloto de despesa de capital, não uma rubrica orçamentária.

O que um roteador proporciona nesta combinação específica é a costura, e não o preço. O Grok 4.6 fica na chave que você já tem para tráfego geral de produção; o Intern-S2-397B não é roteado no OrcaRouter — ele é um checkpoint totalmente novo, e seu caminho até ele é a API do próprio fornecedor ou uma implantação auto-hospedada. Encaminhe o raciocínio geral e sensível à latência para o modelo medido, mantenha o trabalho científico em lote no modelo que você executa e deixe o failover automático cobrir você quando o endpoint de qualquer um dos lados estiver indisponível. A fronteira entre eles se torna uma regra de roteamento em vez de uma segunda integração.

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

Qual escolher

Escolha o Grok 4.6 quando a tarefa for geral, o raciocínio precisar voltar rápido e correto, e você não quiser ser dono da stack que o produz. Sua janela de 500K, seu GPQA Diamond medido em 94,9 e seu conjunto de ferramentas são recursos de produção, e o medidor de $2/$6 é o que você paga por não operar nada.

Escolha o Intern-S2-397B quando a entrada for científica — um artigo repleto de figuras, um diagrama molecular, um sinal de série temporal — e quando o raciocínio tiver de acontecer sobre dados que não podem sair do seu ambiente, ou sobre um comportamento que você mesmo queira ajustar. A Apache-2.0 torna isso possível; nenhuma API alugada faz isso. Inclua o hardware no orçamento, não espere um placar independente tão cedo e trate cada número em sua ficha como uma alegação até que alguém fora da InternLM reproduza um.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.