Um cartão de destaque gerado comparando Intern-S2-397B e Qwen3.8-Max, mostrando à esquerda um checkpoint científico aberto com uma entrada de página de figura e um selo Apache-2.0, e à direita um endpoint carro-chefe com medição, com um bloco de tabela de preços indicando $2 / $6 e um medidor de contexto de 1M tokens, com o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Intern-S2-397B vs Qwen3.8-Max: Dois Carros-Chefe Chineses, Apostas Econômicas Opostas

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Intern-S2-397B e Qwen3.8-Max são os dois lançamentos de ponta chineses de maior impacto do início de setembro de 2026, e fizeram apostas econômicas opostas. O Intern-S2-397B, o modelo multimodal científico de 403 bilhões de parâmetros que a equipe InternLM do Shanghai AI Laboratory lançou sob Apache-2.0 em 13 de setembro, aposta que pesos abertos são o caminho para vencer cargas de trabalho científicas e agênticas: nenhum preço por token, pesos no Hugging Face e seu próprio hardware como medidor. O Qwen3.8-Max, o carro-chefe de 2,4 trilhões de parâmetros da Alibaba que entrou em disponibilidade geral (GA) em 3 de agosto e foi atualizado em 2 de setembro, aposta em uma API paga a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída em um contexto de 1 milhão de tokens, com pesos abertos chegando uma semana após a disponibilidade geral e uma pontuação independente da Artificial Analysis já no placar. O confronto entre eles é menos sobre quais benchmarks vencem e mais sobre qual aposta — propriedade ou um endpoint medido — combina com o formato da sua carga de trabalho.

Dois carros-chefe, duas apostas

Qwen3.8-Max é o tier de maior capacidade da Alibaba na linha Qwen, um modelo esparso de mistura de especialistas (sparse mixture-of-experts) com 2,4 trilhões de parâmetros totais e cerca de 95 bilhões ativados por token, distribuídos em 512 especialistas, com 10 ativos mais um compartilhado. Ele traz uma janela de contexto de 1M de tokens (983.616 tokens com o modo de raciocínio ativado na API hospedada), um teto de saída de 131.072 tokens, entrada de texto, imagem e vídeo, e é servido por meio de um endpoint compatível com a OpenAI. Sua jogada de precificação que o define é uma tarifa fixa: os mesmos US$ 2,00 / US$ 6,00, seja seu prompt de 5.000 tokens ou de 900.000, com entrada em cache custando menos — sem sobretaxa de contexto longo, que é exatamente a alavanca que a maioria dos concorrentes ainda cobra. A Alibaba o posiciona diretamente contra GPT-5.5, Claude Opus 4.7 e Gemini 3.1 Pro em seu próprio guia de migração.

O Intern-S2-397B é um carro-chefe de formato diferente. É um modelo de mistura de especialistas com 60 camadas e 512 especialistas (10 ativos por token), um contexto de raciocínio de texto de 256K e multimodal de 64K, uma superfície de entrada de texto, imagem e séries temporais, e um paradigma de pré-treinamento que lê páginas brutas de literatura científica — figuras, layout, notação simbólica e prosa — em vez de primeiro extrair o texto. Seu aprendizado por reforço abrange mais de vinte domínios científicos, e ele foi treinado para trabalho de agente de longo horizonte em ambientes em sandbox. Sua precificação não é uma tabela de preços, mas a ausência dela: faça a auto-hospedagem dos pesos Apache-2.0, ou solicite acesso à API oficial do Intern.

• Preço — Intern-S2-397B: sem tabela de preços; auto-hospedagem ou Intern API vs Qwen3.8-Max: $2,00 / $6,00 por 1M fixo, entrada em cache mais barata.

• Escala — Intern-S2-397B: 403B no total, 512 especialistas / 10 ativos vs Qwen3.8-Max: 2,4T no total, 95B ativos, 512 especialistas / 10 + 1 compartilhado.

• Contexto — Intern-S2-397B: 256K de texto / 64K multimodal vs. Qwen3.8-Max: 1M de tokens, preço fixo.

• Entradas — Intern-S2-397B: texto, imagem, série temporal vs Qwen3.8-Max: texto, imagem, vídeo.

• Pesos — Intern-S2-397B: Apache-2.0, aberto no dia do lançamento vs Qwen3.8-Max: licença personalizada Qwen3.8-Max, aberto em 12 de agosto após o GA.

• Pontuação independente — Intern-S2-397B: nenhuma ainda vs Qwen3.8-Max: AA Intelligence Index 40, GPQA Diamond 92,7.

Ambas as tabelas são tabelas de fornecedores, e apenas uma tem um árbitro.

Ambos os modelos foram lançados com tabelas de benchmark elaboradas pelos próprios fornecedores, o que torna a disciplina de fontes idêntica e o histórico de resultados diferente. Os números independentes do Qwen3.8-Max acumularam-se desde então: a Artificial Analysis coloca-o em 40 no seu atual Índice de Inteligência, com um GPQA Diamond de 92,7, um HLE de 43,0 e uma pontuação independente de programação de 71,8, a um custo de cerca de 2,67 dólares por tarefa do índice na escala atual. São números medidos por um rastreador independente — o primeiro árbitro real que qualquer um destes dois modelos de topo teve.

As evidências do Intern-S2-397B são o seu próprio card, executado através do OpenCompass, do VLMEvalKit e do AgentCompass, publicado junto com os pesos: MMLU Pro 89,77, MMMU Pro 81,68, HMMT-2026 93,56, SWE-bench-Pro 68,54, e TerminalBench 2.1 com 64,04, um número que o próprio card mostra perdendo para uma geração fechada mais antiga. As suas linhas científicas são a razão pela qual o argumento do especialista existe: Biology-Instructions 55,71, SciReasoner 1.5 63,28, Mol-Instructions 53,95, MolecularIQ 62,35. Cada um desses é do próprio InternLM, sem reprodução. Colocadas lado a lado, as duas bases de evidências contam a mesma história a partir de direções opostas: um modelo é um especialista com linhas gerais respeitáveis e nenhuma medição externa, o outro é um generalista com uma pontuação independente e nenhum ajuste científico.

A generated two-column scoreboard titled 'Intern-S2-397B vs Qwen3.8-Max — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Price self-host or Intern API. Right column 'Qwen3.8-Max': Weights custom Qwen3.8-Max licence, opened Aug 12; Scale 2.4T total, 95B active; Context 1M flat-rate tokens; Inputs text, image, video; Independent score AA Index 40, GPQA 92.7; Price $2.00 / $6.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Qwen3.8-Max figures per Artificial Analysis and Alibaba.'

O que as formas de dinheiro realmente compram

A tarifa fixa de US$ 2 / US$ 6 é a jogada característica do Qwen3.8-Max, e vale detalhar o que ela proporciona. Um agente de análise de repositório que faz passar 200.000 tokens de entrada de contexto de código em uma única chamada paga a mesma taxa por token que um chat curto — sem sobretaxa para prompts longos — e, com cache, um contexto de código estável reduz drasticamente o preço efetivo de entrada em tráfego recorrente. O modelo também pode ser invocado como pesos abertos sob a licença personalizada da Alibaba, que permite uso comercial com atribuição, além de limiares baseados em escala acima de 100 milhões de MAU ou US$ 20 milhões de receita mensal, e um acordo separado para grandes empresas de modelo como serviço.

A economia do Intern-S2-397B é o inverso: sem medição de uso, mas com um gasto de capital. Os pesos têm aproximadamente 807 GB em BF16, distribuídos por 188 shards — um nó multi-GPU robusto —, com uma versão em FP8 reduzindo a pegada em cerca de metade. Se você já tem essa capacidade, o custo marginal da próxima consulta científica se aproxima do custo de eletricidade, e é essa a aposta: a propriedade torna o especialista barato na margem. Se você não tem o hardware, o modelo "grátis" é um piloto, e a API oficial do Intern é a única alternativa com medição de uso.

Os dois carros-chefe podem compartilhar um único ponto de junção se você rotear. O Qwen3.8-Max está no OrcaRouter pelo preço de tabela da Alibaba repassado com 0% de markup, então a tarifa fixa de $2 / $6 e qualquer corte de preço futuro chegam aqui no mesmo dia. O Intern-S2-397B não é roteado — é um checkpoint totalmente novo, e seu caminho até ele é a própria API do fornecedor ou uma implantação auto-hospedada. Envie o tráfego geral, com suporte a vídeo e contexto longo, para o modelo com cobrança por uso usando a chave que você já tem; mantenha o trabalho em lote científico no modelo que você executa; deixe o failover automático cobrir você quando o endpoint de qualquer um dos lados apresentar problemas. O limite é uma regra de roteamento, e não uma segunda integração.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the feature blocks covering scientific-literature pre-training and multi-domain scientific reinforcement learning.

O veredito

Escolha o Qwen3.8-Max para raciocínio geral e trabalho de produção com capacidade de vídeo, onde uma tarifa fixa por um milhão de tokens supera tudo o que os rivais cobram, e onde um placar independente reduz o risco de construir sobre ele. Os seus pesos são abertos o suficiente para terem relevância sob uma licença dentro da qual a maioria das equipes já está, e o seu medidor de $2 / $6 é o preço mais agressivo do mercado entre os carros-chefe de fronteira.

Escolha o Intern-S2-397B para cargas de trabalho científicas — artigos repletos de figuras, diagramas moleculares, sinais de séries temporais — em que a entrada é multimodal de um modo para o qual um generalista nunca foi ajustado, e em que a residência de dados ou o ajuste fino sobre resultados proprietários torna a Apache-2.0 a propriedade decisiva. Reserve orçamento para o hardware, faça a sua própria avaliação e trate os números dele como alegações até que surja um árbitro independente.

O resumo honesto é que esses dois carros-chefe não são realmente substitutos. Um é um instrumento científico próprio, com capacidade geral respeitável; o outro é um generalista alugado, avaliado de forma independente, com tarifa fixa e um interesse passageiro por ciência. Equipes que precisam dos dois devem tratar a fronteira como uma decisão de roteamento — e devem refazer suas próprias avaliações no Intern-S2-397B antes de acreditar em qualquer número no slide de qualquer um dos fornecedores.

A screenshot of the OrcaRouter model page for Qwen3.8-Max at orcarouter.ai/models/qwen/qwen3.8-max, captured September 13, 2026, showing the model listing with its provider Qwen, 1M-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.