Um cartão de título de destaque gerado com o texto 'Solar Mini 4 vs Qwen3.8-Max', com o subtítulo 'Quanto custaram realmente os últimos vinte pontos do índice' e dois selos com os dizeres '24,1 contra 45,4 no índice' e '$0,36 contra $5,41 por tarefa'.
Guides & Insights

Solar Mini 4 vs Qwen3.8-Max: O Que os Últimos Vinte Pontos de Índice Realmente Custam

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Solar Mini 4 custa US$ 0,10 por milhão de tokens de entrada e US$ 0,40 por milhão de tokens de saída. O Qwen3.8-Max, o modelo que a maioria das pessoas quer dizer quando digita "Qwen 3.8" e pede a API, custa US$ 2,00 e US$ 6,00. Em uma tabela de preços, isso equivale a uma diferença de vinte vezes no preço de entrada. Na avaliação independente pela qual ambos os modelos agora passaram, o dado honesto é que o Qwen3.8-Max marca 45,4 no Artificial Analysis Intelligence Index, contra 24,1 do Solar Mini 4 — aproximadamente o dobro da capacidade medida — embora custe cerca de quinze vezes mais por tarefa concluída. Tudo o que vale a pena saber sobre essa dupla está na diferença entre essas duas proporções e no fato de que o modelo da Upstage roda a 204 tokens por segundo, enquanto o carro-chefe da Alibaba roda a 39.

Uma observação sobre nomenclatura antes dos números, porque isso muda o que você está comprando. Qwen 3.8 é uma geração, não um modelo: o carro-chefe hospedado é o Qwen3.8-Max, atualizado como um snapshot datado de 0902, e o membro baixável da mesma geração é o Qwen3.8-2.4T-A95B, os pesos de 2,4 trilhões de parâmetros que a Alibaba publicou em 12 de agosto de 2026. O Solar Mini 4, lançado em 22 de setembro de 2026, é o modelo esparso de mistura de especialistas de 35 bilhões de parâmetros da Upstage, com cerca de 3 bilhões de parâmetros ativos por token e nenhum peso aberto a preço algum.

As duas colunas, nas dimensões que determinam a aquisição

• Índice de Inteligência — 45,4 para o Qwen3.8-Max (0902) contra 24,1 do Solar Mini 4, ambos no Índice de Inteligência v4.3.2.

• Custo por tarefa concluída — US$ 5,41 para o Qwen3.8-Max contra US$ 0,36 para o Solar Mini 4. Aproximadamente quinze para um, e a proporção que ninguém cita.

• Tabela de preços — US$ 2,00 / US$ 6,00 por milhão de tokens, entrada em cache US$ 0,25, para o Qwen3.8-Max, em comparação com US$ 0,10 / US$ 0,40, entrada em cache US$ 0,01, para o Solar Mini 4.

• Contexto — 1.000.000 tokens em ambos, que é a única dimensão em que o modelo barato não fica devendo nada. A Artificial Analysis lista 983.616 para o Qwen3.8-Max e 1.048.100 para o Solar Mini 4; a própria documentação da Upstage diz 512K, então o teto do modelo pequeno é o menos certo dos dois.

• Pesos — O Qwen3.8-Max é proprietário e hospedado; seu irmão aberto Qwen3.8-2.4T-A95B pode ser baixado sob uma licença personalizada e obtém 39,9 no mesmo índice com 262.000 tokens de contexto. O Solar Mini 4 é proprietário e não tem irmão aberto.

• Taxa de transferência — 204 tokens de saída por segundo para o Solar Mini 4, contra 39,5 do Qwen3.8-Max, conforme medido pelo mesmo laboratório. O modelo que custa um quinze avos por tarefa é cinco vezes mais rápido ao executá-la.

O que vinte e um pontos de índice compram

A two-column comparison scoreboard titled 'Solar Mini 4 vs Qwen3.8-Max', subtitled 'Roughly twice the capability at about fifteen times the task cost'. Solar Mini 4: Intelligence Index 24.05; cost per index task $0.36; rate card per 1M $0.10 in / $0.40 out; cached input $0.01 per 1M; context 1.05M listed and 512K claimed; output speed 204 tokens per second; output per task 88,300 tokens; long-context reasoning 83.3% on AA-LCR v1.1. Qwen3.8-Max: Intelligence Index 45.42; cost per index task $5.41; rate card per 1M $2.00 in / $6.00 out; cached input $0.25 per 1M; context 983,616; output speed 39.5 tokens per second; output per task 107,700 tokens; long-context reasoning 80.3% on AA-LCR v1.1.

Eles compram a extremidade mais difícil da distribuição. No Humanity's Last Exam, o Qwen3.8-Max responde corretamente a 43,1% dos itens, contra 25,8% do Solar Mini 4. Em codificação científica, é 52,1% contra 47,6%. No trabalho de conhecimento agêntico, a diferença se amplia e passa para outra categoria: o Qwen3.8-Max alcança 1663 Elo no GDPval-AA, enquanto o Solar Mini 4 chega a 1072 — quase seiscentos pontos Elo, o que não é uma diferença de arredondamento, mas uma mudança naquilo em que se pode confiar que o modelo faça sem supervisão.

A única avaliação em que o modelo pequeno não só mantém a sua posição, mas vence, é o raciocínio de contexto longo. O Solar Mini 4 obtém 83,3% no AA-LCR v1.1 e o Qwen3.8-Max obtém 80,3%. Este é o argumento mais forte a favor do Solar Mini 4 em toda esta comparação: no benchmark criado para testar «ler um documento muito longo e raciocinar sobre ele», um preço por tarefa quinze vezes superior compra um resultado que é três pontos pior.

Onde nenhum dos dois modelos é o instrumento certo é no trabalho autônomo em terminal. O Solar Mini 4 marca 1% no Terminal-Bench 4.0; o Qwen3.8-Max marca 38,9%. Um modelo que resolve oito de vinte tarefas difíceis de terminal é genuinamente utilizável nesse contexto, e o outro não, o que é o exemplo mais claro nesta comparação de uma diferença de natureza, e não de grau.

Por que a conta por tarefa do carro-chefe é muito pior do que o preço por token sugere

O Qwen3.8-Max emite mais saída por tarefa do que o Solar Mini 4 — 107.700 tokens contra 88.300 — e as emite a US$ 6,00 por milhão, em vez de US$ 0,40. Aí já está a maior parte da diferença, antes mesmo de se considerar o comportamento de cache. A Alibaba oferece uma tarifa de US$ 0,25 para entrada em cache, o que é um desconto real em relação ao seu preço de entrada de US$ 2,00, e o irmão aberto da família, Qwen3.8-2.4T-A95B, é um modelo esparso de 2,4 trilhões de parâmetros, com cerca de 95 bilhões de parâmetros ativos, então cada token que ele produz é produzido por uma máquina substancialmente maior. Nada disso é uma crítica. É a razão pela qual existe um multiplicador de quinze vezes por tarefa e pela qual uma comparação de preço por token entre esses dois modelos é enganosa em ambas as direções.

A consequência prática: o Solar Mini 4 não é "o Qwen 3.8 econômico". É um especialista que por acaso é barato, rápido e forte exatamente em um eixo — documentos longos — e fraco no eixo em que errar custa mais caro, que é a confiabilidade agêntica. O Qwen3.8-Max é o generalista cuja vantagem aparece justamente onde uma resposta errada é custosa.

Executando o par em vez de escolher entre eles

Este é o caso incomum na série Solar Mini 4 em que ambos os lados da comparação são rotas que realmente podemos vender a você. O Qwen3.8-Max e seu snapshot datado de 0902 estão no OrcaRouterpela própria tabela do fornecedor de US$ 2,00 / US$ 6,00, ao lado de Qwen3.8-Flash a US$ 0,15 / US$ 0,47e Qwen3.8-27B a US$ 0,33 / US$ 2,40 — três degraus da mesma geração, uma única chave, sem segundo contrato e sem nenhuma alteração de código além de uma string de modelo. Em 1º de outubro de 2026, nossa própria medição no playground coloca o Qwen3.8-Max em um p50 de 2,5 segundos com 87,7 tokens de saída por segundo nos últimos sete dias; essa janela é móvel, então consulte o card do modelo em tempo real em vez desta frase. Os modelos da Upstage não estão disponíveis por nosso intermédio, e o Solar Mini 4 só pode ser acessado pela própria API da Upstage.

A screenshot of the OrcaRouter model page for Qwen3.8-Max, showing the model id qwen/qwen3.8-max at $2.00 input and $6.00 output per million tokens, text, image and video input with text output, vision, tools, JSON and reasoning capability flags, a 2.5-second median time to first token from our own playground, and the description of Alibaba's newest flagship model in the Qwen line.

O que isso torna possível é a divisão que esta comparação defende: enviar o tráfego de documentos longos, em coreano e de extração estruturada para algum lugar barato, encaminhar as requisições com uso intensivo de raciocínio e que usam ferramentas para o modelo de ponta, e deixar que o failover cubra o provedor que estiver tendo um dia ruim. É também aí que a DSL de roteamento justifica seu lugar — compor modelos em uma única chamada significa que uma primeira passagem barata e uma passagem de verificação cara podem ser uma única requisição a um único endpoint, em vez de duas integrações que precisam ser mantidas em sincronia.

A versão curta

A screenshot of the Artificial Analysis model page headed 'Qwen3.8 Max (0902) Intelligence, Performance & Price Analysis', marked as an Alibaba proprietary model released September 2026, ranked 32nd of 223 on intelligence, 172nd on speed and 101st on cost, with $2.00 input, $6.00 output and cached pricing rows, 39.5 output tokens per second, a $5.41 cost figure and a verbosity readout.

Se a sua carga de trabalho for de contexto longo, com um formato de saída fixo e um orçamento de latência tolerável, o Solar Mini 4 oferece 83% do resultado de contexto longo a um quinze avos do custo da tarefa e cinco vezes a vazão, e os vinte e um pontos de índice ausentes nunca aparecerão no seu painel. Se a sua carga de trabalho envolver ferramentas, agentes de múltiplas etapas ou perguntas em que uma resposta errada com confiança é pior do que nenhuma resposta, os pontos ausentes são o produto inteiro e o Qwen3.8-Max vale quinze vezes o preço. Todos os números acima atribuídos à Artificial Analysis são a medição independente dessa organização; a nomenclatura e as datas de lançamento do Qwen3.8 são da Alibaba, e os números de serving do OrcaRouter são a nossa própria medição de playground em uma janela móvel de sete dias.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente