
Solar Mini 4 pontuou 24 no Artificial Analysis Index — e custa cinco vezes mais por tarefa do que o GPT-6 Luna
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 por 1M de tokens
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 por 1M de tokens · 159 tok/s
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 220 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Solar Mini 4 cobra o mesmo por token de entrada que o GPT-6 Luna, e cerca de cinco vezes mais para realmente concluir uma tarefa. Essa é toda a história da primeira avaliação independente do novo modelo da Upstage, e não é a história que os materiais de lançamento contaram. O Solar Mini 4 foi lançado em 22 de setembro de 2026 como um modelo esparso de mistura de especialistas com 35 bilhões de parâmetros que ativa cerca de 3 bilhões de parâmetros por token, com preço de US$ 0,10 por milhão de tokens de entrada e US$ 0,40 por milhão de tokens de saída. O GPT-6 Luna, a camada de eficiência da OpenAI, tem preço de tabela de US$ 0,10 e US$ 0,50, com um nível de contexto longo acima de 272.000 tokens que praticamente dobra ambos. Em uma tabela de preços, eles parecem a mesma compra. No Intelligence Index da Artificial Analysis, em que ambos os modelos passaram pelo mesmo conjunto de dez avaliações, o Solar Mini 4 custa US$ 0,36 por tarefa concluída, contra US$ 0,07 do GPT-6 Luna (max) — um fator de 5,4 que vem inteiramente de como os dois modelos se comportam durante uma tarefa, e não do que cobram por token.
Em 30 de setembro de 2026, a Artificial Analysis publicou a sua análise do modelo, que obtém 24 no Intelligence Index v4.3.2. Tudo neste artigo que é atribuído à Artificial Analysis é a medição da própria organização; tudo o que é atribuído à Upstage é a alegação do fornecedor. A distinção importa mais aqui do que o habitual, porque os dois conjuntos de números nem sempre coincidem.
O que a execução independente realmente diz

O Solar Mini 4 chega a 24,05 no Intelligence Index, contra uma mediana de 12 entre os modelos de raciocínio em sua faixa de preço. Isso o coloca bem acima da média para sua categoria de peso, e a própria formulação da Upstage — “maior pontuação geral entre os modelos com 3B ativos na comparação do Artificial Analysis Intelligence Index” — resiste a testes independentes nesse ponto específico. O Qwen3.6 35B A3B, que também ativa 3 bilhões de parâmetros, obtém 18,2 no mesmo índice. O K2 Horizon MoVA 36B A4B, com 4B ativos, obtém 25,3 — e faz isso com um contexto mais curto, 524K tokens contra 1,05M do Solar Mini 4. Em comparação com o Inkling, um MoE de pesos abertos de 975 bilhões de parâmetros lançado em julho, o Solar Mini 4 fica em 24,1 contra 25,0 — a menos de um ponto de distância de um modelo quase trinta vezes maior que custa US$ 1,00/US$ 4,05 por milhão de tokens.
O perfil dentro dessa pontuação é irregular, e a irregularidade é a parte útil:
• O raciocínio de contexto longo é o ponto forte relativo.O Solar Mini 4 alcança 83% no AA-LCR v1.1, empatado com o MiniMax-M3 e o GPT-6 Luna (max), e à frente do Gemini 3.8 Flash (high) e do GPT-6 Astra (max), com 81%.
• A programação científica se sustenta. 48% no SciCode, um ponto à frente do MiniMax-M3 e do Inkling (xhigh).
• A codificação agêntica desmorona. 1% no Terminal-Bench 4.0. Não é "fraco" — 1%. No AutomationBench-AA, que executa fluxos de trabalho de várias etapas em aplicações SaaS reais, 22,3%.
•A precisão do conhecimento é baixa, mas o modelo sabe que está tentando. O AA-Omniscience retorna −11 com 18% de precisão; o modelo se abstém de responder em cerca de metade das perguntas que lhe são feitas. Sua taxa de não alucinação é de 64%, bem à frente do Inkling (xhigh), com 32%, e do GPT-6 Luna (max), com 23%. Um modelo que diz “Não sei” metade das vezes e acerta dois terços das vezes em que de fato responde é um instrumento diferente de um modelo que confabula com confiança.
No trabalho de conhecimento agêntico, os valores são 1072 Elo no GDPval-AA e 872 Elo no AA-Briefcase, ambos próximos do Inkling (xhigh).
O número cinco vezes, explicado
A métrica de custo por tarefa da Artificial Analysis é a que vai decidir a maioria das conversas de compras, e merece ser lida como um detalhamento, em vez de citada como manchete. Duas coisas a impulsionam.
Primeiro, o volume. O Solar Mini 4 emite cerca de 88.300 tokens de saída por tarefa do Intelligence Index; 71.600 desses são tokens de raciocínio. A $0,40 por milhão de tokens de saída, isso representa cerca de $0,035 da conta — barato, porque a saída é barata. O que custa em vez disso é tempo: a uma velocidade medida de 204 tokens por segundo, a Artificial Analysis registra 430 segundos de trabalho para uma tarefa média do índice, ou cerca de 7,2 minutos. O GPT-6 Luna (max) emite 50.000 tokens de saída por tarefa a 127 tokens por segundo e leva 396 segundos. O Inkling (xhigh), um modelo de pesos abertos de 975 bilhões de parâmetros, emite 34.700 tokens e termina em 169 segundos. O Solar Mini 4 é mais lento que ambos, mas por uma margem que não tem nada a ver com a diferença de custo de cinco vezes.
Segundo — e isto é toda a história — entrada de escrita no cache. O detalhamento de custos da Artificial Analysis atribui cerca de US$ 0,30 dos US$ 0,36 por tarefa do Solar Mini 4 a tokens gravados no cache de prompt, contra US$ 0,03 para leituras de cache, US$ 0,035 para saída e um erro de arredondamento para entrada genuinamente não armazenada em cache. Para o GPT-6 Luna (max), a escrita em cache é US$ 0,012 de US$ 0,068 — cerca de 17% da conta, contra 82% para o Solar Mini 4. A entrada em cache é a linha mais barata da tabela de preços da Upstage, a US$ 0,01 por milhão, e o modelo da Artificial Analysis realmente a utiliza; o problema é quanto precisa ser gravado antes de poder ser lido. Um agente que reenvia uma conversa crescente a cada turno paga o custo de gravação com muito mais frequência do que um modelo que responde em um turno curto e fechado.
Essa é a constatação que vale a pena levar para produção: para um modelo como este, o preço por token não prevê quase nada sobre a conta por tarefa. O comportamento do cache, sim.
Onde os próprios números da Upstage divergem

O post de lançamento da Upstage, publicado em 1º de outubro de 2026 sob o título "Solar Mini 4: Criado para Cargas de Trabalho de Agentes de Alto Volume", relata 24,1 no Artificial Analysis Intelligence Index — efetivamente o mesmo número — e faz várias alegações que se colocam ao lado, e não acima, dos dados independentes.
O fornecedor cita 22,3% no AutomationBench-AA, coincidindo exatamente com a Artificial Analysis, e 47,2 no τ³-Banking, um benchmark de políticas e uso de ferramentas que a suíte de índices deixou de incluir desde então. Ele reporta 83,3% no AA-LCR e 47,6% no SciCode, ambos dentro de um erro de arredondamento em relação aos números independentes. No Humanity's Last Exam, ele reporta 19,6%, enquanto a página da Artificial Analysis apresenta 25,8% para o mesmo modelo; ambos são leituras plausíveis de uma avaliação notoriamente volátil, mas não são o mesmo número, e nenhum dos dois deve ser apresentado como o outro.
Duas linhas de especificação também divergem. A Upstage documenta uma janela de contexto de 512K tokens com até 128K tokens de saída. A Artificial Analysis lista uma janela de contexto de 1,0M tokens e uma saída máxima de 262K. O blog da Upstage deixa explícito que o número de 512K é o contrato de entrega; a discrepância é o tipo de coisa que vale a pena resolver confrontando com uma resposta da API antes que alguém construa um pipeline de recuperação em cima dela.
O fornecedor também faz a única comparação que consegue fazer nos seus próprios termos: um teste interno com três tarefas de agente em coreano, executadas três vezes por modelo, no qual concluir 1.000 conjuntos de três tarefas teve um custo estimado de US$ 1,25 com o Solar Mini 4 e de US$ 2,20 com o MiMo-V2.5. Esse é um teste executado pelo fornecedor, com tarefas escolhidas pelo fornecedor e com a latência excluída, e aponta na direção oposta ao resultado da Artificial Analysis. Não está errado — tarefas diferentes exercitam orçamentos de tokens diferentes —, mas é um número de marketing, e o desconto de lançamento publicado do modelo é um motivo separado para refazer seus próprios números em vez de adotar os de qualquer outra pessoa.
Preços, conforme a documentação atual do console da Upstage: US$ 0,10 por milhão de tokens de entrada, US$ 0,01 por milhão de tokens de entrada em cache, US$ 0,40 por milhão de tokens de saída, com um desconto de lançamento atualmente anunciado de 50% até 22 de outubro de 2026 UTC, o que deixa as tarifas efetivas em US$ 0,05 de entrada, US$ 0,005 de entrada em cache e US$ 0,20 de saída até então.
O que isso significa se você for quem paga
O interessante no Solar Mini 4 não é que seja um modelo ruim. É que se trata de um pequeno modelo genuinamente bom cuja economia é dominada por comportamentos que uma tabela de preços não consegue mostrar. Um 24 no índice com três parâmetros ativos é um resultado de engenharia de verdade, e cargas de trabalho em coreano — o ponto forte declarado do modelo, ao lado de inglês e japonês — são exatamente onde esse resultado provavelmente mais valerá o seu preço.
A parte complicada é tudo o que vem depois da primeira chamada. Turnos longos do assistente, baixa reutilização de cache e uma tarefa que leva sete minutos de decodificação por execução de índice resultam em um número que não se parece em nada com $0,10/$0,40. Se você estiver avaliando isso, o experimento honesto é um teste de custo por trabalho concluído na sua própria carga de trabalho, com o cache de prompts ativado da forma como sua stack de produção realmente o usaria — não uma comparação de preço por token.
Este é também o tipo de problema que um roteador existe para resolver, e a razão pela qual o OrcaRouter repassa os preços de tabela dos provedores com 0% de margem, de modo que uma alteração de preço de um fornecedor chega à sua fatura no mesmo dia. Não roteamos modelos da Upstage, portanto nem o Solar Mini 4 nem o Solar Pro 4 estão disponíveis por nosso intermédio — eles vêm da própria API da Upstage e de plataformas de terceiros. O que nós roteamos é a outra metade desta comparação: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash e mais de 200 outros modelos por trás de uma única chave, o que torna prático manter um modelo barato e um caro na mesma tarefa e deixar o failover automático e o roteamento por requisição decidirem qual deles responde. Quando a diferença entre dois modelos é uma lacuna de custo por tarefa cinco vezes maior que nenhuma tabela de preços revela, a capacidade de mover uma única requisição entre eles importa mais do que qualquer tabela de benchmarks.

A versão curta: o Solar Mini 4 é o novo ponto de Pareto que a Artificial Analysis traça para modelos com menos de três bilhões de parâmetros ativos, e é cerca de cinco vezes mais caro por tarefa concluída do que um modelo cujo preço de tabela de entrada é o mesmo. Ambas essas afirmações são verdadeiras, e a segunda é a que aparece na fatura.
