Um cartão de título de destaque gerado com o texto "Solar Mini 4 vs Granite 4.2 3B", o subtítulo "Um modelo que você chama e um checkpoint que você baixa" e dois selos com os textos "Cerca de 3 bilhões de parâmetros ativos por token, cada um" e "Um cobra por token, o outro por watt".
Guides & Insights

Solar Mini 4 vs Granite 4.2 3B: um modelo que você chama e um checkpoint que você baixa

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque o Solar Mini 4 ao lado do Granite 4.2 3B e o número interessante não é a diferença nos benchmarks. É que o Granite 4.2 3B, o modelo de raciocínio Apache-2.0 da IBM lançado em 25 de agosto de 2026, vai rodar num laptop hoje à noite de graça, enquanto o Solar Mini 4, o modelo proprietário da Upstage lançado em 22 de setembro de 2026, não vai rodar em lugar nenhum que você possui e cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,40 por milhão de tokens de saída para responder a uma pergunta. Ambos ativam cerca de três bilhões de parâmetros de computação por token. Um é um arquivo. O outro é um medidor.

Essa diferença decide quase todo o resto nesta comparação, incluindo quais benchmarks sequer vale a pena colocar lado a lado. O Granite 4.2 3B teve uma avaliação independente muito antes do Solar Mini 4 — a Artificial Analysis atribui-lhe 9 no Intelligence Index v4.3.2, do mesmo conjunto de avaliação e da mesma organização que atribui 24 ao Solar Mini 4. Isso significa que a diferença de quinze pontos aqui é incomumente bem fundamentada: é um laboratório, uma metodologia e dois modelos que ninguém precisou aceitar pela fé.

A especificação, nas dimensões que de fato os separam

• Arquitetura — O Solar Mini 4 é uma mistura esparsa de especialistas: 35B parâmetros totais, 3B ativos por token, segundo a Upstage. O Granite 4.2 3B é denso, cerca de 3B parâmetros com aproximadamente 4B no total, incluindo embeddings, de acordo com os metadados do safetensors. Mesmo orçamento de ativação, duas maneiras diferentes de gastá-lo.

• Pesos — O Solar Mini 4 é proprietário e fechado. O Granite 4.2 3B é disponibilizado sob Apache 2.0 com uma receita de treinamento documentada, incluindo as proporções dos dados.

• Contexto — A Upstage documenta 512K tokens com saída de até 128K; a Artificial Analysis lista 1,0M para o mesmo modelo, então trate o teto como indefinido. O Granite 4.2 3B opera nativamente com 131.072 tokens, estendido para 512K por uma quinta fase de pré-treinamento.

• Preço — Solar Mini 4 a $0.10 / $0.01 em cache / $0.40 por milhão de tokens, atualmente com 50% de desconto até 22 de outubro de 2026. O Granite 4.2 3B não tem tabela de preços do fornecedor porque não há nada para alugar; os endpoints hospedados que a Artificial Analysis monitora o precificam em torno de $0.03 / $0.12, e a auto-hospedagem custa eletricidade.

• Índice de Inteligência — 24 para o Solar Mini 4, 9 para o Granite 4.2 3B, ambos do Artificial Analysis v4.3.2.

• Velocidade — 204 tokens de saída por segundo para o Solar Mini 4 e 223 para o Granite 4.2 3B, ambos medidos pelo mesmo laboratório, com tempo até o primeiro chunk de 1,5 s e 0,5 s, respectivamente. O modelo denso é o mais rápido nos dois quesitos.

Do que é realmente feita a diferença de quinze pontos

A two-column comparison scoreboard titled 'Solar Mini 4 vs Granite 4.2 3B', subtitled 'Same activation budget, two different ways of spending it'. Solar Mini 4: parameters 35B total / 3B active; weights proprietary, no download; context 512K claimed and 1.05M listed; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05; cost per index task $0.36; output per task 88,300 tokens at 204 tok/s; non-hallucination 64.2%. Granite 4.2 3B: parameters 3.66B dense; weights Apache 2.0 on Hugging Face; context 131,072 native; price per 1M about $0.03 / $0.12 hosted; Intelligence Index 9.06; cost per index task $0.006; output per task 18,600 tokens at 223 tok/s; non-hallucination 73.7%.

Avaliações individuais contam uma história menos lisonjeira do que a manchete para o Granite 4.2 3B, e uma mais complicada para o Solar Mini 4. No AA-LCR v1.1, o benchmark de raciocínio de contexto longo, o Solar Mini 4 obtém 83% e o Granite 4.2 3B obtém 24%. Essa única avaliação responde por uma parcela enorme da diferença no índice, e não é um acaso de escala — é o que você compra com 512K a 1M tokens de contexto e com o treinamento para usá-lo. A janela do Granite 4.2 3B chega no máximo a 131K nativamente; a fase estendida de 512K existe, mas o modelo não foi ajustado para raciocinar ao longo dela da mesma forma que o Solar Mini 4 foi.

Em conhecimento geral, a diferença diminui e depois se inverte em natureza. O Granite 4.2 3B obtém 55,9% no GPQA, e o Solar Mini 4 não tem nenhum número no GPQA; no Humanity's Last Exam, os dois são 6,6% e 25,8%, respectivamente, que é a comparação mais direta e a que a diferença de tamanho prevê. O que o Granite 4.2 3B não faz, segundo a Artificial Analysis, é fabricar: sua taxa de não alucinação no AA-Omniscience é de 73,7%, superior à de 64,2% do Solar Mini 4. O modelo menor tem menos probabilidade de inventar uma resposta que não possui.

A codificação agêntica é onde ambos os modelos falham, e onde ler os números importa. O Solar Mini 4 obtém 1% no Terminal-Bench 4.0 e 22,3% no AutomationBench-AA. O Granite 4.2 3B obtém 0% no Terminal-Bench 4.0, 13,9% no Terminal-Bench 2.1 mais antigo e 5,6% no τ³-Banking. Nenhum dos modelos é o instrumento adequado para trabalho autônomo em terminal. Os membros de 8B e 30B da família Granite 4.2 receberam o aprendizado por reforço agêntico da IBM e trazem resultados de SWE-Bench e Terminal-Bench; o 3B pulou explicitamente esse bloco de treinamento, e o modelo da Upstage tem preço voltado para recuperação, estruturação e aplicação de políticas, e não para operar um shell.

Onde o Granite 4.2 3B ainda é a resposta correta

Sete gigabytes e um terço de pesos em bfloat16, menos de quatro gigabytes numa quantização prática, e uma licença Apache 2.0 que lhe permite fazer ajuste fino com os seus próprios dados e publicar o resultado sem perguntar a ninguém. Um estudante com uma única GPU de consumidor, um hospital que não pode enviar texto de pacientes a terceiros, um produto que precisa de funcionar numa aeronave ou no subsolo de uma fábrica, uma equipa que quer possuir um modelo em vez de alugar um endpoint — cada um desses casos escolhe o Granite 4.2 3B e não olha para trás. O motor funciona através de vLLM, SGLang, Transformers e GGUF, e o Ollama lista uma build granite4.2:3b.

Os números informados pelo próprio fornecedor merecem a cautela de sempre. A ficha da IBM alega 78,33 no AIME 2025, 66,67 no HMMT de fevereiro de 2025 e 69,71 no LiveCodeBench v6 — todos sem reprodução por qualquer terceiro, e, para um modelo denso de 3B, o número do AIME fica muito acima da faixa histórica. O índice 9 da Artificial Analysis registra o modelo como genuinamente útil e nada próximo da fronteira, o que é o sinal mais confiável justamente porque a IBM não o publicou.

Onde o Solar Mini 4 é a resposta correta

Qualquer coisa em que o trabalho seja um documento longo, uma extração estruturada repetida, ou uma política que tenha de ser aplicada de forma consistente em volume — e em que noventa segundos de latência sejam aceitáveis. O perfil do Solar Mini 4 é um perfil de especialista: 83% em raciocínio de contexto longo, 48% em codificação científica, 64% em não alucinação, e uma tendência documentada a abster-se em vez de adivinhar. Também fala coreano como um idioma de primeira classe, a par do inglês e do japonês, o que, para uma implantação no mercado coreano, não é uma nota de rodapé.

O que os compradores não devem fazer é comparar os dois preços de token e concluir que o Solar Mini 4 é três vezes mais caro. A Artificial Analysis mediu o Solar Mini 4 em US$ 0,36 por tarefa concluída do Intelligence Index — e, no mesmo conjunto, o Granite 4.2 3B em US$ 0,006. Isso é um fator de sessenta, impulsionado pelas mesmas coisas que inflam o Solar Mini 4 em relação ao GPT-6 Luna (max): 88.300 tokens de saída por tarefa contra 18.600 do Granite, e uma estrutura de custos na qual as gravações de prompt-cache respondem por US$ 0,30 dos US$ 0,36 do Solar Mini 4, contra US$ 0,0006 dos US$ 0,006 do Granite. Um preço de saída barato em um modelo prolixo não significa uma tarefa barata.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b showing the model summary table: developer Granite Team at IBM, a decoder-only dense transformer, base model Granite-4.1-3B-Base, 3B parameters, context length natively 128K with long-context extension to 512K, bfloat16 precision, twelve tested languages including Korean, a built-in chain-of-thought thinking mode, and an Apache-2.0 licence, with the model tree showing three finetunes and the base model ibm-granite/granite-4.1-3b-base.

Nenhum dos dois modelos está no OrcaRouter — não roteamos nem o Granite nem o Upstage — então, se você quiser o Granite 4.2 3B, ele vem do Hugging Face, e se você quiser o Solar Mini 4, ele vem da própria API da Upstage e de plataformas de terceiros. Mas o padrão de dois modelos que esta comparação sugere é para o que os roteadores são feitos, e é a razão pela qual o OrcaRouter coloca mais de 200 modelos atrás de uma única chave com 0% de markup sobre o preço de tabela do provedor: execute o trabalho de documentos longos e de língua coreana com o modelo que de fato compensa seu custo, mantenha as etapas determinísticas de extração em algo que você hospeda, e deixe o roteamento e o failover moverem uma requisição entre eles por chamada, e não por contrato.

A screenshot of the Artificial Analysis comparison page headed 'Granite 4.2 3B Intelligence, Performance & Price Analysis', marked as an IBM open-weights model released August 2026, with an overall speed of 223.4 output tokens per second, a 131k-token context window, and the summary line that Granite 4.2 3B scores 9 on the Artificial Analysis Intelligence Index, placing it above average among comparable models with a median of 6.

Uma observação final sobre os números acima. Cada número do Solar Mini 4 que vem da Artificial Analysis é uma medição independente; cada número do Granite 4.2 3B da ficha de modelo da IBM é uma alegação do fornecedor que nenhum terceiro reproduziu. As pontuações do índice da Artificial Analysis, 24 e 9, são os únicos dois números aqui que foram produzidos pelo mesmo laboratório sob as mesmas condições — e são esses dois que devem fundamentar uma decisão.