Cartela de título com os dizeres “Solar Mini 4 vs Gemma 4 12B” e o subtítulo “Um checkpoint que você baixa e um modelo que você chama”, sobre um gradiente de azul para verde-azulado com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Solar Mini 4 vs Gemma 4 12B: um checkpoint que você baixa e um modelo que você chama

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A comparação honesta mais curta entre o Solar Mini 4 e o Gemma 4 12B é que um deles é um arquivo e o outro é um endpoint. O Solar Mini 4 da Upstage é um modelo mixture-of-experts de 35 bilhões de parâmetros, com 3 bilhões de parâmetros ativos por token, uma janela de contexto de 512.000 tokens e nenhum peso aberto — você o acessa pelo Console da Upstage, pelo Playground ou por uma implantação no local que você combina com o fornecedor. O Gemma 4 12B é um checkpoint denso de 11,95 bilhões de parâmetros sob a licença Apache 2.0, disponível para download hoje, rodando em cerca de 16 GB de memória unificada em um laptop. Ambos são feitos para trabalho agêntico, ambos aceitam um documento longo como entrada, e não estão competindo pelo mesmo espaço na sua stack, porque um deles tem uma conta de memória e o outro tem uma conta de tokens.

Essa distinção se perde porque os dois modelos parecem semelhantes em uma lista de recursos. Ambos raciocinam, ambos chamam ferramentas, ambos produzem saída estruturada, ambos lidam com inglês, coreano e japonês. As diferenças que decidem a questão estão em outro lugar: o que acontece às 3 da manhã quando o serviço está fora do ar, o que sua equipe de conformidade diz sobre onde os dados residem e se você está pagando por token ou por hora de GPU.

O contraste da especificação, dimensão por dimensão

• Arquitetura — O Solar Mini 4 é esparso: 35B de parâmetros totais, 3B ativos por token. O Gemma 4 12B é denso: cada um dos seus 11,95B de parâmetros é executado em cada token. O Solar armazena dez vezes mais pesos e calcula com um quarto deles; o Gemma armazena um quarto e calcula com todos eles.

• Onde é executado — O Solar Mini 4 roda na infraestrutura da Upstage (Console, Playground) ou no seu próprio ambiente, em uma modalidade on-premises. O Gemma 4 12B roda no seu hardware: cerca de 16 GB de memória unificada em precisão total, mais perto de 8 GB em 4 bits, e cabe em uma única GPU de consumidor ou em um laptop da série M.

• Pesos — Apache 2.0 para o Gemma 4 12B, o que significa uso comercial, modificação e redistribuição sem limite de receita. Fechado para o Solar Mini 4. A Upstage já lançou pesos abertos antes, mas nada sobre este lançamento indica que pretende fazer isso aqui.

• Contexto — 512.000 tokens para o Solar Mini 4, com até 128.000 tokens de saída. O Gemma 4 12B tem 256.000 tokens, com a Artificial Analysis listando 260 mil em sua página do modelo. O Solar é o mais longo dos dois, e a diferença não é marginal.

• Modalidades — o Gemma 4 12B é multimodal sem encoder: patches de imagem e áudio de 16 kHz são projetados diretamente no espaço de embeddings do modelo de linguagem, então ele recebe texto, imagem, áudio e vídeo e devolve texto. O Solar Mini 4 é texto entra, texto sai. Esta é a única dimensão em que o Gemma vence de forma absoluta, e por uma grande margem.

• Preço — O Solar Mini 4 está listado a US$ 0,10 por milhão de tokens de entrada e US$ 0,40 por milhão de tokens de saída, com entrada em cache a US$ 0,01; uma promoção de lançamento de 50% vai até 22 de outubro de 2026. O Gemma 4 12B não custa nada para baixar, e a Artificial Analysis listou a inferência hospedada a US$ 0,10 de entrada e US$ 0,30 de saída por milhão quando sua página foi capturada em 22 de setembro de 2026.

• Data de corte de conhecimento — fevereiro de 2026 para o Solar Mini 4; o Gemma 4 12B foi lançado em 3 de junho de 2026 com uma data de corte de conhecimento de janeiro de 2025. Ambos estão desatualizados o suficiente para que a recuperação não seja opcional.

• Pontuações independentes — o Solar Mini 4 ainda não tem nenhuma, um dia após o lançamento. O Gemma 4 12B tem um Índice de Inteligência da Artificial Analysis de 14, classificado em 22º entre os 142 modelos monitorados em sua classe, a 112,7 tokens de saída por segundo.

Para que serve realmente o Gemma 4 12B

Screenshot of Artificial Analysis’s model page for Gemma 4 12B, showing its Intelligence Index score, its rank among the models tracked in its class, and its output speed.

Gemma 4 12B existe para colocar um modelo multimodal capaz em algum lugar que você controla. O posicionamento do Google no lançamento era que ele se aproxima do próprio modelo de mistura de especialistas de 26B da empresa com menos da metade da memória, e que supera o Gemma 3 27B da geração anterior em tarefas de raciocínio, ciência e documentos. Os números relatados pelo fornecedor por trás dessa afirmação são fortes para o tamanho: 77,2% no MMLU-Pro, 78,8% no GPQA Diamond, 94,9 no DocVQA e 88,4 no InfoVQA, todos números do próprio Google e não reproduzidos de forma independente.

A decisão de engenharia interessante é que o Gemma 4 12B não tem codificadores de visão ou áudio separados. Os patches de imagem são projetados no espaço de embeddings do modelo por meio de uma única multiplicação de matrizes; o áudio bruto entra da mesma forma. Isso elimina o custo de memória e latência de executar duas torres extras junto ao modelo de linguagem, e é por isso que um modelo multimodal cabe em 16 GB. Também significa que o modelo de linguagem absorve o trabalho que os codificadores fariam, o que é uma troca real no que diz respeito ao detalhe visual fino.

Para o trabalho com agentes, a consequência prática é que o Gemma 4 12B é o único destes dois modelos capaz de ler uma captura de tela, uma página digitalizada ou uma nota de voz como parte do ciclo. Se o trabalho do seu agente envolve olhar para alguma coisa, a comparação termina antes mesmo de começar.

Para que serve realmente o Solar Mini 4

O Solar Mini 4 visa o caso oposto: trabalho de alta frequência e sensível a custos, em que a entrada é texto e o volume é grande. A própria descrição da Upstage é "velocidade de resposta e custo importam", e a contagem de parâmetros ativos de 3B é o mecanismo. Um modelo esparso nessa proporção é barato de servir, e é por isso que a Upstage pode listar US$ 0,10 por milhão de tokens de entrada para algo com uma janela de 512K.

O contexto de 512K é a arma mais afiada. É o mesmo número que a Upstage oferece no Solar Pro 4, seu carro-chefe, o que significa que o modelo compacto não deixa a desejar em capacidade de documentos — um contrato de 400 páginas, uma base de código completa, um ano de chamados de suporte. O contexto de 256K do Gemma 4 12B é generoso por qualquer padrão normal e metade do contexto do Solar por esse critério.

O raciocínio é novo na linha Mini. Os modelos solar-mini da geração anterior ignoram completamente um parâmetro reasoning_effort; o Solar Mini 4 aceita um, e as ferramentas de agentes de terceiros foram atualizadas para tratá-lo como capaz de raciocínio, em vez de colocá-lo numa lista de bloqueio. A Upstage também lançou o Solar Jev no mesmo dia, um endpoint beta de decisão disponibilizado no Solar Mini 4 que retorna uma escolha, uma pontuação ou uma probabilidade, sem nenhum texto corrido — um sinal sobre para quais cargas de trabalho a Upstage considera que este modelo se destina.

O que o Solar Mini 4 não tem, até o momento desta escrita, é um único número independente. Nenhum Intelligence Index, nenhuma colocação no Agent Arena, e nenhuma tabela de benchmark da Upstage também — o registro de alterações traz especificações e nenhuma pontuação. A única cifra mais ou menos de terceiros em circulação é a execução test400 autorreportada de um wrapper da comunidade, julgada por outro modelo sob uma rubrica declarada, na qual o Solar Mini 4 obteve 98,4% de precisão de campo em reasoning_effort=none e média de 1,21 segundos por chamada. Essa é a comparação de um desenvolvedor com seu próprio harness, e não é motivo para alterar uma decisão de produção.

A comparação que decide isso

Screenshot of Upstage’s pricing page listing Solar Mini 4’s input, cached input and output rates alongside the launch promotion window.

Se você tem GPUs e um motivo para manter os dados internamente, o Gemma 4 12B não está realmente competindo com o Solar Mini 4 de forma alguma — está competindo com a sua conta de luz. Você o baixa uma vez, o executa para sempre, não paga nada por token e obtém entrada multimodal que o Solar Mini 4 não oferece a preço nenhum. Os custos que aparecem depois são operacionais: alguém precisa assumir a pilha de serviço, alguém precisa lidar com a atualização quando o Google lançar a próxima, e sua taxa de transferência é limitada pelo hardware que você comprou.

Se você não tem GPUs, ou tem e a carga de trabalho ocorre em picos, o Solar Mini 4 é a opção sem custo de capital. Você paga US$ 0,05 por milhão de tokens de entrada durante a promoção de lançamento e US$ 0,10 depois, você obtém o dobro da janela de contexto e tem um SLA do fornecedor em vez de um pager. O que você abre mão são os pesos, a entrada multimodal e qualquer capacidade de responder à pergunta "o que acontece com meus dados" com "eles nunca saem deste prédio".

A comparação de preços é mais próxima do que a manchete sugere e vale a pena ser feita com cuidado. No preço de tabela, o Solar Mini 4 e o Gemma 4 12B hospedado custam o mesmo na entrada (US$ 0,10) e o Gemma é mais barato na saída (US$ 0,30 contra US$ 0,40). Durante a promoção da Upstage, o Solar custa metade disso em ambos os casos. Se sua carga de trabalho for intensiva em entrada — documentos longos, respostas curtas —, os dois estão efetivamente empatados no preço de tabela e o Solar é mais barato hoje. Se for intensiva em saída, o Gemma é mais barato, a menos que a promoção esteja ativa.

Executar qualquer um deles sem reconstruir sua stack

A parte incômoda dessa decisão é que ela não é obviamente reversível. Baixar o Gemma 4 12B compromete você com uma pilha de serving; adotar o Solar Mini 4 compromete você com um formato de API. Qualquer que seja a sua escolha, o custo de troca é o que impede você de reavaliar daqui a seis meses, e a razão honesta para manter um roteador no cenário é manter esse custo próximo de zero.

Um ponto a esclarecer com precisão: o OrcaRouter não roteia nenhum modelo da Upstage, portanto o Solar Mini 4 não está disponível aqui — ele vem da própria API da Upstage e de várias plataformas de terceiros. Nós roteamos, sim, os tamanhos maiores do Gemma 4 do Google, o 26B-A4B e o 31B, mas não o checkpoint de 12B de que este artigo trata. A verdadeira função da plataforma neste contexto é a comparação que você faz depois deste artigo: depois de decidir "modelo de agente compacto, entrada de texto", a pergunta interessante passa a ser qual deles, e essa é uma pergunta que você responde colocando três deles por trás de uma única chave e medindo no seu próprio tráfego, em vez de ler outra ficha de especificações. Uma DSL de roteamento que compõe vários modelos em uma única chamada é como você executa esse teste sem escrever três integrações.

OrcaRouter scoreboard comparing Solar Mini 4 and Gemma 4 12B across six dimensions: architecture, weights, context, input modalities, price per million tokens, and Artificial Analysis Intelligence Index.

Qual escolher

Escolha o Gemma 4 12B se você tiver o hardware, se o seu agente precisar olhar imagens ou ouvir áudio, se você precisar dos pesos para ajuste fino, ou se a resposta a "para onde vão os dados" tiver de ser "para lugar nenhum". Escolha o Solar Mini 4 se você não quiser executar inferência, se suas entradas forem texto longo e suas saídas forem curtas, se uma janela de 512K importar, ou se você precisar de um modelo com o coreano em primeiro lugar e com um contrato de fornecedor por trás.

Se você está indeciso, o desempate não é um benchmark. É a pergunta que você ainda não consegue responder sobre o Solar Mini 4: ninguém fora da Upstage o mediu. O Gemma 4 12B tem um Intelligence Index de 14 e um ranking público; o Solar Mini 4 tem uma ficha técnica, um preço e uma promoção que expira em 22 de outubro. Testá-lo custa alguns dólares durante essa janela. Apostar em um caminho de produção nele custa uma reescrita se os números, quando chegarem, não forem favoráveis.