Cartela de título com os dizeres “Kolibri vs Solar Mini 4”, com o subtítulo “O mesmo orçamento de 3B ativos, duas apostas muito diferentes”, e duas linhas em letras miúdas com os dizeres “Kolibri — 78,1B no total, pesos Apache 2.0, auto-hospedado” e “Solar Mini 4 — 35B no total, fechado, API hospedada”, sobre um fundo branco com suaves detalhes em gradiente azul e ciano e o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Kolibri vs Solar Mini 4: O Mesmo Orçamento Ativo de 3B, Duas Apostas Muito Diferentes

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois modelos foram lançados com dezessete dias de diferença, ambos ajustados para gastar cerca de três bilhões de parâmetros ativos por token, e dificilmente poderiam ser mais diferentes quando se trata de adotá-los de verdade. O Kolibri, da Aleph Alpha, tem 78,1 bilhões de parâmetros de pesos Apache-2.0 que você baixa e serve por conta própria: não existe endpoint hospedado e, até hoje, não há uma única pontuação independente dele em lugar nenhum. O Solar Mini 4, da Upstage, tem 35 bilhões de parâmetros que você não pode baixar de forma alguma — ele existe apenas como um endpoint tarifado por uso, e já tem um Artificial Analysis Intelligence Index de 24,05. A contagem de parâmetros ativos diz quanto custa executar cada um. Nada mais nesse número diz quanto custa para você começar.

A razão pela qual os totais divergem tanto — 78,1B contra 35B com quase a mesma fração ativa — é que ambos são projetos esparsos de mistura de especialistas, e os dois laboratórios tomaram decisões opostas sobre quanta capacidade de especialistas manter em reserva. O Kolibri carrega 384 especialistas e encaminha para 1 compartilhado mais 6 deles por token. O Solar Mini 4 divulga uma divisão 35B/3B e nada sobre seu número de especialistas. Quando dois modelos são anunciados com o mesmo valor ativo, o total de parâmetros, e não o valor ativo, é o que decide sua conta de hardware — e aqui há uma diferença de 2,2× no mesmo orçamento de computação declarado.

O que cada um realmente é

• Total de parâmetros — Kolibri 78,10B vs Solar Mini 4 35B

• Parâmetros ativos por token — Kolibri 3.46B vs Solar Mini 4 3B

• Pesos — Kolibri Apache 2.0, pesos completos no Hugging Face vs Solar Mini 4 fechado; apenas API

• Contexto — Kolibri 1.048.576 tokens validados vs. Solar Mini 4 512K de acordo com a documentação da Upstage, 1.048.576 de acordo com o cartão de modelo da Artificial Analysis

• Saída máxima — Kolibri não limitado pelo fornecedor vs Solar Mini 4 128.000 tokens

• Idiomas — Kolibri alemão e inglês vs Solar Mini 4 inglês, coreano e japonês

• Data limite de conhecimento — Kolibri 18 de junho de 2026 vs Solar Mini 4 de fevereiro de 2026

• Entrega — Kolibri auto-hospedado (vLLM) vs. Solar Mini 4 hospedado no Console e Playground da Upstage e on-premises

• Avaliação independente — Kolibri: nenhuma publicada vs Solar Mini 4 AA Intelligence Index 24.05

Kolibri: 78 bilhões de parâmetros, e ninguém fora do laboratório o avaliou

A Aleph Alpha publicou o Kolibri em 3 de outubro de 2026, deliberadamente no Dia da Reunificação Alemã, como o primeiro de uma nova família e o sucessor do Kolibri Origin. O cartão do modelo é excecionalmente franco quanto ao que foi investido nele: 20 biliões de tokens de pré-treinamento, 3,44 biliões de treinamento intermédio e 201 mil milhões de treinamento de contexto longo, executados em 768 GPUs B200 ao longo de 21 dias, para aproximadamente 6,4×10²³ FLOPs e cerca de 950 MWh. O fornecedor também revela voluntariamente o número de falhas — 38 interrupções não planeadas, cerca de uma por cada 10 000 horas de GPU —, que é o tipo de número que os laboratórios normalmente omitem.

Screenshot of Aleph Alpha's newsroom post “Kolibri Has Landed”, showing the 03/10/2026 release date, the line about releasing on the Day of German Reunification, and the architecture comparison table between Kolibri and Kolibri Origin.

A arquitetura é uma história clara de MoE esparsa. Cinquenta camadas com uma proporção de 4:1 entre atenção de janela deslizante (janelas de 512 tokens) e atenção global, que só é ativada a cada cinco camadas. Pesos FP8 com escalonamento em blocos de 128×128 e um cache KV FP8. Kolibri Origin, para comparação, usava 128 especialistas roteados em 8 vias, uma dimensão oculta de especialista de 768 e atenção completa em todas as camadas, em dados em inglês com corte em setembro de 2024. Kolibri passa para 384 especialistas roteados em 6 vias com uma dimensão oculta de 512, e avança os cortes de ambos os idiomas para 18 de junho de 2026.

O pipeline alemão é a parte que é genuinamente difícil de comprar em outro lugar. A Aleph Alpha treinou seu próprio tokenizador UniBPE e reporta que o texto em alemão ocupa 4,90 bytes por token, contra 4,35 do GPT-5, 4,17 do Qwen3.5 e 4,13 do Gemini. Trata-se de um tokenizador que alega ter melhor compressão do alemão do que qualquer um dos modelos multilíngues de fronteira, e é o mecanismo concreto por trás do argumento de venda da implantação soberana: menos tokens por documento em alemão significa menos tokens faturados e uma janela efetiva mais longa no mesmo hardware.

Todos os números de desempenho existentes para o Kolibri vêm do próprio model card da Aleph Alpha e devem ser lidos dessa forma. A tabela comunicada pelo fornecedor apresenta o Kolibri com uma pontuação global de 75,5 nas avaliações em inglês e 70,8 em alemão, 84,3 no GPQA Diamond em inglês contra 81,3 em alemão, 21,5 no Humanity's Last Exam em inglês contra 15,9 em alemão, 66,4 no SWE-Bench Verified, 85,9 no LiveCodeBench v6 e 68,3 no AA-LCR. Esses são números não auditados. Não existe uma página do Artificial Analysis para o Kolibri — o URL do modelo no tracker devolve um 404 —, portanto nada nessa tabela foi reproduzido de forma independente, e o artigo que você está a ler não pode torná-lo mais sólido do que é.

O que a placa consolida é a história do serving. O piso de hardware são duas A100 80GB, ou duas H100 SXM5, ou uma única H200, B200 ou B300. Uma receita vLLM publicada executa-o com --kv-cache-dtype fp8 e parsers dedicados de raciocínio e de chamadas de ferramentas, à temperatura 1.0, top-p 0.97 e top-k 128, com um seletor reasoning_effort que abrange none, low, medium e high. Um único B300 a servir um modelo de 78B num contexto validado de 1M tokens é a forma concreta da oferta: compra a caixa e depois passa a suportar o custo marginal de cada token.

Solar Mini 4: você aluga a fatia ativa de 3B em vez de comprá-la

O Solar Mini 4 foi lançado em 22 de setembro de 2026 — snapshot solar-mini4-260922, alias solar-mini4 — como o modelo pequeno orientado a agentes da Upstage: 35B no total, 3B ativos, data de corte em fevereiro de 2026, inglês, coreano e japonês, com modos de chat, raciocínio, saída estruturada e chamada de ferramentas. Ele está disponível por meio do Console e do Playground da Upstage, e para implantação local, mas não há download de pesos nem licença para inspecionar. A documentação da Upstage também registra "Dados não coletados" para ele, que é a linha de conformidade que importa se você o estiver colocando diante de tráfego real.

Screenshot of Upstage's Console documentation page for Solar Mini 4, showing the snapshot identifier solar-mini4-260922, the release date 2026-09-22, 35B total and 3B active parameters, a 512K context window with 128K maximum output, the list price of $0.10 per million input, $0.40 per million output and $0.01 per million cached, and the note “Data not collected”.

Ao contrário do Kolibri, o Solar Mini 4 passou por uma bateria de testes independente. A Artificial Analysis o coloca com um Índice de Inteligência de 24,05, com 1,01% medidos no Terminal-Bench 4.0, 47,6% no SciCode, 83,3% no AA-LCR e 25,8% no Humanity's Last Exam. O post de lançamento da Upstage apresenta o 24,1 como o maior Índice entre modelos com 3B de parâmetros ativos, à frente do Qwen3.6 35B A3B, com 18, e do Nemotron 3.5 Lightning, com 13 — uma formulação que é justa até onde vai e que, vale notar, é exatamente tão restrita quanto parece, já que é uma afirmação sobre a classe de 3B ativos, e não sobre modelos pequenos em geral.

A medida que deve moldar como você faz seu orçamento para isso não é o Index. O detalhamento de custo por tarefa da Artificial Analysis coloca o Solar Mini 4 em cerca de US$ 0,36 por Intelligence-Agent, e cerca de US$ 0,30 disso — uns 82% — é cache de prompt gravações. As leituras de cache são $0,035 e a saída gerada é de apenas $0,035. O modelo emite cerca de 88.300 tokens de saída por tarefa, dos quais cerca de 71.600 são tokens de raciocínio. Em outras palavras: este é um modelo barato cuja conta é dominada por reescrever um contexto longo, não pelos tokens que ele escreve de volta. Os custos por avaliação variam de $1,63 para o Terminal-Bench 4.0 até $0,95 para o AA-Briefcase. A velocidade mediana de saída é de 198 tokens por segundo com um tempo até o primeiro chunk de 1,58 segundos.

O preço de cada caminho

O Solar Mini 4 não está hoje com o preço de tabela. A página de preços da Upstage apresenta para ele uma escala datada: $0.03 por milhão de tokens de entrada, $0.003 em cache e $0.12 de saída — um desconto de lançamento de 70% — até 10 de outubro de 2026 UTC; depois, $0.05 / $0.005 / $0.20 a partir de 11 de outubro; e, por fim, o preço de tabela de $0.10 / $0.01 / $0.40 a partir de 23 de outubro. O post de lançamento da Upstage descreve o desconto de forma mais vaga do que o próprio cronograma da página de preços; a escala acima é a versão com datas, e é aquela que vale a pena tomar como base de planejamento. Repare onde está o desconto mais acentuado: a entrada cai para um décimo da tarifa de entrada, o que recompensa exatamente a carga de trabalho de contexto longo e estável pela qual o perfil de custo de escrita em cache acima cobra.

O preço do Kolibri é uma ordem de compra. Não há uma tarifa por milhão de tokens para comparar porque não existe medição hospedada — você paga pelas GPUs e pela eletricidade, e o único sinal público de custo do fornecedor é o próprio treinamento: cerca de 950 MWh para produzir o modelo. Se você já possui capacidade de inferência, o custo marginal por token do Kolibri se aproxima do custo da eletricidade; se não possui, o preço de entrada é uma máquina com duas A100 ou melhor. Essa é uma forma de compromisso fundamentalmente diferente da de um modelo que você pode chamar por milhões de tokens e parar de chamar amanhã, e é a decisão real que as duas opções apresentam.

Onde eles se sobrepõem, e onde a comparação falha

• Computação ativa — quase idêntica: 3,46B contra 3B por token

• Tudo o que decorre disso — não comparável, porque apenas um dos dois tem qualquer evidência verificada

• Melhor pontuação medida — Solar Mini 4 tem uma pontuação auditada de 24,05; Kolibri tem uma tabela do fornecedor e nenhuma pontuação auditada.

• Alemão — Kolibri é o único dos dois treinado para isso, a 4,90 bytes por token; o Solar Mini 4 não o lista

• Coreano e japonês — O Solar Mini 4 lista ambos; o Kolibri não lista nenhum

• Contexto longo — Kolibri valida um total de 1.048.576 tokens; a documentação do próprio Solar Mini 4 diz 512K, enquanto a ficha dele no Artificial Analysis diz 1M, então trate o teto como dependente do fornecedor.

• Tempo até o primeiro token — o Solar Mini 4 leva minutos, porque você se cadastra; o Kolibri leva dias, porque você precisa montar um servidor em rack

• Modelo de custo — por token, caindo conforme a escada de descontos, em comparação com capital mais energia

O resumo honesto é que esta não é uma disputa que se resolve em um ranking. A tabela do fornecedor do Kolibri inclui até seu próprio conjunto de comparações — GLM-4.7 Flash 30B-A3B com 64,7 no geral em inglês, Nemotron 3 Nano 30B-A3B com 65,6, Qwen3.5 35B-A3B com 74,7, Qwen3.6 35B-A3B com 71,4, Gemma 4 26B-A4B IT com 71,9, todos contra os 75,5 do próprio Kolibri — e cada uma dessas linhas é um número da própria Aleph Alpha, executado pelo mesmo laboratório em seu próprio harness. É um mapa útil da vizinhança de 3B ativos. Não é um ranking independente.

Se o que você quer é um MoE com 3B ativos em uma chave hoje

Nenhum dos modelos desta comparação está no OrcaRouter, e vale a pena ser preciso quanto ao motivo. O Kolibri ainda não tem nenhum tipo de inferência hospedada — são pesos e uma receita de vLLM, então não há nada para um roteador apontar. O Solar Mini 4 é servido pela Upstage e pelo canal on-premises da própria Upstage; não o roteamos, e não roteamos nenhum modelo da Upstage. Se você quiser qualquer um dos dois, obtém-os diretamente dos fornecedores.

A rota que oferecemos é a classe circundante — o segmento de pequenos MoE esparsos no qual ambos esses modelos estão competindo. Gemma 4 26B-A4B IT está no catálogo a $0,06 de entrada e $0,33 de saída por milhão de tokens, com uma janela de 262.144 tokens. Qwen3.5 35B-A3B está a $0,057 / $0,459 e Qwen3.6 35B-A3B a $0,248 / $1,485, com uma janela de 262.144 tokens e 65.536 tokens de saída máxima. Essa é a mesma troca que os dois modelos acima estão fazendo — uma fatia ativa de 3B a 4B comprada pelo preço de um modelo pequeno — disponível em uma única chave de API com o preço de tabela do provedor repassado a 0% de acréscimo, então uma mudança de preço do fornecedor cai na sua fatura no mesmo dia em que é anunciada, em vez de só na próxima renovação de contrato. O failover automático importa mais aqui do que o habitual: quando você está avaliando um modelo esparso não comprovado, uma segunda rota por trás da mesma chave é o que impede que uma tarde ruim se torne uma indisponibilidade.

A two-column comparison scoreboard titled “Kolibri vs Solar Mini 4 — the scoreboard”. The Kolibri column lists total parameters 78.1B, 3.46B active per token, Apache 2.0 downloadable weights, 1,048,576-token context, German and English, and no independent score published. The Solar Mini 4 column lists total parameters 35B, 3B active per token, closed API-only weights, a 512K-per-docs / 1M-per-Artificial-Analysis context, English, Korean and Japanese, and an Artificial Analysis Intelligence Index of 24.05. A footer line reads “Kolibri figures are Aleph Alpha's own, unaudited; Solar Mini 4 figures per Artificial Analysis and Upstage.”

O que fazer, e o que assistir

Escolha o Kolibri se alemão ou inglês for sua carga de trabalho, se os dados não puderem sair do seu próprio rack, e se você tiver — ou estiver disposto a comprar — as GPUs para servir 78B em FP8. Nessa configuração, é o único destes dois modelos que é sequer uma opção, e o contexto validado de 1M tokens com um tokenizador alemão de 4,90 bytes por token é uma vantagem real, ainda que medida pelo fornecedor. Escolha o Solar Mini 4 se você quiser estar em produção esta semana, se coreano ou japonês estiver no roteiro, e se sua carga de trabalho for um contexto longo e estável que o desconto de cache recompensa; reserve orçamento para gravações de cache, não para tokens de saída.

A questão em aberto é a mesma para ambos, e é uma questão de evidência e não de capacidade. Os 75,5 e 84,3 do Kolibri são números da própria Aleph Alpha no harness da própria Aleph Alpha, e até que um avaliador independente os teste, quem os citar está a citar o laboratório. Os 24,05 do Solar Mini 4 são reais e reproduzidos, mas o Index é uma fotografia de um modelo que ainda está a meio da escada de descontos, com o preço de tabela a chegar apenas a 23 de outubro. Fique atento à primeira avaliação independente do Kolibri, e fique atento ao custo real do Solar Mini 4 quando a escada terminar — porque a $0,10 / $0,40 a economia de alugar a fatia de 3B parece diferente dos $0,03 / $0,12 que lhe estão a ser apresentados hoje.