
Kolibri vs Solar Mini 4: O Mesmo Orçamento Ativo de 3B, Duas Apostas Muito Diferentes
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 217 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 116 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Dois modelos foram lançados com dezessete dias de diferença, ambos ajustados para gastar cerca de três bilhões de parâmetros ativos por token, e dificilmente poderiam ser mais diferentes quando se trata de adotá-los de verdade. O Kolibri, da Aleph Alpha, tem 78,1 bilhões de parâmetros de pesos Apache-2.0 que você baixa e serve por conta própria: não existe endpoint hospedado e, até hoje, não há uma única pontuação independente dele em lugar nenhum. O Solar Mini 4, da Upstage, tem 35 bilhões de parâmetros que você não pode baixar de forma alguma — ele existe apenas como um endpoint tarifado por uso, e já tem um Artificial Analysis Intelligence Index de 24,05. A contagem de parâmetros ativos diz quanto custa executar cada um. Nada mais nesse número diz quanto custa para você começar.
A razão pela qual os totais divergem tanto — 78,1B contra 35B com quase a mesma fração ativa — é que ambos são projetos esparsos de mistura de especialistas, e os dois laboratórios tomaram decisões opostas sobre quanta capacidade de especialistas manter em reserva. O Kolibri carrega 384 especialistas e encaminha para 1 compartilhado mais 6 deles por token. O Solar Mini 4 divulga uma divisão 35B/3B e nada sobre seu número de especialistas. Quando dois modelos são anunciados com o mesmo valor ativo, o total de parâmetros, e não o valor ativo, é o que decide sua conta de hardware — e aqui há uma diferença de 2,2× no mesmo orçamento de computação declarado.
O que cada um realmente é
• Total de parâmetros — Kolibri 78,10B vs Solar Mini 4 35B
• Parâmetros ativos por token — Kolibri 3.46B vs Solar Mini 4 3B
• Pesos — Kolibri Apache 2.0, pesos completos no Hugging Face vs Solar Mini 4 fechado; apenas API
• Contexto — Kolibri 1.048.576 tokens validados vs. Solar Mini 4 512K de acordo com a documentação da Upstage, 1.048.576 de acordo com o cartão de modelo da Artificial Analysis
• Saída máxima — Kolibri não limitado pelo fornecedor vs Solar Mini 4 128.000 tokens
• Idiomas — Kolibri alemão e inglês vs Solar Mini 4 inglês, coreano e japonês
• Data limite de conhecimento — Kolibri 18 de junho de 2026 vs Solar Mini 4 de fevereiro de 2026
• Entrega — Kolibri auto-hospedado (vLLM) vs. Solar Mini 4 hospedado no Console e Playground da Upstage e on-premises
• Avaliação independente — Kolibri: nenhuma publicada vs Solar Mini 4 AA Intelligence Index 24.05
Kolibri: 78 bilhões de parâmetros, e ninguém fora do laboratório o avaliou
A Aleph Alpha publicou o Kolibri em 3 de outubro de 2026, deliberadamente no Dia da Reunificação Alemã, como o primeiro de uma nova família e o sucessor do Kolibri Origin. O cartão do modelo é excecionalmente franco quanto ao que foi investido nele: 20 biliões de tokens de pré-treinamento, 3,44 biliões de treinamento intermédio e 201 mil milhões de treinamento de contexto longo, executados em 768 GPUs B200 ao longo de 21 dias, para aproximadamente 6,4×10²³ FLOPs e cerca de 950 MWh. O fornecedor também revela voluntariamente o número de falhas — 38 interrupções não planeadas, cerca de uma por cada 10 000 horas de GPU —, que é o tipo de número que os laboratórios normalmente omitem.

A arquitetura é uma história clara de MoE esparsa. Cinquenta camadas com uma proporção de 4:1 entre atenção de janela deslizante (janelas de 512 tokens) e atenção global, que só é ativada a cada cinco camadas. Pesos FP8 com escalonamento em blocos de 128×128 e um cache KV FP8. Kolibri Origin, para comparação, usava 128 especialistas roteados em 8 vias, uma dimensão oculta de especialista de 768 e atenção completa em todas as camadas, em dados em inglês com corte em setembro de 2024. Kolibri passa para 384 especialistas roteados em 6 vias com uma dimensão oculta de 512, e avança os cortes de ambos os idiomas para 18 de junho de 2026.
O pipeline alemão é a parte que é genuinamente difícil de comprar em outro lugar. A Aleph Alpha treinou seu próprio tokenizador UniBPE e reporta que o texto em alemão ocupa 4,90 bytes por token, contra 4,35 do GPT-5, 4,17 do Qwen3.5 e 4,13 do Gemini. Trata-se de um tokenizador que alega ter melhor compressão do alemão do que qualquer um dos modelos multilíngues de fronteira, e é o mecanismo concreto por trás do argumento de venda da implantação soberana: menos tokens por documento em alemão significa menos tokens faturados e uma janela efetiva mais longa no mesmo hardware.
Todos os números de desempenho existentes para o Kolibri vêm do próprio model card da Aleph Alpha e devem ser lidos dessa forma. A tabela comunicada pelo fornecedor apresenta o Kolibri com uma pontuação global de 75,5 nas avaliações em inglês e 70,8 em alemão, 84,3 no GPQA Diamond em inglês contra 81,3 em alemão, 21,5 no Humanity's Last Exam em inglês contra 15,9 em alemão, 66,4 no SWE-Bench Verified, 85,9 no LiveCodeBench v6 e 68,3 no AA-LCR. Esses são números não auditados. Não existe uma página do Artificial Analysis para o Kolibri — o URL do modelo no tracker devolve um 404 —, portanto nada nessa tabela foi reproduzido de forma independente, e o artigo que você está a ler não pode torná-lo mais sólido do que é.
O que a placa consolida é a história do serving. O piso de hardware são duas A100 80GB, ou duas H100 SXM5, ou uma única H200, B200 ou B300. Uma receita vLLM publicada executa-o com --kv-cache-dtype fp8 e parsers dedicados de raciocínio e de chamadas de ferramentas, à temperatura 1.0, top-p 0.97 e top-k 128, com um seletor reasoning_effort que abrange none, low, medium e high. Um único B300 a servir um modelo de 78B num contexto validado de 1M tokens é a forma concreta da oferta: compra a caixa e depois passa a suportar o custo marginal de cada token.
Solar Mini 4: você aluga a fatia ativa de 3B em vez de comprá-la
O Solar Mini 4 foi lançado em 22 de setembro de 2026 — snapshot solar-mini4-260922, alias solar-mini4 — como o modelo pequeno orientado a agentes da Upstage: 35B no total, 3B ativos, data de corte em fevereiro de 2026, inglês, coreano e japonês, com modos de chat, raciocínio, saída estruturada e chamada de ferramentas. Ele está disponível por meio do Console e do Playground da Upstage, e para implantação local, mas não há download de pesos nem licença para inspecionar. A documentação da Upstage também registra "Dados não coletados" para ele, que é a linha de conformidade que importa se você o estiver colocando diante de tráfego real.

Ao contrário do Kolibri, o Solar Mini 4 passou por uma bateria de testes independente. A Artificial Analysis o coloca com um Índice de Inteligência de 24,05, com 1,01% medidos no Terminal-Bench 4.0, 47,6% no SciCode, 83,3% no AA-LCR e 25,8% no Humanity's Last Exam. O post de lançamento da Upstage apresenta o 24,1 como o maior Índice entre modelos com 3B de parâmetros ativos, à frente do Qwen3.6 35B A3B, com 18, e do Nemotron 3.5 Lightning, com 13 — uma formulação que é justa até onde vai e que, vale notar, é exatamente tão restrita quanto parece, já que é uma afirmação sobre a classe de 3B ativos, e não sobre modelos pequenos em geral.
A medida que deve moldar como você faz seu orçamento para isso não é o Index. O detalhamento de custo por tarefa da Artificial Analysis coloca o Solar Mini 4 em cerca de US$ 0,36 por Intelligence-Agent, e cerca de US$ 0,30 disso — uns 82% — é cache de prompt gravações. As leituras de cache são $0,035 e a saída gerada é de apenas $0,035. O modelo emite cerca de 88.300 tokens de saída por tarefa, dos quais cerca de 71.600 são tokens de raciocínio. Em outras palavras: este é um modelo barato cuja conta é dominada por reescrever um contexto longo, não pelos tokens que ele escreve de volta. Os custos por avaliação variam de $1,63 para o Terminal-Bench 4.0 até $0,95 para o AA-Briefcase. A velocidade mediana de saída é de 198 tokens por segundo com um tempo até o primeiro chunk de 1,58 segundos.
O preço de cada caminho
O Solar Mini 4 não está hoje com o preço de tabela. A página de preços da Upstage apresenta para ele uma escala datada: $0.03 por milhão de tokens de entrada, $0.003 em cache e $0.12 de saída — um desconto de lançamento de 70% — até 10 de outubro de 2026 UTC; depois, $0.05 / $0.005 / $0.20 a partir de 11 de outubro; e, por fim, o preço de tabela de $0.10 / $0.01 / $0.40 a partir de 23 de outubro. O post de lançamento da Upstage descreve o desconto de forma mais vaga do que o próprio cronograma da página de preços; a escala acima é a versão com datas, e é aquela que vale a pena tomar como base de planejamento. Repare onde está o desconto mais acentuado: a entrada cai para um décimo da tarifa de entrada, o que recompensa exatamente a carga de trabalho de contexto longo e estável pela qual o perfil de custo de escrita em cache acima cobra.
O preço do Kolibri é uma ordem de compra. Não há uma tarifa por milhão de tokens para comparar porque não existe medição hospedada — você paga pelas GPUs e pela eletricidade, e o único sinal público de custo do fornecedor é o próprio treinamento: cerca de 950 MWh para produzir o modelo. Se você já possui capacidade de inferência, o custo marginal por token do Kolibri se aproxima do custo da eletricidade; se não possui, o preço de entrada é uma máquina com duas A100 ou melhor. Essa é uma forma de compromisso fundamentalmente diferente da de um modelo que você pode chamar por milhões de tokens e parar de chamar amanhã, e é a decisão real que as duas opções apresentam.
Onde eles se sobrepõem, e onde a comparação falha
• Computação ativa — quase idêntica: 3,46B contra 3B por token
• Tudo o que decorre disso — não comparável, porque apenas um dos dois tem qualquer evidência verificada
• Melhor pontuação medida — Solar Mini 4 tem uma pontuação auditada de 24,05; Kolibri tem uma tabela do fornecedor e nenhuma pontuação auditada.
• Alemão — Kolibri é o único dos dois treinado para isso, a 4,90 bytes por token; o Solar Mini 4 não o lista
• Coreano e japonês — O Solar Mini 4 lista ambos; o Kolibri não lista nenhum
• Contexto longo — Kolibri valida um total de 1.048.576 tokens; a documentação do próprio Solar Mini 4 diz 512K, enquanto a ficha dele no Artificial Analysis diz 1M, então trate o teto como dependente do fornecedor.
• Tempo até o primeiro token — o Solar Mini 4 leva minutos, porque você se cadastra; o Kolibri leva dias, porque você precisa montar um servidor em rack
• Modelo de custo — por token, caindo conforme a escada de descontos, em comparação com capital mais energia
O resumo honesto é que esta não é uma disputa que se resolve em um ranking. A tabela do fornecedor do Kolibri inclui até seu próprio conjunto de comparações — GLM-4.7 Flash 30B-A3B com 64,7 no geral em inglês, Nemotron 3 Nano 30B-A3B com 65,6, Qwen3.5 35B-A3B com 74,7, Qwen3.6 35B-A3B com 71,4, Gemma 4 26B-A4B IT com 71,9, todos contra os 75,5 do próprio Kolibri — e cada uma dessas linhas é um número da própria Aleph Alpha, executado pelo mesmo laboratório em seu próprio harness. É um mapa útil da vizinhança de 3B ativos. Não é um ranking independente.
Se o que você quer é um MoE com 3B ativos em uma chave hoje
Nenhum dos modelos desta comparação está no OrcaRouter, e vale a pena ser preciso quanto ao motivo. O Kolibri ainda não tem nenhum tipo de inferência hospedada — são pesos e uma receita de vLLM, então não há nada para um roteador apontar. O Solar Mini 4 é servido pela Upstage e pelo canal on-premises da própria Upstage; não o roteamos, e não roteamos nenhum modelo da Upstage. Se você quiser qualquer um dos dois, obtém-os diretamente dos fornecedores.
A rota que oferecemos é a classe circundante — o segmento de pequenos MoE esparsos no qual ambos esses modelos estão competindo. Gemma 4 26B-A4B IT está no catálogo a $0,06 de entrada e $0,33 de saída por milhão de tokens, com uma janela de 262.144 tokens. Qwen3.5 35B-A3B está a $0,057 / $0,459 e Qwen3.6 35B-A3B a $0,248 / $1,485, com uma janela de 262.144 tokens e 65.536 tokens de saída máxima. Essa é a mesma troca que os dois modelos acima estão fazendo — uma fatia ativa de 3B a 4B comprada pelo preço de um modelo pequeno — disponível em uma única chave de API com o preço de tabela do provedor repassado a 0% de acréscimo, então uma mudança de preço do fornecedor cai na sua fatura no mesmo dia em que é anunciada, em vez de só na próxima renovação de contrato. O failover automático importa mais aqui do que o habitual: quando você está avaliando um modelo esparso não comprovado, uma segunda rota por trás da mesma chave é o que impede que uma tarde ruim se torne uma indisponibilidade.

O que fazer, e o que assistir
Escolha o Kolibri se alemão ou inglês for sua carga de trabalho, se os dados não puderem sair do seu próprio rack, e se você tiver — ou estiver disposto a comprar — as GPUs para servir 78B em FP8. Nessa configuração, é o único destes dois modelos que é sequer uma opção, e o contexto validado de 1M tokens com um tokenizador alemão de 4,90 bytes por token é uma vantagem real, ainda que medida pelo fornecedor. Escolha o Solar Mini 4 se você quiser estar em produção esta semana, se coreano ou japonês estiver no roteiro, e se sua carga de trabalho for um contexto longo e estável que o desconto de cache recompensa; reserve orçamento para gravações de cache, não para tokens de saída.
A questão em aberto é a mesma para ambos, e é uma questão de evidência e não de capacidade. Os 75,5 e 84,3 do Kolibri são números da própria Aleph Alpha no harness da própria Aleph Alpha, e até que um avaliador independente os teste, quem os citar está a citar o laboratório. Os 24,05 do Solar Mini 4 são reais e reproduzidos, mas o Index é uma fotografia de um modelo que ainda está a meio da escada de descontos, com o preço de tabela a chegar apenas a 23 de outubro. Fique atento à primeira avaliação independente do Kolibri, e fique atento ao custo real do Solar Mini 4 quando a escada terminar — porque a $0,10 / $0,40 a economia de alugar a fatia de 3B parece diferente dos $0,03 / $0,12 que lhe estão a ser apresentados hoje.
