Cartão hero gerado para o explicador do Kolibri, encabeçado por "Kolibri: um modelo de pesos abertos de 78B da Alemanha", com o subtítulo "78B no total / 3,46B ativos / contexto de 1M tokens / Apache 2.0" e três ícones de linha planos: um beija-flor, uma pilha de camadas e um cadeado sobre um documento. O logotipo da OrcaRouter fica na faixa abaixo da arte.
Guides & Insights

Kolibri, explicado: Aleph Alpha lança um modelo alemão-inglês de 78B sob Apache 2.0

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A Aleph Alpha lançou Kolibri em 3 de outubro de 2026, um modelo de mistura de especialistas com 78,1 bilhões de parâmetros que ativa 3,46 bilhões de parâmetros por token, tem uma janela de contexto validada de 1.048.576 tokens e é disponibilizado com pesos completos no Hugging Face sob a licença Apache 2.0. O laboratório de Heidelberg publicou-o no Dia da Reunificação Alemã, juntamente com um relatório técnico, um cartão de modelo em alemão e inglês e um relato excepcionalmente detalhado de como o modelo foi treinado. O modelo usado como referência em toda a documentação da própria Aleph Alpha é Kolibri Origin — o predecessor de 30,6 bilhões de parâmetros e 3,27 bilhões ativos que concluiu o pré-treinamento em 11 de junho de 2026 e nunca foi divulgado publicamente. Dois modelos, com três meses de diferença, e a distância entre eles é a coisa mais interessante do lançamento.

O que faz Kolibri valer uma leitura atenta não é que ele seja o modelo mais forte disponível. Nas próprias tabelas comparativas da Aleph Alpha, ele não é, e chegaremos a isso. O que é notável é que um laboratório europeu tenha sequer lançado um modelo de pesos abertos nessa escala, com o pipeline de treinamento, a proveniência dos dados e o valor de energia publicados junto com ele, e tenha definido a licença como Apache 2.0 em vez de uma licença de pesquisa sob medida. Para equipes cujas regras de aquisição começam com "para onde vão os dados", essa combinação é o produto.

A ficha técnica, e os dois números que importam

Tudo abaixo é proveniente do cartão de modelo que a Aleph Alpha publicou junto com os pesos; nada disso foi reproduzido de forma independente até o momento, e não há linha da Artificial Analysis para o Kolibri no momento em que isto foi escrito.

• Parâmetros totais — 78.103.074.560, com 3.457.573.120 ativos por token, uma proporção de aproximadamente 22,6 para 1.

• Arquitetura — um transformer de 50 camadas, todas as camadas com mistura de especialistas, 384 especialistas por camada, com 1 compartilhado e 6 roteados, e uma proporção de 4:1 entre atenção de janela deslizante e atenção de consultas agrupadas em toda a pilha.

• Contexto — treinado com 16.384 tokens, com treinamento intermediário em 65.536 e estendido para um contexto nativo de 262.144. Como a codificação posicional é aplicada apenas nas camadas de janela deslizante, a Aleph Alpha afirma que a janela pode ser estendida sem escalonamento de posição e validou a qualidade e a eficiência de serving em até 1.048.576 tokens. O card recomenda permanecer em 262.144 ou menos para cargas de trabalho sensíveis à latência e para tarefas complexas.

• Precisão — pesos FP8 em blocos 128×128 com ativações quantizadas dinamicamente, avaliados com um cache KV FP8; embeddings, a cabeça LM, as normalizações e o roteador MoE permanecem em bfloat16.

• Reasoning — quatro níveis de esforço, nenhum, baixo, médio e alto, definidos através do template de chat.

• Chamada de ferramentas — sim, no estilo Hermes, com um parser vLLM fornecido no mesmo repositório que os pesos.

• Idiomas — alemão e inglês, e nada mais. Isso é apresentado como uma escolha de design, e não como uma omissão.

• Treinamento — 20 trilhões de tokens de pré-treinamento em um corpus bilíngue filtrado, aproximadamente 62,5 por cento em inglês, 23,9 por cento em alemão e 13,6 por cento em código, além de 3,44 trilhões de tokens de treinamento intermediário e 201 bilhões para extensão de contexto longo.

• Computação — 768 NVIDIA B200 em 96 nós HGX, 21 dias de pré-treinamento por 511 horas e 392.000 GPU-horas, com 6,4×10²³ FLOPs reportados. O treinamento intermediário acrescentou cinco dias e 90.000 GPU-horas; a extensão de contexto longo acrescentou 13 horas e 10.000 GPU-horas.

• Energia — 9,5×10² MWh estimados, incluindo a sobrecarga do centro de dados, abrangendo pré-treinamento, treinamento intermediário e treinamento de contexto longo, mas excluindo ajuste fino supervisionado e aprendizado por reforço.

• Licença — Apache 2.0. Sem adenda de uso aceitável, sem limite de usuários ativos mensais, sem termos comerciais separados.

Duas dessas linhas são as que um comprador deveria ler duas vezes. A contagem de parâmetros ativos é o que você paga na inferência, e 3,46 bilhões ativos de 78 bilhões no total é uma proporção de esparsidade agressiva — é exatamente por isso que um modelo desse tamanho consegue ser servido em duas GPUs. E o número de contexto é declarado como 262.144 nativos com 1.048.576 validados, o que é uma afirmação mais cuidadosa do que o simplista "contexto de 1M" que você verá na maioria da cobertura deste lançamento.

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

Dois modelos, com três meses de diferença.

O Kolibri é o segundo modelo daquilo que a Aleph Alpha chama de sua Model Factory, e o cronograma que ela publicou é a parte do lançamento que a maior parte da cobertura ignora.

O trabalho no pipeline de treinamento começou em janeiro de 2026. O Kolibri Origin concluiu o pré-treinamento na escala-alvo em 11 de junho de 2026 — 30,6 bilhões de parâmetros totais, 3,27 bilhões ativos, uma janela de contexto de 65.536 tokens, 7,51 trilhões de tokens de treinamento, 50 camadas, das quais duas eram densas e 48 eram MoE, e um único modo de raciocínio. Foi validado internamente e nunca lançado publicamente. O Kolibri concluiu o pré-treinamento em 11 de setembro de 2026.

• Parâmetros — 30,6B no total e 3,27B ativos, contra 78,1B no total e 3,46B ativos.

• Contexto — 8.192 tokens de contexto de pré-treinamento no Origin, contra 16.384 no Kolibri, chegando a 262.144 nativos.

• Dados — 7,51 trilhões de tokens de pré-treinamento no Origin, em comparação com 20 trilhões, extraídos de um conjunto bruto de mais de 200 trilhões que o pipeline filtrou, deduplicou e selecionou.

• Arquitetura — duas camadas densas mais 48 camadas MoE no Origin, contra 50 camadas MoE, com um design de atenção alterado, o triplo do número de especialistas, maior esparsidade e um algoritmo de roteamento substituído.

• Raciocínio — um modo no Origin, contra nenhum, baixo, médio e alto no Kolibri.

• Lançamento — sem lançamento público para o Origin, 3 de outubro de 2026 para o Kolibri.

Os números que mais mudam são os das suítes de tarefas, em que a mesma estrutura de avaliação pontuou os dois modelos. Na média alemã da suíte de pós-treinamento, Origin marcou 46,4 e Kolibri marcou 70,8; na média em inglês, 54,1 contra 75,5. No AIME 2025 em alemão, 73,5 contra 87,5. Nos benchmarks internos de proxy de cliente que o fornecedor publica como um conjunto vertical, a suíte de fornecedores automotivos passou de 0,72 para 0,99, os semicondutores de 0,35 para 0,80, o setor público alemão de 0,54 para 0,75, a tecnologia de acionamentos industriais de 0,31 para 0,60 e a aeroespacial de 0,14 para 0,59.

Esses números internos por vertical são administrados por fornecedores em suítes de avaliação criadas por fornecedores e concebidas em torno dos clientes do fornecedor; portanto, encare-os como uma descrição de intenção, e não como uma pontuação. O objetivo de publicá-los é que eles explicam para que o modelo foi otimizado: não um ranking, mas um conjunto de documentos de setores regulamentados.

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

O alemão é uma decisão de design aqui, não uma tag de idioma

A maioria dos cards de modelo "multilíngues" designa uma mistura de treinamento que por acaso incluía um pouco de alemão. Este foi construído ao contrário, e o card é específico sobre a mecânica.

{{1}}Aleph Alpha{{/1}} descobriu, a partir de pequenos experimentos com modelos proxy, que cerca de 20% de dados em alemão na mistura produziram os melhores resultados, o que, para uma execução de 20 trilhões de tokens, significava encontrar 4 trilhões de tokens em alemão. Conjuntos de dados abertos em alemão, deduplicados e filtrados, deram-lhe 390 bilhões — uma ordem de magnitude abaixo do objetivo. Ela fechou a lacuna de três formas: reajustando um filtro do Common Crawl especificamente para o alemão, o que produziu 1,3 trilhão de tokens orgânicos únicos; reformulando documentos existentes em alemão em entradas ao estilo de enciclopédia, diálogos de perguntas e respostas e passagens de texto, o que produziu cerca de 1 trilhão a mais e se tornou a maior fonte de alemão; e tradução, usada apenas no Kolibri Origin e descartada no Kolibri. O alemão acabou como um conjunto único de 2,4 trilhões de tokens, 80% dele curado ou gerado internamente, visto em 21,3% dos tokens de pré-treinamento após upsampling.

O detalhe do filtro merece ser citado porque é o tipo de coisa que só aparece num laboratório que realmente treinou em alemão. Um pipeline padrão de dados linguísticos descarta documentos com demasiadas palavras longas — mas a prosa administrativa alemã excede rotineiramente o limite inglês de comprimento médio das palavras, então as configurações predefinidas apagam silenciosamente o registo em que a administração pública escreve. A consequência comercial óbvia é que um modelo treinado com um filtro inglês de prateleira não tem praticamente nenhum vocabulário jurídico-administrativo alemão, e nenhum benchmark lhe dirá isso.

O tokenizador recebe o mesmo tratamento. A Aleph Alpha treinou um tokenizador bilíngue alemão-inglês com um vocabulário de 128.000 tokens usando um novo método que chama de UniBPE, que mantém a mesclagem bottom-up da codificação byte-pair, mas seleciona mesclagens com um objetivo unigram. Em texto web alemão, relata 4,90 bytes médios por token, à frente de GPT-5 com 4,35, Gemini com 4,13, Qwen3.5–3.8 com 4,17, GLM 5.3 com 3,93, DeepSeek V4 com 3,72 e Kimi K3 com 3,28 — todos números divulgados pelos fornecedores em suas próprias comparações. Mais texto por token significa menos tokens por tarefa, o que é um efeito direto de custo de inferência, e não uma alegação de qualidade, e é o tipo de ganho de eficiência que se acumula em uma carga de trabalho de processamento de documentos.

O que a tabela do fornecedor não resolve

A Aleph Alpha publicou uma comparação de pós-treinamento abrangendo catorze modelos, e ela é mais útil do que a maioria das tabelas de lançamento porque não bajula o objeto em questão.

No mesmo harness, com o Kolibri em esforço de raciocínio alto, o Qwen3.8 27B pontua 80,2 na média em inglês contra os 75,5 do Kolibri, e 70,9 na média geral contra 70,0. Ele também lidera no GPQA Diamond, no LiveCodeBench v6, no SWE-Bench Verified e nos dois benchmarks de contexto longo. O Nemotron 3 Super 120B-A12B pontua 73,0 em inglês contra os 75,5 do Kolibri — mais próximo, e à frente no AIME 2025. O Gemma 4 26B-A4B IT pontua 71,0 e 66,0 nas duas médias.

Portanto, o resumo honesto do lançamento não é "estado da arte". É que o Kolibri fica no meio de um campo de modelos que ativam entre três e doze bilhões de parâmetros por token, que vence claramente os muito menores e que perde para um modelo denso de 27 bilhões de parâmetros da Alibaba na maioria das linhas de sua própria tabela, enquanto ativa cerca de um oitavo dos parâmetros. O enquadramento da Aleph Alpha para isso é a fronteira de Pareto da qualidade em relação a tokens decodificados por segundo por GPU — nenhum dos modelos comparados entrega mais qualidade com o mesmo custo de serviço, nem a mesma qualidade com custo menor. Essa é a afirmação a ser interrogada, e é uma afirmação de economia de serviço, não uma afirmação de capacidade.

Nenhum destes números foi verificado de forma independente. Não existe uma entrada da Artificial Analysis para o Kolibri, nem replicação do framework de avaliação por terceiros, e os benchmarks verticais foram criados pelo fornecedor. A comparação também é estruturalmente generosa com o Kolibri numa direção e pouco generosa noutra: todos os catorze modelos foram executados no próprio harness da Aleph Alpha, com prompts e definições de few-shot idênticos, o que é a forma correta de o fazer, mas continua a ser o harness de um único laboratório. Considere todos os números desta secção como comunicados pelo fornecedor até que outra pessoa os execute.

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

O que você precisa para executá-lo

O Kolibri não é um modelo para experimentar num laptop. Os pesos FP8 representam uma ocupação de memória do modelo de cerca de 78 GB, e o mínimo de placas é duas placas A100 de 80 GB, duas H100 SXM5, uma H200, uma B200 ou uma B300; a configuração recomendada é duas H100 SXM5, duas H200, uma B200 ou uma B300.

Servi-lo significa instalar o pacote aleph-alpha-inference, que fornece o plugin Kolibri para vLLM e fixa a versão do vLLM que ele suporta, ou baixar a imagem de contêiner ghcr.io/aleph-alpha/aleph-alpha-inference. A partir daí, é uma invocação padrão do vLLM com o cache KV FP8, o analisador de raciocínio Kolibri e o analisador de chamadas de ferramentas Kolibri. Contextos além de 262.144 tokens precisam de uma flag explícita de comprimento máximo do modelo e de uma substituição do embedding de posição. Os parâmetros de amostragem recomendados são temperatura 1,0, top-p 0,97 e top-k 128.

A superfície da API é compatível com a OpenAI, o que importa mais do que parece: o esforço de raciocínio é passado pelo template de chat como um valor reasoning_effort, e as chamadas de ferramentas são emitidas no campo padrão tools. Uma equipe que já fala o formato chat-completions pode apontar o código existente para um endpoint Kolibri em uma máquina no próprio prédio, sem uma camada de wrapper.

O que o Kolibri ainda não tem

Quatro ausências merecem ser ditas claramente, porque a cobertura de lançamento tende a ignorá-las.

• Nenhuma avaliação independente. A Artificial Analysis não tem página de modelo para o Kolibri, e nenhum terceiro publicou uma reprodução da tabela de benchmarks do fornecedor.

• Nenhum endpoint hospedado do fornecedor. O lançamento consiste em pesos e um relatório técnico; não há SKU de API da Aleph Alpha para o Kolibri no material publicado com o modelo.

• Nenhuma rota no OrcaRouter, e nenhuma em qualquer agregador que mencionaríamos. Sondamos o catálogo sob todas as grafias do prefixo do fornecedor e do nome do modelo, e Kolibri não está lá — então, se você quiser chamá-lo, você mesmo baixa 78 GB e executa um endpoint vLLM. Preferimos dizer isso a dar a entender que o servimos.

• Sem entrada multimodal. Texto entra, texto sai, dois idiomas. Essa é a troca que o laboratório fez, priorizando profundidade em vez de amplitude, e para uma implantação de processamento de documentos provavelmente é a escolha certa, mas é um limite real.

Se o que você realmente precisa hoje é de um pequeno modelo de mistura de especialistas que você possa chamar sem comprar duas GPUs, o nível Gemma 4 MoE é a coisa mais próxima já disponível em um endpoint roteado, a $0,06 por milhão de tokens de entrada e $0,33 por milhão de saída na variante 26B-A4B, com uma janela de 262.144 tokens. Para quem estiver comparando uma implantação soberana 78B auto-hospedada com isso, a comparação útil não são linhas de benchmark — são 78 GB de VRAM e uma conversa de aquisição versus um item de linha por token. O OrcaRouter roteia esse nível em uma única chave compatível com OpenAI, com o preço de lista do provedor repassado e nada acrescentado, que é a maneira barata de descobrir se a carga de trabalho justifica possuir o hardware.

O próprio Kolibri é o artefato mais interessante. Um modelo alemão-inglês de 78 bilhões de parâmetros sob Apache 2.0, com o pipeline de dados, o método do tokenizador, o número de energia e uma história de iteração de três meses publicados ao lado dos pesos, é um tipo diferente de lançamento em relação ao habitual despejo de pesos — a divulgação é parte do produto, não um post de blog sobre ele. Se a alegação de Pareto se sustenta é agora uma questão para pessoas com duas H100s e um cronômetro, e a resposta não virá de ninguém que escreveu o cartão do modelo.