
O Primeiro Dia do Kolibri: a Aleph Alpha abriu 78B de pesos alemão-inglês, e a reação está correndo à frente das evidências
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 217 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Vinte e quatro horas depois de a Aleph Alpha publicar o Kolibri, a reação cristalizou-se numa única frase, e vale a pena desmontar essa frase. O laboratório de Heidelberg colocou um modelo de mistura de especialistas de 78,1 bilhões de parâmetros no Hugging Face sob a licença Apache 2.0 em 3 de outubro de 2026, anunciou-o na mesma manhã em sua própria sala de imprensa e a partir de sua própria conta, e no dia seguinte o resumo que circulava nos feeds de IA dizia: 78B parâmetros totais, 3,46B ativos por token, pesos abertos sob Apache 2.0, feito para alemão e inglês. Cada cláusula dessa frase é verificável no repositório. O que ficou em grande parte não dito é quais partes do lançamento são fatos medidos e quais são alegações que os autores fizeram sobre seu próprio modelo que ninguém fora de Heidelberg executou. Essa lacuna é a história do primeiro dia, e importa mais do que o número da manchete.
Comece pela linha do tempo, porque uma quantidade surpreendente da reação tratou isto como um lançamento silencioso e misterioso, e não era um. O repositório do Hugging Face Aleph-Alpha/Kolibri-1 foi criado em 2 de outubro de 2026 às 05:54:02 UTC, o cartão do modelo indica uma data de lançamento de 3 de outubro, e a publicação da sala de imprensa do fornecedor saiu na mesma manhã às 08:43:53 GMT — no Dia da Reunificação Alemã, uma data que o laboratório claramente escolheu. A própria conta da Aleph Alpha publicou sobre isso em poucos minutos. Não houve embargo de imprensa nem evento de lançamento, e é provavelmente daí que veio o enquadramento de "lançamento silencioso", mas uma publicação na sala de imprensa do fornecedor, um relatório técnico e um anúncio oficial não são um lançamento silencioso. São um lançamento normal que a imprensa de IA em geral simplesmente não noticiou no dia.
O número que a reação está repetindo
O motivo de 3,46B ativos ser o número que todos citam é que ele é o único número no lançamento que muda o que um comprador precisa possuir. Kolibri é um transformer de 50 camadas no qual cada camada é uma mistura de especialistas, com 384 especialistas por camada, um compartilhado e seis roteados, num total de 78.103.074.560 parâmetros. Por token, ele ativa 3.457.573.120 deles — uma taxa de esparsidade de aproximadamente 22,6 para 1. É isso que torna um modelo de 78 bilhões de parâmetros servível em um par de H100s em vez de um rack, e é a afirmação mais decisiva do lançamento.
Ao redor dele, encontram-se os demais números de destaque, todos eles provenientes da ficha do modelo, e não de uma execução independente:
• Contexto — treinado com 16.384 tokens, com treinamento intermediário em 65.536, nativo em 262.144 e validado até 1.048.576. O cartão recomenda permanecer em 262.144 ou abaixo para trabalho sensível à latência. Observe atentamente que o "1M context" fixo que você verá nos resumos é o teto validado, não a janela nativa.
• Precisão — pesos FP8 em blocos 128x128 com ativações quantizadas dinamicamente, avaliados com um cache KV FP8; embeddings, o LM head, as normas e o roteador MoE permanecem em bfloat16.
• Raciocínio — quatro níveis de esforço — nenhum, baixo, médio, alto — definidos por meio do template de chat, com chamada de ferramentas no estilo Hermes e um parser do vLLM incluído no mesmo repositório que os pesos.
• Idiomas — alemão e inglês, e nada mais.
• Treinamento — 20 trilhões de tokens de pré-treinamento em um corpus bilíngue filtrado que é composto por aproximadamente 62,5% de inglês, 23,9% de alemão e 13,6% de código, além de 3,44 trilhões de tokens de treinamento intermediário e 201 bilhões para extensão de contexto longo.
• Computação e energia — 768 NVIDIA B200 em 96 nós HGX, 21 dias de pré-treinamento durante 511 horas e 392.000 horas de GPU, com 6,4x10^23 FLOPs reportados, e uma estimativa de 9,5x10^2 MWh, incluindo a sobrecarga do data center, excluindo ajuste fino supervisionado e aprendizado por reforço.
• Licença — Apache 2.0. Sem adenda de uso aceitável, sem limite de usuários ativos mensais, sem termos comerciais separados.
As duas afirmações que ninguém verificou
Esta é a parte do primeiro dia que a reação pulou, e é a parte que decide se Kolibri é importante ou apenas interessante.
A primeira é a alegação de economia de serving. O enquadramento da Aleph Alpha não é o de que o Kolibri é o modelo mais forte disponível — na própria tabela comparativa do laboratório, ele não é, e o laboratório reconhece isso. Seu enquadramento é o de que nenhum modelo comparado entrega mais qualidade ao mesmo custo de serving, ou a mesma qualidade a custo menor, ao longo de uma fronteira de Pareto de qualidade versus tokens decodificados por segundo por GPU. Essa é uma alegação sobre throughput em hardware específico, e é exatamente o tipo de alegação que só um terceiro com um cronômetro e duas H100s pode resolver. Ninguém o fez. Não há entrada do Kolibri no Artificial Analysis até 4 de outubro de 2026, nem replicação por terceiros do harness de avaliação.
O segundo é a alegação sobre o tokenizador. A Aleph Alpha treinou um tokenizador bilíngue alemão-inglês com um vocabulário de 128.000 tokens usando um método que chama de UniBPE, e relata 4,90 bytes médios por token em texto da web em alemão, contra 4,35 do GPT-5, 4,13 do Gemini, 4,17 do Qwen 3.5-3.8, 3,93 do GLM 5.3, 3,72 do DeepSeek V4 e 3,28 do Kimi K3. Todas essas cifras são do próprio fornecedor, medidas no corpus do próprio fornecedor, em comparação com concorrentes que o fornecedor escolheu. Mais texto por token é um efeito real de custo de inferência, e não uma alegação de qualidade, e, se isso se confirmar, acumula-se em qualquer carga de trabalho de processamento de documentos — mas é a medição de um único laboratório, não um resultado de benchmark.
O alemão é o ponto, e é a engenharia mais interessante do lançamento
A maioria dos cards de modelo "multilíngues" descreve uma mistura de treinamento que por acaso incluía alemão. Este é construído ao contrário, e o card é excepcionalmente específico sobre a mecânica.
Experimentos com pequenos modelos proxy levaram a Aleph Alpha a uma meta de aproximadamente 20% de dados em alemão na mistura, o que, para uma execução de 20 trilhões de tokens, significava encontrar 4 trilhões de tokens em alemão. Conjuntos de dados alemães abertos, deduplicados e filtrados, forneceram 390 bilhões — uma ordem de magnitude a menos. O laboratório fechou a lacuna de três maneiras: reajustando um filtro do Common Crawl especificamente para o alemão, o que produziu 1,3 trilhão de tokens orgânicos únicos; reformulando documentos alemães existentes em verbetes de enciclopédia, diálogos de perguntas e respostas e passagens de texto, o que produziu cerca de mais um trilhão e se tornou a maior fonte isolada de alemão; e tradução, que foi usada para o modelo predecessor e deliberadamente abandonada para o Kolibri. O alemão acabou como um pool único de 2,4 trilhões de tokens, 80% dele curado ou gerado internamente, visto em 21,3% dos tokens de pré-treinamento após upsampling.
O detalhe do filtro é o tipo de coisa que só aparece num laboratório que realmente treinou em alemão. Um pipeline padrão de dados linguísticos descarta documentos com demasiadas palavras longas — mas a prosa administrativa alemã excede rotineiramente o limite inglês para o comprimento médio das palavras, de modo que as configurações padrão eliminam silenciosamente o registro em que a administração pública escreve. Um modelo treinado num filtro inglês padrão não tem praticamente nenhum vocabulário jurídico-administrativo alemão, e nenhum benchmark lhe dirá isso.
O que a tabela de comparação realmente mostra
A Aleph Alpha publicou uma comparação de pós-treinamento abrangendo catorze modelos, e ela é mais útil do que a maioria das tabelas de lançamento porque não bajula o modelo em questão. No mesmo harness, com o Kolibri em esforço de raciocínio alto, o Qwen3.8 27B pontua 80,2 na média de inglês contra 75,5 do Kolibri, e 79,9 na média de alemão contra 70,8, e lidera no GPQA Diamond, no LiveCodeBench v6, no SWE-Bench Verified e em ambos os benchmarks de contexto longo. O Nemotron 3 Super 120B-A12B pontua 73,0 em inglês contra 75,5 do Kolibri. O Gemma 4 26B-A4B IT pontua 71,9 e 66,3 nas duas médias.
Portanto, o resumo honesto do lançamento não é "estado da arte". É que o Kolibri fica no meio de um campo de modelos que ativam entre três e doze bilhões de parâmetros por token, que supera claramente os muito menores, e que perde para um modelo denso de 27 bilhões de parâmetros da Alibaba na maioria das linhas de sua própria tabela, enquanto ativa cerca de um oitavo dos parâmetros. Se a economia compensa essa lacuna é a alegação de Pareto, e a alegação de Pareto não foi testada.

Como você realmente chamaria isso, hoje
Não há endpoint hospedado fornecido pelo fabricante — o lançamento consiste em pesos mais um relatório técnico, sem SKU de API da Aleph Alpha para o Kolibri no material publicado. Também não há rota para ele no OrcaRouter: sondamos o catálogo com todas as grafias do prefixo do fabricante e do nome do modelo, e o Kolibri não está lá, então chamá-lo hoje significa baixar cerca de 78 GB de pesos FP8 e executar você mesmo um endpoint vLLM a partir do aleph-alpha-inference pacote ou da imagem de contêiner publicada.
Isso é uma decisão real de compra, não uma nota de rodapé, e é aí que uma camada de roteamento justifica seu lugar mesmo para um modelo que ela não hospeda. A comparação honesta para quem está avaliando uma implantação soberana auto-hospedada de 78B não são linhas de benchmark — são 78 GB de VRAM e uma conversa de procurement contra um item de linha por token em hardware que pertence a outra pessoa. Se o que você realmente precisa neste mês é um pequeno modelo de mistura de especialistas que você possa chamar sem comprar duas GPUs, o tier Gemma 4 26B-A4B é a coisa mais próxima já disponível em um endpoint roteado, a US$ 0,06 por milhão de tokens de entrada e US$ 0,33 por milhão de saída com uma janela de 262.144 tokens, e o OrcaRouter roteia esse tier em uma única chave compatível com OpenAI pelo preço de tabela do provedor sem nada acrescentado. Essa é a maneira barata de descobrir se a carga de trabalho justifica possuir o hardware antes que o hardware chegue.

O que observar, e o que mudaria o veredito
Três coisas, em ordem de quanto elas mudariam o panorama.
Uma medição independente de throughput na configuração recomendada de dois H100 da placa confirmaria ou derrubaria a alegação de Pareto, que é a única alegação no comunicado genuinamente nova em vez de uma repetição de uma ficha técnica. Uma reprodução independente das médias da suíte de tarefas em alemão e inglês diria se a diferença para o Qwen3.8 27B é tão estreita quanto a própria tabela do fornecedor sugere ou mais estreita. E uma avaliação em língua alemã sobre texto administrativo real — não um benchmark geral traduzido — testaria aquilo para que o comunicado foi realmente criado, o que nenhum ranking mede atualmente.
Até que uma delas se concretize, o enquadramento correto é o que o próprio repositório sustenta. Kolibri é um lançamento genuíno de pesos abertos de um laboratório europeu, em uma escala que laboratórios europeus ainda não haviam lançado, com termos Apache 2.0 que nenhum incumbente igualou, um pipeline de dados publicado junto com os pesos e uma história de iteração com dois modelos que é mais interessante do que o número que virou manchete. É também, por enquanto, um modelo cujos números mais citados vêm de seus próprios autores. Ambas as frases são verdadeiras desde o primeiro dia, e a segunda é a que a reação deixou de fora.

