
Kolibri vs Qwen 3.8: o modelo alemão perde na própria tabela, e esse é o ponto
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 218 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Comece pela frase que a maior parte da cobertura de lançamento de Kolibri omitiu. Na tabela de referência que a Aleph Alpha publicou com o seu próprio modelo a 3 de outubro de 2026, o modelo com que é comparado mais frequentemente não é um rival europeu nem americano. É o Qwen3.8 27B, a variante de pesos abertos do fornecedor para essa geração, lançado a 13 de agosto de 2026 — e, segundo os próprios números da Aleph Alpha, vence. O Qwen3.8 27B obtém 80,2 na média em inglês e 79,9 na média em alemão do mesmo conjunto de avaliação que atribui ao Kolibri 75,5 e 70,8. Lidera no GPQA Diamond, 89,2 contra 84,3. Lidera no LiveCodeBench v6, 93,8 contra 85,9. Lidera no SWE-Bench Verified, 72,6 contra 66,4, e em ambos os benchmarks de contexto longo, 76,9 contra 64,5 no LongBench Pro e 81,3 contra 68,3 no AA-LCR. Um modelo chinês denso de 27 mil milhões de parâmetros, avaliado por um laboratório alemão, supera o porta-estandarte de 78 mil milhões de parâmetros desse laboratório em grande parte da sua própria tabela. Isso não é um escândalo. É o facto mais útil do lançamento, porque força a pergunta sobre para que serve realmente o Kolibri.
Um esclarecimento antes que a comparação vá mais longe, porque "Qwen 3.8" nomeia uma família e não um modelo, e as distinções importam aqui. Qwen3.8-Max é o modelo principal hospedado da Alibaba, disponível desde 3 de agosto de 2026 com uma janela de contexto de 1M tokens a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 de saída. Qwen3.8-27B é a camada de pesos abertos, lançada em 13 de agosto de 2026 com uma janela de 262.144 tokens. Qwen3.8-Flash é a camada de volume, lançada em 26 de agosto de 2026 com a janela de 1M tokens e preços muito mais baixos. E o Qwen3.8 simples — anunciado em 19 de julho de 2026 como um modelo principal de pesos abertos com 2,4 trilhões de parâmetros — não foi lançado; existe como uma página de catálogo de acompanhamento e um anúncio. Tudo abaixo é sobre aquele cujos pesos você pode baixar e executar, que é o 27B.
Onde o Kolibri realmente vence, leia na mesma tabela
As linhas em que o Kolibri supera o Qwen3.8 27B não estão dispersas ao acaso. Elas se agrupam, e o agrupamento é o produto.
• Abstenção — no RGB Negative, Kolibri obtém 85,6 contra 70,6. Quando o contexto não contém a resposta, Kolibri diz isso com muito mais frequência.
• Chamada de ferramentas sob restrição — no τ²-bench telecom, 94,7 contra 82,5; na suíte vertical de fornecedores automotivos, 99,0 contra 97,3.
• Contexto muito longo — no SealQA sem distratores acima de 24k tokens, 100,0 contra 94,4.
• Economia de serving para alemão — um tokenizador bilíngue com 4,90 bytes médios por token em texto da web em alemão, contra 4,17 para a família Qwen3.5–3.8 na medição da própria Aleph Alpha. Menos tokens por documento em alemão é uma redução direta do custo de inferência que aparece em uma fatura e em nenhuma linha de benchmark.
Três desses quatro dizem respeito a comportamento, e não a capacidade. Abstenção, invocação de ferramentas com restrições e recuperação fundamentada em contextos longos são aquilo de que precisa num modelo que lê o material da sua própria organização e de quem se espera que admita quando o material não responde à pergunta. A Aleph Alpha construiu todo o lançamento em torno dessa aposta, e a tabela mostra a aposta a concretizar-se.

As linhas em que o Qwen3.8 27B vence dizem respeito à amplitude: conhecimento em ambos os idiomas, perguntas de ciência de nível de pós-graduação, programação competitiva, engenharia de software em nível de repositório, compreensão de documentos longos. Se o seu requisito é um modelo geral forte a um preço baixo por token com pesos abertos, o Qwen3.8 27B é o melhor modelo, e a tabela diz isso com as próprias palavras do fornecedor.
Essa leitura é corroborada, ao passo que a da Kolibri não é. A Artificial Analysis mediu o Qwen3.8 27B de forma independente, na sua configuração de raciocínio Xhigh, e reporta um Intelligence Index de 34, em 1.º lugar entre os 142 modelos dessa comparação, 45,4 tokens de saída por segundo, um contexto de 256 000 tokens e uma licença Apache 2.0. A nota deles é pouco lisonjeira de uma forma familiar — muito prolixo, com 200 milhões de tokens gerados durante a avaliação do índice, contra uma mediana de 82 milhões, e lento — mas a pontuação em si é uma medição de terceiros do adversário. A Kolibri não tem qualquer página na Artificial Analysis. Portanto, o modelo mais forte desta comparação foi verificado de forma independente, e o mais fraco é apenas a palavra do fornecedor, o que é o inverso de como um modelo emblemático europeu de primeira geração costuma ser enquadrado.
Dois tipos de alegação na cadeia de suprimentos, apontando em direções opostas
Ambos estes lançamentos são argumentos sobre de onde vem um modelo, e os argumentos são imagens espelhadas.
O caso da Aleph Alpha é a proveniência como funcionalidade. O Kolibri foi treinado por equipes alemãs em infraestrutura na Alemanha e na Finlândia, sob a legislação da UE e alemã. O cartão divulga a mistura de pré-treinamento — 20 trilhões de tokens, com aproximadamente 62,5% em inglês, 23,9% em alemão e 13,6% em código — os orçamentos de treinamento intermediário e de contexto longo, a computação exata: 768 NVIDIA B200 em 96 nós HGX durante 21 dias, e uma estimativa de 9,5×10² MWh de energia, incluindo a sobrecarga do data center. Ele declara o método de treinamento até o nível da camada: um transformador de mistura de especialistas com 50 camadas, com uma divisão de 4:1 entre atenção de janela deslizante e atenção de consulta agrupada, Muon e Exact Quantile Balancing em 384 especialistas, com 1 compartilhado e 6 roteados. Doze mil palavras de divulgações anexadas a um download de 78 GB, e uma posição declarada como signatária do Código de Práticas para a IA de Uso Geral da UE.
O caso da Alibaba é de natureza diferente: não “podemos justificar cada decisão”, mas “aqui estão os pesos, pegue-os”. Pesos abertos com licença Apache, numa escala e qualidade que fizeram do Qwen o padrão efetivo em todo o mundo, um vocabulário de 248.077 tokens cobrindo bem mais de cem idiomas, e um ecossistema de serving que vem sendo ajustado em torno desses checkpoints por tempo suficiente para que quase toda pilha de inferência os suporte de imediato. O argumento de soberania ali é sobre disponibilidade: nenhum fornecedor pode retirar o modelo, porque você já tem o arquivo.
Ambas as afirmações são honestas e respondem a medos diferentes. Um comprador do setor público em Baden-Württemberg está preocupado com jurisdição e auditabilidade, e o Kolibri se dirige a essa preocupação. Um grupo de pesquisa em Nairobi ou São Paulo está preocupado com um modelo estar bloqueado atrás de um cartão de crédito em uma moeda na qual não podem pagar, e os pesos abertos do Qwen se dirigem a essa. O que não é honesto é fingir que qualquer uma delas é uma comparação de capacidades, porque a tabela de capacidades já deu sua resposta.

A lacuna de licenciamento é real, mas menor do que parece.
Kolibri é Apache 2.0. Qwen3.8 27B são pesos abertos licenciados sob Apache. Ambos vêm sem cláusula adicional de uso aceitável, sem limite de usuários ativos mensais e sem termos comerciais separados — o que os coloca em um grupo pequeno e significa que nenhum dos dois exige uma revisão jurídica antes do uso comercial.
O que os separa é tudo o que vem depois da licença. O Kolibri chega com um plugin vLLM e um pacote de parser do fornecedor, uma imagem de contêiner, quatro níveis de esforço de raciocínio configuráveis por meio do template de chat, um comportamento explícito de abstenção e uma configuração de amostragem recomendada. O Qwen3.8 27B chega como pesos que o Transformers, o vLLM e o SGLang já sabem servir, com um formato de chamada de ferramentas que o ecossistema mais amplo teve meses para acomodar.
O hardware de implantação varia da mesma forma. Os pesos FP8 do Kolibri ocupam cerca de 78 GB e exigem no mínimo duas placas A100 de 80 GB, dois H100 SXM5, um H200, um B200 ou um B300. O Qwen3.8 27B em bfloat16 tem aproximadamente 54 GB de pesos, o que corresponde a um único acelerador de 80 GB em precisão total ou a uma versão quantizada em muito menos. O modelo alemão custa mais hardware e entrega menos benchmark em troca. Isso só é uma troca ruim se você estivesse comprando benchmark.
O que as etiquetas de preço dizem e não dizem a você
Kolibri não tem preço, porque a Aleph Alpha não está vendendo inferência para ele. O lançamento consiste em pesos, um relatório técnico e um cartão; não há SKU hospedado. Qualquer valor de custo para o Kolibri é um cálculo de amortização de hardware que você mesmo faz.
O Qwen3.8 tem preços públicos em três níveis, e o intermediário é o que importa para uma equipe que compara hospedagem própria com aluguel.
• Qwen3.8-Max — US$ 2,00 por milhão de tokens de entrada e US$ 6,00 de saída, contexto de 1M de tokens, leituras de cache a US$ 0,25, lançado em 3 de agosto de 2026.
• Qwen3.8-27B — $0,33 de entrada e $2,40 de saída, contexto de 262.144 tokens, lançado em 13 de agosto de 2026. Estes são os pesos abertos, então este é o preço que você paga caso prefira não executá-los por conta própria.
• Qwen3.8-Flash — $0,15 de entrada e $0,47 de saída com a janela de 1M tokens, lançado em 26 de agosto de 2026.
Esses são os preços de tabela dos provedores no OrcaRouter, repassados sem nada acrescentado por token, que é a propriedade útil quando a questão é se uma implantação auto-hospedada se paga: você pode medir seu volume real de tokens nos níveis hospedados antes de se comprometer com hardware. Não adicionamos margem, então um corte de preço de fornecedor entra em vigor do nosso lado no mesmo dia. Todos os três níveis do Qwen3.8 podem ser roteados hoje em uma única chave compatível com OpenAI, com failover automático entre provedores, e o próximo Qwen3.8 de 2,4 trilhões de parâmetros tem uma página de catálogo esperando os pesos, em vez de um espaço reservado que finge servi-los.
O Kolibri não é roteável. Sondamos o catálogo com todas as grafias de fornecedor e de modelo e ele está ausente — então a única forma de chamá-lo é o download de 78 GB. Se você quer saber quanto o modelo alemão custaria para a sua carga de trabalho, a resposta é um rack e uma pessoa capaz de rodar o vLLM, e nenhum terceiro pode atualmente lhe cotar qualquer outra coisa.

Quem deve comprar qual
A decisão não depende da qualidade, porque essa questão foi decidida pela própria tabela do fornecedor a favor da Alibaba. Ela depende de contra qual risco você está comprando seguro.
• Escolha o Kolibri se a restrição vinculativa for a jurisdição, a documentação de proveniência ou a auditabilidade — se precisar de conseguir responder de onde vieram os dados de treino, onde correu o processamento e ao abrigo de que lei, e se a carga de trabalho consistir em documentos em alemão e inglês processados dentro do seu próprio perímetro. Está a pagar um prémio de capacidade por isso, e o prémio é visível na tabela acima.
• Escolha o Qwen3.8 27B se a restrição determinante for capacidade por dólar, amplitude de idiomas ou suporte do ecossistema. Ele é o modelo mais forte na própria avaliação da Aleph Alpha, tem licença Apache, roda em um único acelerador, e os planos hospedados começam em US$ 0,33 por milhão de tokens de entrada, caso você prefira não executá-lo de forma alguma.
• Considere ambos na mesma arquitetura se a carga de trabalho tiver um núcleo regulamentado e uma periferia geral. Os documentos que não podem sair do prédio vão para um endpoint Kolibri auto-hospedado; o trabalho de sumarização, tradução e código vai para uma camada Qwen3.8 roteada a um terço de centavo por mil tokens. Uma chave de API, uma regra de roteamento, preços de tabela do provedor repassados e o failover tratado para você — o que é um arranjo consideravelmente mais útil do que escolher uma dessas duas opções e fingir que a outra não existe.
