
Kolibri vs Qwen 3.8 : le modèle allemand perd sur son propre tableau, et c’est là tout l’intérêt
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 218 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Commencez par la phrase que la plupart des articles de lancement consacrés à Kolibri ont omise. Sur le tableau de benchmarks qu'Aleph Alpha a publié avec son propre modèle le 3 octobre 2026, le modèle auquel il est le plus souvent comparé n'est ni un rival européen, ni un rival américain. C'est Qwen3.8 27B, le palier à poids ouverts du fournisseur pour cette génération, publié le 13 août 2026 — et selon les propres chiffres d'Aleph Alpha, il l'emporte. Qwen3.8 27B obtient 80,2 sur la moyenne anglaise et 79,9 sur la moyenne allemande de la même suite d'évaluation qui attribue à Kolibri 75,5 et 70,8. Il mène sur GPQA Diamond, 89,2 contre 84,3. Il mène sur LiveCodeBench v6, 93,8 contre 85,9. Il mène sur SWE-Bench Verified, 72,6 contre 66,4, ainsi que sur les deux benchmarks de contexte long, 76,9 contre 64,5 sur LongBench Pro et 81,3 contre 68,3 sur AA-LCR. Un modèle chinois dense de 27 milliards de paramètres, évalué par un laboratoire allemand, bat le porte-étendard de 78 milliards de paramètres de ce même laboratoire sur la majeure partie de son propre tableau. Ce n'est pas un scandale. C'est le fait le plus utile de cette sortie, car il impose la question de la véritable finalité de Kolibri.
Une clarification avant que la comparaison n'aille plus loin, car « Qwen 3.8 » désigne une famille plutôt qu'un modèle, et les distinctions comptent ici. Qwen3.8-Max est le modèle phare hébergé d'Alibaba, en ligne depuis le 3 août 2026 avec une fenêtre de contexte d'1 M de tokens, à 2,00 $ par million de tokens en entrée et 6,00 $ en sortie. Qwen3.8-27B est le niveau à poids ouverts, publié le 13 août 2026 avec une fenêtre de 262 144 tokens. Qwen3.8-Flash est le niveau volume, publié le 26 août 2026 avec la fenêtre d'1 M de tokens et des prix bien plus bas. Et Qwen3.8 tout court — annoncé le 19 juillet 2026 comme un modèle phare à poids ouverts de 2,4 billions de paramètres — n'est pas publié ; il existe sous la forme d'une page de catalogue de suivi et d'une annonce. Tout ce qui suit concerne celui dont vous pouvez télécharger et exécuter les poids, c'est-à-dire le 27B.
Là où Kolibri l’emporte réellement, d’après le même tableau
Les lignes où Kolibri devance Qwen3.8 27B ne sont pas dispersées au hasard. Elles se regroupent, et ce regroupement est le produit.
• Abstention — sur RGB Negative, Kolibri obtient 85,6 contre 70,6. Lorsque le contexte ne contient pas la réponse, Kolibri l’indique bien plus souvent.
• Appel d’outils sous contrainte — sur τ²-bench telecom, 94,7 contre 82,5 ; sur la suite verticale des fournisseurs automobiles, 99,0 contre 97,3.
• Contexte très long — sur SealQA sans distracteurs au-delà de 24k tokens, 100,0 contre 94,4.
• Économie de service pour l'allemand — un tokeniseur bilingue à 4,90 octets moyens par token sur du texte web allemand, contre 4,17 pour la famille Qwen3.5–3.8 selon la propre mesure d'Aleph Alpha. Moins de tokens par document allemand se traduit directement par une réduction du coût d'inférence, visible sur une facture et dans aucune ligne de benchmark.
Trois de ces quatre éléments concernent le comportement plutôt que la capacité. L’abstention, l’appel d’outils contraint et la récupération ancrée en contexte long sont ce dont vous avez besoin d’un modèle qui lit les propres documents de votre organisation et est censé admettre lorsque ces documents ne répondent pas à la question. Aleph Alpha a construit toute cette version autour de ce pari, et le tableau montre que le pari est gagné.

Les lignes où Qwen3.8 27B l'emporte portent sur l'étendue : connaissances dans les deux langues, questions scientifiques de niveau master, programmation compétitive, ingénierie logicielle à l'échelle d'un dépôt, compréhension de documents longs. Si votre besoin est un modèle général performant à faible prix par token avec des poids ouverts, Qwen3.8 27B est le meilleur modèle, et le tableau le dit dans l'encre même du fournisseur.
Cette lecture est corroborée, contrairement à celle de Kolibri. Artificial Analysis a mesuré Qwen3.8 27B de manière indépendante, dans sa configuration de raisonnement Xhigh, et rapporte un Intelligence Index de 34, au 1er rang des 142 modèles de cette comparaison, 45,4 jetons de sortie par seconde, un contexte de 256 000 jetons et une licence Apache 2.0. Leur commentaire est peu flatteur d'une manière familière — très verbeux : 200 millions de jetons générés lors de l'évaluation de l'indice, contre une médiane de 82 millions, et lent — mais le score lui-même est une mesure de l'adversaire réalisée par un tiers. Kolibri n'a aucune page Artificial Analysis. Ainsi, le modèle le plus fort de cette comparaison a été vérifié indépendamment, et le plus faible repose sur la parole de son fournisseur, soit l'inverse de la façon dont un fleuron européen de première génération est habituellement présenté.
Deux types d'allégations relatives à la chaîne d'approvisionnement, orientées dans des directions opposées.
Ces deux sorties sont des arguments sur l’origine d’un modèle, et ces arguments sont des images miroir l’un de l’autre.
Le cas d'Aleph Alpha, c'est la provenance comme fonctionnalité. Kolibri a été entraîné par des équipes allemandes sur des infrastructures situées en Allemagne et en Finlande, en vertu du droit de l'UE et du droit allemand. La fiche divulgue le mélange de pré-entraînement — 20 billions de tokens à environ 62,5 % d'anglais, 23,9 % d'allemand et 13,6 % de code —, les budgets de mi-entraînement et de contexte long, le calcul exact : 768 NVIDIA B200 répartis sur 96 nœuds HGX pendant 21 jours, et une estimation de 9,5×10² MWh d'énergie, y compris les surcoûts des centres de données. Elle précise la méthode d'entraînement dans le détail, couche par couche : un transformer à mélange d'experts de 50 couches avec une répartition 4:1 entre l'attention à fenêtre glissante et l'attention à requêtes groupées, Muon et Exact Quantile Balancing sur 384 experts, avec 1 partagé et 6 routés. Douze mille mots d'informations divulguées joints à un téléchargement de 78 Go, et une position de signataire déclarée sur le code de bonnes pratiques pour l'IA à usage général de l'UE.
Le cas d'Alibaba est différent par nature : non pas « nous pouvons justifier chaque décision », mais « voici les poids, prenez-les ». Des poids ouverts sous licence Apache, à une échelle et d'une qualité qui ont fait de Qwen le choix par défaut de fait partout dans le monde, un vocabulaire de 248 077 tokens couvrant bien plus d'une centaine de langues, et un écosystème de service ajusté autour de ces checkpoints depuis assez longtemps pour que presque toutes les piles d'inférence les prennent en charge nativement. Ici, l'argument de souveraineté porte sur la disponibilité : aucun fournisseur ne peut retirer le modèle, parce que vous avez déjà le fichier.
Les deux affirmations sont honnêtes et elles répondent à des craintes différentes. Un acheteur du secteur public dans le Bade-Wurtemberg s’inquiète de la juridiction et de l’auditabilité, et Kolibri répond à cette inquiétude. Un groupe de recherche à Nairobi ou à São Paulo s’inquiète qu’un modèle soit verrouillé derrière une carte de crédit dans une monnaie qu’il ne peut pas payer, et les poids ouverts de Qwen répondent à celle-là. Ce qui n’est pas honnête, c’est de prétendre que l’une ou l’autre est une comparaison de capacités, parce que le tableau des capacités a déjà donné sa réponse.

L'écart de licence est réel, mais plus étroit qu'il n'y paraît
Kolibri est sous licence Apache 2.0. Qwen3.8 27B est un modèle à poids ouverts sous licence Apache. Aucun des deux n’est assorti d’un avenant d’utilisation acceptable, d’un seuil d’utilisateurs actifs mensuels ni de conditions commerciales distinctes — ce qui les place dans un petit groupe et signifie qu’aucun des deux n’exige de revue juridique avant une utilisation commerciale.
Ce qui les sépare, c’est tout ce qui suit la licence. Kolibri arrive avec un plugin vLLM et un paquet d’analyseur fournis par l’éditeur, une image conteneur, quatre niveaux d’effort de raisonnement configurables via le gabarit de chat, un comportement d’abstention explicite et une configuration d’échantillonnage recommandée. Qwen3.8 27B arrive sous forme de poids que Transformers, vLLM et SGLang savent déjà servir, avec un format d’appel d’outils que l’écosystème au sens large a eu des mois pour prendre en charge.
Le matériel de déploiement diffère selon les mêmes lignes. Les poids FP8 de Kolibri représentent une empreinte d'environ 78 Go, avec un plancher de deux cartes A100 80 Go, deux H100 SXM5, une H200, une B200 ou une B300. Qwen3.8 27B en bfloat16 représente environ 54 Go de poids, soit un seul accélérateur de 80 Go en pleine précision, soit une version quantifiée sur beaucoup moins. Le modèle allemand coûte plus de matériel et rapporte moins de benchmark en retour. Ce n'est un mauvais compromis que si vous achetiez du benchmark.
Ce que les étiquettes de prix vous disent et ne vous disent pas
Kolibri n'a pas de prix, car Aleph Alpha ne vend pas d'inférence pour Kolibri. La publication consiste en des poids, un rapport technique et une fiche ; il n'existe pas de SKU hébergé. Tout chiffre de coût pour Kolibri est un calcul d'amortissement matériel que vous faites vous-même.
Qwen3.8 affiche publiquement trois niveaux de prix, et c'est celui du milieu qui compte pour une équipe qui compare l'auto-hébergement à la location.
• Qwen3.8-Max — 2,00 $ par million de jetons d'entrée et 6,00 $ en sortie, contexte de 1 M de jetons, lectures de cache à 0,25 $, publié le 3 août 2026.
• Qwen3.8-27B — 0,33 $ en entrée et 2,40 $ en sortie, contexte de 262 144 jetons, publié le 13 août 2026. Il s’agit des poids ouverts, donc ce prix est celui que vous payez si vous préférez ne pas les exécuter.
• Qwen3.8-Flash — 0,15 $ en entrée et 0,47 $ en sortie avec la fenêtre de 1 M de tokens, sorti le 26 août 2026.
Ce sont les prix catalogue des fournisseurs sur OrcaRouter, répercutés sans rien ajouter par token, ce qui est la caractéristique utile lorsqu'il s'agit de savoir si un déploiement auto-hébergé s'amortit : vous pouvez mesurer votre volume réel de tokens sur les offres hébergées avant de vous engager sur du matériel. Nous n'ajoutons pas de marge, donc une baisse de prix d'un fournisseur est effective de notre côté le jour même. Les trois paliers de Qwen3.8 sont routables dès aujourd'hui via une clé compatible OpenAI avec bascule automatique entre fournisseurs, et le Qwen3.8 à venir de 2,4 billions de paramètres dispose d'une page catalogue en attente des poids plutôt que d'un espace réservé qui prétend les servir.
Kolibri n'est pas routable. Nous avons sondé le catalogue sous toutes les orthographes de fournisseur et de modèle et il est absent — le seul moyen de l'appeler est donc le téléchargement de 78 GB. Si vous voulez savoir ce que le modèle allemand coûterait à votre charge de travail, la réponse est une baie et une personne capable d'exécuter vLLM, et aucun tiers ne peut actuellement vous faire de devis pour autre chose.

Qui devrait acheter quoi
La décision ne dépend pas de la qualité, car cette question a déjà été tranchée par le propre tableau du fournisseur en faveur d’Alibaba. Elle dépend du risque contre lequel vous achetez une assurance.
• Choisissez Kolibri si la contrainte déterminante est la juridiction, la documentation de provenance ou l’auditabilité — si vous devez pouvoir répondre d’où proviennent les données d’entraînement, où le calcul a été exécuté et sous quelle loi, et si la charge de travail est constituée de documents allemands et anglais traités à l’intérieur de votre propre périmètre. Vous payez une prime de capacité pour cela, et cette prime est visible dans le tableau ci-dessus.
• Choisissez Qwen3.8 27B si la contrainte déterminante est la capacité par dollar, l’étendue des langues ou le soutien de l’écosystème. C’est le modèle le plus performant selon l’évaluation d’Aleph Alpha elle-même, il est sous licence Apache, il fonctionne sur un seul accélérateur, et les offres hébergées commencent à 0,33 $ par million de jetons d’entrée si vous préférez ne pas l’exécuter du tout.
• Envisagez les deux dans une même architecture si la charge de travail comporte un cœur réglementé et une périphérie générale. Les documents qui ne peuvent pas quitter les murs partent vers un point de terminaison Kolibri auto-hébergé ; le travail de synthèse, de traduction et de code part vers un palier Qwen3.8 routé, à un tiers de cent par millier de jetons. Une seule clé API, une seule règle de routage, les tarifs catalogue des fournisseurs répercutés et le basculement géré pour vous — un arrangement nettement plus utile que de choisir l'un de ces deux et de prétendre que l'autre n'existe pas.
