
Kolibri vs LFM2.5 2.6B Base : un déploiement souverain de 78B face à un checkpoint de la taille d’un téléphone
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 218 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Placez Kolibri à côté de LFM2.5 2.6B Base et la lecture évidente est celle de David contre Goliath : 78,1 milliards de paramètres contre 2,69 milliards, un plancher de déploiement à deux GPU contre un modèle que Liquid AI affirme tourner sur un téléphone. Cette lecture évidente est fausse, et pas dans le sens que vous imaginez. Ni l'un ni l'autre n'est un modèle vers lequel on peut pointer une tâche aujourd'hui. Kolibri a été publié par Aleph Alpha le 3 octobre 2026 sous la forme d'un assistant complet, post-entraîné, capable d'appeler des outils, en allemand et en anglais, avec un plugin de service et une configuration d'échantillonnage recommandée. LFM2.5 2.6B Base, publié par Liquid AI début août 2026, est un checkpoint pré-entraîné sans aucun affinage d'instructions, publié spécifiquement pour être affiné. L'un est un produit que vous déployez. L'autre est une matière première. Comparer leur qualité est une erreur de catégorie, et la question intéressante est de savoir de quel type de matière première votre projet a réellement besoin.
L’écart qui décide de la plupart des achats réels entre ces deux-là ne tient pas aux paramètres. Il tient à la licence. Kolibri est distribué sous Apache 2.0. Le LFM2.5 2.6B Base est distribué sous la LFM Open License v1.0, une licence sur mesure (la fiche du modèle l’enregistre comme « license: other »), et cette différence est celle qui relève d’une équipe juridique plutôt que d’une équipe d’ingénierie.
Deux significations différentes de « open weights »
Les deux modèles vous permettent de télécharger les poids et de les exécuter. C’est sur ce que vous êtes autorisé à faire par la suite qu’ils divergent.
• Kolibri — Apache 2.0, aucune clause d’usage acceptable, aucun seuil de nombre d’utilisateurs, aucune condition commerciale distincte. La fiche d’Aleph Alpha indique seulement que le laboratoire est signataire du Code de pratique de l’UE sur l’IA à usage général (GPAI).
• LFM2.5 2.6B Base — la LFM Open License v1.0, qui est la licence propre de Liquid AI plutôt qu'une licence standard de l'OSI. C'est la même licence qui régit le LFM2.5 2.6B post-entraîné et le reste de la famille.
Pour une équipe de recherche, l’un ou l’autre convient. Pour une entreprise qui doit déclarer sa position en matière de licences dans un document d’appel d’offres, l’une est une valeur connue et l’autre est un document que quelqu’un doit lire. C’est un coût réel, il est payé avant même qu’un seul token soit généré, et il est invisible dans n’importe quel tableau de benchmarks.
Il existe une seconde distinction dans la même catégorie, et c'est précisément celle que la fiche de Liquid AI elle-même s'efforce d'établir. La version Base n'est pas un assistant. Elle n'a bénéficié d'aucun affinage sur instructions, ce qui signifie qu'elle ne suivra pas une consigne, ne s'abstiendra pas, n'émettra pas d'appel d'outil et ne restera pas dans le sujet — non pas parce qu'elle est faible, mais parce qu'elle n'a jamais été entraînée à le faire. La fiche indique clairement qu'elle n'est recommandée que pour les tâches exigeant un affinage lourd : assistants spécifiques à une langue ou à un domaine, entraînement sur des données propriétaires, ou expérimentation de nouvelles approches de post-entraînement. Tout ce qui se situe en aval du point de contrôle de base — affinage supervisé, spécialisation de l'enseignant, distillation on-policy, apprentissage par renforcement agentique — incombe à l'acheteur. Kolibri arrive avec tout cela déjà fait, à quatre niveaux d'effort de raisonnement, avec un analyseur d'appels d'outils de style Hermes livré aux côtés des poids.
Ce que les tailles apportent réellement
Retirez le cadrage et les deux modèles sont optimisés pour des contraintes opposées.
• Paramètres — 78,103,074,560 au total, dont 3,457,573,120 actifs par token sur Kolibri, contre 2,69 milliards au total sur le LFM2.5 Base, qui utilise une pile hybride de 22 blocs de convolution courte à double porte et de 8 couches d'attention à requêtes groupées plutôt qu'un transformeur composé de blocs uniformes.
• Contexte — 131 072 tokens sur le LFM2.5 Base, face à une fenêtre native de 262 144 tokens sur Kolibri et à 1 048 576 validés au-delà.
• Données d'entraînement — 34 billions de tokens sur le LFM2.5 Base, contre 20 billions pour Kolibri, issus d'un ensemble brut de plus de 200 billions après filtrage et déduplication, dont 13,6 % était du code.
• Langues — seize sur le LFM2.5 Base, dont l'arabe, le chinois, le japonais, le coréen, le thaï et le vietnamien, contre exactement deux sur Kolibri, l'allemand et l'anglais, par choix explicite.
• Mémoire — le LFM2.5 Base dispose de builds GGUF, ONNX et MLX publiés en parallèle et est conçu pour le déploiement en périphérie ; les poids FP8 de Kolibri représentent une empreinte d'environ 78 Go, avec au minimum deux cartes A100 80 Go, deux H100 SXM5, un H200, un B200 ou un B300.
Lisez ces cinq lignes ensemble et le tableau cesse d’être déséquilibré. Le modèle de Liquid AI couvre dix fois plus de langues sur un matériel trois ordres de grandeur plus petit. Le modèle d’Aleph Alpha couvre deux langues avec une fenêtre de contexte huit fois plus longue et une profondeur de spécialisation qui ne se révèle qu’à l’intérieur de ses propres évaluations verticales. Ni l’un ni l’autre n’est une version inférieure de l’autre ; ce sont des réponses à des questions différentes, et les questions sont « peut-on faire tourner ceci sans serveur » et « peut-on raisonner sur un dossier réglementaire allemand ».

Un seul d'entre eux dispose d'un score mesuré, et ce n'est pas la Base.
Voici la partie que l'appariement dissimule. Artificial Analysis a bien une page de modèle pour LFM2.5-2.6B — mais pour le modèle post-entraîné, pas pour le Base. Cette page indique un Intelligence Index de 8, classé n°9 sur 49 modèles de sa catégorie, avec un contexte de 128 000 tokens, 2,7 milliards de paramètres et la LFM Open License v1.0. C'est un score modeste et honnête : le modèle est mesuré, facturé à un prix effectivement nul, et évalué pour ce qu'il est — un petit modèle de raisonnement.
Le checkpoint Base n'a pas de score, et il ne peut pas en avoir. Un Intelligence Index est calculé en exécutant un modèle sur des tâches de raisonnement et de connaissances ; un checkpoint qui n'a pas été ajusté aux instructions n'a pas de comportement significatif sur ces tâches. Liquid AI ne publie aucun tableau d'évaluation à son sujet, et cette absence est une affirmation sur l'artefact, non une lacune dans la publication.
La position de Kolibri est une fois encore différente, et mérite d'être énoncée précisément parce qu'elle est facile à mal interpréter. Il n'existe pas non plus de page Artificial Analysis pour Kolibri — nous avons vérifié, et le modèle est totalement absent de cette comparaison. Ce qui existe, c'est le tableau de post-entraînement d'Aleph Alpha lui-même, où, dans l'ensemble de son harnais, Kolibri obtient 75,5 sur la moyenne anglaise et 70,8 sur la moyenne allemande, contre 54,1 et 46,4 pour son propre prédécesseur Kolibri Origin. Ce sont des chiffres produits par le fournisseur sur une suite d'évaluation conçue par le fournisseur, et ils ne sont pas convertibles en Intelligence Index. Ainsi, des deux modèles de ce titre, l'un dispose d'un score indépendant pour une version sœur, l'autre dispose d'un tableau de fournisseur, et aucun des artefacts exacts comparés ne dispose d'une mesure indépendante.

Le frère ou la sœur qui modifie la recommandation
Juger LFM2.5 2.6B Base en lui-même est une mauvaise façon d’évaluer la sortie de Liquid AI, car le Base existe pour servir le LFM2.5 2.6B post-entraîné, et les deux sont livrés ensemble. Si vous n’avez pas l’intention d’écrire un pipeline de fine-tuning, le Base n’est pas votre modèle — c’est l’homologue post-entraîné qui l’est, et c’est celui qui a un score public et un prix publié de pratiquement rien par token lorsque vous l’hébergez vous-même.
C'est la même relation que celle qui lie Kolibri à Kolibri Origin, et la comparaison vaut la peine d'être faite parce qu'Aleph Alpha a publié la chronologie. Origin a terminé son pré-entraînement à 30,6 milliards de paramètres et 3,27 milliards d'actifs le 11 juin 2026 et n'a jamais été publié ; Kolibri a terminé le 11 septembre 2026 à 78,1 milliards et a été publié le 3 octobre. Deux modèles, trois mois, l'un d'eux uniquement en interne. L'équivalent chez Liquid AI est public dans les deux sens : Base et post-entraîné, côte à côte, avec des versions quantifiées pour llama.cpp, ONNX Runtime et MLX d'Apple publiées aux côtés du checkpoint natif. Si votre plan est de faire du fine-tuning, cet outillage périphérique vaut plus qu'une ligne de benchmark, car il détermine la part du travail que vous devrez faire vous-même.
Quoi déployer, par exigence
Celui-ci se résume à une courte liste de décisions plutôt qu'à un gagnant.
• Si le modèle doit fonctionner sans serveur — sur un téléphone, un ordinateur portable, un appareil dans une usine — LFM2.5 2.6B Base est le seul des deux à être ne serait-ce qu'un candidat, et le LFM2.5 2.6B post-entraîné est celui à partir duquel vous commenceriez réellement. Kolibri ne peut pas y fonctionner, quelle que soit la quantification.
• Si la charge de travail consiste à raisonner sur des documents en allemand ou en anglais à l’intérieur de votre propre périmètre, avec des contraintes liées aux données réglementées et un besoin de comportement d’abstention, le LFM2.5 Base n’est pas le bon type d’artefact et Kolibri vise exactement ce cas — à condition que vous puissiez fournir deux accélérateurs de 80 Go et accepter une position de licence que vous pouvez énoncer en une ligne.
• Si vous avez besoin de plus que l’allemand et l’anglais, la famille de Liquid AI couvre seize langues à 2,6B, et l’argument de la couverture linguistique s’inverse à cette taille.
• Si vous avez besoin d’un assistant déployé ce trimestre et que vous ne souhaitez pas exécuter un pipeline de post-entraînement, Kolibri est post-entraîné ; LFM2.5 Base ne l’est pas, et le modèle LFM2.5 post-entraîné est un assistant bien plus petit que Kolibri, plutôt qu’une version moins chère de celui-ci.
Pour les équipes dont la charge de travail se situe véritablement dans la moyenne — quelques milliards de tokens par mois, un contexte modéré, aucune obligation réglementaire de posséder le matériel — ni l'un ni l'autre n'est le premier choix vers lequel se tourner. Les modèles de moins de 4B sont peu coûteux à auto-héberger et difficiles à router à grande échelle, car le coût opérationnel d'un déploiement peut dépasser la facture de tokens ; un modèle de 78B pose le problème inverse. Le palier qui est réellement routé est celui du milieu, et ce palier est disponible sur OrcaRouter dès aujourd'hui : Qwen3.5 35B-A3B à 0,057 $ le million de tokens en entrée et 0,459 $ en sortie, Qwen3.8-Flash à 0,15 $ et 0,47 $ avec un contexte d'un million de tokens, ou le modèle à mélange d'experts Gemma 4 26B-A4B IT à 0,06 $ et 0,33 $. Ce sont les prix catalogue des fournisseurs, répercutés sans rien ajouter par token, sur une seule clé compatible OpenAI avec basculement automatique, et c'est la réponse honnête pour une équipe qui souhaite mesurer son volume réel de tokens avant de s'engager dans un projet de fine-tuning ou dans l'acquisition d'un rack.
Pour être explicite sur ce que nous ne proposons pas : ni Kolibri ni LFM2.5 2.6B Base n’est routable sur OrcaRouter aujourd’hui. Nous avons exploré le catalogue pour les deux sous toutes les orthographes de fournisseur et de modèle, et aucun des deux ne s’y trouve. Kolibri est réservé à l’auto-hébergement, et LFM2.5 Base est un artefact de fine-tuning qui n’a jamais été destiné à se trouver derrière une API.

Le choix en une ligne
Kolibri est un raisonneur allemand-anglais de 78 milliards de paramètres, achevé, sous licence et documenté, qui nécessite deux accélérateurs pour fonctionner. LFM2.5 2.6B Base est un point de départ multilingue inachevé de 2,69 milliards de paramètres, qui exige un pipeline de fine-tuning et tient dans votre poche. Le rapport de paramètres entre eux est de 29 pour 1, et c’est le nombre le moins informatif de cet article.
