
Kolibri vs LFM2.5 2.6B Base: een 78B soevereine deployment tegen een checkpoint ter grootte van een telefoon
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 218 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Zet Kolibri naast LFM2.5 2.6B Base en de voor de hand liggende lezing is David en Goliath: 78,1 miljard parameters tegen 2,69 miljard, een deployment-ondergrens van twee GPU's tegen een model waarvan Liquid AI zegt dat het op een telefoon draait. Die voor de hand liggende lezing is onjuist, en niet in de richting die je zou verwachten. Geen van beide is een model dat je vandaag zonder meer op een taak kunt inzetten. Kolibri werd op 3 oktober 2026 uitgebracht door Aleph Alpha als een complete, post-trained, tool-calling Duits- en Engelstalige assistent met een serving-plugin en een aanbevolen samplingconfiguratie. LFM2.5 2.6B Base, begin augustus 2026 gepubliceerd door Liquid AI, is een vooraf getraind checkpoint zonder enige instructietuning, specifiek uitgebracht om te worden gefinetuned. Het ene is een product dat je implementeert. Het andere is grondstof. Hun kwaliteit vergelijken is een categoriefout, en de interessante vraag is welk soort grondstof je project echt nodig heeft.
Het verschil dat bij de meeste echte aanbestedingen tussen deze twee de doorslag geeft, zijn niet de parameters. Het is de licentie. Kolibri wordt uitgebracht onder Apache 2.0. De LFM2.5 2.6B Base wordt uitgebracht onder de LFM Open License v1.0, een licentie op maat (de modelkaart classificeert deze als "license: other"), en dat verschil is precies het verschil dat naar een juridisch team gaat in plaats van naar een engineeringteam.
Twee verschillende betekenissen van "open weights"
Beide modellen laten je de gewichten downloaden en ze draaien. Wat je daarna mag doen, is waar ze uiteengaan.
• Kolibri — Apache 2.0, geen addendum voor acceptabel gebruik, geen drempel voor het aantal gebruikers, geen afzonderlijke commerciële voorwaarden. De kaart van Aleph Alpha vermeldt alleen dat het lab ondertekenaar is van de EU GPAI Code of Practice.
• LFM2.5 2.6B Base — de LFM Open License v1.0, de eigen licentie van Liquid AI in plaats van een OSI-standaardlicentie. Het is dezelfde licentie die geldt voor de post-getrainde LFM2.5 2.6B en de rest van de familie.
Voor een onderzoeksteam is het om het even. Voor een onderneming die haar licentiepositie in een inkoopdocument moet aangeven, is het ene een bekend gegeven en het andere een document dat iemand moet lezen. Dat is een reële kostenpost, die wordt betaald voordat er ook maar één token is gegenereerd, en die in geen enkele benchmarktabel zichtbaar is.
Er is een tweede onderscheid in dezelfde categorie, en het is het onderscheid dat de eigen modelkaart van Liquid AI met nadruk maakt. De Base is geen assistent. Het heeft geen instruction tuning, wat betekent dat het geen prompt zal volgen, zich niet zal onthouden, geen tool call zal uitsturen en niet bij het onderwerp zal blijven — niet omdat het zwak is, maar omdat het daar nooit voor is getraind. De kaart zegt ronduit dat het alleen wordt aanbevolen voor taken die zware fine-tuning vereisen: taalspecifieke of domeinspecifieke assistenten, training op bedrijfseigen data, of experimenteren met nieuwe post-training-benaderingen. Alles stroomafwaarts van het base-checkpoint — supervised fine-tuning, teacherspecialisatie, on-policy-distillatie, agentische reinforcement learning — is het probleem van de koper. Kolibri komt met dat alles al gedaan, op vier niveaus van redeneerinspanning, met een Hermes-achtige tool-call-parser die naast de weights wordt meegeleverd.
Wat de maten daadwerkelijk opleveren
Haal de framing weg en de twee modellen zijn geoptimaliseerd voor tegengestelde beperkingen.
• Parameters — 78.103.074.560 totaal, met 3.457.573.120 actief per token op Kolibri, tegenover 2,69 miljard totaal op de LFM2.5 Base, die een hybride stack gebruikt van 22 dubbel-gated short-convolutieblokken en 8 grouped-query attention-lagen in plaats van een transformer met uniforme blokken.
• Context — 131.072 tokens op de LFM2.5 Base, tegenover een native venster van 262.144 tokens op Kolibri en een gevalideerde 1.048.576 daarbuiten.
• Trainingsdata — 34 biljoen tokens op de LFM2.5 Base, tegen 20 biljoen op Kolibri, getrokken uit een ruwe pool van meer dan 200 biljoen na filtering en deduplicatie, waarvan 13,6 procent code was.
• Talen — zestien op de LFM2.5 Base, waaronder Arabisch, Chinees, Japans, Koreaans, Thais en Vietnamees, tegenover precies twee op Kolibri, Duits en Engels, door expliciet ontwerp.
• Geheugen — de LFM2.5 Base heeft GGUF-, ONNX- en MLX-builds die ermee gepubliceerd worden en is gebouwd voor edge-implementatie; Kolibri's FP8-gewichten hebben een omvang van ~78 GB met minimaal twee A100 80 GB-kaarten, twee H100 SXM5's, één H200, één B200 of één B300.
Lees die vijf regels samen en het beeld is niet meer scheef. Het model van Liquid AI bestrijkt tien keer zoveel talen op hardware die drie ordes van grootte kleiner is. Het model van Aleph Alpha bestrijkt twee talen met een contextvenster dat acht keer langer is en een diepte van specialisatie die alleen in zijn eigen verticale evaluaties naar voren komt. Geen van beide is een slechtere versie van de andere; het zijn antwoorden op verschillende vragen, en de vragen zijn "kan dit zonder server draaien" en "kan dit door een Duitse regelgevingsaanvraag heen redeneren".

Slechts één ervan heeft een gemeten score, en dat is niet de Base
Hier is het deel dat de pairing verbergt. Artificial Analysis heeft wel een modelpagina voor LFM2.5-2.6B — maar voor het post-getrainde model, niet voor de Base. Die pagina vermeldt een Intelligence Index van 8, gerangschikt op #9 van 49 modellen in zijn klasse, met een context van 128.000 tokens, 2,7 miljard parameters en de LFM Open License v1.0. Het is een bescheiden score en een eerlijke: het model wordt gemeten, geprijsd op effectief nul, en geëvalueerd als wat het is — een klein redeneermodel.
De Base-checkpoint heeft geen score, en kan er ook geen hebben. Een Intelligence Index wordt berekend door een model te laten draaien op redeneer- en kennistaken; een checkpoint dat niet instruction-tuned is, vertoont geen betekenisvol gedrag bij die taken. Liquid AI publiceert er geen evaluatietabel voor, en dat ontbreken is een uitspraak over het artefact, niet een hiaat in de release.
De positie van Kolibri is weer anders, en het is de moeite waard die precies te verwoorden, omdat ze gemakkelijk verkeerd te lezen is. Er is ook geen Artificial Analysis-pagina voor Kolibri — we hebben het nagekeken, en het model ontbreekt volledig in die vergelijking. Wat bestaat, is de eigen post-trainingstabel van Aleph Alpha, waarin Kolibri 75,5 scoort op het Engelse gemiddelde en 70,8 op het Duitse gemiddelde over de eigen harness, tegenover 54,1 en 46,4 voor de eigen voorganger Kolibri Origin. Dat zijn door de leverancier gegenereerde cijfers op een door de leverancier gebouwde evaluatiesuite, en ze zijn niet om te zetten in een Intelligence Index. Dus van de twee modellen in deze kop heeft er één een onafhankelijke score voor een zusterversie, heeft er één een leverancierstabel, en geen van de exacte artefacten die worden vergeleken is überhaupt onafhankelijk gemeten.

De broer of zus die de aanbeveling verandert
LFM2.5 2.6B Base op zichzelf beoordelen is de verkeerde manier om de release van Liquid AI te evalueren, want de Base bestaat om de post-trained LFM2.5 2.6B te ondersteunen, en de twee worden samen uitgebracht. Als je niet van plan bent een fine-tuningpipeline te schrijven, is de Base niet jouw model — het post-trained broertje is dat wel, en dat is degene met een publieke score en een gepubliceerde prijs van vrijwel niets per token wanneer je het zelf host.
Dat is dezelfde relatie die Kolibri met Kolibri Origin heeft, en die vergelijking is de moeite waard, omdat Aleph Alpha de tijdlijn heeft gepubliceerd. Origin voltooide de pre-training op 11 juni 2026 met 30,6 miljard parameters en 3,27 miljard actieve parameters, en werd nooit uitgebracht; Kolibri was op 11 september 2026 klaar met 78,1 miljard en werd op 3 oktober uitgebracht. Twee modellen, drie maanden, waarvan één alleen intern. De equivalente splitsing van Liquid AI is in beide gevallen openbaar: Base en nagetraind, naast elkaar, met gekwantiseerde builds voor llama.cpp, ONNX Runtime en Apple's MLX die samen met het native checkpoint zijn gepubliceerd. Als je van plan bent om te fine-tunen, is die omringende tooling meer waard dan een rij in een benchmark, omdat die bepaalt hoeveel van het werk je zelf moet doen.
Wat te deployen, op basis van vereiste
Deze komt neer op een korte beslissingslijst in plaats van een winnaar.
• Als het model zonder server moet draaien — op een telefoon, een laptop, een apparaat in een fabriek — is LFM2.5 2.6B Base de enige van de twee die zelfs maar in aanmerking komt, en de nagetrainde LFM2.5 2.6B is degene waar je daadwerkelijk mee zou beginnen. Kolibri kan daar bij geen enkele kwantisatie draaien.
• Als de workload Duitse of Engelse documentredenering binnen je eigen perimeter is, met beperkingen rond gereguleerde data en een behoefte aan abstentiegedrag, dan is de LFM2.5 Base niet de juiste vorm van artefact en Kolibri is precies daarop gericht — mits je twee accelerators van 80 GB kunt leveren en een licentiestandpunt kunt accepteren dat je in één regel kunt formuleren.
• Als je meer dan Duits en Engels nodig hebt, beslaat de familie van Liquid AI zestien talen bij 2,6B, en het argument voor taaldekking keert zich bij die omvang om.
• Als je dit kwartaal een assistent in productie nodig hebt en geen post-trainingpipeline wilt draaien, is Kolibri post-getraind; de LFM2.5 Base is dat niet, en het post-getrainde LFM2.5-model is een veel kleinere assistent dan Kolibri, in plaats van een goedkopere versie ervan.
Voor teams waarvan de workload echt in het midden ligt — een paar miljard tokens per maand, matige context, geen wettelijke verplichting om de hardware zelf te bezitten — is geen van beide het eerste waar je naar grijpt. Sub-4B-modellen zijn goedkoop om zelf te hosten en onhandig om op schaal te routeren, omdat de operationele kosten van een deployment hoger kunnen uitvallen dan de tokenrekening; een 78B-model heeft het tegenovergestelde probleem. De tier die daadwerkelijk wordt gerouteerd is die daartussenin, en die tier staat op OrcaRouter vandaag: Qwen3.5 35B-A3B voor $0,057 per miljoen input en $0,459 output, Qwen3.8-Flash voor $0,15 en $0,47 met een context van 1M tokens, of het mixture-of-experts-model Gemma 4 26B-A4B IT voor $0,06 en $0,33. Dat zijn de listprijzen van de aanbieder die worden doorgegeven zonder iets per token toe te voegen, op één OpenAI-compatibele sleutel met failover, en ze zijn het eerlijke antwoord voor een team dat zijn werkelijke tokenvolume wil meten voordat het zich vastlegt op een fine-tuningproject of een rack.
Om expliciet te zijn over wat we niet aanbieden: noch Kolibri noch LFM2.5 2.6B Base is vandaag routeerbaar op OrcaRouter. We hebben de catalogus voor beide doorzocht onder elke leveranciers- en modelspelling en geen van beide staat erin. Kolibri is alleen voor self-hosting, en de LFM2.5 Base is een fine-tuning-artefact dat nooit bedoeld was om achter een API te zitten.

De keuze in één regel
Kolibri is een voltooid, gelicentieerd, gedocumenteerd Duits-Engels redeneermodel met 78 miljard parameters dat twee accelerators kost om te draaien. LFM2.5 2.6B Base is een onvoltooid meertalig startpunt met 2,69 miljard parameters dat een fine-tuningpijplijn kost en in je zak past. De parameterverhouding tussen beide is 29 op 1, en dat is het minst informatieve getal in dit artikel.
