Generierte Hero-Karte für Kolibri vs LFM2.5 2.6B Base, mit der Überschrift 'Kolibri vs LFM2.5 2.6B Base' und der Unterzeile 'Reasoning auf Server-Niveau gegen einen On-Device-Checkpoint', ein Kolibri-Symbol links und eine kleine Chip-Silhouette rechts, jeweils auf einer Seite eines dünnen Trennstrichs. Das OrcaRouter-Logo befindet sich in dem Streifen unter der Grafik.
Guides & Insights

Kolibri vs. LFM2.5 2.6B Base: Ein souveränes 78B-Deployment gegen einen handygroßen Checkpoint

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stellen Sie Kolibri neben LFM2.5 2.6B Base, und die naheliegende Lesart ist David und Goliath: 78,1 Milliarden Parameter gegen 2,69 Milliarden, ein Bereitstellungsminimum von zwei GPUs gegenüber einem Modell, von dem Liquid AI sagt, dass es auf einem Telefon läuft. Die naheliegende Lesart ist falsch, und zwar nicht in die Richtung, die man erwarten würde. Keines von beiden ist ein Modell, das man heute auf eine Aufgabe ansetzen kann. Kolibri wurde am 3. Oktober 2026 von Aleph Alpha als vollständiger, nachtrainierter, Tool-Calling-fähiger deutsch-englischer Assistent mit einem Serving-Plugin und einer empfohlenen Sampling-Konfiguration veröffentlicht. LFM2.5 2.6B Base, im frühen August 2026 von Liquid AI veröffentlicht, ist ein vorab trainierter Checkpoint ganz ohne Instruction-Tuning, der speziell zum Fine-Tuning herausgebracht wurde. Das eine ist ein Produkt, das man einsetzt. Das andere ist Rohmaterial. Der Vergleich ihrer Qualität ist ein Kategorienfehler, und die interessante Frage ist, welche Art von Rohmaterial Ihr Projekt tatsächlich benötigt.

Die Kluft, die bei den meisten echten Beschaffungen zwischen diesen beiden den Ausschlag gibt, liegt nicht in den Parametern. Es ist die Lizenz. Kolibri wird unter Apache 2.0 vertrieben. Das LFM2.5 2.6B Base wird unter der LFM Open License v1.0 vertrieben, einer maßgeschneiderten Lizenz (die Modellkarte führt sie als „license: other“), und genau dieser Unterschied ist derjenige, der an ein Rechtsteam statt an ein Engineering-Team geht.

Zwei verschiedene Bedeutungen von „open weights“

Beide Modelle lassen dich die Gewichte herunterladen und sie ausführen. Was du anschließend tun darfst, darin unterscheiden sie sich.

• Kolibri — Apache 2.0, keine Zusatzklausel zur akzeptablen Nutzung, keine Nutzerzahl-Schwelle, keine separaten kommerziellen Bedingungen. Aleph Alphas Karte vermerkt lediglich, dass das Labor Unterzeichner des EU-GPAI-Verhaltenskodex ist.

• LFM2.5 2.6B Base — die LFM Open License v1.0, eine eigene Lizenz von Liquid AI und keine OSI-Standardlizenz. Es ist dieselbe Lizenz, die für das nachtrainierte LFM2.5 2.6B und den Rest der Familie gilt.

Für ein Forschungsteam ist beides in Ordnung. Für ein Unternehmen, das seine Lizenzposition in einem Beschaffungsdokument angeben muss, ist das eine eine bekannte Größe und das andere ein Dokument, das jemand lesen muss. Das ist ein echter Kostenfaktor, der anfällt, bevor auch nur ein einziges Token generiert wird, und der in keiner Benchmark-Tabelle sichtbar ist.

Es gibt eine zweite Unterscheidung in derselben Kategorie, und es ist diejenige, die Liquid AIs eigene Karte mit Nachdruck hervorhebt. Das Base ist kein Assistent. Es bringt kein Instruction-Tuning mit, was bedeutet, dass es keiner Aufforderung folgen, nicht ablehnen, keinen Tool-Call ausgeben und nicht beim Thema bleiben wird – nicht weil es schwach ist, sondern weil es nie darauf trainiert wurde. Die Karte sagt unmissverständlich, dass es nur für Aufgaben empfohlen wird, die umfangreiches Fine-Tuning erfordern: sprachspezifische oder domänenspezifische Assistenten, Training mit proprietären Daten oder Experimentieren mit neuartigen Post-Training-Ansätzen. Alles, was dem Basis-Checkpoint nachgelagert ist – überwachtes Fine-Tuning, Lehrer-Spezialisierung, On-Policy-Destillation, agentisches Reinforcement Learning –, ist das Problem des Käufers. Kolibri kommt mit all dem bereits erledigt, auf vier Reasoning-Effort-Stufen, mit einem Tool-Call-Parser im Hermes-Stil, der neben den Gewichten ausgeliefert wird.

Was die Größen tatsächlich bringen

Lässt man den Rahmen weg, sind die beiden Modelle auf gegensätzliche Beschränkungen optimiert.

• Parameter — insgesamt 78.103.074.560, davon 3.457.573.120 aktiv pro Token auf Kolibri, gegenüber 2,69 Milliarden insgesamt beim LFM2.5 Base, der einen hybriden Stack aus 22 doppelt gegatteten Short-Convolution-Blöcken und 8 Grouped-Query-Attention-Schichten statt eines Transformers aus einheitlichen Blöcken verwendet.

• Kontext — 131.072 Tokens auf der LFM2.5 Base, gegenüber einem nativen Fenster von 262.144 Tokens auf Kolibri und einer validierten Fenstergröße von 1.048.576 darüber hinaus.

Trainingsdaten — 34 Billionen Token auf der LFM2.5 Base, gegenüber 20 Billionen bei Kolibri, die aus einem Rohpool von über 200 Billionen nach Filterung und Deduplizierung stammen, von denen 13,6 Prozent Code waren.

• Sprachen — sechzehn beim LFM2.5 Base, darunter Arabisch, Chinesisch, Japanisch, Koreanisch, Thailändisch und Vietnamesisch, gegenüber genau zwei bei Kolibri, Deutsch und Englisch, bewusst so ausgelegt.

• Speicher — zur LFM2.5 Base werden GGUF-, ONNX- und MLX-Builds veröffentlicht, und sie ist für den Edge-Einsatz konzipiert; die FP8-Gewichte von Kolibri haben einen Speicherbedarf von ~78 GB und erfordern mindestens zwei A100-Karten mit 80 GB, zwei H100 SXM5, eine H200, eine B200 oder eine B300.

Liest man diese fünf Zeilen zusammen, wirkt das Bild nicht mehr schief. Das Modell von Liquid AI deckt zehnmal so viele Sprachen ab – auf Hardware, die drei Größenordnungen kleiner ist. Das Modell von Aleph Alpha deckt zwei Sprachen ab, mit einem achtmal längeren Kontextfenster und einer Spezialisierungstiefe, die sich nur in seinen eigenen vertikalen Evaluierungen zeigt. Keines ist eine schlechtere Version des anderen; sie sind Antworten auf unterschiedliche Fragen, und die Fragen lauten: „Kann das ohne Server laufen?“ und „Kann das eine deutsche Regulierungseinreichung durchdenken?“

Generated two-column scoreboard for Kolibri and LFM2.5 2.6B Base. Left column Kolibri: role 'post-trained assistant', parameters '78.1B MoE, 3.46B active', context '262,144 native, 1M validated', languages 'German and English', licence Apache 2.0, deployment 'two 80 GB accelerators'. Right column LFM2.5 2.6B Base: role 'pre-trained checkpoint', parameters 2.69B, context 131,072, languages 'sixteen', licence 'LFM Open License v1.0', deployment 'phone, GGUF and MLX'. The footer reads 'Kolibri figures vendor-reported; LFM2.5 2.6B Base has no published evaluation.'

Nur eines von ihnen hat eine gemessene Punktzahl, und es ist nicht die Base

Hier ist der Teil, den das Pairing verbirgt. Artificial Analysis hat tatsächlich eine Modellseite für LFM2.5-2.6B – allerdings für das nachtrainierte Modell, nicht für das Base. Diese Seite weist einen Intelligence Index von 8 aus, rangiert auf Platz 9 von 49 Modellen ihrer Klasse, mit einem Kontext von 128.000 Token, 2,7 Milliarden Parametern und der LFM Open License v1.0. Es ist ein bescheidener und ehrlicher Wert: Das Modell wird gemessen, mit effektiv null bepreist und als das bewertet, was es ist – ein kleines Reasoning-Modell.

Der Base-Checkpoint hat keinen Score und kann auch keinen haben. Ein Intelligence Index wird berechnet, indem ein Modell mit Reasoning- und Wissensaufgaben getestet wird; ein Checkpoint, der kein Instruction-Tuning erhalten hat, zeigt bei diesen Aufgaben kein aussagekräftiges Verhalten. Liquid AI veröffentlicht dafür keine Evaluierungstabelle, und dieses Fehlen ist eine Aussage über das Artefakt, nicht eine Lücke in der Veröffentlichung.

Kolibris Position ist wieder eine andere und es lohnt sich, sie präzise zu benennen, weil sie leicht falsch verstanden wird. Auch für Kolibri gibt es keine Seite von Artificial Analysis — wir haben nachgesehen, und das Modell fehlt in diesem Vergleich vollständig. Was es gibt, ist Aleph Alphas eigene Post-Training-Tabelle, in der Kolibri in ihrem Harness 75,5 beim englischen Durchschnitt und 70,8 beim deutschen Durchschnitt erreicht, gegenüber 54,1 und 46,4 für seinen eigenen Vorgänger Kolibri Origin. Das sind vom Anbieter erhobene Zahlen auf einer vom Anbieter erstellten Evaluationssuite, und sie lassen sich nicht in einen Intelligence Index umrechnen. Von den beiden Modellen in dieser Schlagzeile hat also eines einen unabhängigen Wert für eine Schwesterversion, eines eine Anbietertabelle, und keines der genau verglichenen Artefakte besitzt überhaupt eine unabhängige Messung.

Screenshot of the Artificial Analysis model page for LFM2.5-2.6B, showing an Intelligence Index of 8 against a median of 5, a #9/49 intelligence rank, 128k-token context window, the summary line that the model is amongst the leading models in intelligence and well priced compared with other open-weight models of similar size, $0.00 input and output pricing against $0.00 medians, and the 49 models in this class count.

Das Geschwisterelement, das die Empfehlung ändert

LFM2.5 2.6B Base für sich allein zu beurteilen, ist der falsche Weg, die Veröffentlichung von Liquid AI zu bewerten, denn die Base existiert, um dem nachtrainierten LFM2.5 2.6B zu dienen, und die beiden werden zusammen ausgeliefert. Wenn Sie nicht vorhaben, eine Fine-Tuning-Pipeline zu schreiben, ist die Base nicht Ihr Modell — das nachtrainierte Geschwistermodell ist es, und es ist dasjenige mit einem öffentlichen Score und einem veröffentlichten Preis von praktisch nichts pro Token, wenn Sie es selbst hosten.

Das ist dieselbe Beziehung, die Kolibri zu Kolibri Origin hat, und der Vergleich lohnt sich, weil Aleph Alpha den Zeitplan veröffentlicht hat. Origin schloss das Pre-Training am 11. Juni 2026 mit 30,6 Milliarden Parametern und 3,27 Milliarden aktiven ab und wurde nie veröffentlicht; Kolibri schloss am 11. September 2026 mit 78,1 Milliarden ab und wurde am 3. Oktober veröffentlicht. Zwei Modelle, drei Monate, eines davon nur intern. Die entsprechende Aufteilung von Liquid AI ist in beide Richtungen öffentlich: Base- und post-trainierte Varianten, Seite an Seite, mit quantisierten Builds für llama.cpp, ONNX Runtime und Apples MLX, die zusammen mit dem nativen Checkpoint veröffentlicht wurden. Wenn Sie ein Fine-Tuning planen, ist dieses umgebende Tooling mehr wert als eine Benchmark-Zeile, denn es bestimmt, wie viel der Arbeit Sie selbst erledigen müssen.

Was je nach Anforderung bereitgestellt werden muss

Dieser hier reduziert sich auf eine kurze Entscheidungsliste statt auf einen Gewinner.

• Wenn das Modell ohne Server laufen muss – auf einem Telefon, einem Laptop, einem Gerät in einer Fabrik –, ist LFM2.5 2.6B Base das einzige der beiden, das überhaupt in Frage kommt, und das nachtrainierte LFM2.5 2.6B ist das, wovon man tatsächlich ausgehen würde. Kolibri kann dort mit keiner Quantisierung laufen.

• Wenn die Workload deutsch- oder englischsprachiges Dokumenten-Reasoning innerhalb Ihres eigenen Perimeters ist, mit Einschränkungen für regulierte Daten und dem Bedarf an Abstinenzverhalten, dann ist LFM2.5 Base nicht die richtige Art von Artefakt, und Kolibri zielt genau darauf ab — vorausgesetzt, Sie können zwei 80-GB-Beschleuniger bereitstellen und eine Lizenzposition akzeptieren, die Sie in einer Zeile darlegen können.

• Wenn Sie mehr als Deutsch und Englisch benötigen, deckt die Familie von Liquid AI sechzehn Sprachen bei 2,6B ab, und das Argument zur Sprachabdeckung kehrt sich bei dieser Größe um.

• Wenn Sie in diesem Quartal einen einsatzfähigen Assistenten benötigen und keine Post-Training-Pipeline betreiben möchten, ist Kolibri post-trainiert; das LFM2.5 Base ist es nicht, und das post-trainierte LFM2.5-Modell ist ein viel kleinerer Assistent als Kolibri, statt einer günstigeren Version davon.

Für Teams, deren Arbeitslast wirklich in der Mitte angesiedelt ist – ein paar Milliarden Tokens pro Monat, moderater Kontext, keine regulatorische Anforderung, die Hardware selbst zu besitzen –, ist keines von beiden die erste Wahl. Modelle unter 4B sind günstig selbst zu hosten und im großen Maßstab unhandlich zu routen, weil die Betriebskosten eines Deployments die Token-Rechnung übersteigen können; ein 78B-Modell hat das umgekehrte Problem. Die Stufe, die tatsächlich geroutet wird, ist die dazwischen, und diese Stufe ist auf OrcaRouter heute: Qwen3.5 35B-A3B für 0,057 $ pro Million Input und 0,459 $ Output, Qwen3.8-Flash für 0,15 $ und 0,47 $ mit einem Kontext von 1 Mio. Tokens, oder das Mixture-of-Experts-Modell Gemma 4 26B-A4B IT für 0,06 $ und 0,33 $. Das sind Anbieter-Listenpreise, die ohne Aufschlag pro Token durchgereicht werden, über einen einzigen OpenAI-kompatiblen Schlüssel mit Failover, und sie sind die ehrliche Antwort für ein Team, das sein tatsächliches Token-Volumen messen möchte, bevor es sich entweder auf ein Fine-Tuning-Projekt oder ein Rack festlegt.

Um es explizit zu sagen, was wir nicht anbieten: Weder Kolibri noch LFM2.5 2.6B Base ist heute auf OrcaRouter routbar. Wir haben den Katalog für beide unter jeder Anbieter- und Modellschreibweise durchsucht, und keines von beiden ist dort zu finden. Kolibri ist nur für Self-Hosting verfügbar, und das LFM2.5 Base ist ein Fine-Tuning-Artefakt, das nie dafür gedacht war, hinter einer API zu sitzen.

Screenshot of the OrcaRouter model page for qwen/qwen3.5-35b-a3b, showing the 32K-token context badge, 65K maximum output, text, image and video input, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'Public benchmarks by Qwen - 2026-02-25', the description as an open-weight mixture-of-experts multimodal model with 35B total and 3B active parameters, the pricing tiles $0.06 and $0.46, and a pricing table with two tiers: under 128K input tokens at $0.057 input and $0.459 output, and above that at $0.229 and $1.835, selected by each request's input token count.

Die Auswahl in einer Zeile

Kolibri ist ein fertiger, lizenzierter, dokumentierter deutsch-englischer Reasoner mit 78 Milliarden Parametern, für dessen Betrieb zwei Beschleuniger nötig sind. LFM2.5 2.6B Base ist ein unfertiger mehrsprachiger Ausgangspunkt mit 2,69 Milliarden Parametern, der eine Fine-Tuning-Pipeline erfordert und in die Hosentasche passt. Das Parameterverhältnis zwischen ihnen beträgt 29 zu 1, und es ist die am wenigsten aussagekräftige Zahl in diesem Artikel.