Eine generierte Titelkarte mit der Überschrift „TwIL-LM3-Pro vs LFM2.5 2.6B Base“ und dem Untertitel „Das eine ist fertig, das andere ist ein Ausgangspunkt“, mit zwei abgerundeten Karten, auf denen „TwIL-LM3-Pro – post-trainiert und zusammengeführt“ und „LFM2.5 2.6B Base – vortrainierter Checkpoint“ steht. Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

TwIL-LM3-Pro vs. LFM2.5 2.6B Base: Das eine ist fertig, das andere ist ein Ausgangspunkt

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Aufschlussreichste an dem veröffentlichten Vergleich zwischen TwIL-LM3-Pro und LFM2.5 2.6B Base ist, dass webAI überhaupt keinen gegen das 2.6B veröffentlicht hat. Die Track-A- und Track-B-Tabellen von webAI stellen seinen 3.66B-Spezialisten für formale Logik einer Reihe von Kontrahenten gegenüber — seinem eigenen Granite-Basismodell, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — und der Eintrag von Liquid AI, den sie gewählt haben, ist LFM2.5-8B-A1B, nicht das 2.6B. Das 2.6B, das tatsächlich in der Tabelle auftaucht, ist `LFM2-2.6B`, die vorherige Generation, ein anderes Modell mit einem anderen Pretraining-Durchlauf. Diese Auslassung ist kein Versehen. LFM2.5 2.6B Base ist ein vortrainierter Checkpoint ohne Instruction-Tuning, und Instruction-Following-Benchmarks sind kein Test, für den es gebaut wurde.

Diese Seite vergleicht also ein fertiges Artefakt mit einem Rohmaterial. Die Aion-artige Rahmung – ein Modell hat einen Score und das andere nicht – passt, doch der Grund ist spezifischer und interessanter: Eines ist nachtrainiert und zusammengeführt, das andere stoppt bewusst vor dem Nachtraining, und die beiden Dokumente, die sie beschreiben, beantworten absichtlich unterschiedliche Fragen.

Zwei Parameterzählungen, die nicht dieselbe Messung sind.

TwIL-LM3-Pro hat 3,66 Mrd. Parameter, ist dicht, und alle davon sind bei jedem Token aktiv. Es stammt von `ibm-granite/granite-4.2-3b` ab, durch LoRA-Fine-Tuning, Multipfad-Destillation, Checkpoint-Fusion, einen WiSE-FT-Merge zurück in Richtung Basis und eine entropiegewichtete GRPO-Phase — und das Artefakt, das webAI ausgeliefert hat, ist die zusammengeführte Policy, nicht ein LoRA-Adapter, sodass es eigenständig läuft.

LFM2.5 2.6B Base hat 2,69 Mrd. Parameter über 30 Schichten: 22 doppelt gegatete Short-Convolution-Blöcke, verschachtelt mit 8 Grouped-Query-Attention-Schichten. Dieses hybride Conv-/Attention-Design ist die On-Device-Architektur von Liquid, und es ist der Grund dafür, dass die Durchsatzwerte der Familie so sind, wie sie sind, und nicht allein eine Funktion der Parameteranzahl. Es wurde auf 34 Billionen Token mit einem Vokabular von 128.000 Token trainiert und verfügt über ein Kontextfenster von 131.072 Token.

Die beiden Zahlen liegen etwa 36 % auseinander und stammen aus völlig unterschiedlichen Architekturen, daher bedeutet weder „3,66B schlägt 2,69B“ noch das Gegenteil etwas als Qualitätsaussage. Die eigene Modellkarte von webAI macht diesen Punkt indirekt, wenn sie es ablehnt, die Korpus-Perplexität über Tokenizer hinweg zu vergleichen — der Wortschatz von TwIL-LM3-Pro umfasst 100.352, der von LFM2.5-2.6B 128.000, und die Perplexität wird pro Token berechnet.

Was „Base“ entfernt und warum es den Punktestand verändert

Liquid AI veröffentlicht LFM2.5 2.6B in zwei Formen: den nachtrainierten Checkpoint, abgestimmt auf agentische Workloads in gängigen Agent-Harnesses, und die Base, die in ihrer eigenen Modellkarte als „der vortrainierte, reine Text-Checkpoint, mit dem alle LFM2.5-2.6B-Varianten erstellt werden" beschrieben wird. Die Base ist der Input für das Fine-Tuning, kein Produkt. Sie hat kein Instruction-Tuning, kein nennenswertes Chat-Template und keine veröffentlichte Evaluation – denn die Bewertung eines Basismodells anhand von Aufgaben zur Instruktionsbefolgung misst das Falsche.

Die Position von TwIL-LM3-Pro ist die Umkehrung. Ihr gesamter Wert ist der Post-Training-Stack: webAI berichtet, dass die Pipeline in seiner eigenen Testumgebung das In-Domain-Makro-Gate von 0,4313 seiner Basis auf 0,5539 anhob, wobei der Held-out-Makro über 10 Datensätze stabil blieb (0,7942 bis 0,7901), statt einzubrechen. Die Held-out-Retention ist der schwierige Teil des spezialisierten Post-Trainings, und sie ist der Teil, den die Base nicht beantworten kann.

Hier macht sich auch der Größenvergleich in den Tabellen von webAI bezahlt. TwIL-LM3-Pro wird auf beiden Hold-out-Makros vor LFM2.5-8B-A1B geführt – 0,7901 gegenüber 0,7884 im Zehn-Datensatz-Set, 0,7425 gegenüber 0,7378 im Vierzehn-Datensatz-Set – und das bei weniger als der Hälfte der Parameteranzahl dieses MoE-Modells. Das ist ein echtes vergleichbares Ergebnis, und es liegt genau deshalb vor, weil LFM2.5-8B-A1B ein nachtrainiertes Modell ist, das durch eine Instruction-Harness laufen kann. Beim Base ist das nicht möglich, weshalb die 2,6B nie eine Spalte bekam.

Die Dimensionen, die es wert sind, abgestimmt zu werden

• Parameter — TwIL-LM3-Pro 3.66B dense vs. LFM2.5 2.6B Base 2.69B (30 Schichten: 22 Conv + 8 GQA).

• Post-Training — LoRA-SFT, Destillation, WiSE-FT-Merge und GRPO bei Schritt 2580 vs. keine; die Base ist per Design die Ausgabe des Pre-Trainings.

• Kontextfenster — 131.072 Token bei beiden, von ihren jeweiligen Basismodellen übernommen.

• Vokabular — 100.352 Token vs. 128.000, weshalb ihre Perplexitäten nicht vergleichbar sind.

• Sprachen — nur Englisch vs. siebzehn, darunter Arabisch, Chinesisch, Japanisch, Koreanisch, Spanisch und Thai.

• Denkformat – TwIL-LM3-Pro gibt standardmäßig einen `<think>`-Block aus und argumentiert ausführlich (durchschnittlich 1.902 Tokens im In-Domain-Bereich, 24,2 % der Generierungen stoßen an die Längengrenze) gegenüber einem Basis-Checkpoint ganz ohne Instruktionsformat.

• Lizenz — webAI Non-Commercial License ver. 1.0 vs. Liquid's LFM Open License v1.0.

• Wofür es gedacht ist — ein Inferenz-Endpunkt für formale Logik vs. ein Ausgangspunkt für Fine-Tuning.

Die Kontextzeilen verdienen eine Fußnote, die beide Modelle mitliefern: Jedes bringt 131.072 Token aus dem Pretraining mit, und kein Anbieter hat das Langkontext-Verhalten validiert — die Karte von TwIL-LM3-Pro besagt, dass jeder veröffentlichte Score innerhalb eines 8.192-Token-Fensters gemessen wurde. Die hier übereinstimmenden Zahlen sind übernommen, nicht nachgewiesen.

Lizenz und wofür jede einzelne rechtlich bestimmt ist

Die webAI Non-Commercial License von TwIL-LM3-Pro erlaubt Forschung und persönliche Nutzung und erfordert eine gesonderte Vereinbarung mit webAI für eine Umsatz generierende Bereitstellung. LFM2.5 2.6B Base wird unter Liquids eigener LFM Open License v1.0 ausgeliefert, die die Hugging Face API als `license: other` statt als standardmäßige SPDX-Kennung meldet — lesen Sie die Lizenzdatei, bevor Sie damit planen, denn es handelt sich um Liquids eigene Bedingungen und nicht um eine anerkannte Vorlage.

Keine der beiden Lizenzen ist Apache 2.0, und es ist ein Fehler, „offene Gewichte“ als Synonym für „kommerziell permissiv“ zu behandeln. Der praktische Unterschied zwischen den beiden besteht darin, was die Lizenzen schützen: Ein nichtkommerzieller Forscher kann beide nutzen, ein Unternehmen, das ein Produkt entwickelt, muss beide prüfen, und der eigentliche Zweck von Base – nämlich durch Feinabstimmung in das Produkt von jemand anderem überführt zu werden – macht seine genauen Bedingungen folgenreicher, als sie aussehen.

Wo jedes einzelne in einem Stapel hingehört

The Base ist die richtige Wahl, wenn Sie trainieren möchten. Wenn es bei Ihrem Problem um eine eng gefasste Labeling-Aufgabe, einen domänenspezifischen Klassifikationskopf oder ein Fine-Tuning mit ein paar tausend gelabelten Beispielen geht, ist der Start von einem vorab trainierten 2,69B-Checkpoint mit einem breiten mehrsprachigen Vokabular und einer hybriden Conv-Architektur, die auf Durchsatz ausgelegt ist, eine fundierte Engineering-Entscheidung, und die Kosten des Post-Trainings, das Sie überspringen würden, sind die Kosten, die Sie stattdessen bewusst zahlen.

TwIL-LM3-Pro ist die richtige Wahl, wenn du nicht trainieren willst und die Aufgabe bereits formale Logik ist. Entailment-Labels, die Formalisierung von Lean-Aussagen, semantische Parses und Proof-Critique sind die Aufgaben, auf die seine gesamte Pipeline ausgerichtet war, und mit einem Checkpoint zu starten, der bereits die Merge- und die Reinforcement-Stufe durchlaufen hat, erspart dir den einen Teil davon, der wirklich schwer zu reproduzieren ist – das Niveau der zurückgehaltenen Suite zu halten, während du im Domänenbereich gewinnst.

Der Fehler besteht darin, „3,66 Mrd. nachtrainierter Spezialist“ als strikt besser als „2,69 Mrd. Basis-Checkpoint“ zu lesen. Sie befinden sich auf unterschiedlichen Stufen derselben Produktionslinie.

Ihnen dienen oder um sie herum dienen

Keines der beiden Modelle ist heute eine Route im OrcaRouter-Katalog, und der Grund ist bei jedem ein anderer. TwIL-LM3-Pro ist für nichtkommerzielle Nutzung lizenziert und hat keinen gehosteten Endpoint; LFM2.5 2.6B Base ist ein Fine-Tuning-Artefakt, das niemand absichtlich als Inferenz-Endpoint bereitstellen würde. Wo ein Router seinen Platz verdient, liegt eine Ebene höher, in der Arbeit, die einen Spezialisten umgibt: das Generieren und Filtern der Trainingsdaten, auf denen Sie die Base fine-tunen würden, das Erweitern der Prompts, die Sie einem formallogischen Modell zuführen würden, und das Bewerten der Ausgaben. Dabei handelt es sich um Textaufrufe, und sie laufen über einen einzigen OpenAI-kompatiblen Endpoint für über 200 Modelle zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preissenkung eines Anbieters noch am selben Tag greift und ein Wechsel von einem Datengenerierungsmodell zu einem anderen eine Konfigurationsänderung statt einer zweiten Anbieterbeziehung ist.

Automatisches Failover ist in einer Fine-Tuning-Pipeline wichtiger als üblich, weil ein Batch-Job, der bei 80 % abbricht, den gesamten Durchlauf verschwendet. Ein Schlüssel für die Generierungsmodelle, mit einem Fallback, der bei einem Anbieterfehler die Anfrage wiederholt, ist ein kleinerer Infrastrukturbaustein als drei API-Integrationen.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs LFM2.5 2.6B Base - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Post-training SFT, merge, GRPO; Context 131,072 tokens; Vocabulary 100,352; Languages English; Licence non-commercial. LFM2.5 2.6B Base: Parameters 2.69B (30 layers); Post-training none by design; Context 131,072 tokens; Vocabulary 128,000; Languages 17; Licence LFM Open License v1.0. A footer line reads 'Both vendor-reported; neither model has a third-party evaluation.' The OrcaRouter logo is composited in the bottom-right corner.

Welches, entschieden durch deine Absicht

Wenn Sie trainieren, nehmen Sie das Base. Wenn Sie Inferenz auf formaler Logik betreiben und die Lizenz Ihre Nutzung erlaubt, nehmen Sie TwIL-LM3-Pro. Wenn Sie heute ein kleines instruktionsbefolgendes Modell benötigen und keine der beiden Einschränkungen passt, verwenden Sie das nachtrainierte Geschwistermodell von LFM2.5 2.6B – das Modell, das Liquid tatsächlich für diesen Zweck veröffentlicht – und überlassen Sie das Base dem Fine-Tuning, das Sie ohnehin geplant haben.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, the 16-languages tag, the LFM2 and liquid tags, and the card's opening description of LFM2.5 as a family of hybrid models designed for on-device deployment, built on the LFM2 architecture with extended pre-training and reinforcement learning.A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B, the post-trained sibling, showing the 16-languages and LFM2 tags and the card's description of LFM2.5-2.6B as part of the LFM2.5 family with a 128K context window and agentic post-training.