Eine generierte Titelkarte mit der Aufschrift „FrogNano-4B-2609 vs LFM2.5 2.6B Base“ und dem Untertitel „ein fertiggestellter 4B-Agent gegen einen 2,69B-vortrainierten Checkpoint“, drei Chips mit den Aufschriften „RL-Post-Training abgeschlossen“, „nur Vortraining, 2,69B dense in 30 Schichten“ und „kein Instruction-Tuning“, einer Fußzeile mit der Aufschrift „Beide Spalten vom Anbieter gemeldet; kein Drittanbieter hat eines der Modelle bewertet“, und dem OrcaRouter-Logo, das in die untere rechte Ecke eingefügt ist.
Engineering & Research

FrogNano-4B-2609 vs. LFM2.5 2.6B Base: Ein fertiger Spezialist und ein Sack vortrainierter Gewichte

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Geben Sie eine Frage in LFM2.5 2.6B Base ein, und es wird Ihren Satz fortsetzen, anstatt ihn zu beantworten. Das ist kein Defekt – Liquid AI hat es als den vortrainierten Checkpoint unterhalb der LFM2.5-Familie veröffentlicht, wobei das Instruction-Tuning bewusst seinem Nicht-Base-Geschwistermodell überlassen wurde, und die Model Card sagt unmissverständlich, dass es für umfangreiches Fine-Tuning gedacht ist. Microsofts FrogNano-4B-2609 ist, wie das andere Ende dieser Pipeline aussieht: dieselbe Art kleines Sprachmodell, das fünf Iterationen von Reinforcement Learning auf synthetischen Repository-Aufgaben durchlaufen hat, bis es strukturierte Tool-Aufrufe und Kandidaten-Patches über ein Fünf-Tool-Harness ausgibt. Keines der beiden hat einen veröffentlichten unabhängigen Benchmark. Der Unterschied ist, dass bei einem von ihnen das Post-Training abgeschlossen wurde, und zu wissen, bei welchem, ist die ganze Entscheidung.

Die unten aufgeführten FrogNano-Zahlen stammen aus Microsofts Modellkarte und technischem Bericht. Die LFM-Zahlen stammen aus der Modellkarte von Liquid AI, ihrer Architekturkonfiguration und ihrer Lizenzdatei. Jede Zahl, die einem der beiden Anbieter zugeschrieben wird, ist vom Anbieter gemeldet, und keines dieser Modelle hat eine Bewertung durch Dritte durchlaufen — für LFM2.5 2.6B Base ist das größtenteils beabsichtigt, da ein Checkpoint ohne Instruction-Tuning kein faires Ziel für einen Chat-Benchmark ist.

Der Vergleich funktioniert nur, wenn du weißt, was du vergleichst.

Setzt man die beiden Datenblätter nebeneinander, ist das Erste, was nicht zusammenpasst, die Parameteranzahl. LFM2.5 2.6B Base sind 2,69 Milliarden dichte Parameter in 30 Schichten – 22 doppelt gegatete Kurzfaltungsblöcke und 8 Grouped-Query-Attention-Schichten, trainiert auf rund 34 Billionen Tokens in 16 Sprachen, mit einem Vokabular von 128.000 Tokens und einem Kontext von 131.072 Tokens. Der quantisierte Build landet bei etwa 1,67 GB in Q4_K_M.

Die Karte von FrogNano-4B-2609 gibt ihr Parameterfeld als den Bereich „500M-5B“ an, und die Modellzusammenfassung beschreibt es als ungefähr 4,66 Milliarden. Der Download entscheidet den Streit: zwei Safetensors-Shards mit insgesamt 9,32 GB BF16-Gewichten, 738 Tensoren, auf einem übernommenen dichten 32-Schichten-Hybrid-Stack aus Gated DeltaNet und Gated Attention. Ein 24-Schichten-Vision-Tower befindet sich im Checkpoint und wurde nie nachtrainiert.

Das Größenverhältnis liegt also grob bei 1,7 zu eins, und das Speicherverhältnis liegt eher bei 5,6 zu eins, sobald Quantisierung im Spiel ist. Diese Kluft ist wichtiger als die Parameterzeile, denn bei beiden Modellen handelt es sich um Self-Hosting-Kandidaten und nicht um Endpunkte – was der einzige Grund ist, dass sie in denselben Artikel gehören.

• Verwendungszweck — LFM2.5 2.6B Base ist Rohmaterial für einen Fine-Tuning-Lauf. FrogNano-4B-2609 ist eine fertige Policy für Software-Engineering auf Repository-Ebene innerhalb des Leaf-Harness.

• Instruction Following — LFM2.5 2.6B Base beherrscht sie von Haus aus nicht; Liquid AIs Karte empfiehlt es für Aufgaben, die umfangreiches Fine-Tuning erfordern. FrogNano-4B-2609 befolgt eine Aufgabenbeschreibung und gibt strukturierte Tool-Aufrufe aus, weil genau darauf sein RL-Ziel trainiert wurde.

• Kontext — 131.072 Token für LFM2.5 2.6B Base, gegenüber ungefähr 131K kombinierten Token für FrogNanos evaluierte Konfiguration. Nominell identisch, aber FrogNanos Fenster muss Tool-Ergebnisse, Shell-Ausgaben und Testprotokolle aufnehmen, nicht nur einen Prompt.

• Ausgabegrenze — FrogNanos validierte Konfiguration erlaubt 8.192 generierte Tokens pro Assistenten-Turn. LFM2.5 2.6B Base gibt kein Äquivalent an, da es nicht dafür ausgelegt ist, eine Antwort zu beenden.

• Modalität — beide sind reiner Text. FrogNanos Vision-Komponenten sind geerbt und ausdrücklich nicht unterstützt; LFM2.5 2.6B Base ist konstruktionsbedingt Text-in, Text-out.

• Lizenz — LFM2.5 2.6B Base unterliegt der LFM Open License v1.0, die unter 10 Mio. USD Jahresumsatz kostenlos ist und ab dieser Grenze oder darüber eine separate Lizenz erfordert, wobei abgeleitete Werke die Obergrenze erben. FrogNanos Karte nennt im Vorspann MIT und im Hauptteil Apache 2.0.

Das, wofür Microsoft bezahlt hat, und das, wofür du selbst bezahlen müsstest

Dies ist der entscheidende Abschnitt, denn in ihm führt ein Spezifikationsvergleich in die Irre.

Der gesamte Mehrwert von FrogNano-4B-2609 liegt im Post-Training, und Microsoft hat die Methode veröffentlicht. Man beginnt mit Qwen3.5-4B, das als allgemeines Modell über das Leaf-Harness 39,4 % auf SWE-bench Verified erreichte. Aus echten Snapshots werden Kandidaten-Repository-Aufgaben generiert, Rollouts vom aktuellen Checkpoint ausgeführt, um Aufgaben zu finden, die es manchmal löst, diese behalten, trainiert und wiederholt – fünf Iterationen, insgesamt rund 1.500 validierte synthetische Umgebungen, und zu keinem Zeitpunkt eine Destillation aus einem größeren Modell. Das Ergebnis auf Microsofts eigener Modellkarte sind 61,5 % auf SWE-bench Verified, 37,6 % auf SWE-bench Pro, 31,1 % auf Terminal-Bench 2.0 und 47,3 % auf PatchEval-Verified. Der Effizienz-Anhang des Papers gibt denselben Anstieg mit 48,2 %, 53,4 %, 58,3 %, 58,6 % und 61,6 % über die Iterationen hinweg an, was eine nützliche Erinnerung daran ist, dass selbst die beiden laboreigenen Tabellen desselben Experiments bei den Sprossen nicht übereinstimmen.

Lies das nun vor dem Hintergrund von LFM2.5 2.6B Base. Er ist der Checkpoint vor Beginn dieser Arbeit. Die Empfehlung auf seiner eigenen Model Card — es zu fine-tunen — ist genau die Aufgabe, die FrogNano dokumentiert: eine Aufgabenumgebung, eine ausführbare Belohnung, ein länger laufendes Harness und mehrere Trainingsiterationen gegen eine sich verändernde Policy. Das Paper behauptet nicht, dass dies einfach ist. Es berichtet, dass Zwischen-Checkpoints zunehmend teurer zu trainieren wurden, je länger die Reasoning-Traces wurden, dass eine Log-Längen-Strafe hinzugefügt werden musste, um die Drift zu stoppen, und dass spätere Iterationen die parallele Tool-Call-Fähigkeit verloren, die das Basismodell hatte, und bei einer Rate gleichzeitiger Aufrufe von 1,71 % endeten. Wer plant, das FrogNano-Rezept auf einer anderen 2.6B-Basis auszuführen, sollte für genau diese drei Probleme Budget einplanen.

Was LFM2.5 2.6B Base bietet, ist eine andere Art von Vorsprung: ein Pretraining-Budget von 34 Billionen Token, eine dokumentierte Hybridarchitektur, einen bereits vorhandenen quantisierten Build und einen dokumentierten Kontext von 131.072 Token – und das alles in einer Größe, die auf Hardware läuft, auf die ein 9,32 GB großer BF16-Checkpoint nicht passen würde. Wenn Ihre Aufgabe eng genug gefasst ist, dass ein kleines Fine-Tuning ein allgemeines Modell schlägt, ist das eine echte Position – und wenn nicht, haben Sie sich einen Trainingslauf gespart.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

Was du so oder so bauen musst

Keines davon ist ein Netzwerkaufruf, und das prägt den praktischen Vergleich stärker als jede Spezifikationszeile.

LFM2.5 2.6B Base möchte eine Inferenz-Laufzeit und einen Trainingslauf. Liquid AIs Modellkarte listet Builds im nativen Format, GGUF, ONNX und MLX auf, sodass die Serving-Hälfte gut abgedeckt ist — llama.cpp auf einem Laptop ist eine echte Option für den quantisierten Checkpoint. Die Trainingshälfte liegt bei dir: Daten, Zielfunktion, Evaluierung und eine Möglichkeit festzustellen, ob das Ergebnis besser oder nur anders geworden ist.

FrogNano-4B-2609 möchte einen OpenAI-kompatiblen Endpunkt mit den richtigen Parsern und einen Kubernetes-Cluster mit Berechtigung zum Verwalten von Pods und Netzwerkrichtlinien. Microsofts README sagt ungewöhnlich direkt, dass es sich beim Harness um eine Abhängigkeit und nicht um eine Bequemlichkeit handelt, und die Modellkarte gibt an, dass identische Ergebnisse einen übereinstimmenden Checkpoint, Tokenizer, eine übereinstimmende Serving-Konfiguration, Task-Images und ein übereinstimmendes Evaluationsprotokoll erfordern. Die Konfiguration ist hier kein Detail — stell es ohne einen Qwen3-Reasoning-Parser und einen Qwen3-Coder-Tool-Call-Parser bereit, und das Modell schreibt Prosa, wo das Harness einen Tool-Call erwartet.

So sieht diese Gegenüberstellung aus: Auf der einen Seite ein Trainingsprojekt mit einem kleinen Serving-Problem; auf der anderen Seite ein Serving-Projekt mit einem großen Evaluierungsproblem und nichts mehr zu trainieren. Beides sind Abende voller Arbeit. Nur bei einem davon handelt es sich um Abende voller Arbeit, die damit enden können, dass es heißt: „Das Modell ist nicht gut genug“ – ohne eigenes Verschulden.

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

Wo eine Oberfräse bei einem solchen Bau ihren Platz verdient

Diese beiden Modelle landen in einer Pipeline, die auch etwas Gehostetes aufruft. FrogNanos eigener Evaluierungsaufbau ist der Beweis: Der Leaf-Harness kommuniziert mit einem OpenAI-kompatiblen Endpunkt, was bedeutet, dass auf das zu testende Modell und jedes Modell, mit dem Sie es vergleichen, über dieselbe Schnittstelle zugegriffen wird. Das ist ein Muster, das es zu kopieren lohnt, selbst wenn der Grund nur Hygiene ist, und das ist der Punkt, an dem ein einzelner Endpunkt etwas Konkretes bewirkt.

OrcaRouter bietet über 200 Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel mit 0 % Aufschlag, sodass die Listenpreise der Anbieter unverändert weitergegeben werden und eine Preisänderung eines Anbieters am selben Tag auf unserer Seite live ist – also die Zahl, die sich tatsächlich ändert, wenn Sie entscheiden, ob ein selbst gehosteter Spezialist ein gehostetes allgemeines Modell bei den Kosten pro Aufgabe schlägt. Automatisches Failover deckt die gehostete Hälfte dieses Vergleichs ab, nicht den Checkpoint, den Sie selbst betreiben. Wir hosten weder FrogNano-4B-2609 noch LFM2.5 2.6B Base; beide sind Downloads. Was eine Routing-Schicht beseitigt, ist die zweite Integration jedes Mal, wenn sich die gehostete Seite Ihres Benchmarks ändert.

Eins auswählen, ehrlich gesagt

Wählen Sie LFM2.5 2.6B Base, wenn Ihre Aufgabe eng umgrenzt ist, Ihre Hardware klein ist und Sie bereit sind, den Trainingslauf selbst zu verantworten — die Lizenz ist unter 10 Mio. $ Umsatz kostenlos, der quantisierte Build ist 1,67 GB groß, und Liquid AIs eigene Karte empfiehlt es genau dafür. Der Preis dafür ist, dass Sie einen Ausgangspunkt bekommen, keine Fähigkeit: Nichts in der Veröffentlichung sagt Ihnen, was ein FrogNano-förmiger RL-Lauf darauf erreichen würde, und niemand hat einen veröffentlicht.

Wählen Sie FrogNano-4B-2609, wenn es sich um Software-Engineering auf Repository-Ebene handelt und Sie das Post-Training bereits erledigt haben möchten. Die 61,5 %, 37,6 %, 31,1 % und 47,3 % sind echte veröffentlichte Ergebnisse eines Labors, das seine Methode ausführlich beschrieben hat – und sie sind zugleich im Moment ein geschlossener Kreis: dasselbe Labor, dieselbe Testumgebung, dieselbe Baseline des Basismodells. Der Download von 9,32 GB, die Abhängigkeit von der Testumgebung und die kombinierte Lizenzierung sind der Preis dafür, dass Sie ein Trainingsprojekt überspringen, das Sie sonst durchführen müssten.

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

Der hilfreiche Perspektivwechsel ist, dass dies keine Konkurrenten sind. LFM2.5 2.6B Base ist einem Prozess vorgelagert, der so etwas wie FrogNano-4B-2609 hervorgebracht hat. Wenn Sie sich dabei wiederfinden, zwischen ihnen wählen zu müssen, ist die eigentliche Frage, ob Ihr Problem es wert ist, dafür einen eigenen Trainingslauf zu übernehmen – und wenn die Antwort nein lautet, ist der 4B-Checkpoint mit dem Harness, der veröffentlichten Methode und der vom Anbieter gemeldeten SWE-bench-Rangliste derjenige, der fertig ankommt.