
Clef vs. LFM2.5 2.6B Base: 55 GB auf einem H200 oder 5,4 GB auf einem Laptop
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 219 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Hier ist ein Vergleich, bei dem die Hardware die Entscheidung trifft, bevor es die Modelle tun. Cloudflare/clef ist ein multimodales Entscheidungsmodell mit 27 Milliarden Parametern, nachtrainiert aus Qwen3.8-27B, dessen Repository etwas mehr als 55 GB über zwölf Backbone-Shards plus einen kleinen gemeinsamen Schema-Head umfasst. LiquidAI/LFM2.5-2.6B-Base ist ein reiner Text-Checkpoint mit 2,69 Milliarden Parametern, dessen Gewichte aus einer einzigen 5,4-GB-Datei bestehen, veröffentlicht von Liquid AI am 1. August 2026 unter der LFM Open License. Cloudflares eigene veröffentlichte Latenz für Clef – 209,3 ms Median, 238,6 ms p95 – wurde auf einer einzelnen H200 gemessen. Der vorgesehene Einsatz von Liquid AI für seine LFM2.5-Familie ist ein Laptop, ein Smartphone oder ein Ryzen-Handheld. Beide Anbieter beschreiben ihr Modell als klein, schnell und effizient, und beide sagen jeweils die Wahrheit über eine andere Maschine.
Es gibt eine zweite Lücke hinter der ersten, und sie ist diejenige, die tatsächlich die Pläne ändert. Weder Clef noch LFM2.5 2.6B Base beantwortet eine Frage von Haus aus so, wie Sie es wahrscheinlich erwarten. Clef wird vollständig trainiert für eine Aufgabe geliefert, von der es nicht abweichen kann: Es beantwortet getippte Fragen und wird nichts anderes tun. Der Liquid-Checkpoint wird völlig untrainiert ausgeliefert – er ist ein Basismodell, absichtlich ohne Instruction-Tuning, und Liquid AIs eigene Modellkarte besagt, dass er nur für umfangreiches Fine-Tuning empfohlen wird. Die eigentliche Frage ist also nicht, welches kostengünstiger zu betreiben ist. Es geht darum, ob Sie eine fertige Komponente oder ein Ausgangsmaterial kaufen, und die Antwort fällt für beide unterschiedlich aus.
Wo jedes Einzelne läuft, und warum das der ganze Vergleich ist
Die Deployment-Form ist bei diesen beiden Modellen keine Randnotiz. Bei einem Entscheidungsmodell ist sie die Architektur, denn ein 209-ms-Forward-Pass und eine „läuft auf dem Rechner direkt vor Ihnen“-Geschichte sind dieselbe Behauptung, nur von verschiedenen Enden aus erzählt.
• Parameter — 27B für Clef, mit beibehaltenem Qwen3.8-27B Vision-Encoder; 2,69B nur Text für LFM2.5 2.6B Base.
• Datenträger — ein 55 GB großes Repository für Clef; eine 5,4 GB große safetensors-Datei für den Liquid-Checkpoint, wobei daneben quantisierte GGUF-, ONNX- und MLX-Builds veröffentlicht wurden.
• Hardware — Cloudflare hat Clef mit torch 2.11 und transformers 5.10.2 auf einer einzelnen H200 getestet, und die Latenzwerte stammen aus diesem Durchlauf. Das nachtrainierte Geschwistermodell dieses Checkpoints von Liquid AI erreicht 220 Token pro Sekunde auf einem Apple M5 Max und 113 Tok/s auf einer AMD-Ryzen-CPU, bei unter 2,5 GB Speicher, und der Anbieter merkt an, dass auf einem Smartphone 30 Tok/s erreichbar sind.
• Kontext — 65.536 Token für Clef, laut der Workers AI-Modellseite und dem Launch-Post; 131.072 Token für LFM2.5 2.6B Base.
• Eingabe — Clef liest Text, JSON, Bilder und Videoframes und bewertet sie gemeinsam. Der Liquid-Checkpoint ist rein textbasiert.
• Lizenz — Apache-2.0 für Clef. LFM Open License v1.0 für LFM2.5, die source-available und nicht OSI-Open-Source ist: Die kommerzielle Nutzung ist daran geknüpft, dass Ihre Organisation unter 10 Millionen US-Dollar Jahresumsatz bleibt, und oberhalb dieser Grenze gewährt die Lizenz sie schlicht nicht. Diese Schwelle ist eine Tatsache für die Beschaffung, keine Fußnote.

Kosten pro Entscheidung sind nicht dieselbe Frage wie Kosten pro Token
Verlockend ist hier der Schritt, zwei Preise zu dividieren und einen Sieger zu küren. Das übersteht die Konfrontation mit dem, was die beiden Modelle tatsächlich tun, nicht.
Clef kostet 0,24 $ pro Million Eingabe-Tokens bei Cloudflares Workers AI. Seine Ausgabe ist keine Prosa, daher gibt es die übliche Ausgabe-Token-Zeile nicht; man zahlt einmal für den Zustand und bekommt eine Verteilung zurück. Für eine Routing-Schicht, die täglich Millionen kleiner Entscheidungen trifft, stellt diese Zahl die gesamten Betriebskosten dar, und es ist eine Zahl, die man nur von einem Anbieter und nicht von der eigenen Stromrechnung bekommt.
LFM2.5 2.6B Base kostet nichts pro Aufruf und kann keine Entscheidung treffen. Um daraus Kosten pro Entscheidung zu ermitteln, muss man es zuerst für seine Aufgabe feinjustieren, was bedeutet, Daten zusammenzustellen, einen Trainingsjob auszuführen, das Ergebnis zu evaluieren und erst dann herauszufinden, was es einen an kVA und Engineering-Zeit kostet. Die attraktive Wirtschaftlichkeit eines 2,6B-Checkpoints ist real, aber sie setzt Arbeit voraus, die noch nicht geleistet wurde, und wer Preise pro Token vergleicht, hat genau das übersprungen.
Die ehrliche Einordnung ist, dass es sich um zwei verschiedene Käufe handelt. Clef ist eine Komponente mit einem Listenpreis und einer Hosting-Rechnung. Der Liquid-Checkpoint ist ein Rohmaterial, dessen Kosten der Trainingslauf sind, den Sie so oder so bezahlen werden – und dessen Nutzen darin besteht, dass Sie danach das Artefakt uneingeschränkt besitzen, wobei die Grenzkosten einer Entscheidung dann tatsächlich Strom sind. Für eine eng gefasste, volumenstarke, stabile Aufgabe ist dieser Tausch oft richtig. Für eine Aufgabe, die Sie noch nicht spezifiziert haben, ist er genau umgekehrt, denn Sie können nicht auf ein Ziel hin feinabstimmen, das Sie nicht beschreiben können.
Eine untrainierte Basis ist kein schlechteres Modell, sie ist eine andere Startlinie
Es ist verlockend, die fehlende Benchmark-Tabelle des Liquid-Checkpoints als verborgene Schwäche zu lesen. Das ist sie nicht. Ein vortrainiertes Basismodell anhand von Instruction-Following-Benchmarks zu bewerten, würde das Fehlen von Fine-Tuning messen, nicht die Qualität des Substrats – und genau deshalb benchmarkt Liquid AI das nachtrainierte LFM2.5-2.6B und lässt das Basismodell unbewertet. Die Leerstelle ist von Ihrer Seite aus überprüfbar, und das ist der Punkt: Laden Sie 5.4 GB herunter, führen Sie Ihre eigene Evaluation für Ihre eigene Aufgabe durch und kennen Sie die Antwort, bevor Sie sich darauf festlegen, irgendetwas bereitzustellen.
Clefs Tabelle weist die entgegengesetzte Evidenzform auf und hat das entgegengesetzte Problem. Cloudflare veröffentlicht rund 40 Benchmark-Zeilen, einen vollständigen Workflow-Evaluierungssatz und eine Latenzverteilung, und jede einzelne davon wurde von Cloudflare auf Cloudflares eigenem Decision Index erstellt, ohne dass ein Dritter irgendetwas davon reproduziert hätte. Die Clef-Spalte ist weitaus informativer als die Liquid-Spalte, und keine einzige Zahl darin wurde von jemand anderem überprüft. Das ist eine stärkere Behauptung als ein leeres Feld und eine schwächere, als es aussieht.
Was Sie selbst messen können, teilt sich genauso auf. Mit dem Liquid-Checkpoint können Sie alles messen – er ist 5,4 GB auf Ihrer eigenen Festplatte. Bei Clef stehen Ihnen die Apache-2.0-Gewichte ebenso zum Herunterladen und Ausführen zur Verfügung, doch um Cloudflares Median von 209 ms zu erreichen, ist die von Cloudflare verwendete GPU-Klasse erforderlich. In der Praxis werden die meisten Teams es also über den gehosteten Endpunkt messen und damit die Verfügbarkeit des Anbieters samt seiner Latenz erben.
Wo die Routing-Schicht, für jedes von ihnen
Weder Clef noch irgendeine LFM2.5-Variante ist eine Route auf OrcaRouter, und dieser Artikel ist keine Verfügbarkeitsaussage – der Katalog liefert für beide ein 404, also kommt Clef von Cloudflare Workers AI oder deiner eigenen GPU, und der Liquid-Checkpoint kommt aus seiner eigenen Distribution.
Wozu eine Routing-Schicht hier wirklich dient, ist das Muster, das beide Modelle implizieren. Ein kleiner, begrenzter Scorer, der entscheidet, und ein größerer Generalist, der auf die Entscheidung hin handelt, bilden konstruktionsbedingt eine Zwei-Modell-Architektur – und Clefs eigener Backbone macht die zweite Hälfte davon konkret, denn das Modell, das Cloudflare als Basis für das Post-Training nutzte, Qwen3.8 27B, ist eine gelistete Route zu $0,33 pro Million Input-Tokens und $2,40 pro Million Output-Tokens bei einem Kontext von 262.144 Tokens. Ein einziger Endpunkt vor über 200 Modellen bedeutet, dass der kostengünstige Entscheider und der leistungsfähige Akteur hinter demselben Schlüssel sitzen, über die Routing-DSL zu einem einzigen Aufruf zusammengesetzt statt sie von Hand miteinander zu verdrahten, mit automatischem Failover, damit ein schlechter Nachmittag eines Anbieters den Entscheidungspfad nicht mit hinunterzieht. Wenn du stattdessen den Liquid-Checkpoint selbst hostest und dein Fine-Tuning mit den Modellen vergleichst, die es schlagen muss, ist derselbe Endpunkt das, was diesen Vergleich zu einer Konfigurationsänderung statt zu einem Beschaffungszyklus macht.
TypeSafes Jev 1.13 ist speziell für den Self-Hosting-Fall eine Erwähnung wert: Es ist das Entscheidungsmodell, gegen das Cloudflare gebenchmarkt hat, und spricht bewusst dieselbe POST /v1/systemone-Anfrageform wie Clef, es ist eine gelistete Route zu $0.042 pro Million Eingabe-Tokens bei einem Kontext von 65,536 Tokens, und es ist der Weg mit geringem Aufwand, um herauszufinden, ob ein begrenztes Entscheidungsmodell Ihrer Pipeline hilft, bevor Sie einen Trainingslauf auf ein Substrat verwenden, das vielleicht gar nicht existieren muss.

Welches, wofür
Verwenden Sie den Liquid-Checkpoint, wenn die Aufgabe eng gefasst, hochvolumig, gut genug spezifiziert ist, um Trainingsdaten dafür schreiben zu können, und an eine der beiden harten Einschränkungen gebunden ist, die eine geroutete API nicht beheben kann: Die Daten dürfen Ihre Infrastruktur nicht verlassen, oder der Rechner, auf dem sie laufen muss, ist der auf Ihrem Schreibtisch. Die Umsatzschwelle von LFM 1.0 ist das, was zuerst geprüft werden sollte, denn sie entscheidet, ob die Lizenz für Sie überhaupt verfügbar ist.
Nutzen Sie Clef, wenn die Entscheidung bereits aufzählbar ist, der Zustand in 64K passt, die Antwort eine kalibrierte Wahrscheinlichkeit statt eines Satzes erfordert und 209 ms in einem Hot Path die Eigenschaft ist, die Sie kaufen. Sein festes Schema ist das Feature – eine auditierbare, reproduzierbare, parserfreie Ausgabeform – und sein 55-GB-Footprint ist der Preis für das Backbone, das Clef beim ersten Versuch präzise macht statt erst nach einem Trainingslauf.
Was Sie nicht tun sollten, ist, nach der Parameteranzahl auszuwählen. Ein 2,69B-Modell, das erst trainiert werden muss, bevor es antworten kann, ist keine kleinere Version eines 27B-Modells, das das bereits kann, und die beiden Zahlen im Titel – 55 GB und 5,4 GB – beschreiben zwei verschiedene Budgets, nicht zwei Punkte auf derselben Skala.

Die offene Frage, und sie ist für beide dieselbe.
Keiner der beiden Anbieter hat Belege veröffentlicht, die einer unabhängigen Überprüfung standhalten. Cloudflares Decision-Index-Lauf ist in Eigenregie durchgeführt und nicht reproduziert; die Durchsatzwerte von Liquid AI sind die eigenen Messungen des Anbieters auf Hardware, die er selbst ausgewählt hat. Das LFM2.5 2.6B Base hat konstruktionsbedingt überhaupt keinen Benchmark, und die Clef-Tabelle hat bewusst sehr viele.
Für den Liquid-Checkpoint sind die fehlenden Belege kostengünstig zu beheben und liegen ganz bei Ihnen – die Datei ist klein genug, um sie an einem Nachmittag auf einem Laptop zu bewerten. Für Clef gilt das nicht: Um den Median von 209 ms zu reproduzieren, braucht man die Hardware, die Cloudflare verwendet hat, und den Zustand, den niemand außerhalb von Cloudflare zusammengestellt hat. Diese Asymmetrie sollte – mehr als alles in einer der beiden Spezifikationen – bestimmen, auf welche der beiden Sie in diesem Monat Ihre Planung ausrichten.
