
Clef vs Gemma 4 12B: Eine 64K-Token-Entscheidungs-Appliance gegen einen 256K-Token-Generalisten
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 219 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Die nützlichste Zahl in einem Vergleich zwischen Clef und Gemma 4 12B ist kein Benchmark-Wert. Sie lautet 65.536 gegenüber 256.000 — die Kontextfenster. Cloudflare/clef ist ein multimodales Entscheidungsmodell mit 27 Milliarden Parametern, nachtrainiert aus Qwen3.8-27B, das einen Zustand und ein Schema typisierter Fragen liest und in einem einzigen nicht-autoregressiven Durchlauf für jede erlaubte Antwort eine Wahrscheinlichkeit zurückgibt. Gemma 4 12B — der Unified-Checkpoint, google/gemma-4-12B-it — ist das encoderfreie Any-to-Any-Modell des Anbieters mit 11,95 Milliarden Parametern, veröffentlicht im Sommer 2026, das Text über ein Fenster von 256.000 Token in mehr als 140 Sprachen generiert. Legt man beiden einen Ordner mit Verträgen vor, geht dem Entscheidungsmodell viermal schneller der Platz aus, weil seine Obergrenze bei dokumentierten 65.536 Token liegt, während die des Generalisten bei 256.000 liegt. Diese Asymmetrie ist keine Fußnote. Für eine ganze Klasse von Routing-Aufgaben — lange Dokumente, eingefügte Threads, mehrseitige Formulare — entscheidet sie die Wahl, bevor Genauigkeit überhaupt diskutiert wird.
Dies ist also keine Seite darüber, welches Modell besser ist. Es ist eine Seite über die zwei Achsen, auf denen sie sich wirklich unterscheiden: wie viel Zustand jedes halten kann und welche Form von Antwort jedes physisch erzeugen kann. Alles andere ist entweder eine Herstellerangabe, die niemand reproduziert hat, oder ein Vergleich, der nicht das bedeutet, wonach er aussieht.
Was jedes Einzelne ist, jeweils in einem Absatz.
Clef ist Cloudflares 27B-Entscheidungsmodell, veröffentlicht unter Apache-2.0 mit den Gewichten auf Hugging Face und einem gehosteten Endpunkt auf Workers AI. Cloudflare fror das Qwen3.8-27B-Backbone einschließlich seines Vision-Encoders ein, fügte einen gemeinsamen Schema-Head plus Low-Rank-Adapter mit Rang 256 hinzu und trainierte es mit label-geglätteter Kreuzentropie für gültige Schema-Antworten zusammen mit einem Brier-Verlust, um die Kalibrierung zu schärfen. Sie liefern Zustand — Text, JSON, Bilder oder Video-Frames — und eine bis 64 benannte Fragen, jeweils typisiert als bool (wahr/falsch, wobei die Wahrscheinlichkeit für wahr zurückgegeben wird), Auswahl (2 bis 26 benannte Optionen) oder Bewertung (2 bis 26 geordnete Stufen). Zurück kommt eine Verteilung pro Frage und sonst nichts. Es gibt überhaupt keinen Textgenerierungspfad.
Gemma 4 12B ist ein Generalist, der Text generiert. Es ist Encoder-frei: Statt separater Vision- oder Audio-Türme werden rohe Bild-Patches und Wellenformen durch leichte lineare Schichten direkt in den Embedding-Raum des Sprachmodells projiziert, was es ermöglicht, Text, Bild, Video und Audio ohne eine Pipeline pro Modalität aufzunehmen. Es bietet konfigurierbare Denkmodi, natives Function Calling, ein Vokabular von 262K und ein hybrides Attention-Schema, das 1.024-Token-Sliding-Window-Attention mit vollständiger globaler Attention verschachtelt. Es steht unter Apache-2.0, daneben gelten die eigenen Nutzungsbedingungen des Anbieters, und es ist der Checkpoint, den die meisten meinen, wenn sie sagen: „Diese Größe lokal ausführen.“
Eines sei klar gesagt, bevor wir weitergehen: Keines der beiden Modelle ist eine Route auf OrcaRouter. Unser Katalog liefert einen 404 für cloudflare/clef und für den 12B-Checkpoint in derselben Familie, und nichts in diesem Beitrag sollte als eine Verfügbarkeitsaussage von uns verstanden werden. Was wir aus der Gemma-Familie tatsächlich führen, sind die beiden größeren Varianten, und ihre Preise erscheinen weiter unten.

Die Optionsliste ist eine Schnittstelle, und sie hat einen Fehlermodus.
Der strukturelle Unterschied zwischen diesen beiden besteht darin, was mit Eingaben geschieht, die nicht passen.
• Ausgabe — Clef gibt für jede deklarierte Option eine Wahrscheinlichkeit zurück, und nur für diese Optionen. Gemma 4 12B gibt generierten Text zurück.
• Ablehnung — Clef kennt kein „Nichts davon“, es sei denn, du schreibst selbst eines in die Kriterien hinein. Gemma 4 12B kann einen Fall beschreiben, der auf nichts von dem zutrifft, wonach du gefragt hast.
• Fehlermodus — Clefs Fehler ist still: eine selbstsichere Auswahl innerhalb deines Schemas, keine Ausnahme wird ausgelöst, kein Fallback-Zweig greift. Der Fehler des Generalisten ist meist laut: Prosa, die sich nicht parsen lässt.
• Testbarkeit — ein festes Set an Optionen macht die Komponente reproduzierbar und kostengünstig zu auditieren. Freitext macht sie flexibel und teuer zu validieren.
Clefs eigene Zahlen für dieses Verweigerungsproblem sind die schwächsten Werte, die es veröffentlicht. Bei CLINC150 mit Out-of-Scope-Behandlung – Intent-Erkennung, bei der eine gültige Antwort „das gehört zu keiner Kategorie" lautet – erzielt das 27B 97,4 Macro-F1, der beste Wert in Cloudflares Tabelle und der Grund, sich für das 27B statt für sein eigenes 9B-Geschwister zu interessieren, das im selben Benchmark 66,8 erreicht. Ein Abstand von dreißig Punkten zwischen zwei Modellen, die nach demselben Rezept gebaut wurden, besagt, dass Out-of-Scope-Verhalten das ist, was Skalierung im Post-Training erkauft, und es ist das, worauf die meisten Routing-Pipelines still angewiesen sind. Die von Cloudflare dokumentierte Abhilfe ist eine zweite Frage im Schema – ein noul-Feld hinzufügen, das fragt, ob der Zustand überhaupt passt, und es dann mit einem Schwellenwert versehen – was funktioniert und was Ihre Aufgabe ist, nicht die des Modells.
Woher die Zahlen kommen, ist wichtiger als das, was sie sagen.
Jeder Clef-Wert in diesem Artikel stammt von Cloudflare: aus seiner Modellkarte, seinem Launch-Post oder seinem Decision-Index-Lauf. Die Suite selbst ist Cloudflares eigene, und das Leaderboard, das die Ergebnisse hostet, ist ebenfalls Cloudflares eigenes. Das ist ein Anbieter, der sein Produkt auf Hardware misst, die er kontrolliert, gegen einen Rivalen, dessen API er bewusst nachbildet. Keine unabhängige Stelle hat irgendetwas davon reproduziert, und dieser Beitrag wird nicht vorgeben, dass es anders wäre.
Die Spalte Gemma 4 12B ist eine andere Art von Beleg. Der Anbieter selbst veröffentlicht MMLU Pro 77,2 %, GPQA Diamond 78,8 %, AIME 2026 ohne Tools bei 77,5 % und LiveCodeBench v6 bei 72,0 %. Artificial Analysis, ein unabhängiger Tracker, führt die Reasoning-Konfiguration mit einem Intelligence Index von 14,18 bei angegebenen $0.10 / $0.30 pro Million Tokens und einer gemessenen Median-Geschwindigkeit von etwa 113 Tokens pro Sekunde auf — und auf der eigenen Seite wird angemerkt, dass diese Werte von Workload und Hardware abhängen.
Die ehrliche Lesart ist, dass die beiden Spalten überhaupt nicht vergleichbar sind. Die eine ist eine vom Anbieter durchgeführte Suite zur Entscheidungsqualität des Anbieters; die andere ist eine Mischung aus Anbieter-Benchmarks und einer unabhängigen Bewertung eines allgemeinen Modells. Eine 97,4 neben einer 77,2 zu zitieren, als wären es Spalten derselben Tabelle, wäre das mit Abstand Irreführendste, was diese Seite tun könnte.
Die Latenz ist der einzige Punkt, an dem beide zumindest in denselben Einheiten diskutiert werden können, und selbst dort häufen sich die Vorbehalte. Cloudflare meldet für Clef einen Median von 209,3 ms und einen p95-Wert von 238,6 ms, gemessen auf der eigenen Infrastruktur. Artificial Analysis misst die Zeit bis zum ersten Chunk des 12B-Modells auf etwa 2,4 Sekunden in einer Reasoning-Konfiguration, die ein Thinking-Budget enthält, das das Entscheidungsmodell nicht hat. Ein nicht-autoregressiver Durchlauf von 209 ms gegenüber einem Generierungsstart von 2,4 Sekunden ist ein echter architektonischer Unterschied – ein Forward-Pass gegenüber einer Decoding-Schleife –, und er ist das stärkste Argument, das Clef für einen Hot Path hat. Es ist außerdem mit 27B ein Modell, das Hardware der H200-Klasse benötigt, um diesen Wert zu erreichen, und Cloudflare berechnet 0,24 $ pro Million Input-Tokens, um es für Sie zu betreiben.

Was 64K Kontext dir tatsächlich bringt
Der Kontext ist der Punkt, an dem dieser Vergleich praktisch ist und an dem der General mit großem Vorsprung gewinnt.
• Clef — 65.536 Token, laut der Workers-AI-Modellseite und dem Launch-Beitrag; der mitgelieferte Encoding-Helper verwendet standardmäßig max_length=16,384, was ein Standardwert und keine Obergrenze ist, aber es ist der Standardwert, den Sie erhalten, wenn Sie den Loader so verwenden, wie er ausgeliefert wird.
• Gemma 4 12B — 256.000 Token, laut Herstellerkarte, mit Sliding-Window-Attention über 1.024 Token, um die Kosten für langen Kontext gering zu halten.
• Bilder — Clef bewertet Bilder und Videoframes gemeinsam mit dem Textzustand über den geerbten Vision-Encoder. Gemma 4 12B verarbeitet Text, Bild, Video und Audio über seinen encoderfreien Pfad.
• Sprachen — Clefs Karte erhebt keinen Mehrsprachigkeitsanspruch; Gemma 4 12B ist in über 140 Sprachen dokumentiert.
Für ein Ticket, eine Rechnung oder einen gerenderten Screenshot sind 64K großzügig, und der Unterschied ist akademisch. Bei einem 200-seitigen Vertrag, den Sie Feld für Feld klassifiziert haben möchten, ist es das ganze Argument: Der Generalist kann das Dokument halten, das Entscheidungsmodell nicht. Clefs Antwort darauf ist Chunking, und ein Dokument zu chunkern, bevor Sie darüber entscheiden, bedeutet, dass Sie bereits eine Entscheidung getroffen haben, die das Modell hätte treffen sollen. Das ist eine echte Grenze, und sie verdient es, als solche benannt zu werden.
Was Sie tatsächlich zahlen würden, und wo
Keines der beiden Modelle wird in unserem Katalog geführt, daher zerfällt die Preisfrage in drei Teile.
• Clef — 0,24 $ pro Million Eingabe-Tokens bei Cloudflares Workers AI oder selbst gehostet aus Apache-2.0-Gewichten; die von Cloudflare veröffentlichte Latenz wurde auf einem einzelnen H200 mit torch 2.11 und transformers 5.10.2 gemessen, und die Community-Quantisierungen, die innerhalb von zwei Tagen auftauchten, legen nahe, dass es sich mit einem gewissen Genauigkeitsverlust, den niemand gemessen hat, weiter verkleinern lässt.
• Gemma 4 12B — hier gibt es überhaupt kein gehostetes Angebot. Sie laden ungefähr 24 GB BF16-Gewichte herunter und betreiben sie selbst, oder Sie greifen auf eine Drittanbieter-Plattform zurück. Es gibt keinen Preis pro Token, den wir nennen können.
• Der geroutete Ersatz — Gemma 4 26B A4B, ein Mixture-of-Experts mit insgesamt 25,2B und 3,8B aktiven Parametern, ist auf OrcaRouter zu $0,06 pro Million Input- und $0,33 pro Million Output-Tokens bei einem Kontext von 262.144 Tokens gelistet. Gemma 4 31B, das dichte multimodale Geschwistermodell mit konfigurierbarem Denken und nativen Funktionsaufrufen, ist zu $0,13 und $0,38 gelistet. Beide sind über einen einzigen Schlüssel verfügbar, wobei der Listenpreis des Anbieters ohne Aufschlag pro Token weitergegeben wird und automatisches Failover über Anbieter hinweg erfolgt.
Die letzte Zeile ist die ehrliche Version unserer Beteiligung an diesem Vergleich. Wenn Sie einen Generalisten brauchen, der ein langes Dokument liest und einen Satz schreibt, dann ist der günstige Weg dorthin eine Gemma-4-Größe, die wir tatsächlich anbieten, und sie kostet weniger pro Million Token als das Selbsthosting eines 12B auf gemieteten GPUs. Wenn Sie eine klar umrissene Entscheidung im Hot Path brauchen, sind Clefs 209 ms Median eine echte architektonische Eigenschaft, und das Nächste dazu in unserem Katalog ist TypeSafe's Jev 1.13 – das Modell, gegen das Cloudflare gebenchmarkt und von dem es das Wire-Format kopiert hat – zu 0,042 $ pro Million Input-Token über einen Kontext von 65.536 Token, bereitgestellt über dieselbe POST /v1/systemone-Form. Weil die beiden hinter einem dünnen Adapter API-kompatibel sind, ist der Test von Clef gegen den etablierten Anbieter ein Experiment und keine Migration, und das Experiment bleibt günstig, wenn beide Seiten über einen einzigen Endpunkt erreichbar sind.

Die Entscheidung, als Entscheidung formuliert
Wähle Clef, wenn die Antworten aufzählbar sind, der Zustand in 64K passt, die Entscheidung in einem latenzkritischen Pfad liegt und du bereit bist, die Residualklasse selbst zu verantworten. Die 97,4 des 27B bei der Erkennung von Absichten außerhalb des Geltungsbereichs sind der Grund, warum du dafür statt für das 9B-Schwestermodell bezahlen würdest, und seine feste Ausgabeform ist es, die die Komponente ohne Parser auditierbar macht.
Wähle Gemma 4 12B, wenn die Eingabe lang ist, wenn es sich bei der Modalität um Audio oder Video handelt, wenn die Antwort in Prosaform sein muss oder wenn die Kategorien noch nicht bekannt sind – denn „diesen Haufen in welche Gruppierungen auch immer sinnvoll erscheinen zu triagieren“ ist eine Anfrage, die ein Entscheidungsmodell nicht annehmen kann, nicht eine, die es schlecht bearbeitet. Es ist ein Generalist mit einer unabhängigen Evaluierung dahinter, und für offene Arbeit ist das mehr wert als eine Anbietertabelle.
Und seien Sie gegenüber beiden Zahlenwerken skeptisch – aus dem Grund, den dieser Artikel immer wieder anführt: Cloudflare wurde in keiner Hinsicht unabhängig reproduziert, und diese Karte ist die Benchmark-Tabelle des Anbieters selbst. Die eine wirklich interessante Zahl in dem Paar – ob ein 27B-Schema-Head seinen 97,4-Out-of-Scope-Score tatsächlich auf Daten hält, gegen die er nicht trainiert wurde – ist genau die Zahl, die weder der eine noch der andere Anbieter klären kann, ein Dritter aber könnte.
