Een gegenereerde titelkaart met de tekst 'Clef vs Gemma 4 12B', met als ondertitel 'een beslissingsmodel met 64K tokens tegenover een generalist met 256K tokens', met chips met de tekst '65,536 vs 256,000 context' en 'waarschijnlijkheden vs proza'. Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Engineering & Research

Clef vs Gemma 4 12B: een beslissingsapparaat met 64K tokens tegenover een generalist met 256K tokens

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het nuttigste getal in een vergelijking tussen Clef en Gemma 4 12B is geen benchmarkscore. Het is 65.536 tegen 256.000 — de contextvensters. Cloudflare/clef is een multimodaal beslissingsmodel met 27 miljard parameters, nagetraind op Qwen3.8-27B, dat een toestand en een schema van getypeerde vragen leest en in één enkele niet-autoregressieve pass een waarschijnlijkheid retourneert voor elk toegestaan antwoord. Gemma 4 12B — het Unified-checkpoint, google/gemma-4-12B-it — is het any-to-any-model zonder encoder van de leverancier met 11,95 miljard parameters, uitgebracht in de zomer van 2026, dat tekst genereert over een venster van 256.000 tokens in meer dan 140 talen. Leg een map met contracten voor beide neer en het beslissingsmodel raakt vier keer zo snel door zijn ruimte heen, want zijn plafond is een gedocumenteerde 65.536 tokens, terwijl dat van de generalist 256.000 is. Die asymmetrie is geen voetnoot. Voor een hele klasse van routeringstaken — lange documenten, geplakte threads, formulieren van meerdere pagina's — bepaalt die de keuze nog voordat nauwkeurigheid zelfs maar ter sprake komt.

Dus dit is geen pagina over welk model beter is. Het is een pagina over de twee assen waarop ze werkelijk van elkaar verschillen: hoeveel toestand elk kan vasthouden, en welke vorm van antwoord elk fysiek kan voortbrengen. Al het overige is ofwel een leverancierscijfer dat niemand heeft gereproduceerd, ofwel een vergelijking die niet betekent wat ze lijkt.

Wat elk ervan is, in één alinea per stuk.

Clef is Cloudflare's 27B-beslissingsmodel, gepubliceerd onder Apache-2.0 met de gewichten op Hugging Face en een gehost endpoint op Workers AI. Cloudflare bevroor de Qwen3.8-27B-backbone inclusief de vision-encoder, voegde een gezamenlijke schema-head plus low-rank adapters van rang 256 toe, en trainde het met label-smoothed cross-entropie voor geldige schema-antwoorden naast een Brier-loss om de kalibratie aan te scherpen. Je levert state — tekst, JSON, afbeeldingen of videoframes — en één tot 64 benoemde vragen, elk getypeerd als noul (waar/onwaar, die de kans op waar teruggeeft), choice (2 tot 26 benoemde opties) of score (2 tot 26 geordende niveaus). Wat terugkomt is een verdeling per vraag en niets anders. Er is helemaal geen tekstgeneratiepad.

Gemma 4 12B is een generalist die tekst genereert. Het is encoder-vrij: in plaats van afzonderlijke vision- of audiotorens worden ruwe beeldpatches en golfvormen via lichtgewicht lineaire lagen rechtstreeks in de embeddingruimte van het taalmodel geprojecteerd, waardoor het tekst, beeld, video en audio aankan zonder een pipeline per modaliteit. Het heeft configureerbare denkmodi, native functieaanroepen, een vocabulaire van 262K en een hybride attentieschema dat sliding-window-attentie van 1.024 tokens afwisselt met volledige globale aandacht. Het is Apache-2.0, met daarnaast de eigen gebruiksvoorwaarden van de leverancier, en het is het checkpoint dat de meeste mensen bedoelen als ze zeggen: "draai dit formaat lokaal".

Eén ding moeten we duidelijk zeggen voordat we verdergaan: geen van beide modellen is een route op OrcaRouter. Onze catalogus geeft een 404 voor cloudflare/clef en voor het 12B-checkpoint in dezelfde familie, en niets in dit stuk mag worden gelezen als een beschikbaarheidsclaim van ons. Wat we wel uit de Gemma-familie aanbieden, zijn de twee grotere formaten, en hun prijzen staan verderop.

A two-column comparison scoreboard titled 'Clef vs Gemma 4 12B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Context: 65,536 tokens; Output: probability per option, no text; Input: text, JSON, images, video; Latency: 209.3 ms median, H200; Evidence: vendor's own Decision Index. The right column 'Gemma 4 12B' reads: Parameters: 11.95B dense, encoder-free; Context: 256,000 tokens; Output: generated text; Input: text, image, video, audio; Latency: about 2.4 s to first chunk; Evidence: vendor card plus Artificial Analysis. A footer reads 'Clef figures unaudited; Gemma figures per Google's card and Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

De optielijst is een interface en heeft een faalmodus.

Het structurele verschil tussen deze twee is wat er gebeurt met invoer die niet past.

• Uitvoer — Clef retourneert een waarschijnlijkheid per opgegeven optie, en alleen die opties. Gemma 4 12B retourneert gegenereerde tekst.

• Weigering — Clef kent geen "geen van bovenstaande", tenzij je er zelf een in de criteria opneemt. Gemma 4 12B kan een geval beschrijven dat bij niets past waar je naar vroeg.

• Faalmodus — Clef's fout is stil: een zelfverzekerde keuze binnen je schema, geen exception die wordt opgeworpen, geen fallback-tak die in werking treedt. De fout van de generalist is meestal luidruchtig: proza dat niet parseert.

• Testbaarheid — een vaste set opties maakt de component reproduceerbaar en goedkoop te auditen. Vrije tekst maakt het flexibel en duur om te valideren.

Clef's eigen cijfers voor dat weigeringsprobleem zijn de zwakste cijfers die het publiceert. Op CLINC150 met out-of-scope-afhandeling — intentiedetectie waarbij één geldig antwoord "dit hoort bij geen enkele categorie" is — scoort de 27B 97,4 macro-F1, wat het beste in Cloudflare's tabel is en de reden om de 27B boven zijn eigen 9B-broertje te verkiezen, dat 66,8 scoort op dezelfde benchmark. Een verschil van dertig punten tussen twee modellen die volgens hetzelfde recept zijn gebouwd, zegt dat out-of-scope-gedrag het ding is dat post-trainingschaal oplevert, en het is het ding waarop de meeste routeringspijplijnen stilzwijgend vertrouwen. De mitigatie die Cloudflare documenteert is een tweede vraag in het schema — voeg een noul-veld toe dat vraagt of de toestand er überhaupt in past, en pas er vervolgens een drempel op toe — wat werkt, en wat jouw taak is in plaats van die van het model.

Waar de cijfers vandaan komen, is belangrijker dan wat ze zeggen.

Elk Clef-cijfer in dit artikel is afkomstig van Cloudflare: zijn modelkaart, zijn lanceringsbericht of zijn Decision Index-run. De suite zelf is van Cloudflare, en de ranglijst die de scores host, is ook van Cloudflare. Dat is een leverancier die zijn product meet op hardware die hij zelf controleert, tegen een rivaal wiens API hij bewust spiegelt. Geen enkele derde partij heeft er ook maar iets van gereproduceerd, en dit stuk gaat niet doen alsof het anders is.

De Gemma 4 12B-kolom is een ander soort bewijs. De eigen kaart van de leverancier publiceert MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 zonder tools op 77,5% en LiveCodeBench v6 op 72,0%. Artificial Analysis, een onafhankelijke tracker, indexeert de reasoning-configuratie op een Intelligence Index van 14,18, met een vermelde prijs van $0,10 / $0,30 per miljoen tokens en een gemeten mediane outputsnelheid van ongeveer 113 tokens per seconde — en de eigen pagina merkt op dat die cijfers afhankelijk zijn van de workload en de hardware.

De eerlijke lezing is dat de twee kolommen helemaal niet vergelijkbaar zijn. De ene is een door de leverancier uitgevoerde suite voor besluitkwaliteit; de andere is een mix van leveranciersbenchmarks en een onafhankelijke evaluatie van een algemeen model. Een 97,4 naast een 77,2 vermelden alsof het kolommen van dezelfde tabel waren, zou het meest misleidende zijn wat deze pagina zou kunnen doen.

Latentie is de enige plek waar de twee tenminste in dezelfde eenheden kunnen worden besproken, en zelfs daar stapelen de kanttekeningen zich op. Cloudflare rapporteert Clef op 209,3 ms mediaan en 238,6 ms p95, gemeten op zijn eigen infrastructuur. Artificial Analysis meet de tijd tot de eerste chunk van de 12B op ongeveer 2,4 seconden in een redeneerconfiguratie, die een denkbudget omvat dat het beslissingsmodel niet heeft. Een niet-autoregressieve pass van 209 ms tegenover een generatiestart van 2,4 seconden is een echt architectonisch verschil — één forward pass versus een decoderingslus — en het is het sterkste argument dat Clef heeft voor een hot path. Het is ook, op 27B, een model dat H200-klasse hardware nodig heeft om dat cijfer te halen, en Cloudflare rekent $0,24 per miljoen inputtokens om het voor je te draaien.

A headless capture of the google/gemma-4-12B-it model card on Hugging Face, showing the model title, the Any-to-Any and Transformers and Safetensors tags, the gemma4_unified image-text-to-text architecture line, the Apache 2.0 licence line credited to Google DeepMind, and the note that the card covers the Gemma 4 12B Unified model.

Wat 64K aan context je daadwerkelijk oplevert

Context is waar deze vergelijking praktisch wordt en waar de generalist op papier met een ruime marge wint.

• Clef — 65.536 tokens, volgens de Workers AI-modelpagina en het bericht over de lancering; de meegeleverde encoding-helper gebruikt standaard max_length=16,384, wat een standaardwaarde is en geen plafond, maar het is wel de standaard die je krijgt als je de loader gebruikt zoals hij wordt geleverd.

• Gemma 4 12B — 256.000 tokens, volgens de specificatiekaart van de leverancier, met sliding-window-attention van 1.024 tokens om de kosten voor lange contexten laag te houden.

• Afbeeldingen — Clef scoort afbeeldingen en videoframes gezamenlijk met de teksttoestand via de overgeërfde visie-encoder. Gemma 4 12B verwerkt tekst, afbeelding, video en audio via zijn encoder-vrije pad.

• Talen — De kaart van Clef maakt geen aanspraak op meertaligheid; Gemma 4 12B is gedocumenteerd in meer dan 140 talen.

Voor een ticket, een factuur of een gerenderde screenshot is 64K ruim, en het verschil is academisch. Voor een contract van 200 pagina's dat je veld voor veld wilt laten classificeren, is dat het hele punt: de generalist kan het document overzien, het beslissingsmodel niet. Het antwoord van Clef daarop is chunking, en een document opdelen in chunks voordat je erover beslist, betekent dat je al een beslissing hebt genomen die het model had moeten nemen. Dat is een echte beperking, en die verdient het als zodanig te worden benoemd.

Wat je daadwerkelijk zou betalen, en waar

Geen van beide modellen staat in onze catalogus, dus de prijskwestie valt in drie richtingen uiteen.

• Clef — $0,24 per miljoen inputtokens op Cloudflare's Workers AI, of zelf gehost vanaf Apache-2.0-gewichten; de door Cloudflare gepubliceerde latentie werd gemeten op één enkele H200 met torch 2.11 en transformers 5.10.2, en de community-kwantisaties die binnen twee dagen verschenen, suggereren dat het verder verkleind kan worden met een zeker verlies aan nauwkeurigheid dat niemand heeft gemeten.

• Gemma 4 12B — hier is helemaal geen gehoste route. Je haalt ongeveer 24 GB aan BF16-gewichten op en serveert ze zelf, of je wendt je tot een platform van derden. Er is geen prijs per token die we kunnen opgeven.

• De gerouteerde vervanger — Gemma 4 26B A4B, een mixture-of-experts met in totaal 25,2 miljard en 3,8 miljard actieve parameters, staat op OrcaRouter voor $0,06 per miljoen inputtokens en $0,33 per miljoen outputtokens met een context van 262.144 tokens. Gemma 4 31B, het dense multimodale zusje met configureerbaar denken en native functieaanroepen, staat voor $0,13 en $0,38. Beide staan op één sleutel met de lijstprijs van de provider doorgegeven zonder opslag per token en automatische failover tussen providers.

Die laatste regel is de eerlijke versie van onze betrokkenheid bij deze vergelijking. Als je een generalist nodig hebt die een lang document leest en een zin schrijft, is de goedkope route daarnaartoe een Gemma 4-formaat dat wij daadwerkelijk aanbieden, en dat kost minder per miljoen tokens dan het zelf hosten van een 12B-model op gehuurde GPU's. Als je een begrensde beslissing in het hot path nodig hebt, is de 209 ms-mediaan van Clef een echte architecturale eigenschap, en wat het dichtst daarbij in onze catalogus komt, is TypeSafe's Jev 1.13 — het model waartegen Cloudflare benchmarkte en waarvan het het wire-formaat overnam — tegen $0,042 per miljoen invoertokens bij een context van 65.536 tokens, geleverd via dezelfde POST /v1/systemone vorm. Omdat de twee API-compatibel zijn achter een dunne adapter, is het uitproberen van Clef tegen de gevestigde partij een experiment in plaats van een migratie, en het experiment blijft goedkoop wanneer beide kanten bereikbaar zijn via één endpoint.

A headless capture of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the Gemma 4 31B title, the import date, a p50 TTFT latency figure, and the code-sample and benchmark navigation tabs.

De beslissing, geformuleerd als een beslissing

Kies Clef wanneer de antwoorden opsombaar zijn, de toestand in 64K past, de beslissing zich in een latentiegevoelig pad bevindt, en je bereid bent de restklasse zelf voor je rekening te nemen. De 97,4 van de 27B op detectie van intenties buiten scope is de reden waarom je ervoor zou betalen in plaats van de 9B-tegenhanger, en de vaste uitvoervorm ervan is wat de component auditeerbaar maakt zonder een parser.

Kies Gemma 4 12B wanneer de invoer lang is, wanneer de modaliteit audio of video is, wanneer het antwoord proza moet zijn, of wanneer de categorieën nog niet bekend zijn — want "deze stapel indelen in welke groeperingen dan ook zinvol zijn" is een verzoek dat een beslissingsmodel niet kan accepteren, niet een dat het slecht afhandelt. Het is een generalist met een onafhankelijke evaluatie erachter, en voor open-ended werk is dat meer waard dan een leverancierstabel.

En wees sceptisch over beide sets cijfers om de reden die dit artikel blijft herhalen: Cloudflare is op wat dan ook niet onafhankelijk gereproduceerd, en die kaart is de eigen benchmarktabel van de leverancier. Het enige werkelijk interessante getal in het tweetal — of een 27B-schema-head daadwerkelijk zijn 97,4 out-of-scope-score vasthoudt op data waartegen deze niet is getraind — is precies het getal dat geen van beide leveranciers kan beslechten en dat een derde partij wel zou kunnen.