
Clef vs Gemma 4 12B: En beslutsapparat på 64K token mot en generalist på 256K token
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 219 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Det mest användbara talet i en jämförelse mellan Clef och Gemma 4 12B är inte en benchmarkpoäng. Det är 65 536 mot 256 000 – kontextfönstren. Cloudflare/clef är en multimodell beslutsmodell med 27 miljarder parametrar, eftertränad från Qwen3.8-27B, som läser ett tillstånd och ett schema med typade frågor och returnerar en sannolikhet för varje tillåtet svar i en enda icke-autoregressiv körning. Gemma 4 12B – Unified-checkpointen, google/gemma-4-12B-it – är leverantörens encoderfria any-to-any-modell med 11,95 miljarder parametrar, släppt sommaren 2026, som genererar text över ett fönster på 256 000 tokens på fler än 140 språk. Ställ en mapp med avtal framför båda och beslutsmodellen får slut på utrymme fyra gånger tidigare, eftersom dess tak är dokumenterade 65 536 tokens medan generalistens är 256 000. Den asymmetrin är inte en fotnot. För en hel klass av routningsarbete – långa dokument, inklistrade trådar, flersidiga formulär – avgör den valet innan noggrannhet ens diskuteras.
Så det här är inte en sida om vilken modell som är bättre. Det är en sida om de två axlar på vilka de skiljer sig: hur mycket tillstånd var och en kan hålla, och vilken form av svar var och en fysiskt kan producera. Allt annat är antingen en siffra från leverantören som ingen har reproducerat eller en jämförelse som inte är vad den ser ut att vara.
Vad var och en av dem är, i ett stycke vardera
Clef är Cloudflares 27B-beslutsmodell, publicerad under Apache-2.0 med vikterna på Hugging Face och en hostad slutpunkt på Workers AI. Cloudflare frös Qwen3.8-27B-stommen inklusive dess visionskodare, fäste ett gemensamt schema-huvud plus lågrankade adaptrar av rang 256, och tränade den med etikettutjämnad korsentropi för giltiga schemasvar tillsammans med en Brier-förlust för att skärpa kalibreringen. Du anger state — text, JSON, bilder eller videoramar — och en till 64 namngivna frågor, var och en av typen noul (sant/falskt, returnerar sannolikheten för sant), choice (2 till 26 namngivna alternativ) eller score (2 till 26 ordnade nivåer). Det som kommer tillbaka är en distribution per fråga och inget annat. Det finns ingen textgenereringsväg alls.
Gemma 4 12B är en generalist som genererar text. Den är encoder-fri: i stället för separata vision- eller ljudtorn projiceras råa bildpatchar och vågformer direkt in i språkmodellens inbäddningsutrymme genom lätta linjära lager, vilket är det som gör att den kan ta emot text, bild, video och ljud utan en pipeline per modalitet. Den har konfigurerbara tankelägen, inbyggt funktionsanrop, ett ordförråd på 262K och ett hybridattentionschema som varvar 1 024-tokens glidande fönster-attention med fullständig global attention. Den är Apache-2.0 med leverantörens egna användarvillkor vid sidan om, och det är den checkpoint som de flesta menar när de säger "kör den här storleken lokalt."
En sak som bör sägas rakt ut innan vi går vidare: ingen av modellerna är en route på OrcaRouter. Vår katalog returnerar 404 för cloudflare/clef och för 12B-checkpointen i samma familj, och inget i den här artikeln bör läsas som ett tillgänglighetsanspråk från oss. Det vi däremot har från Gemma-familjen är de två större storlekarna, och deras priser visas längre ner.

Alternativlistan är ett gränssnitt, och den har ett felmod.
Den strukturella skillnaden mellan dessa två är vad som händer med indata som inte passar.
• Utdata — Clef returnerar en sannolikhet per deklarerat alternativ, och endast dessa alternativ. Gemma 4 12B returnerar genererad text.
• Vägran — Clef har inget "inget av ovanstående" om du inte själv skriver in ett sådant i kriterierna. Gemma 4 12B kan beskriva ett fall som inte matchar något av det du frågade om.
• Felmod — Clefs fel är tyst: ett självsäkert val i ditt schema, inget undantag kastas, ingen reservgren utlöses. Generalistens fel är vanligtvis högljutt: prosa som inte kan tolkas.
• Testbarhet — en fast uppsättning alternativ gör komponenten reproducerbar och billig att granska. Fritext gör den flexibel och dyr att validera.
Clefs egna siffror för det där vägransproblemet är de svagaste siffrorna Clef publicerar. På CLINC150 med out-of-scope-hantering – avsiktsdetektering där ett giltigt svar är "detta tillhör ingen kategori" – får 27B 97,4 i macro-F1, vilket är bäst i Cloudflares tabell och anledningen att bry sig om 27B framför dess egen 9B-syskonmodell, som får 66,8 på samma benchmark. En skillnad på trettio punkter mellan två modeller byggda enligt samma recept säger att out-of-scope-beteende är det som efterträningsskalan köper, och det är det som de flesta routing-pipelines i tysthet förlitar sig på. Den åtgärd Cloudflare dokumenterar är en andra fråga i schemat – lägg till ett nytt fält som frågar om tillståndet passar överhuvudtaget, och tröskla det sedan – vilket fungerar, och vilket är ditt jobb snarare än modellens.
Var siffrorna kommer ifrån spelar större roll än vad de säger.
Varje Clef-siffra i den här artikeln kommer från Cloudflare: dess modellkort, dess lanseringsinlägg eller dess Decision Index-körning. Själva sviten är Cloudflares egen, och resultattavlan som visar poängen är Cloudflares egen. Det är en leverantör som mäter sin produkt på hårdvara den kontrollerar mot en rival vars API den medvetet speglar. Ingen tredje part har återskapat något av det, och den här artikeln tänker inte låtsas något annat.
Gemma 4 12B-kolumnen är en annan typ av bevis. Tillverkarens eget modellkort publicerar MMLU Pro 77,2 %, GPQA Diamond 78,8 %, AIME 2026 utan verktyg på 77,5 % och LiveCodeBench v6 på 72,0 %. Artificial Analysis, en oberoende bevakare, indexerar resonemangskonfigurationen till ett Intelligence Index på 14,18 med ett listat pris på 0,10 $ / 0,30 $ per miljon tokens och en uppmätt medianhastighet för utdata på omkring 113 tokens per sekund – och dess egen sida noterar att dessa siffror är beroende av arbetsbelastning och hårdvara.
Den ärliga läsningen är att de två kolumnerna inte alls är jämförbara. Den ena är en leverantörs svit för beslutskvalitet som körs av leverantören; den andra är en blandning av leverantörsbenchmarkar och en oberoende utvärdering av en allmän modell. Att citera ett 97,4 bredvid ett 77,2 som om de vore kolumner i samma tabell skulle vara det enskilt mest vilseledande den här sidan skulle kunna göra.
Latens är den enda plats där de två åtminstone kan diskuteras i samma enheter, och även där hopar sig förbehållen. Cloudflare rapporterar Clef vid 209,3 ms median och 238,6 ms p95, mätt på sin egen infrastruktur. Artificial Analysis mäter 12B:s tid till första chunk till omkring 2,4 sekunder i en resonemangskonfiguration, vilket inkluderar en tankebudget som beslutsmodellen inte har. Ett icke-autoregressivt pass på 209 ms mot en generationsstart på 2,4 sekunder är en reell arkitektonisk skillnad – ett framåtpass kontra en avkodningsloop – och det är Clefs starkaste argument för en het sökväg. Det är också, vid 27B, en modell som behöver hårdvara i H200-klass för att nå den siffran, och Cloudflare debiterar 0,24 USD per miljon indatatoken för att köra den åt dig.

Vad 64K kontext faktiskt ger dig
Det är i kontexten som den här jämförelsen blir praktisk, och där generalisten vinner på pappret med stor marginal.
• Clef — 65 536 tokens, enligt Workers AI-modellsidan och lanseringsinlägget; den medföljande kodningshjälpen har standardvärdet max_length=16,384, vilket är ett standardvärde snarare än ett tak, men det är standardvärdet du får om du använder laddaren som den levereras.
• Gemma 4 12B — 256 000 tokens enligt leverantörens modellkort, med 1 024-tokens glidfönster-attention för att hålla kostnaden för lång kontext nere.
• Bilder — Clef poängsätter bilder och videoramar tillsammans med texttillståndet via den ärvda visionskodaren. Gemma 4 12B tar emot text, bild, video och ljud via sin kodarfria väg.
• Språk — Clefs kort gör inga anspråk på flerspråkighet; Gemma 4 12B är dokumenterad på över 140 språk.
För en biljett, en faktura eller en renderad skärmbild, är 64K generöst och skillnaden är akademisk. För ett 200-sidigt kontrakt som du vill klassificera fält för fält, är det hela argumentet: generalisten kan hålla dokumentet, och beslutsmodellen kan inte. Clef's svar på det är chunkning, och att chunka ett dokument innan du beslutar om det innebär att du redan har fattat ett beslut som modellen var tänkt att fatta. Det är en verklig gräns och den förtjänar att anges som en.
Vad du faktiskt skulle betala, och var
Ingen av modellerna finns med i vår katalog, så prisfrågan delar sig i tre delar.
• Clef — $0,24 per miljon indatatokens på Cloudflares Workers AI, eller självhostad från Apache-2.0-vikter; Cloudflares publicerade latens mättes på en enda H200 med torch 2.11 och transformers 5.10.2, och de community-kvantiseringar som dök upp inom två dagar tyder på att den kan pressas mindre med en viss noggrannhetskostnad som ingen har mätt.
• Gemma 4 12B — ingen hostad väg här överhuvudtaget. Du hämtar ungefär 24 GB BF16-vikter och serverar dem själv, eller vänder dig till en tredjepartsplattform. Det finns inget pris per token som vi kan ange.
• Den routade ersättaren – Gemma 4 26B A4B, en mixture-of-experts med 25,2B parametrar totalt och 3,8B aktiva parametrar, listas på OrcaRouter till $0,06 per miljon indatatoken och $0,33 per miljon utdatatoken med en kontext på 262 144 token. Gemma 4 31B, den täta multimodala syskonmodellen med konfigurerbart tänkande och inbyggt funktionsanrop, listas till $0,13 och $0,38. Båda finns på en och samma nyckel med leverantörens listpris vidarebefordrat utan påslag per token och automatisk redundansväxling mellan leverantörer.
Den sista raden är den ärliga versionen av vårt deltagande i den här jämförelsen. Om det du behöver är en generalist som läser ett långt dokument och skriver en mening, är den billiga vägen dit en Gemma 4-storlek som vi faktiskt tillhandahåller, och den kostar mindre per miljon tokens än att självhosta en 12B på hyrda GPU:er. Om det du behöver är ett avgränsat beslut i den heta sökvägen, är Clefs median på 209 ms en verklig arkitektonisk egenskap, och det närmaste vi har i vår katalog är TypeSafe Jev 1.13 — modellen som Cloudflare benchmarkade mot och kopierade överföringsformatet från — till $0,042 per miljon indatatokens över en kontext på 65 536 tokens, som erbjuds i samma form som POST /v1/systemone. Eftersom de två är API-kompatibla bakom en tunn adapter är att testa Clef mot den sittande lösningen ett experiment snarare än en migrering, och experimentet förblir billigt när båda sidorna är nåbara via en och samma slutpunkt.

Beslutet, uttalat som ett beslut
Välj Clef när svaren är uppräkningsbara, tillståndet får plats i 64K, beslutet ligger i en latenskänslig väg, och du är villig att äga restklassen själv. 27B:s 97,4 på avsiktsigenkänning utanför räckvidden är anledningen till att du skulle betala för den framför 9B-syskonet, och dess fasta utdataform är vad som gör komponenten granskningsbar utan en parser.
Välj Gemma 4 12B när indata är långt, när modaliteten är ljud eller video, när svaret behöver vara i prosaform, eller när kategorierna ännu inte är kända – eftersom ”sortera den här högen i vilka grupperingar som än är rimliga” är en förfrågan som en beslutsmodell inte kan acceptera, inte en som den hanterar dåligt. Den är en generalist med en oberoende utvärdering bakom sig, och för öppet arbete är det värt mer än en leverantörstabell.
Och var skeptisk mot båda siffersamlingarna av det skäl som den här artikeln upprepar gång på gång: Cloudflare har inte oberoende reproducerats på någonting, och det kortet är leverantörens egen benchmarktabell. Det enda verkligt intressanta talet i paret – huruvida ett 27B-schemahuvud verkligen håller sin poäng på 97,4 utanför tillämpningsområdet på data som det inte tränats på – är precis det tal som ingen av leverantörerna kan avgöra, men som en tredje part skulle kunna.
