Wygenerowana karta tytułowa z napisem „Clef vs Gemma 4 12B”, z podtytułem „64K-tokenowy model decyzyjny kontra 256K-tokenowy generalista”, z chipami o treści „kontekst 65,536 vs 256,000” i „prawdopodobieństwa kontra proza”. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Engineering & Research

Clef kontra Gemma 4 12B: 64K-tokenowe urządzenie decyzyjne przeciwko 256K-tokenowemu generaliście

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najbardziej użyteczną liczbą w porównaniu między Clef a Gemma 4 12B nie jest wynik benchmarku. To 65 536 przeciwko 256 000 — okna kontekstu. Cloudflare/clef to multimodalny model decyzyjny o 27 miliardach parametrów, dostrojony po treningu z Qwen3.8-27B, który odczytuje stan i schemat typowanych pytań i zwraca prawdopodobieństwo dla każdej dozwolonej odpowiedzi w jednym przebiegu nieautoregresyjnym. Gemma 4 12B — punkt kontrolny Unified, google/gemma-4-12B-it — to model dostawcy o 11,95 miliarda parametrów, pozbawiony enkodera, typu any-to-any, wydany latem 2026 roku, który generuje tekst w oknie 256 000 tokenów w ponad 140 językach. Postaw przed oboma folder umów, a modelowi decyzyjnemu zabraknie miejsca cztery razy szybciej, bo jego pułap to udokumentowane 65 536 tokenów, podczas gdy pułap generalisty wynosi 256 000. Ta asymetria nie jest przypisem. Dla całej klasy zadań związanych z routingiem — długie dokumenty, wklejone wątki, wielostronicowe formularze — rozstrzyga wybór, zanim w ogóle zacznie się rozmawiać o dokładności.

Zatem to nie jest strona o tym, który model jest lepszy. To strona o dwóch osiach, na których naprawdę się różnią: ile stanu każdy może utrzymać i jaki kształt odpowiedzi każdy jest fizycznie w stanie wytworzyć. Wszystko inne to albo liczba podana przez dostawcę, której nikt nie odtworzył, albo porównanie, które nie oznacza tego, na co wygląda.

Czym jest każde z nich, po jednym akapicie na każde.

Clef to 27-miliardowy model decyzyjny Cloudflare, opublikowany na licencji Apache-2.0, z wagami na Hugging Face i hostowanym endpointem w Workers AI. Cloudflare zamroził szkielet Qwen3.8-27B wraz z jego enkoderem wizyjnym, dołączył wspólną głowicę schematu oraz adaptery niskorzędowe o rzędzie 256, a następnie wytrenował go z użyciem entropii krzyżowej z wygładzaniem etykiet dla poprawnych odpowiedzi schematu oraz straty Brier w celu lepszej kalibracji. Dostarczasz state — tekst, JSON, obrazy lub klatki wideo — oraz od jednego do 64 nazwanych pytań, każde typu noul (prawda/fałsz, zwracające prawdopodobieństwo prawdy), choice (od 2 do 26 nazwanych opcji) lub score (od 2 do 26 uporządkowanych poziomów). W odpowiedzi otrzymujesz rozkład dla każdego pytania i nic więcej. Nie ma żadnej ścieżki generowania tekstu.

Gemma 4 12B to generalista generujący tekst. Jest pozbawiona enkodera: zamiast osobnych wież wizji lub dźwięku surowe fragmenty obrazu i przebiegi fal są rzutowane bezpośrednio do przestrzeni osadzeń modelu językowego przez lekkie warstwy liniowe, co pozwala jej przyjmować tekst, obraz, wideo i dźwięk bez potoku dla poszczególnych modalności. Ma konfigurowalne tryby myślenia, natywne wywoływanie funkcji, słownik o rozmiarze 262 tys. i hybrydowy schemat uwagi, który przeplata uwagę z przesuwanym oknem o rozmiarze 1024 tokenów z pełną uwagą globalną. Jest na licencji Apache-2.0, a obok niej obowiązują własne warunki użytkowania dostawcy, i to jest ten checkpoint, który większość ludzi ma na myśli, mówiąc „uruchom model tej wielkości lokalnie”.

Jedną rzecz należy powiedzieć wprost, zanim przejdziemy dalej: żaden z tych modeli nie jest trasą w OrcaRouter. Nasz katalog zwraca 404 dla cloudflare/clef oraz dla checkpointu 12B z tej samej rodziny, i nic w tym tekście nie powinno być odczytywane jako nasza deklaracja dostępności. To, co faktycznie mamy w ofercie z rodziny Gemma, to dwa większe rozmiary, a ich ceny znajdują się poniżej.

A two-column comparison scoreboard titled 'Clef vs Gemma 4 12B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Context: 65,536 tokens; Output: probability per option, no text; Input: text, JSON, images, video; Latency: 209.3 ms median, H200; Evidence: vendor's own Decision Index. The right column 'Gemma 4 12B' reads: Parameters: 11.95B dense, encoder-free; Context: 256,000 tokens; Output: generated text; Input: text, image, video, audio; Latency: about 2.4 s to first chunk; Evidence: vendor card plus Artificial Analysis. A footer reads 'Clef figures unaudited; Gemma figures per Google's card and Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Lista opcji jest interfejsem i ma tryb awarii.

Strukturalna różnica między tymi dwoma polega na tym, co dzieje się z danymi wejściowymi, które nie pasują.

• Dane wyjściowe — Clef zwraca prawdopodobieństwo dla każdej zadeklarowanej opcji i tylko dla tych opcji. Gemma 4 12B zwraca wygenerowany tekst.

• Odmowa — Clef nie ma opcji „żadna z powyższych”, chyba że samodzielnie wpiszesz ją do kryteriów. Gemma 4 12B potrafi opisać przypadek, który nie pasuje do niczego, o co pytasz.

• Tryb awarii — błąd Clefa jest cichy: pewny wybór wewnątrz twojego schematu, nie zostaje zgłoszony żaden wyjątek, nie zostaje uruchomiona żadna gałąź zapasowa. Błąd generalisty jest zwykle głośny: proza, której nie da się sparsować.

• Testowalność — stały zestaw opcji czyni komponent powtarzalnym i tanim w audycie. Swobodny tekst czyni go elastycznym i kosztownym w walidacji.

Własne liczby Clefa dotyczące tego problemu odmowy to najsłabsze dane, jakie publikuje. Na CLINC150 z obsługą przypadków poza zakresem — czyli wykrywaniem intencji, w którym jedną z prawidłowych odpowiedzi jest „to nie należy do żadnej kategorii” — 27B osiąga 97,4 makro-F1, co jest najlepszym wynikiem w tabeli Cloudflare i powodem, by interesować się 27B zamiast jego własnego brata 9B, który na tym samym benchmarku osiąga 66,8. Trzydziestopunktowa różnica między dwoma modelami zbudowanymi według tego samego przepisu mówi, że zachowanie poza zakresem to rzecz, którą kupuje skala po treningu, i to rzecz, na której po cichu opiera się większość potoków routingu. Środkiem zaradczym, który dokumentuje Cloudflare, jest drugie pytanie w schemacie — dodaj noul pole z pytaniem, czy stan w ogóle pasuje, a następnie zastosuj próg — co działa i co jest twoim zadaniem, a nie zadaniem modelu.

To, skąd pochodzą liczby, ma większe znaczenie niż to, co mówią

Każda liczba Clef w tym artykule pochodzi od Cloudflare: z karty modelu, wpisu o premierze albo przebiegu Decision Index. Sam zestaw testów należy do Cloudflare, a ranking, który przechowuje wyniki, również należy do Cloudflare. To dostawca mierzący swój produkt na kontrolowanym przez siebie sprzęcie przeciwko rywalowi, którego API celowo naśladuje. Żadna strona trzecia nie odtworzyła niczego z tego, a ten tekst nie zamierza udawać, że jest inaczej.

Kolumna Gemma 4 12B to inny rodzaj dowodu. Własna karta dostawcy podaje MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 bez narzędzi na poziomie 77,5% oraz LiveCodeBench v6 na poziomie 72,0%. Artificial Analysis, niezależny tracker, indeksuje konfigurację rozumowania na poziomie Intelligence Index 14,18, z podanymi 0,10 USD / 0,30 USD za milion tokenów i zmierzoną medianą prędkości generowania około 113 tokenów na sekundę — a jego własna strona zauważa, że te wartości zależą od obciążenia i sprzętu.

Uczciwa interpretacja jest taka, że tych dwóch kolumn w ogóle nie można porównywać. Jedna to prowadzony przez dostawcę zestaw testów jakości decyzji; druga to mieszanka benchmarków dostawcy i niezależnej oceny modelu ogólnego. Przytaczanie 97,4 obok 77,2 tak, jakby były kolumnami tej samej tabeli, byłoby najbardziej mylącą rzeczą, jaką ta strona mogłaby zrobić.

Opóźnienie to jedyne miejsce, w którym te dwa można przynajmniej omawiać w tych samych jednostkach, i nawet tam zastrzeżenia się piętrzą. Cloudflare podaje dla Clef medianę 209,3 ms i p95 na poziomie 238,6 ms, zmierzone na własnej infrastrukturze. Artificial Analysis mierzy czas do pierwszego fragmentu modelu 12B na około 2,4 sekundy w konfiguracji rozumowania, która obejmuje budżet myślenia, którego model decyzyjny nie ma. Nieautoregresyjny przebieg w 209 ms w zestawieniu z 2,4-sekundowym startem generowania to prawdziwa różnica architektoniczna — jeden przebieg w przód kontra pętla dekodowania — i jest to najsilniejszy argument, jaki Clef ma za tym, by znaleźć się na gorącej ścieżce. W wariancie 27B jest to także model, który potrzebuje sprzętu klasy H200, aby osiągnąć ten wynik, a Cloudflare pobiera 0,24 USD za milion tokenów wejściowych, aby uruchamiać go dla Ciebie.

A headless capture of the google/gemma-4-12B-it model card on Hugging Face, showing the model title, the Any-to-Any and Transformers and Safetensors tags, the gemma4_unified image-text-to-text architecture line, the Apache 2.0 licence line credited to Google DeepMind, and the note that the card covers the Gemma 4 12B Unified model.

Co tak naprawdę daje ci 64K kontekstu

Kontekst to miejsce, w którym to porównanie staje się praktyczne i w którym generalista wygrywa na papierze znaczną przewagą.

• Clef — 65 536 tokenów, zgodnie ze stroną modelu Workers AI i wpisem zapowiadającym premierę; dołączony pomocnik kodowania domyślnie ustawia max_length=16,384, co jest wartością domyślną, a nie górnym limitem, ale to właśnie tę wartość domyślną otrzymasz, jeśli użyjesz loadera w postaci dostarczonej.

• Gemma 4 12B — 256 000 tokenów zgodnie z kartą producenta, z uwagą o oknie przesuwnym wynoszącym 1024 tokeny, aby ograniczyć koszty długiego kontekstu.

• Obrazy — Clef ocenia obrazy i klatki wideo łącznie ze stanem tekstowym poprzez dziedziczony koder wizyjny. Gemma 4 12B przyjmuje tekst, obraz, wideo i dźwięk przez swoją ścieżkę bez kodera.

• Języki — karta Clef nie zawiera żadnych twierdzeń o wielojęzyczności; Gemma 4 12B jest udokumentowana w ponad 140 językach.

W przypadku zgłoszenia, faktury lub wyrenderowanego zrzutu ekranu 64K to dużo, a różnica ma charakter akademicki. W przypadku 200-stronicowej umowy, którą chcesz sklasyfikować pole po polu, to jest cały spór: model ogólnego przeznaczenia może pomieścić dokument, a model decyzyjny nie. Odpowiedzią Clef na to jest chunking, a dzielenie dokumentu na fragmenty, zanim podejmiesz o nim decyzję, oznacza, że podjąłeś już decyzję, którą miał podjąć model. To realne ograniczenie i zasługuje na to, by je tak nazwać.

Ile faktycznie byś zapłacił i gdzie

Żaden z tych modeli nie znajduje się w naszym katalogu, więc kwestia ceny rozbija się na trzy możliwości.

• Clef — 0,24 USD za milion tokenów wejściowych w Cloudflare Workers AI lub hostowany samodzielnie z wag Apache-2.0; opóźnienie opublikowane przez Cloudflare zostało zmierzone na pojedynczym H200 z torch 2.11 i transformers 5.10.2, a społecznościowe kwantyzacje, które pojawiły się w ciągu dwóch dni, sugerują, że można zmniejszyć jego rozmiar kosztem pewnej utraty dokładności, którego nikt nie zmierzył.

• Gemma 4 12B — brak tu jakiejkolwiek hostowanej ścieżki. Pobierasz około 24 GB wag BF16 i hostujesz je samodzielnie albo sięgasz po platformę zewnętrzną. Nie istnieje cena za token, którą moglibyśmy podać.

• Trasowany zastępnik — Gemma 4 26B A4B, mieszanka ekspertów z łączną liczbą 25,2 mld parametrów i 3,8 mld parametrów aktywnych, w OrcaRouter kosztuje 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion tokenów wyjściowych, z kontekstem 262 144 tokenów. Gemma 4 31B, multimodalny bliźniak typu dense z konfigurowalnym trybem myślenia i natywnym wywoływaniem funkcji, kosztuje 0,13 USD i 0,38 USD. Oba są dostępne na jednym kluczu z ceną katalogową dostawcy przekazywaną bez narzutu za token i automatycznym przełączaniem awaryjnym między dostawcami.

Ta ostatnia linia to szczera wersja naszego udziału w tym porównaniu. Jeśli potrzebujesz generalisty, który przeczyta długi dokument i napisze zdanie, tania droga do niego to rozmiar Gemma 4, który faktycznie obsługujemy, a kosztuje mniej za milion tokenów niż samodzielne hostowanie modelu 12B na wynajętych GPU. Jeśli potrzebujesz ograniczonej decyzji w ścieżce krytycznej, mediana 209 ms Clef to realna właściwość architektoniczna, a najbliższym jej odpowiednikiem w naszym katalogu jest Jev 1.13 od TypeSafe — model, który Cloudflare porównywał w benchmarkach i od którego skopiował format transmisji — w cenie 0,042 USD za milion tokenów wejściowych przy kontekście 65 536 tokenów, obsługiwany przez ten sam POST /v1/systemonekształt. Ponieważ oba są kompatybilne na poziomie API za cienkim adapterem, wypróbowanie Clef przeciwko obecnemu rozwiązaniu jest eksperymentem, a nie migracją, a eksperyment pozostaje tani, gdy obie strony są osiągalne przez jeden punkt końcowy.

A headless capture of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the Gemma 4 31B title, the import date, a p50 TTFT latency figure, and the code-sample and benchmark navigation tabs.

Decyzja, wyrażona jako decyzja

Wybierz Clef, gdy odpowiedzi są wyliczalne, stan mieści się w 64K, decyzja znajduje się na ścieżce wrażliwej na opóźnienia, a ty jesteś gotów samodzielnie wziąć odpowiedzialność za klasę resztkową. Wynik 97,4 modelu 27B w wykrywaniu intencji spoza zakresu to powód, dla którego zapłaciłbyś za niego zamiast za model 9B z tej samej rodziny, a jego stały kształt wyjścia czyni ten komponent audytowalnym bez parsera.

Wybierz Gemma 4 12B, gdy dane wejściowe są długie, gdy modalność to audio lub wideo, gdy odpowiedź musi być prozą albo gdy kategorie nie są jeszcze znane — ponieważ „posegreguj ten stos na jakiekolwiek sensowne grupy” to prośba, której model decyzyjny nie może przyjąć, a nie taka, z którą radzi sobie źle. To generalista, za którym stoi niezależna ewaluacja, a w przypadku pracy otwartej jest to warte więcej niż tabela dostawcy.

I podchodź sceptycznie do obu zestawów liczb z powodu, który ten artykuł wciąż powtarza: Cloudflare nie zostało niezależnie odtworzone na niczym, a ta karta to własna tabela benchmarków dostawcy. Jedyna naprawdę interesująca liczba w tej parze — czy głowica schematu 27B rzeczywiście utrzymuje swój wynik 97,4 dla przypadków spoza zakresu na danych, na których nie była trenowana — to dokładnie ta liczba, której nie może rozstrzygnąć żaden z dostawców, a mogłaby to zrobić strona trzecia.