
Clef celowo kopiuje API Jeva — i to jest właśnie ta interesująca część
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Clef to model multimodalny Cloudflare o 27 miliardach parametrów, który odpowiada na wpisane pytania i nic więcej. Przekazujesz mu stan — tekst, JSON, obraz, klatkę wideo — oraz schemat zawierający do 64 nazwanych pytań, a on zwraca prawdopodobieństwo dla każdej dozwolonej opcji w jednym przebiegu w przód. Żadnego generowanego tekstu, parsera ani pętli dekodowania. To, co czyni Cloudflare/clef wartym lektury, to nie ten projekt, który został zapożyczony, lecz wybrany format przesyłania: Cloudflare zbudował Clef tak, aby mówił treścią żądania i odpowiedzi Jev System One, modelu decyzyjnego, który TypeSafe wypuścił pierwszy, obsługiwanego pod tą samą ścieżką POST /v1/systemone. Interoperacyjność jest tu całym argumentem komercyjnym. Jeśli twój pipeline już zadaje modelowi decyzyjnemu pytania w tym kształcie, Clef to zmiana adresu URL i ciągu modelu, a nie migracja.
To nietypowe, żeby post o wydaniu coś takiego przemilczał, a Cloudflare tego nie przemilcza — karta modelu stwierdza wprost, że API jest „w pełni kompatybilne z Jev i SystemOne”, a blog zaczyna się od przypisania TypeSafe zasługi za wprowadzenie tej kategorii na mapę, po czym pozycjonuje Clef jako drugą generację wewnętrznego eksperymentu. Zatem uczciwa interpretacja tego wydania składa się z trzech części: co zyskujesz dzięki decyzji o kompatybilności, co mówią własne liczby Cloudflare o tym, gdzie Clef wygrywa, a gdzie przegrywa, i co pozostaje niezweryfikowane, ponieważ każda liczba w tej tabeli została wyprodukowana przez dostawcę, który udostępnia ten model.
Kategoria pochodzi z innego miejsca
Wpis Cloudflare'a szczerze przedstawia rodowód. Pomysł modelu, który zwraca ograniczone, ustrukturyzowane wyjścia zamiast prozy, przypisuje się Jev System One firmy TypeSafe. Sama Cloudflare weszła w to przez wcześniejsze demo, które nagięło model dyfuzyjny do emitowania deterministycznych prawdopodobieństw poprzez udostępnianie logprobs, a także przez pracę społecznościową Matta Mastracciego nad przystosowaniem silnika wnioskowania do obsługi tego wzorca. Clef rozwija tę koncepcję, opierając się na innym backbone'ie, specjalnie zaprojektowanej głowie scoringowej oraz — co ma znaczenie komercyjnie — ciele żądania zgodnym z ciałem żądania obecnego dostawcy.
Gdy dostawca jednocześnie kopiuje format transmisji rywala i porównuje się z jego indeksem, kompatybilność nie jest przypisem do modelu — to strategia produktowa. Podmiana modelu decyzyjnego za istniejącym punktem końcowym to najtańszy możliwy sposób, aby nowy gracz został wypróbowany, i najtańszy możliwy eksperyment dla zespołu, który ma już taki punkt końcowy podłączony.
Co faktycznie zostało wydane, i ile to kosztuje
• Parametry — 27B, zbudowany przez zamrożenie Qwen3.8-27B wraz z jego enkoderem wizyjnym oraz wytrenowanie wspólnej głowy schematu i adapterów niskorzędowych rzędu 256 na wierzchu.
• Model siostrzany — Clef-Flash, ten sam przepis w wersji 9B od Qwen3.5-9B. Osobny artykuł, osobne kompromisy.
• Kontekst — 65 536 tokenów, zgodnie ze stroną modelu Workers AI i wpisem na blogu. Dołączony pomocnik kodowania domyślnie przyjmuje max_length=16 384, co jest wartością domyślną, a nie górnym limitem, ale właśnie tą wartością domyślną, którą otrzymasz, jeśli użyjesz loadera w dostarczonej postaci.
• Typy pytań — noul (prawda/fałsz, zwracający prawdopodobieństwo prawdy), choice (od 2 do 26 nazwanych opcji), score (od 2 do 26 uporządkowanych poziomów). Od jednego do 64 pytań na żądanie.
• Cena — 0,24 USD za milion tokenów wejściowych w Cloudflare Workers AI lub hostowanie samodzielne na podstawie wag Apache-2.0, które zajmują około 55 GB w dwunastu shardach.
• Licencja — Apache 2.0, zgodnie z bazowym checkpointem Qwen3.8-27B.

Gdzie wygrywa, a gdzie nie
Przebieg Decision Index Cloudflare jest źródłem wszystkiego w tej sekcji, a ranking, który go hostuje, należy do Cloudflare. Nic poniżej nie zostało niezależnie odtworzone. Czytaj to jako najlepszy scenariusz dostawcy i zwróć uwagę, jak nierówny jest.
Klaster zwycięstw, w którym powinien wygrywać klasyfikator trenowany wewnętrznie. Clef osiąga macro-F1 dla intencji w BANKING77 na poziomie 94,2 wobec 79,7 Jev’a oraz CLINC150 z obsługą przypadków spoza zakresu na poziomie 97,4 wobec 89,3 — trzydziestopunktowa różnica, która jest najbardziej istotną decyzyjnie komórką w tabeli, ponieważ odmowa klasyfikacji to trudniejsza połowa routingu. Osiąga także 86,7 w CRUXEval, 94,0 w CLadder i 83,0 w symulatorze AGD.
Straty są równie realne i należą do tego samego akapitu. W zakresie wiedzy ogólnej i trudnego rozumowania starszy Jev wygrywa bezapelacyjnie: GPQA Diamond 78,3 do 48,0, MMLU-Pro 82,7 do 65,9, BBH 92,9 do 73,7. To trzy największe różnice w tabeli i wszystkie wskazują w tym samym kierunku. Clef również nie jest najlepszym modelem w swoim własnym porównaniu na zbiorze PhishNChips z domeny bezpieczeństwa, gdzie osiąga 79,6, a konkurencyjny wpis uzyskuje wyższy wynik.
W czterech kompleksowych ewaluacjach przepływów pracy end-to-end, zaczerpniętych z własnego publicznego zestawu ewaluacyjnego TypeSafe i ocenianych względem etykiet konsensusu, oba rozwiązania są tak blisko siebie, że to rzut monetą. Clef wygrywa przetwarzanie faktur pod względem dokładnych działań wynikiem 64,7 do 61,8, a zestaw incydentów bezpieczeństwa 62,9 do 61,7; Jev wygrywa obserwowalność śladów agentów 71,6 przeciwko 68,5; obsługa klienta to remis 76,3 do 76,0, który przy takiej różnicy nic nie znaczy.
Opóźnienie to obszar, w którym różnica jest strukturalna, a nie marginalna. Cloudflare podaje medianę 209,3 ms i p95 238,6 ms dla Clef, wobec 524,1 i 536,0 dla Jev. Taki porządek wynika z nieautoregresyjnej konstrukcji, a nie z dziwactw benchmarku, dlatego właśnie ta liczba najprawdopodobniej przetrwa zetknięcie z rzeczywistym wdrożeniem. Bezwzględne wartości w milisekundach zmierzono na własnym sprzęcie Cloudflare i same w sobie niewiele znaczą.
Najbardziej przekonującym punktem danych w komunikacie nie jest wiersz z benchmarku. Cloudflare twierdzi, że jego zespół ds. wywiadu zagrożeń przekazał domenę do Clef wraz ze swoją usługą renderowania w przeglądarce i otrzymał werdykt kategorii w 2,2 sekundy, w porównaniu z 4,7 sekundy dla własnego najszybszego ogólnego LLM w tym samym procesie, przy czym zwrócono więcej klasyfikacji. Wewnętrzna anegdota, nie badanie — ale to właśnie tego typu historia wyjaśnia, dlaczego ktokolwiek miałby to zbudować, zamiast wysłać prompt do ogólnego modelu.

Dwie rzeczy, które mówi ci dokumentacja API, i jedna, której nie.
Udokumentowane pułapki są niewielkie i warto je przeczytać, zanim cokolwiek przeniesiesz. Pewność to pole, które mierzy, jak skupione są prawdopodobieństwa, a nie prawdopodobieństwo, że odpowiedź jest poprawna — dobrze skalibrowany model może zwrócić poprawną odpowiedź o niskiej pewności i błędną o wysokiej pewności. A gdy dwie opcje remisują, odpowiedź idzie za kolejnością opcji modelu, więc umieść swoją preferowaną opcję jako pierwszą. Każdy, kto przenosi klasyfikator oparty na promptach, nie przeczytawszy tych dwóch zdań, błędnie odczyta własne logi.
Większe ograniczenie nie jest nigdzie udokumentowane, ponieważ ma charakter strukturalny. Clef nie ma w ogóle ścieżki generowania tekstu, co oznacza, że nie może przygotować odpowiedzi, streścić wątku, wywołać narzędzia ani prowadzić rozmowy, i nie wymyśli kategorii, której nie zadeklarowałeś. Cała konstrukcja zakłada, że można z góry wyliczyć dozwolone odpowiedzi. To milcząco wyklucza dużą klasę problemów i nie zmienia tego żadna wydajność w benchmarkach.
Ile jest wart argument o kompatybilności
Tu kończy się przegląd modelu, a zaczyna pytanie architektoniczne. Jeśli Clef obsługuje format żądań Jev'a, to model stojący za Twoim punktem końcowym decyzyjnym jest wartością konfiguracyjną, a rozsądnym sposobem jego przyjęcia jest działanie obok siebie, a nie zastąpienie — uruchom oba na własnym ruchu, zachowaj ten, który wypada lepiej na Twoich danych, i spraw, by przełączenie pozostało tanie.
Sam Clef nie znajduje się na naszej liście tras; katalog OrcaRouter zwraca dla niego 404, a niczego tutaj nie należy odczytywać jako naszego zapewnienia o dostępności. To, co mamy w ofercie, to dotychczasowy model, który Clef miał zastąpić. Jev 1.13 od TypeSafe to ujęta w wykazie trasa w cenie 0,042 USD za milion tokenów wejściowych przy kontekście 65 536 tokenów, obsługiwana przez to samo POST /v1/systemone ciało żądania, więc test A/B między nimi to zmiana ciągu modelu, a nie przepisanie kodu. Posiadanie obu za jednym kluczem — ponad 200 modeli, cena katalogowa dostawcy przekazywana bez marży za token, automatyczne przełączanie awaryjne między dostawcami — sprawia, że ten test nadal działa po tygodniu, w którym ktoś postanowi się nim zainteresować, zamiast zamienić się w nieaktualny komentarz w pliku konfiguracyjnym. Model ogólnego przeznaczenia, który trzymasz pod ręką, aby działać na podstawie tego, co ustali model decyzyjny, jest osiągalny z tego samego klucza, a nie przez drugą umowę.

Co zmieniłoby ten odczyt?
Ktoś spoza Cloudflare musi ponownie uruchomić Decision Index. Zestaw testów jest publiczny, a ewaluacje opisuje się jako odtwarzalne, więc uruchomienie przez stronę trzecią to różnica między tabelą dostawcy a faktem — a komórki, które mają największe znaczenie, to te wskazujące w przeciwnych kierunkach. Wynik 97,4 w wykrywaniu intencji poza zakresem obok 48,0 w GPQA Diamond nie jest gładką krzywą możliwości; opisuje model, który jest bardzo dobry w rozpoznawaniu kształtów klasyfikacji w swojej dystrybucji treningowej i znacznie słabszy w rozumowaniu, którego nie widział. Jeśli to się potwierdzi w niezależnym testowaniu, jest to najważniejszy operacyjnie fakt o Clef i nie ma go w najważniejszych informacjach.
Ruch produkcyjny również musi wyglądać jak tabela opóźnień. Mediana 209 ms zmierzona na jednym H200 nic nie mówi o p95 przy współbieżności, a cały atut tego projektu polega na tym, że znajduje się on na gorącej ścieżce.
A platforma dostrajania musi coś dawać. Wpis Cloudflare opisuje pętlę RL — AI Gateway do przechwytywania zbioru danych z własnego ruchu, Workers AI do generowania rolloutów, Containers jako piaskownicę do oceniania, Trainer do aktualizacji wag, a następnie ponowne wdrożenie na Workers AI — w tym samym wpisie, w którym ogłasza się modele, bez dołączonego wyniku klienta. Dostrojony Clef, który przebija model bazowy w zadaniu, na którym model bazowy nigdy nie był trenowany, byłby znacznie silniejszym dowodem dla tej kategorii niż jakikolwiek wiersz w tabeli.
Do tego czasu uczciwe podsumowanie brzmi tak: Cloudflare dostarczył prawdziwy, objęty permisywną licencją, naprawdę szybki model decyzyjny i sprawił, że można go trywialnie podmienić na ten, który pojawił się pierwszy. To lepsza historia niż w przypadku większości otwartych wydań, a wciąż, jak dotąd, jest to wyłącznie własna relacja dostawcy o samym sobie.
