Eine generierte Titelkarte mit der Aufschrift „Clef“, dem Untertitel „Cloudflares Entscheidungsmodelle, die nie ein Token schreiben“, mit zwei Chips mit der Aufschrift „Gewichte 30. Sept. 2026“ und „Blog 1. Okt. 2026“. Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Engineering & Research

Clef kopiert Jevs API absichtlich – und das ist der interessante Teil

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Clef ist ein multimodales Modell mit 27 Milliarden Parametern von Cloudflare, das typisierte Fragen beantwortet und sonst nichts. Man übergibt ihm einen Zustand — Text, JSON, ein Bild, ein Video-Frame — plus ein Schema mit bis zu 64 benannten Fragen, und es liefert in einem einzigen Vorwärtsdurchlauf eine Wahrscheinlichkeit für jede zulässige Option zurück. Kein generierter Text, kein Parser, keine Decodierschleife. Was Cloudflare/clef lesenswert macht, ist nicht jenes Design, das es übernommen hat, sondern das Wire-Format, das es gewählt hat: Cloudflare entwickelte Clef so, dass es den Request- und Response-Body von Jev System One, dem Entscheidungsmodell, das TypeSafe zuerst ausgeliefert hat, bereitgestellt unter demselben POST /v1/systemone-Pfad. Interoperabilität ist hier das gesamte kommerzielle Argument. Wenn Ihre Pipeline einem Entscheidungsmodell bereits Fragen in dieser Form stellt, ist Clef eine URL-Änderung und ein Modell-String, keine Migration.

Es ist ungewöhnlich, dass ein Release-Post so etwas vergräbt, und Cloudflare vergräbt es nicht – die Model Card stellt unmissverständlich fest, dass die API „vollständig kompatibel mit Jev und SystemOne“ ist, und der Blog beginnt damit, TypeSafe dafür zu würdigen, die Kategorie etabliert zu haben, bevor Clef als Version der zweiten Generation eines internen Experiments positioniert wird. Die ehrliche Lesart dieser Veröffentlichung hat also drei Teile: was die Kompatibilitätsentscheidung bringt, was Cloudflares eigene Zahlen darüber sagen, wo Clef gewinnt und verliert, und was unbestätigt bleibt, weil jede Zahl in dieser Tabelle vom Anbieter stammt, der das Modell ausliefert.

Die Kategorie kam von woanders her

Cloudflares Beitrag ist offen in Bezug auf die Herkunft. Die Idee eines Modells, das statt Prosa begrenzte strukturierte Ausgaben zurückgibt, wird TypeSafe's Jev System One zugeschrieben. Cloudflares eigener Einstieg war eine frühere Demo, die ein Diffusionsmodell dazu brachte, deterministische Wahrscheinlichkeiten auszugeben, indem sie logprobs offenlegte, plus Community-Arbeit von Matt Mastracci, damit die Inferenz-Engine dieses Muster verarbeiten konnte. Clef baut auf diesem Konzept auf – mit einem anderen Backbone, einem eigens entwickelten Scoring-Head und – dem kommerziell entscheidenden Teil – einem Request-Body, der dem des Platzhirsches entspricht.

Wenn ein Anbieter sowohl das Wire-Format eines Konkurrenten kopiert als sich auch am Index des Konkurrenten misst, ist die Kompatibilität keine Fußnote zum Modell, sondern die Produktstrategie. Ein Entscheidungsmodell hinter einem bestehenden Endpunkt auszutauschen ist der billigstmögliche Weg, einen neuen Marktteilnehmer zu testen, und das billigstmögliche Experiment für ein Team, das bereits eines davon verdrahtet hat.

Was tatsächlich ausgeliefert wurde und was es kostet

• Parameter — 27B, erstellt durch Einfrieren von Qwen3.8-27B samt seinem Vision-Encoder und Training eines gemeinsamen Schema-Heads plus Rang-256-Low-Rank-Adaptern obendrauf.

• Geschwistermodell — Clef-Flash, dasselbe Rezept mit 9B von Qwen3.5-9B. Separater Artikel, separate Abwägungen.

• Kontext — 65.536 Token, laut der Modellseite von Workers AI und dem Blogbeitrag. Der mitgelieferte Encoding-Helfer verwendet standardmäßig max_length=16,384, ein Standardwert statt einer Obergrenze, aber der Standardwert, den man erhält, wenn man den Loader wie ausgeliefert verwendet.

• Fragetypen — noul (Wahr/Falsch, gibt die Wahrscheinlichkeit für Wahr zurück), choice (2 bis 26 benannte Optionen), score (2 bis 26 geordnete Stufen). Ein bis 64 Fragen pro Anfrage.

• Preis — 0,24 $ pro Million Eingabe-Tokens bei Cloudflares Workers AI oder selbst gehostet aus Apache-2.0-Gewichten, die über zwölf Shards hinweg rund 55 GB umfassen.

• Lizenz — Apache 2.0, in Anlehnung an den Qwen3.8-27B-Basis-Checkpoint.

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Wo es gewinnt und wo nicht

Cloudflares Decision Index-Lauf ist die Quelle für alles in diesem Abschnitt, und die Rangliste, die ihn hostet, gehört Cloudflare. Nichts des Folgenden wurde unabhängig reproduziert. Lesen Sie es als das Best-Case-Szenario eines Anbieters und beachten Sie, wie unausgewogen es ist.

Die Siege ballen sich dort, wo ein hausintern trainierter Klassifikator gewinnen sollte. Clef erreicht bei BANKING77 Intent-Macro-F1 94,2 gegenüber Jevs 79,7 und bei CLINC150 mit Out-of-Scope-Behandlung 97,4 gegenüber 89,3 – eine Dreißig-Punkte-Lücke, die die entscheidungsrelevanteste Zelle in der Tabelle ist, denn die Klassifizierung zu verweigern ist die schwierige Hälfte des Routings. Außerdem erreicht es CRUXEval mit 86,7, CLadder mit 94,0 und den Haushaltsgeräte-Simulator mit 83,0.

Die Verluste sind ebenso real und gehören in denselben Absatz. Bei Allgemeinwissen und schwierigem Schlussfolgern gewinnt der ältere Jev klar: GPQA Diamond 78,3 zu 48,0, MMLU-Pro 82,7 zu 65,9, BBH 92,9 zu 73,7. Das sind die drei größten Unterschiede in der Tabelle, und sie weisen alle in dieselbe Richtung. Clef ist zudem nicht das beste Modell in seinem eigenen Vergleich auf dem PhishNChips-Datensatz aus dem Sicherheitsbereich, wo es bei 79,6 landet und ein konkurrierender Eintrag höher abschneidet.

Bei den vier End-to-End-Workflow-Evaluierungen, die aus TypeSafes eigenem öffentlichen Eval-Set stammen und gegen Konsens-Labels bewertet wurden, liegen die beiden so dicht beieinander, dass es ein Münzwurf ist. Clef gewinnt die Rechnungsverarbeitung bei exakten Aktionen mit 64,7 zu 61,8 und den Sicherheitsvorfall-Datensatz mit 62,9 zu 61,7; Jev gewinnt die Agent-Trace-Observability mit 71,6 gegen 68,5; Kundenservice ist ein 76,3-zu-76,0-Unentschieden, das bei diesem Abstand nichts bedeutet.

Die Latenz ist der Punkt, an dem die Kluft strukturell und nicht marginal ist. Cloudflare meldet für Clef einen Median von 209,3 ms und einen p95-Wert von 238,6 ms, gegenüber 524,1 und 536,0 für Jev. Diese Reihenfolge ergibt sich aus dem nicht-autoregressiven Design und nicht aus den Eigenheiten eines Benchmarks, weshalb es die Zahl ist, die einen Kontakt mit einem echten Deployment am ehesten überstehen dürfte. Die absoluten Millisekunden wurden auf Cloudflares eigener Hardware gemessen und besagen für sich genommen wenig.

Der überzeugendste Datenpunkt in der Veröffentlichung ist keine Benchmark-Zeile. Cloudflare sagt, sein Threat-Intelligence-Team habe Clef eine Domain zusammen mit seinem Browser-Rendering-Dienst übergeben und in 2,2 Sekunden eine Kategorie-Einstufung erhalten – gegenüber 4,7 Sekunden für sein eigenes schnellstes allgemeines LLM im selben Workflow, wobei mehr Klassifizierungen zurückgegeben wurden. Interne Anekdote, keine Studie – aber es ist die Art von Geschichte, die erklärt, warum überhaupt jemand das bauen würde, anstatt ein allgemeines Modell zu prompten.

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

Zwei Dinge, die Ihnen die API-Referenz verrät, und eines, das sie nicht verrät.

Die dokumentierten Fallstricke sind klein und es lohnt sich, sie zu lesen, bevor Sie irgendetwas portieren. Das Konfidenz-Feld misst, wie konzentriert die Wahrscheinlichkeiten sind, nicht die Wahrscheinlichkeit, dass die Antwort richtig ist — ein gut kalibriertes Modell kann eine richtige Antwort mit niedriger Konfidenz und eine falsche mit hoher Konfidenz zurückgeben. Und wenn zwei Optionen gleichauf liegen, folgt die Antwort der Optionsreihenfolge des Modells, also setzen Sie Ihre bevorzugte Option an die erste Stelle. Wer einen prompt-basierten Klassifikator portiert, ohne diese beiden Sätze zu lesen, wird seine eigenen Protokolle falsch interpretieren.

Die größere Einschränkung ist nirgends dokumentiert, weil sie struktureller Natur ist. Clef hat überhaupt keinen Pfad zur Textgenerierung, was bedeutet, dass es keine Antwort entwerfen, keinen Thread zusammenfassen, kein Tool aufrufen oder ein Gespräch führen kann, und es wird keine Kategorie erfinden, die Sie nicht deklariert haben. Das gesamte Design geht davon aus, dass Sie die zulässigen Antworten im Voraus aufzählen können. Das schließt stillschweigend eine große Klasse von Problemen aus, und keine noch so gute Benchmark-Leistung ändert daran etwas.

Was das Kompatibilitätsargument wert ist

An diesem Punkt ist das Release keine Modellprüfung mehr, sondern eine Architekturfrage. Wenn Clef die Request-Form von Jev spricht, dann ist das Modell hinter Ihrem Decision-Endpoint ein Konfigurationswert, und der sinnvolle Weg, es einzuführen, ist parallel statt als Ersatz – lassen Sie beide gegen Ihren eigenen Traffic laufen, behalten Sie dasjenige, das auf Ihren Daten besser abschneidet, und sorgen Sie dafür, dass der Wechsel günstig bleibt.

Clef selbst steht nicht auf unserer Routenliste; der OrcaRouter-Katalog liefert dafür einen 404 zurück, und nichts hier sollte als Verfügbarkeitsaussage unsererseits gelesen werden. Was wir führen, ist der Platzhirsch, den zu verdrängen es gebaut wurde. TypeSafe's Jev 1.13 ist eine gelistete Route zu 0,042 $ pro Million Eingabe-Tokens bei einem Kontext von 65.536 Token, bereitgestellt über denselben POST /v1/systemone-Body, sodass ein A/B-Test zwischen den beiden eine Model-String-Änderung ist und keine Neuimplementierung. Beide hinter einem Schlüssel zu haben – über 200 Modelle, Anbieterlistenpreis ohne Aufschlag pro Token durchgereicht, automatisches Failover über Anbieter hinweg – ist das, was diesen Test auch nach der Woche noch am Laufen hält, in der jemand beschließt, sich dafür zu interessieren, statt dass er zu einem veralteten Kommentar in einer Konfigurationsdatei verkommt. Das allgemeine Modell, das man bereithält, um auf das zu reagieren, was das Entscheidungsmodell schlussfolgert, ist über denselben Schlüssel erreichbar statt über einen zweiten Vertrag.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

Was würde diese Lesart ändern?

Jemand außerhalb von Cloudflare muss den Decision Index erneut ausführen. Die Suite ist öffentlich, und die Evals werden als reproduzierbar beschrieben, also ist ein Drittanbieter-Durchlauf der Unterschied zwischen der Tabelle eines Anbieters und einer Tatsache – und die Zellen, die am meisten zählen, sind diejenigen, die in entgegengesetzte Richtungen zeigen. Eine 97,4 bei der Out-of-Scope-Intent-Erkennung neben einer 48,0 bei GPQA Diamond ist keine gleichmäßige Fähigkeitskurve; sie beschreibt ein Modell, das sehr gut bei den Klassifikationsformen in seiner Trainingsverteilung ist und viel schwächer beim Reasoning, das es nicht gesehen hat. Wenn sich das unter unabhängigen Tests bestätigt, ist es die operativ wichtigste Tatsache über Clef, und sie steht nicht in den Highlights.

Der Produktionsverkehr muss ebenfalls wie die Latenztabelle aussehen. Ein auf einem H200 gemessener Median von 209 ms sagt nichts über p95 unter Nebenläufigkeit aus, und das ganze Verkaufsargument des Designs ist, dass es in einem Hot Path sitzt.

Und die Fine-Tuning-Plattform muss etwas liefern. Cloudflares Beitrag beschreibt eine RL-Schleife – AI Gateway, um einen Datensatz aus dem eigenen Traffic zu erfassen, Workers AI, um Rollouts zu generieren, Containers als Scoring-Sandbox, Trainer zum Aktualisieren der Gewichte und dann erneutes Deployment auf Workers AI – im selben Beitrag, der die Modelle ankündigt, ohne dass ein Kundenergebnis beigefügt ist. Ein feinabgestimmtes Clef, das das Basismodell bei einer Aufgabe übertrifft, für die das Basismodell nie trainiert wurde, wäre weitaus stärkerer Beweis für die Kategorie als jede Zeile in der Tabelle.

Bis dahin lautet die faire Zusammenfassung so: Cloudflare hat ein echtes, permissiv lizenziertes, wirklich schnelles Entscheidungsmodell veröffentlicht und es mühelos mit dem austauschbar gemacht, das zuerst kam. Das ist eine bessere Geschichte, als die meisten offenen Veröffentlichungen bieten, und sie ist bislang noch vollständig die eigene Darstellung des Anbieters.