Eine Titelkarte mit der Aufschrift „Clef vs Qwen3.8-27B — Ein Backbone, zwei Ausgabeverträge“, darunter zwei Karten: Clef, 27B-Entscheidungsmodell, ein Logit pro Option; und Qwen3.8-27B, dichtes 27B-VLM, Tokens und Tool-Aufrufe.
Guides & Insights

Clef vs. Qwen3.8-27B: Ein Backbone, zwei Output-Verträge

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Clef kann keinen Satz schreiben, und es ist aus einem Modell gebaut, das es kann. Cloudflare/clef ist ein multimodales Entscheidungsmodell mit 27 Milliarden Parametern: Man übergibt ihm einen Zustand und ein Schema typisierter Fragen, und es liefert für jede zulässige Option eine Wahrscheinlichkeit, ohne auch nur einen Token Prosa zu erzeugen. Das darunterliegende Backbone ist Qwen3.8-27B, ein dichtes Vision-Language-Modell mit offenen Gewichten, an Ort und Stelle eingefroren und mit einem kleinen zusätzlichen Kopf versehen. Das macht dies zu einer der wenigen Modell-gegen-Modell-Seiten, auf denen die beiden Seiten überhaupt keine Rivalen sind – sie sind ein Checkpoint und sein Derivat, teilen 55 Gigabyte Gewichte und sind sich uneinig darüber, ob die Antwort etwas ist, das man liest, oder etwas, mit dem man rechnet.

Die Gewichte für beide gingen online, bevor die Worte dazu veröffentlicht wurden. Cloudflare erstellte das Cloudflare/clef-Repository auf Hugging Face am 30. September 2026 um 21:15 UTC, unter Apache-2.0, und veröffentlichte den Ankündigungsbeitrag – „Einführung von Clef: unsere Open-Source-Entscheidungsmodelle und neue RL-Fine-Tuning-Plattform“ – am folgenden Nachmittag. Etwa achtzehn Stunden lang war ein 55-Gigabyte-Modell herunterladbar und lief auf Cloudflares eigenen Edge-GPUs, bevor sein Anbieter irgendetwas dazu sagte. Innerhalb von drei Tagen hatte es eine Ollama-Bibliotheksseite hinter Ollama 0.35.1, wo dieser Beitrag es fand, sowie NVFP4-, FP8-, EXL3-, INT8-, Q4- und Q8-Builds von einem Dutzend verschiedener Uploader.

Was sich aus dem Repository wissen lässt, ist ungewöhnlich vollständig, und es lohnt sich, das von dem zu trennen, was sich nicht wissen lässt. Wissbar: die Architektur, der Basis-Checkpoint, die Lizenz, eine lauffähige Referenzimplementierung und eine vollständige Evaluationsmatrix. Nicht wissbar: ob eine dieser Zahlen einen erneuten Lauf durch jemanden übersteht, der nicht Cloudflare ist. Jede unten Clef zugeschriebene Punktzahl stammt aus einem Lauf, den der Anbieter selbst mit einer Suite durchgeführt hat, die er hostet. Diese Asymmetrie gegenüber einem Modell, hinter dem ein Monat unabhängiger Nutzung liegt, ist das ehrliche Rückgrat dieses Vergleichs, und der Rest des Beitrags dreht sich darum, wo sie tatsächlich zubeißt.

Die beiden Repositories, Seite an Seite

Fang mit dem Download an, denn die Gleichheit ist der Punkt. Clefs Safetensors kommen auf 54,97 GB über zwölf Shards. Die des Elternmodells kommen auf 55,56 GB über achtzehn. Clef behält den Vision-Encoder von Qwen3.8-27B bei – den Prozessor, den Vision-Turm, das gesamte multimodale Frontend –, sodass nichts entfernt wurde, um es kleiner zu machen. Was Cloudflare hinzugefügt hat, ist ein gemeinsamer Schema-Head von 256 MB: vier Schichten, 1.024 breit, sechzehn Heads, ein 4.096 breites Feedforward, zwei Routing-Schichten, die die letzten Hidden States des Backbones lesen. Das Trainingsrezept ist ein eingefrorenes Backbone, dieser Head und Low-Rank-Adapter mit Rang 256, mit label-geglätteter Kreuzentropie für gültige Schema-Antworten, gepaart mit einem Brier-Verlust, um die Kalibrierung zu schärfen.

Dann die Divergenz, die vollständig darin liegt, was das Modell ausgeben darf.

• Parameter — Clef 27B, nachtrainiert aus Qwen/Qwen3.8-27B. Qwen3.8-27B 27B dense, 64 Schichten, 5.120 Hidden, 248.320-Token-Vokabular, 16 × (3 × Gated DeltaNet → FFN) verschachtelt mit Gated Attention.

• Ausgabe — Clef: ein Logit pro zulässiger Option, pro Frage softmax-normalisiert, überhaupt kein Generierungspfad. Qwen3.8-27B: Token, Tool-Aufrufe und ein standardmäßig aktiver Reasoning-Block.

• Frageformen — Clef akzeptiert 1 bis 64 typisierte Fragen pro Anfrage in drei Formen: noul (Wahrscheinlichkeit für wahr), choice (2 bis 255 benannte Optionen), score (2 bis 10 geordnete Stufen, wobei ein wahrscheinlichkeitsgewichteter Wert zurückgegeben wird, der zwischen ihnen liegen kann). Qwen3.8-27B hat keinen solchen Vertrag; man bekommt Fließtext und schreibt den Parser selbst.

• Lizenz — Apache-2.0 bei beiden, weshalb die Drittanbieter-Quantisierung an einem Wochenende über die Bühne ging.

• Die Kosten der eingefrorenen Hälfte — Clefs Head ist 256 MB groß im Vergleich zu 54,97 GB Backbone. Fast der gesamte Download ist das übergeordnete Modell. Wenn Sie Qwen3.8-27B bereits auf der Festplatte haben, laden Sie es ein zweites Mal herunter, um eine andere Meinung dazu zu bekommen, wie geantwortet werden soll.

A two-column scoreboard for Clef and Qwen3.8-27B across six dimensions: output, parameters, GPQA Diamond (48.0 vs 90.5), hosted context (65,536 vs 262,144 tokens), median latency (209.3 ms vs 1,929 ms) and list price ($0.24 per M in vs $0.33/$2.40 per M). A footer notes Clef's figures are vendor-reported and unreproduced, Qwen's GPQA is per Artificial Analysis, and latency was measured by each side on its own hardware.

Was die Neubetitelung kostet, in zwei Zahlen

Cloudflares Bewertung ist die Decision Index 0.2.1 Suite, die intern durchgeführt wird, und sie ist eine Tabelle über Entscheidungsmodelle – sechs Spalten: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B und Laya. Qwen3.8-27B hat darin keine Zeile, und Clef hat keine Zeile im Artificial Analysis Intelligence Index. Es gibt also kein gemeinsames Scoreboard, und dieser Beitrag wird keines erfinden.

Es gibt jedoch einen Benchmark, den beide Seiten durchlaufen haben, und die Lücke ist groß genug, um die entscheidungsrelevanteste Zahl im Release zu sein. Bei GPQA Diamond – naturwissenschaftliche Fragen auf Graduiertenniveau, Multiple-Choice – misst Cloudflare Clef bei 48,0. Das Parent-Modell liegt bei 90,5 in der Testumgebung von Artificial Analysis und 89,2 auf der eigenen Modellkarte des Anbieters. Das ist ein 40-Punkte-Absturz beim Allgemeinwissen, und es ist kein Geheimnis: Clef antwortet, indem es einen festen Satz vorgegebener Optionen bewertet, und Multiple-Choice-Aufgaben zum Allgemeinwissen sind ungefähr so weit von „dieses Ticket weiterleiten“ entfernt, wie dieselben Gewichte überhaupt ausgerichtet werden können. Betrachten Sie den Vergleich als Hinweis, nicht als kontrollierten Vergleich – zwei Testumgebungen, zwei Labore, weder die des Anbieters noch die des Trackers. Doch die Richtung steht außer Zweifel, und das ist der Preis des Vertrags.

Dasselbe Muster zeigt sich in den übrigen Allzweck-Zellen von Clef. MMLU-Pro 65,9, BBH 73,7, CLINC150 mit Out-of-Scope-Behandlung 97,4 für das 27B-Modell gegenüber Jevs 89,3 — Letzteres ist die seltene Zelle, in der das abgeleitete Modell das ältere Entscheidungsmodell klar schlägt, und das ist wichtig, weil die Verweigerung der Klassifizierung die schwierige Hälfte des Routings ist. Wo Clef stark ist, ist es genau dort stark, wo ein hausintern trainierter Klassifikator stark sein sollte: BANKING77-Intent-Macro-F1 bei 94,2, BFCL Case-Exact bei 98,5, API-Bank bei 91,9. Wo es schwach ist, übertrifft ein rein textbasiertes Entscheidungsmodell aus einem konkurrierenden Labor — TypeSafes Jev — es auf GPQA Diamond um dreißig Punkte, während es $0,042 pro Million Eingabe-Tokens in unserem eigenen Katalog berechnet, was eine nützliche Erinnerung daran ist, dass „27B“ kein Argument an sich ist.

Was das Parent behält, ist alles, wonach der Decision Index nicht fragt. Auf seiner eigenen Karte und in den aus AA stammenden Zeilen führt unser Katalog auf: Terminal-Bench 2.1 bei 73,0, SWE-bench Pro 61,7, LiveCodeBench v6 90,3, OSWorld-Verified 84,3, DeepSWE 1.1 bei 42,2, AA Coding 68,1 auf Rang 35 von 138 beprobten Modellen. Keines davon hat eine Clef-Zeile, weil Clef sie nicht bearbeiten kann. Es hat keinen Tool-Calling-Pfad, keine Langhorizont-Planung, keine Möglichkeit, den Patch auszugeben.

Was eine Entscheidung kostet und warum die Ausgabezeile das ganze Argument ist

Die Modellseite von Workers AI führt genau einen Stückpreis für Clef auf: 0,24 $ pro Million Input-Tokens. Es gibt keine Output-Zeile, und der Grund dafür liegt in den Antworten. Ollamas eigenes dokumentiertes Beispiel – ein Support-Ticket, das über drei Fragen geleitet wird – kommt mit "usage": {"input_tokens": 1204, "output_tokens": 3}. Drei Output-Tokens für drei Fragen. Ob Cloudflare diese drei Tokens in Rechnung stellt, ist nahezu irrelevant: Die Output-Kosten einer Entscheidung sind kein Tarif, sondern eine Anzahl von Fragen.

Vergleichen Sie das mit der Preisliste des Parent-Modells in unserem eigenen Katalog, die wie folgt lautet: $0,33 pro Million Eingabe-Tokens und $2,00 pro Million Ausgabe mit einem 262.144-Token-Zustand. Gleicher 1.204-Token-Zustand, gleiche einzelne Routing-Entscheidung:

• Clef — 1.204 Eingabe-Token bei 0,24 $ pro Million entsprechen etwa 0,00029 $ pro Entscheidung, und etwa 289 $ pro Million Entscheidungen. Die Zahl ändert sich kaum, wenn die Antwort schwieriger wird – nur, wenn der Zustand länger wird.

• Qwen3.8-27B mit deaktiviertem Denken – derselbe Zustand kostet etwa 0,00040 $ für den Input, plus ungefähr zehn Output-Tokens zu 2,40 $ pro Million. Sagen wir 0,00042 $, oder 421 $ pro Million. Clef ist etwa 1,5× günstiger, was nicht die Geschichte ist, die irgendjemand erzählt.

• Qwen3.8-27B mit eingeschaltetem Denken — was bei diesem Checkpoint die Standardeinstellung ist. Wenn das Modell 400 Token damit verbringt, darüber nachzudenken, in welche von vier Kategorien eine E-Mail zum Zurücksetzen des Passworts gehört, sind das weitere $0,00096, und die Entscheidung landet bei etwa $0,0014, oder $1.357 pro Million. Diese 400 Token sind eine Annahme, keine Messung, und der Multiplikator verschiebt sich linear damit.

Die ehrliche Version des Preisarguments ist also enger, als es zunächst aussieht. Gegen einen Generalisten, der mit ausgeschaltetem Thinking läuft, gewinnt Clef bei den Dollarkosten um etwa den Faktor eineinhalb — real, aber nicht transformativ. Gegen dasselbe Modell in seiner Standardkonfiguration ist die Lücke eine Funktion der Ausführlichkeit, und Ausführlichkeit ist genau das, was ein Sprachmodell hat und ein Scorers-over-Options-Design überhaupt nicht hat. Das ist die strukturelle Behauptung: Die Kosten von Clef sind durch die Länge des Zustands begrenzt, und die des Parent-Modells sind dadurch begrenzt, wie viel das Parent-Modell zu sagen beschließt.

Cloudflare's Workers AI model page for clef, showing a 65,536-token context window, vision support, and unit pricing of $0.24 per million input tokens with no output line.

Die einzige Zahl, die nicht nah dran ist

Cloudflare meldet eine mediane Anfragelatenz von 209,3 ms für Clef und einen p95-Wert von 238,6 ms, gemessen über die 43 Benchmarks in seinem Durchlauf, auf seinen eigenen Edge-GPUs. Niemand außerhalb von Cloudflare hat das reproduziert, und die Infrastruktur des Anbieters ist der Grund dafür, dass die Zahl so niedrig ausfällt – dieses Modell ist darauf ausgelegt, im selben Netzwerk wie der Aufrufer zu sitzen.

Für das Parent-Modell können wir mehr bieten als eine Herstellerangabe, denn es ist eine unserer Routen. Über das Sieben-Tage-Fenster, das am 2. Oktober 2026 endet, hat OrcaRouters eigener Playground Qwen3.8-27B bei einem p50 von 1.929 ms und 235,8 Ausgabe-Tokens pro Sekunde gemessen, bei 136,3 Millionen Tokens Traffic in diesem Zeitfenster. Die Tagesreihe ist der interessante Teil: p95 liegt an sechs der sieben Tage bei exakt 10.000 ms, was eher nach einer Obergrenze als nach einer Messung klingt, und der p50 schwankt je nach Tag zwischen 1.751 ms und 4.296 ms. Betrachte den Median als ungefähr das Neunfache von Clef, und behandle den Tail als nicht aussagekräftig, bis jemand eine echte Verteilung veröffentlicht.

Diese Lücke ist kein Tuning-Unterschied, und sie wird sich nicht schließen. Ein Prefill-only-Durchlauf plus ein paralleler Scoring-Kopf ist in einem einzigen Durchgang fertig; ein autoregressives Modell ist fertig, wenn es nichts mehr zu sagen hat. Die absoluten Herstellerzahlen für Clef verdienen den üblichen Abschlag, aber die Rangfolge ist eine Eigenschaft der Architektur, nicht von Cloudflares Hardware.

Der Kontext wird für eine der Nachrichten zitiert. Die zu übersetzende Nachricht ist: „Der Kontext wird für eine der Nachrichten zitiert.“

Beide Modelle akzeptieren Text, JSON, Bilder und Video. Die Fenster sind nicht gleich, und eines davon wird je nachdem, wo man nachliest, uneinheitlich angegeben.

• Clef, gehostet — 65.536 Token, laut der Modellseite von Workers AI und dem Ankündigungs-Post. Das ist die Zahl, an die ein API-Aufrufer gebunden ist, und Cloudflares eigene Darstellung ist vergleichend: doppelt so viel Zustand, wie Jevs 32K-Fenster fasst.

• Clef, auf der Festplatte — die veröffentlichte config.json deklariert max_position_embeddings von 262.144, weil das eingefrorene Backbone das des Elternmodells ist und weiterhin die Positionsobergrenze des Elternmodells trägt. Der mitgelieferte encode_record-Helfer hat standardmäßig max_length=16.384, wobei max_state_tokens verfügbar ist, um den Zustand separat zu begrenzen. Keine dieser drei Zahlen ist falsch; sie beantworten unterschiedliche Fragen, und eine Laufzeitauflistung, die 256K bewirbt, liest die Konfiguration, nicht den Endpunkt.

• Qwen3.8-27B — 262.144 nativ, mit der passenden Serving-Konfiguration auf 1.000.000 erweiterbar, laut Hersteller-Karte und unserer Katalogzeile. Mindestens das Vierfache des gehosteten Clef-Fensters.

Die praktische Konsequenz ist kleiner, als das Verhältnis vermuten lässt. Clef konsumiert einen Zustand – ein Ticket, eine Rechnung, einen Screenshot – kein Gespräch, und einer seiner Verkaufsvorteile ist, dass man Clef eine große, flach zusammengefasste Payload übergeben und vierundsechzig Fragen dazu stellen kann, ohne die Payload pro Frage erneut zu bezahlen. Der Parent braucht das Fenster, weil er den Verlauf, die Tool-Ergebnisse und sein eigenes Reasoning vorhalten muss. Unterschiedliche Anforderungen, unterschiedliche Obergrenzen.

Beide sehen dieselben Pixel.

Der Vision-Encoder wird übernommen, es handelt sich also nicht um den Fall, dass ein Modell multimodal ist und das andere nicht. Clef akzeptiert bis zu vier Bilder pro Anfrage – base64-kodiertes PNG, JPEG oder WebP –, die von jeder Frage in der Payload gemeinsam genutzt werden, und Videoframes lassen sich als Frame-Arrays hinzufügen; das Beleg-Beispiel in der Karte stellt eine Ja/Nein-Frage dazu, ob eine Summe lesbar ist, was das Design im Kleinen zeigt. Qwen3.8-27B ist ein natives Vision-Language-Modell mit OmniDocBench 1.5 bei 91.1, RealWorldQA bei 85.9 und CharXiv bei 78.8 auf der Modellkarte des Anbieters.

Was sich unterscheidet, ist das, was Sie zurückbekommen. Clef liefert Ihnen eine Feld-für-Feld-Entscheidung mit zugehöriger Wahrscheinlichkeit – eine typisierte Antwort zu einem Dokument. Das übergeordnete System liefert Ihnen eine Beschreibung des Dokuments, die Sie anschließend parsen. Für eine große Klasse von Dokumentenarbeit – dieses Formular prüfen, diese Klausel finden, liegt diese Summe über dem Schwellenwert – ist die typisierte Antwort die gesamte Aufgabe, und die Beschreibung ist Overhead, den Sie bezahlen und dann wegwerfen.

Wo die Grenze tatsächlich verläuft

• Nutzen Sie Clef — die Antworten sind im Voraus aufzählbar und Sie möchten lieber keinen Parser schreiben. Routing, Triage, Gating, Richtlinienprüfungen, Extraktion von Dokumentfeldern. Geschlossene Mengen, 2 bis 255 Optionen pro Frage, bis zu 64 Fragen werden gemeinsam bewertet.

• Nimm Clef — die Entscheidung fällt in einem Hot Path, und 209 ms gegenüber 1.929 ms verändern, was die Pipeline leisten kann. Das ist der stärkste einzelne Grund zu wechseln, und es ist ein Latenz-, kein Genauigkeitsgrund.

• Nimm Clef — du willst Determinismus. Eine Option, die du nicht deklariert hast, kann nicht wieder auftauchen, denn es gibt keinen Generierungsschritt, der sie hervorbringen könnte.

• Behalte Qwen3.8-27B — die Antwort ist keine Auswahl aus einer Liste: zusammenfassen, entwerfen, ein neuartiges Problem durchdenken, Code schreiben, Werkzeuge über einen langen Horizont steuern. Clef kann nichts davon, und es wird dir das nicht sagen.

• Behalte Qwen3.8-27B — du brauchst das Modell, damit es „keines davon“ sagt. Ein Entscheidungsmodell bewertet die ihm vorgegebenen Optionen. Gib ihm ein Abrechnungs-/Technik-/Vertriebsschema und eine Datenschutzanfrage, und es liefert das am wenigsten schlechte dieser drei statt einer Ablehnung. Das übergeordnete Modell bringt die Frage zum Vorschein, auf die du nicht gekommen bist.

• Qwen3.8-27B behalten — für Kontext- oder Langdokumentarbeit. Viermal das gehostete Fenster, noch vor der Million-Token-Erweiterung.

Lesen Sie diese Liste als Pipeline statt als ein Urteil, denn genau das ist sie. Die Architektur macht die Beziehung wörtlich: Clef ist der Prefill-Pass des Parents mit einem anderen Antwortmechanismus am Ende. Ein sinnvolles Design stellt Clef nach vorne – entscheidet die Route, die Priorität, das Eskalations-Flag – und behält Qwen3.8-27B dahinter, um die Entscheidung umzusetzen. Die beiden sind Komplemente, die sich zufällig einen Download teilen.

Wo man sie jeweils ausführt

Clef wird auf Cloudflares Workers AI zu dem oben genannten Preis von 0,24 $ pro Million Input gehostet, und die Apache-2.0-Gewichte stehen Ihnen zur Verfügung, um sie lokal auszuführen. Der Eintrag in der Ollama-Bibliothek ist die neueste Oberfläche: ollama pull clef erfordert Ollama 0.35.1 oder neuer, weil das Modell über den /v1/systemone Endpunkt kommuniziert, den Ollama für Entscheidungsmodelle hinzugefügt hat. Achten Sie auf die Tags, nicht auf die Schlagzeile — die Standard- und clef:27b-Tags sind 18 GB, was ein 4-Bit-Build eines 55-Gigabyte-Modells ist; clef:27b-q8_0 ist 30 GB, clef:27b-nvfp4 ist 18 GB, clef:27b-mxfp8 ist 31 GB, und clef:27b-mlx-bf16 ist die volle 55-GB-Variante für Apple Silicon. TypeSafes eigenes Python-SDK wird damit kommunizieren, wenn Sie es auf ein lokales Ollama verweisen und einen beliebigen API-Schlüssel angeben, den die Laufzeit ignoriert. Ein Vorbehalt, der sich in der Produktion rächen wird: confidence misst, wie konzentriert die Wahrscheinlichkeiten sind, nicht die Wahrscheinlichkeit, dass die Antwort korrekt ist, und Gleichstände werden in der von Ihnen deklarierten Optionsreihenfolge aufgelöst.

Das Parent-Modell lässt sich heute leichter hinter eine API stellen. Qwen3.8-27B ist auf OrcaRouter zu den oben verwendeten Tarifen von $0,33 und $2,40 pro Million routbar, mit dem 262.144-Token-Fenster, und es ist eines von über 200 Modellen, die über einen einzigen OpenAI-kompatiblen Schlüssel erreichbar sind. Da der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht wird, ist eine Preissenkung eines Anbieters auf einer der beiden Seiten dieses Vergleichs am selben Tag, an dem sie kommt, auf unseren Routen live.

Clef selbst ist keine unserer Routen — unser öffentlicher Katalog liefert nichts dazu, und nichts hier sollte als Verfügbarkeitsaussage von uns gelesen werden. Was wir jedoch führen, ist das Modell, das das Entscheidungsmuster ohne ein Cloudflare-Konto erreichbar macht: TypeSafes Jev 1.13 ist eine gelistete Route zu $0,042 pro Million Input-Tokens mit einem Kontext von 65.536 Token, gemessen bei einem p50 von 148 ms über dasselbe Sieben-Tage-Fenster, und es verwendet dieselbe POST /v1/systemone Anfrageform. Da Clef absichtlich API-kompatibel mit Jev ist, ist eine Pipeline, die gegen eines von beiden gebaut wurde, nur eine Konfigurationsänderung vom anderen entfernt — was genau der Fall ist, den eine Routing-Schicht kostenlos machen soll. Halten Sie beide erreichbar, messen Sie anhand Ihrer eigenen Labels, und lassen Sie den Gewinner eher ein Datenpunkt als eine architektonische Festlegung sein. Wenn ein Entscheidungsmodell letztlich als Gate für einen Agenten dient, muss das Modell, das aufgrund der Entscheidung handelt, weiterhin erreichbar sein, und diese Hälfte steckt bereits hinter demselben Schlüssel.

OrcaRouter's own model page for qwen/qwen3.8-27b, showing a 262,144-token context window and pricing of $0.33 per million input tokens and $2.40 per million output tokens.

Was würde diese Lesart ändern?

Drei Dinge, in aufsteigender Reihenfolge danach, wie sehr sie es bewegen würden.

Ein Dritter muss den Decision Index erneut ausführen. Die Suite ist öffentlich, und Cloudflare beschreibt die Evals als reproduzierbar, also ist das machbar – und die CLINC150-Out-of-Scope-Zelle ist die, die man im Auge behalten sollte, denn eine 97,4 für das 27B ist entweder ein echter Vorteil gegenüber Jevs 89,3 auf der schwierigsten Hälfte des Routings oder ein Artefakt eines hausintern gebauten Harness. Niemand außerhalb von Cloudflare weiß es bisher.

Jemand muss Clef und Qwen3.8-27B an derselben Klassifikationsaufgabe mit denselben Labels bewerten. Das ist der einzige Vergleich, der klären würde, ob das Re-Heading bei Closed-Set-Entscheidungen ein Qualitätskompromiss oder eine Qualitätsverbesserung ist, und keiner der beiden Anbieter hat einen Anreiz, ihn durchzuführen. Bis dahin gilt die 40-Punkte-Lücke bei GPQA als bester verfügbarer Beleg dafür, was entfernt wurde, und sie ist ein Beleg für die falsche Aufgabe.

Und Clefs Latenz muss unter Nebenläufigkeit einen p95-Wert erreichen. Der Median von 209 ms wurde vom Anbieter gemessen, auf Hardware, die der Anbieter kontrolliert, für ein Modell, dessen gesamtes Verkaufsargument darin besteht, dass es in einem Hot Path sitzt. Die Rangfolge gegenüber einem autoregressiven Parent-Modell ist architektonisch bedingt und wird Bestand haben. Die absoluten Millisekunden sind die Zahl, der man misstrauen sollte, und sie sind die Zahl, auf der der gesamte Business Case beruht.

Qwen3.8-27B ist eines von über 200 Modellen, die über einen einzigen OpenAI-kompatiblen Schlüssel erreichbar sind — Qwen3.8-27B.