
Clef vs Qwen3.8-27B: jeden backbone, dwa kontrakty wyjściowe
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Clefnie potrafi napisać zdania, a mimo to zbudowano go z modelu, który potrafi. Cloudflare/clef to 27-miliardowy multimodalny model decyzyjny: podajesz mu stan i schemat typowanych pytań, a on zwraca prawdopodobieństwo dla każdej dozwolonej opcji, nie produkując ani jednego tokenu prozy. Szkieletem pod nim jest Qwen3.8-27B, gęsty model wizyjno-językowy z otwartymi wagami, zamrożony na miejscu z dołączoną niewielką dodatkową głową. To czyni tę stronę jedną z nielicznych stron typu „model kontra model”, na których obie strony wcale nie są rywalami — to punkt kontrolny i jego pochodna, dzielące 55 gigabajtów wag i niezgadzające się co do tego, czy odpowiedź to coś, co się czyta, czy coś, czym się liczy.
Wagi dla obu trafiły do publicznej wiadomości, zanim padły słowa. Cloudflare utworzył Cloudflare/clef, repozytorium na Hugging Face 30 września 2026 o 21:15 UTC, na licencji Apache-2.0, i opublikował wpis ogłaszający — „Przedstawiamy Clef: nasze modele decyzyjne o otwartym kodzie źródłowym i nową platformę do dostrajania RL” — następnego popołudnia. Przez około osiemnaście godzin model o rozmiarze 55 GB był dostępny do pobrania i działał na własnych GPU brzegowych Cloudflare, zanim jego dostawca się o nim wypowiedział. W ciągu trzech dni miał stronę w bibliotece Ollama dla Ollama 0.35.1, gdzie właśnie znalazł go ten tekst, oraz kompilacje NVFP4, FP8, EXL3, INT8, Q4 i Q8 od dwunastu różnych uploaderów.
To, co można poznać z repozytorium, jest niezwykle kompletne, i warto oddzielić to od tego, czego poznać nie można. Co można poznać: architekturę, bazowy checkpoint, licencję, działającą implementację referencyjną i pełną macierz ewaluacji. Czego nie można poznać: czy którakolwiek z tych liczb przetrwa ponowne uruchomienie przez kogoś, kto nie jest Cloudflare. Każdy wynik, który poniżej przypisuje się Clef, pochodzi z uruchomienia przez samego dostawcę zestawu testów, który ten dostawca hostuje. Ta asymetria wobec modelu, za którym stoi miesiąc niezależnego użytkowania, jest uczciwym kręgosłupem tego porównania, a reszta tekstu dotyczy tego, gdzie faktycznie daje o sobie znać.
Dwa repozytoria, obok siebie
Zacznijmy od pobrania, bo właśnie ta identyczność jest tu sednem. Safetensory Clefa mają łącznie 54,97 GB w dwunastu shardach. Safetensory rodzica mają 55,56 GB w osiemnastu. Clef zachowuje enkoder wizji Qwen3.8-27B — procesor, wieżę wizji, cały multimodalny front end — więc nic nie zostało usunięte, żeby go zmniejszyć. To, co dodał Cloudflare, to wspólna głowica schematu o rozmiarze 256 MB: cztery warstwy, szerokość 1024, szesnaście głowic, feedforward o szerokości 4096, dwie warstwy routingu odczytujące końcowe ukryte stany szkieletu. Przepis treningowy to zamrożony szkielet, ta głowica i adaptery niskiego rzędu o randze 256, z entropią krzyżową z wygładzaniem etykiet dla prawidłowych odpowiedzi schematu zestawioną z stratą Brier w celu wyostrzenia kalibracji.
Następnie rozbieżność, która tkwi wyłącznie w tym, co modelowi wolno emitować.
• Parametry — Clef 27B, dotrenowany z Qwen/Qwen3.8-27B. Qwen3.8-27B: gęsty model 27B, 64 warstwy, 5120 wymiarów ukrytych, słownik 248 320 tokenów, 16 × (3 × Gated DeltaNet → FFN) przeplatane z Gated Attention.
• Wyjście — Clef: jeden logit na każdą dozwoloną opcję, z softmaxem dla każdego pytania, całkowity brak ścieżki generowania. Qwen3.8-27B: tokeny, wywołania narzędzi oraz blok rozumowania, który jest domyślnie włączony.
• Kształty pytań — Clef przyjmuje od 1 do 64 pytań z określonym typem na żądanie w trzech formach: noul (prawdopodobieństwo prawdy), choice (od 2 do 255 nazwanych opcji), score (od 2 do 10 uporządkowanych poziomów, zwracając wartość ważoną prawdopodobieństwem, która może znaleźć się pomiędzy nimi). Qwen3.8-27B nie ma takiego kontraktu; otrzymujesz prozę i sam piszesz parser.
• Licencja — Apache-2.0 w obu przypadkach, dlatego właśnie kwantyzacja przez strony trzecie odbyła się w weekend.
• Koszt zamrożonej połowy — głowa Clef ma 256 MB wobec 54,97 GB szkieletu. Niemal całe pobieranie to model nadrzędny. Jeśli masz już Qwen3.8-27B na dysku, pobierasz go po raz drugi, aby uzyskać inną opinię o tym, jak odpowiedzieć.

Ile kosztuje ponowne nagłówkowanie – w dwóch liczbach
Ewaluacja Cloudflare to zestaw Decision Index 0.2.1, przeprowadzany wewnętrznie, i jest to tabela dotycząca modeli decyzyjnych — sześć kolumn: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B i Laya. Qwen3.8-27B nie ma w niej wiersza, a Clef nie ma wiersza w Artificial Analysis Intelligence Index. Nie ma więc wspólnej tablicy wyników i ten tekst jej nie wymyśli.
Jest jednak jeden benchmark, któremu poddano obie strony, a różnica jest wystarczająco duża, by być liczbą najbardziej istotną dla decyzji w tym wydaniu. W GPQA Diamond — pytania naukowe na poziomie magisterskim, wielokrotnego wyboru — Cloudflare mierzy Clef na poziomie 48,0. Model nadrzędny osiąga 90,5 w zestawie testowym Artificial Analysis i 89,2 na karcie modelu samego dostawcy. To czterdziestopunktowa przepaść w wiedzy ogólnej i nie ma w tym tajemnicy: Clef odpowiada, punktując stały zestaw przekazanych mu opcji, a wielokrotny wybór z wiedzy ogólnej jest mniej więcej tak daleki od „przekieruj to zgłoszenie”, jak tylko można ukierunkować te same wagi. Porównanie należy traktować jako orientacyjne, a nie kontrolowane — dwa zestawy testowe, dwa laboratoria, ani dostawcy, ani podmiotu śledzącego. Ale kierunek nie budzi wątpliwości i to jest cena kontraktu.
Ten sam wzorzec widać w pozostałych komórkach ogólnego przeznaczenia Clef. MMLU-Pro 65,9, BBH 73,7, CLINC150 z obsługą poza zakresem 97,4 dla modelu 27B wobec 89,3 modelu Jev — ta ostatnia to rzadka komórka, w której wersja pochodna bije starszy model decyzyjny wprost, a ma to znaczenie, bo odmowa klasyfikacji to trudniejsza połowa routingu. Tam, gdzie Clef jest mocny, jest mocny dokładnie tam, gdzie powinien być klasyfikator wytrenowany wewnętrznie: macro-F1 intencji BANKING77 na poziomie 94,2, dokładność przypadków BFCL 98,5, API-Bank 91,9. Tam, gdzie jest słaby, tekstowy model decyzyjny z konkurencyjnego laboratorium — Jev firmy TypeSafe — bije go o trzydzieści punktów w GPQA Diamond, licząc 0,042 USD za milion tokenów wejściowych w naszym własnym katalogu, co jest użytecznym przypomnieniem, że „27B” samo w sobie nie jest argumentem.
To, co zachowuje element nadrzędny, to wszystko, o co nie pyta Decision Index. Na swojej własnej karcie oraz w wierszach pochodzących z AA nasz katalog zawiera: Terminal-Bench 2.1 z wynikiem 73,0, SWE-bench Pro 61,7, LiveCodeBench v6 90,3, OSWorld-Verified 84,3, DeepSWE 1.1 z wynikiem 42,2, AA Coding 68,1 na pozycji 35 spośród 138 próbkowanych modeli. Żaden z nich nie ma wiersza Clef, ponieważ Clef nie może ich wykonać. Nie ma ścieżki wywoływania narzędzi, planowania długoterminowego ani sposobu na wyemitowanie patcha.
Ile kosztuje jedna decyzja i dlaczego linia wyjściowa to cały argument
Na stronie modelu Workers AI podana jest dokładnie jedna cena jednostkowa dla Clef: 0,24 USD za milion tokenów wejściowych. Nie ma wiersza wyjściowego, a powód kryje się w odpowiedziach. Udokumentowany przykład samego Ollama — zgłoszenie do pomocy technicznej skierowane przez trzy pytania — wraca z "usage": {"input_tokens": 1204, "output_tokens": 3}. Trzy tokeny wyjściowe na trzy pytania. To, czy Cloudflare nalicza opłatę za te trzy tokeny, jest prawie nieistotne: koszt wyjściowy decyzji to nie stawka, lecz liczba pytań.
Porównaj to z cennikiem modelu nadrzędnego w naszym własnym katalogu, który wynosi $0,33 za milion tokenów wejściowych i $2,40 za milion tokenów wyjściowych przy oknie 262 144 tokenów. Ten sam stan o rozmiarze 1 204 tokenów, ta sama pojedyncza decyzja o routingu:
• Clef — 1204 tokeny wejściowe przy $0,24 za milion to około $0,00029 na decyzję, a około $289 za milion decyzji. Ta liczba prawie się nie zmienia, gdy odpowiedź staje się trudniejsza — zmienia się tylko wtedy, gdy stan staje się dłuższy.
• Qwen3.8-27B z wyłączonym myśleniem — ten sam stan kosztuje około $0.00040 na wejściu, plus około dziesięciu tokenów wyjściowych po $2.40 za milion. Nazwijmy to $0.00042, czyli $421 za milion. Clef jest około 1,5× tańszy, co nie jest historią, którą ktokolwiek opowiada.
• Qwen3.8-27B z włączonym myśleniem — co jest ustawieniem domyślnym dla tego checkpointu. Jeśli model zużywa 400 tokenów na rozumowanie, do której z czterech kategorii należy e-mail dotyczący resetowania hasła, to kolejne 0,00096 USD, a decyzja plasuje się w okolicach 0,0014 USD, czyli 1357 USD na milion. Te 400 tokenów to założenie, a nie pomiar, a mnożnik zmienia się liniowo wraz z nim.
Uczciwa wersja argumentu cenowego jest więc węższa, niż wygląda na pierwszy rzut oka. W porównaniu z generalistą działającym z wyłączonym myśleniem Clef wygrywa kosztowo około półtora raza — to realne, ale nie przełomowe. W porównaniu z tym samym modelem w jego domyślnej konfiguracji różnica jest funkcją gadatliwości, a gadatliwość to dokładnie to, co ma model językowy, a czego konstrukcja scorers-over-options nie ma w ogóle. To jest teza strukturalna: koszt Clef jest ograniczony długością stanu, a koszt modelu nadrzędnego jest ograniczony tym, ile ten model zdecyduje się powiedzieć.

Jedyna liczba, która nie jest bliska
Cloudflare raportuje medianę opóźnienia żądań dla Clef na poziomie 209,3 ms i p95 na poziomie 238,6 ms; wartości te zmierzono w 43 benchmarkach w ramach własnego przebiegu, na własnych GPU brzegowych. Nikt poza Cloudflare nie odtworzył tego wyniku, a infrastruktura dostawcy jest powodem, dla którego ta liczba jest tak niska — ten model jest zaprojektowany, aby działać w tej samej sieci co wywołujący.
W przypadku rodzica możemy zrobić lepiej niż podać numer dostawcy, ponieważ jest to jedna z naszych tras. W siedmiodniowym oknie kończącym się 2 października 2026 r. własne środowisko testowe OrcaRouter zmierzyło Qwen3.8-27B na poziomie p50 wynoszącym 1 929 ms i 235,8 tokenu wyjściowego na sekundę, przy 136,3 mln tokenów ruchu w tym oknie. Najciekawsza jest seria dzienna: p95 wynosi dokładnie 10 000 ms w sześciu z siedmiu dni, co wygląda raczej na pułap niż na pomiar, a p50 waha się między 1 751 ms a 4 296 ms w zależności od dnia. Medianę traktuj jako około dziewięć razy większą niż w Clef, a ogon jako nieinformacyjny, dopóki ktoś nie opublikuje rzeczywistego rozkładu.
Ta różnica nie wynika z dostrajania i się nie zniweluje. Przebieg obejmujący wyłącznie prefill plus równoległa głowa oceniająca kończy się w jednym przejściu; model autoregresyjny kończy, gdy skończą mu się rzeczy do powiedzenia. Bezwzględne wartości liczbowe dostawcy dla Clef zasługują na zwykłe zdyskontowanie, ale ta kolejność jest właściwością architektury, a nie sprzętu Cloudflare.
Dla jednego z nich kontekst jest cytowany na trzy sposoby.
Oba modele przyjmują tekst, JSON, obrazy i wideo. Okna nie są takie same, a jedno z nich jest podawane niespójnie w zależności od tego, gdzie się o tym czyta.
• Clef, hostowany — 65 536 tokenów, zgodnie ze stroną modelu Workers AI i postem ogłaszającym. To liczba, która ogranicza wywołującego API, a samo ujęcie Cloudflare ma charakter porównawczy: dwa razy więcej stanu niż mieści okno 32K Jev’a.
• Clef, na dysku — udostępniony config.json deklaruje max_position_embeddings o wartości 262,144, ponieważ zamrożony backbone pochodzi od rodzica i wciąż ma limit pozycji rodzica. Dołączona funkcja pomocnicza encode_record domyślnie przyjmuje max_length=16,384, a dostępny max_state_tokens pozwala niezależnie ograniczyć stan. Żadna z tych trzech liczb nie jest błędna; odpowiadają one na różne pytania, a zestawienie środowiska uruchomieniowego, które reklamuje 256K, odczytuje konfigurację, a nie endpoint.
• Qwen3.8-27B — 262 144 natywnie, rozszerzalny do 1 000 000 przy odpowiedniej konfiguracji serwowania, zgodnie z kartą producenta i naszym wierszem w katalogu. Co najmniej czterokrotnie większy niż hostowane okno Clef.
Praktyczna konsekwencja jest mniejsza, niż sugeruje ten stosunek. Clef konsumuje stan — zgłoszenie, fakturę, zrzut ekranu — a nie rozmowę, a jednym z jego atutów jest to, że można mu przekazać duży, spłaszczony ładunek danych i zadać na jego temat sześćdziesiąt cztery pytania, nie płacąc ponownie za ten ładunek danych przy każdym pytaniu. Rodzic potrzebuje okna, ponieważ musi przechowywać historię, wyniki narzędzi i własne rozumowanie. Różne wymagania, różne limity.
Obaj widzą te same piksele
Koder wizji jest dziedziczony, więc nie jest to przypadek, w którym jeden model jest multimodalny, a drugi nie. Clef przyjmuje do czterech obrazów na żądanie, zakodowanych w base64 plików PNG, JPEG lub WebP, wspólnych dla każdego pytania w ładunku, a klatki wideo można dodawać jako tablice klatek — przykład paragonu w karcie zadaje pytanie typu tak/nie o to, czy suma jest czytelna, co jest miniaturowym odzwierciedleniem tego projektu. Qwen3.8-27B to natywny model wizyjno-językowy z wynikami OmniDocBench 1.5 na poziomie 91,1, RealWorldQA 85,9 i CharXiv 78,8 na karcie producenta.
Różnica polega na tym, co otrzymujesz w zamian. Clef daje ci decyzję pole po polu z dołączonym prawdopodobieństwem, czyli odpowiedź z typem dotyczącą dokumentu. Model nadrzędny daje ci opis dokumentu, który następnie parsujesz. W przypadku dużej klasy prac z dokumentami — sprawdź ten formularz, znajdź tę klauzulę, czy ta suma przekracza próg — odpowiedź z typem to cała praca, a opis to narzut, za który płacisz, a potem go wyrzucasz.
Gdzie tak naprawdę przebiega granica
• Wybierz Clef — odpowiedzi można z góry wyliczyć, a wolisz nie pisać parsera. Routing, triage, gating, kontrole polityk, ekstrakcja pól dokumentów. Zbiory zamknięte, od 2 do 255 opcji na pytanie, do 64 pytań ocenianych razem.
• Weź Clef — decyzja zapada w gorącej ścieżce, a 209 ms w porównaniu z 1929 ms zmienia to, co może zrobić potok. To najsilniejszy pojedynczy powód do przejścia i jest to powód związany z opóźnieniem, a nie z dokładnością.
• Weź Clef — zależy ci na determinizmie. Opcja, której nie zadeklarowałeś, nie może wrócić, ponieważ nie ma kroku generowania, który by ją wytworzył.
Zachowaj Qwen3.8-27B — odpowiedź nie jest wyborem z listy: streszczanie, redagowanie, rozumowanie nad nowym problemem, pisanie kodu, sterowanie narzędziami w długim horyzoncie. Clef nie potrafi niczego z tego, i nie powie ci tego.
• Zachowaj Qwen3.8-27B — potrzebujesz modelu, który powie „żadna z tych opcji”. Model decyzyjny ocenia podane mu opcje. Przekaż mu schemat rozliczeniowy/techniczny/sprzedażowy oraz żądanie dotyczące prywatności, a zwróci najmniej złą z tych trzech opcji zamiast odmowy. Model nadrzędny wydobywa na wierzch pytanie, na które nie wpadłeś, żeby je zadać.
• Zachowaj Qwen3.8-27B — do pracy z kontekstem lub długimi dokumentami. Cztery razy większe okno hostowane, przed rozszerzeniem do miliona tokenów.
Czytaj tę listę jako potok, a nie wyrok, bo właśnie tym ona jest. Architektura czyni tę zależność dosłowną: Clef jest przebiegiem prefill rodzica z innym mechanizmem odpowiedzi na końcu. Rozsądny projekt stawia Clef z przodu — decyduje o trasie, priorytecie, fladze eskalacji — a Qwen3.8-27B trzyma za nim, aby ten działał na podstawie tej decyzji. Te dwa elementy się uzupełniają i przypadkiem dzielą jedno pobranie.
Gdzie uruchomić każde z nich
Clef jest hostowany w Cloudflare Workers AI w stawce 0,24 USD za milion tokenów wejściowych podanej powyżej, a wagi na licencji Apache-2.0 możesz uruchomić lokalnie. Najnowszą powierzchnią jest wpis w bibliotece Ollama: ollama pull clef wymaga Ollamy 0.35.1 lub nowszej, ponieważ model komunikuje się przez /v1/systemone, endpoint, który Ollama dodała dla modeli decyzyjnych. Uważaj na tagi, nie na nagłówek — tag domyślny i clef:27b mają 18 GB, co stanowi czterobitową kompilację modelu o rozmiarze 55 gigabajtów; clef:27b-q8_0 ma 30 GB, clef:27b-nvfp4 ma 18 GB, clef:27b-mxfp8 ma 31 GB, a clef:27b-mlx-bf16 to pełne 55 GB dla Apple silicon. Własne SDK Pythona od TypeSafe będzie z nim rozmawiać, jeśli wskażesz lokalną Ollamę i podasz dowolny klucz API, który środowisko uruchomieniowe ignoruje. Jedno zastrzeżenie, które da się we znaki w produkcji: confidence mierzy, jak skupione są prawdopodobieństwa, a nie szansę, że odpowiedź jest poprawna, a remisy rozstrzyga się zgodnie z kolejnością zadeklarowanych opcji.
Model nadrzędny jest dziś tym łatwiejszym do udostępnienia za pośrednictwem API. Qwen3.8-27B można trasować w OrcaRouter po stawkach 0,33 USD i 2,40 USD za milion użytych powyżej, z oknem 262 144 tokenów, i jest jednym z ponad 200 modeli dostępnych przez pojedynczy klucz zgodny z OpenAI. Ponieważ cena katalogowa dostawcy jest przekazywana przy 0% marży, obniżka ceny przez dostawcę po którejkolwiek stronie tego porównania jest aktywna w naszych trasach tego samego dnia, w którym zostaje wprowadzona.
Sam Clef nie jest jedną z naszych tras — nasz publiczny katalog nie zwraca dla niego niczego i niczego tutaj nie należy odczytywać jako naszego twierdzenia o dostępności. To, co oferujemy, to model, który sprawia, że wzorzec decyzyjny jest osiągalny bez konta Cloudflare: Jev 1.13 od TypeSafe to trasa objęta katalogiem w cenie 0,042 USD za milion tokenów wejściowych z kontekstem 65 536 tokenów, zmierzona na poziomie p50 wynoszącym 148 ms w tym samym siedmiodniowym oknie, i posługuje się identycznym POST /v1/systemone kształtem żądania. Ponieważ Clef jest celowo zgodny z Jev pod względem API, pipeline zbudowany pod jednym z nich jest o jedną zmianę konfiguracji od drugiego — a właśnie ten przypadek warstwa routingu istnieje po to, by uczynić darmowym. Utrzymuj oba osiągalne, mierz na własnych etykietach i pozwól, by zwycięzca był punktem danych, a nie zobowiązaniem architektonicznym. Jeśli model decyzyjny zacznie stanowić bramkę dla agenta, model, który działa na podstawie tej decyzji, wciąż musi być osiągalny, a ta połowa jest już za tym samym kluczem.

Co zmieniłoby ten odczyt?
Trzy rzeczy, w kolejności rosnącej według tego, jak bardzo by na to wpłynęły.
Podmiot trzeci musi ponownie uruchomić Decision Index. Ten zestaw testów jest publiczny, a Cloudflare opisuje te ewaluacje jako odtwarzalne, więc jest to wykonalne — a komórka CLINC150 poza zakresem jest tą, na którą trzeba uważać, ponieważ 97,4 dla 27B to albo prawdziwa przewaga nad wynikiem 89,3 Jev'a na najtrudniejszej połowie routingu, albo artefakt wewnętrznie zbudowanego harnessu. Nikt poza Cloudflare jeszcze tego nie wie.
Ktoś musi ocenić Clef i Qwen3.8-27B w tym samym zadaniu klasyfikacyjnym, z tymi samymi etykietami. To jedyne porównanie, które rozstrzygnęłoby, czy zmiana głowy klasyfikacyjnej to kompromis jakościowy, czy ulepszenie jakości w przypadku decyzji dla zamkniętego zbioru, a żaden z dostawców nie ma motywacji, by je przeprowadzić. Do tego czasu czterdziestopunktowa luka w GPQA pozostaje najlepszym dostępnym dowodem na to, co zostało usunięte — a jest to dowód dotyczący niewłaściwego zadania.
A opóźnienie Clef wymaga p95 w warunkach współbieżności. Medianę 209 ms zmierzył dostawca, na kontrolowanym przez siebie sprzęcie, dla modelu, którego cała propozycja wartości polega na tym, że znajduje się w gorącej ścieżce. Względna kolejność wobec autoregresyjnego modelu nadrzędnego ma charakter architektoniczny i przetrwa. Bezwzględne milisekundy to liczba, której nie należy ufać, i to na tej liczbie opiera się całe uzasadnienie biznesowe.
Qwen3.8-27B to jeden z ponad 200 modeli dostępnych za pomocą jednego klucza zgodnego z OpenAI — Qwen3.8-27B.
