Kartu judul bertuliskan “Clef vs Qwen3.8-27B — Satu backbone, dua kontrak output”, dengan dua kartu di bawahnya: Clef, model keputusan 27B, satu logit per opsi; dan Qwen3.8-27B, VLM dense 27B, token dan panggilan alat.
Guides & Insights

Clef vs Qwen3.8-27B: Satu Backbone, Dua Kontrak Output

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Cleftidak dapat menulis satu kalimat pun, dan ia dibangun dari sebuah model yang bisa. Cloudflare/clef adalah model keputusan multimodal dengan 27 miliar parameter: Anda memberinya sebuah state dan skema pertanyaan bertipe, lalu ia mengembalikan probabilitas untuk setiap opsi yang diizinkan tanpa menghasilkan satu token prosa pun. Tulang punggung di bawahnya adalah Qwen3.8-27B, model visi-bahasa dense dengan bobot terbuka, yang dibekukan di tempatnya dengan head tambahan kecil yang terpasang. Itu menjadikan ini salah satu dari sedikit halaman model-versus-model di mana kedua sisinya sama sekali bukan rival — keduanya adalah sebuah checkpoint dan turunannya, berbagi bobot sebesar 55 gigabyte dan berbeda pendapat tentang apakah jawabannya adalah sesuatu yang Anda baca atau sesuatu yang Anda hitung.

Bobot untuk keduanya menjadi publik sebelum pengumumannya keluar. Cloudflare membuat repositori Cloudflare/clef di Hugging Face pada 21:15 UTC tanggal 30 September 2026, dengan lisensi Apache-2.0, dan menerbitkan postingan pengumuman — "Memperkenalkan Clef: model keputusan open-source kami, dan platform fine-tuning RL baru" — pada sore berikutnya. Selama sekitar delapan belas jam, model berukuran 55 gigabita dapat diunduh dan dijalankan di GPU edge milik Cloudflare sendiri sebelum vendornya mengatakan apa pun tentangnya. Dalam tiga hari, ia sudah memiliki halaman pustaka Ollama di balik Ollama 0.35.1, dan di sanalah artikel ini menemukannya, serta build NVFP4, FP8, EXL3, INT8, Q4, dan Q8 dari selusin pengunggah yang berbeda.

Apa yang dapat diketahui dari repositori ini luar biasa lengkap, dan ada baiknya memisahkan hal itu dari apa yang tidak dapat diketahui. Dapat diketahui: arsitekturnya, checkpoint dasarnya, lisensinya, implementasi referensi yang berjalan, dan matriks evaluasi yang lengkap. Tidak dapat diketahui: apakah angka-angka itu akan tetap bertahan jika dijalankan ulang oleh pihak yang bukan Cloudflare. Setiap skor yang dikaitkan dengan Clef di bawah ini berasal dari pengujian vendor sendiri terhadap suite yang dihosting vendor. Asimetri terhadap model yang memiliki pengalaman penggunaan independen selama sebulan adalah inti jujur dari perbandingan ini, dan sisa tulisan ini membahas di mana asimetri itu benar-benar berdampak.

Kedua repositori, berdampingan

Mulai dari unduhannya, karena kesamaannya itulah intinya. Safetensors milik Clef berjumlah 54,97 GB dalam dua belas shard. Milik induknya berjumlah 55,56 GB dalam delapan belas shard. Clef mempertahankan encoder visi Qwen3.8-27B — prosesornya, menara visinya, seluruh front end multimodal — jadi tidak ada yang dilucuti untuk membuatnya lebih kecil. Yang ditambahkan Cloudflare adalah head skema gabungan berukuran 256 MB: empat lapisan, lebar 1.024, enam belas head, feedforward selebar 4.096, dua lapisan routing yang membaca keadaan tersembunyi akhir dari backbone. Resep pelatihannya adalah backbone yang dibekukan, head itu, dan adaptor low-rank rank-256, dengan cross-entropy yang dihaluskan label untuk jawaban skema yang valid dipasangkan dengan Brier loss untuk mempertajam kalibrasi.

Lalu divergensinya, yang sepenuhnya terletak pada apa yang diizinkan untuk dikeluarkan oleh model.

• Parameter — Clef 27B, pasca-pelatihan dari Qwen/Qwen3.8-27B. Qwen3.8-27B 27B dense, 64 lapisan, 5.120 hidden, kosakata 248.320 token, 16 × (3 × Gated DeltaNet → FFN) yang diselang-seling dengan Gated Attention.

• Keluaran — Clef: satu logit per opsi yang diizinkan, di-softmax per pertanyaan, tidak ada jalur generasi sama sekali. Qwen3.8-27B: token, panggilan alat, dan blok penalaran yang aktif secara bawaan.

• Bentuk pertanyaan — Clef menerima 1 hingga 64 pertanyaan bertipe per permintaan dalam tiga bentuk: bool (probabilitas benar), pilihan (2 hingga 255 opsi bernama), skor (2 hingga 10 level berurutan, mengembalikan nilai berbobot probabilitas yang dapat berada di antara level-level tersebut). Qwen3.8-27B tidak memiliki kontrak seperti itu; Anda mendapatkan prosa dan Anda menulis parser-nya.

• Lisensi — Apache-2.0 pada keduanya, itulah sebabnya kuantisasi pihak ketiga terjadi dalam satu akhir pekan.

• Biaya dari separuh yang dibekukan — kepala Clef adalah 256 MB dibandingkan 54,97 GB backbone. Hampir seluruh unduhan adalah model induknya. Jika Anda sudah memiliki Qwen3.8-27B di disk, Anda mengunduhnya untuk kedua kalinya hanya untuk mendapatkan pendapat berbeda tentang cara menjawab.

A two-column scoreboard for Clef and Qwen3.8-27B across six dimensions: output, parameters, GPQA Diamond (48.0 vs 90.5), hosted context (65,536 vs 262,144 tokens), median latency (209.3 ms vs 1,929 ms) and list price ($0.24 per M in vs $0.33/$2.40 per M). A footer notes Clef's figures are vendor-reported and unreproduced, Qwen's GPQA is per Artificial Analysis, and latency was measured by each side on its own hardware.

Berapa biaya penulisan ulang judul, dalam dua angka

Evaluasi Cloudflare adalah suite Decision Index 0.2.1, dijalankan secara internal, dan ini adalah tabel tentang model keputusan — enam kolom: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B dan Laya. Qwen3.8-27B tidak memiliki baris di dalamnya, dan Clef tidak memiliki baris pada Artificial Analysis Intelligence Index. Jadi tidak ada papan skor bersama dan tulisan ini tidak akan mengarangnya.

Namun, ada satu tolok ukur yang telah dijalani kedua pihak, dan selisihnya cukup besar untuk menjadi angka yang paling relevan untuk keputusan dalam rilis ini. Pada GPQA Diamond — pertanyaan sains tingkat pascasarjana, pilihan ganda — Cloudflare mengukur Clef pada 48.0. Model induknya berada pada 90.5 pada perangkat uji Artificial Analysis dan 89.2 pada kartu model milik vendor itu sendiri. Itu adalah jurang empat puluh poin dalam pengetahuan umum, dan itu bukan misteri: Clef menjawab dengan memberi skor pada serangkaian opsi tetap yang diberikan kepadanya, dan pilihan ganda pengetahuan umum kira-kira sejauh mungkin dari "routing tiket ini" sebagaimana bobot yang sama dapat diarahkan. Perlakukan perbandingan ini sebagai indikatif, bukan terkendali — dua perangkat uji, dua lab, bukan milik vendor maupun pelacak. Tetapi arahnya tidak diragukan, dan itulah harga dari kontrak tersebut.

Pola yang sama terlihat di sisa sel serbaguna Clef. MMLU-Pro 65.9, BBH 73.7, CLINC150 dengan penanganan di luar cakupan 97.4 untuk 27B melawan 89.3 milik Jev — yang terakhir itu adalah sel langka tempat model turunan mengalahkan model keputusan yang lebih tua secara mutlak, dan itu penting karena menolak mengklasifikasikan adalah separuh yang sulit dari perutean. Di mana Clef kuat, ia kuat tepat di tempat pengklasifikasi yang dilatih internal seharusnya kuat: BANKING77 intent macro-F1 pada 94.2, BFCL case-exact pada 98.5, API-Bank pada 91.9. Di tempat ia lemah, model keputusan yang hanya berbasis teks dari lab pesaing — Jev milik TypeSafe — mengalahkannya dengan selisih tiga puluh poin pada GPQA Diamond sambil menagih $0.042 per juta token input di katalog kami sendiri, yang merupakan pengingat berguna bahwa "27B" bukanlah argumen itu sendiri.

Apa yang dipertahankan oleh induk adalah semua hal yang tidak ditanyakan oleh Decision Index. Pada kartunya sendiri dan dalam baris yang bersumber dari AA, katalog kami memuat: Terminal-Bench 2.1 pada 73.0, SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3, DeepSWE 1.1 pada 42.2, AA Coding 68.1 pada peringkat 35 dari 138 model yang disampel. Tidak satu pun dari itu memiliki baris Clef, karena Clef tidak dapat mencobanya. Clef tidak memiliki jalur pemanggilan alat, tidak ada perencanaan jangka panjang, tidak ada cara untuk mengeluarkan patch.

Apa biaya dari satu keputusan, dan mengapa baris keluaran adalah keseluruhan argumennya

Halaman model Workers AI mencantumkan tepat satu harga satuan untuk Clef: $0,24 per juta token masukan. Tidak ada baris keluaran, dan alasannya ada pada responsnya. Contoh yang didokumentasikan Ollama sendiri — tiket dukungan yang diteruskan melalui tiga pertanyaan — kembali dengan "usage": {"input_tokens": 1204, "output_tokens": 3}. Tiga token keluaran untuk tiga pertanyaan. Apakah Cloudflare menagih tiga token itu nyaris tidak relevan: biaya keluaran dari sebuah keputusan bukanlah tarif, melainkan jumlah pertanyaan.

Bandingkan itu dengan daftar tarif induk di katalog kami sendiri, yaitu $0,33 per juta token masukan dan $2,40 per juta keluaran dengan jendela 262.144 token. Keadaan 1.204 token yang sama, keputusan perutean tunggal yang sama:

• Clef — 1.204 token masukan dengan $0,24 per juta adalah sekitar $0,00029 per keputusan, dan sekitar $289 per juta keputusan. Angka itu hampir tidak berubah ketika jawabannya menjadi lebih sulit, hanya ketika state-nya menjadi lebih panjang.

• Qwen3.8-27B dengan mode berpikir dinonaktifkan — keadaan yang sama memakan biaya sekitar $0,00040 untuk input, ditambah sekitar sepuluh token output dengan harga $2,40 per juta. Sebut saja $0,00042, atau $421 per juta. Clef sekitar 1,5× lebih murah, yang bukan cerita yang sedang diceritakan siapa pun.

• Qwen3.8-27B dengan thinking dibiarkan aktif — yang merupakan default pada checkpoint ini. Jika model menghabiskan 400 token untuk bernalar tentang ke bucket mana dari empat bucket sebuah email reset kata sandi termasuk, itu berarti tambahan $0.00096 dan keputusannya mendarat di sekitar $0.0014, atau $1,357 per juta. Token 400 itu adalah asumsi, bukan pengukuran, dan kelipatannya bergerak secara linear dengannya.

Jadi versi jujur dari argumen penetapan harga lebih sempit daripada yang terlihat pada awalnya. Dibandingkan generalis yang berjalan dengan thinking off, Clef menang dalam hal dolar dengan faktor sekitar satu setengah — nyata, tetapi tidak transformatif. Dibandingkan model yang sama dalam konfigurasi bawaannya, selisihnya merupakan fungsi dari verbositas, dan verbositas adalah tepat apa yang dimiliki model bahasa dan sama sekali tidak dimiliki oleh desain scorers-over-options. Itulah klaim strukturalnya: biaya Clef dibatasi oleh panjang state, dan biaya induknya dibatasi oleh seberapa banyak induk memutuskan untuk mengatakan.

Cloudflare's Workers AI model page for clef, showing a 65,536-token context window, vision support, and unit pricing of $0.24 per million input tokens with no output line.

Satu-satunya angka yang tidak dekat

Cloudflare melaporkan latensi permintaan median sebesar 209,3 ms untuk Clef dan p95 sebesar 238,6 ms, yang diukur pada 43 tolok ukur dalam pengujiannya, di GPU edge miliknya sendiri. Tidak ada pihak di luar Cloudflare yang mereproduksinya, dan infrastruktur vendor itulah alasan angka tersebut bisa serendah itu — model ini dirancang untuk berada di jaringan yang sama dengan pemanggilnya.

Bagi induknya, kita bisa melakukan lebih baik daripada sekadar angka vendor, karena ini salah satu rute kami. Selama jendela tujuh hari yang berakhir 2 Oktober 2026, playground milik OrcaRouter sendiri mengukur Qwen3.8-27B pada p50 1.929 ms dan 235,8 token keluaran per detik, pada 136,3 juta token lalu lintas dalam jendela tersebut. Deret hariannya adalah bagian yang menarik: p95 berada tepat di 10.000 ms pada enam dari tujuh hari, yang terbaca seperti batas atas ketimbang sebuah hasil pengukuran, dan p50 berayun antara 1.751 ms dan 4.296 ms tergantung harinya. Anggap mediannya kira-kira sembilan kali milik Clef, dan anggap ekornya tidak informatif sampai ada yang menerbitkan distribusi yang sebenarnya.

Celah itu bukan perbedaan penyetelan dan tidak akan menutup. Sebuah proses yang hanya melakukan prefill ditambah head penilaian paralel selesai dalam satu sapuan; model autoregresif selesai ketika kehabisan hal untuk dikatakan. Angka absolut vendor untuk Clef layak mendapat potongan seperti biasa, tetapi pengurutannya adalah sifat arsitektur, bukan sifat perangkat keras Cloudflare.

Konteks dikutip dengan tiga cara untuk salah satunya.

Kedua model menerima teks, JSON, gambar, dan video. Jendelanya tidak sama, dan salah satunya dikutip secara tidak konsisten tergantung di mana Anda membacanya.

• Clef, dihosting — 65,536 token, menurut halaman model Workers AI dan postingan pengumuman. Itulah angka yang mengikat pemanggil API, dan pembingkaian Cloudflare sendiri bersifat komparatif: dua kali keadaan yang ditampung jendela 32K milik Jev.

• Clef, di disk — config.json yang dirilis mendeklarasikan max_position_embeddings sebesar 262.144, karena backbone yang dibekukan adalah milik induk dan masih membawa batas posisi induk. Helper encode_record bawaan secara default bernilai max_length=16,384, dengan max_state_tokens tersedia untuk membatasi state secara terpisah. Tidak ada satu pun dari ketiga angka itu yang salah; angka-angka itu menjawab pertanyaan yang berbeda, dan daftar runtime yang mengiklankan 256K sedang membaca config, bukan endpoint.

• Qwen3.8-27B — 262.144 secara native, dapat diperluas hingga 1.000.000 dengan konfigurasi penyajian yang tepat, menurut kartu vendor dan baris katalog kami. Setidaknya empat kali jendela Clef yang dihosting.

Konsekuensi praktisnya lebih kecil daripada yang disiratkan oleh rasio tersebut. Clef mengonsumsi sebuah state — tiket, faktur, tangkapan layar — bukan percakapan, dan salah satu nilai jualnya adalah Anda dapat memberinya payload besar yang telah diratakan lalu mengajukan enam puluh empat pertanyaan tentangnya tanpa membayar payload itu lagi per pertanyaan. Induk membutuhkan jendela tersebut karena harus menampung riwayat, hasil alat, dan penalarannya sendiri. Kebutuhan berbeda, batas atas berbeda.

Keduanya melihat piksel yang sama

Encoder visi diwariskan, jadi ini bukan kasus satu model bersifat multimodal dan model lainnya tidak. Clef menerima hingga empat gambar per permintaan, berupa PNG, JPEG, atau WebP berkode base64, yang digunakan bersama oleh setiap pertanyaan dalam payload, dan frame video dapat ditambahkan sebagai array frame — contoh struk di kartu mengajukan pertanyaan ya/tidak tentang apakah suatu total dapat terbaca, yang merupakan desain dalam bentuk mini. Qwen3.8-27B adalah model visi-bahasa native dengan OmniDocBench 1.5 pada 91.1, RealWorldQA pada 85.9, dan CharXiv pada 78.8 di kartu vendor.

Yang berbeda adalah apa yang Anda dapatkan kembali. Clef memberi Anda keputusan per bidang dengan probabilitas terlampir, yaitu jawaban bertipe tentang sebuah dokumen. Induknya memberi Anda deskripsi dokumen, yang kemudian Anda uraikan. Untuk banyak jenis pekerjaan dokumen — periksa formulir ini, temukan klausul ini, apakah total ini di atas ambang batas — jawaban bertipe itulah keseluruhan pekerjaannya, dan deskripsi adalah overhead yang Anda bayar lalu buang.

Di mana garis itu sebenarnya berada

• Ambil Clef — jawabannya dapat dienumerasi sebelumnya dan Anda lebih suka tidak menulis parser. Perutean, triase, gating, pemeriksaan kebijakan, ekstraksi bidang dokumen. Kumpulan tertutup, 2 hingga 255 opsi per pertanyaan, hingga 64 pertanyaan dinilai bersama.

• Ambil Clef — keputusannya berada di hot path dan 209 ms dibandingkan 1.929 ms mengubah apa yang dapat dilakukan pipeline. Ini adalah alasan tunggal terkuat untuk beralih, dan ini alasan latensi, bukan alasan akurasi.

• Ambil Clef — Anda menginginkan determinisme. Opsi yang tidak Anda deklarasikan tidak dapat muncul kembali, karena tidak ada langkah generasi untuk menghasilkannya.

• Pertahankan Qwen3.8-27B — jawabannya bukan pilihan dari daftar: meringkas, menyusun draf, bernalar melalui masalah baru, menulis kode, mengoperasikan alat sepanjang horizon yang panjang. Clef tidak bisa melakukan satu pun dari itu, dan ia tidak akan memberitahumu demikian.

• Pertahankan Qwen3.8-27B — Anda memerlukan model untuk mengatakan "tidak satu pun dari ini." Model pengambilan keputusan menilai opsi yang diberikan kepadanya. Berikan skema penagihan/teknis/penjualan dan permintaan privasi, dan model itu akan mengembalikan yang paling tidak buruk dari ketiga opsi tersebut alih-alih penolakan. Induknya memunculkan pertanyaan yang tidak terpikir oleh Anda untuk ditanyakan.

• Pertahankan Qwen3.8-27B — untuk pekerjaan konteks atau dokumen panjang. Empat kali lipat jendela yang dihosting, sebelum ekstensi satu juta token.

Baca daftar itu sebagai pipeline, bukan sebagai putusan, karena memang itulah adanya. Arsitekturnya membuat hubungan itu literal: Clef adalah prefill pass milik induknya dengan mekanisme jawaban yang berbeda di ujungnya. Desain yang masuk akal menempatkan Clef di depan — menentukan rute, prioritas, penanda eskalasi — dan menempatkan Qwen3.8-27B di belakangnya untuk bertindak atas keputusan itu. Keduanya adalah komplemen yang kebetulan berbagi satu unduhan.

Di mana menjalankan masing-masing

Clef dihosting di Workers AI milik Cloudflare dengan angka $0,24 per juta token input di atas, dan bobot Apache-2.0 menjadi milik Anda untuk dijalankan secara lokal. Daftar di pustaka Ollama adalah permukaan terbaru: ollama pull clef memerlukan Ollama 0.35.1 atau lebih baru, karena model ini berbicara melalui endpoint /v1/systemone yang ditambahkan Ollama untuk model pengambilan keputusan. Perhatikan tag-nya, bukan judul utamanya — tag bawaan dan clef:27b berukuran 18 GB, yaitu build empat-bit dari model 55 gigabita; clef:27b-q8_0 berukuran 30 GB, clef:27b-nvfp4 berukuran 18 GB, clef:27b-mxfp8 berukuran 31 GB, dan clef:27b-mlx-bf16 adalah versi penuh 55 GB untuk Apple silicon. SDK Python milik TypeSafe sendiri akan dapat berkomunikasi dengannya jika Anda mengarahkannya ke Ollama lokal dan memberikan kunci API apa pun, yang akan diabaikan oleh runtime. Satu catatan yang akan mengganggu di lingkungan produksi: confidence mengukur seberapa terkonsentrasinya probabilitas, bukan peluang jawabannya benar, dan hasil seri diselesaikan sesuai urutan opsi yang Anda deklarasikan.

Model induk adalah yang lebih mudah ditempatkan di belakang API saat ini. Qwen3.8-27B dapat dirutekan di OrcaRouter dengan tarif $0,33 dan $2,40 per juta yang digunakan di atas, dengan jendela 262.144 token, dan model ini adalah salah satu dari lebih dari 200 model yang dapat dijangkau melalui satu kunci yang kompatibel dengan OpenAI. Karena harga daftar penyedia diteruskan dengan markup 0%, pemotongan harga vendor di kedua sisi perbandingan ini langsung aktif di rute kami pada hari yang sama saat diberlakukan.

Clef sendiri bukan salah satu rute kami — katalog publik kami tidak mengembalikan apa pun untuknya, dan tidak ada apa pun di sini yang boleh dibaca sebagai klaim ketersediaan dari kami. Yang kami sediakan adalah model yang membuat pola keputusan dapat dijangkau tanpa akun Cloudflare: TypeSafe Jev 1.13 adalah rute yang terdaftar dengan $0.042 per juta token input dengan konteks 65.536 token, diukur pada p50 148 ms sepanjang jendela tujuh hari yang sama, dan ia memakai yang identik POST /v1/systemone, bentuk permintaan. Karena Clef kompatibel secara API dengan Jev secara sengaja, pipeline yang dibangun untuk salah satunya hanya berjarak satu perubahan konfigurasi dari yang lain — yang merupakan kasus yang lapisan routing ada untuk membuatnya gratis. Jaga agar keduanya tetap dapat dijangkau, ukur pada label Anda sendiri, dan biarkan pemenangnya menjadi titik data alih-alih komitmen arsitektural. Jika model keputusan akhirnya menjadi gerbang bagi agen, model yang bertindak atas keputusan tersebut tetap harus dapat dijangkau, dan separuh itu sudah berada di balik kunci yang sama.

OrcaRouter's own model page for qwen/qwen3.8-27b, showing a 262,144-token context window and pricing of $0.33 per million input tokens and $2.40 per million output tokens.

Apa yang akan mengubah pembacaan ini?

Tiga hal, dalam urutan menaik berdasarkan seberapa besar mereka akan menggerakkannya.

Pihak ketiga perlu menjalankan ulang Decision Index. Suite ini publik dan Cloudflare menyebut evaluasinya dapat direproduksi, jadi ini bisa dilakukan — dan sel di luar cakupan CLINC150 adalah yang perlu dicermati, karena angka 97,4 untuk 27B bisa jadi keunggulan nyata atas 89,3 milik Jev pada separuh tersulit routing, atau bisa jadi artefak dari harness buatan internal. Belum ada orang di luar Cloudflare yang tahu.

Seseorang perlu memberi skor pada Clef dan Qwen3.8-27B pada tugas klasifikasi yang sama dengan label yang sama. Itu satu-satunya perbandingan yang dapat menentukan apakah penggantian head merupakan kompromi kualitas atau peningkatan kualitas untuk keputusan himpunan tertutup, dan tidak ada vendor yang punya insentif untuk menjalankannya. Sampai saat itu, selisih GPQA empat puluh poin tetap menjadi bukti terbaik yang tersedia tentang apa yang dihapus, dan bukti itu adalah bukti tentang tugas yang salah.

Dan latensi Clef memerlukan p95 dalam kondisi konkurensi. Median 209 ms diukur oleh vendor, pada perangkat keras yang dikendalikan vendor, untuk model yang seluruh nilai jualnya adalah bahwa ia berada di hot path. Urutan relatif terhadap induk autoregresif bersifat arsitektural dan akan bertahan. Angka milidetik absolut adalah angka yang perlu dicurigai, dan angka itulah yang menjadi sandaran seluruh kasus bisnis.

Qwen3.8-27B adalah salah satu dari lebih dari 200 model yang dapat diakses melalui satu kunci yang kompatibel dengan OpenAI — Qwen3.8-27B.