Kartu judul yang dihasilkan bertuliskan 'Clef', dengan subjudul 'model keputusan Cloudflare yang tidak pernah menulis token', dengan dua chip bertuliskan 'weights 30 Sept 2026' dan 'blog 1 Oct 2026'. Logo OrcaRouter dikomposisikan di sudut kanan bawah.
Engineering & Research

Clef Sengaja Meniru API Jev — dan Itulah Bagian yang Menarik

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Clef adalah model multimodal 27 miliar parameter dari Cloudflare yang menjawab pertanyaan bertipe dan tidak melakukan hal lain. Anda memberinya sebuah state — teks, JSON, gambar, frame video — plus skema berisi hingga 64 pertanyaan bernama, dan ia mengembalikan probabilitas untuk setiap opsi yang diizinkan dalam satu forward pass. Tidak ada teks yang dihasilkan, tidak ada parser, tidak ada loop decoding. Yang membuat Cloudflare/clef layak dibaca bukanlah desain itu, yang dipinjamnya, melainkan format wire yang dipilihnya: Cloudflare membangun Clef untuk berbicara dalam request dan response body dari Jev System One, model keputusan yang pertama dirilis TypeSafe, dilayani di jalur yang sama POST /v1/systemone. Interoperabilitas di sini adalah seluruh argumen komersialnya. Jika pipeline Anda sudah mengajukan pertanyaan kepada model keputusan dalam bentuk itu, Clef hanyalah perubahan URL dan string model, bukan migrasi.

Itu hal yang tidak biasa untuk disembunyikan dalam postingan rilis, dan Cloudflare tidak menyembunyikannya — kartu model menyatakan secara tegas bahwa API tersebut "sepenuhnya kompatibel dengan Jev dan SystemOne," dan blog itu dibuka dengan memberi kredit kepada TypeSafe karena telah membuat kategori ini dikenal sebelum memposisikan Clef sebagai versi generasi kedua dari eksperimen internal. Jadi pembacaan jujur atas rilis ini memiliki tiga bagian: apa yang Anda peroleh dari keputusan kompatibilitas ini, apa yang dikatakan angka-angka Cloudflare sendiri tentang di mana Clef menang dan kalah, dan apa yang masih belum terverifikasi karena setiap angka dalam tabel itu dihasilkan oleh vendor yang merilis model tersebut.

Kategori itu berasal dari tempat lain

Postingan Cloudflare bersikap jujur tentang garis keturunannya. Gagasan tentang model yang mengembalikan keluaran terstruktur yang terbatas alih-alih prosa dikreditkan ke Jev System One milik TypeSafe. Jalur Cloudflare sendiri masuk adalah demo sebelumnya yang membengkokkan model difusi agar memancarkan probabilitas deterministik dengan mengekspos logprobs, ditambah kerja komunitas oleh Matt Mastracci dalam membuat mesin inferensi menangani pola tersebut. Clef dibangun di atas konsep itu dengan backbone yang berbeda, head penilaian yang dibuat khusus, dan — bagian yang penting secara komersial — body permintaan yang cocok dengan milik incumbent.

Ketika seorang vendor menyalin format wire milik pesaing sekaligus melakukan benchmark terhadap indeks pesaing tersebut, kompatibilitas bukanlah catatan kaki untuk model itu, melainkan strategi produknya. Menukar model keputusan di balik endpoint yang sudah ada adalah cara termurah bagi pendatang baru untuk dicoba, dan eksperimen termurah bagi tim yang sudah memiliki salah satunya terpasang.

Apa yang sebenarnya dirilis, dan berapa biayanya

• Parameter — 27B, dibangun dengan membekukan Qwen3.8-27B beserta encoder visinya dan melatih head skema gabungan plus adaptor low-rank rank-256 di atasnya.

• Saudara — Clef-Flash, resep yang sama pada 9B dari Qwen3.5-9B. Artikel terpisah, trade-off terpisah.

• Konteks — 65.536 token, sesuai halaman model Workers AI dan postingan blog. Helper pengodean bawaan secara bawaan menggunakan max_length=16,384, sebuah nilai bawaan, bukan batas maksimum, tetapi nilai bawaan yang Anda dapatkan jika menggunakan loader sebagaimana dikirimkan.

• Jenis pertanyaan — noul (benar/salah, mengembalikan probabilitas benar), choice (2 hingga 26 opsi bernama), score (2 hingga 26 tingkat berurutan). Satu hingga 64 pertanyaan per permintaan.

• Harga — $0.24 per juta token input di Workers AI milik Cloudflare, atau di-host sendiri dari bobot Apache-2.0 yang berukuran sekitar 55 GB yang tersebar dalam dua belas shard.

• Lisensi — Apache 2.0, mengikuti checkpoint dasar Qwen3.8-27B.

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Di mana ia menang, dan di mana tidak.

Pengujian Decision Index Cloudflare adalah sumber untuk semua yang ada di bagian ini, dan papan peringkat yang menghostingnya adalah milik Cloudflare. Tidak ada apa pun di bawah ini yang telah direproduksi secara independen. Bacalah ini sebagai kasus terbaik versi pemasok, dan perhatikan betapa tidak meratanya hasilnya.

Kemenangan mengelompok di tempat pengklasifikasi terlatih seharusnya menang. Clef meraih macro-F1 intent BANKING77 sebesar 94,2 melawan 79,7 milik Jev, dan CLINC150 dengan penanganan di luar cakupan sebesar 97,4 melawan 89,3 — selisih tiga puluh poin yang merupakan sel paling relevan untuk pengambilan keputusan dalam tabel tersebut, karena menolak mengklasifikasi adalah separuh bagian tersulit dari perutean. Clef juga meraih CRUXEval sebesar 86,7, CLadder sebesar 94,0, dan simulator peralatan rumah sebesar 83,0.

Kekalahan-kekalahan itu tak kalah nyata dan pantas berada di paragraf yang sama. Dalam hal pengetahuan umum dan penalaran sulit, Jev versi lama menang telak: GPQA Diamond 78,3 berbanding 48,0, MMLU-Pro 82,7 berbanding 65,9, BBH 92,9 berbanding 73,7. Itu adalah tiga selisih terbesar dalam tabel dan semuanya mengarah ke arah yang sama. Clef juga bukan model terbaik dalam perbandingannya sendiri pada set PhishNChips domain keamanan, dengan hanya meraih 79,6 sementara entri pesaing mencetak skor lebih tinggi.

Pada empat evaluasi alur kerja end-to-end, yang diambil dari kumpulan eval publik milik TypeSafe sendiri dan dinilai terhadap label konsensus, keduanya cukup dekat sehingga seperti lempar koin. Clef unggul dalam pemrosesan faktur pada tindakan tepat dengan 64,7 berbanding 61,8 dan kumpulan insiden keamanan 62,9 berbanding 61,7; Jev unggul dalam observabilitas jejak agen dengan 71,6 berbanding 68,5; layanan pelanggan adalah hasil seri 76,3 berbanding 76,0 yang tidak berarti pada selisih tersebut.

Latensi adalah titik di mana kesenjangannya bersifat struktural, bukan marginal. Cloudflare melaporkan median 209,3 ms dan p95 238,6 ms untuk Clef, dibandingkan dengan 524,1 dan 536,0 untuk Jev. Urutan itu berasal dari desain non-autoregresif, bukan dari keanehan benchmark, dan itulah sebabnya angka ini paling mungkin bertahan saat berhadapan dengan deployment nyata. Angka milidetik absolutnya diukur pada perangkat keras milik Cloudflare sendiri dan tidak banyak berarti jika berdiri sendiri.

Titik data paling meyakinkan dalam rilis ini bukanlah baris tolok ukur. Cloudflare mengatakan tim intelijen ancamannya menyerahkan sebuah domain kepada Clef bersama layanan perenderan browser-nya dan memperoleh putusan kategori dalam 2,2 detik, dibandingkan 4,7 detik bagi LLM umum tercepat miliknya sendiri pada alur kerja yang sama, dengan lebih banyak klasifikasi yang dikembalikan. Anekdot internal, bukan studi — tetapi inilah jenis cerita yang menjelaskan mengapa siapa pun akan membangun ini alih-alih memberikan prompt kepada model umum.

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

Dua hal yang diberitahukan oleh referensi API kepada Anda, dan satu hal yang tidak.

Jebakan yang didokumentasikan itu kecil dan layak dibaca sebelum Anda mem-port apa pun. Bidang keyakinan mengukur seberapa terkonsentrasi probabilitasnya, bukan probabilitas bahwa jawabannya benar — model yang terkalibrasi dengan baik dapat mengembalikan jawaban benar dengan keyakinan rendah dan jawaban salah dengan keyakinan tinggi. Dan ketika dua opsi seri, jawabannya mengikuti urutan opsi model, jadi letakkan opsi pilihan Anda lebih dulu. Siapa pun yang mem-port pengklasifikasi berbasis prompt tanpa membaca dua kalimat itu akan salah membaca log mereka sendiri.

Kendala yang lebih besar tidak didokumentasikan di mana pun karena bersifat struktural. Clef tidak memiliki jalur pembuatan teks sama sekali, yang berarti Clef tidak dapat menyusun balasan, merangkum utas, memanggil alat, atau melakukan percakapan, dan Clef tidak akan mengarang kategori yang tidak Anda deklarasikan. Seluruh desainnya mengasumsikan Anda dapat menyebutkan jawaban yang diizinkan terlebih dahulu. Itu diam-diam mengecualikan banyak sekali masalah, dan seberapa pun baiknya performa benchmark, itu tidak mengubahnya.

Apa nilainya argumen kompatibilitas

Di sinilah rilis ini berhenti menjadi tinjauan model dan berubah menjadi pertanyaan arsitektur. Jika Clef memakai bentuk permintaan Jev, maka model di balik endpoint keputusan Anda adalah sebuah nilai konfigurasi, dan cara yang masuk akal untuk mengadopsinya adalah secara berdampingan, bukan sebagai pengganti — jalankan keduanya pada trafik Anda sendiri, pertahankan yang pengukurannya lebih baik pada data Anda, dan biarkan peralihannya tetap murah.

Clef sendiri tidak ada dalam daftar rute kami; katalog OrcaRouter mengembalikan 404 untuknya, dan tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim ketersediaan dari kami. Yang kami bawa adalah incumbent yang dirancang untuk digantikannya. Jev 1.13 dari TypeSafe adalah rute terdaftar dengan tarif $0,042 per juta token masukan pada konteks 65.536 token, dilayani melalui POST /v1/systemone body yang sama, sehingga uji A/B antara keduanya hanyalah string model, bukan penulisan ulang. Dengan keduanya berada di belakang satu kunci — 200+ model, harga daftar penyedia diteruskan tanpa markup per token, failover otomatis antar penyedia — inilah yang menjaga uji tersebut tetap berjalan setelah minggu ketika seseorang memutuskan untuk memedulikannya, alih-alih merosot menjadi komentar usang di file konfigurasi. Model umum yang Anda simpan untuk bertindak atas apa pun yang disimpulkan model keputusan dapat dijangkau dari kunci yang sama, bukan dari kontrak kedua.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

Apa yang akan mengubah pembacaan ini?

Seseorang di luar Cloudflare perlu menjalankan ulang Decision Index. Suite ini publik dan eval-nya digambarkan sebagai dapat direproduksi, jadi pengujian oleh pihak ketiga adalah pembeda antara tabel vendor dan fakta — dan sel yang paling penting adalah sel yang menunjuk ke arah berlawanan. Angka 97,4 pada deteksi niat di luar cakupan di samping 48,0 pada GPQA Diamond bukanlah kurva kemampuan yang mulus; itu menggambarkan model yang sangat baik pada bentuk klasifikasi dalam distribusi pelatihannya dan jauh lebih lemah dalam penalaran yang belum pernah dilihatnya. Jika itu bertahan dalam pengujian independen, itu adalah fakta paling penting secara operasional tentang Clef dan itu tidak ada dalam sorotan.

Trafik produksi juga perlu terlihat seperti tabel latensi. Median 209 ms yang diukur pada satu H200 tidak menjelaskan apa pun tentang p95 dalam kondisi konkurensi, dan seluruh nilai jual desain ini adalah bahwa ia berada di hot path.

Dan platform fine-tuning perlu menghasilkan sesuatu. Postingan Cloudflare menjelaskan loop RL — AI Gateway untuk menangkap kumpulan data dari trafik Anda sendiri, Workers AI untuk menghasilkan rollout, Containers sebagai sandbox penilaian, Trainer untuk memperbarui bobot, lalu menyebarkan ulang ke Workers AI — dalam postingan yang sama yang mengumumkan model-model tersebut, tanpa hasil pelanggan yang dilampirkan. Clef yang telah di-fine-tune dan mengalahkan model dasar pada tugas yang belum pernah digunakan untuk melatih model dasar akan menjadi bukti yang jauh lebih kuat untuk kategori ini daripada baris mana pun dalam tabel.

Sampai saat itu, ringkasan yang adil adalah ini: Cloudflare merilis model keputusan yang nyata, berlisensi permisif, dan benar-benar cepat, serta membuatnya dapat ditukar dengan sangat mudah dengan model yang hadir lebih dulu. Itu adalah cerita yang lebih baik daripada yang ditawarkan sebagian besar rilis terbuka, dan sejauh ini, itu sepenuhnya masih merupakan versi vendor itu sendiri tentang dirinya.