
Clef vs Gemma 4 12B: Perangkat Keputusan 64K-Token Melawan Generalis 256K-Token
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 219 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Angka paling berguna dalam perbandingan antara Clef dan Gemma 4 12B bukanlah skor benchmark. Angka itu adalah 65.536 berbanding 256.000 — jendela konteks. Cloudflare/clef adalah model keputusan multimodal berparameter 27 miliar, yang dilatih lanjut dari Qwen3.8-27B, yang membaca sebuah state dan skema pertanyaan bertipe lalu mengembalikan probabilitas untuk setiap jawaban yang diizinkan dalam satu lintasan non-autoregresif. Gemma 4 12B — checkpoint Unified, google/gemma-4-12B-it — adalah model any-to-any tanpa encoder milik vendor tersebut dengan 11,95 miliar parameter, yang dirilis pada musim panas 2026, yang menghasilkan teks dalam jendela 256.000 token di lebih dari 140 bahasa. Hadapkan satu folder kontrak kepada keduanya, dan model keputusan itu kehabisan ruang empat kali lebih cepat, karena plafonnya terdokumentasi 65.536 token sementara milik model generalis 256.000. Asimetri itu bukan catatan kaki. Untuk satu kelas pekerjaan routing secara keseluruhan — dokumen panjang, utas yang ditempel, formulir multi-halaman — hal itu menentukan pilihan bahkan sebelum akurasi dibahas.
Jadi ini bukan halaman tentang model mana yang lebih baik. Ini halaman tentang dua sumbu yang benar-benar membedakan keduanya: seberapa banyak state yang dapat ditampung masing-masing, dan bentuk jawaban seperti apa yang secara fisik mampu dihasilkan masing-masing. Segala hal lainnya adalah entah angka vendor yang belum pernah direproduksi siapa pun atau perbandingan yang maknanya tidak seperti yang terlihat.
Apa masing-masingnya, dalam satu paragraf masing-masing.
Clef adalah model keputusan 27B milik Cloudflare, dirilis di bawah Apache-2.0 dengan bobotnya di Hugging Face dan endpoint yang dihosting di Workers AI. Cloudflare membekukan backbone Qwen3.8-27B termasuk vision encoder-nya, menambahkan head skema gabungan plus adapter low-rank rank-256, dan melatihnya menggunakan cross-entropy dengan penghalusan label untuk jawaban skema yang valid, bersama Brier loss untuk mempertajam kalibrasi. Anda memasok state — teks, JSON, gambar, atau frame video — dan satu hingga 64 pertanyaan bernama, masing-masing bertipe noul (benar/salah, mengembalikan probabilitas benar), choice (2 hingga 26 opsi bernama) atau score (2 hingga 26 tingkat berurutan). Yang dikembalikan adalah distribusi per pertanyaan dan tidak ada yang lain. Tidak ada jalur generasi teks sama sekali.
Gemma 4 12B adalah model generalis yang menghasilkan teks. Ia tanpa encoder: alih-alih menara visi atau audio yang terpisah, patch gambar mentah dan bentuk gelombang diproyeksikan langsung ke ruang embedding model bahasa melalui lapisan linear yang ringan, itulah yang memungkinkannya menerima teks, gambar, video, dan audio tanpa pipeline per modalitas. Ia memiliki mode berpikir yang dapat dikonfigurasi, pemanggilan fungsi native, kosakata 262K, dan skema atensi hibrida yang menyelang-seling atensi jendela geser 1.024 token dengan atensi global penuh. Ia berlisensi Apache-2.0 dengan syarat penggunaan milik vendor sendiri di sampingnya, dan inilah checkpoint yang dimaksud kebanyakan orang saat mengatakan "jalankan ukuran ini secara lokal."
Satu hal yang perlu dinyatakan dengan jelas sebelum melanjutkan: tidak ada model yang merupakan rute di OrcaRouter. Katalog kami mengembalikan 404 untuk cloudflare/clef dan untuk checkpoint 12B di keluarga yang sama, dan tidak ada apa pun dalam tulisan ini yang boleh dibaca sebagai klaim ketersediaan dari kami. Yang kami sediakan dari keluarga Gemma adalah dua ukuran yang lebih besar, dan harganya tertera lebih jauh di bawah.

Daftar opsi adalah antarmuka, dan ia memiliki mode kegagalan
Perbedaan struktural antara keduanya adalah apa yang terjadi pada input yang tidak sesuai.
• Keluaran — Clef mengembalikan probabilitas untuk setiap opsi yang dideklarasikan, dan hanya opsi tersebut. Gemma 4 12B mengembalikan teks yang dihasilkan.
• Penolakan — Clef tidak memiliki "tidak ada yang di atas" kecuali Anda sendiri menuliskannya ke dalam kriteria. Gemma 4 12B dapat mendeskripsikan kasus yang tidak cocok dengan apa pun yang Anda tanyakan.
• Mode kegagalan — Kesalahan Clef bersifat senyap: pilihan yang penuh keyakinan di dalam skema Anda, tidak ada pengecualian yang dimunculkan, tidak ada cabang cadangan yang terpicu. Kesalahan generalis biasanya berisik: prosa yang tidak dapat diuraikan.
• Kemampuan Uji — kumpulan opsi tetap membuat komponen dapat direproduksi dan murah untuk diaudit. Teks bebas membuatnya fleksibel dan mahal untuk divalidasi.
Angka Clef sendiri untuk masalah penolakan itu adalah angka terlemah yang dipublikasikannya. Pada CLINC150 dengan penanganan out-of-scope — deteksi intent di mana salah satu jawaban yang valid adalah "ini tidak termasuk kategori mana pun" — 27B mencetak skor 97.4 macro-F1, yang merupakan yang terbaik di tabel Cloudflare dan alasan untuk lebih peduli pada 27B dibandingkan saudara 9B-nya sendiri, yang mencetak 66.8 pada benchmark yang sama. Selisih tiga puluh poin antara dua model yang dibangun dari resep yang sama menunjukkan bahwa perilaku out-of-scope adalah hal yang diperoleh dari skala pasca-pelatihan, dan itulah hal yang diam-diam menjadi sandaran sebagian besar pipeline routing. Mitigasi yang didokumentasikan Cloudflare adalah pertanyaan kedua dalam skema — tambahkan bidang noul yang menanyakan apakah state tersebut cocok sama sekali, lalu terapkan ambang batas — yang berhasil, dan yang merupakan tugas Anda, bukan tugas model.
Dari mana angka-angka itu berasal lebih penting daripada apa yang mereka katakan
Setiap angka Clef dalam artikel ini berasal dari Cloudflare: kartu modelnya, postingan peluncurannya, atau pengujian Decision Index-nya. Suite itu sendiri milik Cloudflare, dan papan peringkat yang menghosting skor tersebut juga milik Cloudflare. Itu adalah pemasok yang mengukur produknya pada perangkat keras yang dikendalikannya sendiri terhadap pesaing yang API-nya sengaja ditiru. Tidak ada pihak ketiga yang mereproduksi satu pun dari itu, dan tulisan ini tidak akan berpura-pura sebaliknya.
Kolom Gemma 4 12B adalah jenis bukti yang berbeda. Kartu milik vendor sendiri mencantumkan MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 tanpa alat pada 77,5%, dan LiveCodeBench v6 pada 72,0%. Artificial Analysis, pemantau independen, mengindeks konfigurasi penalaran itu pada Intelligence Index 14,18 dengan tarif yang tercantum $0,10 / $0,30 per juta token dan kecepatan output median terukur sekitar 113 token per detik — dan halamannya sendiri mencatat bahwa angka-angka tersebut bergantung pada beban kerja dan perangkat keras.
Pembacaan yang jujur adalah bahwa kedua kolom itu sama sekali tidak dapat dibandingkan. Yang satu adalah rangkaian penilaian kualitas keputusan milik vendor yang dijalankan oleh vendor itu sendiri; yang lain adalah campuran tolok ukur vendor dan evaluasi independen terhadap sebuah model umum. Mengutip angka 97,4 di samping 77,2 seolah-olah keduanya adalah kolom dari tabel yang sama akan menjadi hal paling menyesatkan yang bisa dilakukan halaman ini.
Latensi adalah satu-satunya tempat di mana keduanya setidaknya dapat dibahas dalam satuan yang sama, dan bahkan di sana peringatannya menumpuk. Cloudflare melaporkan Clef pada median 209,3 ms dan p95 238,6 ms, yang diukur pada infrastrukturnya sendiri. Artificial Analysis mengukur waktu ke chunk pertama model 12B pada sekitar 2,4 detik dalam konfigurasi penalaran, yang mencakup anggaran berpikir yang tidak dimiliki model keputusan tersebut. Pass non-autoregresif 209 ms dibandingkan awal generasi 2,4 detik adalah perbedaan arsitektural yang nyata — satu forward pass versus loop decoding — dan itu adalah argumen terkuat yang dimiliki Clef untuk jalur panas. Pada 27B, ini juga merupakan model yang membutuhkan perangkat keras kelas H200 untuk mencapai angka tersebut, dan Cloudflare mengenakan biaya $0,24 per juta token masukan untuk menjalankannya bagi Anda.

Apa yang sebenarnya bisa Anda dapatkan dari 64K konteks
Konteks adalah titik ketika perbandingan ini menjadi praktis dan ketika si generalis menang di atas kertas dengan selisih yang besar.
• Clef — 65.536 token, menurut halaman model Workers AI dan postingan peluncurannya; helper encoding bawaan secara default disetel ke max_length=16,384, yang merupakan nilai default, bukan batas maksimum, tetapi itulah default yang akan Anda dapatkan jika menggunakan loader sebagaimana dikirimkan.
• Gemma 4 12B — 256.000 token, menurut kartu vendor, dengan perhatian jendela geser 1.024 token untuk menekan biaya konteks panjang.
• Gambar — Clef memberi skor pada gambar dan bingkai video secara bersamaan dengan status teks melalui encoder visi yang diwarisi. Gemma 4 12B menerima teks, gambar, video, dan audio melalui jalur bebas encoder-nya.
• Bahasa — Kartu Clef tidak membuat klaim multibahasa; Gemma 4 12B didokumentasikan dalam lebih dari 140 bahasa.
Untuk tiket, faktur, atau tangkapan layar yang dirender, 64K itu cukup besar dan perbedaannya bersifat akademis. Untuk kontrak 200 halaman yang ingin Anda klasifikasikan bidang demi bidang, itulah inti persoalannya: model generalis dapat menampung dokumen itu, sedangkan model keputusan tidak. Jawaban Clef untuk hal itu adalah chunking, dan melakukan chunking pada dokumen sebelum Anda memutuskan tentangnya berarti Anda sudah membuat keputusan yang seharusnya dibuat oleh model. Itu adalah batasan yang nyata dan layak dinyatakan sebagai batasan.
Berapa yang sebenarnya akan Anda bayar, dan di mana
Tidak satu pun dari kedua model itu ada di katalog kami, jadi pertanyaan harga terbagi menjadi tiga.
• Clef — $0.24 per juta input di Workers AI milik Cloudflare, atau dihosting sendiri dari bobot Apache-2.0; latensi yang dipublikasikan Cloudflare diukur pada satu H200 dengan torch 2.11 dan transformers 5.10.2, dan kuantisasi komunitas yang muncul dalam dua hari menunjukkan bahwa ini dapat dibuat lebih kecil lagi dengan konsekuensi akurasi yang belum diukur oleh siapa pun.
• Gemma 4 12B — sama sekali tidak ada rute hosted di sini. Anda mengambil sekitar 24 GB bobot BF16 dan melayankannya sendiri, atau beralih ke platform pihak ketiga. Tidak ada harga per token yang dapat kami cantumkan.
• Pengganti yang dirutekan — Gemma 4 26B A4B, sebuah mixture-of-experts dengan total 25,2B dan 3,8B parameter aktif, terdaftar di OrcaRouter pada $0,06 per juta token input dan $0,33 per juta token output dengan konteks 262.144 token. Gemma 4 31B, saudara multimodal padat dengan pemikiran yang dapat dikonfigurasi dan pemanggilan fungsi native, terdaftar pada $0,13 dan $0,38. Keduanya berada pada satu kunci dengan harga daftar penyedia diteruskan tanpa markup per token dan failover otomatis antar penyedia.
Baris terakhir itu adalah versi jujur dari keterlibatan kami dalam perbandingan ini. Jika yang Anda butuhkan adalah generalis yang membaca dokumen panjang dan menulis satu kalimat, rute murah untuk mendapatkannya adalah ukuran Gemma 4 yang benar-benar kami layani, dan biayanya lebih rendah per juta token daripada menjalankan sendiri model 12B di GPU sewaan. Jika yang Anda butuhkan adalah keputusan terbatas di jalur panas, median 209 ms milik Clef adalah properti arsitektur yang nyata, dan hal terdekat dengannya di katalog kami adalah Jev 1.13 milik TypeSafe — model yang dijadikan tolok ukur oleh Cloudflare dan yang format pengirimannya disalin — dengan $0,042 per juta token masukan pada konteks 65.536 token, dilayani melalui POST /v1/systemone bentuk yang sama. Karena keduanya kompatibel dengan API di balik adaptor tipis, mencoba Clef terhadap inkumben adalah eksperimen, bukan migrasi, dan eksperimen itu tetap murah ketika kedua sisi dapat dijangkau melalui satu endpoint.

Keputusan itu, dinyatakan sebagai sebuah keputusan
Pilih Clef ketika jawabannya dapat dienumerasi, state-nya muat dalam 64K, keputusannya berada di jalur yang sensitif terhadap latensi, dan Anda bersedia menangani sendiri kelas residualnya. Skor 97,4 dari 27B pada deteksi intent di luar cakupan adalah alasan Anda mau membayar untuknya dibandingkan varian 9B, dan bentuk output tetapnya membuat komponen ini dapat diaudit tanpa parser.
Pilih Gemma 4 12B saat inputnya panjang, saat modalitasnya audio atau video, saat jawabannya perlu berupa prosa, atau saat kategorinya belum diketahui — karena "triase tumpukan ini ke dalam pengelompokan apa pun yang masuk akal" adalah permintaan yang tidak dapat diterima oleh model keputusan, bukan permintaan yang ditanganinya dengan buruk. Ini adalah generalis dengan evaluasi independen di belakangnya, dan untuk pekerjaan terbuka itu lebih bernilai daripada tabel vendor.
Dan bersikap skeptis terhadap kedua kumpulan angka itu karena alasan yang terus diulang artikel ini: Cloudflare belum direproduksi secara independen pada apa pun, dan kartu itu adalah tabel benchmark milik vendor sendiri. Satu angka yang benar-benar menarik dalam pasangan itu — apakah kepala skema 27B benar-benar mempertahankan skor di luar cakupan 97,4-nya pada data yang tidak digunakan untuk pelatihannya — justru merupakan angka yang tidak dapat dipastikan oleh kedua vendor dan bisa dipastikan oleh pihak ketiga.
