Kartu judul yang dihasilkan bertuliskan 'Clef vs LFM2.5 2.6B Base', dengan subjudul '55 GB pada H200 versus 5,4 GB pada laptop', serta chip yang bertuliskan '27B model keputusan' dan '2,69B base pra-terlatih'. Logo OrcaRouter dikomposisikan di sudut kanan bawah.
Engineering & Research

Clef vs LFM2.5 2.6B Base: 55 GB di H200, atau 5.4 GB di Laptop

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Berikut adalah perbandingan di mana perangkat keras menentukan argumennya sebelum modelnya melakukannya. Cloudflare/clefadalah model keputusan multimodal dengan 27 miliar parameter, yang dilatih lanjutan dari Qwen3.8-27B, dengan repositori berukuran sedikit lebih dari 55 GB yang tersebar di dua belas shard backbone ditambah satu joint schema head kecil. LiquidAI/LFM2.5-2.6B-Baseadalah checkpoint khusus teks dengan 2,69 miliar parameter yang bobotnya berupa satu berkas tunggal berukuran 5,4 GB, diterbitkan oleh Liquid AI pada 1 Agustus 2026 di bawah LFM Open License. Latensi Clef yang dipublikasikan Cloudflare sendiri — median 209,3 ms, p95 238,6 ms — diukur pada satu unit H200. Sasaran penerapan Liquid AI untuk keluarga LFM2.5-nya adalah laptop, ponsel, atau perangkat genggam Ryzen. Kedua vendor menggambarkan model mereka sebagai kecil, cepat, dan efisien, dan keduanya mengatakan yang sebenarnya tentang mesin yang berbeda.

Ada celah kedua di balik yang pertama, dan itulah yang benar-benar mengubah rencana. Baik Clef maupun LFM2.5 2.6B Base tidak menjawab pertanyaan secara langsung seperti yang mungkin Anda harapkan. Clef hadir sepenuhnya terlatih untuk satu tugas, dan tidak bisa menyimpang darinya: ia menjawab pertanyaan yang diketik, dan tidak akan melakukan hal lain. Checkpoint Liquid hadir tanpa pelatihan untuk apa pun — ini adalah model dasar, sengaja tanpa penyetelan instruksi, dan kartu milik Liquid AI sendiri menyatakan bahwa model ini direkomendasikan hanya untuk fine-tuning yang berat. Jadi, pertanyaan sebenarnya bukanlah mana yang lebih murah untuk dijalankan. Pertanyaannya adalah apakah Anda membeli komponen jadi atau bahan awal, dan jawabannya berbeda untuk masing-masingnya.

Di mana masing-masing dijalankan, dan mengapa itulah keseluruhan perbandingannya

Bentuk deployment bukan catatan pinggir bagi kedua model ini. Untuk model keputusan, itu adalah arsitekturnya, karena forward pass 209 ms dan cerita "berjalan di mesin di depan Anda" adalah klaim yang sama yang diceritakan dari dua ujung yang berbeda.

• Parameter — 27B untuk Clef, dengan encoder visi Qwen3.8-27B tetap dipertahankan; 2.69B hanya teks untuk LFM2.5 2.6B Base.

• Disk — repositori 55 GB untuk Clef; satu file safetensors 5,4 GB untuk checkpoint Liquid, dengan build GGUF, ONNX, dan MLX terkuantisasi yang diterbitkan bersamanya.

• Perangkat Keras — Cloudflare menguji Clef dengan torch 2.11 dan transformers 5.10.2 pada satu H200, dan angka latensinya berasal dari uji tersebut. Saudara pasca-pelatihan checkpoint ini dari Liquid AI berjalan pada 220 token per detik di Apple M5 Max dan 113 tok/s di CPU AMD Ryzen, dalam memori di bawah 2,5 GB, dan vendor mencatat 30 tok/s dapat dicapai di ponsel.

• Konteks — 65.536 token untuk Clef, menurut halaman model Workers AI dan postingan peluncuran; 131.072 token untuk LFM2.5 2.6B Base.

• Masukan — Clef membaca teks, JSON, gambar, dan frame video lalu menilainya secara bersama. Checkpoint Liquid hanya untuk teks.

• Lisensi — Apache-2.0 untuk Clef. LFM Open License v1.0 untuk LFM2.5, yang bersifat source-available dan bukan open source OSI: penggunaan komersial dikondisikan pada organisasi Anda yang tetap berada di bawah $10 juta pendapatan tahunan, dan di atas ambang tersebut lisensinya sama sekali tidak memberikannya. Ambang batas itu adalah fakta pengadaan, bukan catatan kaki.

A two-column comparison scoreboard titled 'Clef vs LFM2.5 2.6B Base — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; On disk: 55 GB repository; Context: 65,536 tokens; Output: probability per option, no text; Hardware: H200 class, 209.3 ms median; Licence: Apache 2.0. The right column 'LFM2.5 2.6B Base' reads: Parameters: 2.69B text-only; On disk: 5.4 GB single file; Context: 131,072 tokens; Output: untuned text continuation; Hardware: laptop, 220 tok/s on M5 Max; Licence: LFM 1.0, $10M revenue threshold. A footer reads 'Clef figures per Cloudflare; LFM figures per Liquid AI's cards. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Biaya per keputusan bukanlah pertanyaan yang sama dengan biaya per token

Godaan di sini adalah membagi dua harga lalu menobatkan pemenang. Cara itu tidak bertahan saat berhadapan dengan apa yang sebenarnya dilakukan kedua model tersebut.

Clef adalah $0,24 per juta token masukan di Workers AI milik Cloudflare. Keluarannya bukan prosa, jadi baris token keluaran yang biasa tidak ada; Anda membayar untuk state, sekali, dan mendapatkan distribusi kembali. Bagi lapisan perutean yang membuat jutaan keputusan kecil per hari, angka itu adalah keseluruhan biaya operasional, dan itu adalah angka yang hanya bisa Anda dapatkan dari vendor, bukan dari tagihan listrik Anda sendiri.

LFM2.5 2.6B Base tidak memakan biaya apa pun per panggilan dan tidak dapat membuat keputusan. Untuk mendapatkan biaya per keputusan darinya, Anda harus melakukan fine-tuning padanya terlebih dahulu untuk tugas Anda, yang berarti mengumpulkan data, menjalankan pekerjaan pelatihan, mengevaluasi hasilnya, dan baru setelah itu mengetahui berapa biayanya dalam kVA dan waktu rekayasa. Ekonomi yang menarik dari checkpoint 2.6B itu nyata, tetapi berada di hilir dari pekerjaan yang belum terjadi, dan orang yang membandingkan harga per token telah melewatinya begitu saja.

Cara membingkai yang jujur adalah bahwa ini adalah dua pembelian yang berbeda. Clef adalah komponen dengan harga daftar dan tagihan hosting. Checkpoint Liquid adalah bahan mentah yang biayanya adalah proses pelatihan yang akan Anda bayar bagaimanapun juga — dan imbalannya adalah setelah itu Anda memiliki artefak tersebut sepenuhnya, dan pada titik itu biaya marginal dari sebuah keputusan benar-benar hanyalah listrik. Untuk tugas yang sempit, bervolume tinggi, dan stabil, pertukaran itu sering kali tepat. Untuk tugas yang belum Anda tentukan dengan jelas, hal itu terbalik, karena Anda tidak dapat melakukan fine-tuning menuju target yang tidak dapat Anda gambarkan.

Base yang belum dilatih bukan model yang lebih buruk, melainkan garis awal yang berbeda.

Menggoda untuk menafsirkan tabel benchmark yang tidak ada pada checkpoint Liquid sebagai kelemahan tersembunyi. Tidak demikian. Menilai model dasar praterlatih pada benchmark pengikutan instruksi akan mengukur ketiadaan fine-tuning, bukan kualitas substratnya; itulah tepatnya alasan Liquid AI menguji LFM2.5-2.6B pascapelatihan dan membiarkan model dasarnya tanpa evaluasi. Kekosongan itu dapat diverifikasi dari sisi Anda, dan itulah intinya: unduh 5,4 GB, jalankan evaluasi Anda sendiri pada tugas Anda sendiri, dan ketahui jawabannya sebelum Anda berkomitmen untuk menyajikan apa pun.

Tabel Clef adalah bentuk bukti yang berlawanan dan memiliki masalah yang berlawanan. Cloudflare menerbitkan 40-an baris tolok ukur, satu set evaluasi alur kerja lengkap dan distribusi latensi, dan setiap satunya diproduksi oleh Cloudflare pada Decision Index milik Cloudflare sendiri, tanpa ada pihak ketiga yang mereproduksi bagian mana pun darinya. Kolom Clef jauh lebih informatif daripada kolom Liquid, dan tidak ada satu pun angka di dalamnya yang telah diperiksa oleh orang lain. Itu adalah klaim yang lebih kuat daripada kosong, dan lebih lemah daripada yang terlihat.

Apa yang dapat Anda ukur sendiri terbagi dengan cara yang sama. Dengan checkpoint Liquid, Anda dapat mengukur semuanya — ukurannya 5,4 GB di disk Anda sendiri. Dengan Clef, bobot Apache-2.0 juga dapat Anda unduh dan jalankan, tetapi untuk menyamai median 209 ms Cloudflare, diperlukan kelas GPU yang digunakan Cloudflare, sehingga dalam praktiknya sebagian besar tim akan mengukurnya melalui endpoint yang dihosting dan mewarisi ketersediaan vendor beserta latensinya.

Di mana lapisan routing cocok, untuk masing-masing

Baik Clef maupun varian LFM2.5 mana pun bukan rute di OrcaRouter, dan artikel ini bukan klaim ketersediaan — katalognya mengembalikan 404 untuk keduanya, jadi Clef berasal dari Workers AI milik Cloudflare atau GPU Anda sendiri, dan checkpoint Liquid berasal dari distribusinya sendiri.

Apa yang sebenarnya menjadi tujuan lapisan routing di sini adalah pola yang disiratkan kedua model. Skorer kecil berbatas yang memutuskan, dan generalis yang lebih besar yang bertindak atas keputusan tersebut, secara konstruksi merupakan arsitektur dua model — dan backbone milik Clef sendiri membuat paruh kedua dari itu konkret, karena model yang di-post-train oleh Cloudflare, Qwen3.8 27B, adalah rute terdaftar dengan tarif $0.33 per juta token masukan dan $2.40 per juta token keluaran dalam konteks 262,144 token. Satu endpoint di depan 200+ model berarti penentu murah dan aktor yang cakap berada di balik kunci yang sama, disusun menjadi satu panggilan melalui routing DSL alih-alih dirangkai secara manual, dengan failover otomatis sehingga hari buruk penyedia tidak ikut menjatuhkan jalur keputusan. Jika sebaliknya Anda melakukan self-hosting checkpoint Liquid dan membandingkan fine-tune Anda dengan model-model yang harus dikalahkannya, endpoint yang sama itulah yang membuat perbandingan tersebut menjadi perubahan konfigurasi alih-alih siklus pengadaan.

Jev 1.13 dari TypeSafe layak disebutkan khusus untuk kasus self-hosting: ini adalah model keputusan yang dijadikan tolok ukur oleh Cloudflare dan dengan sengaja menggunakan POST /v1/systemone bentuk permintaan yang sama seperti Clef, ini adalah rute yang terdaftar dengan tarif $0,042 per juta token input dalam konteks 65.536 token, dan ini adalah cara berupaya rendah untuk mengetahui apakah model keputusan yang terbatas membantu pipeline Anda sebelum Anda menghabiskan satu sesi pelatihan pada substrat yang mungkin tidak perlu ada.

A headless capture of the OrcaRouter model page for qwen/qwen3.8-27b, showing the Qwen breadcrumb, the Qwen3.8 27B title with a 262K context marker, the text, image and video input modalities, and the site's Code samples, Pricing, Performance, Public benchmarks and FAQ navigation tabs.

Yang mana, untuk apa

Gunakan checkpoint Liquid ketika tugasnya sempit, bervolume tinggi, dispesifikasikan cukup baik sehingga Anda dapat menulis data pelatihan untuknya, dan dibatasi oleh salah satu dari dua kendala keras yang tidak dapat diatasi oleh API yang dirutekan: data tidak boleh meninggalkan infrastruktur Anda, atau mesin yang harus menjalankannya adalah mesin yang ada di meja Anda. Ambang batas pendapatan LFM 1.0 adalah hal pertama yang perlu diperiksa, karena itu menentukan apakah lisensinya bahkan tersedia untuk Anda.

Gunakan Clef ketika keputusannya sudah dapat dienumerasi, state-nya muat dalam 64K, jawabannya membutuhkan probabilitas yang terkalibrasi alih-alih sebuah kalimat, dan 209 ms di jalur panas adalah properti yang Anda beli. Skema tetapnya adalah fiturnya — bentuk keluaran yang dapat diaudit, dapat direproduksi, tanpa parser — dan jejak 55 GB-nya adalah harga dari backbone yang membuatnya akurat pada percobaan pertama alih-alih setelah proses pelatihan.

Yang seharusnya tidak Anda lakukan adalah memilih berdasarkan jumlah parameter. Model 2,69B yang harus dilatih terlebih dahulu sebelum dapat menjawab bukanlah versi lebih kecil dari model 27B yang sudah bisa menjawab, dan dua angka dalam judul — 55 GB dan 5,4 GB — menggambarkan dua anggaran yang berbeda, bukan dua titik pada satu skala.

A headless capture of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the model title, the TextGeneration and Transformers and Safetensors tags, a 16-languages marker, the Liquid AI organisation, and the opening line describing the LFM2.5 family as hybrid models designed for on-device deployment.

Pertanyaan yang belum terjawab, dan itu adalah pertanyaan yang sama untuk keduanya.

Tidak ada vendor yang telah menerbitkan bukti yang bertahan terhadap pengujian independen. Uji Decision Index Cloudflare dilakukan sendiri dan tidak direproduksi; angka throughput Liquid AI adalah pengukuran vendor sendiri pada perangkat keras yang dipilihnya. LFM2.5 2.6B Base sama sekali tidak memiliki tolok ukur, dan itu memang disengaja, sementara tabel Clef memiliki sangat banyak tolok ukur karena pilihan.

Untuk checkpoint Liquid, bukti yang hilang murah untuk diperbaiki dan sepenuhnya di tangan Anda — berkasnya cukup kecil untuk dievaluasi di laptop dalam satu sore. Untuk Clef, tidak demikian: mereproduksi median 209 ms memerlukan perangkat keras yang digunakan Cloudflare dan status yang belum disusun oleh siapa pun di luar Cloudflare. Asimetri itulah, lebih dari apa pun dalam kedua spesifikasi, yang seharusnya menentukan mana dari keduanya yang menjadi pusat rencana Anda bulan ini.