Kartu judul hero berjudul 'Liquid AI d1-3B vs LFM2.5-2.6B-Base' dengan subjudul 'model keputusan dan leluhurnya sendiri', digambar sebagai pohon keluarga dari kiri ke kanan: kartu berlabel LFM2.5-2.6B-Base bobot mentah, panah berlabel pasca-pelatihan, dan kartu berlabel d1-3B menjawab pertanyaan, dengan chip keep-training di bawah kartu kiri dan chip ya/tidak, label, serta skor di bawah kartu kanan.
Guides & Insights

Liquid AI d1-3B vs LFM2.5-2.6B-Base: Model Keputusan dan Nenek Moyangnya Sendiri

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ini bukan pertarungan antara dua rival. Liquid AI d1-3B, model keputusan berbobot terbuka yang diterbitkan Liquid AI pada 7 Oktober 2026, dibangun di atas basis yang dikonstruksi vendor dengan merata-ratakan bobot LFM2.5-2.6B dengan tulang punggung teks LFM2.5-VL-3B. LFM2.5-2.6B-Base adalah induk pertamanya — checkpoint pra-latih mentah yang diunggah Liquid pada 1 Agustus 2026, 2,69 miliar parameter, 34 triliun token pelatihan, konteks 131.072 token, tanpa penyetelan instruksi dan tanpa templat obrolan. Jadi, kerangka yang jujur untuk perbandingan ini adalah keturunan melawan leluhur: sebuah model yang telah dilatih lanjut untuk pekerjaan yang sangat spesifik, berdiri di samping substrat yang belum dibentuk yang menjadi asal pembentukannya. Salah satunya menjawab pertanyaan malam ini. Yang lain adalah tempat Anda memulai jika pertanyaan yang perlu dijawab bukan pertanyaan yang sudah diajukan siapa pun sejauh ini.

Apa sebenarnya masing-masing itu

Dua kartu model itu terbaca seperti dokumen dari tahap berbeda dalam lini produksi, dan perbedaannya bukan sekadar gaya.

Liquid AI d1-3Bmembawa 3,12B parameter, encoder visi SigLIP2 NaFlex sebesar 400M, jendela konteks 32.768 token, kosakata 128.000 token, dan enam belas bahasa yang didokumentasikan. Ini adalah model keputusan: Anda memberinya sebuah state dan pertanyaan bernama, lalu ia mengembalikan probabilitas ya/tidak, label terpilih beserta tingkat keyakinan dan distribusi opsi lengkap, atau skor terurut — dalam satu forward pass, tanpa token keluaran yang dihasilkan. Model ini menyertakan panggilan system_one untuk satu state dengan beberapa pertanyaan, varian batch yang mengemas banyak permintaan tanpa padding, dan pengakses probabilities mentah untuk distribusi yang mendasarinya. Ini bukan model chat dan tidak menulis teks, dan kartu model menyatakannya dengan kata-kata itu.

LFM2.5-2.6B-Basemembawa 2,69B parameter dalam 30 lapisan — 22 blok konvolusi pendek bergerbang ganda dan 8 blok attention grouped-query — dilatih pada 34 triliun token dan diperluas ke konteks 131.072 token selama mid-training, dengan kosakata 128.000 token yang sama dan enam belas bahasa yang sama. Ini adalah checkpoint teks-saja yang telah dilatih sebelumnya tanpa penyetelan instruksi, tanpa benchmark di kartunya, dan rekomendasi yang terbaca seperti peringatan: gunakan hanya untuk tugas yang membutuhkan fine-tuning berat. Ini menyelesaikan teks. Ini tidak mengikuti instruksi.

Keduanya adalah unduhan tanpa gerbang di bawah lisensi terbuka milik Liquid sendiri. Keduanya mengutamakan teks. Tidak satu pun ada di katalog kami, dan tidak ada apa pun di sini yang merupakan klaim ketersediaan untuk salah satu dari keduanya.

A two-column scoreboard for Liquid AI d1-3B and LFM2.5-2.6B-Base. The d1-3B column reads: role post-trained decision model; 3.12B parameters; 32,768-token context; text and image input; Decision Index 48.57 (vendor); answers a question in 8 ms. The base column reads: role raw pre-trained base; 2.69B parameters; 131,072-token context; text-only input; Decision Index not scoreable; answers a question only after you fine-tune. The footer reads 'd1-3B figures vendor-reported; the base checkpoint publishes no benchmark table.'

Garis keturunannya adalah bagian yang menarik.

Liquid tidak melakukan fine-tuning pada model baru untuk rilis d1. Ia merata-ratakan dua checkpoint — LFM2.5-2.6B dan tower teks dari LFM2.5-VL-3B — untuk mendapatkan titik awal yang lebih baik, lalu melakukan fine-tuning pada beberapa run dengan seed acak dan campuran data yang berbeda dan menggabungkannya kembali. Uraian vendor tentang apa yang meningkatkan hasil sangat mencolok karena bebas dari teknik eksotis: pelatihan pada input panjang, mengacak urutan kemunculan opsi jawaban, dan menghapus jalan pintas dari data pelatihan lebih berdampak daripada metode canggih apa pun yang mereka coba.

Detail penghapusan jalan pintas itu layak direnungkan sejenak, karena hal itu menyebutkan kegagalan yang ingin dihindari oleh kategori ini. Model yang dilatih untuk menjawab pertanyaan pilihan ganda akan dengan senang hati mempelajari bahwa opsi B biasanya benar, atau bahwa opsi terpanjang yang menang. Mengacak urutan opsi selama pelatihan adalah yang menghentikannya. Model keputusan yang telah mempelajari prior posisi alih-alih membaca keadaan itu lebih buruk daripada tidak berguna — ia salah dengan penuh keyakinan pada skala besar — dan itulah hal spesifik yang membedakan model keputusan sejati dari pengklasifikasi yang hanya diberi prompt.

Ada juga regresi yang perlu disebut secara gamblang, karena vendor tidak menyebutkannya: checkpoint dasar memiliki jendela konteks 131.072 token dan Liquid AI d1-3B memiliki 32.768. Pasca-pelatihan menjadi model keputusan menghabiskan tiga perempat konteks yang dapat digunakan. Jika Anda membayangkan bahwa turunannya secara ketat mendominasi pendahulunya pada setiap sumbu, ternyata tidak, dan keputusan dokumen panjang adalah sumbu di mana checkpoint yang lebih tua memiliki lebih banyak ruang — secara prinsip, meskipun ia tidak memiliki head keputusan untuk memanfaatkannya.

Papan skor, dengan asimetri yang melekat

Membandingkan keduanya pada benchmark adalah kesalahan kategori, tetapi ini adalah kesalahan kategori yang informatif, tetapi ini adalah kesalahan kategori yang informatif... dengan peringatan yang ada. Setiap angka d1-3B adalah milik Liquid sendiri, dinilai oleh vendor dengan penilai resmi alih-alih dikirim ke papan peringkat publik, dan tidak direproduksi oleh pihak ketiga mana pun. Setiap angka LFM2.5-2.6B-Base tidak ada karena model dasar tidak memiliki apa pun untuk diukur.

• Decision Index 0.2.1 — Liquid AI d1-3B 48.57, pertama di antara semua yang di bawah 10B dalam tabel vendor dan unggul atas model keputusan yang ukurannya dua belas kali lipatnya. LFM2.5-2.6B-Base — tidak dinilai, tidak dapat dinilai tanpa head keputusan.

• Tolok ukur teks — Liquid AI d1-3B rata-rata 82,9 pada tujuh tolok ukur publik yang mencakup pemahaman, toksisitas, niat, QA medis, dan pemahaman lintas bahasa. LFM2.5-2.6B-Base tidak menerbitkan tabel tolok ukur sama sekali.

• Visi — Liquid AI d1-3B rata-rata 74,1 pada sebelas tolok ukur gambar yang dibaca sebagai keputusan; menghilangkan gambarnya menurunkan pertanyaan yang sama menjadi 45,1. LFM2.5-2.6B-Base hanya teks, tanpa tower visi.

• Parameter — 3,12B dibandingkan dengan 2,69B. Model keputusan adalah yang lebih besar di antara keduanya, yang merupakan kebalikan dari narasi pasca-pelatihan yang biasa.

• Konteks — 32.768 token versus 131.072. Leluhur memenangkan baris ini dan ini satu-satunya baris yang dimenangkannya.

• Latensi — Liquid AI d1-3B menjawab satu pertanyaan dalam 8 ms pada RTX 4090 dan 50 ms pada Jetson Orin Nano, serta menjalankan 64 packed states pada 475 per detik di 4090. LFM2.5-2.6B-Base tidak memiliki latensi yang bisa disebutkan sampai Anda melakukan fine-tuning terhadapnya menjadi sesuatu yang menjawab pertanyaan, dan pada titik itu angkanya adalah angka dari hasil fine-tune Anda.

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

Apa yang sebenarnya Anda pilih di antara, dalam praktiknya

Aturan keputusan di sini luar biasa bersih, karena kedua titik pemeriksaan tersebut tidak bersaing untuk pos anggaran yang sama.

Gunakan Liquid AI d1-3B ketika pertanyaannya sudah ada dan berbentuk salah satu dari tiga bentuk yang ditangani model keputusan: ya atau tidak, pilihan dari himpunan bernama, atau penilaian pada skala berurutan. Aplikasi yang dipublikasikan semuanya adalah pekerjaan produksi yang mudah dikenali — triase dan perutean, moderasi, klasifikasi maksud dan topik, pemeriksaan ekstraksi, perankingan ulang, pagar pengaman agen, dan inspeksi visual. Angka demo yang dijalankan vendor pada 5 Oktober menempatkan d1 melawan GPT-6.1 Sol dan Claude Opus 5.5 pada enam tugas semacam itu dan mengklaim d1 setara atau mengalahkan GPT-6.1 Sol pada empat tugas dengan biaya 19x hingga 200x lebih murah; halaman metodologi menyatakan secara gamblang bahwa setiap aplikasi dijalankan sekali per model, jadi perlakukan bentuk klaimnya sebagai temuan, bukan angka di belakang koma. Yang benar-benar mencolok adalah demo inspeksinya: penyortiran barang bagus versus cacat di empat lini produksi dengan akurasi 85 hingga 97% pada tugas yang tidak pernah dilatihkan kepada model, yang dipahami hanya dari deskripsi singkat.

Ambil LFM2.5-2.6B-Base ketika pertanyaannya belum ada. Ini adalah titik awal yang lebih murah untuk fine-tune yang ingin Anda miliki sendiri — head keputusan domain, classifier khusus, tugas yang belum ada checkpoint-nya. Anda mewarisi arsitektur, tokenizer, dan konteks panjang, dan Anda membayar dengan komputasi, data, dan evaluasi. Dua dari empat aplikasi yang dibangun vendor di sekitar d1 dimulai dari proyek open-source alih-alih dari nol, yang merupakan gambaran wajar tentang apa yang sebenarnya dihasilkan oleh checkpoint dasar plus disiplin.

Jebakan praktisnya adalah memperlakukan base checkpoint sebagai pengganti langsung. Ia bukan asisten, tidak akan mengikuti prompt, dan bila dievaluasi sebagai model chat, skornya mendekati nol — itu bukan fakta tentang kualitasnya, melainkan fakta tentang apa arti "base".

Self-hosting salah satu dari keduanya, dan lapisan di atasnya

Keduanya hadir sebagai bobot, dan vendor melakukan pekerjaan penerapan untuk sisi d1: dukungan llama.cpp sejak hari pertama, tumpukan NVIDIA lengkap dari DGX hingga Jetson, kuantisasi NVFP4, varian bobot-dan-aktivasi 8-bit, serta konversi GGUF di Hugging Face. Checkpoint dasarnya memiliki varian GGUF, ONNX, dan MLX sendiri melalui keluarga LFM2.5 yang lebih luas. Jika Anda lebih memilih untuk tidak menghosting apa pun, Liquid menyediakan d1 yang dihosting dari API-nya sendiri dengan harga yang dihitung hanya berdasarkan token input, dengan gambar ditagih sebesar 1,5 token per patch 32×32 piksel; akses khusus teks juga tersedia melalui platform pihak ketiga.

Yang tidak diubah oleh kedua jalur itu adalah bagian lain dari tumpukan teknologi. Model yang Anda hosting adalah model yang harus Anda jaga tetap hidup, versikan, dan failover — dan keputusan yang diaturnya tetap mendarat di samping panggilan generatif yang tidak Anda hosting. Campuran itulah lapisan yang diruntuhkan oleh router: satu endpoint untuk 200+ model, harga daftar penyedia diteruskan tanpa markup 0% sehingga perubahan harga vendor langsung berlaku di sisi Anda pada hari yang sama, dan failover otomatis sehingga sore buruk salah satu upstream tidak menjadi gangguan layanan Anda. Menghosting sendiri model keputusan 3B di sampingnya justru membuat pertanyaan routing semakin tajam, bukan semakin lunak, karena kini Anda memiliki separuh pipeline dan menyewa separuh lainnya.

Yang mana, untuk siapa

Jika pertanyaan yang perlu Anda jawab minggu ini adalah salah satu dari tiga bentuk yang dapat diambil oleh model keputusan, dan itu adalah pertanyaan yang sudah pernah dibayangkan orang lain, turunannya sudah selesai dan gratis serta berjalan dalam 50 ms di perangkat tanpa GPU — ambil Liquid AI d1-3B dan selesai sudah.

Jika Anda sedang membangun hal yang menjawab pertanyaan yang belum ditanyakan siapa pun, dan Anda memiliki data serta daya komputasi untuk menguasainya, LFM2.5-2.6B-Base adalah titik awal yang jujur, dan perlu diketahui bahwa turunan dalam artikel ini dibuat darinya melalui jalur yang persis akan Anda tempuh.

Dan jika Anda tidak yakin sedang berada dalam situasi yang mana dari kedua situasi itu, jawabannya hampir selalu yang pertama. Pasca-pelatihan menjadi head keputusan adalah langkah yang mahal; menjalankan milik orang lain itu gratis.

A capture of our own models catalogue page, showing the filter rail for input modalities, context length, input price, status, series and supported parameters, a header reading '207 models, 16 providers, one API key, one bill', sort control set to Newest, a model listing beginning with openai/gpt-5-search-api-2025-10-14, and a 'How to call any model' panel with the OpenAI-compatible endpoint https://api.orcarouter.ai/v1/chat/completions.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari