
Liquid AI d1-3B vs Intern-Decision-4B: Decider Terkalibrasi Mana yang Sebenarnya Anda Butuhkan?
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Dua model open-weight kini menjawab pertanyaan dengan tidak menulis apa pun, dan sampai Anda meletakkan skema I/O keduanya berdampingan, keduanya tampak seperti ide yang sama yang muncul dua kali. Liquid AI d1-3B, yang diunggah ke Hugging Face pada 5 Oktober 2026 dan diumumkan oleh Liquid dua hari kemudian, adalah model keputusan multimodal 3.12B yang kartunya menyatakan secara tegas bahwa model ini "bukan model chat dan tidak menulis teks." Intern-Decision-4B milik InternLM, yang diunggah secara diam-diam ke organisasi InternLM pada 26 September 2026 tanpa postingan blog, tanpa tweet, dan tanpa halaman peluncuran di belakangnya, adalah model keputusan 4B yang di-fine-tune dari Qwen3.5-4B yang juga mengembalikan distribusi jawaban untuk setiap pertanyaan dalam satu forward pass. Kontrak yang sama di permukaan. Perbedaan di baliknya — lisensi yang akan menyulitkan Anda, kontrak yang bisa menulis teks secara tidak sengaja, dan mesin yang belum pernah dibandingkan siapa pun — itulah yang menentukan mana yang layak masuk ke stack Anda.
Seberapa dekat keduanya sebenarnya
Hal pertama yang perlu diluruskan adalah seberapa besar perbandingan ini berakhir seri. Kedua model menerima sebuah state dan skema berisi pertanyaan-pertanyaan bernama, keduanya membaca sinyal dari logit pada posisi placeholder alih-alih melakukan sampling, keduanya bersifat multimodal, dan keduanya melaporkan bahwa mereka tidak menulis apa pun. Dari bentuk pemanggilannya, keduanya nyaris identik, dan perbedaan yang menarik ada pada detail-detail di sekeliling tepinya.
• Ukuran — Liquid AI d1-3B total 3,12B, dibangun di atas LFM2.5-VL-3B milik Liquid; Intern-Decision-4B 4B (sekitar 4,54B menurut jumlah tensor yang tercetak di kartu), fine-tuned dari Qwen3.5-4B
• Jenis pertanyaan — d1-3B dan Intern-Decision-4B menggunakan tiga yang sama: noul untuk ya/tidak, choice untuk salah satu dari himpunan bernama, score untuk titik pada skala terurut
• Bidang jawaban — d1-3B mengembalikan jawaban beserta keyakinan dan probabilitas; skema InternLM mengembalikan distribusi beserta nilai keyakinan yang kartu modelnya memperingatkan bukanlah probabilitas terkalibrasi
• Batas masukan — d1-3B 32.768 token konteks; Intern-Decision-4B batas 8.192 token yang menolak permintaan lebih panjang secara langsung alih-alih memotongnya, dengan gambar dihitung ke dalamnya
• Lisensi — d1-3B di bawah LFM Open License v1.0 milik Liquid, Apache 2.0 di sisi InternLM
• Bahasa — d1-3B mencantumkan 16; kartu Intern-Decision-4B tidak menyatakan apa pun
• Antarmuka — d1-3B dikirim sebagai model yang Anda muat dan panggil dengan trust_remote_code=True; Intern-Decision-4B dikirim sebagai pustaka Python yang Anda pip install, dengan satu backend yang diimplementasikan dan bidang model milik permintaan itu sendiri secara eksplisit tidak dapat mengganti checkpoint
• Skor vendor sendiri — d1-3B 48,57 pada split publik Decision Index 0.2.1; Intern-Decision-4B 90,02 yang dirata-ratakan di seluruh tabel tujuh set miliknya sendiri dengan skor Brier 0,347 dan kesalahan kalibrasi yang diharapkan 0,065
Dua angka terakhir itu tidak sebanding, dan menganggapnya sebagai papan skor akan menjadi kesalahan paling mudah yang bisa dilakukan di halaman ini. Angka-angka itu berasal dari harness yang berbeda, kumpulan pertanyaan yang berbeda, dan penilai yang berbeda.

Kalibrasi adalah inti dari keseluruhan produk, dan hanya satu dari mereka yang menjaminnya secara tertulis.
Model keputusan baru bernilai latensinya jika angka yang dikembalikannya di samping jawaban memiliki makna. Itulah kalibrasi: keyakinan yang dinyatakan sebesar 0,9 seharusnya benar sekitar sembilan dari sepuluh kali, dan model yang yakin tetapi salah lebih buruk daripada model yang mengatakan bahwa ia tidak tahu.
InternLM-lah yang menangani hal ini. Kartunya mendokumentasikan temperature hasil fitting sebesar 1,99241824, yang diperoleh melalui minimisasi log-likelihood negatif atas 1.728 kasus kalibrasi yang ditetapkan dengan 1.693 disisihkan untuk validasi, dan dicetak hingga delapan tempat desimal agar dapat direproduksi. Model ini juga menerbitkan uji coba sebelum-dan-sesudah pada 96 kasus yang menunjukkan mekanismenya bekerja, bukan sekadar menyatakannya: Brier 0,628 dan ECE 0,213 sebelum kalibrasi dibandingkan dengan 0,550 dan 0,089 sesudahnya. Brier dan ECE adalah dua ukuran standar untuk menilai apakah probabilitas yang dinyatakan dapat dipercaya, dan arah pergerakannya besar.
Liquid tidak menerbitkan padanan apa pun. Kartu d1-3B sendiri memuat tolok ukur bergaya akurasi — SQuAD 2.0 85,3, Civil Comments 93,0, MASSIVE intent 87,3, PubMedQA 66,0, BoolQ 86,7, XNLI 85,0, PAWS-X 76,9, rata-rata 77,1 — bersama dengan 48,57 pada Decision Index, dan nilai jual yang dinyatakan model adalah jawaban bertipe yang terkalibrasi. Namun tidak ada baris ECE, tidak ada baris Brier, dan tidak ada temperature hasil fitting yang dipublikasikan.
Asimetri itu tidak berarti turunan Qwen3.5-4B lebih terkalibrasi daripada model 3B yang dibangun di atas LFM2.5-VL-3B; ini berarti bahwa di antara kedua kartu ini, salah satunya memberi Anda perhitungan untuk mereproduksi klaim tersebut dan yang lainnya hanya memberi Anda klaimnya. Jika pipeline Anda menetapkan ambang batas pada suatu keyakinan — arahkan di atas 0,8, eskalasikan di bawah 0,4 — Anda dapat memvalidasi sisi InternLM malam ini dan Anda hanya dapat melakukan uji petik pada sisi Liquid.
Catatan ini berlaku dua arah. Kedua kumpulan angka tersebut berasal dari pihak pertama. Tidak ada model yang dinilai oleh pihak independen, dan klaim kalibrasi InternLM bertumpu pada pilot 96 kasus milik InternLM sendiri terhadap fit milik InternLM sendiri.
Lisensi yang meminta nomor kepada Anda
Intern-Decision-4B adalah Apache 2.0, diwarisi dari Qwen3.5-4B, dengan pemberitahuan upstream yang tetap dipertahankan — penggunaan komersial, redistribusi, fine-tuning, tidak ada pertanyaan soal pendapatan di mana pun di dalamnya.
d1-3B berada di bawah Liquid's LFM Open License v1.0, dan Bagian 5 adalah bagian yang tidak dibaca siapa pun sampai tim pengadaan membacanya. Penggunaan komersial diberikan hanya dengan syarat Anda atau entitas hukum Anda tetap berada di bawah Ambang Batas, yang didefinisikan dalam dokumen yang sama sebagai pendapatan tahunan sepuluh juta dolar AS atau lebih; penggunaan di atasnya sama sekali tidak dilisensikan. Organisasi nirlaba dan pengguna riset dikecualikan.
Untuk individu atau tim kecil, keduanya gratis. Untuk apa pun yang memiliki departemen keuangan, kedua repo itu adalah produk yang berbeda, dan perbedaannya adalah angka yang menentukan apakah Anda berada di atasnya atau tidak.
Bagian akhir dari tabel benchmark d1-3B adalah klaim sebenarnya.
Angka utama pada kartu Liquid adalah 48,57 pada Decision Index 0.2.1, lebih unggul dari baris sub-10B lainnya dalam tabel yang membentang dari Winnow-12B di 50,02 hingga Decider 2B di 28,97. Yang membuat angka itu layak dikutip adalah indeks diskriminasi yang berada di bawahnya. Pada subskor Decision Index sendiri, d1-3B mencetak 74,5 pada Tools dan 36,3 pada Arts sementara hanya mampu mencetak 23,8 pada Knowledge — dibandingkan dengan Decider 35B-A3B, model mixture-of-experts 36B yang 12 kali ukurannya, yang mencetak 56,5 pada Tools, 32,6 pada Arts, dan 31,8 pada Knowledge.

Dengan kata lain, 3B bukanlah model kecil yang secara seragam sedikit lebih buruk. Ini adalah model kecil yang luar biasa kuat dalam keputusan terstruktur bergaya alat dan luar biasa lemah dalam pertanyaan yang membutuhkan pengetahuan dunia, dan ia mengalahkan 36B pada dua kategori yang paling terasa seperti pekerjaan yang menjadi tujuan pembuatannya. Jika keputusan Anda adalah "yang mana dari lima tindakan bernama ini" dan "apakah ini berpijak pada petikan yang diambil", kesenjangan ukuran memainkan peran lebih kecil daripada yang Anda perkirakan. Jika keputusan Anda bersandar pada fakta yang harus sudah dipegang model, perkirakan 23.8 akan muncul.
Ada versi kedua dari argumen itu di sisi visi. d1-3B rata-rata 74,1 pada sebelas tolok ukur gambar publik dibandingkan 73,9 untuk model dasarnya sendiri, dan dengan gambarnya dihilangkan, pertanyaan yang sama mendapat skor 45,1 — jadi pada pertanyaan tentang gambar, jawabannya benar-benar berasal dari gambar itu. Ia setara dengan model dasarnya, bukan lebih baik darinya, dan baris per tolok ukur bergerak dua arah: CV-Bench 82,1 dibandingkan 87,6, POPE 88,5 dibandingkan 90,1, BLINK 59,2 dibandingkan 58,7.
Perlu dicatat juga jeda pada kartu InternLM: agregatnya yang tinggi berasal dari tugas-tugas berbasis pertanyaan seperti Typed Decision 80.55 dan ToolACE 96.45, sementara Jevbench-Hard berada di 73.87. Ketika skema menjadi sulit, skornya turun.
Kecepatan: celahnya bukan di tempat yang Anda duga
d1-3B mengiklankan 8 ms untuk satu pertanyaan pada RTX 4090 dan 9 ms pada MI325X, 21 ms untuk tiga pertanyaan yang berbagi satu state, 16 ms pada Jetson AGX Thor, dan throughput terpaket sebesar 475 keputusan per detik pada 4090 dan 1.106 pada MI325X.
Kartu Intern-Decision-4B mengukur rata-rata 44,16 ms secara end-to-end pada RTX 4090 yang sama, dengan median 44,03 ms dan 44,60 ms pada P95.
Itu tampak seperti keunggulan 5x dan bukan demikian, karena keduanya mengukur hal yang berbeda. Angka Liquid adalah panggilan model hangat, satu permintaan pada satu waktu, dengan pemilihan dan kompilasi kernel dibayar di muka — kartu itu menyatakan secara eksplisit bahwa satu pertanyaan membutuhkan 16 ms pada 4090 tanpa kompilasi CUDA graph, dan bahwa panggilan pertama dengan bentuk baru membayar biaya kompilasi. 44 ms InternLM adalah per-kueri end-to-end melalui pustaka Python yang satu-satunya backend yang diimplementasikan adalah inferensi Hugging Face lokal, sehingga ia membawa mesin di sekitarnya. Tidak ada angka yang salah. Tempatkan keduanya di bawah satu harness, pada satu mesin, pada bentuk permintaan yang sama, dan selisihnya menyusut menjadi sesuatu yang ingin Anda ukur daripada asumsikan.
Yang tidak dipertanyakan adalah batas atasnya. 8.192 token adalah penolakan keras di sisi InternLM, dan token gambar mengambil dari anggaran yang sama, jadi dokumen panjang plus tangkapan layar adalah permintaan yang kembali ditolak, bukan dipotong. d1-3B memberi Anda 32.768 token untuk digunakan. Jika state Anda adalah tiket dan pertukaran singkat, celah itu tidak pernah menggigit. Jika state Anda seukuran halaman, itu menentukan persoalannya sebelum benchmark mana pun melakukannya.
Jalankan mereka sebagai panel, bukan sebagai penukaran.
Menjawab ya/tidak yang spesifik dan menjawab "yang mana dari enam hal bernama ini, dan seberapa yakin Anda" adalah permintaan yang berbeda, dan kedua kartu itu cukup berbeda bentuknya — yang satu dengan batas atas input yang keras dan fit kalibrasi yang dipublikasikan, yang lain dengan konteks 32K dan ekor penilaian yang lebih baik — sehingga penerapan yang berguna bagi tim yang mengevaluasi keduanya sering kali bukan penggantian melainkan panel: keadaan yang sama diajukan ke kedua model, dengan ketidaksepakatan dialihkan ke manusia atau ke model yang lebih besar.
Tidak ada satu pun dari kedua model ini yang ada di katalog kami, dan ini bukan klaim ketersediaan; keduanya adalah artefak yang di-host sendiri. Tetapi sebuah panel justru berbentuk seperti itu, di mana lapisan routing yang bekerja, bukan dokumennya. OrcaRouter mengekspos lebih dari 200 model di balik satu kunci API dengan harga daftar penyedia diteruskan pada markup 0% — jadi ketika vendor yang Anda rutenya di belakang kami memotong harganya, tagihan Anda ikut berubah di hari yang sama — dan failover otomatis antar penyedia mencegah panel dua model menjadi dua titik kegagalan tunggal. Model yang Anda rutenya hari ini bukanlah kedua model ini; melainkan model generalis yang di-host yang akan Anda gantikan, seperti Qwen3.5-27B dengan $0.086 per juta token input dan $0.688 per juta token output, yang merupakan angka yang harus dikalahkan oleh model 3B yang di-host sendiri setelah Anda memperhitungkan GPU-nya.
Apa yang harus dilakukan minggu ini
Jika keputusan Anda berupa state pendek, lisensinya harus lolos tinjauan perusahaan Anda, dan Anda menginginkan rentang target build terluas — llama.cpp, LM, jalur batch padat yang menjalankan 64 state dalam satu pass — d1-3B adalah yang lebih matang sebagai produk di antara keduanya dan diskriminasi alat-dan-seni-nya adalah hal terkuat yang ditunjukkan oleh kartu mana pun di antara keduanya. Jika keputusan Anda berjalan pada state panjang, atau Anda memerlukan lisensi tanpa klausa pendapatan, atau Anda menginginkan fit kalibrasi yang dapat Anda reproduksi dan harness yang biaya sekitarnya sudah diperhitungkan, Intern-Decision-4B adalah yang dokumennya benar-benar dapat Anda periksa.

Bagian yang tidak nyaman itu sama untuk keduanya: tidak ada pihak independen yang memiliki salah satu dari kedua model tersebut, dan tidak ada perbandingan kalibrasi yang tidak dipesan oleh vendor yang menulis kartu itu. Untuk model yang nilainya adalah makna dari sebuah angka di samping jawaban, itulah celah yang layak ditutup sebelum Anda menetapkan ambang batas pada apa pun.
