Kartu judul yang dihasilkan untuk Microsoft-Decision-1 vs Liquid AI d1-3B dengan subjudul 'satu-satunya dua model keputusan yang sepakat soal jendela konteks', dengan chip bertuliskan 32.768 token pada keduanya, hanya teks vs teks, gambar, dan audio, 25 bahasa vs 16, API terkelola vs bobot lfm1.0, dan footer yang mencatat bahwa angka kedua vendor dilaporkan sendiri dan belum diverifikasi.
Guides & Insights

Microsoft-Decision-1 vs Liquid AI d1-3B: Jendela 32K yang Sama, Dua Pemahaman yang Berbeda

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Untuk sekali ini, spesifikasinya sejalan.Microsoft-Decision-1, yang tersedia secara umum di Microsoft Foundry sejak 8 Oktober 2026, memiliki 32.768 token konteks. Begitu juga Liquid AI d1-3B, yang diunggah ke Hugging Face pada 5 Oktober 2026 dan diumumkan oleh Liquid AI dua hari kemudian. Keduanya menerima sebuah state ditambah serangkaian pertanyaan bertipe — ya/tidak, pilihan di antara opsi bernama, posisi pada skala terurut — dan keduanya menjawab dalam satu forward pass dengan distribusi probabilitas alih-alih teks yang dihasilkan; Laya, Intern-Decision-4B, Kev, dan sisanya di niche ini tidak sepakat satu sama lain tentang panjang konteks, jadi inilah satu-satunya pasangan di mana dimensi itu gugur dan perbandingannya harus diperdebatkan berdasarkan hal lain.

Sesuatu yang lain itu ternyata adalah kanal masukan. Model Microsoft secara eksplisit hanya untuk teks: model ini "tidak menerima atau menghasilkan konten gambar, audio, atau video." Model Liquid AI membawa encoder visi SigLIP2 NaFlex berparameter 400 juta di atas backbone bahasa berparameter 2,6 miliar dan mencapai total 3,12 miliar parameter, dan model ini dibangun persis untuk hal yang dikesampingkan Microsoft — menilai tangkapan layar, formulir hasil pemindaian, atau bingkai kamera terhadap pertanyaan tetap. Pemisahan itu, ditambah perbedaan lisensi yang tidak ada kaitannya dengan kemampuan, adalah keseluruhan pertandingan ini.

Ketika keduanya sepakat, itu lebih dari yang Anda perkirakan.

• Jendela konteks — 32.768 token untuk Microsoft-Decision-1 dan 32.768 token untuk Liquid AI d1-3B.

• Bentuk keluaran — probabilitas terkalibrasi atas opsi yang diberikan; tidak ada yang menghasilkan teks, dan penghitung penggunaan Liquid AI melaporkan fakta tersebut sebagai output_tokens: 0.

• Jenis pertanyaan — baik pilihan dokumen, skor terurut, maupun ya/tidak biner, dan keduanya memungkinkan Anda menentukan kumpulan opsi per permintaan alih-alih melatih ulang kepala kosakata.

• Abstensi — Microsoft mendokumentasikan opsi abstensi eksplisit seperti "cannot tell"; skema Decision Index milik Liquid AI mendukung hal yang sama melalui kumpulan opsinya.

• Inferensi satu lintasan — satu panggilan per keputusan di kedua sisi, yang membuat salah satu dari keduanya layak pada volume pipeline.

Dua model yang sepakat tentang dua kendala tersulit di niche ini patut direnungkan sejenak. Jendela 32K-lah yang membuat penilai keputusan dapat digunakan pada kontrak utuh, kebijakan berhalaman banyak, atau utas dukungan panjang; checkpoint Laya bahasa Inggris 512-token dan batas pertanyaan per panggilan pada Intern-Decision-4B tidak. Jika input Anda pendek, sebagian besar bidang ini dapat dipertukarkan dan keputusannya adalah soal hosting. Jika input Anda panjang, bidang ini menyempit ke dua model ini.

Perasaan bahwa hanya satu di antara mereka yang memilikinya

Liquid AI d1-3B bersifat multimodal, dan pohon model membuat garis keturunannya jelas: LFM2.5-2.6B-Base, lalu LFM2.5-VL-3B, lalu d1-3B yang dilatih lanjutan untuk keputusan terkalibrasi satu lintasan. Gambar masuk melalui encoder SigLIP2 NaFlex, dan kartu model melaporkan rata-rata 74.1 pada sebelas tolok ukur gambar publik, dibandingkan 73.9 untuk model visi dasar — jadi penyetelan keputusan tidak mengorbankan kualitas visinya. Kartu itu juga melaporkan eksperimen sebaliknya: hilangkan gambarnya, dan pertanyaan yang sama turun ke 45.1, yang merupakan bukti paling bersih yang akan Anda dapatkan bahwa saluran persepsi itu menopang, bukan sekadar dekoratif.

Microsoft-Decision-1 tidak memiliki padanan, dan kelalaian itu disengaja, bukan belum selesai. Kartu Microsoft mencantumkan penggunaan di luar cakupan sebagai pembuatan teks, menjawab pertanyaan terbuka, percakapan, penerjemahan dan peringkasan, serta secara terpisah menyatakan bahwa model tersebut hanya untuk teks. Bagi pipeline yang perlu menilai tangkapan layar formulir terhadap rubrik, atau memutuskan apakah sebuah bingkai kamera memuat peristiwa keselamatan, itu adalah penghentian mutlak — tidak ada rekayasa prompt yang dapat memulihkan modalitas yang tidak pernah diberikan kepada model.

Jumlah bahasanya justru berlawanan arah, dan inilah perbedaan nyata yang kedua. Microsoft-Decision-1 mencantumkan 25 bahasa yang didukung, dan perusahaan itu berterus terang bahwa cakupan, kualitas, dan kalibrasi "dapat bervariasi menurut bahasa," dengan menyebut bahasa non-Inggris dan terutama bahasa dengan sumber daya lebih rendah sebagai area yang berkinerja kurang baik. Liquid AI d1-3B menyatakan 16 bahasa. Dalam hal keluasan, Microsoft unggul di atas kertas; dalam hal kejujuran tentang apa arti keluasan, kedua vendor mengatakan hal yang serupa, dan tak satu pun telah menerbitkan kalibrasi per bahasa.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

Tab benchmark, lagi.

Halaman Foundry milik Microsoft-Decision-1 memuat tab Benchmarks dengan bagian metodologi dan tanpa angka: tolok ukur keputusan publik dan komunitas ditambah kumpulan internal yang disisihkan, metrik yang mencakup akurasi dan galat kalibrasi, urutan opsi divariasikan, uji statistik berpasangan, dan klaim bahwa model tersebut "berkinerja setara dengan model keputusan terkemuka dan lebih unggul daripada model keputusan terbuka lain yang dievaluasi dengan metodologi yang sama." Tidak ada yang perlu diperiksa, tidak ada yang perlu direproduksi.

Liquid AI d1-3B menerbitkan 48.57 pada Decision Index 0.2.1 — dan kualifikasi itu lebih penting daripada angkanya, karena Decision Index adalah indeks milik Liquid AI sendiri dan d1-3B adalah model milik Liquid AI sendiri. Ini adalah hasil yang dinilai vendor pada tolok ukur yang ditulis vendor, yang diposisikan oleh perusahaan sebagai yang terbaik di antara model keputusan di bawah 10B dan lebih unggul dari model 35B pada skala yang sama. Perlakukan 48.57 sebagai klaim indikatif, bukan angka yang diaudit. Di samping itu, kartu tersebut mencantumkan evaluasi format keputusan internal dengan rata-rata 77.1, SQuAD 2.0 sebesar 85.3, PAWS-X sebesar 76.9, dan DecisionBench 71.8 — semuanya dilaporkan sendiri, dan pembingkaian "di bawah 10B" adalah kualifikasi yang sah, bukan pengelakan, karena model ini berukuran 3.12B.

Jadi pertanyaan kalibrasi itu terselesaikan dengan cara yang sama seperti di seluruh bidang ini: Liquid AI memberi Anda angka yang dihasilkan berdasarkan skalanya sendiri, Microsoft memberi Anda metodologi tanpa angka, dan keduanya tidak memberi Anda pengukuran pihak ketiga yang independen. Satu-satunya angka kalibrasi yang akan penting bagi penerapan Anda adalah angka yang Anda hitung sendiri pada data berlabel Anda.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

Penyajian, lisensi, dan apa yang sebenarnya Anda beli

Latensi d1-3B dipublikasikan dan itulah alasan model ini ada. Delapan milidetik per keputusan pada RTX 4090, sembilan pada AMD MI325X, dengan throughput padat sebesar 475 dan 1.106 per detik pada 64 state. Pada perangkat edge: 30 ms pada Apple M5 Pro, 16 ms pada Jetson AGX Thor, 26 ms pada Jetson AGX Orin 64 GB, 50 ms pada Orin Nano. Microsoft-Decision-1 tidak mempublikasikan angka latensi sama sekali, dan opsi yang dirancang di dalamnya — Foundry API yang dihosting dengan skema bayar sesuai pemakaian atau throughput tersedia yang direservasi, dengan inferensi batch dinonaktifkan — berarti Anda mengukurnya melalui deployment Anda sendiri. Itu bukan kesenjangan yang kecil bagi sebuah model yang seluruh tujuannya adalah dipanggil sekali per dokumen yang diambil atau tindakan yang diusulkan.

Lisensi adalah titik di mana keduanya berbeda dengan cara yang mengejutkan banyak orang. Liquid AI d1-3B ditandai dengan lfm1.0, bukan Apache 2.0 — lisensi keluarga yang sama dengan lini LFM Liquid lainnya, yang membawa ketentuan penggunaan yang tidak dimiliki lisensi permisif. Jika tinjauan hukum Anda membacanya sebagai kompatibel dengan OpenAI-tanpa-syarat apa pun, ini bukan itu, dan ada baiknya membacanya sebelum model dirilis, bukan sesudahnya. Microsoft-Decision-1 tidak memiliki bobot sama sekali: ini adalah endpoint terkelola di bawah portofolio Direct from Azure, dengan autentikasi Azure, penagihan terpadu, tanpa unduhan, dan pertanyaan lisensi digantikan oleh perjanjian layanan. Tidak ada dari kedua model ini yang dapat di-fine-tune melalui jalur yang didokumentasikan vendor, dan inilah keterbatasan paling tajam bagi sebuah model pengambil keputusan — scorer yang tidak dapat Anda sesuaikan dengan label Anda sendiri adalah scorer yang mode kesalahannya tidak dapat Anda perbaiki, hanya dapat Anda hindari.

Perutean di sekitar mereka adalah tempat OrcaRouter berada dalam pola ini, dan hanya di satu sisinya. Kami tidak menghosting Microsoft-Decision-1 maupun Liquid AI d1-3B: keduanya tidak mengembalikan teks, keduanya tidak ada di katalog kami, dan endpoint penilaian probabilitas bukan target chat-completions. Yang kami bawa adalah separuh generasi dari loop — model yang menyusun draf jawaban yang akan dinilai oleh penilai Anda, mengekstrak bidang-bidang yang akan dinilai oleh penilai Anda, atau mengusulkan tindakan yang akan disetujui oleh penilai Anda. Itu adalah lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI pada harga daftar penyedia yang diteruskan dengan markup 0%, sehingga perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama, dan failover otomatis mencakup panggilan generasi dalam loop yang tidak memiliki latensi cadangan untuk mencoba ulang.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Dua pilihan yang jelas, dan satu yang tidak dekat.

Ambil Liquid AI d1-3B jika ada apa pun dalam pipeline Anda berupa gambar. Triase tangkapan layar, ekstraksi formulir, perutean QA visual, moderator yang menilai bingkai kamera — Microsoft-Decision-1 tidak dapat dibuat untuk melakukan ini, dan d1-3B dibangun untuk itu dengan tolok ukur visi yang dipublikasikan untuk mendukung klaim tersebut. Ambil juga jika Anda memerlukan inferensi edge yang diukur dalam puluhan milidetik di Jetson atau laptop, jika Anda ingin model tersebut ada di perangkat keras Anda sendiri, atau jika lisensi yang dapat Anda baca sudah cukup bagi penasihat hukum Anda.

Ambil Microsoft-Decision-1jika input Anda berupa teks, dokumen Anda panjang, gerbang Anda adalah pengadaan — autentikasi Azure, penagihan terpadu, penilaian Responsible AI, vendor yang dapat dieskalasi — atau lalu lintas Anda mencakup lebih dari 16 bahasa yang dicantumkan d1-3B. Terimalah bahwa angka latensi yang tidak ada dan tabel tolok ukur yang tidak disertakan berarti dua minggu pertama Anda dengannya adalah pengukuran, bukan integrasi.

Satu-satunya kasus yang bisa dibilang tidak tipis adalah pekerjaan multimodal: di sana, pilihan itu sudah ditentukan ketika Microsoft menuliskan "text-only" ke dalam kartu model.