Kartu judul yang dihasilkan untuk Microsoft-Decision-1 vs Liquid AI d1-omni-600M dengan subjudul 'permukaan sensor terluas di kategori ini versus daftar input tersempit', dengan chip bertuliskan 587 juta parameter dengan visi dan audio, Foundry API khusus teks, 30 detik ucapan versus 32.768 token teks, encoder dua arah versus decoder pascapelatihan, dan tidak ada kalibrasi yang dipublikasikan pada kedua sisi.
Engineering & Research

Microsoft-Decision-1 vs Liquid AI d1-omni-600M: {{1}}Penilai yang Mendengarkan Melawan Penilai yang Hanya Berjalan{{/1}}

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Anda mengarahkan klaim di meja asuransi, dan berkasnya datang sebagai tiga hal: sebuah PDF, foto pintu yang penyok, dan panggilan telepon sembilan puluh detik. Liquid AI d1-omni-600Mdapat membaca dokumen, melihat foto, dan mendengarkan panggilan itu, lalu menjawab serangkaian pertanyaan yang Anda susun sebelumnya — apakah ini tercakup, kategori mana, seberapa parah, pada skala dua sampai sepuluh — dalam satu kali proses, tanpa teks yang dihasilkan dan tanpa apa pun yang perlu diuraikan. Microsoft-Decision-1dapat membaca dokumen. Versi ini tersedia secara umum di Microsoft Foundry pada 8 Oktober 2026 sebagai penilai terhosting khusus teks yang dilatih lanjut pada Qwen3.5-9B dengan jendela 32.768 token, dan cakupan masukannya berhenti sampai di situ: tanpa gambar, tanpa audio, tanpa video. Keduanya mengembalikan probabilitas terkalibrasi atas opsi yang Anda berikan, keduanya mengeluarkan nol token keluaran, dan tidak ada satu pun yang menerbitkan angka kalibrasi.

Kalimat bersama terakhir itu adalah bagian yang tidak nyaman dari perbandingan ini. Keduanya adalah model keputusan dengan sensor terlebar dan sensor tersempit yang dirilis bulan ini, dan meskipun ada jarak arsitektural di antara keduanya, keduanya berada di posisi pembuktian yang persis sama: bobot nyata atau endpoint nyata, kontrak yang terdokumentasi, dan tidak ada angka yang bisa ditunjuk oleh siapa pun di luar vendor ketika seseorang bertanya apakah probabilitasnya dapat dipercaya.

Dua keturunan, bukan dua ukuran

Angka 587M mengundang Anda untuk membaca Liquid AI d1-omni-600M sebagai kerabat yang diperkecil dari model-model yang pernah dibahas blog ini. Tidak demikian. Model ini dilatih dari LFM2.5-Encoder-350M, sebuah encoder dua arah, dengan trunk bersama 381M dan decision head, encoder visi 94M yang diambil dari lini LFM2.5-VL-450M dan FastConformer 17 lapis untuk audio. Microsoft-Decision-1 adalah garis keturunan yang sama sekali berbeda: decoder Qwen3.5-9B, dilatih lanjut oleh Microsoft, dihosting di Foundry, bobotnya tidak didistribusikan dan tidak ada jalur fine-tuning yang ditawarkan.

Bidirectional versus decoder adalah fakta arsitektural yang menentukan bagaimana masing-masing berperilaku, dan itu juga alasan mengapa jumlah parameter menjadi distraksi. Encoder bidirectional membaca seluruh state sekaligus, yang merupakan bentuk tepat untuk penilaian atas input tetap; decoder pascapelatihan melepaskan jalur generasi tetapi mempertahankan tokenizer, jendela, dan paket enterprise yang menyertai penerapan foundry. Keduanya bukan versi yang diperbesar dari yang lain, dan keduanya tidak dapat ditukar satu sama lain tidak peduli bagaimana tabel benchmark dibaca.

Apa yang sebenarnya Anda dapatkan dari daftar input

Di sinilah d1-omni-600M paling tajam menyimpang dari segala hal lain di kategori ini, dan di sinilah sebuah klaim perlu dibaca dengan cermat.

• Ucapan — Liquid AI d1-omni-600M menerima teks ditambah hingga 30 detik ucapan dan melaporkan keputusan atasnya, yang tidak dapat dilakukan oleh penilai hanya-teks pada tingkat akurasi apa pun. Modalitas non-teks Microsoft-Decision-1 tidak ada.

• Eksklusi mutual — d1-omni-600M memunculkan ValueError jika gambar dan audio tiba dalam permintaan yang sama. Permukaan sensor terluas di kategori ini tetap satu modalitas non-teks pada satu waktu, yang merupakan batasan nyata bagi meja klaim tersebut.

• Pemangkasan — kartunya menyatakan 16.384 posisi gabungan teks, gambar, dan audio, dan menambahkan bahwa jika ada gambar, teks status dan pertanyaan dipangkas menjadi 896 token agar sesuai dengan pelatihan. Dokumen mana pun yang Anda lampirkan foto ke dalamnya akan bersaing dengan pemangkasan tersebut. 32.768 token Microsoft-Decision-1 semuanya teks dan tidak dipangkas.

• Format — d1-omni-600M memiliki tiga jenis pertanyaan: noul untuk keputusan biner yang mengembalikan P(yes) antara 0 dan 1, choice untuk satu label dari himpunan yang Anda tentukan dengan keyakinan dan probabilitas per opsi, dan score untuk posisi pada skala terurut dua hingga sepuluh tingkat beserta distribusinya. Beberapa pertanyaan melekat pada satu state dan dibaca dalam satu lintasan, dan penghitung penggunaan melaporkan output_tokens: 0. Microsoft mendokumentasikan bentuk ya/tidak, pilihan ganda, penilaian, klasifikasi, dan rubrik, serta opsi abstensi yang didukung secara eksplisit seperti "tidak dapat memastikan" ketika buktinya tidak cukup — satu-satunya detail desain di halaman Microsoft yang tidak memiliki padanan langsung di sini.

• Runtime — d1-omni-600M menyertakan kode khusus, memerlukan trust_remote_code=True, dan kartunya merekomendasikan float16 pada GPU sekaligus memperingatkan bahwa bfloat16 mengubah jawaban teratas pada beberapa baris. Itu adalah sensitivitas waktu penyajian yang didokumentasikan oleh vendor, bukan cacat. Microsoft-Decision-1 adalah endpoint terkelola di mana bentuk deployment adalah satu-satunya variabel runtime Anda, dan perlu dicatat bahwa inferensi batch dinonaktifkan: tidak ada kanal offline untuk mengamortisasi proses penilaian massal melaluinya.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

Kesenjangan bukti, dalam kedua arah

Liquid AI menerbitkan keluarga d1 terbuka, termasuk d1-omni-600M, pada 7 Oktober 2026 dengan pos rilis dan satu set dokumentasi. Yang tidak diterbitkan adalah angka yang akan membuat klaim multimodal itu konkret. Tidak ada tolok ukur akurasi yang khusus untuk kemampuan utamanya sendiri — kualitas keputusan visi-dan-audio yang membenarkan encoder 94M dan 112M — dan bagian visi ditahan dari materi evaluasi yang dirilis. Angka latensi pun tidak diterbitkan, jadi throughput model adalah sesuatu yang Anda temukan sendiri di perangkat keras Anda.

Posisi Microsoft secara struktural identik dan selangkah lebih maju. Tab Benchmarks-nya menyebutkan metriknya — akurasi, kesalahan kalibrasi, recall keamanan, tingkat positif palsu, konsistensi keadilan — menyatakan bahwa evaluasi dijalankan pada benchmark keputusan publik dan komunitas plus set uji internal yang disisihkan yang tidak digunakan dalam pelatihan, bahwa urutan opsi divariasikan, bahwa uji statistik berpasangan diterapkan, dan mengklaim model tersebut "setara dengan model keputusan terkemuka dan lebih unggul daripada model keputusan terbuka lain yang dievaluasi dengan metodologi yang sama". Tidak satu pun hasilnya dicetak. Dua puluh lima bahasa dicantumkan sebagai didukung, termasuk Jepang, Korea, Arab, Vietnam, Thailand, Turki, Hindi, Bengali, Swahili, Ibrani, Persia, dan Ukraina, dengan peringatan jujur bahwa cakupan, kualitas, dan kalibrasi "bervariasi menurut bahasa" dan bahwa bahasa non-Inggris, terutama bahasa dengan sumber daya lebih rendah, merupakan titik lemah. Harga juga tidak ada di halaman model; halaman itu menautkan ke halaman harga Microsoft.

Jadi perbandingan antara keduanya bukanlah perbandingan bukti versus bukti. Ini adalah pilihan antara dua jenis angka yang hilang. Liquid AI telah merilis permukaan sensor dan membiarkan akurasi permukaan itu tidak diukur secara publik. Microsoft telah merilis jalur pengadaan — autentikasi Azure, tata kelola, penilaian Responsible AI, metodologi yang didokumentasikan — dan membiarkan kalibrasi produk probabilitas tidak dikuantifikasi.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

Pertanyaan kalibrasi yang tak satu pun dari mereka jawab

Bagi model keputusan, probabilitas adalah produknya. Semua yang ada di hilir adalah ambang batas: 0,7 dieskalasi, 0,95 diterima otomatis, dan biaya menarik garis itu secara keliru dibayar dalam bentuk keputusan otomatis yang buruk, bukan dalam token. Dalam kategori ini setidaknya ada satu keluarga yang mempublikasikan angka-angkanya — checkpoint Intern-Decision dari InternLM mencantumkan angka Brier dan expected calibration error di kartu model mereka — dan tidak ada satu pun model dalam artikel ini yang melakukannya. Asimetri itulah alasan praktis untuk menjaga cakupan tetap luas alih-alih memutuskan hanya berdasarkan arsitektur.

Kabar baiknya adalah tes ini murah dan tidak memerlukan kerja sama vendor. Kumpulkan beberapa ratus kasus berlabel yang menyerupai trafik nyata Anda, tulis skema pertanyaan yang benar-benar akan dikirim oleh aplikasi Anda, jalankan kedua model pada kasus-kasus tersebut, dan hitung expected calibration error pada outputnya. Anda kemudian akan mengetahui dua hal yang saat ini tidak diketahui siapa pun di luar kedua vendor tersebut: seberapa baik probabilitas Microsoft-Decision-1 mencerminkan akurasinya pada distribusi Anda, dan apakah jalur audio serta gambar d1-omni-600M sepadan dengan encoder yang dibawanya. Panduan terdokumentasi Microsoft sendiri mengarah ke arah yang sama — validasi pada data yang representatif, tetapkan ambang batas dari biaya kesalahan Anda, selalu sertakan opsi abstain, acak urutan opsi, dan libatkan manusia dalam proses untuk keputusan yang berdampak besar.

Di mana masing-masing seharusnya berada, dan di mana OrcaRouter seharusnya berada.

Microsoft-Decision-1 tepat digunakan di mana pun materi penentunya berupa teks dan penghambatnya adalah pengadaan: dokumen panjang, petikan yang diambil, panggilan alat yang diusulkan, jawaban yang dihasilkan yang dinilai berdasarkan rubrik, dengan autentikasi Azure, penagihan terpadu, dan penilaian vendor yang diperlukan sebelum apa pun mencapai tahap produksi. Instrumen ini lebih sempit cakupannya dan lebih mudah untuk mendapat persetujuan.

Liquid AI d1-omni-600M cocok di mana pun materi penentunya bukan teks — foto yang dilampirkan pada formulir, rekaman panggilan singkat, tangkapan layar — dan di mana pun Anda menginginkan bobot lfm1.0 yang dapat Anda jalankan dan fine-tune di dalam batas yang Anda kendalikan. Ini adalah instrumen yang lebih luas dan yang lebih sulit untuk divalidasi, karena klaim multimodal justru merupakan bagian yang tidak memiliki benchmark yang dipublikasikan di baliknya.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Keduanya tidak ada dalam katalog kami, dan tidak ada apa pun di sini yang merupakan klaim ketersediaan untuk salah satu dari keduanya. Model yang mengembalikan probabilitas alih-alih teks bukanlah sesuatu yang Anda gunakan untuk merutekan penyelesaian obrolan, dan tetap berada di luar kursi penilaian adalah keseluruhan desain instrumen ini. Yang dibawa OrcaRouter adalah sisi generatif dari loop yang sama: lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI yang menulis rubrik yang menjadi dasar penilaian scorer Anda, mentranskripsikan atau merangkum materi sebelum menjadi status, dan mengeluarkan panggilan alat yang disetujui scorer Anda sebelum dijalankan. Harga daftar penyedia diteruskan pada markup 0%, sehingga pemotongan harga vendor di sisi generatif langsung berlaku pada sisi kami di hari yang sama. Failover otomatis menjaga sisi itu tetap hidup ketika satu penyedia mengalami degradasi — yang langsung disadari oleh pipeline yang menilai setiap dokumen yang diambil — dan jika Anda ingin beberapa penulis dinilai alih-alih satu, DSL perutean menyusunnya menjadi satu panggilan dan fusi model melaporkan kesepakatan mereka sebagai bidang yang dapat dibaca oleh scorer Anda seperti bidang lainnya.

Intinya

Microsoft-Decision-1 mencapai ketersediaan umum di Microsoft Foundry pada 8 Oktober 2026: hanya teks, 32.768 token, dibangun di atas Qwen3.5-9B yang telah dilatih lanjut, dihosting tanpa bobot, tanpa harga di halaman model, tanpa angka latensi, dan bagian tolok ukur yang menjelaskan metodologinya tanpa mencetak hasil. Liquid AI d1-omni-600M diunggah pada 7 Oktober 2026 sebagai model keputusan encoder dua arah 587M yang membaca teks, gambar, atau 30 detik ucapan — satu modalitas nonteks pada satu waktu, dengan teks dipangkas menjadi 896 token saat ada gambar — di bawah lisensi lfm1.0, tanpa tolok ukur akurasi untuk kemampuan utamanya, tanpa pemisahan visi, dan tanpa latensi yang dipublikasikan. Pilihlah berdasarkan modalitas dan kendali, bukan berdasarkan skor, karena skornya tidak ada: jika materi Anda adalah foto atau panggilan telepon, hanya salah satu dari ini yang dapat menjawab, dan jika itu dokumen empat puluh halaman dengan tinjauan pengadaan terlampir, hanya yang satunya lagi yang dapat diterapkan.

Yang dibawa OrcaRouter adalah sisi generatif dari loop yang sama: lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI yang menulis rubrik yang menjadi acuan penilaian scorer Anda, mentranskripsikan atau meringkas materi sebelum materi itu menjadi sebuah state, dan mengeluarkan tool call yang disetujui scorer Anda sebelum dijalankan.