Kartu judul yang dihasilkan untuk Microsoft-Decision-1 vs Intern-Decision-4B dengan subjudul 'dua pencetak skor, satu dengan angka dan satu tanpa angka', dengan chip bertuliskan 9B vs 4B, API terkelola vs bobot terbuka, tanpa tolok ukur yang dipublikasikan vs Brier 0.347 dan ECE 0.065, serta footer sumber yang mencatat bahwa angka Microsoft tidak direproduksi dan angka InternLM dilaporkan vendor.
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-4B: Satu Menerbitkan Kalibrasinya, yang Lain Menerbitkan Metodologinya

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Letakkan Microsoft-Decision-1 di samping Intern-Decision-4B dan Anda akan mendapatkan perbandingan yang lebih ditentukan bukan oleh kemampuan melainkan oleh apa yang masing-masing vendor bersedia publikasikan. Model Microsoft mencapai ketersediaan umum di Microsoft Foundry pada 8 Oktober 2026: basis Qwen3.5-9B, pasca-dilatih oleh Microsoft, hanya teks, konteks 32.768 token, bobot tidak didistribusikan, metodologi evaluasi yang menjelaskan akurasi, kesalahan kalibrasi, dan uji statistik berpasangan — dan tidak ada satu pun hasil. Intern-Decision-4B dari InternLM diunggah ke Hugging Face pada 26 September 2026 pukul 05:36:37 UTC tanpa pengumuman apa pun di baliknya, di-fine-tune dari Qwen3.5-4B, menerima gambar maupun teks, berjalan dalam 44 milidetik pada satu RTX 4090, dan mencetak tabel lengkap angka Brier dan expected-calibration-error. Keduanya mengembalikan distribusi probabilitas atas opsi yang Anda berikan. Hanya satu di antaranya yang memberi tahu Anda seberapa baik ia melakukannya.

Inversi itu — model yang lebih besar dan lebih banyak didanai justru menjadi yang tidak transparan — adalah keseluruhan bentuk perbandingan ini, dan itu menentukan pilihan bagi sebagian besar tim lebih cepat daripada baris spesifikasi mana pun.

Satu angka yang membedakan mereka

InternLM melaporkan Brier 0,347 dan ECE 0,065 untuk Intern-Decision-4B di seluruh rangkaian benchmark-nya, dengan skor rata-rata 90,02 pada Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) dan WildJailBreak (89,86). Itu adalah angka yang dilaporkan vendor pada harness milik vendor sendiri, dan baris Jevbench khususnya adalah keluarga benchmark proyek itu sendiri — bacalah sebagai penilaian mandiri, bukan verifikasi independen. Tetapi itu adalah angka dengan skala yang dinyatakan, dan ECE khususnya adalah angka yang memberi tahu Anda apakah nilai 0,8 yang dikembalikan layak untuk ditindaklanjuti.

Microsoft tidak menerbitkan padanan apa pun. Tab Benchmarks pada halaman katalog Microsoft-Decision-1 menjelaskan apa yang diukur dan mengklaim bahwa model tersebut "tampil setara dengan model keputusan terkemuka dan lebih unggul daripada model keputusan terbuka lain yang dievaluasi dengan metodologi yang sama," dengan area terkuat disebut penalaran, penerapan aturan, dan ketangguhan format prompt, serta yang terlemah sebagai pengetahuan domain khusus. Tidak ada Brier, tidak ada ECE, tidak ada tabel akurasi. Jika keputusan adopsi Anda memerlukan angka kalibrasi sebelum Anda dapat menentukan besaran ambang eskalasi, salah satu dari dua model ini memberikannya kepada Anda dan yang lain meminta Anda mengukurnya sendiri.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

Di mana kedua kontrak itu sebenarnya berbeda.

Di permukaan, model-model ini menerima pemanggilan yang sama. Anda menyuplai sebuah state, skema pertanyaan bernama, dan sekumpulan opsi tetap; Anda menerima kembali probabilitas per opsi tanpa satu token pun teks yang dihasilkan. Perbedaannya muncul di tepi-tepi kontrak tersebut.

• Modalitas — Microsoft-Decision-1 secara eksplisit hanya untuk teks dan tidak menerima atau menghasilkan konten gambar, audio, maupun video. Intern-Decision-4B menerima gambar opsional bersama state, hingga delapan gambar per panggilan, dan itulah yang menjadikannya kandidat untuk triase screenshot, pemeriksaan tata letak dokumen, dan perutean QA visual.

• Kardinalitas pertanyaan — InternLM mendokumentasikan 1 hingga 16 pertanyaan per panggilan, hingga 62 opsi masing-masing, di tiga jenis bidang (pilihan, skor, noul). Microsoft mendokumentasikan format — ya/tidak, pilihan ganda, peringkat, klasifikasi, rubrik — dan satu pemanggilan hingga 32K token, tetapi tidak ada batas pertanyaan per panggilan.

• Konteks — Microsoft menyatakan 32.768 token. Kartu Intern-Decision-4B menyatakan batasnya dalam pertanyaan, opsi, dan gambar, bukan sebagai satu angka konteks, sehingga Anda tidak dapat menyandingkan keduanya pada satu angka.

• Distribusi — Microsoft-Decision-1 adalah API Foundry yang dihosting; bobot model tidak didistribusikan dan tidak ada unduhan. Intern-Decision-4B adalah Apache-2.0 di Hugging Face dengan lisensi Qwen hulu yang dipertahankan sebagai LICENSE-QWEN, yang berarti mempertahankan lisensi tersebut dan pemberitahuan hulu jika Anda mendistribusikan ulang.

• Struktur biaya — Bobot InternLM tidak memerlukan biaya untuk dijalankan dan tercatat pada rata-rata 44,16 ms, P95 44,60 ms, di satu RTX 4090. Harga per token Microsoft sama sekali tidak dicantumkan di halaman model.

• Tata kelola — Microsoft merilis penilaian Responsible AI, praktik penerapan yang didokumentasikan, dan pengecualian eksplisit (bukan untuk pembuatan teks, QA terbuka, percakapan, penerjemahan atau peringkasan; bukan untuk menjadi satu-satunya pengambil keputusan otomatis dalam keputusan berdampak tentang orang). InternLM merilis kartu model yang jujur tentang asal-usul — bobot "dimodifikasi oleh penyetelan keputusan" — dan tidak ada yang menyerupai paket kepatuhan.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

Dua alasan yang sangat berbeda mengapa angka latensi sulit dibandingkan

Microsoft-Decision-1 tidak mempublikasikan angka latensi, jadi tidak ada yang bisa diletakkan di samping rata-rata 44,16 ms milik InternLM. Itu bukan kelalaian kecil untuk beban kerja ini. Model-model ini ada untuk dipanggil berkali-kali di dalam pipeline — sekali per dokumen yang diambil, sekali per panggilan alat yang diusulkan, sekali per respons yang dinilai — dan perbedaan antara empat keputusan per detik dan empat puluh adalah perbedaan antara menilai satu sampel dan menilai semuanya. Angka InternLM dapat dicapai hari ini pada perangkat keras yang bisa Anda sewa per jam; angka Microsoft harus diukur melalui deployment Foundry Anda sendiri, dan bentuk deployment yang Anda pilih (serverless bayar sesuai penggunaan versus throughput yang disediakan) akan mengubahnya lebih besar daripada modelnya.

Di sinilah juga bagian OrcaRouter dari pola tersebut menjadi relevan, dan hanya bagian generatifnya. Kami tidak menghosting Microsoft-Decision-1 atau Intern-Decision-4B — model yang mengembalikan probabilitas alih-alih teks bukanlah sesuatu yang Anda arahkan untuk chat completions, dan keduanya tidak muncul di katalog kami. Yang berada di balik satu kunci yang kompatibel dengan OpenAI milik kami adalah kumpulan lebih dari 200 model yang melakukan penulisan: prompt hakim yang disusun oleh satu model, jawaban kandidat yang dihasilkan oleh dua model lainnya, panggilan alat yang dinilai sebelum dijalankan. Harga daftar penyedia diteruskan dengan markup 0%, sehingga penurunan harga pada generator langsung berlaku di sisi kami pada hari yang sama, dan failover otomatis menjaga sisi generasi dari loop penilaian tetap hidup ketika satu penyedia mengalami degradasi — yang lebih penting dari biasanya di sini, karena pipeline yang menilai semua yang dilihatnya tidak memiliki ruang cadangan untuk mencoba ulang panggilan yang macet.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Siapa yang harus mengambil yang mana

Pilih Intern-Decision-4B jika salah satu dari hal berikut benar: Anda perlu menilai gambar sekaligus teks, Anda memerlukan angka kalibrasi sebelum dapat merilis, Anda menginginkan opsi untuk menjalankan model di perangkat keras Anda sendiri di dalam batas yang Anda kendalikan, atau Anda ingin menyempurnakannya. Poin terakhir perlu ditekankan — penilai berbobot terbuka 4B dengan wrapper yang terdokumentasi adalah model yang dapat Anda adaptasi ke label Anda sendiri, sedangkan Microsoft-Decision-1 adalah API terkelola tanpa jalur fine-tuning dan tanpa bobot untuk diadaptasi.

Ambil Microsoft-Decision-1 jika penghambatnya adalah pengadaan, bukan performa: Anda memerlukan autentikasi Azure, penagihan terpusat, tata kelola, dan penilaian Responsible AI dari vendor sebelum apa pun mencapai produksi, dan Anda memerlukan konteks 32K untuk dokumen panjang yang diperumit oleh batas per panggilan milik 4B. Ketiadaan tolok ukur yang dipublikasikan memang merupakan biaya nyata, tetapi itu adalah biaya yang dapat Anda hapus dalam satu sore dengan menjalankan kumpulan berlabel Anda sendiri melalui kedua model dan membandingkan ECE — yang memang akan Anda lakukan pula sebelum memercayai tabel dari vendor mana pun.

Jawaban yang tidak nyaman adalah bahwa keduanya cukup murah untuk diuji sehingga perdebatan itu hampir tidak layak dilakukan. Intern-Decision-4B membutuhkan GPU yang mungkin sudah Anda miliki. Microsoft-Decision-1 membutuhkan deployment Foundry dan sampel keputusan berlabel milik Anda sendiri. Jalankan data Anda melalui keduanya, hitung kalibrasi pada subset yang penting bagi Anda, dan biarkan angkanya yang menentukan — yang, secara tepat, memang itulah tujuan model-model ini.