
Microsoft-Decision-1 vs Intern-Decision-4B: Satu Menerbitkan Kalibrasinya, yang Lain Menerbitkan Metodologinya
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Letakkan Microsoft-Decision-1 di samping Intern-Decision-4B dan Anda akan mendapatkan perbandingan yang lebih ditentukan bukan oleh kemampuan melainkan oleh apa yang masing-masing vendor bersedia publikasikan. Model Microsoft mencapai ketersediaan umum di Microsoft Foundry pada 8 Oktober 2026: basis Qwen3.5-9B, pasca-dilatih oleh Microsoft, hanya teks, konteks 32.768 token, bobot tidak didistribusikan, metodologi evaluasi yang menjelaskan akurasi, kesalahan kalibrasi, dan uji statistik berpasangan — dan tidak ada satu pun hasil. Intern-Decision-4B dari InternLM diunggah ke Hugging Face pada 26 September 2026 pukul 05:36:37 UTC tanpa pengumuman apa pun di baliknya, di-fine-tune dari Qwen3.5-4B, menerima gambar maupun teks, berjalan dalam 44 milidetik pada satu RTX 4090, dan mencetak tabel lengkap angka Brier dan expected-calibration-error. Keduanya mengembalikan distribusi probabilitas atas opsi yang Anda berikan. Hanya satu di antaranya yang memberi tahu Anda seberapa baik ia melakukannya.
Inversi itu — model yang lebih besar dan lebih banyak didanai justru menjadi yang tidak transparan — adalah keseluruhan bentuk perbandingan ini, dan itu menentukan pilihan bagi sebagian besar tim lebih cepat daripada baris spesifikasi mana pun.
Satu angka yang membedakan mereka
InternLM melaporkan Brier 0,347 dan ECE 0,065 untuk Intern-Decision-4B di seluruh rangkaian benchmark-nya, dengan skor rata-rata 90,02 pada Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) dan WildJailBreak (89,86). Itu adalah angka yang dilaporkan vendor pada harness milik vendor sendiri, dan baris Jevbench khususnya adalah keluarga benchmark proyek itu sendiri — bacalah sebagai penilaian mandiri, bukan verifikasi independen. Tetapi itu adalah angka dengan skala yang dinyatakan, dan ECE khususnya adalah angka yang memberi tahu Anda apakah nilai 0,8 yang dikembalikan layak untuk ditindaklanjuti.
Microsoft tidak menerbitkan padanan apa pun. Tab Benchmarks pada halaman katalog Microsoft-Decision-1 menjelaskan apa yang diukur dan mengklaim bahwa model tersebut "tampil setara dengan model keputusan terkemuka dan lebih unggul daripada model keputusan terbuka lain yang dievaluasi dengan metodologi yang sama," dengan area terkuat disebut penalaran, penerapan aturan, dan ketangguhan format prompt, serta yang terlemah sebagai pengetahuan domain khusus. Tidak ada Brier, tidak ada ECE, tidak ada tabel akurasi. Jika keputusan adopsi Anda memerlukan angka kalibrasi sebelum Anda dapat menentukan besaran ambang eskalasi, salah satu dari dua model ini memberikannya kepada Anda dan yang lain meminta Anda mengukurnya sendiri.

Di mana kedua kontrak itu sebenarnya berbeda.
Di permukaan, model-model ini menerima pemanggilan yang sama. Anda menyuplai sebuah state, skema pertanyaan bernama, dan sekumpulan opsi tetap; Anda menerima kembali probabilitas per opsi tanpa satu token pun teks yang dihasilkan. Perbedaannya muncul di tepi-tepi kontrak tersebut.
• Modalitas — Microsoft-Decision-1 secara eksplisit hanya untuk teks dan tidak menerima atau menghasilkan konten gambar, audio, maupun video. Intern-Decision-4B menerima gambar opsional bersama state, hingga delapan gambar per panggilan, dan itulah yang menjadikannya kandidat untuk triase screenshot, pemeriksaan tata letak dokumen, dan perutean QA visual.
• Kardinalitas pertanyaan — InternLM mendokumentasikan 1 hingga 16 pertanyaan per panggilan, hingga 62 opsi masing-masing, di tiga jenis bidang (pilihan, skor, noul). Microsoft mendokumentasikan format — ya/tidak, pilihan ganda, peringkat, klasifikasi, rubrik — dan satu pemanggilan hingga 32K token, tetapi tidak ada batas pertanyaan per panggilan.
• Konteks — Microsoft menyatakan 32.768 token. Kartu Intern-Decision-4B menyatakan batasnya dalam pertanyaan, opsi, dan gambar, bukan sebagai satu angka konteks, sehingga Anda tidak dapat menyandingkan keduanya pada satu angka.
• Distribusi — Microsoft-Decision-1 adalah API Foundry yang dihosting; bobot model tidak didistribusikan dan tidak ada unduhan. Intern-Decision-4B adalah Apache-2.0 di Hugging Face dengan lisensi Qwen hulu yang dipertahankan sebagai LICENSE-QWEN, yang berarti mempertahankan lisensi tersebut dan pemberitahuan hulu jika Anda mendistribusikan ulang.
• Struktur biaya — Bobot InternLM tidak memerlukan biaya untuk dijalankan dan tercatat pada rata-rata 44,16 ms, P95 44,60 ms, di satu RTX 4090. Harga per token Microsoft sama sekali tidak dicantumkan di halaman model.
• Tata kelola — Microsoft merilis penilaian Responsible AI, praktik penerapan yang didokumentasikan, dan pengecualian eksplisit (bukan untuk pembuatan teks, QA terbuka, percakapan, penerjemahan atau peringkasan; bukan untuk menjadi satu-satunya pengambil keputusan otomatis dalam keputusan berdampak tentang orang). InternLM merilis kartu model yang jujur tentang asal-usul — bobot "dimodifikasi oleh penyetelan keputusan" — dan tidak ada yang menyerupai paket kepatuhan.

Dua alasan yang sangat berbeda mengapa angka latensi sulit dibandingkan
Microsoft-Decision-1 tidak mempublikasikan angka latensi, jadi tidak ada yang bisa diletakkan di samping rata-rata 44,16 ms milik InternLM. Itu bukan kelalaian kecil untuk beban kerja ini. Model-model ini ada untuk dipanggil berkali-kali di dalam pipeline — sekali per dokumen yang diambil, sekali per panggilan alat yang diusulkan, sekali per respons yang dinilai — dan perbedaan antara empat keputusan per detik dan empat puluh adalah perbedaan antara menilai satu sampel dan menilai semuanya. Angka InternLM dapat dicapai hari ini pada perangkat keras yang bisa Anda sewa per jam; angka Microsoft harus diukur melalui deployment Foundry Anda sendiri, dan bentuk deployment yang Anda pilih (serverless bayar sesuai penggunaan versus throughput yang disediakan) akan mengubahnya lebih besar daripada modelnya.
Di sinilah juga bagian OrcaRouter dari pola tersebut menjadi relevan, dan hanya bagian generatifnya. Kami tidak menghosting Microsoft-Decision-1 atau Intern-Decision-4B — model yang mengembalikan probabilitas alih-alih teks bukanlah sesuatu yang Anda arahkan untuk chat completions, dan keduanya tidak muncul di katalog kami. Yang berada di balik satu kunci yang kompatibel dengan OpenAI milik kami adalah kumpulan lebih dari 200 model yang melakukan penulisan: prompt hakim yang disusun oleh satu model, jawaban kandidat yang dihasilkan oleh dua model lainnya, panggilan alat yang dinilai sebelum dijalankan. Harga daftar penyedia diteruskan dengan markup 0%, sehingga penurunan harga pada generator langsung berlaku di sisi kami pada hari yang sama, dan failover otomatis menjaga sisi generasi dari loop penilaian tetap hidup ketika satu penyedia mengalami degradasi — yang lebih penting dari biasanya di sini, karena pipeline yang menilai semua yang dilihatnya tidak memiliki ruang cadangan untuk mencoba ulang panggilan yang macet.

Siapa yang harus mengambil yang mana
Pilih Intern-Decision-4B jika salah satu dari hal berikut benar: Anda perlu menilai gambar sekaligus teks, Anda memerlukan angka kalibrasi sebelum dapat merilis, Anda menginginkan opsi untuk menjalankan model di perangkat keras Anda sendiri di dalam batas yang Anda kendalikan, atau Anda ingin menyempurnakannya. Poin terakhir perlu ditekankan — penilai berbobot terbuka 4B dengan wrapper yang terdokumentasi adalah model yang dapat Anda adaptasi ke label Anda sendiri, sedangkan Microsoft-Decision-1 adalah API terkelola tanpa jalur fine-tuning dan tanpa bobot untuk diadaptasi.
Ambil Microsoft-Decision-1 jika penghambatnya adalah pengadaan, bukan performa: Anda memerlukan autentikasi Azure, penagihan terpusat, tata kelola, dan penilaian Responsible AI dari vendor sebelum apa pun mencapai produksi, dan Anda memerlukan konteks 32K untuk dokumen panjang yang diperumit oleh batas per panggilan milik 4B. Ketiadaan tolok ukur yang dipublikasikan memang merupakan biaya nyata, tetapi itu adalah biaya yang dapat Anda hapus dalam satu sore dengan menjalankan kumpulan berlabel Anda sendiri melalui kedua model dan membandingkan ECE — yang memang akan Anda lakukan pula sebelum memercayai tabel dari vendor mana pun.
Jawaban yang tidak nyaman adalah bahwa keduanya cukup murah untuk diuji sehingga perdebatan itu hampir tidak layak dilakukan. Intern-Decision-4B membutuhkan GPU yang mungkin sudah Anda miliki. Microsoft-Decision-1 membutuhkan deployment Foundry dan sampel keputusan berlabel milik Anda sendiri. Jalankan data Anda melalui keduanya, hitung kalibrasi pada subset yang penting bagi Anda, dan biarkan angkanya yang menentukan — yang, secara tepat, memang itulah tujuan model-model ini.
