Kartu judul yang dihasilkan untuk Microsoft-Decision-1 vs Intern-Decision-2B dengan subjudul 'checkpoint tengah yang paling cepat menjawab dan paling buruk dalam menyatakan seberapa yakin ia', dengan chip bertuliskan 2.213.241.664 parameter, suhu 2,100509348278, ECE 0,100, 33,28 ms pada 4090, dan batas 8.192 token.
Engineering & Research

Microsoft-Decision-1 vs Intern-Decision-2B: Sembilan Milidetik Lebih Cepat dan Kalibrasinya Secara Terukur Lebih Buruk

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ada satu angka di tabel milik InternLM sendiri yang seharusnya tidak ada, dan itulah alasan mengapa perbandingan ini lebih bernilai daripada lembar spesifikasi. Intern-Decision-2B — 2.213.241.664 parameter, disempurnakan dari Qwen/Qwen3.5-2B, diunggah ke Hugging Face pada 26 September 2026 pukul 05:36:19 UTC tanpa pengumuman — mencatat 33,28 ms latensi rata-rata per kueri pada satu RTX 4090, yang sedikit lebih cepat daripada saudaranya berparameter 852 juta pada 33,98 ms. Model ini juga mencatat kalibrasi terburuk di keluarganya: kesalahan kalibrasi yang diharapkan sebesar 0,100 versus 0,066 milik model 0,8B, dengan suhu terpasang sebesar 2,100509348278 versus 2,747760550703 milik model 0,8B. Sementara itu Microsoft-Decision-1, yang tersedia secara umum di Microsoft Foundry sejak 8 Oktober 2026, tidak memublikasikan angka latensi maupun kesalahan kalibrasi sama sekali — hanya satu paragraf metodologi yang menjelaskan bagaimana keduanya diukur. Jadi pertanyaan yang sebenarnya diajukan oleh pertarungan ini bukanlah mana di antara keduanya yang lebih baik. Melainkan apa yang Anda beli ketika Anda membeli ukuran menengah dari apa pun.

Kedua model adalah pemberi skor keputusan: state masuk, kumpulan pertanyaan terbatas masuk, probabilitas terkalibrasi keluar, tanpa teks yang dihasilkan dan tanpa token yang perlu diurai. Kontrak bersama itulah yang membuat perbedaannya mudah terbaca. Microsoft-Decision-1 adalah API Foundry yang dihosting, hanya teks, di atas basis Qwen3.5-9B dengan jendela 32.768 token, tanpa bobot terdistribusi dan tanpa jalur fine-tuning. Intern-Decision-2B adalah checkpoint Apache-2.0 dengan lisensi Qwen upstream yang dipertahankan sebagai LICENSE-QWEN, repositori sekitar 4,46 GB, kode inferensi khusus, dan tanpa endpoint yang dihosting di mana pun.

Ukuran sedang sebenarnya untuk apa

InternLM merilis tiga checkpoint dalam empat puluh detik: yang 0.8B pada 05:35:57, yang ini pada 05:36:19, yang 4B pada 05:36:37. Pada rata-rata tujuh suite milik vendor sendiri, keluarga ini menanjak dalam urutan yang Anda harapkan — 79,38, 84,68, 90,02 — dan inilah satu-satunya tempat di mana 2B tampak seperti pembelian yang masuk akal. Di semua tempat lain, ukuran itu tampak seperti ukuran yang tidak akan dipilih siapa pun dengan sengaja.

Pemrosesan prompt mendominasi sebuah panggilan keputusan, dan itulah penjelasan mekanis untuk inversi latensi, bukan sebuah misteri. Sebuah scorer melakukan tepat satu forward pass atas prompt yang panjangnya ditentukan oleh state, skema, dan deskripsi opsi — tidak pernah oleh apa pun yang ditulis model, karena model tidak menulis apa pun. Dalam rezim itu, jumlah parameter adalah biaya tingkat kedua, sehingga alasan biasa untuk memilih checkpoint terkecil tidak berlaku: Anda tidak menghemat waktu, Anda menghemat memori. Seluruh repositori 0.8B sekitar 1,73 GB dibandingkan 4,46 GB model ini, dan itulah alasan jujur untuk lebih memilihnya. Satu-satunya klaim nyata dari 2B adalah bahwa ia kebetulan menjadi yang tercepat di antara yang cepat, dengan selisih yang cukup kecil untuk dianggap noise.

Jika dibandingkan dengan Microsoft-Decision-1, klaim itu hampir tidak relevan, karena kedua model tidak berada dalam rezim latensi yang sama. Kecepatan endpoint yang dihosting adalah fungsi dari bentuk deployment Anda — serverless versus throughput yang disediakan pada SKU standar yang sama — sebelum menjadi fungsi dari modelnya, dan Microsoft tidak menerbitkan angka per panggilan untuk dibandingkan. Yang Microsoft terbitkan adalah batasan operasional keras yang justru berlawanan arah: inferensi batch dinonaktifkan. Tidak ada saluran offline untuk mengamortisasi proses scoring massal, sehingga pipeline Microsoft-Decision-1 menanggung biaya interaktif untuk setiap keputusan, sementara checkpoint yang dihosting sendiri membayar dalam jam GPU baik saat melakukan scoring maupun tidak.

Kolom kalibrasi, tempat bagian tengah kalah

Baca ketiga kartu Intern-Decision sekaligus dan keluarga ini tidak lagi berperilaku seperti yang dapat diprediksi. Akurasi bersifat monoton terhadap ukuran; kalibrasi tidak. Model 2B memiliki ECE sebesar 0.100 — yang terlemah dari ketiganya — dan temperatur hasil fitting 2.100509348278, jauh di bawah nilai 0.8B sebesar 2.747760550703. Kartu tersebut menginstruksikan Anda untuk menggunakan modul inferensi yang disertakan dengan ukuran yang Anda unduh, karena kalibrasi default bersifat per-checkpoint; siapa pun yang menyalin wrapper dari satu saudara ke saudara lainnya secara diam-diam menerapkan temperatur yang salah.

Transformasi itu sendiri layak dipahami sebelum Anda menganggap 0,100 itu sebagai putusan atas bobot. Transformasi ini adalah softmax atas logit kandidat field, diikuti softmax kedua atas log distribusi tersebut dibagi temperatur. Karena dijalankan setelah softmax pertama dan mempertahankan urutan, ia sama sekali tidak dapat mengubah argmax. Ia menggeser keyakinan, probabilitas ya, dan nilai harapan dari pertanyaan skor, serta membiarkan label tetap identik. Jika pipeline Anda membaca label, temperatur tidak berpengaruh dan ECE hanyalah keingintahuan. Jika pipeline Anda membaca probabilitas — memberi ambang padanya, memeringkat berdasarkan itu, memasukkannya ke perhitungan nilai harapan — maka ECE 0,100 adalah perbedaan antara ambang yang berarti seperti yang Anda tulis dan ambang yang tidak. Respons yang tepat adalah menyesuaikan temperatur Anda sendiri pada kasus berlabel Anda sendiri, bukan menyimpulkan bahwa bobotnya buruk.

Microsoft-Decision-1 meminta pekerjaan yang persis sama, dengan lebih sedikit modal awal. Tab Benchmarks-nya menyatakan bahwa akurasi, error kalibrasi, recall keamanan, tingkat positif palsu, dan konsistensi keadilan diukur pada benchmark keputusan publik dan komunitas ditambah set pengujian internal yang disisihkan, bahwa urutan opsi divariasikan, bahwa uji statistik berpasangan diterapkan, dan bahwa model tersebut "berkinerja setara dengan model keputusan terdepan dan lebih unggul daripada model keputusan terbuka lain yang dievaluasi dengan metodologi yang sama." Tidak ada ECE. Tidak ada Brier. Tidak ada temperature. Tidak ada tabel akurasi. Model yang seluruh proposisi nilainya adalah probabilitas yang dapat dipercaya adalah satu-satunya dalam perbandingan ini tanpa angka kalibrasi yang dipublikasikan sama sekali.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-2B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; context 32,768 tokens; modalities text only; batch inference disabled; calibration error not published; latency not published. Right column Intern-Decision-2B rows read: availability uploaded September 26, 2026; context 8,192 tokens with oversize input rejected; modalities text plus up to eight images; batch inference not applicable, self-hosted; ECE 0.100, the worst of its three siblings; 33.28 ms mean on a single RTX 4090, the fastest of the three. A footer line reads that the InternLM figures are vendor-reported and the 2B's fitted temperature is 2.100509348278.

Batas kontrak: empat hal yang tidak akan dilakukan oleh model yang dihosting

Kedua model menerima apa yang tampak seperti panggilan yang sama, dan perbedaannya terletak di bagian tepinya.

• Modalitas — Microsoft-Decision-1 secara eksplisit hanya teks dan tidak menerima gambar, audio, atau video. Intern-Decision-2B menerima hingga delapan gambar bersama state, yang menjadikannya kandidat untuk triase tangkapan layar dan pemeriksaan tata letak yang tidak dapat dilayani oleh API hosted dengan akurasi apa pun.

• Batas input dan mode kegagalan — Microsoft-Decision-1 menjalankan satu invokasi atas hingga 32.768 token. Intern-Decision-2B mendeklarasikan DecisionEngine(max_length=8192) dan menolak input yang terlalu besar alih-alih memotongnya, yang merupakan perilaku yang benar untuk penilai dan juga batas keras, karena state, skema, dan kerangka harus semuanya ada dalam satu lintasan; tidak ada strategi chunking yang mempertahankan kontrak.

• Bentuk pertanyaan — InternLM mendokumentasikan satu hingga enam belas pertanyaan per panggilan dengan hingga 62 opsi masing-masing di tiga jenis bidang (choice, score, noul), di mana noul adalah biner ya/tidak yang mengembalikan probabilitas dan score mengembalikan nilai ekspektasi berbobot probabilitas pada skala yang Anda tentukan. Microsoft mendokumentasikan format-formatnya — ya/tidak, pilihan ganda, rating, klasifikasi, rubrik — plus opsi abstain yang didukung secara eksplisit seperti "cannot tell" ketika buktinya tidak memadai, yang merupakan satu baris paling berguna di halaman itu bagi siapa pun yang menulis logika eskalasi.

• Harga — halaman model Microsoft-Decision-1 tidak mencantumkan tarif; tautan penetapan harga mengarah ke halaman penetapan harga Microsoft, sehingga biaya per keputusan adalah sesuatu yang Anda baca dari Azure atau dari tagihan, dengan 0% di antaranya dapat dikaitkan dengan token keluaran karena tidak ada token keluaran. Intern-Decision-2B tidak memerlukan biaya per panggilan dan semuanya ada pada waktu GPU, dan model ini tidak memiliki penyedia terkelola. Penyimpanannya sekitar 4,46 GB yang terdiri atas shard bahasa 3,76 GB, menara visi 612,5 MB, dan proyektor 50,3 MB.

Apa yang sudah terkonfirmasi, dan apa yang hanya klaim vendor?

Menjaga kedua kategori itu tetap terpisah adalah keseluruhan disiplin pada keluarga ini. Dikonfirmasi oleh daftar file atau respons HTTP: jumlah parameter, peta shard, pasangan lisensi, model dasar, arsitektur di baliknya — sebuah Qwen3_5ForConditionalGeneration dengan 24 lapisan, ukuran tersembunyi 2.048, 8 kepala kueri terhadap 2 kepala key-value, dimensi kepala 256, pola berulang tiga lapisan atensi linier ke satu lapisan atensi penuh, satu lapisan prediksi multi-token yang dipertahankan, dan plafon embedding 262.144 posisi yang membuat plafon mesin 8.192 token secara praktis tidak relevan.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Dilaporkan vendor dan tidak dapat direproduksi: setiap angka akurasi, setiap angka latensi, dan temperature-nya. Tidak ada makalah, tidak ada entri arXiv, tidak ada pos peluncuran, tidak ada changelog dan tidak ada evaluasi independen. Space demo merespons 401, yang berarti Space itu tidak publik, bukan rusak. Repositori GitHub yang muncul setelah modelnya — tiga commit, kode pelatihan, dua backend inferensi, bundel evaluasi dengan 10.751 baris uji, tolok ukur kalibrasi 96 kasus dan panduan reproduksi — adalah lebih banyak dokumentasi daripada yang didapat sebagian besar rilis senyap, dan repositori itu tidak menyertakan bobot, data pelatihan, maupun lisensi kode. Microsoft berada dalam posisi yang berbeda tetapi berdekatan: metodologinya nyata dan klaimnya bersifat kualitatif, dan saat ini tidak ada dari kedua perusahaan itu yang berada dalam posisi untuk membuat angka intinya diperiksa oleh siapa pun selain Anda.

Di mana posisi OrcaRouter dalam pipeline seperti ini

Tidak ada satu pun dari kedua model itu yang ada dalam katalog kami, dan tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim ketersediaan. Model yang mengembalikan probabilitas alih-alih teks bukanlah sesuatu yang Anda gunakan untuk merutekan chat completion, dan hal itu berlaku untuk keduanya. Yang kami sediakan adalah separuh generatif dari loop yang menjadi tujuan keberadaan para penilai tersebut: lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI yang menulis rubrik, menyusun draf jawaban kandidat, dan mengeluarkan tool call yang kemudian dinilai oleh penilai sebelum dieksekusi. Harga daftar penyedia diteruskan pada markup 0%, sehingga pemotongan harga vendor di sisi generatif langsung berlaku di sisi kami pada hari yang sama, dan jika Anda lebih memilih untuk tidak mempertaruhkan ambang batas Anda pada satu juri saja, DSL perutean menyusun beberapa model menjadi satu panggilan dan fusi model melaporkan tingkat kesepakatan mereka sebagai bidang yang dapat Anda nilai. Failover otomatis menjaga sisi itu tetap hidup ketika satu penyedia mengalami penurunan kinerja, yang lebih penting dalam loop yang menilai semua yang dilihatnya daripada dalam loop yang menjawab pengguna sesekali.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Intinya

Microsoft-Decision-1 telah tersedia secara umum di Microsoft Foundry sejak 8 Oktober 2026: dihosting, hanya teks, 32.768 token, basis Qwen3.5-9B yang dilatih lanjut oleh Microsoft, tanpa bobot terdistribusi, dan bagian tolok ukur yang mendokumentasikan metodologinya tanpa mencetak angka — termasuk tanpa latensi, dengan inferensi batch dimatikan. Intern-Decision-2B adalah checkpoint Apache-2.0 dengan 2.213.241.664 parameter dari 26 September 2026 yang merupakan yang tercepat di antara ketiga saudaranya pada 33,28 ms di 4090 dan yang paling buruk kalibrasinya pada ECE 0,100, dengan suhu hasil fitting sebesar 2,100509348278 yang tidak dapat mengubah label tetapi akan mengubah setiap keyakinan yang Anda jadikan ambang. Jika Anda menginginkan ukuran menengah, alasan jujurnya tipis: bayar tambahan 2,7 GB untuk akurasi 4B atau terima jejak 0,8B, dan dalam dunia mana pun, fitting kalibrasi Anda sendiri sebelum ambang batas sedekat apa pun mendekati produksi.

Yang kami bawa adalah separuh generatif dari loop yang menjadi tujuan keberadaan para penilai itu: lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI yang menulis rubrik, menyusun draf jawaban kandidat, dan mengeluarkan panggilan alat yang kemudian diberi skor oleh penilai sebelum dieksekusi.