Kartu judul yang dihasilkan untuk Microsoft-Decision-1 vs Intern-Decision-0.8B dengan subjudul 'penilai yang dihosting tanpa angka melawan checkpoint 1,73 GB dengan angka yang kurang menguntungkan', dengan chip bertuliskan endpoint Foundry melawan 852.985.920 parameter, paragraf metodologi versus skor WildJailBreak 64,48, dan 32.768 token melawan batas 8.192.
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-0.8B: Setengah Ons Masalah Jailbreak Melawan Blank yang Di-host

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Mulailah dari kolom yang akan dilewatkan oleh sebuah postingan peluncuran. Intern-Decision-0.8B — model keputusan 852.985.920 parameter milik InternLM, di-fine-tune dari Qwen3.5-0.8B dan diunggah ke Hugging Face pada 26 September 2026 tanpa pengumuman, tanpa makalah, dan dengan tautan GitHub yang masih 404 — diukur pada 64.48 pada WildJailBreak terhadap referensi 96.29 untuk Jev 1.13 milik TypeSafe. Itu bukan perbedaan pembulatan. Itu adalah keruntuhan ketahanan penolakan pada model yang seluruh tugasnya adalah menilai input, yang diterbitkan pada kartu model milik vendornya sendiri, dalam tabel yang tolok ukurnya milik pesaing. Letakkan itu bersebelahan dengan Microsoft-Decision-1, yang tersedia secara umum di Microsoft Foundry pada 8 Oktober 2026 sebagai penilai khusus teks yang menjalani post-training pada Qwen3.5-9B dengan metodologi evaluasi yang terdokumentasi dan tanpa satu pun hasil yang dicetak di bawahnya, dan Anda akan melihat bentuk sebenarnya dari pertarungan ini. Salah satu dari model ini akan memberi tahu Anda sebuah angka yang membuatnya terlihat buruk. Yang lainnya memberi tahu Anda metrik mana yang akan digunakannya.

Pembalikan itu lebih bernilai daripada lembar spesifikasi. Kedua model menerima suatu state dan kumpulan pertanyaan yang terbatas lalu mengembalikan probabilitas atas opsi-opsi Anda — keduanya tidak menghasilkan teks, dan pada sumbu itu keduanya adalah jenis instrumen yang sama. Perbedaan yang penting adalah siapa yang menjalankannya, seberapa besar ukurannya, seberapa banyak yang dapat Anda verifikasi, dan satu kolom keamanan yang tetap dipilih untuk diterbitkan oleh model yang lebih kecil, lebih senyap, dan dapat diunduh sepenuhnya.

Apa yang sebenarnya dikembalikan oleh masing-masing

Microsoft-Decision-1 adalah API yang dihosting, dan itu adalah perbedaan struktural pertama. Bobotnya tidak didistribusikan — tidak ada unduhan, tidak ada repositori, tidak ada jalur penyetelan halus — dan integrasi berarti penerapan Foundry dengan autentikasi, penagihan, dan tata kelola Azure yang menyertainya. Model ini menjalankan satu lintasan atas hingga 32.768 token, mendukung pertanyaan ya/tidak, pilihan ganda, penilaian, klasifikasi, dan pertanyaan berbentuk rubrik, serta hanya teks masuk dan numerik keluar. Model ini secara eksplisit mendukung opsi abstensi seperti "tidak dapat menentukan" ketika buktinya tidak cukup, dan itulah yang membuat ambang batas menjadi bermakna.

Intern-Decision-0.8B adalah susunan yang sebaliknya. Ini adalah bobot Apache 2.0 dengan lisensi Qwen hulu yang dipertahankan di sampingnya sebagai LICENSE-QWEN, sekitar 1,73 GB repositori yang terbagi dalam tiga shard — shard bahasa 1,50 GB, shard visi 176 MB, dan proyektor 25 MB — yang muat pada satu GPU konsumen atau laptop dengan spesifikasi memadai. Model ini menerima sebuah state, skema berisi satu hingga enam belas pertanyaan bernama dengan masing-masing hingga 62 opsi, dan secara opsional hingga delapan gambar, serta inference.py bawaannya mendokumentasikan kontrak tersebut dengan lebih rinci daripada yang biasanya diupayakan kebanyakan model yang dirilis: opsi dipetakan ke simbol satu token A–Z, lalu a–z, lalu 0–9; logit dibaca pada posisi tepat sebelum setiap placeholder <decision> dalam kerangka yang telah dirender sebelumnya; softmax diambil hanya atas kandidat yang sah untuk bidang tersebut; suhu yang telah disesuaikan diterapkan.

Kedua lisensi itu bukan pembelian yang sama. Microsoft-Decision-1 memberi Anda endpoint terkelola dan tidak ada artefak yang Anda miliki. Intern-Decision-0.8B memberi Anda artefak yang Anda miliki, tanpa endpoint, tanpa kontrak dukungan, dan tanpa dokumentasi selain repositori itu sendiri.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Plafon, dan kalibrasi yang dapat Anda audit

Dua angka menentukan sebagian besar integrasi nyata, dan keduanya milik model kecil.

Yang pertama adalah 8,192 token. Mesin inferensi Intern-Decision-0.8B menolak masukan yang terlalu besar alih-alih memotongnya, yang merupakan perilaku yang benar untuk pemberi skor dan juga batas keras: tidak ada strategi chunking yang mempertahankan kontrak, karena state, skema, dan skeleton semuanya harus berada dalam satu lintasan. Batas atas Microsoft-Decision-1 empat kali lebih tinggi pada 32,768, dan itu adalah batas hosted yang dapat Anda naikkan dengan melakukan provisioning secara berbeda, bukan konstanta dalam file Python.

Yang kedua adalah kalibrasi, dan di sini arahnya berbalik. InternLM menerbitkan temperatur hasil fit sebesar 2.747760550703 untuk model 0.8B, yang dipilih melalui minimisasi NLL atas 1.728 kasus kalibrasi yang ditetapkan, dengan 1.693 disisihkan untuk validasi, dan kartu modelnya secara eksplisit menyatakan bahwa label test-suite tidak digunakan untuk memilihnya. Transformasi yang diterapkan adalah softmax atas logit kandidat bidang tersebut diikuti softmax kedua atas log dari distribusi itu yang dibagi dengan temperatur. Karena transformasi berjalan setelah softmax pertama dan mempertahankan urutan, ia sama sekali tidak dapat mengubah argmax — ia menggeser keyakinan, probabilitas ya, dan nilai harapan dari pertanyaan skor, serta membiarkan label tetap identik. Jika pipeline Anda membaca label, temperatur tidak berpengaruh. Jika pipeline membaca probabilitas, memberi ambang batas padanya, atau memasukkannya ke dalam perhitungan nilai harapan, temperatur adalah perbedaan antara angka yang bermakna dan angka yang tidak. Memberikan temperature=1 mengembalikan distribusi yang tidak terkalibrasi jika Anda lebih suka melakukan fit sendiri.

Microsoft-Decision-1 tidak memiliki artefak yang setara. Tab Benchmarks-nya menyatakan bahwa akurasi, kesalahan kalibrasi, recall keamanan, tingkat positif palsu, dan konsistensi keadilan diukur pada tolok ukur keputusan publik dan komunitas ditambah set uji internal yang disisihkan, bahwa urutan opsi divariasikan, bahwa uji statistik berpasangan diterapkan, dan bahwa model tersebut "tampil setara dengan model keputusan terkemuka dan lebih unggul daripada model keputusan terbuka lain yang dievaluasi dengan metodologi yang sama." Tidak ada kesalahan kalibrasi yang tercetak, tidak ada suhu untuk diperiksa, dan tidak ada pembagian validasi yang dijelaskan. Satu properti yang membuat probabilitas berguna — apakah 0,8 berarti 0,8 — dinyatakan dan tidak dikuantifikasi.

Bacalah kedua paragraf itu secara berdampingan, dan perbandingannya tidak lagi soal ukuran. Checkpoint 0,8 miliar parameter yang kalibrasinya dapat Anda periksa dan perangkat lunaknya dapat Anda jalankan, bagi tim evaluasi, adalah objek yang lebih mudah ditangani daripada API terkelola yang kalibrasinya hanyalah sebuah kalimat. Model kecil itu juga memiliki angka latensi yang tercatat — rata-rata 33,98 ms, median 33,44 ms, p95 37,50 ms per kueri pada satu RTX 4090 melalui jalur Hugging Face lokal, dalam pengukuran InternLM sendiri — sedangkan milik Microsoft adalah sesuatu yang Anda ukur melalui deployment Anda sendiri, di mana pilihan antara serverless dan throughput yang disediakan akan lebih banyak menggeser angka tersebut daripada modelnya sendiri.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-0.8B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; weights not distributed; calibration error not published; latency not published. Right column Intern-Decision-0.8B rows read: availability uploaded September 26, 2026; parameters 852,985,920 in 1.73 GB; input ceiling 8,192 tokens with oversize input rejected; weights Apache 2.0 and self-serve; Brier 0.530 and ECE 0.066; 33.98 ms mean on a single RTX 4090. A footer line reads that the InternLM figures are vendor-reported on InternLM's own harness with no independent reproduction.

Di mana model kecil kalah

Tidak satu pun dari hal-hal di atas membuat Intern-Decision-0.8B menjadi pilihan yang aman, dan tabel terbitan yang sama menjelaskan alasannya. WildJailBreak pada 64.48 versus 96.29 milik Jev adalah kesenjangan ketangguhan penolakan sebesar tiga puluh poin pada kategori persis ketika seorang penilai berhadapan dengan masukan yang tidak tepercaya. Model keputusan sering kali merupakan komponen yang memutuskan apakah tindakan yang diusulkan diizinkan; model yang mudah dibujuk dengan kata-kata menjadi liabilitas di posisi itu. Apakah defisit itu berasal dari basis Qwen3.5-0.8B, dari tujuan penyetelan keputusan, atau dari jumlah parameter yang kecil bukanlah sesuatu yang diberitahukan oleh repositori, dan tidak ada makalah, resep pelatihan, maupun pengungkapan data yang akan memberitahukannya.

Sisa tabel milik InternLM sendiri lebih menyanjung daripada kolom tersebut dan tetap sederhana. Rata-rata di tujuh suite adalah 79,38 untuk 0,8B versus 84,68 untuk saudara 2B-nya sendiri dan 90,02 untuk 4B — keluarga ini menanjak tajam seiring ukuran, yang merupakan sinyal ringan bahwa tabel itu tidak direkayasa balik untuk menyanjung model andalan. AG News berada di 88,61 versus 89,57 milik Jev, praktis setara pada klasifikasi topik empat kelas. Dalam hal kalibrasi, 0,8B melaporkan Brier 0,530 dan expected calibration error 0,066, versus 0,358 dan 0,095 milik Jev — ECE lebih baik, akurasi jauh lebih buruk. Itu profil yang masuk akal untuk model kecil dengan temperature yang sengaja disesuaikan, dan itu bukan kombinasi yang akan dipilih tim pemasaran untuk diterbitkan secara kebetulan.

Juga tidak ada tanggal rilis, tidak ada pengumuman, tidak ada koleksi yang mengumpulkan ketiga checkpoint tersebut, tidak ada endpoint yang dihosting di mana pun, dan tidak ada evaluasi independen. Space demo tersebut merespons 401. Deskripsi yang tepat untuk Intern-Decision-0.8B adalah checkpoint yang telah dirilis dengan klaim yang belum diaudit — yang merupakan situasi lebih baik daripada API dengan daftar tunggu, karena Anda dapat mengukurnya dalam waktu satu sore, tetapi itu berarti validasinya sepenuhnya menjadi tanggung jawab Anda.

Memilih, dan di mana posisi OrcaRouter

Ambil Microsoft-Decision-1 jika penghambatnya adalah pengadaan atau skala: Anda memerlukan autentikasi Azure, penagihan terpadu, dan penilaian AI yang Bertanggung Jawab sebelum apa pun mencapai produksi; Anda memerlukan konteks 32K; Anda memerlukan endpoint yang tidak Anda operasikan; atau Anda memerlukan jalur abstensi yang dirancang di dalamnya daripada dibuat sendiri. Terima sebagai gantinya bahwa Anda tidak dapat menjalankannya, tidak dapat melakukan fine-tune, tidak dapat memeriksa kalibrasinya, dan akan mengukur klaim intinya sendiri.

Ambil Intern-Decision-0.8B jika penghalangnya adalah biaya, memori, atau kendali: Anda menginginkan pemberi skor Apache-2.0 yang muat dalam 1,73 GB, berjalan pada perangkat keras yang sudah Anda miliki, menghasilkan label yang sama setiap kali, dan dapat ditukar dengan saudara 2B atau 4B-nya hanya dengan mengubah jalur checkpoint. Terimalah sebagai gantinya batas 8.192 token, kolom WildJailBreak, dan fakta bahwa tidak ada orang di luar InternLM yang mereproduksi apa pun pada kartu tersebut.

Rekomendasi jujurnya adalah melakukan keduanya, karena keduanya cukup murah sehingga perdebatannya nyaris tidak layak dilakukan. Panggilan penilaian itu sendiri bukan sesuatu yang kami rutekan — model yang mengembalikan probabilitas alih-alih teks bukanlah penyelesaian chat, dan tidak satu pun dari ini ada dalam katalog kami. Yang dibawa OrcaRouter adalah separuh lain dari loop: lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI yang menyusun rubrik, menghasilkan jawaban kandidat, atau mengeluarkan panggilan alat yang akan dinilai oleh penilai Anda, dengan harga daftar penyedia yang diteruskan dengan markup 0%, sehingga pemotongan harga vendor pada generator berlaku di sisi kami pada hari yang sama. Failover otomatis lebih penting dari biasanya di sini, karena pipeline yang menilai semua yang dilihatnya tidak punya ruang untuk mencoba ulang panggilan yang macet, dan DSL perutean memungkinkan Anda mengirim satu prompt penilai ke beberapa penulis dan menggabungkan kesepakatan mereka alih-alih mempercayai satu saja.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

Intinya

Microsoft-Decision-1 mencapai ketersediaan umum di Microsoft Foundry pada 8 Oktober 2026: dihosting, hanya teks, 32.768 token, dibangun di atas Qwen3.5-9B, dengan paragraf metodologi sebagai pengganti tabel tolok ukur. Intern-Decision-0.8B adalah checkpoint Apache-2.0 berukuran 1,73 GB yang diunggah pada 26 September 2026 yang menerbitkan Brier 0,530, ECE 0,066, temperature hasil fitting 2,747760550703, 33,98 ms pada 4090 — dan skor WildJailBreak 64,48 yang tidak diminta siapa pun untuk dicetak. Jika Anda hanya dapat memvalidasi satu hal sebelum mengadopsi salah satunya, validasikan kalibrasi pada kasus berlabel Anda sendiri; itulah angka yang kedua vendor biarkan untuk Anda temukan.