Kartu judul yang dihasilkan untuk Intern-Decision-2B bertuliskan 'Dirilis secara senyap, tidak diumumkan' dengan lencana 'tautan GitHub mulai aktif hari ini' dan '2.213.241.664 parameter', dengan logo OrcaRouter dikompositkan di sudut.
Engineering & Research

Intern-Decision-2B Dirilis Secara Senyap ke Hugging Face. Tautan GitHub di Kartunya Baru Saja Tidak Lagi Menghasilkan 404.

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Sebelumnya hari ini, kartu model untuk internlm/Intern-Decision-2Bmenunjuk ke tiga tempat untuk informasi lebih lanjut, dan dua di antaranya sudah mati: Space demo menjawab HTTP 401, dan github.com/internlm/Intern-Decisionmengembalikan 404 kepada siapa pun yang mengkliknya. Per 08:58 UTC, repositori di balik tautan kedua itu sudah ada — publik, dengan tiga commit, memuat kode pelatihan, dua backend inferensi, bundel evaluasi dengan 10.751 baris uji, tolok ukur kalibrasi 96 kasus, dan panduan reproduksi. Itu satu-satunya hal yang telah berubah pada model ini sejak muncul di Hugging Face pada 05:36 UTC, 26 September 2026, dan itu cukup untuk mengubah Intern-Decision-2B dari "checkpoint dengan README yang tidak dapat diakses" menjadi "checkpoint yang benar-benar dapat Anda periksa, jadikan dasar reproduksi, dan debatkan."

Bobotnya sendiri tidak berubah dan tidak ambigu. Intern-Decision-2B adalah model keputusan terstruktur multimodal dengan 2.213.241.664 parameter yang disetel secara halus dari Qwen/Qwen3.5-2B — basis Alibaba dari 28 Februari 2026 — dirilis di bawah Apache-2.0 dengan lisensi Qwen hulu yang dipertahankan di sampingnya sebagai LICENSE-QWEN. Ini adalah yang di tengah dari tiga ukuran yang didorong InternLM dalam empat puluh detik: Intern-Decision-0.8B pada 05:35:57, yang ini pada 05:36:19, dan Intern-Decision-4B pada 05:36:37. Masih belum ada pengumuman dalam bentuk apa pun di balik salah satu dari semuanya itu.

Yang membuat ukuran menengah layak dibahas tersendiri adalah bahwa di situlah keluarga ini berhenti berperilaku secara terprediksi. Berdasarkan angka InternLM sendiri, ini adalah yang tercepat di antara ketiganya dan yang paling buruk kalibrasinya di antara ketiganya, dan kedua fakta itu layak dipahami sebelum Anda mengunduh empat setengah gigabita apa pun.

Apa yang sudah terkonfirmasi, dan apa yang hanya klaim vendor?

Dua kategori, dan keduanya perlu dipisahkan.

Terkonfirmasi, karena ini adalah daftar file atau respons HTTP: jumlah parameter (2,592 F32 ditambah 2,213,239,072 bobot BF16); peta shard (shard bahasa 3.76 GB, menara visi 612.5 MB, proyektor 50.3 MB, sekitar 4.43 GB tensor dan kurang lebih 4.46 GB repositori); pasangan lisensi; model dasar; arsitektur di bawahnya (sebuah Qwen3_5ForConditionalGeneration dengan 24 lapisan, ukuran tersembunyi 2,048, 8 kepala query terhadap 2 kepala key-value, dimensi kepala 256, pola berulang dari tiga lapisan linear-attention ke satu lapisan full-attention, satu lapisan multi-token-prediction yang dipertahankan, dan plafon embedding 262,144 posisi); keberadaan repositori; dan fakta bahwa koleksi model di huggingface.co/collections/internlm/intern-decision sekarang mengarah dan mencantumkan ketiga checkpoint.

Dilaporkan vendor dan tidak direproduksi: setiap angka akurasi, setiap angka latensi, dan suhu kalibrasi. Tidak ada makalah, tidak ada entri arXiv, tidak ada postingan peluncuran, tidak ada changelog, dan tidak ada evaluasi independen — pencarian untuk string "Intern-Decision" tidak mengembalikan apa pun yang membahas model ini. Space demo masih merespons 401, yang berarti tidak publik, bukan bahwa itu rusak. Checkpoint 2B memiliki satu like dan nol unduhan. Tidak ada orang di luar InternLM yang menjalankannya.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal, the Demo, Model Weights and GitHub links, and the card text stating the model is 'a multimodal structured decision model fine-tuned from Qwen3.5-2B' that 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by the five-step 'How inference works' list.

Kontrak inferensi, dalam urutan terjadinya.

Berkas yang paling informatif di repositori ini bukanlah kartu modelnya. Berkas itu adalah src/inference/engine.py dan inference.py yang disertakan di Hub, karena keduanya mendokumentasikan sebuah kontrak, bukan sebuah prompt.

• Anda menyediakan status — materi yang dinilai — sebuah pertanyaan skema, dan secara opsional hingga delapan gambar. Satu hingga enam belas pertanyaan, hingga 62 opsi masing-masing.

• Setiap opsi pertanyaan dipetakan ke simbol token tunggal: A–Z, lalu a–z, lalu 0–9. Batas 62 opsi bukan preferensi desain, melainkan tepat jumlah simbol token tunggal yang dapat dialamatkan oleh kontrak.

• Prompt sistem, state, skema, dan kerangka JSON asisten yang lengkap dirender dengan satu <decision> placeholder per field. Template chat checkpoint dan blok pemikiran kosong dipertahankan apa adanya.

• Satu forward pass kausal dijalankan. Logit dibaca pada posisi tepat sebelum setiap placeholder — bukan setelahnya, bukan pada token yang dihasilkan.

• Softmax dihitung hanya atas simbol kandidat yang sah untuk field tersebut, kalibrasi checkpoint diterapkan, dan simbol-simbol tersebut dipetakan kembali ke nilai opsi asli Anda.

Kartu ini terus terang tentang apa ini: "API ini melakukan penilaian kandidat secara terstruktur. API ini tidak memanggil generate() atau mengambil sampel teks bebas." Sebuah DecisionEngine(max_length=8192) menolak input yang kelebihan ukuran alih-alih memotongnya, sehingga permintaan yang tidak muat akan gagal secara mencolok alih-alih diam-diam kehilangan paragraf terakhirnya. Daftar backend-nya juga jujur — backend="hf" adalah default dan satu-satunya yang diimplementasikan di repositori Hugging Face, yang perlu diketahui karena rilis GitHub juga menyertakan backend XTuner dan keduanya tidak identik secara numerik. Panduan evaluasi InternLM sendiri menyatakan demikian: "Perbedaan kernel dan BF16 dapat mengubah probabilitas dan kadang-kadang label."

Anomali di tengah

Deretkan tiga checkpoint itu berdampingan di tabel milik InternLM sendiri, dan bentuknya cukup ganjil untuk menjadi inti ceritanya.

• Rata-rata di tujuh suite — Intern-Decision-0.8B 79.38, Intern-Decision-2B 84.68, Intern-Decision-4B 90.02. Berurutan, seperti yang Anda duga dari bertambahnya bobot.

• Latensi pada satu RTX 4090 — rata-rata 33,98 ms untuk 0,8B, 33,28 ms untuk 2B, 44,16 ms untuk 4B. Ukuran tengah adalah yang tercepat dari ketiganya, dengan selisih yang cukup kecil sehingga bisa jadi hanya noise pada satu GPU tetapi konsisten pada rata-rata, median (33,15 ms), dan P95 (33,55 ms).

• Skor Brier, semakin rendah semakin baik — 0,530, 0,437, 0,347. Monoton seiring ukuran, seperti lazimnya aturan penskoran yang tepat.

• Kesalahan kalibrasi yang diharapkan, semakin rendah semakin baik — 0.066 untuk 0.8B, 0.100 untuk 2B ini, 0.065 untuk 4B. Ukuran menengah adalah yang terburuk, dan ukuran ini lebih buruk daripada model yang berukuran setengahnya.

Baris terakhir itu yang menarik, dan temperatur hasil fitting justru memperkuat, bukan menjelaskan, hal itu. Setiap checkpoint membawa temperatur hasil fitting NLL-nya sendiri: 2,747760550703 untuk 0,8B, 2,100509348278 untuk 2B, 1,992418 untuk 4B. Semuanya di-fit pada 1.728 kasus kalibrasi yang ditetapkan dengan 1.693 kasus disisihkan, dengan meminimalkan negative log-likelihood melalui pencarian inverse-temperature dalam [0,01, 100], dengan label test-suite sengaja dikeluarkan dari proses fitting. Temperatur 2B berada di antara kedua saudaranya, yang merupakan hal yang Anda harapkan jika anomali itu hanyalah artefak fitting. Ternyata bukan: nilai hasil fitting monoton terhadap ukuran, sedangkan galat pasca-kalibrasi tidak. Berdasarkan pengukuran InternLM sendiri, checkpoint berparameter 2,2 miliar adalah yang paling tidak dapat dipercaya di antara ketiganya ketika memberi tahu Anda seberapa yakin ia.

Ada dua catatan sebelum itu menjadi sebuah kesimpulan. ECE dengan sepuluh bin berlebar sama dan keyakinan probabilitas maksimum adalah statistik yang bising pada suite kecil yang digunakan tabel ini — Jevbench-Hard, 111 item, jadi seluruh kolom ECE bergantung pada sekitar seratus lebih pertanyaan dan pilihan binning. Dan internlm/Intern-Decision-2B adalah satu-satunya kartu dari ketiganya yang tidak membawa bagian kalibrasi tambahan yang dimiliki kartu 4B, jadi dokumentasinya di sini lebih sedikit, bukan lebih banyak. Bacalah 0,100 sebagai alasan untuk menyesuaikan suhu Anda sendiri, bukan sebagai putusan atas bobotnya.

A rendered comparison card titled 'Three checkpoints, forty seconds' listing the Intern-Decision 0.8B, 2B and 4B columns against seven rows: upload timestamps 05:35:57 / 05:36:19 / 05:36:37 UTC; parameters 852,985,920 / 2,213,241,664 / 4,539,265,536; seven-suite average 79.38 / 84.68 / 90.02; Brier 0.530 / 0.437 / 0.347; ECE 0.066 / 0.100 / 0.065; fitted temperature 2.747761 / 2.100509 / 1.992418; and RTX 4090 mean latency 33.98 ms / 33.28 ms / 44.16 ms, with a footer noting every figure is vendor-reported and unreproduced.

Apa yang ditambahkan repositori, dan apa yang masih ditahannya

Rilis GitHub lebih lengkap daripada kartu model, yang sendirinya informatif — laboratorium yang berniat membuat artefak makalah biasanya tidak menyertakan generator kalibrasi deterministik dan bundel evaluasi yang memverifikasi hash bersama peluncur pelatihan.

Apa yang kini publik: kode pelatihan dan objektif masked-next-token (simbol jawaban ground-truth hanya muncul di label, tidak pernah di input; jawaban setiap bidang diprediksi oleh logit tepat sebelum penandanya, dan semua bidang berbagi satu forward pass); tujuh suite akurasi dengan hash yang diverifikasi SHA-256 dan jumlah baris; kode penskoran; skrip pencocokan temperature dan replay, di mana replay dinyatakan mengubah nol keputusan; tolok ukur kalibrasi distribusi 96 kasus dengan generator dan penilai offlinenya; dan demo peramban yang dilayani pada loopback dengan POST /v1/decisions (dengan alias /v1/jev).

Apa yang secara eksplisit dikecualikan, dalam kata-kata repositori itu sendiri: "Data pelatihan, catatan kalibrasi/validasi privat, gambar, pipeline persiapan, dan bobot model tidak disertakan." Repositori ini sama sekali tidak menyertakan file lisensi, sehingga ketentuan kode tidak dinyatakan meskipun bobotnya berlisensi Apache-2.0. Dan komposisi pembagian kalibrasi — 1.728 kasus yang mana, dari mana — tetap tidak diungkapkan, yang merupakan satu-satunya kelalaian yang membatasi sejauh mana angka ECE dapat diperiksa.

Ukuran yang benar-benar kami rutekan, dan satu yang tidak

Intern-Decision-2B tidak tersedia di OrcaRouter. Halaman model kami untuknya mengembalikan 404, tidak ada endpoint terkelola di mana pun untuknya yang dapat kami temukan, dan tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim ketersediaan. Satu-satunya cara untuk memanggilnya saat ini adalah mengunduh checkpoint dan menjalankan inference.py di samping bobotnya.

Itu penting untuk keputusan yang sebenarnya menjadi fokus artikel ini, karena penilai yang tidak dilayani siapa pun adalah penilai yang harus Anda operasikan. Jika keputusan closed-set yang ingin Anda buat bentuknya mirip dengan apa yang dilakukan keluarga ini — sebuah state, pertanyaan bertipe, probabilitas terkalibrasi — perbandingan hosted-nya adalah TypeSafe's Jev 1.13, yang merupakan model yang sengaja dijadikan tolok ukur oleh InternLM dan yang tersedia di OrcaRouter dengan harga $0.042 per juta token input dengan konteks 65K dan P50 waktu-ke-token-pertama sebesar 178 ms.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

Menjalankan checkpoint 2,2 miliar parameter secara lokal dan memanggil classifier yang dihosting bukanlah pembelian yang sama, tetapi keduanya adalah masalah yang sama, dan memiliki keduanya pada satu kunci dengan harga daftar penyedia yang diteruskan pada markup 0% adalah alasan untuk menjaga perbandingan tetap terbuka daripada mempertaruhkan arsitektur pada salah satunya.

Apa yang akan mengubah gambaran ini?

Tiga hal, secara berurutan.

Seseorang di luar InternLM perlu mereproduksi rata-rata 84,68 dan ECE 0,100, dan repositori-lah yang kini memungkinkan hal itu — itulah berita sebenarnya di sini. Ujian ini bersifat publik dan terverifikasi hash; hanya lembar jawabannya yang belum ada, dan lembar jawaban itu adalah checkpoint yang kini dapat diunduh oleh siapa pun.

Vendor perlu mengatakan untuk apa ini. Model dengan stack pelatihan yang berfungsi, bundel evaluasi yang dipublikasikan, dan tanpa pengumuman, tanpa lisensi pada kodenya, dan tanpa endpoint yang dihosting terbaca sebagai rilis riset yang belum diputuskan menjadi produk. Bobot Apache-2.0 berargumen ke satu arah; lisensi kode yang hilang dan 401 Space berargumen ke arah lain.

Dan ukuran menengah perlu punya alasan untuk ada. Jika keunggulan kecepatan 2B dibanding 0.8B nyata tetapi marginal, dan kalibrasinya adalah yang terlemah di antara ketiganya pada setiap metrik yang dipublikasikan InternLM, maka rekomendasi yang jujur bagi sebagian besar pembaca adalah membayar 2,6× dalam ruang disk untuk 4B atau menerima akurasi yang lebih lemah dari model yang lebih kecil. Argumen untuk 2B adalah bahwa ia kebetulan menjadi yang tercepat di antara yang cepat — dan itu adalah argumen yang lebih tipis daripada yang disiratkan oleh pembingkaian keluarga ini yang bernuansa pemasaran.