
Intern-Decision-4B: InternLM Merilis Model Keputusan yang Menjawab Tanpa Menulis Satu Token pun
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 592 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 187 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Tiga repositori model muncul di halaman Hugging Face milik InternLM dalam waktu empat puluh detik pada 26 September 2026: Intern-Decision-0.8B pada 05:35:57 UTC, Intern-Decision-2B pada 05:36:19, dan internlm/Intern-Decision-4B pada 05:36:37. Yang 4B adalah yang menarik. Ini adalah fine-tune dari Qwen3.5-4B yang menerima state bersama, skema pertanyaan bernama, dan gambar opsional, serta mengembalikan distribusi jawaban terkalibrasi untuk setiap pertanyaan dalam satu forward pass. Model ini tidak pernah menghasilkan teks. Catatan rilisnya sendiri menyatakannya secara gamblang: "API ini melakukan penilaian kandidat terstruktur. API ini tidak memanggil generate() atau mengambil sampel teks bebas." Empat puluh detik unggahan dan tidak ada satu baris pengumuman di mana pun — tidak ada posting blog, tidak ada tweet, tidak ada changelog, tidak ada halaman peluncuran. Yang ada hanyalah kartu model, sebuah inference.py, dan empat shard safetensors.

Apa yang diluncurkan, dan apa yang tidak
Keluarga adalah hal pertama yang harus dipastikan benar, karena kartu milik 4B diam-diam memuatnya. Tabel benchmark-nya mencantumkan baris untuk Intern-Decision-0.8B dan Intern-Decision-2B bersama barisnya sendiri, dan ketiga checkpoint itu muncul di hub dalam menit yang sama. Repositori 2B tidak pernah ditautkan dari kartu 4B — Anda harus menemukannya melalui feed unggahan organisasi.
Apa yang tidak dirilis adalah hampir semua hal yang biasanya ada dalam sebuah rilis:
• Tidak ada pengumuman — nol liputan web, tidak ada pernyataan vendor dalam bahasa apa pun yang bisa kami temukan.
• Tanpa demo — kartu ini menautkan Space di huggingface.co/spaces/internlm/intern-decision; endpoint tersebut merespons HTTP 401, artinya Space itu tidak publik, bukan berarti rusak.
• Tidak ada koleksi — koleksi model yang diiklankan di huggingface.co/collections/internlm/intern-decision juga mengembalikan 401.
• Tidak ada repositori kode — tautan GitHub kartu tersebut, github.com/internlm/Intern-Decision, adalah 404, dan daftar repositori organisasi InternLM tidak memuat proyek semacam itu.
• Belum ada adopsi — hingga tulisan ini dibuat, 4B hanya menunjukkan satu suka dan nol unduhan.
Itu adalah seluruh permukaan yang dapat diketahui. Anggap setiap angka di bawah ini sebagai milik vendor sendiri, karena belum ada orang lain yang menjalankan ini.

Kontrak inferensi adalah produknya
Sebagian besar kartu digunakan untuk prosedur lima langkah, yang menunjukkan ke mana upaya rekayasanya diarahkan. Pertanyaan dan opsi tetap mempertahankan urutannya. Opsi setiap pertanyaan dipetakan ke simbol token tunggal — A sampai Z, lalu a sampai z, lalu 0 sampai 9. Itu berarti 62 simbol, dan itulah tepatnya alasan kartu membatasi sebuah pertanyaan pada 62 opsi. Prompt dirender dari prompt sistem asli, state, skema keputusan, dan kerangka JSON asisten yang lengkap dengan satu <decision> placeholder per field, sambil mempertahankan template chat checkpoint dan blok berpikir yang kosong. Kemudian satu forward pass kausal. Logit dibaca pada posisi tepat sebelum setiap placeholder, softmax dijalankan hanya atas logit simbol kandidat yang diizinkan untuk field tersebut, kalibrasi diterapkan, dan simbol dipetakan kembali ke nilai opsi Anda.
Konsekuensinya adalah bentuk tetap: tanpa loop decoding, tanpa sampling, tanpa parser, tanpa permukaan halusinasi, dan batas atas keras berupa satu keputusan per pertanyaan per lintasan. Tiga jenis pertanyaan didukung — choice dengan peta kriteria terurut, score dengan daftar atau peta berkunci numerik, dan noul, biner tidak/ya.
Detail lembar spesifikasi yang paling penting
Kartu tersebut secara eksplisit menyatakan bahwa input "ditolak tanpa pemotongan" di atas DecisionEngine(max_length=8192). Baca itu bersamaan dengan konfigurasi dan sesuatu yang aneh muncul: menara teks yang mendasarinya mendeklarasikan max_position_embeddings sebesar 262.144. Tulang punggungnya dapat menangani seperempat juta token; pembungkus yang dirilis menolak apa pun di atas 8.192. Ini bukan model konteks panjang dengan default yang konservatif — ini adalah model penilaian keputusan yang harness-nya sendiri membatasi bukti yang boleh Anda berikan padanya. Jika pertanyaan perutean Anda bergantung pada lebih dari sekitar delapan ribu token keadaan, checkpoint ini sebagaimana dirilis tidak akan menjawabnya, dan ia akan menolak alih-alih memotong input Anda.
Maksimal delapan gambar diizinkan, dan kartu mencatat bahwa token gambar turut diperhitungkan terhadap batas 8.192 yang sama.

Di dalam bobot
Empat shard, 4,54 miliar parameter BF16, dan konfigurasi yang menjelaskan nama ukurannya: ada menara teks, menara visi dengan sekitar dua lusin lapisan dan ukuran patch 16 piksel, serta proyektor di antara keduanya. Sisi teks memiliki 32 lapisan pada ukuran tersembunyi 2.560, dengan 16 kepala atensi terhadap 4 kepala key/value, kosakata 248.320 token, dan embedding terikat. Jenis lapisan bergantian pada interval tetap — tiga lapisan atensi linear, lalu satu lapisan atensi penuh, diulang. Hanya lapisan atensi penuh yang membawa atensi global, dan embedding rotary bersifat parsial dengan faktor 0,25. Untuk memuatnya diperlukan Python 3.12 atau lebih baru, PyTorch 2.9.1 dan Transformers 5.14.1, dan daftar file masih membawa file tokenizer, merges, dan vocabulary alih-alih mengandalkan tokenizer di sisi hub.
Angka-angkanya, dan siapa yang menghasilkannya
Semua hal di bagian ini diukur oleh InternLM dan dipublikasikan di kartu model. Tidak ada satu pun dari itu yang telah direproduksi oleh pihak ketiga, dan tidak ada entri Artificial Analysis, tidak ada peringkat arena, dan tidak ada baris papan peringkat untuk model ini di mana pun.
Di tujuh set evaluasi, 4B rata-rata 90,02, dengan skor Brier 0,347 dan expected calibration error 0,065. Tabel yang sama mencantumkan Intern-Decision-0.8B pada 79,38 dan Intern-Decision-2B pada 84,68, sehingga keluarga ini menanjak seiring ukuran — 4,7 poin dari 0,8B ke 2B, lalu 5,3 poin lagi ke 4B. Tabel itu juga memuat lima baris yang tidak dilatih vendor: Jev pada 88,74, JevK5 pada 85,16, SemIf pada 84,23, Kev pada 79,56, dan Laya pada 57,77. Baris-baris itu dijalankan oleh InternLM pada harness InternLM terhadap checkpoint InternLM. Itu bukan angka milik proyek-proyek tersebut sendiri, dan membacanya sebagai angka mereka adalah kesalahan termudah yang tersedia di sini.
Latensi diukur pada satu RTX 4090 melalui jalur Hugging Face lokal, dan kartu ini menandai nilai-nilai tersebut sebagai bergantung pada beban kerja dan perangkat keras. Model 4B mencatat rata-rata 44,16 ms, median 44,03 ms, dan 44,60 ms pada P95 — sebaran antara median dan ekor yang jauh di bawah satu milidetik, yang merupakan ciri forward pass dengan bentuk tetap. Dua checkpoint yang lebih kecil keduanya berada di sekitar 33 ms, dengan 2B sedikit lebih unggul daripada 0.8B pada rata-rata dan median, yang patut diperhatikan alih-alih diabaikan: keduanya cukup dekat sehingga berada dalam noise pengukuran satu sama lain.
Kalibrasi, dan catatan jujur di dalamnya
Checkpoint ini hadir dengan temperature default sebesar 1,99241824, yang disesuaikan secara terpisah untuk model ini melalui minimisasi negative log-likelihood pada 1.728 kasus kalibrasi yang ditentukan, dengan 1.693 kasus disisihkan untuk validasi. Kartu tersebut menyatakan bahwa label suite pengujian tidak digunakan untuk memilihnya. Implementasinya adalah kalibrasi probabilitas kandidat, bukan temperature sampling: ini mengubah keyakinan, probabilitas biner, dan skor yang diharapkan sementara keputusan argmax dibiarkan tidak berubah.
Sebuah diagnostik terpisah dengan 96 kasus kemudian melaporkan efeknya. Pada kolom sebelum-dan-sesudah milik InternLM sendiri, Brier dan ECE keseluruhan 4B bergerak dari 0,628 / 0,213 ke 0,550 / 0,089, dibandingkan dengan 0,595 / 0,130 untuk Jev. Dua pembacaan jujur atas tabel itu: kalibrasinya jelas berhasil, dan kolom "sebelum" bukanlah yang akan pernah dilihat pengguna mana pun, karena default yang dikirimkan adalah temperature hasil fitting. Juga patut dicatat — dua dari enam kategori diagnostik lebih buruk bagi 4B daripada bagi Jev, dan yang terburuk di antaranya, bukti harian dan bias observasi, membaik menjadi 0,575 / 0,210 namun masih tertinggal dari 0,603 / 0,114 milik Jev. Pada irisan itu, kalibrasi mempersempit celah tanpa menutupnya.
Di mana router cocok, dan di mana belum
Hambatan praktis untuk menggunakan model ini bukanlah akurasi, melainkan pengemasannya. Rilis ini menyediakan kelas Python yang Anda impor setelah mengunduh empat shard, bukan endpoint HTTP yang bisa Anda panggil. Itulah tepatnya celah yang ada bagi lapisan perutean untuk ditutup — satu kunci untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%, dan failover otomatis saat penyedia goyah — tetapi kita harus berterus terang bahwa OrcaRouter saat ini tidak menyediakan Intern-Decision-4B atau model sejenisnya. Katalog kami tidak mencantumkannya, dan tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim ketersediaan. Yang dapat kami tawarkan adalah pilihan yang lebih hemat: jika Anda ingin mencoba penilai keputusan berparameter 4,5 miliar di depan jalur produksi, Anda dapat membangunnya ke dalam router dengan fallback ke model umum sehingga hari kalibrasi yang buruk membuat Anda hanya perlu mencoba ulang, bukan mengalami gangguan layanan.
Apa yang akan mengubah gambaran
Tiga hal, dalam urutan kepentingannya. Seseorang di luar InternLM perlu mereproduksi rata-rata 90,02 dan galat kalibrasi yang diharapkan sebesar 0,065 — klaim kalibrasi yang belum pernah diuji pada set pengujian eksternal adalah angka yang paling tidak dapat ditransfer dalam pembelajaran mesin. Jejak kartu itu sendiri perlu muncul: Space, koleksi, repositori GitHub. Dan vendor perlu menyatakan apakah ini produk atau artefak makalah, karena lisensi khusus riset dan lisensi Apache-2.0 bukanlah komitmen yang sama, dan 4B memilih Apache-2.0 dengan lisensi Qwen yang dipertahankan di sampingnya. Sampai saat itu, kerangka yang benar adalah yang disiratkan oleh unggahan itu sendiri: ini adalah checkpoint nyata dengan kontrak inferensi yang nyata dan kartu skor yang sepenuhnya belum diverifikasi, yang diterbitkan tanpa memberi tahu siapa pun.
Untuk saat ini, ringkasan yang jujur itu sempit dan berguna. Jika masalah Anda adalah "pilih satu dari lima label perutean dan beri tahu saya seberapa yakin Anda", model 4,5B yang mengeluarkan 62 logit dan tanpa prosa adalah bentuk yang bisa dipertahankan untuk dievaluasi. Jika masalah Anda melibatkan dokumen panjang, lebih dari delapan gambar, atau kebutuhan apa pun untuk menjelaskan jawaban dengan kata-kata, checkpoint ini sebagaimana dirilis adalah alat yang salah, dan sebanyak apa pun polesan benchmark vendor tidak akan mengubah itu.
