
Intern-Decision-0.8B Hadir Tanpa Pengumuman: Apa yang Diam-diam Ditempatkan InternLM di Hugging Face
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 592 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 187 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Tautan GitHub di kartu model mengembalikan 404. Space demo mengembalikan 401. Tidak ada koleksi, tidak ada posting blog, tidak ada laporan teknis, dan tidak ada hasil pencarian di mana pun untuk string "Intern-Decision" yang bukan lowongan magang — namun Intern-Decision-0.8B kini berada di Hugging Face sebagai checkpoint lengkap, dapat diunduh, Apache-2.0, fine-tuned dari Qwen3.5-0.8B, diunggah pada dini hari 26 September 2026 bersama dua saudara yang lebih besar yang muncul dalam tiga menit yang sama: Intern-Decision-2B dan Intern-Decision-4B. InternLM pernah merilis dengan cara seperti ini sebelumnya, dan itulah sebabnya semua yang di bawah ini disusun dari repositori itu sendiri alih-alih dari posting peluncuran. Perbedaan ini penting di sini lebih dari biasanya: sebuah repo memberi tahu Anda apa yang ada, dan hanya vendor yang dapat memberi tahu Anda untuk apa itu.
Apa yang sebenarnya dikatakan repo itu, secara rinci, cukup tidak biasa sehingga layak dibaca. Ini bukan model percakapan dan bukan model bahasa kecil dalam pengertian biasa. Intern-Decision-0.8B menerima sepotong state, skema pertanyaan bernama yang Anda tulis terlebih dahulu, dan secara opsional hingga delapan gambar, lalu mengembalikan distribusi jawaban untuk setiap pertanyaan dalam satu forward pass. Model ini tidak pernah memanggil generate(). Model ini tidak pernah melakukan sampling. Tidak ada output teks yang perlu diurai, tidak ada JSON yang perlu diperbaiki, tidak ada loop percobaan ulang di sekitar kurung kurawal yang tidak pernah tertutup. Kesempitannya adalah keseluruhan arsitekturnya, dan itu menempatkan model ini dalam kategori kecil yang sama dengan Jev 1.13 milik TypeSafe dan Laya milik Convai — kategori yang jelas sengaja dijadikan pembanding oleh InternLM, karena Jevbench adalah benchmark milik TypeSafe sendiri dan itu adalah kolom pertama tabel.
Inilah yang dapat diketahui dari checkpoint, yang hanya diklaim oleh checkpoint, dan yang untuk saat ini tidak dapat dikatakan sama sekali oleh siapa pun di luar InternLM.
Apa yang sebenarnya ada di dalam repositori
Kartu ini singkat dan jujur tentang garis keturunannya. Intern-Decision-0.8B dideskripsikan sebagai "model keputusan terstruktur multimodal yang di-fine-tune dari Qwen3.5-0.8B" — basis Qwen yang dirilis pada 28 Februari 2026 — dan repositori ini membawa file lisensi kedua, LICENSE-QWEN, bersama ketentuan Apache-2.0, yang memang seharusnya dilakukan model turunan dan menjadi sinyal kejujuran kecil tersendiri. Indeks Hugging Face melaporkan 852.985.920 parameter di tiga shard: shard bahasa 1,50 GB, shard visi 176 MB, dan proyektor 25 MB. Total penyimpanan repositori sekitar 1,73 GB termasuk file tokenizer, yang membuat semuanya nyaman muat di satu GPU konsumen atau laptop dengan spesifikasi mumpuni.
Konfigurasi ini mengungkap arsitektur yang telah Qwen rilis di sepanjang generasi 3.5, bukan jaringan keputusan yang dirancang khusus. Ini adalah Qwen3_5ForConditionalGeneration dengan 24 lapisan yang disusun dalam pola berulang tiga lapisan linear-attention berbanding satu lapisan full-attention, ukuran tersembunyi 1.024, 8 attention head berbanding 2 key-value head, dimensi head 256, dan embedding posisi maksimum 262.144 token. Satu lapisan multi-token-prediction dipertahankan. Jalur vision-nya nyata: teks pada kartu menjelaskan penanganan gambar, prosesornya menerima gambar, dan checkpoint-nya menyertakan vision tower dan projector untuk melayaninya — jadi tag multimodal pada repo didukung oleh bobot, bukan sekadar oleh tag.
Gambaran keluarga model ini patut diperhatikan karena membentuk cara membaca segala hal lainnya. InternLM mengunggah tiga ukuran dalam 40 detik: 0,8B, lalu 2B, lalu 4B. Jumlah parameternya adalah 852.985.920, 2.213.241.664, dan 4.539.265.536. Kartu model 4B memuat bagian tambahan — pilot kalibrasi distribusi yang diketahui dengan 96 kasus beserta skor sebelum dan sesudah — yang tidak dimiliki kartu 0,8B. Asimetri itu bukan bukti adanya cacat pada model kecil; itu adalah bukti bahwa dokumentasi model kecil ditulis dengan anggaran yang lebih kecil, yang merupakan hal yang tampak seperti rilis senyap.
Bagaimana jalur inferensi sebenarnya bekerja
File inference.py yang disertakan adalah file paling informatif di repositori, karena file ini mendokumentasikan kontrak, bukan prompt. Urutannya seperti ini:
• Anda memberikan sebuah permintaan dengan state (hal yang dinilai), questions (sebuah skema), dan secara opsional berupa gambar.
• Opsi setiap pertanyaan dipetakan ke simbol token tunggal — A sampai Z, lalu huruf kecil, lalu angka, hingga 62 opsi per pertanyaan.
• Prompt sistem, state, skema, dan kerangka JSON asisten yang lengkap dirender dengan satu placeholder <decision> per bidang.
• Satu forward pass kausal dijalankan. Logit dibaca pada posisi tepat sebelum setiap placeholder.
• Softmax diambil hanya atas simbol kandidat yang diizinkan untuk bidang tersebut, kalibrasi checkpoint diterapkan, dan simbol dipetakan kembali ke nilai opsi asli Anda.
Mesin ini menyediakan tiga jenis pertanyaan. choice menerima objek terurut yang memetakan nilai opsi ke deskripsi. score menerima daftar — yang menjadi nilai string "0", "1", "2", dan seterusnya — atau objek terurut dengan kunci string numerik berhingga, yang memungkinkan model mengembalikan nilai ekspektasi berbobot probabilitas dan bukan hanya kategori. noul adalah keputusan biner dengan "no" sebelum "yes". Respons mengembalikan, per field, distribusi probabilitas yang terkalibrasi, tingkat keyakinan yang sama dengan probabilitas kandidat maksimum, keputusan argmax dengan pemecahan seri leksikal, dan untuk pertanyaan score nilai numerik ekspektasi serta legenda. Batasannya eksplisit: satu hingga enam belas pertanyaan per permintaan, hingga 62 opsi untuk masing-masing pertanyaan, plafon input default 8.192 token yang ditolak alih-alih dipotong, dan maksimum delapan gambar yang tokennya diperhitungkan terhadap plafon tersebut.
Dua detail dalam daftar itu perlu diperhatikan karena keduanya menentukan apakah Anda dapat memercayai keluarannya. Yang pertama adalah tidak ada jawaban emas yang dimasukkan ke dalam prompt — model memberi skor pada kandidat yang belum diperlihatkan jawabannya. Yang kedua adalah usage.output_tokens bukanlah jumlah token teks; ia menghitung field yang diberi skor. Siapa pun yang menghubungkan ini ke perhitungan anggaran token yang sudah ada akan terkejut oleh hal itu, dan kartu tersebut menyatakannya alih-alih membiarkannya ditemukan sendiri.

Tabel benchmark, dan seberapa besar kita harus mempercayainya
Pembaca, waspadalah pada bagian ini: setiap angka di bawah ini dilaporkan vendor dan belum direproduksi. InternLM memilih benchmark, memilih model pembanding, menjalankan evaluasinya, dan menerbitkan tabelnya. Tidak ada uji independen atas Intern-Decision-0.8B di papan peringkat publik mana pun, dan pencarian di Artificial Analysis tidak menemukan apa pun untuk model tersebut sama sekali. Itu tidak membuat tabel itu salah. Itu membuatnya tidak diaudit, dan berarti kolom-kolomnya paling berguna untuk membaca bentuk hasilnya, bukan levelnya.

• Jevbench, tiga split — Intern-Decision-0.8B mencatat 97.92 pada Easy, 80.56 pada Original dan 52.25 pada Hard. Jev dari TypeSafe berada di 100.00, 98.61 dan 72.07 pada split yang sama.
• Typed Decision — 0.8B mencetak skor 77.35 melawan 73.35 milik Jev. Inilah satu-satunya kolom di mana model terkecil di bidang ini mengalahkan model yang namanya dijadikan nama benchmark tersebut.
• ToolACE — 94,52 untuk model 0,8B dibanding 91,29 untuk Jev. ToolACE adalah tolok ukur pemanggilan fungsi, dan head keputusan yang mengungguli Jev dalam pemilihan alat adalah klaim paling substantif dalam tabel tersebut.
• AG News — 88,61 dibandingkan 89,57 milik Jev. Secara efektif setara dengan yang terdepan di kategori ini pada klasifikasi topik empat kelas.
• WildJailBreak — 64.48 dibandingkan dengan 96.29 milik Jev. Inilah keruntuhannya. Bisa dibilang ini kolom yang paling penting untuk model yang akan Anda arahkan ke masukan yang tidak tepercaya, dan kolom di mana 0.8B paling jauh dari referensi.
• Rata-rata — 79,38 untuk 0.8B, 84,68 untuk saudara 2B-nya sendiri, 90,02 untuk 4B. Keluarga ini menanjak tajam, yang persis seperti yang Anda harapkan dan itu sendiri merupakan argumen ringan bahwa tabel tersebut tidak direkayasa balik untuk menyanjung sang andalan.
• Kalibrasi — Brier 0.530 dan expected calibration error 0.066 untuk 0.8B. Jev melaporkan 0.358 dan 0.095. Baca keduanya bersama-sama dan gambaran yang lebih jelas muncul daripada yang diberikan masing-masing angka bila dibaca sendiri-sendiri: 0.8B terkalibrasi lebih baik daripada Jev dalam pengertian ECE — tingkat keyakinan yang dinyatakannya lebih dekat mengikuti akurasinya — sekaligus secara keseluruhan secara signifikan kurang akurat. Itu profil yang masuk akal untuk model kecil dengan temperature yang sengaja disesuaikan, dan itu bukan kombinasi yang membuatnya tampak bagus untuk dipublikasikan secara tidak sengaja.
Kumpulan perbandingan ini memiliki satu sifat yang mencolok: kumpulan ini didominasi oleh Litsy. Jev, Litsy, Sifa, Kev, dan JevK5 semuanya muncul; benchmark milik tabel itu sendiri adalah TypeSafe. Litsy memilih untuk diukur di kandang kompetitor, menggunakan harness milik kompetitor, dan menyertakan kolom-kolom tempat model terkecilnya kalah. Itu adalah jenis keputusan yang dibuat sebuah tim ketika tidak merencanakan kampanye pemasaran seputar peluncuran — yang konsisten dengan segala hal lain tentang bagaimana ini dirilis.
Suhu kalibrasi adalah angka yang paling menarik
Intern-Decision-0.8B menetapkan suhu default sebesar 2,747760550703, melalui minimisasi NLL atas 1.728 kasus kalibrasi yang ditetapkan dengan 1.693 kasus validasi terpisah. Kartu tersebut secara eksplisit menyatakan bahwa label test-suite tidak digunakan untuk memilihnya. Transformasi yang diterapkan adalah p = softmax(candidate_logits.float()) diikuti oleh calibrated_p = softmax(log(p) / T).
Itu adalah kalibrasi probabilitas kandidat, bukan temperatur pengambilan sampel, dan perbedaan ini bukan sekadar bertele-tele. Karena transformasi tersebut diterapkan setelah softmax dan mempertahankan urutan, ia sama sekali tidak dapat mengubah keputusan argmax. Ia menggeser keyakinan, probabilitas ya noul, dan nilai harapan dari pertanyaan skor — dan membiarkan keputusan utamanya tetap identik. Jika alur kerja Anda membaca label, temperatur tidak berpengaruh. Jika alur kerja Anda membaca probabilitas — menetapkan ambang batasnya, memeringkat berdasarkan probabilitas itu, atau memasukkannya ke dalam perhitungan nilai harapan hilir — temperatur adalah perbedaan antara angka yang bermakna dan angka yang tidak. Memberikan temperature=1 mengembalikan distribusi yang tidak terkalibrasi, yang merupakan jalan keluar berguna bagi siapa pun yang ingin menerapkan kalibrasi mereka sendiri di atasnya.
Suhu disetel per checkpoint, bukan dibagikan. Model 4B menggunakan nilai yang berbeda, 1.99241824, dan kartu modelnya menginstruksikan Anda untuk menggunakan modul inferensi yang disertakan dengan ukuran yang Anda unduh agar kalibrasi bawaannya cocok. Siapa pun yang menyalin pembungkus inferensi dari satu model kembaran ke model lainnya akan secara diam-diam menerapkan suhu yang salah.
Tiga puluh empat milidetik, dan hasil yang seharusnya tidak mungkin.
InternLM mengukur latensi ujung ke ujung per kueri pada satu RTX 4090 menggunakan jalur Hugging Face lokal — pengukuran nyata, tetapi juga konfigurasi penyajian paling lambat yang mungkin, karena penerapan produksi akan menggunakan runtime terkompilasi atau batching. Jev terdaftar pada rata-rata 109,70 ms dan median 106,30 ms dengan p95 146,70 ms. Intern-Decision-0.8B berada pada 33,98 / 33,44 / 37,50 ms.
Angka yang layak diperhatikan adalah saudara 2B: rata-rata 33.28 ms, median 33.15 ms. 2B lebih cepat daripada 0.8B, dengan selisih yang cukup kecil untuk dianggap noise tetapi tidak ke arah yang diprediksi oleh jumlah parameter. Itu bukan kesalahan dalam tabel dan sebenarnya bukan tentang modelnya. Model keputusan melakukan tepat satu forward pass atas prompt yang panjangnya ditentukan oleh state, skema, dan deskripsi opsi — bukan oleh apa pun yang ditulis model, karena model tidak menulis apa pun. Untuk prompt dalam rezim tersebut, pemrosesan prompt mendominasi dan jumlah parameter adalah biaya sekunder. Konsekuensi praktisnya adalah alasan yang biasa untuk memilih checkpoint terkecil — Anda membayar per token — tidak berlaku di sini. Alasan sebenarnya untuk memilih 0.8B daripada 2B adalah jejak memori dan fakta bahwa seluruh repositorinya muat dalam 1.73 GB, bukan throughput.
Apa yang belum dapat ditetapkan
Inilah bagian yang akan dijawab oleh sebuah postingan peluncuran dan tidak bisa dijawab oleh repositori.
Tidak ada tanggal rilis yang disebutkan, tidak ada pengumuman, dan tidak ada apa pun di saluran publik InternLM yang menjelaskan keluarga ini. URL GitHub yang tercetak pada kartu model tidak dapat diakses. Space demo yang dirujuk dalam kartu tersebut tidak dapat dibaca publik. Tidak ada koleksi yang menghimpun ketiga checkpoint tersebut, yang berarti satu-satunya cara untuk menemukan 2B atau 4B adalah dengan melihat daftar model organisasi tersebut. Tidak ada makalah, sehingga data pelatihan, resep penyetelan, jumlah langkah pelatihan, dan apa yang diubah oleh "decision tuning" pada bobot semuanya tidak disebutkan. Tidak ada evaluasi independen, tidak ada replikasi latensi pihak ketiga, dan belum ada bukti bahwa siapa pun di luar InternLM telah menjalankan checkpoint tersebut.
Ada juga dua pertanyaan yang diangkat oleh kartu tersebut tanpa dijawab. Yang pertama adalah apa arti celah WildJailBreak dalam praktik: defisit ketahanan penolakan sebesar itu adalah properti dari fine-tune, dan apakah hal itu mencerminkan model dasar, tujuan penyetelan keputusan, atau jumlah parameter yang kecil bukanlah sesuatu yang diberitahukan oleh repositori kepada Anda. Yang kedua adalah apa yang terjadi pada batas atas input. Permintaan yang melebihi 8.192 token ditolak, bukan dipotong, yang merupakan perilaku yang tepat untuk model penilaian, tetapi itu berarti jendela konteks praktis bukanlah 262.144 yang diiklankan oleh konfigurasi — melainkan apa pun yang muat dalam 8.192 token state, skema, opsi, dan patch gambar. Untuk dokumen panjang dengan skema yang kaya, batas atas itu tercapai lebih cepat daripada yang disiratkan oleh diagram arsitektur.
Di mana ini berada, dan cara mencobanya tanpa harus bertaruh padanya
Kerangka yang jujur adalah bahwa Intern-Decision-0.8B adalah checkpoint yang telah dirilis dengan klaim yang belum diaudit dan tanpa dokumentasi pendukung. Kombinasi itu bukan alasan untuk mengabaikannya — rilis bobot Apache-2.0 yang dapat Anda unduh dan ukur dalam satu sore adalah situasi yang lebih baik daripada API dengan daftar tunggu — tetapi itu berarti beban validasi ada pada Anda. Mesin ini dimuat dari direktori lokal, berjalan pada GPU kelas 4090 atau yang lebih kecil, dan kartunya menyediakan contoh permintaan siap pakai yang dapat Anda tempelkan. Evaluasi sehari terhadap kasus berlabel Anda sendiri akan memberi tahu Anda lebih banyak tentang kolom WildJailBreak daripada yang dapat diberikan tabel vendor.
Jika lapisan keputusan adalah bagian yang Anda evaluasi, target pembanding yang berguna adalah yang dihosting. Jev 1.13 milik TypeSafe adalah model yang dijadikan tolok ukur oleh InternLM, dan model itu dapat dipanggil hari ini melalui satu endpoint yang kompatibel dengan OpenAI dengan harga $0,042 per juta token input dengan output ditagih nol — harga yang sama dengan yang diterbitkan vendor, karena OrcaRouter meneruskan harga daftar penyedia tanpa markup alih-alih menambahkan margin di atasnya. Menempatkan kepala keputusan 0,8B yang dihosting sendiri dan API keputusan yang dihosting pada kunci yang sama, pada sore yang sama, adalah eksperimen yang jauh lebih murah daripada menyiapkan dua kontrak terpisah untuk menjawab pertanyaan yang sama.

Yang akan mengubah gambaran ini bukanlah sebuah benchmark. Yang akan mengubahnya adalah munculnya repositori GitHub, atau InternLM menerbitkan resep penyetelannya, atau sebuah checkpoint yang untuk pertama kalinya dijalankan secara independen dan masuk ke papan peringkat. Sampai salah satu dari hal itu terjadi, deskripsi yang akurat tentang Intern-Decision-0.8B bersifat sempit dan tidak menyanjung, sekaligus sepenuhnya menguntungkannya: bobotnya nyata, kontrak inferensinya didokumentasikan lebih baik daripada yang mampu dilakukan sebagian besar model yang diluncurkan, dan pemasarannya belum dimulai.
