Kartu judul hero bertuliskan 'Intern-Decision-0.8B' dengan subjudul 'Dirilis secara diam-diam, tidak diumumkan', membawa lencana 'tanpa makalah, tanpa repositori, tanpa pos peluncuran' dan '852.985.920 parameter, 1,73 GB di disk', dengan logo OrcaRouter dikompositkan di sudut.
Guides & Insights

Intern-Decision-0.8B Hadir Tanpa Pengumuman: Apa yang Diam-diam Ditempatkan InternLM di Hugging Face

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tautan GitHub di kartu model mengembalikan 404. Space demo mengembalikan 401. Tidak ada koleksi, tidak ada posting blog, tidak ada laporan teknis, dan tidak ada hasil pencarian di mana pun untuk string "Intern-Decision" yang bukan lowongan magang — namun Intern-Decision-0.8B kini berada di Hugging Face sebagai checkpoint lengkap, dapat diunduh, Apache-2.0, fine-tuned dari Qwen3.5-0.8B, diunggah pada dini hari 26 September 2026 bersama dua saudara yang lebih besar yang muncul dalam tiga menit yang sama: Intern-Decision-2B dan Intern-Decision-4B. InternLM pernah merilis dengan cara seperti ini sebelumnya, dan itulah sebabnya semua yang di bawah ini disusun dari repositori itu sendiri alih-alih dari posting peluncuran. Perbedaan ini penting di sini lebih dari biasanya: sebuah repo memberi tahu Anda apa yang ada, dan hanya vendor yang dapat memberi tahu Anda untuk apa itu.

Apa yang sebenarnya dikatakan repo itu, secara rinci, cukup tidak biasa sehingga layak dibaca. Ini bukan model percakapan dan bukan model bahasa kecil dalam pengertian biasa. Intern-Decision-0.8B menerima sepotong state, skema pertanyaan bernama yang Anda tulis terlebih dahulu, dan secara opsional hingga delapan gambar, lalu mengembalikan distribusi jawaban untuk setiap pertanyaan dalam satu forward pass. Model ini tidak pernah memanggil generate(). Model ini tidak pernah melakukan sampling. Tidak ada output teks yang perlu diurai, tidak ada JSON yang perlu diperbaiki, tidak ada loop percobaan ulang di sekitar kurung kurawal yang tidak pernah tertutup. Kesempitannya adalah keseluruhan arsitekturnya, dan itu menempatkan model ini dalam kategori kecil yang sama dengan Jev 1.13 milik TypeSafe dan Laya milik Convai — kategori yang jelas sengaja dijadikan pembanding oleh InternLM, karena Jevbench adalah benchmark milik TypeSafe sendiri dan itu adalah kolom pertama tabel.

Inilah yang dapat diketahui dari checkpoint, yang hanya diklaim oleh checkpoint, dan yang untuk saat ini tidak dapat dikatakan sama sekali oleh siapa pun di luar InternLM.

Apa yang sebenarnya ada di dalam repositori

Kartu ini singkat dan jujur tentang garis keturunannya. Intern-Decision-0.8B dideskripsikan sebagai "model keputusan terstruktur multimodal yang di-fine-tune dari Qwen3.5-0.8B" — basis Qwen yang dirilis pada 28 Februari 2026 — dan repositori ini membawa file lisensi kedua, LICENSE-QWEN, bersama ketentuan Apache-2.0, yang memang seharusnya dilakukan model turunan dan menjadi sinyal kejujuran kecil tersendiri. Indeks Hugging Face melaporkan 852.985.920 parameter di tiga shard: shard bahasa 1,50 GB, shard visi 176 MB, dan proyektor 25 MB. Total penyimpanan repositori sekitar 1,73 GB termasuk file tokenizer, yang membuat semuanya nyaman muat di satu GPU konsumen atau laptop dengan spesifikasi mumpuni.

Konfigurasi ini mengungkap arsitektur yang telah Qwen rilis di sepanjang generasi 3.5, bukan jaringan keputusan yang dirancang khusus. Ini adalah Qwen3_5ForConditionalGeneration dengan 24 lapisan yang disusun dalam pola berulang tiga lapisan linear-attention berbanding satu lapisan full-attention, ukuran tersembunyi 1.024, 8 attention head berbanding 2 key-value head, dimensi head 256, dan embedding posisi maksimum 262.144 token. Satu lapisan multi-token-prediction dipertahankan. Jalur vision-nya nyata: teks pada kartu menjelaskan penanganan gambar, prosesornya menerima gambar, dan checkpoint-nya menyertakan vision tower dan projector untuk melayaninya — jadi tag multimodal pada repo didukung oleh bobot, bukan sekadar oleh tag.

Gambaran keluarga model ini patut diperhatikan karena membentuk cara membaca segala hal lainnya. InternLM mengunggah tiga ukuran dalam 40 detik: 0,8B, lalu 2B, lalu 4B. Jumlah parameternya adalah 852.985.920, 2.213.241.664, dan 4.539.265.536. Kartu model 4B memuat bagian tambahan — pilot kalibrasi distribusi yang diketahui dengan 96 kasus beserta skor sebelum dan sesudah — yang tidak dimiliki kartu 0,8B. Asimetri itu bukan bukti adanya cacat pada model kecil; itu adalah bukti bahwa dokumentasi model kecil ditulis dengan anggaran yang lebih kecil, yang merupakan hal yang tampak seperti rilis senyap.

Bagaimana jalur inferensi sebenarnya bekerja

File inference.py yang disertakan adalah file paling informatif di repositori, karena file ini mendokumentasikan kontrak, bukan prompt. Urutannya seperti ini:

• Anda memberikan sebuah permintaan dengan state (hal yang dinilai), questions (sebuah skema), dan secara opsional berupa gambar.

• Opsi setiap pertanyaan dipetakan ke simbol token tunggal — A sampai Z, lalu huruf kecil, lalu angka, hingga 62 opsi per pertanyaan.

• Prompt sistem, state, skema, dan kerangka JSON asisten yang lengkap dirender dengan satu placeholder <decision> per bidang.

• Satu forward pass kausal dijalankan. Logit dibaca pada posisi tepat sebelum setiap placeholder.

• Softmax diambil hanya atas simbol kandidat yang diizinkan untuk bidang tersebut, kalibrasi checkpoint diterapkan, dan simbol dipetakan kembali ke nilai opsi asli Anda.

Mesin ini menyediakan tiga jenis pertanyaan. choice menerima objek terurut yang memetakan nilai opsi ke deskripsi. score menerima daftar — yang menjadi nilai string "0", "1", "2", dan seterusnya — atau objek terurut dengan kunci string numerik berhingga, yang memungkinkan model mengembalikan nilai ekspektasi berbobot probabilitas dan bukan hanya kategori. noul adalah keputusan biner dengan "no" sebelum "yes". Respons mengembalikan, per field, distribusi probabilitas yang terkalibrasi, tingkat keyakinan yang sama dengan probabilitas kandidat maksimum, keputusan argmax dengan pemecahan seri leksikal, dan untuk pertanyaan score nilai numerik ekspektasi serta legenda. Batasannya eksplisit: satu hingga enam belas pertanyaan per permintaan, hingga 62 opsi untuk masing-masing pertanyaan, plafon input default 8.192 token yang ditolak alih-alih dipotong, dan maksimum delapan gambar yang tokennya diperhitungkan terhadap plafon tersebut.

Dua detail dalam daftar itu perlu diperhatikan karena keduanya menentukan apakah Anda dapat memercayai keluarannya. Yang pertama adalah tidak ada jawaban emas yang dimasukkan ke dalam prompt — model memberi skor pada kandidat yang belum diperlihatkan jawabannya. Yang kedua adalah usage.output_tokens bukanlah jumlah token teks; ia menghitung field yang diberi skor. Siapa pun yang menghubungkan ini ke perhitungan anggaran token yang sudah ada akan terkejut oleh hal itu, dan kartu tersebut menyatakannya alih-alih membiarkannya ditemukan sendiri.

A single-column scoreboard headed 'Intern-Decision-0.8B — the scoreboard' listing parameters of 852,985,920 across three shards, a repository of about 1.73 GB under Apache 2.0 plus LICENSE-QWEN, an inference path of one causal forward pass with no generate() and no sampling, RTX 4090 latency of 33.98 ms mean and 37.50 ms p95, calibration at Brier 0.530 and ECE 0.066 with a fitted temperature of 2.747760550703, a suite average of 79.38 across seven benchmarks, and WildJailBreak at 64.48 against Jev's 96.29, with a footer noting every figure is vendor-reported and unreproduced.

Tabel benchmark, dan seberapa besar kita harus mempercayainya

Pembaca, waspadalah pada bagian ini: setiap angka di bawah ini dilaporkan vendor dan belum direproduksi. InternLM memilih benchmark, memilih model pembanding, menjalankan evaluasinya, dan menerbitkan tabelnya. Tidak ada uji independen atas Intern-Decision-0.8B di papan peringkat publik mana pun, dan pencarian di Artificial Analysis tidak menemukan apa pun untuk model tersebut sama sekali. Itu tidak membuat tabel itu salah. Itu membuatnya tidak diaudit, dan berarti kolom-kolomnya paling berguna untuk membaca bentuk hasilnya, bukan levelnya.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

• Jevbench, tiga split — Intern-Decision-0.8B mencatat 97.92 pada Easy, 80.56 pada Original dan 52.25 pada Hard. Jev dari TypeSafe berada di 100.00, 98.61 dan 72.07 pada split yang sama.

• Typed Decision — 0.8B mencetak skor 77.35 melawan 73.35 milik Jev. Inilah satu-satunya kolom di mana model terkecil di bidang ini mengalahkan model yang namanya dijadikan nama benchmark tersebut.

• ToolACE — 94,52 untuk model 0,8B dibanding 91,29 untuk Jev. ToolACE adalah tolok ukur pemanggilan fungsi, dan head keputusan yang mengungguli Jev dalam pemilihan alat adalah klaim paling substantif dalam tabel tersebut.

• AG News — 88,61 dibandingkan 89,57 milik Jev. Secara efektif setara dengan yang terdepan di kategori ini pada klasifikasi topik empat kelas.

• WildJailBreak — 64.48 dibandingkan dengan 96.29 milik Jev. Inilah keruntuhannya. Bisa dibilang ini kolom yang paling penting untuk model yang akan Anda arahkan ke masukan yang tidak tepercaya, dan kolom di mana 0.8B paling jauh dari referensi.

• Rata-rata — 79,38 untuk 0.8B, 84,68 untuk saudara 2B-nya sendiri, 90,02 untuk 4B. Keluarga ini menanjak tajam, yang persis seperti yang Anda harapkan dan itu sendiri merupakan argumen ringan bahwa tabel tersebut tidak direkayasa balik untuk menyanjung sang andalan.

• Kalibrasi — Brier 0.530 dan expected calibration error 0.066 untuk 0.8B. Jev melaporkan 0.358 dan 0.095. Baca keduanya bersama-sama dan gambaran yang lebih jelas muncul daripada yang diberikan masing-masing angka bila dibaca sendiri-sendiri: 0.8B terkalibrasi lebih baik daripada Jev dalam pengertian ECE — tingkat keyakinan yang dinyatakannya lebih dekat mengikuti akurasinya — sekaligus secara keseluruhan secara signifikan kurang akurat. Itu profil yang masuk akal untuk model kecil dengan temperature yang sengaja disesuaikan, dan itu bukan kombinasi yang membuatnya tampak bagus untuk dipublikasikan secara tidak sengaja.

Kumpulan perbandingan ini memiliki satu sifat yang mencolok: kumpulan ini didominasi oleh Litsy. Jev, Litsy, Sifa, Kev, dan JevK5 semuanya muncul; benchmark milik tabel itu sendiri adalah TypeSafe. Litsy memilih untuk diukur di kandang kompetitor, menggunakan harness milik kompetitor, dan menyertakan kolom-kolom tempat model terkecilnya kalah. Itu adalah jenis keputusan yang dibuat sebuah tim ketika tidak merencanakan kampanye pemasaran seputar peluncuran — yang konsisten dengan segala hal lain tentang bagaimana ini dirilis.

Suhu kalibrasi adalah angka yang paling menarik

Intern-Decision-0.8B menetapkan suhu default sebesar 2,747760550703, melalui minimisasi NLL atas 1.728 kasus kalibrasi yang ditetapkan dengan 1.693 kasus validasi terpisah. Kartu tersebut secara eksplisit menyatakan bahwa label test-suite tidak digunakan untuk memilihnya. Transformasi yang diterapkan adalah p = softmax(candidate_logits.float()) diikuti oleh calibrated_p = softmax(log(p) / T).

Itu adalah kalibrasi probabilitas kandidat, bukan temperatur pengambilan sampel, dan perbedaan ini bukan sekadar bertele-tele. Karena transformasi tersebut diterapkan setelah softmax dan mempertahankan urutan, ia sama sekali tidak dapat mengubah keputusan argmax. Ia menggeser keyakinan, probabilitas ya noul, dan nilai harapan dari pertanyaan skor — dan membiarkan keputusan utamanya tetap identik. Jika alur kerja Anda membaca label, temperatur tidak berpengaruh. Jika alur kerja Anda membaca probabilitas — menetapkan ambang batasnya, memeringkat berdasarkan probabilitas itu, atau memasukkannya ke dalam perhitungan nilai harapan hilir — temperatur adalah perbedaan antara angka yang bermakna dan angka yang tidak. Memberikan temperature=1 mengembalikan distribusi yang tidak terkalibrasi, yang merupakan jalan keluar berguna bagi siapa pun yang ingin menerapkan kalibrasi mereka sendiri di atasnya.

Suhu disetel per checkpoint, bukan dibagikan. Model 4B menggunakan nilai yang berbeda, 1.99241824, dan kartu modelnya menginstruksikan Anda untuk menggunakan modul inferensi yang disertakan dengan ukuran yang Anda unduh agar kalibrasi bawaannya cocok. Siapa pun yang menyalin pembungkus inferensi dari satu model kembaran ke model lainnya akan secara diam-diam menerapkan suhu yang salah.

Tiga puluh empat milidetik, dan hasil yang seharusnya tidak mungkin.

InternLM mengukur latensi ujung ke ujung per kueri pada satu RTX 4090 menggunakan jalur Hugging Face lokal — pengukuran nyata, tetapi juga konfigurasi penyajian paling lambat yang mungkin, karena penerapan produksi akan menggunakan runtime terkompilasi atau batching. Jev terdaftar pada rata-rata 109,70 ms dan median 106,30 ms dengan p95 146,70 ms. Intern-Decision-0.8B berada pada 33,98 / 33,44 / 37,50 ms.

Angka yang layak diperhatikan adalah saudara 2B: rata-rata 33.28 ms, median 33.15 ms. 2B lebih cepat daripada 0.8B, dengan selisih yang cukup kecil untuk dianggap noise tetapi tidak ke arah yang diprediksi oleh jumlah parameter. Itu bukan kesalahan dalam tabel dan sebenarnya bukan tentang modelnya. Model keputusan melakukan tepat satu forward pass atas prompt yang panjangnya ditentukan oleh state, skema, dan deskripsi opsi — bukan oleh apa pun yang ditulis model, karena model tidak menulis apa pun. Untuk prompt dalam rezim tersebut, pemrosesan prompt mendominasi dan jumlah parameter adalah biaya sekunder. Konsekuensi praktisnya adalah alasan yang biasa untuk memilih checkpoint terkecil — Anda membayar per token — tidak berlaku di sini. Alasan sebenarnya untuk memilih 0.8B daripada 2B adalah jejak memori dan fakta bahwa seluruh repositorinya muat dalam 1.73 GB, bukan throughput.

Apa yang belum dapat ditetapkan

Inilah bagian yang akan dijawab oleh sebuah postingan peluncuran dan tidak bisa dijawab oleh repositori.

Tidak ada tanggal rilis yang disebutkan, tidak ada pengumuman, dan tidak ada apa pun di saluran publik InternLM yang menjelaskan keluarga ini. URL GitHub yang tercetak pada kartu model tidak dapat diakses. Space demo yang dirujuk dalam kartu tersebut tidak dapat dibaca publik. Tidak ada koleksi yang menghimpun ketiga checkpoint tersebut, yang berarti satu-satunya cara untuk menemukan 2B atau 4B adalah dengan melihat daftar model organisasi tersebut. Tidak ada makalah, sehingga data pelatihan, resep penyetelan, jumlah langkah pelatihan, dan apa yang diubah oleh "decision tuning" pada bobot semuanya tidak disebutkan. Tidak ada evaluasi independen, tidak ada replikasi latensi pihak ketiga, dan belum ada bukti bahwa siapa pun di luar InternLM telah menjalankan checkpoint tersebut.

Ada juga dua pertanyaan yang diangkat oleh kartu tersebut tanpa dijawab. Yang pertama adalah apa arti celah WildJailBreak dalam praktik: defisit ketahanan penolakan sebesar itu adalah properti dari fine-tune, dan apakah hal itu mencerminkan model dasar, tujuan penyetelan keputusan, atau jumlah parameter yang kecil bukanlah sesuatu yang diberitahukan oleh repositori kepada Anda. Yang kedua adalah apa yang terjadi pada batas atas input. Permintaan yang melebihi 8.192 token ditolak, bukan dipotong, yang merupakan perilaku yang tepat untuk model penilaian, tetapi itu berarti jendela konteks praktis bukanlah 262.144 yang diiklankan oleh konfigurasi — melainkan apa pun yang muat dalam 8.192 token state, skema, opsi, dan patch gambar. Untuk dokumen panjang dengan skema yang kaya, batas atas itu tercapai lebih cepat daripada yang disiratkan oleh diagram arsitektur.

Di mana ini berada, dan cara mencobanya tanpa harus bertaruh padanya

Kerangka yang jujur adalah bahwa Intern-Decision-0.8B adalah checkpoint yang telah dirilis dengan klaim yang belum diaudit dan tanpa dokumentasi pendukung. Kombinasi itu bukan alasan untuk mengabaikannya — rilis bobot Apache-2.0 yang dapat Anda unduh dan ukur dalam satu sore adalah situasi yang lebih baik daripada API dengan daftar tunggu — tetapi itu berarti beban validasi ada pada Anda. Mesin ini dimuat dari direktori lokal, berjalan pada GPU kelas 4090 atau yang lebih kecil, dan kartunya menyediakan contoh permintaan siap pakai yang dapat Anda tempelkan. Evaluasi sehari terhadap kasus berlabel Anda sendiri akan memberi tahu Anda lebih banyak tentang kolom WildJailBreak daripada yang dapat diberikan tabel vendor.

Jika lapisan keputusan adalah bagian yang Anda evaluasi, target pembanding yang berguna adalah yang dihosting. Jev 1.13 milik TypeSafe adalah model yang dijadikan tolok ukur oleh InternLM, dan model itu dapat dipanggil hari ini melalui satu endpoint yang kompatibel dengan OpenAI dengan harga $0,042 per juta token input dengan output ditagih nol — harga yang sama dengan yang diterbitkan vendor, karena OrcaRouter meneruskan harga daftar penyedia tanpa markup alih-alih menambahkan margin di atasnya. Menempatkan kepala keputusan 0,8B yang dihosting sendiri dan API keputusan yang dihosting pada kunci yang sama, pada sore yang sama, adalah eksperimen yang jauh lebih murah daripada menyiapkan dua kontrak terpisah untuk menjawab pertanyaan yang sama.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Yang akan mengubah gambaran ini bukanlah sebuah benchmark. Yang akan mengubahnya adalah munculnya repositori GitHub, atau InternLM menerbitkan resep penyetelannya, atau sebuah checkpoint yang untuk pertama kalinya dijalankan secara independen dan masuk ke papan peringkat. Sampai salah satu dari hal itu terjadi, deskripsi yang akurat tentang Intern-Decision-0.8B bersifat sempit dan tidak menyanjung, sekaligus sepenuhnya menguntungkannya: bobotnya nyata, kontrak inferensinya didokumentasikan lebih baik daripada yang mampu dilakukan sebagian besar model yang diluncurkan, dan pemasarannya belum dimulai.