
Intern-Decision-4B vs Qwen 3.8: Forward Pass 44 Milidetik Melawan 2,4 Triliun Parameter
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 592 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 187 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
InternLM menerbitkan Intern-Decision-4B di Hugging Face pada pagi 26 September 2026 — tanpa tulisan peluncuran, tanpa entri blog, tautan GitHub di kartu modelnya sendiri yang mengembalikan 404 dan Space demo yang mengembalikan 404. Bobotnya nyata dan dapat diunduh; pengumumannya tidak ada. Dan model di baliknya adalah fine-tune dari Qwen3.5-4B, yang membuat perbandingan terhadap model unggulan yang dihosting bernilai lebih daripada sekadar lembar spesifikasi. Keduanya bukan pesaing. Keduanya adalah dua ujung dari satu pipeline, dan pertanyaan utamanya adalah di mana garis di antara keduanya jatuh. Inti yang mendasarinya adalah model 2,4 triliun parameter yang diterbitkan vendor pada Agustus dan kini dilayani sebagai Qwen3.8-Max, dengan tarif $2,00 dan $6,00 per juta token; Intern-Decision-4B adalah hasil bangun ulang 4,54 miliar parameter dari model dasar berusia tujuh bulan itu, yang tidak mengeluarkan token sama sekali, menjawab hingga enam belas pertanyaan bertipe dalam satu forward pass, dan tidak memakan biaya per panggilan karena tidak ada keluaran yang ditagih.
Jawaban satu barisnya: jika tugas Anda adalah keputusan dengan kumpulan jawaban yang tertutup, Intern-Decision-4B kira-kira lima puluh kali lebih cepat per keputusan dan secara struktural lebih murah, dan tidak ada model frontier yang akan mengalahkannya pada sumbu sempit itu. Jika tugas Anda adalah hal lain — penalaran, konteks panjang, penggunaan alat, apa pun yang jawabannya belum tercantum dalam prompt Anda — Qwen 3.8 bukan sekadar lebih baik, melainkan satu-satunya dari keduanya yang sama sekali bisa mengerjakan tugas itu. Semua yang di bawah ini adalah tentang menemukan garis itu dengan tepat.
Apa yang sebenarnya sudah dikonfirmasi, dan apa yang belum
Mulailah dari buktinya, karena cara membingkainya itu penting. Tidak ada pengumuman vendor untuk Intern-Decision-4B. Tidak ada siaran pers, tidak ada makalah, tidak ada deskripsi repositori untuk dibaca. Yang ada saat ini adalah repositori Hugging Face yang diterbitkan pagi ini di bawah organisasi internlm — Intern Large Models, kelompok Shanghai AI Laboratory — yang membawa lisensi Apache 2.0 dengan lisensi Qwen hulu yang dipertahankan di sampingnya sebagai LICENSE-QWEN. Dua checkpoint saudara muncul dalam selisih empat puluh detik satu sama lain: Intern-Decision-0.8B dengan 853 juta parameter dan Intern-Decision-2B dengan 2,21 miliar. Ketiganya membawa tag yang sama — pembuatan keputusan, multimodal, prediksi terstruktur — dan ketiganya berada di bawah satu koleksi model yang belum dapat diakses secara publik.
Yang belum dikonfirmasi: apakah ini rilis final atau push awal. Repositori tersebut dibuat pada 05:36 UTC dan dimodifikasi lagi sebelum 08:00 UTC pada hari yang sama, dan aktivitas publik lebih lanjut pada checkpoint saudara terus berlangsung melewati pukul 09:00. InternLM belum mengatakan seperti apa rencana penerapan yang dimaksud, belum menerbitkan repositori yang ditautkannya, dan belum mengatakan apakah endpoint yang dihosting akan hadir. Perlakukan setiap angka benchmark dalam artikel ini sebagai dilaporkan vendor dan belum direproduksi — karena sampai tulisan ini dibuat, benar-benar tidak ada hal lain yang telah ditulis tentang model ini di mana pun. Tiga jalur pencarian terpisah mengembalikan hasil atas nama tersebut.

Taruhan arsitektural: penilai, bukan generator
Kalimat terpenting dalam dokumentasi Intern-Decision-4B sendiri adalah sebuah negasi: jalur inferensinya "tidak memanggil generate() atau mengambil sampel teks bebas." Itu bukan detail implementasi, melainkan keseluruhan desainnya, dan itulah yang membedakannya dari memanggil Qwen3.8-Max dengan skema JSON lalu berharap kurung kurawalnya menutup.
Berikut mekanismenya, seperti yang dijelaskan kartu. Anda memberikan kepada model sebuah state bersama, skema pertanyaan yang diberi nama, dan secara opsional hingga delapan gambar. Setiap pertanyaan adalah salah satu dari tiga tipe: choice (pilih satu dari himpunan opsi terurut), score (beri nilai pada skala ordinal, dikembalikan sebagai nilai ekspektasi berbobot probabilitas), atau noul (biner tidak/ya). Prompt sistem, state, skema, dan kerangka JSON asisten yang lengkap dirender dengan satu placeholder per bidang. Lalu — dan inilah triknya — model menjalankan satu forward pass kausal, dan logit dibaca pada posisi tepat sebelum setiap placeholder. Softmax diambil hanya atas simbol kandidat yang diizinkan untuk bidang itu, kalibrasi checkpoint diterapkan, dan simbol-simbol dipetakan kembali ke nilai opsi asli Anda.
Konsekuensinya konkret. Karena ruang jawaban setiap field dirakit per permintaan alih-alih ditanamkan ke dalam head kosakata, skema yang Anda rancang sore ini tidak memerlukan pelatihan ulang — tambahkan pertanyaan, opsi-opsinya menjadi simbol kandidat untuk field tersebut. Karena tidak ada loop decoding, tidak ada token keluaran, tidak ada kurung kurawal yang terlupa, dan tidak ada logika coba ulang untuk JSON yang cacat. Dan karena semua pertanyaan dinilai dari pembacaan state yang sama, enam belas pertanyaan membutuhkan satu forward pass, bukan enam belas.
Batasannya sama konkretnya, dan kartu tersebut menyatakannya tanpa berbelit-belit. Satu hingga enam belas pertanyaan, hingga 62 opsi per pertanyaan, hingga delapan gambar. Maksimum default 8.192 — dan input yang melampauinya akan ditolak tanpa pemotongan. Klausul terakhir itu adalah keputusan desain yang layak direnungkan: pemotongan diam-diam adalah cara sebuah sistem mulai menjawab pertanyaan yang berbeda dari yang Anda ajukan, dan InternLM memilih untuk gagal secara nyaring. Itu keputusan yang tepat, dan itu juga merupakan jebakan operasional, karena utas tiket yang panjang plus skema plus gambar akan melampaui 8.192 lebih cepat dari yang Anda perkirakan dan tidak ada jalan keluar yang mulus — Anda akan mendapat error.
Di mana Intern-Decision-4B menang, dan itu bukan dengan selisih tipis
Dua sumbu, dan keduanya bersifat struktural, bukan inkremental.
• Latensi per keputusan — rata-rata 44,16 ms, median 44,03 ms, 44,60 ms pada p95, diukur pada satu RTX 4090 melalui jalur Hugging Face lokal. Dibandingkan dengan Qwen3.8-Max, yang jendela langsung tujuh harinya di playground kami sendiri menunjukkan p50 sebesar 2.474 ms dan p95 sebesar 9.789 ms pada 55,4 token keluaran per detik. Itu kira-kira 56× pada median, dan perbandingan ini bukanlah tidak adil, melainkan lebih merupakan perbandingan antara dua operasi yang berbeda: satu model mengklasifikasikan, model lainnya bernalar lalu menulis. Kesenjangan itu nyata, dan alasan di baliknya juga nyata.
• Biaya per keputusan — dan ini aritmetika, bukan opini. Ambil contoh panggilan triase dukungan yang realistis: 800 token masukan untuk state dan skema, serta 150 token keluaran berupa JSON terstruktur. Pada Qwen3.8-Max, itu berarti 800 × $2,00/juta ditambah 150 × $6,00/juta, atau sekitar $0,0025 per keputusan, sebelum satu token penalaran pun — dan Qwen3.8-Max adalah model penalaran, jadi sisi keluarannya secara optimistis kecil. Satu juta keputusan memakan biaya sekitar $2.500. Satu juta keputusan yang sama pada Intern-Decision-4B memakan nol token dan sekitar 12,3 jam waktu RTX 4090. Intern-Decision-4B tidak memiliki harga keluaran karena tidak memiliki keluaran.
Pertukarannya jujur dan jelas: model 4B membutuhkan GPU yang Anda miliki atau sewa, ia menempati GPU itu, dan selamanya hanya bisa melakukan satu hal. Tetapi jika satu hal itu adalah yang produk Anda lakukan jutaan kali sehari, perhitungan di atas merupakan keseluruhan alasan bisnisnya, dan sebesar apa pun kemampuan model frontier, itu tidak akan mengubahnya.
Angka yang tidak dipublikasikan Qwen 3.8: kalibrasi
Ini adalah pembeda yang tenang, dan inilah yang akan dilewatkan oleh sebagian besar perbandingan karena tidak terlihat seperti tolok ukur.
Intern-Decision-4B mengembalikan sebuah distribusi atas nilai opsi Anda, bukan sekadar label — ditambah keyakinan, dan untuk pertanyaan baru, probabilitas ya yang terkalibrasi. InternLM melaporkan skor Brier 0,347 dan kesalahan kalibrasi yang diharapkan 0,065 di seluruh rangkaiannya sendiri, dan menyertakan suhu yang di-fit dalam checkpoint: 1,99241824, di-fit secara terpisah untuk ukuran ini melalui minimisasi log-likelihood negatif pada 1.728 kasus kalibrasi yang ditentukan dengan 1.693 kasus validasi held-out. Label test-suite tidak digunakan untuk memilihnya. Ada diagnostik kedua yang independen dengan 96 kasus di kartu model yang menggunakan distribusi referensi eksak alih-alih label sampel, dan ini menunjukkan Brier/ECE keseluruhan bergerak dari 0,628 / 0,213 sebelum kalibrasi menjadi 0,550 / 0,089 sesudahnya — langkah kalibrasi memangkas error yang diharapkan jauh lebih dari setengah.
Sekarang cari angka yang sama di sisi Qwen 3.8. Angka itu tidak ada. Alibaba menerbitkan skor Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking, dan long-context recall — semuanya ukuran kemampuan. Alibaba tidak menerbitkan metrik kalibrasi untuk anggota keluarga Qwen 3.8 mana pun, karena keyakinan model generatif bukanlah kuantitas yang disediakan vendor. Jika sistem Anda memerlukan probabilitas yang dapat dijadikan ambang batas atau dasar perutean, bukan jawaban yang harus dipercaya, perbedaan itu bukan soal derajat. Satu model memberi Anda angka dengan tingkat kesalahan yang terdokumentasi; model lainnya memberi Anda teks, dan Anda membangun perkiraan keyakinan Anda sendiri di sekitarnya.
Di mana Qwen 3.8 menang, dan itu juga bukan kemenangan tipis.
Sandingkan keduanya dalam hal apa yang dapat diminta untuk mereka lakukan, dan batas-batasnya tak lagi samar.
• Konteks — Qwen3.8-Max memiliki jendela 1.000.000 token. Intern-Decision-4B menolak apa pun di atas 8.192. Itu berarti faktor 122, dan tidak ada solusi alternatifnya, karena batas input ditegakkan, bukan dipotong.
• Modalitas masukan — Qwen3.8-Max menerima teks, gambar, dan video. Intern-Decision-4B menerima teks dan gambar, maksimal delapan, dan token gambar diperhitungkan terhadap anggaran 8.192 yang sama.
• Penalaran dan alat — Qwen3.8-Max menyertakan penggunaan alat, mode JSON, dan penalaran di antara kemampuan yang dideklarasikannya, serta mencatat Indeks Kecerdasan Artificial Analysis sebesar 45,4, peringkat kelima belas dari 145 model yang diindeks, dengan skor AA Coding 76,2 di peringkat kesembilan dari 138. Itu adalah angka independen yang diterbitkan oleh Artificial Analysis, bukan klaim vendor. Intern-Decision-4B tidak memiliki entri Artificial Analysis, tidak memiliki skor independen dalam bentuk apa pun, dan tidak memiliki kemampuan untuk menalar, merencanakan, atau memanggil apa pun.
• Keluaran terbuka — Qwen3.8-Max menulis. Intern-Decision-4B tidak dapat menghasilkan paragraf, alasan, atau rencana. Ia hanya dapat memberi skor pada opsi yang sudah Anda pikirkan untuk dicantumkan.
Perlu dicatat juga di sisi bobot terbuka: jika Anda menginginkan inti Qwen 3.8 itu sendiri dan bukan jalur hosted, Qwen3.8-27B adalah saudara dense-nya — 27,8 miliar parameter, Apache 2.0, konteks 262.144 token, dan sekitar $0,33 / $2,40 per juta token di tempat ia dilayankan. Ia mendapat skor 33,7 pada AA Intelligence Index. Ia masih satu orde besaran lebih besar daripada Intern-Decision-4B, masih generatif, dan masih alat yang salah untuk keputusan himpunan tertutup dalam volume besar — tetapi ia adalah pilihan tengah yang jujur, dan satu-satunya dari ketiganya yang benar-benar murah dan benar-benar mumpuni sekaligus.

Membaca tabel benchmark milik InternLM sendiri dengan jujur
Kartu Intern-Decision-4B memuat tabel perbandingan, dan apa yang tidak ada darinya lebih informatif daripada apa yang ada di dalamnya. Baris-barisnya adalah Jev, Laya, SemIf, Kev, JevK5, dan 0.8B serta 2B milik InternLM sendiri. Setiap entri di antaranya adalah entri System One atau model keputusan lainnya — Jev dari TypeSafe AI, Laya dari Convai Innovations, dan tiga lainnya. Setiap angka dilaporkan oleh vendor pada harness milik InternLM sendiri. Tidak ada model terdepan sama sekali di dalam tabel itu.
Itu bukan kelalaian. Itu adalah cakupan klaim yang jujur. Rata-rata utama Intern-Decision-4B sebesar 90,02 di tujuh suite — Jevbench-Easy 100,00, Jevbench-Original 98,61, Jevbench-Hard 73,87, Typed Decision 80,55, ToolACE 96,45, AG News 90,82, WildJailBreak 89,86 — adalah klaim untuk memimpin kategori model keputusan, yang memang dilakukannya pada tabel ini, mengalahkan 88,74 milik Jev dan 57,77 milik Laya. Ini bukan klaim untuk bersaing dengan Qwen 3.8, dan InternLM tidak membuat klaim itu di mana pun. Kartu model dibatasi pada kategorinya sendiri, dan membaca kemenangan kategori sebagai kemenangan kemampuan adalah kesalahan yang hendak dicegah oleh bagian ini.
Dua peringatan lagi. Angka latensi — rata-rata 44 ms pada 4090 — diukur oleh vendor, bergantung pada beban kerja dan perangkat keras, dan forward pass GPU tunggal bukan pengukuran yang sama dengan panggilan API yang dihosting termasuk round-trip jaringan dan antrean. Dan pilot kalibrasi berisi 96 kasus: sebuah diagnostik, bukan benchmark, dan kartu itu menyatakannya.
Pertanyaan deployment, yang merupakan percabangan sesungguhnya.
Lupakan sejenak tolok ukur dan tanyakan apa yang masing-masing tuntut dari Anda secara operasional.
Intern-Decision-4B berukuran sekitar 9,1 GB di disk pada bf16 — dua shard bahasa pada 4,26 GB dan 4,15 GB, sebuah tower visi 612 MB, dan sebuah proyektor 54 MB. Itu dimuat melalui 16 KB inference.py yang disertakan di dalam repositori itu sendiri, dengan DecisionEngine kelas yang Anda instansiasi sekali dan pakai ulang. Satu dict Python masuk, satu dict respons keluar, dengan persyaratan Python 3.12+. Itu berjalan pada 44 ms di 4090, dan saudara 0.8B cukup kecil untuk dipertimbangkan dengan jauh lebih sedikit. Tapi modulnya adalah antarmukanya — tidak ada server, tidak ada endpoint yang kompatibel dengan OpenAI, dan tidak ada API yang dihosting. Anda sedang membangun layanan di sekitarnya, dan jika Anda memerlukan dua di antaranya untuk failover, Anda juga sedang membangunnya.
Sisi generatif dari pipeline yang sama adalah keputusan yang sama sekali berbeda, dan itulah yang sebenarnya menjadi fungsi sebuah router. Qwen3.8-Max dan Qwen3.8-27B keduanya dapat dipanggil di OrcaRouter di balik kunci yang sama yang kompatibel dengan OpenAI, dengan harga daftar penyedia tanpa markup 0% yang diteruskan — jadi ketika Alibaba mengubah harga Qwen, harga itu langsung berlaku di sisi kami pada hari yang sama, bukan pada siklus penagihan berikutnya. Intern-Decision-4B bukan salah satu rute kami dan tidak akan menjadi rute kami sampai InternLM menyediakannya di suatu tempat; kami tidak akan berpura-pura sebaliknya. Yang kami cakup adalah separuh dari pipeline ini yang berupa panggilan jaringan: satu kunci untuk 200+ model, failover otomatis jika Qwen3.8-Max menurun — tingkat kesalahan tujuh harinya secara langsung adalah 1,78% — dan kemampuan untuk menguji A/B dua tier Qwen 3.8 satu sama lain di jalur permintaan yang sama sebelum Anda berkomitmen pada salah satunya.
Pola mana yang layak diambil. Jalankan scorer secara lokal karena ia murah dan cepat serta melakukan satu hal sempit dengan baik. Rutekan langkah penalaran, karena di sanalah pergantian vendor, pemotongan harga, dan pemadaman benar-benar terjadi.

Mana yang sebenarnya harus Anda pilih
Pilih Intern-Decision-4B jika keputusan Anda bersifat closed-set, jawaban Anda dapat didaftar seluruhnya dalam sebuah prompt, Anda menjalankan keputusan yang sama secara massal, dan Anda peduli pada probabilitas sama seperti pada label. Perutean tiket, moderasi konten terhadap taksonomi tetap, ekstraksi terstruktur ke dalam skema yang Anda kendalikan, rubrik penilaian, gerbang biner — apa pun yang daftar opsinya bisa ditulis manusia terlebih dahulu. 4,54 miliar parameternya jujur tentang batas atasnya: kartunya sendiri menunjukkan 4B pada 73,87 di Jevbench-Hard versus 100,00 di Easy, jadi semakin sulit bentuk keputusannya, semakin banyak yang harus dikorbankan oleh model kecil itu.
Pilih Qwen 3.8 — artinya Qwen3.8-Max jika Anda menginginkan inti yang dihosting, Qwen3.8-27B jika Anda menginginkan bobot yang bisa Anda pegang — jika jawabannya tidak dapat dienumerasi terlebih dahulu, jika masukannya lebih dari 8.192 token, jika Anda memerlukan dasar pemikiran yang dapat Anda tunjukkan kepada manusia, jika Anda memerlukan panggilan alat, atau jika Anda memerlukan video. Pilih juga model ini jika Anda sekadar tidak ingin mengoperasikan GPU: 12,3 jam waktu 4090 per juta keputusan baru murah jika Anda sudah memiliki 4090 dan ada hal lain untuk dilakukan dengannya pada 363 hari lainnya.
Pilih keduanya jika pipeline Anda berbentuk seperti kebanyakan pipeline yang sebenarnya — pengklasifikasi closed-set yang murah di depan, model frontier di belakangnya untuk kasus-kasus yang pengklasifikasinya tidak yakini. Itulah konfigurasi yang dituju oleh keyakinan terkalibrasi Intern-Decision-4B, dan itulah alasan angka ECE di atas lebih penting daripada rata-rata utama.
Apa yang harus ditonton
Tiga pertanyaan terbuka, semuanya bisa dijawab dalam hitungan hari. Apakah InternLM menerbitkan repositori GitHub yang ditautkan oleh kartunya sendiri — saat ini 404 — dan bersama itu deskripsi pelatihan? Apakah ada pengumuman yang menyusul bobot tersebut, mengubah push senyap menjadi rilis yang terdokumentasi? Dan apakah ada pihak independen yang mereproduksi rata-rata 90.02, atau Brier 0.347, pada perangkat keras yang bukan milik InternLM?
Ada satu ketidaksesuaian kecil yang perlu dicatat selagi Anda menunggu, karena hal semacam ini penting saat Anda menentukan ukuran deployment. Model ini dinamai 4B. Jumlah parameternya adalah 4.539.265.536 — 4,54 miliar. Model 0.8B sebesar 853 juta dan model 2B sebesar 2,21 miliar, keduanya membulatkan ke atas atau ke bawah hanya sedikit. Hanya 4B yang membulatkan ke bawah lebih dari setengah miliar. Itu bukan masalah. Itu pengingat bahwa dalam rilis yang tidak diumumkan, dokumen adalah satu-satunya spesifikasi yang Anda miliki, dan bahkan dokumen itu masih diedit.
