
Intern-Decision-0.8B vs Qwen 3.8: 853 Juta Parameter dan Himpunan Jawaban Tertutup
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 592 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 187 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Intern-Decision-0.8B adalah yang terkecil dari tiga model keputusan yang diluncurkan InternLM ke Hugging Face pada pagi 26 September 2026, dan ini bukan yang tercepat di antara ketiganya. Itu hal pertama yang perlu diketahui. Berdasarkan pengukuran lab itu sendiri, saudara 2B-nya berjalan sedikit lebih cepat — 33,28 ms versus 33,98 ms — dan mencetak enam poin lebih tinggi pada rata-rata tujuh suite yang sama, jadi alasan umum untuk memilih checkpoint sub-miliar, yaitu kecepatan murni, tidak berlaku di sini. Yang berlaku adalah ukuran: 852.985.920 parameter, 1,71 GB bobot bf16, cukup kecil untuk berada secara permanen di margin mesin yang memiliki pekerjaan lain. Bandingkan itu dengan Qwen3.8-Max — versi hosted dari inti sparse mixture-of-experts 2,4 triliun parameter yang diterbitkan vendor pada Agustus, dengan harga $2,00 dan $6,00 per juta token — dan keduanya tidak bersaing untuk pekerjaan yang sama. Yang satu mengembalikan distribusi probabilitas atas opsi yang Anda berikan sebelumnya. Yang lain menulis.
Jawaban singkatnya: Intern-Decision-0.8B layak dimiliki jika Anda membutuhkan keputusan himpunan tertutup yang dinilai pada perangkat keras yang sudah Anda miliki, dan jika 1.71 GB alih-alih 4.43 GB menjadi pembeda antara merilis dan tidak merilis. Model ini tidak layak dimiliki jika Anda menginginkan penilai kecil paling akurat yang dirilis InternLM minggu ini — yaitu 4B — atau jika jawaban Anda belum tercantum dalam prompt Anda, yang dalam hal ini tidak satu pun dari keduanya adalah alat yang tepat dan Qwen 3.8 adalah satu-satunya dari pasangan tersebut yang setidaknya bisa melakukan pekerjaan itu.
Apa yang dikatakan repositori, dan apa yang tidak dilakukan oleh hal lain
Mulailah dari buktinya, karena buktinya sangat sedikit. InternLM tidak membuat pengumuman untuk model ini. Tidak ada posting peluncuran, tidak ada makalah, tidak ada deskripsi repositori. Kartu Hugging Face menautkan Space demo dan repositori GitHub, dan pada saat penulisan ini Space mengembalikan 401 dan tautan GitHub mengembalikan 404 — dua tempat yang ditunjuk kartu untuk informasi lebih lanjut ditutup. Tiga checkpoint muncul dalam selang waktu empat puluh detik satu sama lain pada sekitar pukul 05:36 UTC tanggal 26 September: Intern-Decision-0.8B, Intern-Decision-2B dan Intern-Decision-4B, semuanya membawa tag yang sama — pengambilan keputusan, multimodal, prediksi terstruktur — dan semuanya merupakan fine-tune dari checkpoint Qwen, dalam hal ini Qwen3.5-0.8B.
Apa yang dapat diketahui dari repositori ini luar biasa tepat untuk rilis yang belum diumumkan, karena lab tersebut menyertakan modul inferensinya sendiri bersama bobotnya. 0.8B dimuat melalui inference.py berukuran 16 KB di direktori model, memerlukan Python 3.12 atau lebih baru dan torch 2.9.1 dengan transformers 5.14.1, serta mengekspos kelas DecisionEngine yang Anda instansiasi sekali lalu gunakan kembali. Satu dict Python masuk, satu dict respons keluar. Yang tidak dapat diketahui: apakah ini rilis yang sudah selesai atau dorongan awal, apakah endpoint yang dihosting akan hadir, dan apakah dua checkpoint yang mengapitnya dimaksudkan sebagai produk yang sama pada ukuran berbeda atau tiga produk berbeda yang kebetulan memiliki nama yang sama. Tidak ada orang di luar InternLM yang telah menjalankan salah satunya.

Masalah saudara: 2B lebih cepat dan lebih baik
Berikut adalah bagian dari tabel yang diterbitkan InternLM sendiri yang membuat 0.8B sulit ditempatkan. Membaca ketiga ukuran pada tujuh suite yang sama:
• Kecepatan — 0,8B: rata-rata 33,98 ms, median 33,44 ms, 37,50 ms pada p95. 2B: 33,28 ms, 33,15 ms, 33,55 ms. 4B: 44,16 ms, 44,03 ms, 44,60 ms. Semua diukur per kueri pada satu RTX 4090 melalui jalur Hugging Face lokal.
• Rata-rata tujuh suite — 0.8B: 79.38. 2B: 84.68. 4B: 90.02.
• Kalibrasi — 0.8B: Brier 0.530, ECE 0.066. 2B: Brier 0.437, ECE 0.100. 4B: Brier 0.347, ECE 0.065.
• Jejak di disk pada bf16 — 0,8B: 1,71 GB. 2B: 4,43 GB. 4B: 9,08 GB.
2B lebih cepat secara rata-rata, jauh lebih rapat pada ekornya, dan lebih akurat, semuanya sekaligus. Jadi "lebih kecil berarti lebih cepat" tidak berlaku di seluruh keluarga ini — dua kali, karena 4B lebih lambat daripada keduanya. Satu-satunya sumbu tempat 0.8B menang telak adalah sumbu yang tidak di-benchmark oleh siapa pun: 1,71 GB dibandingkan 4,43 GB milik 2B dan 9,08 GB milik 4B. Jika Anda menempatkan pemberi skor dalam anggaran memori tetap — kotak kecil yang selalu menyala, GPU yang dipakai bersama penyewa lain, node edge dengan model bahasa yang sudah menempati sebagian besar kartu — itulah seluruh argumennya, dan itu argumen yang nyata.
Sisa tabel itu adalah studi tentang di mana model-model kecil jebol secara tidak merata. Skor Typed Decision milik 0.8B adalah 77.35 versus 80.55 milik 4B — terpaut tiga poin pada seperlima jumlah parameter. Namun Jevbench-Original turun dari 98.61 ke 80.56 dan WildJailBreak runtuh dari 89.86 ke 64.48. Apa pun yang diukur oleh kedua suite itu — kartu tersebut tidak menyebutkannya, dan kartu tersebut sama sekali tidak memberikan definisi suite — keduanya adalah yang paling keras menghukum checkpoint kecil. Model yang bertahan pada satu sumbu tetapi terjun bebas pada dua sumbu lainnya bukanlah model yang lebih lemah secara merata. Itu adalah model dengan batas kompetensi yang spesifik, dan Anda tentu ingin tahu di mana beban kerja Anda berada sebelum mengerahkan armada ke sana.
Satu peringatan lagi tentang baris kalibrasi. ECE 0.8B sebesar 0.066 adalah angka terbaiknya — lebih baik daripada 0.095 milik Jev pada suite yang sama — sementara skor Brier-nya sebesar 0.530 lebih buruk daripada 0.358 milik Jev. Galat terkalibrasi dan galat probabilitas kuadrat rata-rata bukanlah pengukuran yang sama, dan tabel yang menunjukkan salah satunya tampak kuat dan yang lain tampak lemah memberi tahu Anda bahwa distribusinya berbentuk baik di dekat puncak keyakinannya dan lebih gemuk daripada seharusnya di antaranya. Jika sistem Anda memakai ambang pada keyakinan, perbedaan itu lebih penting daripada rata-ratanya.
Apa yang sebenarnya bisa Anda dapatkan dengan 1,71 GB
Jalur inferensi dalam model ini adalah pemberi skor, bukan generator, dan perbedaan biayanya bersifat struktural, bukan inkremental. Anda memberinya state bersama, skema pertanyaan bernama, dan secara opsional hingga delapan gambar. Setiap pertanyaan adalah salah satu dari tiga jenis: choice (salah satu dari kumpulan opsi terurut), score (skala ordinal, dikembalikan sebagai nilai harapan berbobot probabilitas), atau noul (biner tidak/ya). State, skema, dan kerangka JSON asisten yang lengkap dirender dengan satu placeholder per bidang, model menjalankan satu forward pass kausal, dan logit dibaca pada posisi tepat sebelum setiap placeholder. Softmax diambil hanya atas simbol kandidat yang diizinkan untuk bidang tersebut, kalibrasi yang telah di-fit dari checkpoint diterapkan, simbol dipetakan kembali ke nilai opsi Anda.
Tiga konsekuensi muncul dari hal itu. Tidak ada token keluaran dan karena itu tidak ada harga keluaran — sejuta keputusan tidak memerlukan biaya token sama sekali. Tidak ada loop decoding dan tidak ada kurung kurawal yang bisa terlupakan, jadi JSON yang cacat bukanlah mode kegagalan. Dan karena ruang jawaban tiap field disusun per permintaan, skema yang Anda ciptakan sore ini tidak perlu pelatihan ulang: tambahkan sebuah pertanyaan dan pilihannya menjadi simbol kandidat untuk field tersebut.
Batasannya dinyatakan dengan sama gamblangnya. Satu hingga enam belas, hingga 62 opsi masing-masing, hingga delapan gambar, dan batas default 8.192 token — dengan input yang melebihinya ditolak, bukan dipotong.Klausul terakhir itu adalah keputusan desain yang layak direnungkan, karena pemotongan senyap adalah cara sebuah pengklasifikasi diam-diam menjawab pertanyaan yang berbeda dari yang Anda ajukan. InternLM justru gagal secara mencolok, yang benar sekaligus jebakan operasional: sebuah untaian token ditambah skema ditambah gambar akan melampaui 8.192 lebih cepat dari yang Anda perkirakan, dan tidak ada akhir yang mulus saat itu terjadi.
Dan 1,71 GB itu memberi Anda hitungan ekonomi runtime yang bisa dikalikan. Pada 33,98 ms per keputusan, satu juta keputusan berarti 9,44 jam pada satu RTX 4090. Model 4B membutuhkan 12,3 jam untuk satu juta keputusan yang sama, dan mengorbankan sepuluh setengah poin akurasi sebagai ganti 7,37 GB yang tidak Anda miliki. Tidak satu pun dari angka itu mencakup biaya perangkatnya, dan tidak satu pun mencakup hal yang sering orang lupakan: Anda mengoperasikan sebuah layanan, dan tidak ada server di dalam repositori.

Qwen 3.8 bukanlah satu model, dan ujung murahnya adalah yang perlu diperhatikan.
Qwen 3.8, jika dianggap sebagai nama mandiri, adalah Qwen3.8-2.4T-A95B: inti sparse mixture-of-experts berparameter 2,4 triliun yang diterbitkan Alibaba sebagai bobot terbuka pada 12 Agustus 2026, dengan sekitar 95 miliar parameter aktif per token dan lisensi khusus, bukan Apache 2.0. Penyajian terkelola dari inti yang sama adalah Qwen3.8-Max, tersedia secara umum melalui API berbayar sejak 3 Agustus dan diperbarui sebagai snapshot bertanggal 2 September. Keduanya adalah satu otak yang dijual dengan dua cara, dan penyajian kedua adalah yang sebenarnya akan dipanggil oleh kebanyakan orang.
Berdasarkan angka independen, Artificial Analysis mengukur snapshot Qwen3.8-Max dari Qwen3.8-Max pada Indeks Kecerdasan 45,4 — peringkat kelima belas dari 145 model yang diindeks — dengan skor AA Coding 76,2 pada peringkat kesembilan dari 138, GPQA Diamond pada 92,8, Humanity's Last Exam pada 43,1, dan skor recall konteks panjang 80,3. Checkpoint terbuka tertinggal dari API; nilainya berada pada 39,9. Pada jendela playground tujuh hari kami, Qwen3.8-Max berada pada p50 2.578 ms dan p95 9.539 ms pada 55,5 token output per detik, dengan tingkat kesalahan 1,57%. Qwen3.8-Max dapat dipanggil di OrcaRouter dengan harga daftar penyedia dengan tambahan markup 0%, jadi harga Alibaba aktif di sisi kami pada hari yang sama, bukan pada siklus penagihan berikutnya.
Namun, varian dense itulah yang harus ditimbang terhadap checkpoint lokal 1.71 GB, karena ia adalah cara termurah untuk membeli kemampuan umum di keluarga ini. Qwen3.8-27B adalah Apache 2.0, membawa konteks asli 262.144 token, dan Qwen3.8-27B berada di $0.33 dan $2.40 per juta token di platform kami. Artificial Analysis Intelligence Index-nya adalah 33.7. Jumlah parameternya sekitar tiga puluh dua kali lipat Intern-Decision-0.8B, masih generatif, dan tetap merupakan instrumen yang salah untuk keputusan himpunan tertutup dalam volume besar — tetapi ia adalah pilihan menengah yang jujur, dan satu-satunya anggota perbandingan ini yang benar-benar murah dan benar-benar umum sekaligus.
Pemberi skor melawan generator, dinyatakan secara gamblang.
• Konteks — Qwen3.8-Max memiliki jendela 1.000.000 token. Intern-Decision-0.8B menolak apa pun di atas 8.192. Faktor 122, ditegakkan, bukan dipotong.
• Masukan — Qwen3.8-Max menerima teks, gambar, dan video. Intern-Decision-0.8B menerima teks dan hingga delapan gambar, dan token gambar dihitung terhadap anggaran 8.192 yang sama.
• Keluaran — Qwen3.8-Max menulis, bernalar, memanggil alat, dan mengeluarkan JSON saat diminta. Intern-Decision-0.8B tidak dapat menghasilkan paragraf, alasan, atau rencana. Ia hanya dapat memberi skor pada opsi yang sudah Anda pikirkan untuk dicantumkan.
• Biaya per panggilan — panggilan triase realistis dengan 800 token masukan dan 150 token keluaran menghabiskan sekitar $0.0025 pada Qwen3.8-Max, sebelum token penalaran apa pun, dan sisi keluarannya secara optimistis kecil karena ini adalah model penalaran. Sejuta panggilan semacam itu kira-kira $2,500. Intern-Decision-0.8B tidak memiliki harga token sama sekali: sejuta keputusan adalah 9,44 jam dari 4090 yang Anda miliki atau sewa.
• Latensi — 2.578 ms pada median di Qwen3.8-Max selama tujuh hari terakhir, termasuk jaringan dan antrean. 33,98 ms milik Intern-Decision-0.8B adalah forward pass murni pada kartu lokal dan bukan pengukuran yang sama; perbandingan yang jujur adalah satu orde besaran, bukan delapan puluh kali lipat.
• Bukti — setiap angka Intern-Decision-0.8B di sini dilaporkan oleh vendor pada harness milik InternLM sendiri dan tidak direproduksi oleh siapa pun, termasuk latensinya. Setiap angka Qwen 3.8 berasal dari Alibaba sendiri atau pengukuran Artificial Analysis, dan semuanya dilabeli secara terpisah di atas.
• Skor independen — Qwen3.8-Max memilikinya. Intern-Decision-0.8B tidak memiliki satu pun dari jenis apa pun, dan tidak ada penyedia inferensi yang menerapkannya.

Dua cara untuk menjalankan pipeline ini
Percabangan operasional lebih tajam daripada percabangan benchmark. Intern-Decision-0.8B adalah modul, bukan layanan. Tidak ada endpoint yang kompatibel dengan OpenAI, tidak ada server batching, tidak ada pemeriksaan kesehatan, tidak ada kebijakan percobaan ulang, dan tidak ada replika kedua kecuali Anda membuatnya sendiri. Ia dimuat dalam satu proses dan menjawab satu dict pada satu waktu, dan jika Anda memerlukan failover, Andalah failover-nya. Itu adalah deskripsi yang wajar tentang checkpoint penelitian 853 juta parameter yang diterbitkan tanpa catatan peluncuran, dan hal itu harus diperhitungkan ke dalam keputusan tersebut.
Separuh generatif dari pipeline yang sama adalah panggilan jaringan, dan panggilan jaringan adalah alasan router ada. Baik Qwen3.8-Max maupun Qwen3.8-27B dapat dijangkau di balik satu kunci yang kompatibel dengan OpenAI, dan failover otomatis berarti upstream yang terdegradasi tidak menjadi insiden Anda — layak disebutkan di sini karena tingkat kesalahan tujuh hari secara langsung Qwen3.8-Max di sisi kami adalah 1,57%, yang terbilang rendah sampai itu menjadi permintaan Anda. Pola yang masuk akal adalah pola yang selama ini secara diam-diam digambarkan oleh pasangan ini: jalankan penilai closed-set yang murah secara lokal karena cepat dan tidak memerlukan biaya per panggilan, dan tahap penalaran karena di situlah pemotongan harga, pergantian model, dan hal-hal aktual terjadi.
Dua hal yang tidak akan kami klaim. Intern-Decision-0.8B bukan salah satu rute kami dan tidak akan sampai InternLM menghostingnya di suatu tempat — kami tidak akan menyiratkan sebaliknya. Dan kami sama sekali tidak menghosting model InternLM saat ini, jadi tidak ada apa pun dalam artikel ini yang merupakan promosi untuk menjalankan subjek melalui kami.
Apa yang bisa mengubah jawabannya
Tiga pertanyaan terbuka, semuanya dapat dijawab dalam hitungan hari. Apakah InternLM menerbitkan repositori GitHub yang ditautkan oleh kartunya sendiri, beserta deskripsi tentang bagaimana bobot-bobot ini disetel? Apakah ada pos peluncuran yang menyusul checkpoint, yang mengubah push senyap menjadi rilis terdokumentasi dengan cerita deployment yang dinyatakan? Dan apakah ada pihak independen yang mereproduksi rata-rata 79.38 atau galat kalibrasi 0.066 pada perangkat keras yang bukan milik InternLM?
Sampai salah satunya hadir, pembacaan jujur atas Intern-Decision-0.8B singkat dan spesifik: ini adalah penilai closed-set termurah dalam keluarga yang terdiri dari tiga model, dengan footprint yang membuatnya muat di tempat yang tidak dapat dijangkau oleh saudaranya sendiri yang lebih cepat dan lebih akurat, diterbitkan tanpa pengumuman dan tanpa satu artefak yang akan memberi tahu Anda untuk apa model ini disetel. Jika keputusan Anda bersifat closed-set, jawaban Anda dapat dienumerasi dalam sebuah prompt, dan 1,6 GB adalah angka yang benar-benar menjadi penentu dalam deployment Anda, itu adalah pilihan yang tepat dan tidak ada yang setara dengannya pada ukuran itu. Jika jawaban Anda tidak dapat dienumerasi sebelumnya, atau state Anda berjalan lebih dari 8.192 token, atau Anda membutuhkan alasan yang dapat Anda tunjukkan kepada pemangku kepentingan, maka perbandingannya sudah dekat — dan model yang Anda inginkan bukanlah model dengan 853 juta parameter itu.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
