
Intern-Decision-2B vs Qwen 3.8: Satu Backbone, Dua Pekerjaan yang Sangat Berbeda
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 584 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 187 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Buka konfigurasi untuk internlm/Intern-Decision-2B dan konfigurasi untuk Qwen/Qwen3.5-2B secara berdampingan dan hampir tidak ada yang berbeda. Lapisan 24 yang sama, ukuran hidden 2.048 yang sama, 8 kepala query yang sama terhadap 2 kepala key-value, dimensi head 256 yang sama, batas atas embedding 262.144 posisi yang sama, kosakata 248.320 token yang sama, pola berulang yang sama dari tiga lapisan linear-attention berbanding satu lapisan full-attention. Intern-Decision-2B bukanlah arsitektur baru. Itu adalah tulang punggung tersebut dengan kemampuan menghasilkan teksnya dihapus dan keyakinannya dikalibrasi — dan pengurangan tunggal itulah yang membuat perbandingan terhadap Qwen3.8-Max, model unggulan 2,4 triliun parameter yang dirujuk oleh seluruh nama keluarga "Qwen 3.8" di ujung atas, lebih berharga daripada sekadar hitung mundur parameter.
Keduanya bukan pesaing dan pertarungan itu bukan kontes. Intern-Decision-2B adalah fine-tune Qwen3.5-2B dengan 2.213.241.664 parameter, diunggah ke Hugging Face pada 05:36 UTC tanggal 26 September 2026 di antara tiga saudara yang belum diumumkan, dan ia tidak mengeluarkan token: ia menerima suatu state dan pertanyaan bertipe, menjalankan satu forward pass kausal, membaca logit pada posisi placeholder tetap, dan mengembalikan distribusi terkalibrasi per field. Qwen3.8-Max adalah flagship yang dihosting Alibaba, sebuah model sparse mixture-of-experts dengan sekitar 95 miliar parameter aktif per token, jendela konteks multimodal 1 juta token, dan harga daftar $2.00 per juta token input dan $6.00 per juta token output. Yang satu adalah komponen. Yang lain adalah layanan. Pertanyaan yang berguna adalah di mana letak sambungan di antara keduanya dalam pipeline yang sudah Anda bayar.
Pengurangan, tepatnya
Apa yang diubah oleh decision tuning patut dinyatakan secara persis, karena itu memperjelas apa yang sudah dibawa model dasar.
Tugas ini dinamai di repositori sebagai pemodelan bahasa bertopeng autoregresif. Input asisten berisi kerangka JSON lengkap dengan satu token <decision> per bidang; simbol jawaban ground-truth hanya muncul di label, tidak pernah di input. Pelatihan menggunakan penyelarasan token berikutnya kausal biasa, di mana logit tepat sebelum sebuah penanda memprediksi jawaban bidang tersebut, dan semua bidang berbagi satu forward pass. Saat inferensi, logit dibatasi pada simbol jawaban token tunggal yang sah — A–Z, a–z, 0–9, yang menjadi asal batas 62 opsi — lalu di-softmax dan dipetakan kembali ke label Anda.
Jadi, mekanisme token berikutnya milik model dasar tetap utuh dan tidak dimodifikasi. Yang ditanamkan melalui pelatihan adalah preferensi untuk menempati salah satu dari sedikit posisi jawaban alih-alih melanjutkan kalimat, ditambah suhu spesifik checkpoint sebesar 2.100509348278 yang diestimasi dengan negative log-likelihood pada 1,728 kasus kalibrasi yang ditentukan dengan 1,693 kasus yang disisihkan. Kartu itu dengan jelas menyatakan bahwa generasi tidak menjadi opsi: API "melakukan penilaian kandidat terstruktur. API tidak memanggil generate() atau mengambil sampel teks bebas."
Repositori ini juga mencatat apa yang tidak disentuh oleh penyetelan: repositori tersebut "melakukan fine-tuning pada tulang punggung bahasa Qwen3.5 sambil membekukan menara visi dan proyektornya." Shard visi berukuran 612.517.440 byte pada 2B memiliki jumlah byte yang sama dengan checkpoint keputusan 4B, yang cocok untuk komponen yang diwarisi, bukan komponen yang dilatih. Jalur gambar berfungsi; hanya saja bukan itu yang menghabiskan anggaran lintasan keputusan.

Apa yang tidak dapat dilakukan oleh 2,2 miliar parameter, dan apa yang dilakukan oleh 2,4 triliun parameter sebagai gantinya
Semuanya terbagi berdasarkan satu sumbu: apakah jawaban Anda sudah ada sebagai daftar.
Intern-Decision-2B menjawab himpunan tertutup. Satu hingga enam belas pertanyaan, hingga 62 opsi per pertanyaan, hingga delapan gambar, semuanya di dalam anggaran 8.192 token yang ditolak mesin alih-alih dipotong. Dikembalikan sebagai probabilitas. Dengan rata-rata 33,28 ms per permintaan pada satu RTX 4090 dengan P95 33,55 ms, dan tidak ada yang ditagih per panggilan karena tidak ada output untuk ditagih.
Qwen3.8-Max menulis. Konteks 1 juta token, masukan teks, gambar, dan video, penalaran dengan mode berpikir, pemanggilan alat native, keluaran terstruktur, hingga 131.000 token keluaran pada build bertanggal 0902. Pada prinsipnya, ia juga dapat membuat keputusan perutean yang sama dengan yang dibuat oleh Intern-Decision-2B — Anda dapat memberinya prompt untuk memilih di antara opsi dan mengembalikan JSON. Ada tiga hal yang tidak beres ketika Anda melakukannya. Anda membayar token yang dihabiskannya untuk memutuskan. Anda mendapatkan string yang proses parsing-nya mungkin berhasil atau mungkin tidak. Dan angka di dalam string itu adalah apa pun yang dihasilkan sampler, bukan softmax yang dapat Anda beri ambang batas pada 0,8 dan bertindak berdasarkan itu.
Kedua pernyataan itu benar dan tidak saling meniadakan. Model unggulan berparameter 2,4 triliun ada karena sebagian besar masalah bukan himpunan tertutup. Pemberi skor berparameter 2,2 miliar ada karena subset yang memang demikian layak mendapatkan instrumen yang lebih murah.
Papan Skor

• Parameter — Intern-Decision-2B 2,213,241,664 dalam BF16 ditambah menara visi dan proyektor, sekitar 4.46 GB di disk; Qwen3.8-Max kira-kira 2.4 triliun total dengan sekitar 95 miliar aktif per token, dilayani bukan diunduh.
• Konteks — 8.192 token, ditolak di atas; 1.000.000 token dengan output maksimum 131.000 pada build 0902.
• Keluaran — probabilitas terkalibrasi dan argmax, tanpa teks yang dihasilkan; teks yang dihasilkan termasuk jejak penalaran.
• Modalitas masukan — teks ditambah hingga delapan gambar; teks, gambar, dan video.
• Biaya — tidak ada biaya per panggilan, dan Anda memiliki GPU-nya; $2,00 per juta token masukan, $6,00 per juta token keluaran, dengan pembacaan cache sebesar $0,25 dan penulisan cache sebesar $2,50.
• Bukti yang dipublikasikan — tabel vendor tujuh suite dengan rata-rata 84,68, Brier 0,437, dan ECE 0,100 pada 10.751 baris uji, tidak direproduksi oleh siapa pun di luar InternLM, pada checkpoint dengan satu suka dan nol unduhan; Artificial Analysis Intelligence Index sebesar 45,4 pada peringkat 15 dari 145 dan AA Coding index sebesar 76,2 pada peringkat 9 dari 138, keduanya diukur secara independen.
• Latensi — rata-rata 33,28 ms per permintaan pada satu RTX 4090, menurun seiring ditambahkannya batching; 2,655 detik P50 ke token pertama sebagaimana dilaporkan katalog, meningkat seiring beban.
Baris bukti tersebut tidak setara dan tidak boleh dicetak seolah-olah setara. Produk unggulan Alibaba memiliki skor indeks independen di belakangnya. Checkpoint InternLM memiliki tabel yang dibuat oleh para penulisnya sendiri, dan angka kalibrasinya khususnya harus dibaca sebagai niat yang terdokumentasi dengan baik sampai bertemu data pihak lain — terlebih lagi di sini, karena ukuran tertentu ini mencatat kesalahan kalibrasi yang diharapkan paling buruk dari ketiga model yang dirilis InternLM, 0,100 dibandingkan 0,066 untuk model yang berukuran setengahnya dan 0,065 untuk model yang hampir dua kali ukurannya.
Sambungan, dan cara menjalankannya
Pipeline yang masuk akal bukanlah pilihan antara keduanya, melainkan pemisahan: scorer menangani keputusan yang terenumerasi, dan model frontier menangani segala hal yang jawabannya bukan daftar. Triage dukungan yang mengarahkan ke salah satu dari enam tim dan menilai urgensi pada skala tiga poin tidak membutuhkan 95 miliar parameter aktif; ia membutuhkan probabilitas dan ambang batas. Jalur eskalasi yang pada akhirnya menulis balasan kepada pelanggan, itulah yang membutuhkannya.
Pemisahan itu memiliki bentuk operasional. Intern-Decision-2B tidak ada di OrcaRouter — halaman model kami untuknya mengembalikan 404 dan tidak ada rute yang dihosting di mana pun yang dapat kami temukan — jadi ia berjalan di perangkat keras Anda sendiri, yang berarti ia adalah komponen yang Anda operasikan dan pantau. Qwen3.8-Max adalah sebuah rute: satu kunci untuk 200-plus model, harga daftar penyedia diteruskan tanpa markup, yang berarti perubahan harga vendor pada model unggulan mencapai tagihan Anda pada hari yang sama saat diberlakukan. Menempatkan bagian pipeline yang dihosting di balik satu permukaan itu adalah yang menjaga bagian yang lebih murah tetap murah: scorer menjaga volume panggilan tetap rendah, dan model frontier hanya dijangkau untuk kasus-kasus yang benar-benar membutuhkannya.

Jika Anda masih mengevaluasi penilai skor mana yang cocok di slot itu — yang ini tidak memiliki evaluasi independen, dan kalibrasinya adalah yang terlemah di keluarganya sendiri — failover otomatis antar penyedia adalah cara untuk mencobanya pada jalur yang sudah memiliki alternatif yang berfungsi di belakangnya, alih-alih langsung menggantikan alternatif tersebut.
Vonis yang Jujur
Jika masalah Anda adalah keputusan atas sekumpulan jawaban yang dapat Anda enumerasi, dan state-nya muat dalam delapan ribu token, Intern-Decision-2B akan melakukannya dalam tiga puluh tiga milidetik tanpa biaya per panggilan, dan tidak ada model frontier yang akan mengalahkannya pada sumbu itu tidak peduli berapa banyak parameter yang Anda sewa. Lakukan kalibrasi Anda sendiri terhadapnya sebelum Anda bergantung pada keyakinan yang dilaporkannya.
Jika masalah Anda adalah hal lain — penalaran, konteks panjang, penggunaan alat, video, dokumen sejuta token, atau sekadar jawaban yang belum ditulis — Qwen3.8-Max bukan sekadar lebih baik. Ia satu-satunya di antara keduanya yang benar-benar dapat mengerjakan tugas itu.
Dan jika Anda belum dapat mengatakan mana dari keduanya yang Anda miliki, jawabannya mungkin adalah bahwa Anda memiliki keduanya, dalam pipeline yang sama, yang merupakan arsitektur yang sejak awal secara diam-diam diberitahukan oleh jumlah parameter kepada Anda.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
