Kartu judul yang dihasilkan bertuliskan 'Intern-Decision-2B vs Gemma 4 12B', dengan subjudul '8.192 token melawan 256.000', dengan lencana 'penilai yang menolak' dan 'generalis yang menulis', dengan logo OrcaRouter dikompositkan di sudut.
Guides & Insights

Intern-Decision-2B vs Gemma 4 12B: Batas 8.192 Token Berhadapan dengan Jendela 256K

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Misalkan hal yang perlu dinilai adalah berkas klaim asuransi empat puluh halaman. internlm/Intern-Decision-2B akan menolaknya. Bukan memotongnya, bukan meringkasnya — menolaknya, karena mesin inferensi bawaan mendeklarasikan DecisionEngine(max_length=8192) dan kartu model menyatakan dengan bahasa yang jelas bahwa masukan yang terlalu besar "ditolak tanpa pemotongan." google/gemma-4-12B-it — Gemma 4 12B Unified — akan menerima dokumen yang sama, ditambah foto hasil pemindaian yang distaples padanya, ditambah rekaman panggilan telepon, dan menuliskan jawaban untuk Anda. Kontras itulah keseluruhan perbandingannya, dan hampir tidak ada hubungannya dengan jumlah parameter — 2.213.241.664 versus 11.959.730.224 — yang akan diutamakan oleh pembacaan lembar spesifikasi.

Intern-Decision-2B adalah yang di tengah dari tiga checkpoint keputusan yang diunggah InternLM ke Hugging Face pada 26 September 2026 tanpa pengumuman, di-fine-tune dari Qwen/Qwen3.5-2B dan dilisensikan Apache-2.0 dengan ketentuan Qwen tetap disertakan. Gemma 4 12B Unified adalah model multimodal tanpa encoder milik Google DeepMind dari Mei 2026, sistem any-to-any yang menerima teks, gambar, audio, dan video serta menghasilkan teks dalam jendela 256.000 token dalam lebih dari 140 bahasa. Salah satunya adalah pemberi skor. Yang lainnya adalah generalis yang kebetulan bisa memberi skor dengan buruk jika Anda memberinya prompt dengan cermat. Memilih di antara keduanya bukanlah pertanyaan tentang tolok ukur, melainkan pertanyaan tentang bentuk jawaban Anda yang sudah ada.

Di mana keduanya sebenarnya tidak dapat dibandingkan

Ada baiknya bersikap terus terang soal ini sebelum membahas angka-angkanya, karena pertemuan ini mengundang kesan simetri yang palsu.

Intern-Decision-2B tidak menghasilkan token. Model ini menerima sebuah state, satu hingga enam belas pertanyaan bernama dengan hingga 62 opsi masing-masing, dan secara opsional hingga delapan gambar; merender kerangka JSON asisten dengan satu placeholder <decision> per field; menjalankan satu forward pass kausal; membaca logits pada posisi tepat sebelum setiap placeholder; melakukan softmax hanya atas simbol legal field tersebut; dan menerapkan temperature hasil fitting sebesar 2.100509348278. Outputnya adalah distribusi terkalibrasi dan argmax per field. Kartu model tersebut menyatakan hal negatifnya secara terang-terangan: "API ini melakukan penilaian kandidat terstruktur. API ini tidak memanggil generate() atau mengambil sampel teks bebas."

Gemma 4 12B menghasilkan. Semua yang dilakukannya — penalaran dengan pemikiran yang dapat dikonfigurasi, pemanggilan fungsi, OCR, pemahaman bagan, pengenalan ucapan, cakupan 140 bahasa — berjalan melalui loop dekode atas kosakata berisi 262.144 entri. Mintalah keputusan perutean dengan probabilitas dan Anda akan mendapatkan prosa yang memuat sebuah angka, dan angka itu akan menjadi apa pun yang dihasilkan sampler, bukan softmax atas kumpulan opsi Anda.

Jadi, pertanyaan praktisnya bukanlah "mana yang lebih akurat". Melainkan "apakah jawaban saya sudah merupakan himpunan tertutup?" Jika ya, 12B adalah cara yang boros untuk memilih dari sebuah daftar. Jika tidak, Intern-Decision-2B tidak dapat membantu Anda sama sekali pada tingkat akurasi apa pun.

Batas atas input adalah garis paling tajam di antara keduanya

Inilah dimensi yang harus ditimbang di atas semua yang lain, karena hal ini menghasilkan kegagalan total, bukan kegagalan yang terdegradasi.

• Panjang input — Intern-Decision-2B menerima 8.192 token dan menolak apa pun yang lebih panjang, dengan tegas; Gemma 4 12B menerima 256.000 token dan, pada kartu milik Google sendiri, mencetak skor 43,4% pada MRCR v2 eight-needle di 128k.

• Gambar — hingga delapan untuk Intern-Decision-2B, dan diperhitungkan terhadap anggaran 8.192 token yang sama; rasio aspek dan resolusi variabel untuk Gemma 4 12B, dengan input teks dan gambar berselang-seling dalam urutan apa pun.

• Modalitas yang disertakan — teks dan gambar untuk satu; teks, gambar, audio, dan video untuk yang lain.

• Bahasa — tidak ada klaim multibahasa yang dibuat di mana pun dalam dokumentasi Intern-Decision; Gemma 4 mencakup 140+ bahasa yang telah dilatih sebelumnya dengan skor multibahasa yang dievaluasi sebesar 83,4 pada MMMLU untuk versi 12B.

• Keluaran — distribusi jawaban JSON bertipe untuk satu; teks yang dihasilkan untuk yang lain.

Batas 8.192 bukanlah angka sembarangan, dan itulah yang membuatnya sulit diakali. Objective keputusan membaca satu logit pada posisi tetap per field, sehingga prompt harus memuat state, skema, dan kerangka lengkap dalam satu kali jalan; tidak ada strategi chunking yang mempertahankan kontrak. Tiket, email, state JSON pendek, satu atau dua tangkapan layar — itulah pusat desainnya. Dokumen yang memerlukan retrieval adalah dokumen yang tidak ditujukan untuk model ini.

Berapa biaya masing-masing untukmu, dihitung dengan jujur

Intern-Decision-2B tidak memiliki endpoint yang dihosting dan tidak memiliki penyedia. Halaman model OrcaRouter untuknya mengembalikan 404, dan tidak ada apa pun dalam artikel ini yang merupakan klaim ketersediaan. Memanggilnya berarti mengunduh sekitar 4,46 GB repositori — shard bahasa 3,76 GB, menara visi 612,5 MB, proyektor 50,3 MB — dan menjalankan inference.py di samping bobot dalam lingkungan Python 3.12 dengan torch 2.9.1 dan transformers 5.14.1, pada GPU yang Anda bayar, terlepas dari apakah ia sedang menilai keputusan atau tidak.

Itu bukan kerugian dalam setiap kasus, dan hitung-hitungannya layak dilakukan daripada sekadar berasumsi. Dengan rata-rata 33,28 ms per permintaan pada satu RTX 4090, menurut pengukuran InternLM sendiri, Intern-Decision-2B yang dihosting secara lokal tidak menagih apa pun per keputusan. Generalist yang dihosting menagih per token, termasuk untuk token yang dihabiskan untuk berpikir sebelum menjawab. Pada skala volume, scorer yang sudah Anda miliki adalah instrumen yang lebih murah — biayanya adalah GPU dan rekayasa, bukan panggilan itu.

Gemma 4 12B Unified juga tidak ada di katalog kami; jika Anda menginginkannya, Anda harus mengambil sendiri 11,96 miliar parameter BF16 dan menyajikannya sendiri. Yang benar-benar tersedia di katalog kami untuk rute Gemma 4 adalah dua ukuran lainnya, dan harganya murah: Gemma 4 26B A4B seharga $0,06 per juta token masukan dan $0,33 per juta token keluaran, serta Gemma 4 31B seharga $0,13 dan $0,38, keduanya terdaftar dengan konteks 262.144 token dan waktu-ke-token-pertama P50 yang ditunjukkan katalog sebesar 1,73 detik. Jika masalah Anda ternyata adalah penalaran umum, bukan keputusan himpunan tertutup, itulah yang perlu dibandingkan dengan penilai yang dioperasikan secara lokal — dua model lagi pada satu kunci, harga daftar penyedia diteruskan tanpa markup, dan failover otomatis sehingga model yang masih Anda evaluasi tidak pernah menjadi satu-satunya titik kegagalan dalam jalur produksi.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

Papan skor, dengan catatan yang terlampir.

• Parameter — Intern-Decision-2B 2,213,241,664 dalam BF16 ditambah menara visi dan proyektor; Gemma 4 12B Unified 11,959,730,224 dalam BF16.

• Konteks — 8.192 token, ditolak di atas, versus 256.000 token.

• Keluaran — probabilitas terkalibrasi dan sebuah argmax, tanpa teks; teks yang dihasilkan, satu token setiap kali.

• Modalitas — teks ditambah hingga delapan gambar versus teks, gambar, audio, dan video sebagai masukan, teks sebagai keluaran.

• Bukti yang diterbitkan — tabel vendor tujuh suite dengan rata-rata 84,68, skor Brier 0,437, dan ECE 0,100, tidak direproduksi oleh siapa pun di luar lab; kartu evaluasi Google dengan MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 tanpa alat 77,5%, dan LiveCodeBench v6 72,0, plus pencantuman independen pada Artificial Analysis Intelligence Index sebesar 14,2.

Adopsi — satu suka dan nol unduhan pada checkpoint 2B dibandingkan dengan keluarga yang telah beredar sejak Mei dengan kuantisasi, fine-tune, dan turunan yang jumlahnya mencapai ratusan.

Bacalah baris-baris bukti itu secara asimetris, karena memang begitulah keadaannya. Angka-angka Google telah diindeks dan direproduksi secara independen oleh pihak ketiga; angka InternLM belum pernah dijalankan oleh siapa pun di luar lab, dan angka kalibrasinya khususnya harus diperlakukan sebagai niat yang terdokumentasi dengan baik sampai ia bertemu dengan set uji asing. Ringkasan yang jujur bukanlah bahwa tabel vendor itu salah. Melainkan bahwa kedua kolom itu tidak membawa bobot pembuktian yang sama, dan perbandingan yang mencetak 84.68 di samping 77.2 tanpa mengatakan hal itu menyesatkan pembacanya.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

Apa yang harus dilakukan dengan ini

Pilih Intern-Decision-2B ketika keputusan benar-benar sudah tertutup, keadaannya cukup muat dalam delapan ribu token, Anda menginginkan probabilitas yang bisa Anda beri ambang ketimbang paragraf yang harus Anda uraikan, dan Anda memiliki perangkat keras serta kemauan untuk mengoperasikan checkpoint yang belum didukung siapa pun. Ukuran menengah ini secara khusus membawa kalibrasi terbitan terlemah di antara ketiga model yang dirilis InternLM — ECE 0.100 versus 0.066 untuk model yang setengah ukurannya dan 0.065 untuk model yang hampir dua kali ukurannya — jadi jika Anda memilih di dalam keluarga ini, 2B adalah model yang perlu Anda pasang suhu sendiri padanya, bukan model yang bisa dipercaya langsung dari kotaknya.

Pilih Gemma 4 12B — atau lebih praktisnya, salah satu dari dua ukuran Gemma 4 yang benar-benar kami rutekan — ketika input lebih panjang dari satu halaman, ketika melibatkan audio atau video atau bahasa selain Inggris, ketika jawabannya harus dijelaskan dan bukan sekadar dipilih, atau ketika Anda tidak ingin memiliki stack inferensi. 12B adalah yang terkecil di antara model Gemma 4 dengan audio native; 26B A4B mengaktifkan sekitar empat miliar parameter per token dan merupakan cara termurah untuk masuk ke keluarga ini.

Dan jika yang sebenarnya Anda punya adalah masalah penskoran yang disertai dokumen panjang, tak satu pun dari ini adalah instrumen yang tepat: itu adalah masalah pengambilan yang menyamar sebagai artikel perbandingan.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.