
Intern-Decision-2B vs Laya: 2,2 Miliar Parameter Melawan 421 Juta, Keduanya Menolak Menuliskan Jawaban
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 584 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 187 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
internlm/Intern-Decision-2B dan convaiinnovations/laya adalah dua model paling mirip di ceruk model keputusan kecil, dan fakta paling berguna dari perbandingan ini adalah bahwa keduanya mencapainya melalui jalur yang berlawanan. Checkpoint 2.213.241.664 parameter milik InternLM membaca logit pada posisi tetap sebelum placeholder dan tidak pernah memanggil generate(). Checkpoint 421 juta parameter milik Convai memasukkan pertanyaan bertipe ke decision head di atas backbone ModernBERT-large dan mengembalikan probabilitas terkalibrasi dalam satu forward pass. Keduanya tidak menulis token, keduanya menjanjikan probabilitas, keduanya mencapai batas sekitar delapan ribu token masukan, dan yang lebih kecil berukuran lima kali lebih kecil serta kira-kira seribu kali lebih populer. Yang membedakan keduanya bukanlah kemampuan melainkan kemasan, dan kesenjangan kemasan itulah yang menentukan pembelian bagi sebagian besar pembaca.
Intern-Decision-2B muncul di Hugging Face pada 05.36 UTC, 26 September 2026, ukuran tengah dari tiga ukuran yang diunggah InternLM dalam empat puluh detik tanpa pengumuman, di-fine-tune dari Qwen/Qwen3.5-2B di bawah Apache-2.0. Laya pertama kali di-push pada 18 September 2026 dan sejak itu telah mengumpulkan 3.700-an suka, paket pip, server HTTP yang kompatibel dengan Jev, integrasi ONNX dan LangChain, serta notebook fine-tuning. Kontras dalam hal kematangan itulah artikelnya.
Premis yang mereka miliki bersama, dan mekanisme yang berbeda
Kedua kartu berpendapat bahwa jika masalah Anda adalah memilih di antara jawaban yang diketahui, menghasilkan prosa adalah operasi yang salah. Pernyataan Laya adalah "ia tidak pernah menghasilkan teks, jadi tidak ada yang perlu diurai dan tidak ada yang perlu dihalusinasi." Pernyataan Intern-Decision-2B adalah bahwa API-nya "melakukan penskoran kandidat secara terstruktur. Ia tidak memanggil generate() atau mengambil sampel teks bebas."
Mekanisme adalah titik di mana keduanya berpisah.
Laya adalah pengklasifikasi. Encoder ModernBERT-large (395M, bidirectional, sepenuhnya fine-tuned) memberi masukan ke kepala keputusan yang dilatih dari awal — dua lapisan transformer, penilai penanda opsi, dan kepala act/escalate — dengan total 421M. Opsi berbagi anggaran token tetap (head_max_len, 192 token pada checkpoint bahasa Inggris, 256 pada multibahasa), dan router mendeteksi skrip dan bahasa dalam waktu kurang dari setengah milidetik sebelum pass.
Intern-Decision-2B adalah model token berikutnya yang dilarang menjadi generator. Model ini memetakan opsi setiap pertanyaan ke simbol token tunggal A–Z, a–z, 0–9; merender kerangka JSON asisten lengkap dengan satu placeholder <decision> per bidang; menjalankan satu forward pass kausal; membaca logit tepat sebelum setiap placeholder; menerapkan softmax atas simbol yang sah untuk bidang tersebut; dan menerapkan suhu hasil fit sebesar 2.100509348278. Di bawahnya adalah Qwen3_5ForConditionalGeneration standar — 24 lapisan, tiga lapisan linear-attention berbanding satu lapisan full-attention, lapisan multi-token-prediction yang dipertahankan, batas embedding 262.144 posisi — ditambah menara visi dan proyektor.
Konsekuensi praktis dari perbedaan ini adalah kapasitas opsi. Anggaran tetap per opsi milik Laya runtuh pada ruang label yang luas; kartunya sendiri mendokumentasikan pertanyaan dengan 77 label yang mencetak skor 0,425 versus 0,870 milik TypeSafe Jev pada tugas yang sama, karena 77 opsi menerima sekitar tiga atau empat token masing-masing. Intern-Decision-2B menangani hingga 62 opsi per pertanyaan dan hingga enam belas pertanyaan, dan 62 bukanlah preferensi melainkan jumlah persis simbol satu token yang dapat ditangani kontraknya. Keduanya tidak nyaman setelah melewati beberapa lusin opsi; bentuk kegagalannya berbeda.

Papan Skor

• Parameter — Intern-Decision-2B 2.213.241.664 dalam BF16 ditambah menara visi dan proyektor, sekitar 4,46 GB di disk; Laya 421M, satu file safetensors 842 MB, dengan checkpoint multibahasa 644 MB yang terpisah.
• Batas atas input — 8.192 token untuk keduanya, keduanya menolak alih-alih memotong; perhatikan bahwa 8.192 milik Laya berlaku untuk laya-multilingual dan memerlukan max_len=8192, karena default yang disertakan adalah 1.024.
• Gambar — hingga delapan untuk Intern-Decision-2B, dihitung terhadap anggaran token yang sama; tidak ada jalur multimodal untuk Laya.
• Kecepatan — 33,28 ms rata-rata, 33,15 ms P50, 33,55 ms P95 per permintaan pada satu RTX 4090 untuk Intern-Decision-2B; Laya melaporkan sekitar 33 ms per permintaan dan 103–332 pertanyaan per detik secara batch pada satu T4.
• Bahasa — Intern-Decision-2B sama sekali tidak membuat klaim multibahasa; Laya melakukan perutean lintas 100+ bahasa, melaporkan 45 dari 51 bahasa yang dijadikan tolok ukur dapat digunakan pada lebih dari tiga kali tingkat acak, dan 0,451 pada intent MASSIVE di tiga belas bahasa non-Inggris dibandingkan 0,306 untuk checkpoint khusus bahasa Inggrisnya.
• Akurasi zero-shot — Intern-Decision-2B mencatat rata-rata 84,68 pada tujuh suite vendor dengan Brier 0,437 dan ECE 0,100, semuanya belum direproduksi; checkpoint bahasa Inggris dasar Laya mencetak 0,362 pada tolok ukur typed-decisions 2.000 keputusan, yang oleh kartunya sendiri ditandai sebagai berada di bawah garis kelas mayoritas 0,461.
• Pengemasan — sebuah checkpoint, sebuah inference.py dan GitHub yang baru diterbitkan dengan pelatihan dan evaluasi, versus pip install laya, server HTTP yang kompatibel dengan Jev, jalur cepat ONNX Runtime dan TileLang, serta notebook fine-tuning yang berjalan di GP tingkat gratis.
Perbandingan yang paling adil bukanlah yang disusun oleh lembar spesifikasi.
Menempatkan 84,68 di samping 0,362 hampir merupakan ketidakjujuran, dan ada baiknya menjelaskan alasannya daripada membiarkan angka-angka itu berdiri sendiri.
0,362 milik Laya adalah checkpoint dasar yang diukur secara zero-shot pada tolok ukur yang tidak disetel untuknya. Kartu modelnya sendiri menyimpulkan secara eksplisit: "Laya adalah basis yang cepat untuk dispesialisasi, bukan mesin keputusan zero-shot." Setelah di-fine-tune pada split pelatihan milik tolok ukur itu sendiri, ia mencapai 0,766, melampaui plafon guru 0,735 dan mengalahkan 0,727 yang dipublikasikan TypeSafe Jev pada keputusan yang sama. Sementara itu, 84,68 milik Intern-Decision-2B adalah rata-rata vendor atas tujuh suite yang set pengujiannya bukan yang dikutip Laya, dihasilkan oleh lab yang membangun model tersebut, tanpa ada pihak ketiga yang menjalankannya — checkpoint itu menunjukkan satu like dan nol unduhan. Membandingkan hasil yang di-fine-tune dengan hasil zero-shot, atau rata-rata vendor dengan papan peringkat independen, bukanlah sebuah perbandingan. Itu adalah dua pengukuran berbeda yang memakai jenis huruf yang sama.
Apa yang benar-benar sebanding: keduanya kecil, keduanya murah untuk dijalankan, dan keduanya tidak dapat di-fine-tune ke domain Anda. Repositori yang diterbitkan InternLM pagi ini membuat bagian terakhir itu jauh lebih mudah daripada kemarin, karena repositori itu menyertakan peluncur pelatihan, objektif masked-next-token, bundel terverifikasi hash berisi 10.751 baris uji di tujuh suite, serta skrip penyesuaian suhu dan replay. Lab yang menyertakan generator kalibrasi deterministik dan menegaskan bahwa replay mengubah nol keputusan sedang mengundang persis jenis adaptasi yang direkomendasikan kartu Laya.
Bagaimana Anda sebenarnya akan menyebut salah satu dari keduanya?
Tidak satu pun model berada di OrcaRouter. Halaman model OrcaRouter untuk Intern-Decision-2B mengembalikan 404 dan tidak ada rute Laya juga; tidak ada apa pun di sini yang merupakan klaim ketersediaan. Intern-Decision-2B berarti mengunduh checkpoint dan menjalankan engine bawaannya di GPU Anda sendiri. Laya berarti pip install laya dan, jika Anda menginginkan antarmuka yang kompatibel dengan Jev, laya-serve pada POST /v1/systemone.
Pertanyaan berbentuk Orchestrator yang ada di baliknya adalah apakah Anda menginginkan antarmuka operasional kedua untuk pemberi skor. Laya dirancang untuk disematkan — bentuk permintaan dan respons yang sama dengan TypeSafe Jev, sehingga klien yang sudah ada cukup mengubah URL dasar dan tidak ada yang lain. Intern-Decision-2B dirancang untuk direproduksi, dan saat ini dibutuhkan sekitar satu hari kerja penyiapan lingkungan sebelum keputusan pertama kembali. Jika keputusan himpunan tertutup yang Anda buat bentuknya mirip dengan salah satu dari ini, alternatif terhosting yang dijadikan tolok ukur oleh kedua kartu adalah TypeSafe Jev 1.13, yang memang memiliki rute: $0,042 per juta token masukan, konteks 65K, dan P50 waktu-ke-token-pertama sebesar 178 ms, dapat dijangkau dengan kunci yang sama seperti 200+ model lainnya dengan harga daftar penyedia diteruskan pada markup 0%.

Di mana masing-masing unggul
Laya menang dalam segala hal operasional. Paket pip versus unduhan checkpoint. Router untuk lebih dari seratus bahasa versus tanpa klaim multibahasa. Throughput batch yang diukur dalam ratusan pertanyaan per detik versus angka per permintaan tanpa dukungan batching. Dua tahun kekuatan ekosistem — ONNX, TileLang, LangChain, MCP — versus repositori yang baru dua jam bersifat publik.
Intern-Decision-2B unggul dalam tiga hal yang sempit. Model ini menerima gambar, yang tidak dilakukan Laya. Model ini tidak membawa utang fine-tuning: angka 84.68-nya adalah klaim vendor zero-shot, sedangkan angka utama Laya, 0.766, berasal dari checkpoint yang di-fine-tune pada split pelatihan milik benchmark itu sendiri. Dan model ini didokumentasikan dengan kit reproduksi — bundel evaluasi yang dapat diverifikasi dan stack pelatihan publik — yang lebih bernilai daripada satu baris papan peringkat bagi siapa pun yang harus membenarkan model tersebut kepada orang lain.
Hasil imbang adalah premisnya. Keduanya menolak untuk menghasilkan, keduanya memberikan probabilitas yang bisa Anda tetapkan ambang batasnya, dan keduanya berada di bawah panjang masukan tempat sebagian besar dokumen nyata berada. Jika keadaan Anda berupa tiket, email, atau formulir, keduanya bisa dipakai dan Laya akan membawa Anda ke sana lebih cepat. Jika keadaan Anda memiliki tangkapan layar terlampir atau organisasi Anda membutuhkan reproduksi yang dapat diaudit, checkpoint tengah InternLM adalah yang menjawab keberatan spesifik itu — dan menurut angka InternLM sendiri, ia adalah yang paling tidak terkalibrasi dengan baik di antara tiga saudaranya, pada ECE 0.100 versus 0.066 dan 0.065, jadi sesuaikan temperatur Anda sendiri sebelum Anda memercayai tingkat keyakinan yang dilaporkannya.
