
Intern-Decision-4B vs Laya: Dua Model yang Menolak Menulis Jawaban, Ukurannya Terpaut Sepuluh Kali Lipat
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 592 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 187 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Ada satu baris di kartu model Intern-Decision-4B yang berbunyi "Laya — 57.77". Siapa pun yang pernah membaca dokumentasi Laya sendiri akan mengenali arti angka itu: convaiinnovations/laya adalah model keputusan non-autoregresif dengan 421 juta parameter, dan 57.77 adalah rata-rata yang diperolehnya saat digunakan secara zero-shot pada benchmark milik orang lain. Kartu modelnya sendiri menyatakan hal yang sama dengan lebih blak-blakan — checkpoint dasarnya berada di bawah baseline kelas mayoritas pada benchmark typed-decisions, yaitu 0.362 berbanding 0.461. Sementara itu internlm/Intern-Decision-4B adalah model dengan 4,54 miliar parameter yang dibangun untuk pekerjaan yang persis sama: ambil sebuah state dan serangkaian pertanyaan bertipe, jalankan satu forward pass, kembalikan probabilitas terkalibrasi, tidak pernah menghasilkan token. Taruhan arsitektural yang sama, bentuk keluaran yang sama, lisensi Apache-2.0 yang sama, sepuluh kali lipat jumlah parameter — dan salah satunya adalah base untuk di-fine-tune sementara yang lain mengklaim dirinya sebagai mesin zero-shot yang sudah jadi.
Mereka sepakat tentang premisnya, dan itulah bagian yang langka.
Kedua kartu tersebut menyampaikan argumen yang sama, dan hal itu perlu dinyatakan karena sebagian besar industri berpendapat sebaliknya. Jika masalah Anda adalah memilih di antara sekumpulan jawaban yang telah diketahui, menghasilkan prosa adalah operasi yang salah: Anda membayar untuk token yang Anda buang, Anda memerlukan parser, dan Anda mendapatkan penjelasan yang tidak Anda minta alih-alih probabilitas yang bisa Anda tetapkan ambangnya. Kartu Laya menyatakannya sebagai "ia tidak pernah menghasilkan teks, jadi tidak ada yang perlu diuraikan dan tidak ada yang bisa dihalusinasikan." Kartu Intern-Decision-4B menyatakan API-nya "melakukan penilaian kandidat secara terstruktur. Ia tidak memanggil generate() atau mengambil sampel teks bebas."
Mekanisme-mekanisme ini berbeda dengan cara yang mendidik. Laya memasukkan pertanyaan bertipe ke head klasifikasi dan mengembalikan jawaban bertipe dengan probabilitas terkalibrasi dalam satu forward pass, dengan lapisan perutean yang mendeteksi skrip dan bahasa dalam waktu kurang dari setengah milidetik sebelum pass tersebut. Intern-Decision-4B memetakan opsi setiap pertanyaan ke simbol token tunggal, merender kerangka JSON asisten dengan satu placeholder per bidang, membaca logits tepat sebelum setiap placeholder, dan melakukan softmax hanya atas simbol yang diizinkan untuk bidang tersebut. Pendekatan Laya adalah masalah klasifikasi; pendekatan InternLM adalah masalah token berikutnya yang tidak dibiarkannya menjadi masalah generasi.

Perbedaan ukuran, dan apa yang didapat karenanya
Meminta dua model mengerjakan tugas yang sama pada 421M dan 4,54B parameter menghasilkan hasil yang dapat Anda prediksi, lalu sebuah kejutan.
Bagian yang diprediksi adalah kemampuan pada pertanyaan sulit. Intern-Decision-4B rata-rata 90,02 pada tujuh set evaluasi dengan skor Brier 0,347 dan galat kalibrasi yang diharapkan 0,065 dalam pengukuran InternLM sendiri, dan berjalan 44,16 ms rata-rata per kueri pada satu RTX 4090. Checkpoint dasar bahasa Inggris Laya memiliki akurasi 0,362 pada benchmark typed-decisions 2.000 keputusan, yang oleh kartu modelnya sendiri ditandai sebagai di bawah garis kelas mayoritas 0,461 dan hanya sedikit di atas baseline acak 0,318. Ketika checkpoint yang sama di-fine-tune pada split pelatihan benchmark itu sendiri, angkanya melonjak menjadi 0,766. Kartu Laya menarik kesimpulannya sendiri: "Laya adalah basis yang cepat untuk dispesialisasi, bukan mesin keputusan zero-shot."
Yang mengejutkan adalah model yang lebih kecil menang langsung di dua dimensi. Kecepatan: Laya menjawab 103 hingga 332 pertanyaan per detik dalam batch pada satu T4, dan kartu modelnya menempatkannya sekitar enam hingga delapan kali lebih cepat daripada TypeSafe Jev pada angka p50 236–276 ms yang diukur secara independen yang dikutipnya. Parameter sepuluh kali lebih banyak tidak berarti throughput sepuluh kali lebih tinggi di arah sebaliknya — 44,16 ms milik Intern-Decision-4B adalah per kueri pada 4090 tanpa publikasi soal batching. Dan bahasa: Laya melaporkan 45 dari 51 bahasa yang diuji dapat digunakan pada lebih dari tiga kali tingkat acak, dengan skor routed 0,451 pada intent MASSIVE dalam tiga belas bahasa non-Inggris dibandingkan 0,306 untuk checkpoint khusus bahasa Inggrisnya. Intern-Decision-4B sama sekali tidak mengklaim kemampuan multibahasa.
Papan Skor
• Parameter — 4,54B BF16 untuk Intern-Decision-4B, menara teks ditambah menara visi ditambah proyektor; 421M untuk Laya, satu stack ringkas kelas encoder.
• Batas input — 8.192 token untuk keduanya, dan keduanya menolak alih-alih memotong; perhatikan bahwa 8.192 milik Laya berlaku untuk checkpoint multibahasa, yang default bawaannya adalah 1.024.
• Multiplisitas — Intern-Decision-4B menerima 1 hingga 16 pertanyaan dan hingga 62 opsi per pertanyaan, dan 62 bukan angka sembarangan: itu tepat jumlah simbol token tunggal yang dapat dialamatkan oleh kontrak inferensinya. Laya juga menerima beberapa pertanyaan bertipe, tetapi kartu modelnya mendokumentasikan keruntuhan tajam setelah sekitar 50 opsi, di mana pertanyaan dengan 77 label hanya mendapat anggaran tiga atau empat token per label dan akurasi turun menjadi 0,425.
• Gambar — hingga delapan untuk Intern-Decision-4B, dihitung terhadap anggaran 8.192 token; tidak ada jalur multimodal untuk Laya.
• Kalibrasi — Intern-Decision-4B menyertakan suhu hasil fitting sebesar 1.99241824 yang dipilih melalui minimisasi NLL pada 1.728 kasus, dan melaporkan ECE 0.065 pada suite miliknya sendiri; Laya dirilis dengan terlalu percaya diri, dan kartunya menyatakan bahwa penyetelan ulang satu suhu per jenis pertanyaan dan jumlah opsi mengubah ECE rata-rata dari 0.466 menjadi 0.081.
• Postur zero-shot — checkpoint final yang mengklaim rata-rata 90,02 dibandingkan dengan basis terdokumentasi yang skornya berada di bawah garis kelas mayoritas.
• Latensi — rata-rata 44,16 ms, median 44,03 ms pada satu RTX 4090, dibandingkan dengan 103 hingga 332 pertanyaan per detik yang diproses secara batch pada satu T4.
• Bahasa — tidak ada klaim yang dipublikasikan yang bertentangan dengan 45 dari 51 bahasa yang dapat digunakan saat dirutekan.
• Lisensi — Apache-2.0 dengan lisensi Qwen hulu yang dipertahankan terhadap Apache-2.0 yang secara eksplisit ditandai untuk penggunaan komersial.

Dua kartu, dua gagasan yang sangat berbeda tentang pengungkapan
Di sinilah perbandingan berhenti menjadi sekadar lembar spesifikasi dan berubah menjadi penilaian subjektif, karena kedua vendor mendokumentasikan model mereka dengan gaya yang saling berlawanan.
Kartu milik Laya menerbitkan kegagalannya sendiri secara rinci. Kartu itu melaporkan bahwa checkpoint bahasa Inggris mencetak akurasi 0,000 pada bahasa Khmer dengan keyakinan 0,952 — yakin meski salah, yang membuat gating keyakinan tidak berguna di sana. Kartu itu melaporkan bahwa action.act_probability tidak membawa sinyal yang dapat digunakan, menunjukkan nilai 1,0 untuk hampir setiap input dengan AUROC 0,30 pada 396 keputusan berlabel, dan menyarankan Anda untuk melakukan gating pada keyakinan sebagai gantinya, yang mencapai 0,77 pada item yang sama. Kartu itu menyebut pertanyaan skor ordinal sebagai "primitif terlemah", mengutip 0,372 pada SST-5. Kartu yang memberi tahu Anda keluaran mana miliknya sendiri yang harus diabaikan sedang melakukan sesuatu yang tidak dicoba oleh sebagian besar vendor.
Kartu Intern-Decision-4B memuat tabel yang bersih dan tanpa kasus kegagalan. Catatan peringatannya nyata dan berperan penting — bagian kalibrasi secara tidak biasa eksplisit menyatakan bahwa kolom "sebelum" dalam pilotnya bukanlah yang akan dilihat pengguna mana pun, dan bahwa label suite pengujian tidak digunakan untuk memilih temperature — tetapi bagian evaluasinya berisi tujuh kemenangan dan tanpa pengakuan. Kartu itu juga memuat baris untuk lima sistem pesaing yang dijalankan InternLM pada harness milik InternLM, termasuk baris Laya yang membuka artikel ini. Angka-angka itu bukan angka milik proyek-proyek tersebut sendiri, dan membacanya sebagai demikian akan menjadi kesalahan.
Jadi dasar sumber untuk pertarungan ini asimetris sedemikian rupa sehingga menguntungkan model yang lebih kecil: bukti Laya mencakup cacat yang didokumentasikannya sendiri, sedangkan bukti Intern-Decision-4B belum pernah berhadapan dengan test set yang tidak dipilih oleh penulisnya sendiri.
Bentuk masalah mana yang cocok untuk masing-masing
Dengan state terstruktur yang pendek dalam bahasa Inggris, kumpulan jawaban tertutup, dan kebutuhan akan probabilitas yang dapat dipercaya, Intern-Decision-4B adalah objek yang secara di atas kertas lebih mampu dan secara praktik lebih mahal — empat shard safetensors, PyTorch 2.9.1 dan Transformers 5.14.1 di bawah Python 3.12, mesin residen, dan wrapper yang Anda tulis sendiri jika menginginkan endpoint HTTP. Dengan keputusan perutean atau guardrail bervolume tinggi di lusinan bahasa yang throughput menjadi kendala pengikatnya, Laya adalah bentuk yang lebih baik: pip install laya, model 421M, dan kartu yang sudah memberi tahu Anda untuk melakukan fine-tuning sebelum memercayai probabilitasnya.
Satu hal yang kedua kartu ini sepakati adalah bahwa tidak satu pun model boleh dipercaya secara zero-shot tanpa memeriksa kalibrasi pada data Anda sendiri — Laya karena checkpoint dasarnya hampir setara dengan tebakan acak pada jenis keputusan yang tidak dikenal, Intern-Decision-4B karena ECE 0,065-nya berasal dari suite yang disusun oleh penulisnya sendiri.
Apa yang diubah dan tidak diubah oleh router di sini
Tidak satu pun dari model ini ada dalam katalog OrcaRouter, dan ini layak dikatakan secara terus terang daripada disiratkan sebaliknya: halaman model kami mengembalikan 404 untuk Intern-Decision-4B maupun Laya, dan keduanya bukan rute yang dapat Anda panggil hari ini. Apa artinya bagi kedua proyek itu tidak sama. Lisensi Apache-2.0 milik Laya dengan tag penggunaan komersial berarti hambatannya semata-mata soal pengemasan — ini adalah paket Python lokal dengan jejak kecil, yang merupakan jenis hal yang masuk akal untuk dapat dilayani. Hambatan Intern-Decision-4B juga soal pengemasan, tetapi bobot BF16 4,54B dan plafon penolakan 8.192 tokennya menjadikannya komponen, bukan layanan.
Di sisi jauh keputusan, di situlah OrcaRouter benar-benar membantu. Jika masalah keputusan terstruktur Anda ternyata membutuhkan langkah penalaran, model-model umum yang dapat melakukannya tersedia dengan satu kunci untuk lebih dari 200 model, dengan harga daftar penyedia diteruskan pada markup 0% dan failover otomatis antar penyedia — jadi model yang Anda pasangkan dengan penilai hanya berjarak satu endpoint, bukan kontrak kedua.
Versi singkatnya
Kedua proyek ini sampai pada kesimpulan yang sama tentang bagaimana keputusan seharusnya dibuat, lalu berbeda dalam hampir segala hal lainnya. Laya bertaruh bahwa 421M parameter, perutean bahasa yang ketat, dan kejujuran tanpa kompromi tentang cacatnya sendiri menghasilkan basis cepat yang tinggal Anda spesialisasikan. Intern-Decision-4B bertaruh bahwa parameter sepuluh kali lipat dan kontrak penskoran token tunggal yang dirancang dengan cermat menghasilkan mesin zero-shot yang sudah jadi. Eksperimen yang menentukan adalah eksperimen yang belum pernah dijalankan secara publik oleh keduanya: ambil serangkaian keputusan dengan jawaban yang dapat dihitung, jalankan keduanya, dan periksa apakah probabilitasnya bermakna apa pun. Laya telah memublikasikan separuh eksperimen itu dan menunjukkan kepada Anda di mana ia gagal. Intern-Decision-4B belum memublikasikannya sama sekali.

