
Decision 3.0 vs Intern-Decision-4B: Dua Tim Melakukan Fine-Tuning pada Model yang Sama dan Berbeda Pendapat tentang Segala Hal Lainnya
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token · 71 tok/s
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Letakkan d3-mini, anggota 4B dari Decision 3.0, di samping Intern-Decision-4B dan hal pertama yang Anda sadari bukanlah sebuah perbedaan. Keduanya merupakan fine-tune dari checkpoint dasar yang sama, Qwen3.5-4B. Keduanya tercatat memiliki 4,54 miliar parameter. Keduanya menerima sebuah state, skema pertanyaan bernama, dan sekumpulan jawaban kandidat, lalu mengembalikan probabilitas terkalibrasi untuk setiap kandidat tanpa menghasilkan token. Keduanya berlisensi Apache-2.0. Keduanya dirilis tanpa pengumuman — InternLM mengunggah tiga checkpoint dalam empat puluh detik pada 26 September 2026, dan keluarga Decision 3.0 milik vLLM-SR muncul di Hugging Face pada 10 Oktober 2026 dengan kabar yang hanya disampaikan melalui akun X proyek vLLM.
Semua setelah itu adalah ketidaksepakatan. Mereka tidak sepakat tentang cara membaca probabilitas dari model, tentang apakah video dihitung sebagai input, tentang berapa lama permintaan boleh berlangsung, dan — yang paling tajam — tentang apakah tim bersedia menerbitkan angka yang menyatakan keyakinannya sendiri dapat dipercaya. Tulisan ini membahas keempat ketidaksepakatan tersebut dan berapa biaya yang harus Anda tanggung untuk masing-masingnya, bukan tentang model mana yang "lebih baik", karena keduanya tidak diukur pada skala yang sama dan tidak dapat diperingkatkan satu terhadap yang lain tanpa melakukan pekerjaan yang tidak dilakukan oleh vendor mana pun.
Kebetulan yang perlu dipahami lebih dahulu
Dua laboratorium memilih backbone 4B yang sama dalam waktu dua minggu tidak sepenuhnya mengejutkan — Qwen3.5-4B adalah basis yang wajar untuk model output terstruktur, dan kedua tim jelas memilihnya karena cukup kecil untuk dijalankan dengan murah dan cukup kuat untuk membaca instruksi. Yang mengejutkan adalah mereka mencapai jumlah parameter yang sama hingga empat angka signifikan. Itu menunjukkan bahwa fine-tuning mempertahankan arsitekturnya, dan bahwa tidak ada yang menambahkan menara visi terpisah yang cukup besar untuk mengubah total. Keduanya menggabungkan kemampuan multimodal mereka ke dalam bobot yang sama.
Bagian yang menarik adalah pembacaannya. Kedua model menjawab pertanyaan dengan cara yang sama secara prinsip — menilai jawaban kandidat alih-alih menghasilkannya — dan sepenuhnya berbeda dalam mekanisme:
• Intern-Decision-4B — memetakan setiap opsi ke satu simbol token (A–Z, lalu a–z, lalu 0–9), merender kerangka JSON ke dalam prompt dengan placeholder untuk setiap bidang, dan menjalankan satu forward pass kausal, membaca logits pada posisi tepat sebelum setiap placeholder. Mekanisme ini didokumentasikan langkah demi langkah pada kartu modelnya, termasuk langkah softmax dan temperature yang tepat.
• d3-mini — menghadirkan arsitektur khusus di modeling_d3.py dengan head readout terpisah di readout.safetensors miliknya sendiri, sebuah decision_config.json yang mendeklarasikan noncausal_full_attention dan pooling token terakhir, serta pemetaan token-ke-kode yang didefinisikan dalam konfigurasi alih-alih dijelaskan dalam prosa.
Tidak ada pendekatan yang jelas lebih baik. Rute InternLM memiliki keunggulan karena berjalan pada kelas model Hugging Face standar dengan urutan numerik yang terdokumentasi — Anda dapat memeriksa hasil kerjanya. Rute vLLM-SR memiliki keunggulan karena pembacaannya adalah head yang terlatih, bukan proyeksi dari embedding token yang sudah ada, yang merupakan penyesuaian lebih bebas, dan konsekuensinya adalah Anda harus trust_remote_code=True dan menjalankan kode mereka untuk melakukan apa pun sama sekali.
Batas yang diterbitkan masing-masing
Di sinilah preferensi yang sebenarnya mulai terbentuk, karena satu kartu jauh lebih spesifik daripada yang lain tentang di mana kartu itu berhenti berfungsi.
• Batas masukan — Intern-Decision-4B: 8.192 token secara default dan permintaan yang melebihinya ditolak langsung, tidak pernah dipotong, dengan batas yang ditetapkan oleh argumen konstruktor. d3-mini: max_length adalah null dalam konfigurasi yang dikirim dan tidak ada anggaran token yang muncul di mana pun pada kartu tersebut.
• Pertanyaan per permintaan — Intern-Decision-4B: 1 hingga 16, dengan maksimum yang dinyatakan sebesar 62 opsi dalam satu pertanyaan. d3-mini: tidak ada batas yang dinyatakan; kartu tersebut hanya menyebutkan bahwa pertanyaan-pertanyaan dijawab bersamaan, masing-masing dari forward pass-nya sendiri.
• Gambar — Intern-Decision-4B: hingga delapan per permintaan, diurutkan berdasarkan daftar yang Anda berikan, dengan prosesor checkpoint yang menangani pengubahan ukuran dan perluasan token. d3-mini: beberapa per permintaan sebagai path, URL, gambar PIL, atau URL data base64, masing-masing dibaca hingga 1,6 megapiksel, setiap pertanyaan melihat setiap gambar.
• Video — Intern-Decision-4B: tidak ada. d3-mini: beberapa video, dibaca pada 2 frame per detik, dibatasi hingga 32 frame yang tersebar di seluruh klip dan 0,2 megapiksel per frame.
Batas atas input adalah garis yang akan menentukan hal ini bagi sebagian besar orang. Anggaran 8.192 token yang dibagi antara state, instruksi pertanyaan, dan deskripsi kandidat merupakan kendala nyata pada pekerjaan penilaian dokumen dan perutean konteks panjang yang menjadi alasan model-model ini dijual, dan InternLM patut mendapat pujian karena mengatakannya secara terang-terangan alih-alih membiarkannya ditemukan sendiri. vLLM-SR yang tidak menyatakannya adalah kebalikannya: bukan batas tersembunyi, melainkan batas yang tidak diketahui, dan seberapa banyak pun membaca repositori tidak dapat memastikannya.
Kalibrasi adalah pemisahan yang sebenarnya
Setiap model keputusan membuat janji yang sama: angka yang dikembalikannya adalah probabilitas, dan ambang batas yang ditetapkan terhadapnya memiliki makna. Hampir tidak ada yang membuktikannya. Di sinilah kedua rilis tersebut paling berbeda, dan perbedaannya bergerak ke arah yang berlawanan dari yang akan Anda duga dari tanggal rilis.
Intern-Decision-4B menerbitkan, pada kartu modelnya sendiri, skor Brier sebesar 0,347 dan kesalahan kalibrasi yang diharapkan sebesar 0,065 pada rata-rata tujuh benchmark, temperatur hasil penyuaian sebesar 1,99241824 yang diperoleh melalui minimalisasi NLL pada 1.728 kasus kalibrasi yang ditetapkan dengan 1.693 kasus validasi terpisah, pernyataan eksplisit bahwa label test-suite tidak digunakan untuk memilih temperatur tersebut, dan diagnostik 96 kasus yang menunjukkan kalibrasinya bergerak dari 0,628 Brier / 0,213 ECE sebelum penskalaan temperatur menjadi 0,550 / 0,089 setelahnya. Ini juga menyatakan nilai default dan mengatakan bahwa kalibrasinya bersifat per-checkpoint, jadi menggunakan ukuran lain dengan modul ini tidak akan cocok.
Decision 3.0 menerbitkan indeks akurasi dan klaim cakupan — semua 140.178 permintaan publik dijawab, tidak ada yang tidak didukung — dan tidak ada angka kalibrasi sama sekali. Tidak ada skor Brier, tidak ada ECE, tidak ada suhu yang dinyatakan, pada salah satu pun dari keenam titik pemeriksaan. Suhu yang dirilis d3 decision_config.json adalah 1.0, yang merupakan identitas dan mungkin merupakan nilai yang di-fit atau mungkin bukan; file tidak menyatakannya.
Bacalah dua judul indeks secara berdampingan dan asimetrinya makin parah. Kartu d3-mini melaporkan skor public-suite Jev Decision Index 0.3 sebesar 54,90, yang dijelaskan sebagai diukur dengan kit resmi pada bobot yang dirilis, sementara baris-baris perbandingan di papan yang sama dijelaskan sebagai data papan langsung. Intern-Decision-4B melaporkan rata-rata 90,02 di tujuh tolok ukurnya sendiri. Kedua angka itu tidak berada pada skala yang sama, tidak menggunakan tugas yang sama, dan menempatkannya dalam satu kalimat sebagai perbandingan akan tidak jujur. Yang bisa dibandingkan adalah pengungkapannya: satu kartu memberi tahu seberapa salah tingkat keyakinannya, dan yang lain tidak tahu atau tidak mau mengatakannya.

Latensi, dan mengapa kedua kumpulan milidetik itu juga tidak dapat dibandingkan
Kedua kartu mempublikasikan latensi per permintaan, dan menerima angkanya begitu saja akan menjadi kesalahan karena alasan yang sama angka akurasi tidak dapat dibandingkan.
• Intern-Decision-4B — rata-rata 44,16 ms, median 44,03 ms, p95 44,60 ms, diukur pada satu RTX 4090 melalui jalur Hugging Face lokal, dijelaskan sebagai bergantung pada beban kerja dan perangkat keras.
• d3-mini — median 17.5 ms untuk teks, 96.2 ms dengan gambar, 371.5 ms dengan video sepuluh detik, pada satu AMD Instinct MI325X, satu permintaan dalam satu waktu.
Dua hal membuat keduanya tidak dapat dibandingkan. Yang pertama adalah jalur perangkat keras dan perangkat lunak: 4090 versus MI325X, forward pass Hugging Face standar versus implementasi attention kustom dengan kernel masked-layer yang tersedia melalui flash-linear-attention. Yang kedua adalah beban kerjanya: angka InternLM dijelaskan sebagai end-to-end per-kueri pada campuran yang tidak disebutkan, sedangkan angka vLLM-SR dipecah berdasarkan modalitas input, sehingga perbandingan hanya teks adalah satu-satunya baris yang setara, dan bahkan itu pun mencakup dua vendor GPU.
Angka yang harus diambil dari kedua kartu bukanlah peringkat, melainkan bentuknya. Model keputusan dipanggil berulang kali di dalam satu alur kerja — sebuah catatan dukungan mungkin memerlukan tujuan, pemeriksaan pengembalian dana, keputusan eskalasi, dan skor prioritas, empat pertanyaan, dan kumpulan 128 catatan mengubahnya menjadi 512 keputusan. Pada volume itu, 17 ms dan 44 ms keduanya menghilang dibandingkan dengan berapa pun biaya model generatif di hilir. Angka yang bergantung pada modalitas adalah yang perlu diperhatikan, karena permintaan gambar atau video adalah antara lima hingga dua puluh kali biaya permintaan teks menurut angka d3-mini sendiri, dan jika keputusan Anda dibuat berdasarkan tangkapan layar, Anda telah mengimpor profil biaya yang tidak dimiliki sebagian besar penerapan model keputusan.
Yang mana yang sebenarnya harus dipilih
Jika keputusan yang perlu Anda ambil bergantung pada video, tidak ada perdebatan dan tidak diperlukan analisis: Decision 3.0 membaca video dan Intern-Decision-4B tidak. Itulah jawaban lengkapnya untuk apa pun yang melibatkan rekaman layar, klip kamera, atau urutan bingkai, dan itulah kesenjangan kemampuan yang dengan sendirinya sudah cukup untuk membenarkan keberadaan keluarga yang lebih baru.
Jika masukan Anda berupa teks dan sesekali gambar, pilihannya bergantung pada dua hal dan tidak satu pun dari keduanya adalah papan peringkat.
Gunakan Intern-Decision-4B ketika Anda perlu menalar tentang ambang batas. Dari keduanya, hanya ini yang memberi tahu Anda apakah 0,9 berarti sembilan dari sepuluh kali; ia menyebutkan temperature-nya, menyatakan kasus mana yang menjadi dasar pencocokan temperature tersebut, dan mendokumentasikan inferensinya sebagai prosedur bernomor singkat yang dapat Anda implementasikan ulang terhadap kelas model standar. Bagi scorer yang berada di depan tindakan otomatis, itulah properti yang penting, dan itu lebih langka daripada poin akurasi.
Ambil Decision 3.0 saat Anda membutuhkan rentang atau modalitasnya. Enam checkpoint dari 0,59B hingga 26,09B berarti format permintaan yang sama dapat dilayani oleh model edge 6,7 ms dan model 27B, dan keluarga ini berbagi satu antarmuka, sehingga berpindah antar tingkatan hanyalah perubahan konfigurasi, bukan penulisan ulang. Masalahnya, Anda mempercayai anggaran input yang tidak dinyatakan dan klaim kalibrasi yang belum diaudit, dan model terbesar dalam keluarga ini adalah model yang nomor indeksnya diukur vendor pada harness miliknya sendiri.
Saat ini, tidak ada satu pun yang menjadi default yang aman. Checkpoint d3 yang paling banyak diunduh telah ada di Hugging Face selama sekitar satu hari; Intern-Decision-4B telah tersedia selama dua minggu dan menarik sekitar 3.200 unduhan serta 83 suka, yang merupakan perhatian tetapi bukan lalu lintas produksi. Keduanya cukup murah untuk diuji dan tidak ada satu pun yang memiliki evaluasi pihak ketiga di belakangnya. Jika Anda menempatkan penilai di depan sesuatu yang mengeluarkan uang, langkah yang tepat adalah menjalankan keduanya pada kasus berlabel Anda sendiri dan membandingkan kurva kalibrasi, bukan baris indeks.

Di mana router cocok, sejujurnya
OrcaRouter tidak menyediakan satu pun dari model ini. Checkpoint Decision 3.0 adalah jalur inferensi Python lokal di repositori Hugging Face tanpa endpoint HTTP yang dipublikasikan, dan Intern-Decision-4B dikirim sebagai DecisionEngine, sebuah kelas yang Anda instansiasi sendiri. Tidak ada satu pun yang dapat kami rutekan saat ini, dan tidak ada bagian dari artikel ini yang boleh dibaca sebagai klaim ketersediaan.
Yang kami sediakan adalah sisi hosted dari keluarga yang sama. typesafe/jev-1.13 ada di katalog kami, disajikan melalui POST /v1/systemone — kontrak state-dan-pertanyaan-bernama yang sama yang diterapkan kedua model terbuka di atas — dengan $0.042 per juta token input tanpa biaya completion, karena model ini tidak pernah menghasilkan completion. Model ini berdampingan dengan 200 lebih model lain, dan itulah poin praktisnya bagi siapa pun yang membandingkan kedua model ini: penilai adalah bagian yang murah dalam loop ini, sedangkan model yang bertindak atas keputusan itu adalah bagian yang mahal. Merutekan keduanya melalui satu kunci, dengan failover otomatis saat penyedia bermasalah dan harga daftar penyedia diteruskan dengan markup 0%, berarti mengevaluasi model keputusan tidak mengharuskan Anda menandatangani kontrak kedua atau menulis ulang call site saat beralih backend. Jika Anda sedang di tengah evaluasi — yang memang posisi kedua model ini hari ini — itulah bagian yang layak disiapkan sebelum Anda memilih salah satunya.

Pertanyaan terbuka
Kedua kartu itu berbeda pendapat tentang apa yang penulis model berutang kepada pembaca, dan ketidaksepakatan itu lebih menarik daripada modelnya. InternLM menerbitkan sebuah temperature dan kasus-kasus yang menjadi dasar fitting-nya, lalu menerbitkan diagnostik yang menunjukkan seberapa besar kalibrasi membaik. vLLM-SR menerbitkan hash file, revisi dasar yang dipin, target perangkat keras yang dinyatakan, klaim cakupan — kerja provenance yang nyata — dan sama sekali tidak ada angka kalibrasi.
Ujian untuk menentukan rilis mana yang matang bukanlah tentang mana yang memenangkan papan peringkat. Ujiannya adalah apakah checkpoint Decision berikutnya dirilis dengan skor Brier di dalamnya, dan apakah unggahan InternLM berikutnya mencapai video. Keduanya terlihat dari luar, keduanya murah untuk diperiksa, dan keduanya belum terjadi.
