Kartu judul yang dihasilkan untuk perbandingan Decision 3.0 dan Intern-Decision-4B, dengan subjudul 'basis Qwen3.5-4B yang sama, dua jawaban berbeda', dengan chip bertuliskan '26 Sep vs 10 Okt', 'video vs hanya gambar', 'Brier dipublikasikan vs tidak', dan footer bertuliskan 'Angka Decision 3.0 adalah milik vLLM-SR sendiri; angka Intern-Decision-4B adalah milik InternLM sendiri; tidak ada yang direproduksi secara independen.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Engineering & Research

Decision 3.0 vs Intern-Decision-4B: Dua Tim Melakukan Fine-Tuning pada Model yang Sama dan Berbeda Pendapat tentang Segala Hal Lainnya

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Letakkan d3-mini, anggota 4B dari Decision 3.0, di samping Intern-Decision-4B dan hal pertama yang Anda sadari bukanlah sebuah perbedaan. Keduanya merupakan fine-tune dari checkpoint dasar yang sama, Qwen3.5-4B. Keduanya tercatat memiliki 4,54 miliar parameter. Keduanya menerima sebuah state, skema pertanyaan bernama, dan sekumpulan jawaban kandidat, lalu mengembalikan probabilitas terkalibrasi untuk setiap kandidat tanpa menghasilkan token. Keduanya berlisensi Apache-2.0. Keduanya dirilis tanpa pengumuman — InternLM mengunggah tiga checkpoint dalam empat puluh detik pada 26 September 2026, dan keluarga Decision 3.0 milik vLLM-SR muncul di Hugging Face pada 10 Oktober 2026 dengan kabar yang hanya disampaikan melalui akun X proyek vLLM.

Semua setelah itu adalah ketidaksepakatan. Mereka tidak sepakat tentang cara membaca probabilitas dari model, tentang apakah video dihitung sebagai input, tentang berapa lama permintaan boleh berlangsung, dan — yang paling tajam — tentang apakah tim bersedia menerbitkan angka yang menyatakan keyakinannya sendiri dapat dipercaya. Tulisan ini membahas keempat ketidaksepakatan tersebut dan berapa biaya yang harus Anda tanggung untuk masing-masingnya, bukan tentang model mana yang "lebih baik", karena keduanya tidak diukur pada skala yang sama dan tidak dapat diperingkatkan satu terhadap yang lain tanpa melakukan pekerjaan yang tidak dilakukan oleh vendor mana pun.

Kebetulan yang perlu dipahami lebih dahulu

Dua laboratorium memilih backbone 4B yang sama dalam waktu dua minggu tidak sepenuhnya mengejutkan — Qwen3.5-4B adalah basis yang wajar untuk model output terstruktur, dan kedua tim jelas memilihnya karena cukup kecil untuk dijalankan dengan murah dan cukup kuat untuk membaca instruksi. Yang mengejutkan adalah mereka mencapai jumlah parameter yang sama hingga empat angka signifikan. Itu menunjukkan bahwa fine-tuning mempertahankan arsitekturnya, dan bahwa tidak ada yang menambahkan menara visi terpisah yang cukup besar untuk mengubah total. Keduanya menggabungkan kemampuan multimodal mereka ke dalam bobot yang sama.

Bagian yang menarik adalah pembacaannya. Kedua model menjawab pertanyaan dengan cara yang sama secara prinsip — menilai jawaban kandidat alih-alih menghasilkannya — dan sepenuhnya berbeda dalam mekanisme:

• Intern-Decision-4B — memetakan setiap opsi ke satu simbol token (A–Z, lalu a–z, lalu 0–9), merender kerangka JSON ke dalam prompt dengan placeholder untuk setiap bidang, dan menjalankan satu forward pass kausal, membaca logits pada posisi tepat sebelum setiap placeholder. Mekanisme ini didokumentasikan langkah demi langkah pada kartu modelnya, termasuk langkah softmax dan temperature yang tepat.

• d3-mini — menghadirkan arsitektur khusus di modeling_d3.py dengan head readout terpisah di readout.safetensors miliknya sendiri, sebuah decision_config.json yang mendeklarasikan noncausal_full_attention dan pooling token terakhir, serta pemetaan token-ke-kode yang didefinisikan dalam konfigurasi alih-alih dijelaskan dalam prosa.

Tidak ada pendekatan yang jelas lebih baik. Rute InternLM memiliki keunggulan karena berjalan pada kelas model Hugging Face standar dengan urutan numerik yang terdokumentasi — Anda dapat memeriksa hasil kerjanya. Rute vLLM-SR memiliki keunggulan karena pembacaannya adalah head yang terlatih, bukan proyeksi dari embedding token yang sudah ada, yang merupakan penyesuaian lebih bebas, dan konsekuensinya adalah Anda harus trust_remote_code=True dan menjalankan kode mereka untuk melakukan apa pun sama sekali.

Batas yang diterbitkan masing-masing

Di sinilah preferensi yang sebenarnya mulai terbentuk, karena satu kartu jauh lebih spesifik daripada yang lain tentang di mana kartu itu berhenti berfungsi.

• Batas masukan — Intern-Decision-4B: 8.192 token secara default dan permintaan yang melebihinya ditolak langsung, tidak pernah dipotong, dengan batas yang ditetapkan oleh argumen konstruktor. d3-mini: max_length adalah null dalam konfigurasi yang dikirim dan tidak ada anggaran token yang muncul di mana pun pada kartu tersebut.

• Pertanyaan per permintaan — Intern-Decision-4B: 1 hingga 16, dengan maksimum yang dinyatakan sebesar 62 opsi dalam satu pertanyaan. d3-mini: tidak ada batas yang dinyatakan; kartu tersebut hanya menyebutkan bahwa pertanyaan-pertanyaan dijawab bersamaan, masing-masing dari forward pass-nya sendiri.

• Gambar — Intern-Decision-4B: hingga delapan per permintaan, diurutkan berdasarkan daftar yang Anda berikan, dengan prosesor checkpoint yang menangani pengubahan ukuran dan perluasan token. d3-mini: beberapa per permintaan sebagai path, URL, gambar PIL, atau URL data base64, masing-masing dibaca hingga 1,6 megapiksel, setiap pertanyaan melihat setiap gambar.

• Video — Intern-Decision-4B: tidak ada. d3-mini: beberapa video, dibaca pada 2 frame per detik, dibatasi hingga 32 frame yang tersebar di seluruh klip dan 0,2 megapiksel per frame.

Batas atas input adalah garis yang akan menentukan hal ini bagi sebagian besar orang. Anggaran 8.192 token yang dibagi antara state, instruksi pertanyaan, dan deskripsi kandidat merupakan kendala nyata pada pekerjaan penilaian dokumen dan perutean konteks panjang yang menjadi alasan model-model ini dijual, dan InternLM patut mendapat pujian karena mengatakannya secara terang-terangan alih-alih membiarkannya ditemukan sendiri. vLLM-SR yang tidak menyatakannya adalah kebalikannya: bukan batas tersembunyi, melainkan batas yang tidak diketahui, dan seberapa banyak pun membaca repositori tidak dapat memastikannya.

Kalibrasi adalah pemisahan yang sebenarnya

Setiap model keputusan membuat janji yang sama: angka yang dikembalikannya adalah probabilitas, dan ambang batas yang ditetapkan terhadapnya memiliki makna. Hampir tidak ada yang membuktikannya. Di sinilah kedua rilis tersebut paling berbeda, dan perbedaannya bergerak ke arah yang berlawanan dari yang akan Anda duga dari tanggal rilis.

Intern-Decision-4B menerbitkan, pada kartu modelnya sendiri, skor Brier sebesar 0,347 dan kesalahan kalibrasi yang diharapkan sebesar 0,065 pada rata-rata tujuh benchmark, temperatur hasil penyuaian sebesar 1,99241824 yang diperoleh melalui minimalisasi NLL pada 1.728 kasus kalibrasi yang ditetapkan dengan 1.693 kasus validasi terpisah, pernyataan eksplisit bahwa label test-suite tidak digunakan untuk memilih temperatur tersebut, dan diagnostik 96 kasus yang menunjukkan kalibrasinya bergerak dari 0,628 Brier / 0,213 ECE sebelum penskalaan temperatur menjadi 0,550 / 0,089 setelahnya. Ini juga menyatakan nilai default dan mengatakan bahwa kalibrasinya bersifat per-checkpoint, jadi menggunakan ukuran lain dengan modul ini tidak akan cocok.

Decision 3.0 menerbitkan indeks akurasi dan klaim cakupan — semua 140.178 permintaan publik dijawab, tidak ada yang tidak didukung — dan tidak ada angka kalibrasi sama sekali. Tidak ada skor Brier, tidak ada ECE, tidak ada suhu yang dinyatakan, pada salah satu pun dari keenam titik pemeriksaan. Suhu yang dirilis d3 decision_config.json adalah 1.0, yang merupakan identitas dan mungkin merupakan nilai yang di-fit atau mungkin bukan; file tidak menyatakannya.

Bacalah dua judul indeks secara berdampingan dan asimetrinya makin parah. Kartu d3-mini melaporkan skor public-suite Jev Decision Index 0.3 sebesar 54,90, yang dijelaskan sebagai diukur dengan kit resmi pada bobot yang dirilis, sementara baris-baris perbandingan di papan yang sama dijelaskan sebagai data papan langsung. Intern-Decision-4B melaporkan rata-rata 90,02 di tujuh tolok ukurnya sendiri. Kedua angka itu tidak berada pada skala yang sama, tidak menggunakan tugas yang sama, dan menempatkannya dalam satu kalimat sebagai perbandingan akan tidak jujur. Yang bisa dibandingkan adalah pengungkapannya: satu kartu memberi tahu seberapa salah tingkat keyakinannya, dan yang lain tidak tahu atau tidak mau mengatakannya.

A generated two-column scoreboard headed 'Decision 3.0 d3-mini vs Intern-Decision-4B - the scoreboard'. The left column for d3-mini reads: base model Qwen3.5-4B fine-tuned, 4.54B parameters; input ceiling not stated on the card; video input yes, up to 32 frames at 2 fps; calibration figures none published; reported score Jev Decision Index 0.3 public suite 54.90; latency median 17.5 ms text and 96.2 ms image. The right column for Intern-Decision-4B reads: base model Qwen3.5-4B fine-tuned, 4.54B parameters; input ceiling 8,192 tokens, rejected not truncated; video input none, images only up to eight; calibration Brier 0.347, ECE 0.065 and temperature 1.99241824; reported score 90.02 seven-benchmark average; latency mean 44.16 ms and median 44.03 ms on one RTX 4090. A footer reads 'd3-mini figures are vLLM-SR's own; Intern-Decision-4B figures are InternLM's own; neither is independently reproduced.'

Latensi, dan mengapa kedua kumpulan milidetik itu juga tidak dapat dibandingkan

Kedua kartu mempublikasikan latensi per permintaan, dan menerima angkanya begitu saja akan menjadi kesalahan karena alasan yang sama angka akurasi tidak dapat dibandingkan.

• Intern-Decision-4B — rata-rata 44,16 ms, median 44,03 ms, p95 44,60 ms, diukur pada satu RTX 4090 melalui jalur Hugging Face lokal, dijelaskan sebagai bergantung pada beban kerja dan perangkat keras.

• d3-mini — median 17.5 ms untuk teks, 96.2 ms dengan gambar, 371.5 ms dengan video sepuluh detik, pada satu AMD Instinct MI325X, satu permintaan dalam satu waktu.

Dua hal membuat keduanya tidak dapat dibandingkan. Yang pertama adalah jalur perangkat keras dan perangkat lunak: 4090 versus MI325X, forward pass Hugging Face standar versus implementasi attention kustom dengan kernel masked-layer yang tersedia melalui flash-linear-attention. Yang kedua adalah beban kerjanya: angka InternLM dijelaskan sebagai end-to-end per-kueri pada campuran yang tidak disebutkan, sedangkan angka vLLM-SR dipecah berdasarkan modalitas input, sehingga perbandingan hanya teks adalah satu-satunya baris yang setara, dan bahkan itu pun mencakup dua vendor GPU.

Angka yang harus diambil dari kedua kartu bukanlah peringkat, melainkan bentuknya. Model keputusan dipanggil berulang kali di dalam satu alur kerja — sebuah catatan dukungan mungkin memerlukan tujuan, pemeriksaan pengembalian dana, keputusan eskalasi, dan skor prioritas, empat pertanyaan, dan kumpulan 128 catatan mengubahnya menjadi 512 keputusan. Pada volume itu, 17 ms dan 44 ms keduanya menghilang dibandingkan dengan berapa pun biaya model generatif di hilir. Angka yang bergantung pada modalitas adalah yang perlu diperhatikan, karena permintaan gambar atau video adalah antara lima hingga dua puluh kali biaya permintaan teks menurut angka d3-mini sendiri, dan jika keputusan Anda dibuat berdasarkan tangkapan layar, Anda telah mengimpor profil biaya yang tidak dimiliki sebagian besar penerapan model keputusan.

Yang mana yang sebenarnya harus dipilih

Jika keputusan yang perlu Anda ambil bergantung pada video, tidak ada perdebatan dan tidak diperlukan analisis: Decision 3.0 membaca video dan Intern-Decision-4B tidak. Itulah jawaban lengkapnya untuk apa pun yang melibatkan rekaman layar, klip kamera, atau urutan bingkai, dan itulah kesenjangan kemampuan yang dengan sendirinya sudah cukup untuk membenarkan keberadaan keluarga yang lebih baru.

Jika masukan Anda berupa teks dan sesekali gambar, pilihannya bergantung pada dua hal dan tidak satu pun dari keduanya adalah papan peringkat.

Gunakan Intern-Decision-4B ketika Anda perlu menalar tentang ambang batas. Dari keduanya, hanya ini yang memberi tahu Anda apakah 0,9 berarti sembilan dari sepuluh kali; ia menyebutkan temperature-nya, menyatakan kasus mana yang menjadi dasar pencocokan temperature tersebut, dan mendokumentasikan inferensinya sebagai prosedur bernomor singkat yang dapat Anda implementasikan ulang terhadap kelas model standar. Bagi scorer yang berada di depan tindakan otomatis, itulah properti yang penting, dan itu lebih langka daripada poin akurasi.

Ambil Decision 3.0 saat Anda membutuhkan rentang atau modalitasnya. Enam checkpoint dari 0,59B hingga 26,09B berarti format permintaan yang sama dapat dilayani oleh model edge 6,7 ms dan model 27B, dan keluarga ini berbagi satu antarmuka, sehingga berpindah antar tingkatan hanyalah perubahan konfigurasi, bukan penulisan ulang. Masalahnya, Anda mempercayai anggaran input yang tidak dinyatakan dan klaim kalibrasi yang belum diaudit, dan model terbesar dalam keluarga ini adalah model yang nomor indeksnya diukur vendor pada harness miliknya sendiri.

Saat ini, tidak ada satu pun yang menjadi default yang aman. Checkpoint d3 yang paling banyak diunduh telah ada di Hugging Face selama sekitar satu hari; Intern-Decision-4B telah tersedia selama dua minggu dan menarik sekitar 3.200 unduhan serta 83 suka, yang merupakan perhatian tetapi bukan lalu lintas produksi. Keduanya cukup murah untuk diuji dan tidak ada satu pun yang memiliki evaluasi pihak ketiga di belakangnya. Jika Anda menempatkan penilai di depan sesuatu yang mengeluarkan uang, langkah yang tepat adalah menjalankan keduanya pada kasus berlabel Anda sendiri dan membandingkan kurva kalibrasi, bukan baris indeks.

A screenshot of the Intern-Decision-4B model card on Hugging Face. The header shows 83 likes, 1.34k followers and tags for Image-Text-to-Text, Transformers, Safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational under an Apache-2.0 licence, with the model size listed as 5B parameters in F32 or BF16 and the base model pinned to Qwen/Qwen3.5-4B. A section titled 'How inference works' lists five numbered steps: map each question's options to single-token symbols A to Z then a to z then 0 to 9; render the state, decision schema and a JSON skeleton with one decision placeholder per field; run one causal forward pass and read logits immediately before each placeholder; take a softmax over the allowed candidate-symbol logits and apply the checkpoint's probability calibration; and map symbols back to the original option values. It states that the API never calls generate() and samples no free-form text. A benchmark results table below carries Jevbench Easy, Jevbench Original, Jevbench Hard, Typed Decision, ToolACE, AG News and WildJailBreak columns for the Jev, Laya, Semif and Kev rows. The sidebar reports 3,179 downloads last month.

Di mana router cocok, sejujurnya

OrcaRouter tidak menyediakan satu pun dari model ini. Checkpoint Decision 3.0 adalah jalur inferensi Python lokal di repositori Hugging Face tanpa endpoint HTTP yang dipublikasikan, dan Intern-Decision-4B dikirim sebagai DecisionEngine, sebuah kelas yang Anda instansiasi sendiri. Tidak ada satu pun yang dapat kami rutekan saat ini, dan tidak ada bagian dari artikel ini yang boleh dibaca sebagai klaim ketersediaan.

Yang kami sediakan adalah sisi hosted dari keluarga yang sama. typesafe/jev-1.13 ada di katalog kami, disajikan melalui POST /v1/systemone — kontrak state-dan-pertanyaan-bernama yang sama yang diterapkan kedua model terbuka di atas — dengan $0.042 per juta token input tanpa biaya completion, karena model ini tidak pernah menghasilkan completion. Model ini berdampingan dengan 200 lebih model lain, dan itulah poin praktisnya bagi siapa pun yang membandingkan kedua model ini: penilai adalah bagian yang murah dalam loop ini, sedangkan model yang bertindak atas keputusan itu adalah bagian yang mahal. Merutekan keduanya melalui satu kunci, dengan failover otomatis saat penyedia bermasalah dan harga daftar penyedia diteruskan dengan markup 0%, berarti mengevaluasi model keputusan tidak mengharuskan Anda menandatangani kontrak kedua atau menulis ulang call site saat beralih backend. Jika Anda sedang di tengah evaluasi — yang memang posisi kedua model ini hari ini — itulah bagian yang layak disiapkan sebelum Anda memilih salah satunya.

A screenshot of the OrcaRouter model page for Jev 1.13. The header reads 'Jev 1.13', by TypeSafe, dated 2026-09-24, tagged NEW, with a specification panel reading 65K tokens of context, text input, text output and a p50 time-to-first-token of 176 ms, and the endpoint listed as /v1/systemone. The description says it is TypeSafe's structured decision and evaluation model, given a state and a set of named questions (noul / choice / score), returning a structured answer for each, served via POST /v1/systemone, non-streaming, up to about 64K input tokens, text in and structured JSON out. The metric strip reads input /bin/bash.04 per 1M tokens, no output price, p50 TTFT 176 ms, p95 TTFT 423 ms and 59.3M tokens of traffic over 7 days. Buttons read 'Get the Jev 1.13 API' and 'Try in playground', and a code sample shows a POST to https://api.orcarouter.ai/v1/systemone with the model typesafe/jev-1.13 and a state plus noul, choice and score questions.

Pertanyaan terbuka

Kedua kartu itu berbeda pendapat tentang apa yang penulis model berutang kepada pembaca, dan ketidaksepakatan itu lebih menarik daripada modelnya. InternLM menerbitkan sebuah temperature dan kasus-kasus yang menjadi dasar fitting-nya, lalu menerbitkan diagnostik yang menunjukkan seberapa besar kalibrasi membaik. vLLM-SR menerbitkan hash file, revisi dasar yang dipin, target perangkat keras yang dinyatakan, klaim cakupan — kerja provenance yang nyata — dan sama sekali tidak ada angka kalibrasi.

Ujian untuk menentukan rilis mana yang matang bukanlah tentang mana yang memenangkan papan peringkat. Ujiannya adalah apakah checkpoint Decision berikutnya dirilis dengan skor Brier di dalamnya, dan apakah unggahan InternLM berikutnya mencapai video. Keduanya terlihat dari luar, keduanya murah untuk diperiksa, dan keduanya belum terjadi.