
Microsoft-Decision-1 vs Gemma 4 12B: Satu Memilih dari Daftar Anda, Satu Menuliskan yang Baru untuk Anda
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token · 69 tok/s
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Letakkan Microsoft-Decision-1 dan Gemma 4 12B berdampingan dan perbedaan yang menentukan segalanya bukanlah ukuran, akurasi, atau lisensi — melainkan apa yang terjadi setelah model membaca input Anda. Gemma 4 12B, model multimodal tanpa encoder berparameter 11,96 miliar milik DeepMind yang dirilis pada 3 Juni 2026 di bawah Apache 2.0, membaca teks, gambar, audio, atau video lalu menuliskan jawaban kepada Anda, token demi token, dalam jendela 256.000 token dan lebih dari 140 bahasa. Microsoft-Decision-1 mulai tersedia secara umum di Microsoft Foundry pada 8 Oktober 2026 sebagai penilai khusus teks yang menjalani pelatihan lanjutan pada Qwen3.5-9B: Anda memberinya suatu keadaan dan pertanyaan yang jawabannya sudah Anda enumerasi, dan model itu mengembalikan probabilitas terkalibrasi untuk setiap opsi dalam satu lintasan atas hingga 32.768 token, tanpa menghasilkan apa pun. Satu model memberi tahu Anda opsi mana yang benar. Model lainnya memberi tahu Anda bagaimana seharusnya opsi itu — dan menagih Anda untuk setiap kata dari semua itu.
Membingkainya sebagai sebuah kontes akan menjadi kesalahan kategori, dan hal itu layak dikatakan sebelum baris-baris spesifikasi, bukan sesudahnya. Keduanya bukan pengganti satu sama lain; keduanya berada di ujung yang berlawanan dari sebuah alur kerja. Pertanyaan yang berguna adalah ujung mana yang sebenarnya sedang Anda bangun, karena jawabannya menentukan apakah Anda membeli seorang juri atau seorang penulis.
Tagihan adalah titik ketika perbedaan itu tidak lagi bersifat filosofis.
Gemma 4 12B ditagih sebagaimana setiap model generatif ditagih: token masukan dan token keluaran, keduanya. Saat Anda memintanya menghasilkan JSON terstruktur, setiap karakter JSON itu dihasilkan, disampel, dan dibayar — dan semakin bersarang skema Anda, semakin panjang jawabannya dan semakin besar pos biaya tersebut. Itu bukan cacat model. Itulah yang dilakukan decoder, dan justru pos biaya itulah yang ada untuk dihapus oleh para pengambil keputusan.
Microsoft-Decision-1 tidak memiliki sisi output untuk ditagih. Ia menjalankan satu forward pass atas state, pertanyaan, dan kumpulan opsi Anda, membaca skor untuk setiap kandidat, lalu selesai. Konsekuensinya berlipat ganda seiring volume, bukan seiring ukuran prompt: pipeline yang melabeli sepuluh ribu record dengan Gemma 4 12B menghasilkan sepuluh ribu dokumen JSON, dan pipeline yang sama pada decision scorer menghasilkan sepuluh ribu prompt dan tidak ada yang lain. Apakah penghematan absolutnya besar sepenuhnya bergantung pada volume Anda dan seberapa gemuk skema Anda, dan siapa pun yang memiliki anggaran per-token dapat menyelesaikannya di spreadsheet. Arahnya tidak diperdebatkan.
Ada asimetri kedua yang lebih kecil: Microsoft tidak mencantumkan tarif di halaman model Microsoft-Decision-1. Tautan penetapan harga mengarah ke halaman penetapan harga Microsoft sendiri, sehingga biaya per keputusan adalah hal yang Anda baca dari Azure, bukan dari kartu model. Yang memang ditegaskan halaman tersebut adalah bahwa 0% dari panggilan adalah token keluaran, dan bahwa inferensi batch dinonaktifkan — Anda tidak dapat mengamortisasi proses penilaian massal melalui kanal batch seperti yang akan Anda lakukan dengan model generatif.

Input yang sama, dua jawaban berbeda
Berikan kedua model sebuah tiket dukungan pelanggan dan sebuah pertanyaan. Microsoft-Decision-1 mengembalikan sesuatu seperti 0,83 untuk "penagihan", 0,11 untuk "teknis", 0,04 untuk "pembatalan", 0,02 untuk "tidak dapat memastikan". Anda memiliki label yang dapat dinamai, angka yang dapat Anda jadikan ambang batas, dan jalur abstensi — Microsoft mendokumentasikan bahwa opsi bergaya "tidak dapat memastikan" didukung ketika bukti yang diberikan tidak memadai, itulah yang membuat logika eskalasi berfungsi. Yang tidak Anda dapatkan adalah alasan.
Berikan tiket kepada Gemma 4 12B dan Anda mendapatkan sebuah paragraf. Ia dapat menalar permintaan tersebut dengan pemikiran yang dapat dikonfigurasi, memanggil fungsi, membaca faktur hasil pindai yang terlampir pada tiket, mentranskripsikan pesan suara yang disematkan padanya, dan menjawab dalam bahasa pelanggan sendiri. Semua itu adalah hal yang tidak dapat dilakukan Decision-1 pada tingkat akurasi mana pun: permukaan masukannya adalah teks dan tidak ada yang lain, dan ia secara eksplisit tidak dirancang untuk menjawab pertanyaan terbuka, percakapan, penerjemahan, atau peringkasan.
Tidak ada keluaran Gemma 4 12B yang berupa probabilitas. Minta keputusan perutean beserta tingkat keyakinan kepadanya, dan Anda akan mendapatkan prosa yang memuat angka, dan angka itu adalah apa pun yang dihasilkan sampler, bukan softmax atas himpunan opsi yang Anda berikan. Jika ambang batas hilir bergantung pada angka itu bermakna sesuatu, Anda sedang menghadapi proyek kalibrasi, bukan sekadar pemberi skor.
Ada atau tidaknya himpunan tertutup pada pertanyaan Anda adalah keseluruhan keputusannya.
Ini adalah tes yang perlu diterapkan sebelum hal lainnya, dan membutuhkan sekitar sepuluh menit dengan papan tulis.
• Jika jawaban Anda diambil dari daftar yang dapat Anda sebutkan terlebih dahulu — label, peringkat, ya/tidak, skor rubrik, rute — Microsoft-Decision-1 adalah instrumen yang tepat, dan Gemma 4 12B adalah cara yang boros dan kurang andal untuk memilih dari daftar itu. Anda akan membayar decoder untuk menebak angka yang sudah Anda batasi.
• Jika jawaban Anda bukan himpunan tertutup — rangkum ini, jelaskan itu, tulis balasannya, deskripsikan bagan — Microsoft-Decision-1 tidak dapat membantu berapa pun harganya. Ia tidak memiliki jalur ke prosa, tidak memiliki bidang alasan, dan tidak memiliki mekanisme untuk menghasilkan apa pun yang tidak Anda sebutkan sebagai opsi.
• Jika keduanya, Anda memiliki pipeline dua model alih-alih sebuah pilihan, dan pertanyaan desain yang menarik menjadi model mana yang memiliki ambang eskalasi. Penilai yang menetapkannya; penulis yang mengisi apa yang terjadi di atas dan di bawahnya.
Di mana Gemma 4 12B hanyalah olahraga yang berbeda
Di luar kerangka pengambilan keputusan, Gemma 4 12B tidak unggul di satu lini pun — ia memainkan permainan yang berbeda, dan berpura-pura sebaliknya akan menjadi tidak jujur.

• Modalitas — Microsoft-Decision-1 masukannya hanya teks dan keluarannya numerik. Gemma 4 12B menerima teks, gambar, audio, dan video secara native melalui desain tanpa encoder yang memproyeksikan patch mentah dan bentuk gelombang langsung ke ruang embedding, dengan masukan berselang-seling dalam urutan apa pun.
• Konteks — 32.768 token untuk Microsoft-Decision-1 versus 256.000 untuk Gemma 4 12B, yang mendapat skor 43,4% pada MRCR v2 eight-needle di 128k pada kartu milik Google sendiri.
• Bahasa — 25 bahasa yang didukung untuk Microsoft-Decision-1, dengan Microsoft memperingatkan bahwa cakupan, kualitas, dan kalibrasi "dapat bervariasi menurut bahasa" serta menyebut bahasa non-Inggris dengan sumber daya rendah sebagai titik lemah; 140+ untuk Gemma 4 12B, dengan angka MMMLU yang dievaluasi sebesar 83,4 untuk ukuran ini.
• Performa yang dipublikasikan — tab Benchmarks milik Microsoft-Decision-1 memuat metodologi dan tidak ada angka; Google mempublikasikan 77,2% MMLU Pro, 77,5% AIME 2026 tanpa alat, 72,0% LiveCodeBench v6, 78,8% GPQA Diamond, 69,1% MMMU Pro, dan 79,7% MATH-Vision untuk Gemma 4 12B.
• Distribusi — Microsoft-Decision-1 adalah API hosted khusus Foundry tanpa bobot, tanpa unduhan, dan tanpa jalur fine-tuning. Gemma 4 12B adalah bobot Apache 2.0 yang hadir di ekosistem hari pertama yang terdiri atas LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, dan Unsloth.
• Waktu Proses — penilaian keputusan dilakukan dalam satu lintasan tanpa loop dekode, sehingga latensi berskala dengan panjang prompt, bukan dengan panjang jawaban; Gemma 4 12B menghasilkan token demi token, dan materi peluncuran Google menempatkannya pada 16 GB VRAM atau memori terpadu.
Baris benchmark itulah yang layak direnungkan sejenak, dalam arah yang paling tidak menguntungkan Microsoft. Angka-angka Gemma 4 12B juga dilaporkan vendor — tetapi angka-angka itu telah didukung oleh penggunaan pihak ketiga selama berbulan-bulan, dalam harness publik, pada perangkat keras milik orang lain. Entri Microsoft dalam kategori ini adalah yang terbaru dan paling tidak dapat diverifikasi di antara keduanya, meskipun berasal dari perusahaan yang lebih besar.
Berapa biaya yang harus Anda keluarkan untuk menerjemahkan masing-masing
Gemma 4 12B dalam bentuk 12B-nya tidak ada di katalog kami — jika itu ukuran yang Anda inginkan, Anda harus mengambil 11,96 miliar parameter BF16 dan melayaninya sendiri. Yang ada di katalog kami adalah sisa lini Gemma 4, dan harganya murah: Gemma 4 26B A4B seharga $0,06 per juta token input dan $0,33 per juta output, dan Gemma 4 31B seharga $0,13 dan $0,38, keduanya terdaftar dengan konteks 262.144 token. Itu adalah harga daftar vendor yang diteruskan tanpa markup tambahan dari pihak kami, di balik satu kunci yang kompatibel dengan OpenAI bersama lebih dari 200 model lainnya. Jika masalah Anda ternyata adalah penalaran umum alih-alih keputusan pada himpunan tertutup, salah satu dari dua ukuran itu adalah pilihan murah untuk diukur terhadap scorer yang Anda operasikan sendiri — dan jika Anda lebih memilih untuk tidak berkomitmen pada satu penulis saja, failover otomatis menjaga bagian generasi dari loop penilaian tetap hidup ketika satu penyedia menurun.

Microsoft-Decision-1 adalah deployment Foundry yang Anda sediakan sendiri, dan tidak tersedia melalui kami. Tidak ada apa pun dalam artikel ini yang merupakan klaim ketersediaan untuknya, di kedua sisi panggilan.
Intinya
Microsoft-Decision-1 mulai tersedia secara umum di Microsoft Foundry pada 8 Oktober 2026: pemberi skor hanya teks dengan 32.768 token yang berbasis Qwen3.5-9B, yang mengembalikan probabilitas terkalibrasi atas opsi yang Anda enumerasikan, dengan nol token keluaran, tanpa bobot, dan tanpa angka benchmark yang dipublikasikan. Gemma 4 12B adalah generalis multimodal tanpa encoder berukuran 11,96 miliar parameter yang dirilis pada 3 Juni 2026 di bawah Apache 2.0, yang bernalar, membaca gambar dan audio, serta menulis jawaban sepanjang 256.000 token. Pilih berdasarkan bentuk jawaban Anda, bukan berdasarkan jumlah parameter: himpunan tertutup menjadi milik pemberi skor, himpunan terbuka menjadi milik penulis, dan membayar dekoder untuk memilih dari daftar yang sudah Anda tulis adalah cara paling umum tim menghabiskan sepuluh kali biaya sebuah keputusan.
Yang memang tersedia di katalog kami adalah sisa lini Gemma 4, dan harganya murah: Gemma 4 26B A4B dengan $0.06 per juta token masukan dan $0.33 per juta token keluaran, dan Gemma 4 31B dengan $0.13 dan $0.38.
