Kartu judul yang dihasilkan untuk perbandingan Perceptron Mk1.5 dan Gemma 4 12B, dengan judul utama 'Perceptron Mk1.5 vs Gemma 4 12B' dan subjudul 'Yang satu menjawab dengan kalimat. Yang lain menjawab dengan koordinat.', serta tiga kartu bertuliskan 'Konteks Mk1.5: 36.864 token', 'Konteks Gemma 4 12B: 256K' dan 'Keluaran Mk1.5: kotak dan lintasan', dengan catatan kaki 'Angka Mk1.5 dilaporkan vendor.'
Guides & Insights

Perceptron Mk1.5 vs Gemma 4 12B: Yang Satu Menjawab dalam Kalimat, yang Lain Menjawab dalam Koordinat

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Inilah angka yang seharusnya menghentikan Anda lebih dulu: Perceptron Mk1.5 adalah model yang dibangun untuk video dan agen berwujud, dan jendela konteksnya adalah 36.864 token. Gemma 4 12B adalah model generalis 12B dengan bobot terbuka dan jendela 256K. Pada sumbu yang paling banyak digunakan orang untuk membandingkan model visi — berapa banyak rekaman yang bisa saya berikan kepadanya — model yang lebih kecil, tertutup, dan dibuat khusus kalah tujuh kali lipat dari model yang dapat diunduh. Inversi itu bukanlah cacat pada salah satu produk. Itu memberi tahu Anda untuk apa masing-masing sebenarnya dibangun, dan kedua pekerjaan itu lebih jauh terpisah daripada yang disiratkan oleh baris "input multimodal" yang sama pada lembar spesifikasi keduanya.

Perceptron Mk1.5 adalah model penalaran berwujud yang dirilis Perceptron pada 25 September 2026, penerus Perceptron Mk1 dari Mei, yang menerima teks, gambar, video, dan audio serta mengeluarkan teks plus geometri yang dapat diurai mesin. Gemma 4 12B adalah model multimodal berbobot terbuka tanpa encoder milik Google DeepMind berukuran 11,96B, dirilis 3 Juni 2026 di bawah Apache 2.0, yang menerima teks, gambar, audio, dan video serta mengeluarkan teks. Keduanya murah, keduanya membaca umpan kamera, dan hanya satu di antaranya yang akan memberikan kotak pembatas kepada pengendali Anda tanpa tahap penguraian kedua. Pilihan di antara keduanya adalah pilihan tentang apa yang harus dikembalikan.

Apa yang masing-masing dirancang untuk mengembalikan

Letakkan keduanya berdampingan dan perbedaannya bukan pada akurasi. Itu adalah tipe keluaran. Tanyakan kepada Gemma 4 12B di mana forklift berada dan Anda akan mendapatkan sebuah kalimat, dan di sebagian besar aplikasi, kalimat itu adalah produknya — deskripsi, ringkasan, jawaban atas pertanyaan tentang sebuah foto. Tanyakan kepada Perceptron Mk1.5 dan, di samping prosanya, Anda dapat meminta sebuah titik, kotak pembatas, poligon, klip, atau <track> elemen yang membawa observasi spasial dan stempel waktu yang terkait dengannya. Klip berdurasi 60 detik kembali sebagai urutan posisi sepanjang waktu alih-alih satu perkiraan rata-rata tentang adegan tersebut.

Itulah keseluruhan argumen bagi keberadaan Mk1.5, dan ada baiknya kita tepat tentang mengapa hal itu penting. Deskripsi sebuah adegan adalah artefak yang sudah jadi. Koordinat adalah input bagi sesuatu yang lain — perencana genggaman, pemeriksaan cacat, jejak audit berstempel waktu. Jika kode hilir Anda harus membaca prosa dan menyimpulkan posisi darinya, Anda telah membangun parser di antara dua model, dan parser itu kini menjadi permukaan kegagalan Anda. Tawaran Mk1.5 adalah bahwa geometrinya datang dalam bentuk bertipe.

Argumen tandingan Gemma 4 12B bukanlah bahwa model ini juga melakukan hal yang sama. Argumennya adalah bahwa Anda bisa memiliki bobotnya. Apache 2.0, 11,96B parameter, diterbitkan dalam varian pra-terlatih dan varian yang disetel dengan instruksi, berjalan pada perangkat keras yang Anda kendalikan, dengan kartu evaluasi yang dipublikasikan dan indeks pihak ketiga yang mendukungnya. Itu adalah jenis aset yang berbeda, dan tidak satu pun dapat menggantikan yang lain.

Di mana keduanya benar-benar selaras

Lebih sedikit tempat daripada yang disiratkan oleh label "multimodal 2026", tetapi titik temunya nyata dan layak dinyatakan justru karena di situlah daftar periksa seorang pembeli biasanya dimulai.

• Modalitas masukan — keduanya benar-benar empat modalitas. Perceptron Mk1.5 menerima teks, gambar, video dan audio (WAV, MP3, FLAC). Gemma 4 12B menerima teks, gambar, audio dan video melalui satu jalur terpadu tanpa encoder.

• Modalitas keluaran — keduanya tidak menghasilkan audio maupun gambar. Keduanya berupa teks. Perbedaannya adalah teks Mk1.5 dapat membawa anotasi spasial terstruktur, sedangkan teks Gemma 4 12B tidak.

• Pemanggilan fungsi — keduanya mendukungnya. Mk1.5 menyediakan pemanggilan fungsi pada chat completions dan menerima respons terbatas melalui JSON Schema dan regex. Gemma 4 12B menyertakan pemanggilan fungsi dalam bentuk yang disesuaikan dengan instruksi dan mode berpikir yang dapat dikonfigurasi.

• Kontrol penalaran — Mk1.5 menggantikan boolean vision_config.enable_thinking yang lama dengan field reasoning_effort yang menerima nilai high, medium, low, minimal, atau none, dan nilai defaultnya adalah high. Gemma 4 12B menyediakan varian thinking dan non-reasoning yang menghasilkan skor berbeda pada harness yang sama karena keduanya melakukan jumlah pekerjaan yang berbeda.

• Konteks — 36.864 token untuk Mk1.5 dibandingkan 256K untuk Gemma 4 12B. Ini adalah kesenjangan terlebar dalam daftar dan bagian berikutnya membahasnya.

• Bobot dan lisensi — Mk1.5 adalah model hosted tertutup dengan SDK, bukan unduhan. Gemma 4 12B berlisensi Apache 2.0, jadi harga hosted hanyalah salah satu opsi di antara beberapa opsi, bukan satu-satunya cara untuk menjalankannya.

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Gemma 4 12B - the scoreboard', comparing six dimensions: context window 36,864 tokens vs 256K tokens; input text, image, video, audio vs text, image, audio, video; output text plus boxes, tracks and timestamps vs text only; reasoning control 'reasoning_effort, high default' vs thinking on and off; price $0.15 in / $1.50 out per 1M tokens vs $0.10 in / $0.30 out; and independent score 'none yet' vs AA Index 14 of 142. Footnoted that Mk1.5 figures are vendor-reported with no independent index and that the Gemma index is per Artificial Analysis.

Jendela 36K adalah keputusan desain, bukan kekurangan.

Model yang diwujudkan dengan jendela 36.864 token terdengar seperti kesalahan sampai Anda melihat apa yang dibangun Perceptron di sampingnya. Mk1.5 menerima asset_idx field, sehingga satu permintaan dapat merujuk ke beberapa gambar atau video dan menangani masing-masing secara terpisah. Ini membatasi audio pada 16.384 token per item — dokumentasi Perceptron memperkirakan itu sekitar 21,8 menit ucapan pada sekitar 750 token per menit. Dan alasan jendela dapat tetap kecil adalah karena tugasnya sempit: temukan dan lacak hal-hal spesifik dalam frame, jawab tentangnya, berhenti.

Itu adalah bentuk pekerjaan yang berbeda dari milik Gemma 4 12B. Jendela 256K adalah untuk menampung dokumen, repositori, atau percakapan panjang dan menalar di seluruh isinya. Jendela Mk1.5 adalah anggaran untuk satu tugas persepsi dengan jawaban terstruktur, dan Perceptron telah menyesuaikan ukurannya dengan tugas itu, bukan dengan papan peringkat. Di mana perbedaannya terasa adalah saat tugas Anda adalah "tonton seluruh video inspeksi 40 menit ini dan ceritakan semuanya" — jendela 36K tidak akan menampung transkrip dan frame serta jawabannya sekaligus, dan jendela Gemma 4 12B ditambah skor recall konteks panjangnya adalah instrumen yang jujur untuk itu.

Paruh kedua dari trade-off itu adalah kecepatan. Perceptron melaporkan hingga 4,7× lebih cepat secara end-to-end dari median tiga kali pengujian pada satu H100, dengan catatan bahwa 4,7× adalah hasil terbaik dari tiga pengukuran dan bukan kasus tipikal: jawaban chat turun dari 5,2 detik menjadi 1,1 detik, QA gambar turun dari 1,7 detik menjadi 0,51 detik (sekitar 3,3×), dan video 60 detik pada konkurensi delapan jalur turun dari 19 detik menjadi 9,1 detik (sekitar 2,1×). Pada beban kerja video yang benar-benar dijalankan agen embodied, kelipatan yang jujur kira-kira dua.

Salah satu dari ini sudah diukur oleh orang lain.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing the Apache 2.0 licence, Google DeepMind authorship, the gemma4_unified image-text-to-text pipeline tag, and the card text that Gemma 4 models handle text, image and audio input (audio supported on E2B, E4B and 12B) and generate text output, with a context window of up to 256K tokens and multilingual support in over 140 languages.

Ini adalah asimetri paling jelas dalam pertandingan ini dan tidak ada yang mendekati.

Gemma 4 12B memiliki kartu evaluasi vendor dan indeks pihak ketiga. Kartu tersebut memuat angka yang dilaporkan vendor — MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 tanpa alat 77,5, Tau2 yang dirata-ratakan dari tiga kali percobaan 69,0 — dan satu titik lemah yang jujur pada MRCR v2 8-needle di 128k, yang berada di 43,4 dan merupakan baris yang perlu dibaca sebelum mengasumsikan jendela 256K berperilaku seperti jendela di ujung jauh. Di atas itu ada pengukuran independen: Artificial Analysis menempatkan Gemma 4 12B pada Intelligence Index 14, peringkat ke-22 dari 142 model di kelasnya, pada 113,7 token keluaran per detik — peringkat ke-20 dari 142 dalam hal kecepatan — dengan harga daftar $0,10 input dan $0,30 output per juta token.

Perceptron Mk1.5 tidak memiliki hal semacam itu. Tidak ada entri indeks Artificial Analysis dan tidak ada skor arena untuk Mk1.5 maupun Mk1, jadi setiap angka kemampuan yang ada untuk model ini dihasilkan oleh perusahaan yang menjualnya. Kumpulan itu spesifik, bukan samar-samar, dan layak dibaca: 0,9433 pada egosentris hand_box terhadap 0,4467 untuk Gemini 3.1 Pro dan 0,6179 untuk Gemini terbaik dalam uji yang dijalankan Perceptron sendiri; EgoSchema 80,40 terhadap 81,20 untuk pesaing yang sama, kerugian 0,80 poin pada tolok ukur pemahaman luas dengan klaim keunggulan 12% pada subset EgoSchema-hard di 63,75; 0,647 centre-F1 dan 0,628 point-HOTA pada Molmo2-Track; DailyOmni 74,67 dan AVHBench 80,56 di sisi audio. Pola dalam angka-angka itu — tegas pada geometri yang halus, kurang lebih setara atau sedikit tertinggal pada pemahaman video umum — koheren dan cocok dengan cerita produknya. Namun tolok ukur vendor atas modelnya sendiri hanyalah sebuah klaim, dan dua model dalam artikel ini tidak dijelaskan dengan jenis bukti yang sama.

Satu baris dalam tabel itu layak mendapat peringatan khusus. Perbandingan pelacakan Perceptron mencantumkan Qwen3-VL-8B pada 0.180 centre-F1, bersumber dari makalah model tersebut, di samping angka terukur untuk modelnya sendiri, dan memasangkannya dengan Qwen3.5-27B pada 0.530 dan 0.476 di berbagai checkpoint dan penyiapan evaluasi yang berbeda. Angka dari makalah di dalam kolom angka terukur bukanlah baris yang setara, dan itulah jenis baris yang dikutip tanpa asal-usulnya. Kehati-hatian yang sama berlaku secara terbalik untuk posting 56.0 Mk1.5 pada LiveVQA-W dengan tool diaktifkan — angka itu berasal dari voting mayoritas empat sampel, sedangkan 53.2 yang menjadi pembandingnya untuk Gemini 3.8 Flash dengan search grounding tidak demikian, dan voting mayoritas atas empat sampel adalah teknik yang sah yang membuat skor tampak lebih baik dibandingkan satu pass greedy.

Menghitung biaya beban kerja aktual

Daftar tarifnya lebih berdekatan daripada produknya. Perceptron Mk1.5 seharga $0,15 per juta token input dan $1,50 per juta output, dengan input yang di-cache seharga $0,0375 — tepat seperempat dari tarif input standar, dan lebih murah per token yang di-cache daripada input standar Gemma 4 12B sebesar $0,10. Gemma 4 12B tercantum seharga $0,10 dan $0,30 pada perangkat uji pihak ketiga yang mengukurnya, dan lisensinya Apache 2.0, jadi self-hosting menghilangkan biaya marginal sepenuhnya jika Anda memiliki perangkat kerasnya.

Dua hal menyulitkan perbandingan langsung dan keduanya mengarah ke arah yang berlawanan. Pertama, Mk1.5reasoning_effort secara default diatur ke high, yang berarti setiap panggilan yang tidak Anda konfigurasi membeli jalur penalaran termahal yang ditawarkan model; menurunkannya ke medium atau low adalah perubahan satu baris dengan efek langsung pada tagihan, dan itu adalah eksperimen termurah dalam rilis ini. Kedua, Gemma 4 12B memungkinkan Anda mematikan langkah berpikir sepenuhnya, yang mengubah tagihan sekaligus latensi, dan pada tugas tetap seperti klasifikasi tingkat frame, pass tanpa penalaran sering kali merupakan pilihan yang tepat.

Hitunglah dengan angka nyata: sebuah pipeline visi yang memproses 40.000 frame per hari dengan sekitar seribu token input gambar per frame. Itu berarti 40 juta token input per hari. Dengan tarif input Mk1.5 sebesar $0,15, dengan frame yang di-cache saat adegan yang sama berulang, biaya input Anda hanya beberapa dolar satu digit rendah per hari — murah menurut standar apa pun. Gemma 4 12B dengan input $0,10 bahkan lebih murah, dan gratis secara marginal jika Anda meng-host sendiri. Kedua model itu tidak mahal. Keputusan di sini bukan keputusan anggaran; ini soal apakah Anda membutuhkan koordinat, jendela 256K, atau keduanya.

Memanggil keduanya tanpa integrasi kedua

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, and JSON Schema and regex constrained responses) and the Pricing table beneath it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Hambatan praktis untuk menjalankan perbandingan ini bukanlah harga — melainkan bahwa Perceptron Mk1.5 dan Gemma 4 12B tidak berada dalam katalog yang sama. Keduanya juga tidak dirutekan di OrcaRouter saat ini: entri Gemma 4 yang kami layani adalah varian 31B Instruct dan 26B-A4B, dan Mk1.5 tidak memiliki rute sama sekali, jadi panduan yang jujur adalah mengakses Mk1.5 melalui API milik vendor sendiri di api.perceptron.inc — pip install "perceptron>=0.4.0", masukkan kunci ke PERCEPTRON_API_KEY — dan Gemma 4 12B baik melalui host pihak ketiga atau dengan menyajikan sendiri bobot Apache-2.0.

Yang benar-benar menjadi fungsi lapisan routing dalam situasi ini adalah keputusan yang belum Anda buat. Jika output terstruktur Mk1.5 adalah yang dibutuhkan aplikasi Anda dan jendela Gemma 4 12B adalah yang dibutuhkan beban kerja Anda yang lain, itu berarti dua integrasi dan dua domain kegagalan; menempatkannya di belakang satu endpoint yang kompatibel dengan OpenAI dengan failover otomatis berarti gangguan penyedia di sisi mana pun akan terdegradasi menjadi fallback alih-alih pekerjaan yang gagal, dan aturan routing dapat mengirim pekerjaan geometri dan pekerjaan konteks panjang ke model yang berbeda tanpa aplikasi Anda mengetahui mana yang mana. Ketika vendor mengubah tarifnya, router pass-through menagih harga daftar penyedia dengan tanpa tambahan per token, sehingga perubahan tersebut berlaku pada hari yang sama alih-alih pada siklus penagihan berikutnya. DSL routing juga merupakan cara Anda menyiapkan perbandingan — sebagian lalu lintas nyata ke setiap model, diukur pada frame Anda sendiri, alih-alih argumen benchmark.

Yang mana yang sebenarnya kamu inginkan?

Ambil Perceptron Mk1.5 jika jawabannya harus dapat dibaca mesin. Jika Anda mengendalikan sesuatu, atau mencatat sesuatu yang menjadi intinya adalah posisi dan waktu, seberapa pun besar jendela konteks tambahan tidak bisa menggantikan koordinat yang bertipe, dan Mk1.5 adalah satu-satunya model dalam pasangan ini yang menghasilkannya. Masuklah dengan mata terbuka soal tiga hal: anggaran 36.864 token, high sebagai default penalaran, dan fakta bahwa setiap angka kemampuan yang melekat padanya adalah milik vendor sendiri.

Cara termurah untuk menyelesaikannya adalah mengarahkan sebagian lalu lintas nyata ke masing-masing dan mengukur pada frame Anda sendiri; keduanya berada di balik satu endpoint yang kompatibel dengan OpenAI di OrcaRouter, yang membuat uji berdampingan cukup menjadi satu baris konfigurasi alih-alih integrasi kedua.

Ambil Gemma 4 12B jika Anda perlu menampung banyak materi, jika Anda memerlukan bobotnya, atau jika Anda perlu membenarkan pilihan itu kepada seseorang yang tidak menerima tolok ukur vendor begitu saja. Model ini memiliki indeks independen, kartu evaluasi yang diterbitkan, lisensi Apache 2.0, dan jendela tujuh kali lebih besar — dan ia akan mendeskripsikan sebuah pemandangan alih-alih mengukurnya. Klausa terakhir itulah seluruh keputusannya. Salah satu dari model ini adalah generalis yang dapat Anda miliki dan audit; yang lainnya adalah spesialis yang Anda sewa karena ia mengembalikan geometri, dan fakta bahwa spesialis itu memiliki jendela lebih kecil dan tidak punya skor pihak ketiga bukanlah sebuah kontradiksi. Itulah tampilan sebuah alat yang dibangun secara sempit dari luar.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari