Kartu judul yang dihasilkan untuk 'ARTEMIS vs Gemma 4 12B' dengan subjudul 'Harness dan otak bukanlah pembelian yang sama', dengan dua kartu yang mempertentangkan ARTEMIS sebagai harness otomatisasi Android tanpa modelnya sendiri dengan Gemma 4 12B sebagai checkpoint multimodal padat 12B tanpa cara untuk bertindak.
Guides & Insights

ARTEMIS vs Gemma 4 12B: harness dan otak bukanlah pembelian yang sama

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

ARTEMIS dan Gemma 4 12B milik Google tidak bersaing, dan cara tercepat untuk membuang-buang waktu seminggu adalah menempatkan keduanya dalam tabel perbandingan lalu memilih pemenang. ARTEMIS, yang di-open-source-kan oleh Google pada Agustus 2026 di bawah Apache 2.0, adalah harness otomatisasi Android: ia menerima sebuah kalimat, mengendalikan ponsel sungguhan melalui ADB, dan melaporkan apa yang terjadi. Gemma 4 12B, yang dirilis oleh Google DeepMind pada 3 Juni 2026, adalah model multimodal open-weights dense berparameter 12 miliar — sebuah otak yang dapat Anda jalankan di laptop, bukan sistem yang dapat menyentuh layar. Salah satunya tidak dapat melihat, memutuskan, atau bertindak tanpa jenis komponen lain terpasang; yang lain sama sekali tidak dapat memegang perangkat. Tetapi perbandingan itu layak dilakukan, karena pertanyaan yang mendasarinya adalah pertanyaan yang saat ini diajukan setiap tim seluler: dapatkah model terbuka kecil yang sepenuhnya Anda miliki melakukan otomatisasi Android, atau apakah Anda memerlukan model frontier yang dihosting di balik harness seperti ARTEMIS? Pertanyaan itu memiliki jawaban nyata, dan jawabannya bukan seperti yang tersirat dalam pos peluncuran vendor mana pun.

Pertama, kesalahan kategori, dinyatakan secara gamblang

ARTEMIS tidak memuat model apa pun. Lencananya sendiri bertuliskan "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL", dan berkas yang menentukan mana yang Anda pakai adalah code>config/artemis.jsonc/code>. Ini adalah loop kendali: pencari lokasi yang mengutamakan aksesibilitas, pemeriksaan keamanan yang membersihkan popup sebelum ketukan Anda mendarat, buku besar sesi yang memadatkan tangkapan layar lama menjadi ringkasan visual, dan dua profil eksekusi — Flash sekitar 3–5 detik per langkah, Pro sekitar 15–40 detik per langkah dengan Planner, Operator, dan Checker yang hanya-baca. Semua yang diketahuinya tentang dunia tiba melalui model bahasa-visual yang tidak ia tulis sendiri.

Gemma 4 12B adalah bentuk objek yang berlawanan. Ia adalah checkpoint. Ia tidak memiliki koneksi perangkat, tidak memiliki ADB, tidak memiliki layanan aksesibilitas, tidak memiliki gagasan bahwa ketukan adalah hal yang dapat dieksekusi. Beri ia tangkapan layar dan tanyakan apa yang harus dilakukan selanjutnya, maka ia akan menjawabmu — mungkin dengan baik — tetapi menjawab adalah seluruh cakupan kemampuannya untuk bertindak. Segala sesuatu antara "model berkata ketuk di (540, 1180)" dan "ponsel mengetuk di (540, 1180)" adalah tugas ARTEMIS, dan itu adalah sebagian besar pekerjaannya.

Jadi perumusan yang jujur untuk perbandingan ini bukanlah ARTEMIS-versus-Gemma. Melainkan: apa yang Anda dapatkan dari model terbuka 12B sebagai lapisan penalaran agen Android, dan kapan Anda perlu membayar untuk sesuatu yang lebih besar?

Apa yang sebenarnya dibawa oleh Gemma 4 12B

Untuk model berukuran sedang, spesifikasinya luar biasa baik, dan tiga propertinya penting untuk apa pun yang bersifat mobile.

Model ini benar-benar multimodal pada lapisan input. Teks, gambar, audio, dan video masuk; teks keluar. Ini adalah Gemma ukuran menengah pertama tanpa encoder multimodal terpisah, dan yang pertama di keluarganya yang mencerna audio secara native — yang bukan fitur otomasi UI, melainkan fitur nyata jika skenario pengujian Anda melibatkan pesan suara, notifikasi yang berbicara, atau jalur aksesibilitas yang dibangun di atas isyarat audio.

Ini adalah 12B yang dapat Anda genggam.Artificial Analysis mencantumkannya pada 12B parameter total di bawah Apache 2.0 — tanpa ambang pendapatan, tanpa klausul riset, lisensi yang dapat Anda bangun produk di atasnya tanpa meminta izin siapa pun — dengan jendela konteks 256K, penalaran diaktifkan, dan kecepatan keluaran terukur 109,2 token per detik. Laporan komunitas menempatkan bobotnya pada sekitar 13,4 GB di SFP8 dan sekitar 6,7 GB di Q4_0, yang merupakan laptop dengan memori 16 GB.

Murah, tetapi bukan yang termurah di kelasnya.Artificial Analysis mencantumkannya pada $0.10 per juta token masukan dan $0.30 per juta token keluaran — dan mencatat di panel yang sama bahwa ini tergolong mahal untuk model open-weights berukuran serupa, yang mediannya berada di $0.05 untuk masukan dan $0.15 untuk keluaran. Pembacaan cache sekitar $0.03.

Gambaran benchmark-nya adalah kekacauan kelas menengah yang biasa, dan perlu dinyatakan dengan hati-hati, karena angka-angka di situs pelacak saling bertentangan. Artificial Analysis memberi skor konfigurasi penalaran itu pada Intelligence Index 14, menempatkannya di peringkat ke-21 dari 142 model open-weights di kelasnya — posisi papan tengah yang cukup terhormat dan jauh dari frontier. Positioning Google sendiri adalah bahwa 12B hampir menyamai Gemma 4 26B-A4B yang lebih besar dan mengalahkan Gemma 3 27B dari generasi sebelumnya pada tugas penalaran, sains, dan dokumen. Agregator pihak ketiga menempatkannya di sekitar 72% pada LiveCodeBench v6 dan 77.2% pada MMLU-Pro, dengan GPQA Diamond berkisar dari 66% hingga 79% tergantung pelacak mana dan konfigurasi mana yang Anda baca. Itu angka yang cukup terhormat untuk 12B. Angka-angka itu juga merupakan agregat yang dilaporkan sendiri dan belum diaudit, dan ketika empat situs berbeda sebesar tiga belas poin, Anda sebaiknya berpegang pada rentangnya, bukan pada satu angka.

A screenshot of the Artificial Analysis page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a measured speed of 109.2 output tokens per second, $0.10 per million input tokens and $0.30 per million output, a 256k-token context window, 12B total parameters, an Apache 2.0 licence and reasoning enabled.

Apa yang dibawa ARTEMIS, dalam satu paragraf, karena itu bukan topiknya di sini

ARTEMIS membawa semua yang tidak bisa dibawa oleh model: locator yang mengutamakan pendekatan dinamis yang memakai indeks elemen aksesibilitas bila ada dan beralih ke visi dan koordinat bila tidak ada, yang berarti tidak ada XPath yang perlu dipelihara dan tidak ada ID yang menjadi basi di permukaan Compose atau Flutter. Ia membawa Safety Net yang mencegat popup sistem yang hampir menjadi sasaran ketukan Anda, verifikasi checkpoint dengan empat level dari code>off/code> hingga code>strict/code>, tumpukan crash otomatis, tangkapan layar keyframe dan laporan diagnostik, konsol web, Python SDK untuk pytest dan CI, dan — alasan ia menyebar secepat itu — server MCP native yang mengekspos seluruhnya kepada Antigravity, Claude Code, Codex dan asisten lain yang mendukung MCP sebagai lima alat. Tingkat penyelesaian 99%+ yang diklaimnya pada benchmark AndroidWorld dari Google Research menempatkannya di 99,1% pada papan peringkat publik per 11 September 2026, dibandingkan 80% untuk performa manusia. Angka itu dilaporkan sendiri dan papan peringkat tidak memverifikasi kiriman, jadi anggap saja ini sebagai klaim vendor yang kuat, bukan audit.

Satu-satunya tempat di mana keduanya benar-benar tumpang tindih

Ada arsitektur nyata di mana Gemma kecil melakukan seluruh pekerjaan, dan itu layak diperhatikan karena menunjukkan untuk apa model cloud sebenarnya membayar. Kerangka agen Android sumber terbuka bernama Orion berjalan sepenuhnya di perangkat: MediaProjection menangkap layar, versi terkuantisasi Gemma-4-E4B-it yang berjalan di Qualcomm Hexagon NPU melalui LiteRT-LM memilih tindakan berikutnya, dan Layanan Aksesibilitas Android mengirimkan ketukan. Tanpa API cloud, tanpa tagihan per token, dan layar tidak pernah meninggalkan ponsel. Ini divalidasi pada Galaxy S25 Ultra dan, menurut deskripsinya sendiri, hanya bermakna pada perangkat keras dengan Hexagon NPU — model ini membutuhkan sekitar 3 GB penyimpanan dan kerangka kerja tersebut menargetkan QNN HTP v79 pada arm64.

Itulah bentuk agen Android model kecil yang bekerja saat ini, dan perhatikan apa yang diperlukan untuk mencapainya. Modelnya terkuantisasi dan dipetakan ke NPU. Ruang aksinya adalah piksel, karena model yang hanya berbasis tangkapan layar tidak dapat menafsirkan "indeks elemen 12". Seluruh desainnya adalah tumpukan vertikal — model, runtime, silikon, framework — itulah sebabnya ini adalah framework dan bukan drop-in untuk rangkaian pengujian Anda. Gemma 4 12B memiliki jumlah parameter sekitar tiga kali lipat dari E4B dalam tumpukan tersebut dan tidak dikirimkan dalam format yang dapat dijalankan di ponsel; 12B dengan kuantisasi empat bit adalah workstation atau endpoint yang dilayani, bukan model yang berjalan di NPU.

A generated diagram of a four-layer Android agent stack - assistant (Antigravity, Claude Code, Codex) on top, then the ARTEMIS harness with locator, Safety Net, checkpoints and traces, then the vision-language reasoning layer, then the Android device via ADB - with a callout beside the reasoning layer noting that Gemma 4 12B could sit there but is untested with ARTEMIS.

Di mana masing-masing benar-benar unggul

Biaya dalam skala besar — Gemma 4 12B yang di-hosting sendiri sama sekali tidak memiliki harga per token, dibandingkan dengan panggilan visi per langkah untuk setiap langkah dari proses ARTEMIS. Pada rangkaian regresi 500 tes yang dijalankan setiap malam, perbedaan itu terakumulasi lebih cepat daripada kesenjangan benchmark mana pun.

Privasi — Gemma 4 12B di perangkat keras Anda sendiri tidak pernah mengirim tangkapan layar ke mana pun; helper aksesibilitas ARTEMIS secara eksplisit berjalan di perangkat dan tidak mengirim apa pun, tetapi panggilan model yang dilakukannya pada setiap tangkapan layar akan ditujukan ke penyedia mana pun yang Anda konfigurasikan.

Keandalan tugas pada aplikasi nyata — ARTEMIS, dengan selisih yang jauh, karena ini adalah harness dengan jaring pengaman, verifikasi checkpoint, dan pemulihan. Tidak ada model yang lebih baik yang dapat menggantikan itu.

Audio dan dokumen panjang — Gemma 4 12B, dengan input audio native pada lembar spesifikasi teknis dan jendela konteks 256K token. ARTEMIS tidak punya pendapat tentang keduanya.

Waktu hingga tes pertama yang lulus — ARTEMIS, dengan selisih yang sangat besar. Klon, code>./start.sh/code>, hubungkan perangkat dengan USB debugging, tunggu tugas pertama untuk menginstal helper aksesibilitas. Membangun yang setara dengan checkpoint kosong adalah proyek multi-bulan, dan contoh Orion di atas adalah seperti apa proyek itu ketika sudah selesai.

Kebebasan untuk memodifikasi lapisan penalaran — Gemma 4 12B, yaitu bobot Apache 2.0 yang dapat Anda fine-tune sesuai kosakata UI Anda sendiri. ARTEMIS adalah kode Apache 2.0, tetapi penalarannya berada di mana pun model Anda berada.

Versi dari pairing ini yang benar-benar tersedia saat ini

Bersikaplah jelas tentang apa yang dapat Anda deploy minggu ini. Daftar backend yang telah diuji ARTEMIS adalah Gemini, Claude, GPT-4o, dan Qwen-VL — Gemma 4 12B tidak muncul di dalamnya, dan tidak ada evaluasi yang dipublikasikan tentang Gemma 4 12B yang menjalankan sesi ARTEMIS. File konfigurasi menerima endpoint model, jadi pasangan tersebut masuk akal, bukan sudah terbukti, dan jika Anda mencobanya, Anda sedang melakukan pekerjaan orisinal, bukan mengikuti dokumentasi. Patut dikatakan secara terus terang: peta jalan ARTEMIS memiliki item "VLM ringan di perangkat", dan model yang mengisinya tidak akan berupa model 12B.

Gemma 4 12B juga tidak ada di katalog kami — kami merutekan ukuran Gemma 4 lainnya, Gemma 4 26B-A4B dan Gemma 4 31B, dan bukan yang 12B, jadi jika itu checkpoint yang Anda inginkan, Anda mengambilnya dari distribusi vendor itu sendiri dan host pihak ketiga yang biasa. Kegunaan katalog yang dirutekan adalah separuh lain dari masalah ini: jika rencana Anda adalah ARTEMIS pada model vision yang dihosting, model itu adalah pos biaya yang berskala dengan setiap langkah setiap run, dan tuas yang berguna bukanlah harga yang tertera melainkan harga cache. Sebuah run Pro membaca ulang konteks yang terus tumbuh pada setiap langkah, jadi model dengan pembacaan cache yang murah mengubah aritmetika jauh lebih besar daripada model dengan input segar yang murah. Itu juga sebabnya failover penyedia seharusnya berada di konfigurasi, bukan di log insiden Anda — sesi Android yang panjang menyimpan konteksnya di satu endpoint, dan gangguan singkat penyedia pada langkah ke-74 membuat Anda kehilangan run tersebut.

A generated scoreboard comparing ARTEMIS and Gemma 4 12B across six dimensions: category (harness vs open-weights VLM checkpoint), ability to drive a phone (yes via ADB vs no), parameter count (not a model vs 12B dense, about 6.7GB at Q4), price (per-step model call vs $0.10 in / $0.30 out per 1M), AndroidWorld (99.1% self-reported vs not published) and licence (Apache 2.0 for both).

Yang mana langkahmu berikutnya

Jika Anda memiliki aplikasi seluler dan rangkaian regresi, Anda menginginkan ARTEMIS, dan Gemma 4 12B bukanlah pengganti untuk bagian mana pun darinya — paling banter, ia adalah mesin yang mungkin Anda tukar nanti, tanpa dokumentasi, atas waktu Anda sendiri. Jika Anda sedang membangun produk yang harus berjalan di ponsel tanpa jaringan dan tanpa biaya per panggilan, Anda menginginkan model kecil, dan Gemma 4 12B mungkin terlalu besar untuk faktor bentuk yang sebenarnya Anda miliki; lihat apa yang dilakukan Orion dengan Gemma kelas 4B di NPU sebelum Anda mengasumsikan 12B akan muat.

Kedua keputusan itu hanya bertabrakan di satu titik, dan ini soal biaya, bukan soal kemampuan: berapa banyak panggilan vision per hari yang bersedia Anda bayar? Jawablah dengan jujur — hitung tes Anda, hitung langkah Anda, hitung run nightly Anda — dan pilihan antara harness pada model hosted dan stack self-hosted akan menentukan dirinya sendiri.

Fungsi katalog yang dirutekan adalah separuh lainnya dari masalah ini: jika rencana Anda adalah ARTEMIS pada model visi yang dihosting, model itu adalah pos biaya yang meningkat seiring setiap langkah dari setiap eksekusi

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari