Kartu judul yang dihasilkan bertuliskan 'AREX-2 vs Gemma 4 12B - Salah Satunya Adalah Model', dengan dua panel. Panel kiri, berjudul Gemma 4 12B, mencantumkan: dirilis 3 Juni 2026; 11,95B parameter, dense; konteks 256K, Apache 2.0; unduh hari ini. Panel kanan, berjudul AREX-2, mencantumkan: repo dibuat 29 Sep 2026; tidak ada bobot yang diunggah; tidak ada kartu, tidak ada tag lisensi; tidak dapat diunduh. Footer bertuliskan 'Satu kolom adalah model. Yang lainnya adalah stempel waktu.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

AREX-2 vs Gemma 4 12B: Salah Satunya Adalah Model

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Sebuah perbandingan antara Gemma 4 12B dan AREX-2memiliki satu sifat yang tidak dimiliki perbandingan mana pun lain di blog ini: salah satu dari dua kolomnya kosong karena model di sisi itu belum ada. Gemma 4 12B adalah artefak yang sudah dirilis — Goog­le DeepMind menerbitkannya pada 3 Juni 2026 sebagai model dense open-weights berparameter 11,95 miliar di bawah Apache 2.0, lengkap dengan model card penuh, jendela konteks 256K token, input audio dan gambar native, serta tiga setengah bulan pengujian independen di belakangnya. AREX-2 adalah repositori Hugging Face yang dibuat BAAI pada 29 September 2026 pukul 17:56 UTC dan belum diisi apa pun: tidak ada bobot, tidak ada model card, tidak ada tag lisensi, tidak ada evaluasi, tidak ada pengumuman.

Asimetri itu bukan alasan untuk melewatkan perbandingan. Itulah perbandingannya. Pertanyaan yang layak dijawab bukanlah mana di antara keduanya yang lebih baik — tidak ada yang bisa menjawabnya sampai AREX-2 memiliki file di dalamnya — melainkan apakah agen riset BAAI generasi kedua bahkan akan bersaing dengan model edge 12B sejak awal, atau apakah keduanya menempati posisi dalam stack yang tidak pernah bersentuhan. Salah menilai hal itu adalah kesalahan yang mahal, karena itulah kesalahan yang membuat sebuah tim menganggarkan untuk hal yang salah.

Sisi yang telah dikirim, dengan aturannya sendiri

Gemma 4 12B adalah anggota kecil dari keluarga terbuka generasi keempat Google, dan pilihan desain yang mendefinisikannya bersifat arsitektural: model ini sepenuhnya menghilangkan encoder visi terpisah dan memasukkan patch gambar mentah serta bentuk gelombang audio langsung ke transformer. Itu bukan trik benchmark. Itulah yang membuat model ini benar-benar portabel — sekitar 27 GB bobot BF16 yang terkuantisasi di bawah 7 GB, dan kartu yang menyebut 16 GB VRAM sebagai target penerapan. Di laptop atau satu kartu kelas menengah, ini adalah model yang benar-benar bisa Anda pegang.

Profil kemampuan itu mengikuti dari hal tersebut. Kartu milik Goog​le sendiri — dilaporkan vendor, dan layak dilabeli demikian — mencantumkan DocVQA 94,9 dan InfoVQA 88,4 untuk pemahaman dokumen, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5, dan LiveCodeBench v6 72,0 dalam mode thinking. Artificial Analysis, yang independen, memberi skor konfigurasi penalaran itu pada Intelligence Index 14, mengukurnya pada 114 token per detik, dan menetapkan harga panggilan tipikal yang dilayani sebesar $0,10 per juta token input dan $0,30 per juta output. Entri katalog kami sendiri untuk Gemma 4 31B yang lebih besar mencantumkan 85,7 pada GPQA Diamond. Bentuknya adalah generalis kecil yang luar biasa kuat dalam dokumen dan gambar, wajar dalam penalaran, dan jauh dari model terdepan dalam pekerjaan multi-langkah yang sulit.

Deskripsi pekerjaannya karena itu konkret: inferensi lokal atau single-tenant, pemahaman dokumen dan tangkapan layar, loop agentik sederhana, dan apa pun yang datanya tidak dapat meninggalkan gedung. Ini bukan mesin riset mendalam dan Google tidak menjualnya sebagai mesin seperti itu.

A screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a speed rank of 19 of 142, $0.10 per million input tokens and $0.30 per million output, a 256K-token context window, text, image, speech and video input with text output, and the note that it is among the leading models in intelligence but somewhat expensive for its size. The page header reads 'Released June 2026' and 'Open weights model'.

Sisi lainnya, yang merupakan nama dan stempel waktu

Segala hal yang dapat dikonfirmasi tentang AREX-2 minggu ini cukup dalam satu kalimat. Ini adalah repositori di bawah organisasi BAAI di Hugging Face, yang dibuat pada 29 September 2026, berisi sebuah .gitattributes berkas dan tidak ada yang lain — nol byte data model yang tersimpan, nol unduhan, tidak ada kartu model, tidak ada pernyataan lisensi, tidak ada penerapan oleh penyedia. BAAI sendiri tidak mengumumkan apa pun.

Yang membuatnya layak dicatat adalah keluarga yang menjadi asal namanya. Lini AREX milik BAAI dirilis pada 23 Juli 2026 dengan dua model: AREX-Base, sebuah mixture-of-experts 122 miliar parameter dengan 10 miliar parameter aktif yang berbasis pada Qwen3.5-122B-A10B, dan AREX-Turbo, model dense 4B yang dibangun di atas Qwen3.5-4B. Keduanya berlisensi Apache 2.0. Keduanya adalah agen riset mendalam, bukan model chat — sebuah loop dalam yang mengumpulkan bukti dan menghasilkan jawaban kandidat dengan angka keyakinan, dan sebuah loop luar yang memeriksa jawaban tersebut terhadap batasan awal dan dapat menyempurnakan atau memulai ulang seluruh lintasan. Berdasarkan angka yang dipublikasikan BAAI, AREX-Base mencapai 82,5 pada BrowseComp, 85,4 pada GAIA, dan 89,9 pada DeepSearch QA; AREX-Turbo mencapai 70,7, 81,6, dan 78,5 pada tiga tolok ukur yang sama.

Semua angka itu milik vendor sendiri dan tidak ada yang direproduksi secara independen. Angka-angka itu juga tentang model yang berbeda. AREX-2 tidak memiliki angka, dan "2" tidak memberi tahu Anda apa pun tentang ukuran, backbone, atau arsitektur — generasi kedua dalam lini ini bisa berupa agen yang lebih besar, distilasi yang lebih kecil, atau kerangka kerja yang dilatih ulang dengan backbone yang diganti.

Apakah keduanya bahkan bertemu?

Di sinilah perbandingan itu menjadi lebih berguna daripada kelihatannya. Ambil dua penafsiran yang masuk akal tentang apa jadinya AREX-2.

Jika ia adalah agen riset generasi kedua pada skala yang kurang lebih seperti Base, maka ia dan Gemma 4 12B tidak akan pernah bersaing. Mixture-of-experts 122B yang menggerakkan pencarian multi-sumber adalah layanan terkelola, ditagih per token, dan terikat jaringan; Gemma 4 12B adalah checkpoint yang Anda unduh dan jalankan sendiri. Keputusan di antara keduanya bukanlah perbandingan kualitas, melainkan keputusan tentang apakah beban kerja Anda adalah loop riset atau endpoint inferensi.

Jika AREX-2 ternyata adalah tier kecil — penerus 4B Turbo, bukan 122B Base — maka keduanya memang berada di rak yang sama, dan perbandingannya menjadi nyata. Versi AREX-2 itu kira-kira sepertiga dari jumlah parameter Gemma 4 12B, dikhususkan untuk pencarian yang digerakkan alat, bukan keluasan multimodal, dan akan diukur pada BrowseComp dan GAIA, bukan pada DocVQA. Dua model kecil, satu dioptimalkan untuk mempertahankan lintasan penelitian yang panjang, yang lain untuk melihat dan membaca pada perangkat sederhana. Tim yang membangun pipeline dokumentasi seharusnya tidak peduli pada yang pertama; tim yang membangun agen penelitian seharusnya tidak peduli pada yang kedua.

• Apa yang ada — Gemma 4 12B dapat diunduh hari ini dengan kartu lengkap. AREX-2 adalah repositori tanpa file di dalamnya.

• Parameter — 11.95B dense untuk Gemma 4 12B. Tidak disebutkan, dan hanya dapat disimpulkan dari nama produk, untuk AREX-2.

• Konteks — 256K token (262,144 posisi) untuk Gemma 4 12B. Tidak diketahui untuk AREX-2.

• Modalitas — teks, gambar, dan audio masuk untuk Gemma 4 12B. Belum diketahui untuk AREX-2; generasi AREX pertama adalah teks plus penggunaan alat.

• Lisensi — Apache 2.0 untuk Gemma 4 12B, dinyatakan pada kartu. Tidak dinyatakan untuk AREX-2; AREX-Base dan AREX-Turbo adalah Apache 2.0.

• Untuk apa ini — inferensi multimodal yang dapat di-deploy pada perangkat keras Anda sendiri versus, berdasarkan bukti dari keluarga model ini, pencarian jangka panjang dan agregasi bukti terhadap endpoint yang dihosting.

A generated two-column card headed 'Two deployment shapes, and only one of them exists'. It contrasts where Gemma 4 12B runs (local or single-tenant; about 27 GB BF16, under 7 GB quantised, 16 GB VRAM target; no rate card or per-token meter) against where AREX-Base runs (a 122B mixture-of-experts, a cluster or a hosted endpoint billed per token), names tokens per search step times steps per trajectory as the cost driver for the AREX shape, and notes that AREX-2 is neither shape because there are no files in the repository. A footer reads 'Is this a quality comparison? Not until one side has a model in it.' The OrcaRouter logo is composited in the bottom-right corner.

Bagian yang sebenarnya dapat dibandingkan: di mana masing-masing berjalan

Karena perbandingan kemampuan tidak tersedia, perbandingan deployment-lah yang jujur untuk dilakukan, dan selisihnya tidak tipis.

Gemma 4 12B berjalan di tempat Anda menaruhnya. Tidak ada kartu tarif, tidak ada meteran per token, dan tidak ada penyedia antara Anda dan model — biayanya adalah perangkat keras dan listrik, dan mode kegagalannya adalah perencanaan kapasitas Anda sendiri. Sebaliknya, ketika AREX-Base dirilis pada Juli, model itu adalah campuran-pakar 122B: model yang Anda layani di klaster atau sewa per token, dan 4B Turbo milik keluarga itu sendiri ada justru karena pilihan tersebut memiliki harga. Jika generasi kedua mengikuti pola yang sama, ekonomi AREX-2 akan menjadi fungsi dari token yang dikonsumsi per kueri dikalikan dengan jumlah langkah pencarian yang ditempuh suatu trajektori — angka yang jauh lebih besar untuk agen riset mendalam daripada untuk model pembaca dokumen, karena agen membaca ulang konteks yang terus bertambah pada setiap iterasi.

Di situlah lapisan perutean berhenti menjadi abstraksi dan mulai menjadi pos biaya. Jika Anda akhirnya menjalankan agen riset terhadap model yang dihosting sambil mempertahankan Gemma 4 12B lokal untuk pekerjaan dokumen, dalam kasus biasa itu adalah dua integrasi. Melalui satu API di depan lebih dari 200 model — dengan harga daftar penyedia diteruskan apa adanya dan tanpa markup tambahan di atasnya, sehingga perubahan harga vendor berlaku pada hari yang sama — semuanya menjadi satu kunci, satu tagihan, dan satu klien, serta aturan failover dapat memindahkan permintaan dari penyedia yang sedang bermasalah tanpa disadari loop agen Anda. Kami merutekan Gemma 4 26B-A4B dan Gemma 4 31B saat ini; kami tidak merutekan 12B, dan tidak ada apa pun dari lini AREX yang ada di katalog kami, jadi jika salah satunya adalah model yang Anda butuhkan, model itu berasal dari distribusi vendornya sendiri.

Apa yang harus dilakukan minggu ini

Jika Anda memerlukan model multimodal ringkas yang bisa Anda jalankan sendiri, keputusan itu tidak pernah menunggu AREX-2. Gemma 4 12B sudah dirilis, terdokumentasi, dinilai secara independen, dan dapat di-deploy, sedangkan kolom perbandingan di sisi lain kosong. Jangan membeli apa pun dengan mengandalkan nama yang masih dicadangkan.

Jika Anda sedang membangun agen riset mendalam dan lini AREX adalah yang sebenarnya Anda inginkan, hal yang perlu diperhatikan bukanlah namanya melainkan pohonnya: apakah safetensors muncul di repositori itu, apa yang dikatakan kartu tentang jumlah parameter, dan tag lisensi mana yang melekat padanya. Generasi pertama dirilis dengan Apache 2.0, dan jika generasi kedua juga demikian, pertanyaannya menjadi pertanyaan hosting, bukan pertanyaan lisensi. Sampai saat itu, AREX-Base adalah model AREX yang benar-benar dapat Anda jalankan, dan telah tersedia sejak Juli.

Satu hal yang layak dikatakan secara terang-terangan tentang perbandingan yang secara nominal menjadi topik artikel ini: halaman VS yang satu sisinya adalah commit repositori dan sisi lainnya adalah model yang sudah dirilis bukanlah pertandingan, melainkan jadwal. Jadwal itu mengatakan Gemma 4 12B tersedia sekarang dan AREX-2 sama sekali tidak tersedia.