Kartu judul hero untuk 'AstaBrief 8B vs Gemma 4 12B: Penulis Spesialis Melawan Generalis yang Melakukan Segalanya', yang membandingkan penulis laporan tugas tunggal dengan generalis multimodal 11.95B, dengan logo OrcaRouter di sudut.
Guides & Insights

AstaBrief 8B vs Gemma 4 12B: Penulis Spesialis Melawan Generalis yang Serba Bisa

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

AstaBrief 8B dan Gemma 4 12B berada di kelas ukuran yang sama dan lisensi yang sama, dan di luar itu keduanya adalah jawaban atas pertanyaan yang berbeda. AstaBrief 8B adalah model open-weight 8B milik Ai2, dirilis pada 2 Oktober 2026 dan di-fine-tune dari Qwen3-8B, yang melakukan satu hal: mengubah pertanyaan riset dan cuplikan literatur yang diambil menjadi laporan bersitasi, dalam satu kali proses, sekitar 51 detik dari awal sampai akhir. Gemma 4 12B adalah model multimodal terpadu 11,95B milik DeepMind, generalis Apache-2.0 yang menerima teks, gambar, audio, dan video secara native serta menangani konteks 256.000 token. Yang satu adalah pisau bedah yang mengerjakan satu tugas lebih cepat daripada pipeline serbaguna yang digantikannya; yang lain adalah seluruh kotak peralatan, di perangkat.

Godaan untuk menyatakan bahwa model spesialis lebih baik dalam tugasnya lalu beranjak. Pertanyaan yang lebih berguna, jika Anda men-deploy pada satu GPU konsumen, adalah apakah keunggulan model sempit itu cukup besar untuk membenarkan menjalankan dua stack alih-alih satu — dan jawabannya bergantung pada angka-angka yang belum diverifikasi secara independen oleh lab mana pun.

Bagian-bagian yang benar-benar tumpang tindih

Keduanya adalah model dense dengan bobot terbuka yang dapat Anda jalankan di satu kartu, keduanya Apache-2.0, dan keduanya tersedia untuk diunduh, bukan di balik API. Sejauh itu, keduanya memang benar-benar tumpang tindih, dan itulah yang membuat perbandingan ini sama sekali layak dilakukan.

Di luar itu, divergensinya bersifat total, dan dua baris melakukan sebagian besar pekerjaannya.

• Parameter — AstaBrief 8B: sekitar 8B dense, bobot BF16 di kelas GPU tunggal. Gemma 4 12B: 11,95B dense, arsitektur terpadu tanpa encoder.

• Modalitas masukan — AstaBrief 8B: hanya teks, dan secara spesifik berupa pertanyaan plus kutipan. Gemma 4 12B: teks, gambar, audio, dan video, dengan audio dan visi diproyeksikan langsung ke ruang embedding decoder melalui lapisan linear ringan alih-alih encoder terpisah.

• Modalitas keluaran — Keduanya: teks. AstaBrief 8B menghasilkan laporan dengan sitasi; Gemma 4 12B menghasilkan teks biasa dalam bentuk apa pun yang Anda minta.

• Konteks — AstaBrief 8B: batas posisi 40.960 token model dasar, yang dilatih pada 32K. Gemma 4 12B: 256.000 token, dengan skema atensi hibrida yang menyelang-seling atensi jendela geser lokal (jendela 1024 token) dengan atensi global, dan RoPE proporsional pada lapisan global untuk menjaga memori konteks panjang tetap terkendali.

• Pelatihan — AstaBrief 8B: fine-tuning terawasi pada 47K contoh laporan lalu sekitar 6K pasangan DPO, di delapan H100. Gemma 4 12B: pra-pelatihan umum Google DeepMind plus penyetelan instruksi, yang didokumentasikan dalam sebuah laporan teknis.

• Tugas — AstaBrief 8B: satu tugas, pembuatan laporan dengan sitasi. Gemma 4 12B: penalaran, pengodean, alur kerja agentik, obrolan multibahasa dalam lebih dari 140 bahasa.

• Skor independen — Tidak ada untuk AstaBrief 8B selain tabel milik Ai2 sendiri. Gemma 4 12B muncul di papan peringkat publik, termasuk Artificial Analysis, tempat keluarga rilis ini dinilai; itu adalah angka pihak ketiga dan satu-satunya dalam artikel ini yang tidak disediakan oleh vendor.

Bacalah baris konteks sebagai perbedaan struktural, bukan sebagai butir lembar spesifikasi. Plafon 40K AstaBrief 8B bukanlah keterbatasan yang sedang diakali oleh Ai2; itu adalah konsekuensi dari desainnya. Model ini tidak pernah menyimpan korpus, hanya kutipan yang dipilih dan ditentukan ukurannya oleh orang lain. Jendela 256K Gemma 4 12B berarti tugas yang sama dapat didekati tanpa lapisan pengambilan sama sekali — tempelkan kumpulan materi yang besar lalu tanyakan — yang merupakan arsitektur yang benar-benar berbeda untuk hasil yang sama, dan yang meleburkan dua sistem menjadi satu.

Di mana spesialis menang, dan seberapa besar

Argumen Ai2 untuk AstaBrief adalah jam, dan itu argumen yang bagus. Pipeline Thinking yang didukung Claude miliknya rata-rata 178,5 detik per laporan; AstaBrief yang menulis seluruh laporan dalam satu kali proses rata-rata 51,1 detik, sekitar 3,5x lebih cepat, dan Ai2 mengklaim penyederhanaan tersebut tidak mengorbankan kualitas pada metrik yang dilacaknya.

Perusahaan yang penting di sini bukanlah Claude. Melainkan scaffolding multi-langkah itu sendiri — peringkasan cuplikan, pengelompokan tematik, dan penulisan bagian demi bagian — yang semuanya dihapus oleh AstaBrief. Dan scaffolding itu adalah pekerjaan yang sama yang jika tidak, harus Anda bangun di atas generalis mana pun, termasuk Gemma 4 12B, jika Anda menginginkan laporan terstruktur yang disertai sitasi darinya. Generalis yang diminta "laporan bersitasi" akan menghasilkannya; membuatnya menghasilkan laporan sesuai skema tetap, dengan kunci sitasi yang selaras dengan daftar sumber, adalah rekayasa prompt yang Anda miliki dan pelihara.

Klaim kualitas adalah titik di mana Anda harus melambat.

• SQABench-CS2 rata-rata, split pengujian (dilaporkan vendor) — AstaBrief 8B 87,0, checkpoint SFT miliknya sendiri 83,7, basis Qwen3-8B 77,3. 100 pertanyaan ilmu komputer yang ditulis pengguna.

• DeepScholarBench (dilaporkan vendor) — AstaBrief 8B 53.50, tertinggal dari Asta ScholarQA milik Ai2 sendiri di 60.25 dan DR-Tulu-8B di 56.26.

• Perbandingan berpasangan terhadap pipeline Ai2 yang ditenagai Claude (dilaporkan vendor) — 55% kemenangan pada split dev, 72% pada pengujian.

• Studi manusia (dilaporkan vendor) — 14 pertanyaan dari tiga peneliti, DR-Tulu secara keseluruhan lebih disukai, dua dari tiga menyebut akurasi sitasi AstaBrief.

Tidak ada skor yang setara untuk Gemma 4 12B pada SQABench-CS2, di kedua arah. Ketiadaan itu adalah inti jujur dari perbandingan ini: Anda tidak bisa memberi angka pada kualitas laporan Gemma 4 12B dibandingkan dengan AstaBrief 8B, karena tidak ada yang menjalankan generalis itu melalui harness Ai2 dan tidak ada yang berpura-pura melakukannya. Siapa pun yang memberi tahu Anda bahwa spesialis itu "26 poin lebih baik" sedang membandingkan angka vendor dengan ketiadaan.

A screenshot of the Hugging Face model card for google/gemma-4-12B-it showing the 'Any-to-Any' pipeline tag, the Apache 2.0 licence line, the gemma4_unified and image-text-to-text tags, the arXiv identifier 2607.02770, the 12B parameter size and a downloads-last-month figure of 1,902,430.

Di mana generalis menang mutlak

Keunggulan Gemma 4 12B tidaklah marginal dan mudah diremehkan.

Yang pertama adalah cakupan. AstaBrief 8B adalah komponen yang mengharapkan bukti diserahkan kepadanya. Gemma 4 12B membaca tangkapan layar, mendengarkan audio, menonton video, menulis kode, dan mempertahankan percakapan 256K. Jika pekerjaan Anda melibatkan gambar dalam makalah, rekaman pembicaraan, atau materi sumber multimodal, spesialis tersebut sama sekali tidak dapat berpartisipasi dan pertanyaannya sudah tertutup.

Yang kedua adalah bahwa paparan publik yang luas itu sendiri merupakan salah satu bentuk bukti. Gemma 4 12B ada di papan peringkat pihak ketiga; keluarga ini mencakup lima ukuran dari E2B hingga 31B; varian yang disetel instruksi dan yang telah dilatih sebelumnya keduanya diterbitkan bersama laporan teknis. Itu adalah asal-usul yang normal, membosankan, dan dapat diverifikasi — yang justru hilang dari AstaBrief 8B maupun kelas model riset khusus yang lebih luas.

Yang ketiga adalah biaya praktis dari stack kedua. Menjalankan AstaBrief 8B untuk penulisan laporan plus model generalis untuk segala hal lainnya berarti dua model yang tetap berada di memori, dua format prompt, dua harness evaluasi, dan dua jalur upgrade. Pada satu kartu 24GB dalam BF16, itu tidak gratis — dan model card AstaBrief memperingatkan bahwa model ini telah di-fine-tune terhadap satu format prompt tertentu, yang dipublikasikan sebagai file dataset, dan bahwa menggunakan format yang berbeda dapat menurunkan kualitas perilaku. Model generalis tidak memiliki keterikatan seperti itu.

• Gemma 4 12B (dilaporkan vendor) — indeks kecerdasan 9 pada konfigurasi Reasoning; tidak ada angka Gemma yang sebanding pada tolok ukur laporan Ai2.

• Keluarga Gemma 4 — lima ukuran dari E2B hingga 31B, Apache-2.0, laporan teknis telah diterbitkan, kehadiran di papan peringkat pihak ketiga.

• Gemma 4 26B A4B, tersedia di katalog kami — $0.06 per juta token input, $0.33 per juta output, jendela konteks 262.144 token. Gemma 4 31B juga dirutekan, dengan harga $0.13 / $0.38.

• Gemma 4 12B, lokal — 11,95B padat, konteks 256K, atensi hibrida jendela geser dan global, jendela lokal 1024 token.

Terkait ketersediaan, model Gemma 4 di-hosting secara komersial: Gemma 4 26B A4B adalah rute aktif di katalog kami dengan $0.06 per juta token input dan $0.33 per juta output, dengan jendela konteks 262,144 token, dan Gemma 4 31B juga dirutekan. Itu penting karena berarti Anda dapat mengevaluasi cabang generalis tanpa memiliki GPU sama sekali. Tidak ada penyedia di katalog kami yang menyediakan AstaBrief 8B, termasuk kami — ini adalah model unduh-dan-jalankan, dan cara jujur untuk menggunakannya adalah pada perangkat keras yang Anda kendalikan, atau di dalam produk Asta milik Ai2 sendiri.

Menjalankan perbandingan sendiri, dengan murah

Keputusan yang tidak dapat dibuat artikel ini untuk Anda adalah keputusan yang dapat Anda buat dalam satu sore, karena eksperimennya asimetris dalam hal biaya. AstaBrief 8B memerlukan bobot lokal dan format prompt terbitannya; Anda dapat menyiapkannya di satu kartu dengan vLLM dalam konfigurasi yang didokumentasikan Ai2, temperature 0.7 dan top-p 0.95. Lengan generalis dapat berupa panggilan yang dihosting — Gemma 4 26B A4B dengan $0.06 masuk dan $0.33 keluar per juta token cukup dekat secara esensial untuk dijadikan acuan kalibrasi, dan Anda dapat mengarahkan harness Anda sendiri ke keduanya tanpa memiliki GPU kedua.

Lalu ukur hal yang tidak diukur oleh tabel vendor: atas pertanyaan Anda, dengan cuplikan Anda, berapa banyak laporan yang kembali dengan sitasi yang benar dan berapa lama seluruh rantai itu memakan waktu setelah Anda menambahkan perekat skema sitasi ke sisi generalis. 3,5x milik Ai2 diukur terhadap pipeline Ai2 sendiri, bukan terhadap Gemma 4 12B, dan selisih itu akan terlihat berbeda di stack Anda.

Menempatkan lini generalis di balik satu endpoint adalah yang membuat ini murah untuk diulang alih-alih menjadi proyek sekali jalan: satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0% sehingga penurunan harga vendor langsung masuk ke tagihan Anda pada hari yang sama, failover otomatis saat penyedia menurun kinerjanya, dan DSL routing jika Anda ingin beberapa model menjawab bersama-sama. Intinya bukanlah kesetiaan pada salah satu model; intinya adalah menjalankan ulang perbandingan pada kuartal berikutnya seharusnya cukup dengan perubahan konfigurasi, karena kedua model ini akan segera digantikan.

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration tag, the apache-2.0 licence, the qwen3 and deep-research tags and the role descriptor for Ai2, as the reference point for the specialist arm of the comparison.

Yang mana yang sebenarnya harus Anda unduh

Pilih AstaBrief 8B jika hasil akhirnya adalah laporan riset yang disertai sitasi dan Anda memiliki lapisan pengambilan yang memasokinya. Desain satu lintasan adalah pencapaian teknik yang nyata, pengurangan waktu generasi 3,5x adalah alasan keberadaannya, Apache-2.0 plus data pelatihan yang dipublikasikan membuatnya dapat diaudit, dan tidak ada model generalis yang akan menyamai struktur keluarannya tanpa Anda membangun dan memelihara perancahnya sendiri.

Pilih Gemma 4 12B jika pekerjaan Anda lebih luas daripada laporan, jika sumber Anda multimodal, jika konteks 256K memungkinkan Anda melewati pembuatan lapisan retrieval sama sekali, atau jika Anda menginginkan model yang memiliki skor pihak ketiga yang melekat pada namanya dan rute hosted yang dapat Anda panggil hari ini.

Dan perhatikan asimetri yang jujur dalam bukti tersebut, karena hal itu justru merugikan pihak spesialis: angka-angka AstaBrief 8B, termasuk angka-angkanya sendiri yang terdengar paling bagus, berasal dari Ai2, menggambarkan kumpulan perbandingan tahun 2025 yang menurut lab belum dijalankan ulang, dan mencakup studi manusia dengan empat belas pertanyaan. Angka-angka Gemma 4 12B berasal dari orang-orang yang tidak bekerja di Google. Perbedaan asal-usul itu lebih bernilai daripada beberapa poin pada benchmark yang belum pernah dijalankan pada keduanya.