
AesCode-8B vs Gemma 4 12B: Dua Model Visi Kecil, Dua Output yang Sepenuhnya Berbeda
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token · 85 tok/s
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
AesCode-8B dan Gemma 4 12B keduanya menerima sebuah gambar dan sebuah kalimat dan keduanya adalah checkpoint Apache-2.0 yang kamu unduh alih-alih menyewa, itulah sebabnya mesin pencari akan dengan senang hati menempatkan keduanya berdampingan. Kemiripannya nyata dan juga dangkal. Gemma 4 12B mengembalikan sebuah jawaban — deskripsi, transkripsi, potongan kode, jejak penalaran. AesCode-8B mengembalikan halaman yang dirender: slide, poster, atau dasbor sebagai dokumen HTML dan CSS lengkap yang bisa kamu buka di browser dan edit secara manual. Bentuk masukan yang sama, kelas bobot yang kurang lebih sama, dan keluaran yang hampir tidak berbagi apa pun dengan yang lain. Perbedaan tunggal itu menentukan hampir setiap pertanyaan praktis di bawah ini, termasuk mana yang bisa kamu hadapkan ke pengguna besok.
Patut dinyatakan sejak awal, karena ini menentukan seberapa besar bobot yang dapat ditanggung oleh angka-angka itu: Gemma 4 12B diluncurkan oleh DeepMind pada 2026-06-03 dengan kartu model, dokumentasi, dan ekosistem, dan sejak itu telah diuji secara independen. AesCode-8B sama sekali tidak diluncurkan. Repositori Microsoft untuknya dibuat pada 2026-09-29 dan bobotnya masuk dalam sebuah commit berjudul "Release AesCode-8B" pada 03:35 UTC tanggal 2026-10-07, dengan kode pelatihan dan evaluasi muncul di GitHub pada hari berikutnya. Tidak ada postingan Microsoft Research, tidak ada halaman produk, tidak ada catatan rilis, dan tidak ada preprint — sitasi kartu modelnya berbunyi "Under review" dengan tahun placeholder 2027. Pada saat penulisan ini, repositori 8B menunjukkan dua unduhan dan satu suka. Segala hal yang bersifat kuantitatif tentang AesCode-8B karenanya berasal dari Microsoft sendiri, dan tidak ada yang direproduksi oleh pihak lain.
Kedua model, menurut istilah mereka sendiri
Gemma 4 12B adalah model terbuka ukuran menengah, sebuah checkpoint dense dengan 11,95 miliar parameter yang pilihan desain penentunya adalah tidak adanya encoder visi atau audio terpisah: patch gambar dan bentuk gelombang audio masuk langsung ke transformer. Model ini memiliki konteks 256K token dan membutuhkan sekitar 16 GB VRAM, dengan bobot BF16 sekitar 27 GB dan build terkuantisasi di bawah 7 GB. Kartu dari vendor sendiri — dilaporkan vendor, dan dilabeli demikian di sini — mencantumkan DocVQA 94,9, InfoVQA 88,4, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5, dan LiveCodeBench v6 72,0 dalam mode berpikir. Evaluasi independen adalah bagian yang lebih penting: Artificial Analysis menilai konfigurasi penalaran pada Intelligence Index 14, mengukur sekitar 114 token per detik, dan menetapkan harga panggilan yang dilayani tipikal sekitar $0,10 per juta token input dan $0,30 per juta output. Tiga setengah bulan penerapan sudah ada di belakangnya.
AesCode-8B adalah hasil fine-tune dari Qwen3-VL-8B-Instruct, dipublikasikan dengan empat shard safetensors yang totalnya 17.543.339.408 byte — sekitar 8,8 miliar parameter bf16, itulah sebabnya kolom ukuran yang dibulatkan Hugging Face terbaca 9B sementara vendor menyebut 8B. Konfigurasi yang dipublikasikan adalah resep Qwen3-VL standar: 36 lapisan tersembunyi, ukuran tersembunyi 4.096, 32 kepala atensi dengan 8 kepala key-value, kosakata 151.936 token, dan persyaratan untuk transformers 4.57 atau lebih baru. Run yang dilaporkan Microsoft menggunakan konteks 24.576 token dengan hingga 12.000 token keluaran, temperature 0,8, top-p 0,95, dan tiga generasi per prompt tanpa pemilihan. Lisensinya Apache 2.0, tanpa pembatasan akses, tanpa adendum penggunaan yang dapat diterima. Yang tidak disertakan adalah data pelatihan dan evaluasi, serta endpoint yang dihosting — kami tidak dapat menemukan AesCode-8B tersedia di mana pun, dan model ini tidak ada dalam katalog kami sendiri.
Untuk apa model-model itu sebenarnya dilatih
Ringkasan desain dikutip di kartu model dan layak dibaca sebagai keseluruhan tesis: model kode "tidak dapat melihat bagaimana tata letak, hierarki, dan warna menyatu di kanvas," sementara generator gambar "menyusun halaman yang menarik secara visual tetapi sering salah merender teks, angka, dan hubungan logis." AesCode adalah upaya untuk mempertahankan rasa komposisi dan kemampuan verifikasi sekaligus.
Mekanismenya tidak biasa dalam satu cara tertentu. Setiap prompt pelatihan dipasangkan dengan gambar referensi yang dihasilkan dari prompt yang sama, yang menyediakan tata letak dan gaya sementara prompt teks tetap menjadi acuan untuk konten. Lalu, saat inferensi, model hampir tidak membutuhkan gambar: tahan referensi dari AesCode-8B dan skor Visual-nya turun 1,00 poin dari seratus. Tahan referensi dari Qwen3-VL-8B-Instruct dan penurunannya 19,55. Tahan referensi dari GPT-5.5, yang dievaluasi di bawah perangkat uji yang sama, dan nilainya 10,04. Prior visual berakhir di dalam bobot alih-alih di dalam masukan, dan itulah hasil penelitian yang sesungguhnya di balik judul besar itu.
Target pelatihan Gemma 4 12B adalah target multimodal biasa, dan mengatakan demikian bukanlah sebuah kritik: baca gambar, jawab pertanyaan, ikuti instruksi, panggil alat. Tidak ada apa pun di kartu modelnya yang menunjukkan bahwa model ini pernah diarahkan untuk menghasilkan artefak yang dirender, dan tidak ada evaluasi Gemma 4 12B yang dipublikasikan yang mengukur kualitas tata letak dokumen, luapan kanvas, atau konsistensi desain, karena itu bukan metrik model tersebut.
Papan skor, dan rubrik milik siapa

• Parameter — AesCode-8B: 8.8B bf16, dense. Gemma 4 12B: 11.95B dense.
• Masukan — AesCode-8B: teks ditambah gambar referensi opsional. Gemma 4 12B: teks, gambar, audio, dan video.
• Output — AesCode-8B: dokumen HTML dan CSS yang lengkap. Gemma 4 12B: teks, termasuk pemanggilan alat.
• Konteks — AesCode-8B: 24.576 token dalam konfigurasi yang dilaporkan. Gemma 4 12B: 256K token.
• Lisensi — keduanya Apache 2.0, tanpa pembatasan akses, bobot disertakan.
• Bukti — AesCode-8B: rubrik infografis 300 sampel milik Microsoft sendiri, tiga generasi per prompt, tanpa reproduksi independen. Gemma 4 12B: kartu vendor plus Intelligence Index independen sebesar 14 dan throughput terukur di Artificial Analysis.
Sekarang bagian yang tidak bisa dibawa oleh papan skor. Microsoft melaporkan AesCode-8B pada 82,94 Overall pada set 300 sampel itu, di depan GPT-5.5 yang dikondisikan referensi pada 81,28 dan Claude Opus 4.8 pada 80,39, serta unggul 31,1 poin Visual dari backbone Qwen3-VL-8B miliknya sendiri. Bacalah semua itu sebagai laporan vendor dan belum direproduksi, pada rubrik yang dibuat vendor, pada sampel yang dipilih vendor, dinilai oleh harness yang digunakan vendor untuk melatih modelnya. Kartu itu cukup jujur untuk mempublikasikan dimensi yang tak satu pun model dalam perbandingan melampaui 60 — Style, di mana AesCode-8B berada di 53,21 dan GPT-5.5 memimpin di 57,91 — dan definisi Microsoft sendiri untuk dimensi itu adalah desain yang tidak memerlukan revisi visual lebih lanjut sebelum pengiriman. Pada satu sumbu yang menanyakan apakah seorang manusia akan merilis halaman itu tanpa disunting, model 8B bukanlah yang terdepan. Itulah angka yang perlu dipegang ketika seseorang mengutip 82,94.
Di mana mereka benar-benar tumpang tindih
Hanya ada satu rak bersama, dan rak itu lebih sempit daripada kelihatannya. Jika Anda sedang mengevaluasi model visi terbuka kecil untuk alur kerja yang sarat dokumen, keduanya adalah kandidat — satu untuk membaca dokumen, yang lain untuk menghasilkan dokumen. Tim yang membuat dasbor internal sebagai HTML dan juga perlu mengekstrak angka dari PDF yang diunggah akan menyentuh kedua produk dalam minggu yang sama.
Pemisahan di dalam tumpang tindih itu jelas. Gemma 4 12B adalah model yang Anda arahkan ke dokumen yang masuk. AesCode-8B adalah model yang Anda arahkan ke brief ketika hasil akhirnya adalah halaman. Keduanya tidak saling menggantikan, dan pipeline yang menginginkan keduanya adalah pipeline dua model, bukan sebuah pilihan.

Deployment, di mana asimetri benar-benar terasa
Kisah penyajian Gemma 4 12B sudah selesai. Anda mengunduhnya, kuantisasi jika mau, jalankan di VRAM 16 GB, dan sudah ada basis perkakas yang luas yang melakukan hal ini. Jika Anda lebih memilih untuk tidak menjalankannya sama sekali, panggilan yang disajikan itu murah dan harganya independen.
Kisah penyajian AesCode-8B adalah sebuah command line dan sedikit aritmetika. Kartu model memberikan rutenya secara langsung — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, dengan transformers 4.57 atau lebih baru untuk jalur non-vLLM. Bobot bf16 sebesar 17,5 GB harus berdampingan dengan KV cache untuk 24.576 token dan hingga dua gambar, jadi satu kartu 24 GB secara teknis sudah cukup namun terasa sempit; 40-48 GB, atau dua kartu 24 GB, adalah batas bawah yang realistis. Sediakan anggaran untuk perender juga, karena setiap klaim kualitas tentang model ini dibuat dengan merender keluaran HTML-nya di peramban sandbox, sehingga menilai hasil Anda sendiri berarti harus menyiapkan sesuatu yang mirip Playwright dengan permintaan eksternal diblokir.
Lalu ada kenyataan ketersediaan yang sebenarnya. Kami tidak merutekan AesCode-8B, dan sejauh yang dapat kami temukan, tidak ada pihak lain yang melakukannya; evaluasi hari ini berarti bobot ada di perangkat keras Anda sendiri. Hal terdekat yang dapat dipanggil adalah arsitektur yang menjadi dasar fine-tuning model tersebut. Qwen3-VL-8B-Instruct kini dapat dirutekan melalui OrcaRouter dengan harga $0.18 per juta token input dan $0.70 per juta token output dalam konteks 131,072 token, dan dua checkpoint yang kami sediakan dihargai dengan cara yang sama — Gemma 4 26B-A4B seharga $0.06 dan $0.33, Gemma 4 31B seharga $0.13 dan $0.38. Harga daftar dari penyedia diteruskan tanpa tambahan markup, dan failover antar penyedia terjadi secara otomatis, jadi cara murah untuk mengetahui apakah prompt Anda menghasilkan keluaran yang baik adalah menguji backbone yang belum di-fine-tune terlebih dahulu dan menghabiskan waktu GPU selama seminggu hanya pada prompt yang bertahan.

Yang mana yang sebenarnya kamu inginkan?
Pilih AesCode-8B jika hasil yang diinginkan adalah halaman. Model ini menghasilkan HTML terstruktur yang dapat diedit — tabel sebagai tabel HTML, bagan sebagai spesifikasi ECharts — yang berarti outputnya dapat di-diff di Git dan gayanya dapat diubah oleh desainer tanpa perlu dibuat ulang. Terimalah komprominya: checkpoint riset yang tidak diumumkan dengan jumlah unduhan dua digit, tanpa evaluasi independen, tanpa endpoint yang dihosting, konteks 24K yang hanya divalidasi pada halaman infografis tunggal, dan tag bahasa yang hanya mendukung bahasa Inggris pada kartunya.
Pilih Gemma 4 12B untuk segala hal lainnya. Model ini membaca dokumen lebih baik daripada sebagian besar model yang ukurannya dua kali lipat, model ini menangani audio, mengikuti instruksi alat, memiliki konteks seperempat juta token, dan memiliki tiga setengah bulan pengalaman orang lain di belakangnya. Jika Anda memilih salah satu dari dua ini untuk menjadi model visi kecil Anda, dan Anda tidak secara khusus diminta untuk menghasilkan dek slide sebagai kode, inilah jawabannya.
Dan jika kebutuhan yang sesungguhnya adalah keduanya, jangan memperlakukannya sebagai pemecah seri. Alihkan pekerjaan pembacaan ke model yang dihosting dan pertahankan pekerjaan rendering di mesin mana pun yang mampu menampung bobot tersebut.
Apa yang akan mengubah halaman ini
Tiga sinyal. Reproduksi independen atas angka 82,94 dan penurunan acuan sebesar 1,00 poin akan memindahkan AesCode-8B dari klaim vendor menjadi hasil, dan akan membuat pertanyaan ukuran 8B versus 12B benar-benar menarik, bukan hanya secara nominal. Penyedia inferensi yang mengambil checkpoint tersebut akan meruntuhkan kolom deployment, yang saat ini merupakan seluruh perbedaan praktisnya. Dan makalah yang dikutip Microsoft sebagai sedang ditinjau — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — akan menjawab pertanyaan yang tidak dapat dijawab kartu model, dimulai dari bagaimana rubrik visual berperilaku ketika graf desain itu sendiri salah. Sampai salah satu dari itu terwujud, bacaan yang dapat dipertahankan itu sempit dan nyata: AesCode-8B sangat baik pada bagian-bagian desain visual yang dapat diperiksa mesin, sedang-sedang saja pada bagian yang tidak dapat diperiksa, dan Gemma 4 12B adalah produk jadi yang mengerjakan pekerjaan berbeda.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
