
AesCode-8B vs Qwen3-8B: Mereka Terlihat Seperti Induk dan Anak, tetapi Sebenarnya Bukan
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token · 85 tok/s
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Nama-nama itu mengundang kesalahan. AesCode-8B adalah model 8B dengan backbone Qwen3-VL-8B-Instruct, Qwen3-8B adalah model 8B milik vendor sendiri, dan pembacaan yang jelas adalah bahwa yang pertama merupakan fine-tune dari yang kedua. Ternyata bukan. Konfigurasi yang dipublikasikan AesCode-8B menyatakan Qwen3-VL-8B-Instruct sebagai basis — saudara vision-language, checkpoint berbeda dengan tugas berbeda — dan metadata Hugging Face mencantumkannya sebagai finetune dari model itu, bukan dari Qwen3-8B yang hanya teks. Dua model AesCode di kelas bobot ini adalah sepupu bukan induk dan anak, dan perbedaan itulah alasan utama halaman ini berguna: ini memberi tahu Anda apa yang dibeli Microsoft ketika memulai dari checkpoint vision-language, berapa biayanya di sisi teks, dan mengapa perbandingan dengan generalis 8B biasa dari keluarga ini akhirnya mengukur sebuah fork bukan peningkatan.
Keduanya berlisensi Apache 2.0 dan keduanya dapat diunduh, tetapi catatan publikasi mereka tidak bisa lebih berbeda. Qwen3-8B dirilis pada April 2025 sebagai bagian dari lini generasi Qwen3 milik vendor tersebut, dengan dokumentasi, integrasi ekosistem, dan delapan belas bulan penerapan oleh pihak lain di belakangnya. AesCode-8B tidak mencantumkan tanggal rilis di mana pun dalam berkasnya. Microsoft membuat repositori Hugging Face pada 2026-09-29, melakukan commit bobot dengan pesan "Release AesCode-8B" pada 03:35 UTC tanggal 2026-10-07, dan menaruh kode pelatihan di GitHub pada hari berikutnya. Tidak ada pos Microsoft Research, catatan rilis, halaman produk, maupun makalah — sitasi pada kartu model berbunyi "Under review" dengan tahun placeholder 2027, dan repositori tersebut menunjukkan dua unduhan pada saat penulisan ini. Semua hal kuantitatif tentang AesCode-8B di bawah ini berasal dari Microsoft sendiri dan tidak direproduksi oleh siapa pun.
Pohon keluarga yang disembunyikan oleh nama-nama
Lini generasi Qwen3 berisi beberapa checkpoint kelas 8B yang berbagi garis keturunan dan tidak banyak kesamaan lain. Qwen3-8B adalah generalis khusus teks: total parameter sekitar 8,2 miliar dengan sekitar 7 miliar non-embedding, attention grouped-query, konteks native 32K token yang dapat diperluas hingga 131K melalui YaRN, dan pelatihan pada 119 bahasa dan dialek. Model ini bernalar, mengobrol, menulis kode, dan memanggil alat, dan merupakan salah satu model 8B yang paling banyak di-host sendiri di ekosistem terbuka justru karena alasan-alasan itu. Qwen3-VL-8B-Instruct adalah anggota multimodal: generasi keluarga yang sama, menara visi khusus di atasnya, masukan gambar dan teks, keluaran teks.
Microsoft memulai dari yang kedua. Konfigurasi AesCode-8B membaca Qwen3VLForConditionalGeneration, dengan 36 lapisan tersembunyi, ukuran tersembunyi 4.096, 32 kepala atensi dan 8 kepala key-value, kosakata 151.936 token dan posisi mrope yang berselang-seling, dan memerlukan transformers 4.57 atau yang lebih baru. Total shard-nya 17.543.339.408 byte, sekitar 8,8 miliar parameter bf16, itulah sebabnya kolom ukuran yang dibulatkan milik Hugging Face menyebut 9B sementara vendor menyebut 8B. Itu pembulatan, bukan selisih, dan jumlah parameter bukanlah percabangan yang penting — modalitas input dan konteks penyajian 24.576 token-lah yang penting.
Jadi, perumusan yang jujur bukanlah "generalis versus hasil penyetelan halusnya." Melainkan: generalis teks dengan konteks panjang dan riwayat produksi delapan belas bulan, melawan checkpoint riset multimodal yang mengeluarkan dokumen dan belum pernah dievaluasi secara independen.

Untuk apa Microsoft membelanjakan anggaran pelatihan
Ringkasan desain dikutip di kartu model dan menjelaskan percabangan: model kode "tidak dapat melihat bagaimana tata letak, hierarki, dan warna berpadu di kanvas," sementara generator gambar "menyusun halaman yang memikat secara visual tetapi sering salah merender teks, angka, dan hubungan logis." AesCode adalah upaya untuk mengambil kepekaan komposisi dari yang satu dan kemampuan verifikasi dari yang lain, dan resepnya tidak biasa dalam cara yang spesifik.
Setiap prompt pelatihan dipasangkan dengan gambar referensi yang dihasilkan dari prompt yang sama — eksekusi Microsoft sendiri menggunakan GPT-Image-2 untuk gambar dan GPT-5.5 untuk memperluas ringkasan singkat menjadi prompt konten yang terperinci. Referensi hanya membawa tata letak dan gaya; prompt teks tetap menjadi acuan untuk konten. Lalu, saat inferensi, model hampir tidak membutuhkannya: jika referensi ditahan dari AesCode-8B, skor Visual-nya turun 1,00 poin dari seratus, dibandingkan dengan 19,55 untuk backbone dan 10,04 untuk GPT-5.5. Hasil terkait adalah reward berbasis referensi menaikkan Visual yang hanya berbasis prompt dari 25,17 menjadi 69,71, sehingga prior visual berpindah ke dalam bobot alih-alih tetap berada di input.
Selebihnya adalah kisah desain reward. Supervisi adalah "graf desain" dari simpul dan sisi — teks, bagan, tabel, kartu, wilayah, slot gambar, dengan penampungan, perataan, urutan, dan koneksi sebagai sisinya — yang dipilih sehingga setiap properti pada kanvas menjadi milik elemen bernama dan karena itu dapat dinilai sendiri. Tujuh kanal menilai hasilnya: enam pemverifikasi deterministik untuk eksekusi, teks, batas, data tabel dan bagan, tata letak semantik, dan ruang kosong, ditambah satu Visual Graph Rubric khusus sampel yang dinilai oleh model visi-bahasa. Kandidat dirender di browser Playwright yang di-sandbox dengan permintaan eksternal diblokir, dan harness membaca kembali DOM, gaya terhitung, kotak pembatas, dan tangkapan layar, itulah sebabnya tabel harus berupa tabel HTML dan bagan harus berupa spesifikasi ECharts. Pelatihan dilakukan dengan supervised fine-tuning cold-start pada 3.000 demonstrasi, lalu GDPO atas 7.408 prompt selama 400 langkah pada satu node berisi delapan NVIDIA B200, dengan setiap kanal reward dinormalisasi di dalam grup rollout-nya sehingga sinyal padat berbasis aturan tidak dapat menenggelamkan sinyal visual yang jarang. Microsoft mengukur normalisasi tersebut sebesar 5,12 poin Visual dibandingkan GRPO skalar biasa.
Tidak satu pun dari perangkat itu ada untuk membuat AesCode-8B menjadi asisten umum yang lebih baik. Perangkat itu ada untuk membuat output dapat diperiksa, dan itulah sebabnya konteks model tersebut seperti apa adanya.
Berdampingan, dengan angka-angka yang diberi label.
• Dasar — AesCode-8B: Qwen3-VL-8B-Instruct, sebuah checkpoint visi-bahasa. Qwen3-8B: generalis teks saja dari generasi yang sama.
• Parameter — AesCode-8B: sekitar 8,8B bf16 di empat shard. Qwen3-8B: total sekitar 8,2B, sekitar 7B non-embedding.
• Masukan — AesCode-8B: teks ditambah gambar referensi opsional. Qwen3-8B: teks.
• Keluaran — AesCode-8B: dokumen HTML dan CSS yang lengkap. Qwen3-8B: teks, panggilan alat, kode.
• Konteks — AesCode-8B: 24.576 token dalam konfigurasi yang dilaporkan. Qwen3-8B: 32K asli, 131K diperluas melalui YaRN.
• Bahasa — AesCode-8B: tag kartunya hanya "en". Qwen3-8B: 119 bahasa dan dialek.
• Bukti — AesCode-8B: rubrik infografis 300 sampel milik Microsoft sendiri, tiga generasi per prompt, tanpa reproduksi dari luar. Qwen3-8B: delapan belas bulan benchmark independen, pekerjaan kuantisasi, dan penerapan produksi.
• Lisensi — Apache 2.0 untuk keduanya, tanpa gating. Hasil seri, dan bukan pembeda seperti yang orang duga.
Kesenjangan bukti adalah perbandingan yang sesungguhnya
Microsoft melaporkan AesCode-8B pada 82,94 Keseluruhan dalam rubriknya, unggul dari GPT-5.5 yang dikondisikan referensi pada 81,28 dan Claude Opus 4.8 pada 80,39, serta unggul 31,1 poin Visual dari backbone-nya sendiri yang dikondisikan referensi. Tiga angka dalam tabel itu lebih bernilai daripada judul utamanya. Yang pertama adalah Gaya, di mana AesCode-8B berada pada 53,21 dan tidak ada model dalam perbandingan yang melewati 60 — dan definisi Gaya menurut Microsoft adalah desain yang tidak memerlukan revisi visual lebih lanjut sebelum pengiriman, jadi pada satu dimensi yang menanyakan apakah manusia akan merilis halaman itu tanpa disunting, model tersebut bukan yang terdepan. Yang kedua adalah kegagalan batas: luapan kanvas yang parah berulang pada 4,3% dari 300 sampel, dibandingkan 34,7% untuk GPT-5.5. Yang ketiga adalah bahwa separuh visual dari skor berasal dari juri vision-language yang tidak disebutkan namanya, yang berarti separuh deterministiknya dapat direproduksi oleh pihak luar dan separuh lainnya tidak.
Angka-angka Qwen3-8B berasal dari tempat yang sama sekali berbeda, dan itu lebih penting daripada kumpulan mana yang lebih tinggi. Delapan belas bulan evaluasi independen, kuantisasi komunitas, tolok ukur penyajian, dan penerapan produksi adalah jenis bukti yang berbeda: ini bukan sebuah klaim, melainkan rekam jejak. Anda dapat mengetahui bagaimana Qwen3-8B berperilaku di bawah kuantisasi empat-bit pada kartu tertentu karena seseorang telah menerbitkannya. Anda tidak dapat melakukan itu untuk AesCode-8B, karena hingga minggu ini belum ada siapa pun di luar Microsoft yang menjalankannya pada apa pun.
Dan tidak ada metrik bersama antara kedua tabel. Qwen3-8B tidak memiliki skor tata letak infografis; AesCode-8B sama sekali tidak memiliki tolok ukur penalaran umum yang dipublikasikan. Perbandingannya bukan soal dekat atau tidak dekat — perbandingan itu tidak tersedia.
Apa yang sebenarnya dibutuhkan untuk menjalankan masing-masing

Qwen3-8B adalah yang mudah. Model teks 8.2B dapat dikuantisasi ke satu kartu konsumen, memiliki delapan belas bulan perkakas di belakangnya di setiap kerangka kerja penyajian dan runtime lokal, serta berperilaku dapat diprediksi. Perluasan konteks ke 131K didokumentasikan, bukan sekadar cerita, dan cakupan 119 bahasa adalah alasan model ini muncul di begitu banyak pipeline multibahasa.
AesCode-8B adalah proyek serving. Perintah pada kartu itu sendiri adalah vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, dengan transformers 4.57 atau lebih baru untuk jalur non-vLLM. Bobot bf16 sebesar 17,5 GB harus muat di samping cache KV untuk 24.576 token dan hingga dua gambar, jadi satu kartu 24 GB secara teknis memadai dan terasa sempit, dan 40-48 GB atau dua kartu 24 GB adalah batas bawah yang realistis. Perhitungkan juga renderer, karena setiap klaim tentang kualitas model ini dibuat dengan merender keluaran HTML-nya di peramban bersandbox — jika Anda ingin tahu apakah keluaran Anda sendiri bagus, itulah harness yang harus Anda siapkan. Dan perhatikan bahwa konteks 24.576 token diuji pada halaman infografis tunggal, bukan dek multi-slide yang menjadi sasaran model ini, jadi tekanan konteks pada dek nyata adalah wilayah yang belum teruji.
Ketersediaan adalah separuh lainnya dari poin yang sama. AesCode-8B bukanlah sesuatu yang dirutekan oleh OrcaRouter, dan kami juga tidak dapat menemukannya dilayani di tempat lain; evaluasi hari ini berarti bobot di perangkat keras Anda sendiri. Leluhurnya adalah cerita yang berbeda — Qwen3-VL-8B-Instruct dapat dipanggil melalui OrcaRouter saat ini dengan $0,18 per juta token masukan dan $0,70 per juta keluaran dalam konteks 131.072 token, yang menjadikannya cara termurah untuk melihat apa yang dilakukan versi yang belum disetel dari arsitektur persis ini pada prompt infografis Anda sendiri. Lebih jauh di lini yang sama, Qwen3.3-27B dapat dirutekan dengan $0,33 dan $2,40. Harga daftar penyedia diteruskan tanpa markup tambahan dan failover antarpenyedia bersifat otomatis, sehingga membuat prototipe prompt terhadap backbone yang dihosting hanya membutuhkan satu kunci alih-alih seminggu GPU, dan hanya prompt yang benar-benar tampil bagus yang mendapatkan pekerjaan reproduksi.

Yang mana yang kamu inginkan bergantung pada artefaknya
Pilih AesCode-8B ketika hasil yang diserahkan adalah halaman dan halaman itu harus dapat diedit. Output HTML terstruktur yang bisa di-diff di Git, tabel sebagai tabel sungguhan dan bagan sebagai spesifikasi ECharts, adalah artefak yang benar-benar berbeda dari satu paragraf teks, dan sebesar apa pun kemampuan umum tidak dapat menggantikannya. Terima trade-off ini secara sadar: checkpoint riset yang tidak diumumkan dengan jumlah unduhan dua digit, konteks 24K, hanya bahasa Inggris, tanpa evaluasi independen, batas atas Style yang diterbitkan oleh vendornya sendiri, dan biaya serving yang diukur dalam puluhan gigabyte.
Pilih Qwen3-8B untuk segala hal lainnya — yang, bagi sebagian besar tim, berarti semuanya. Ini adalah generalis yang terbukti pada ukuran bobot ini, ia memiliki konteks yang lebih panjang, ia berbicara dalam seratus sembilan belas bahasa, ia berjalan di perangkat keras yang sudah Anda miliki, dan ia memiliki delapan belas bulan pengalaman produksi orang lain di balik keputusan yang akan Anda buat. Jika Anda tidak memiliki kebutuhan khusus untuk menghasilkan halaman yang dirender, perbandingan ini memiliki satu jawaban.
Alasan untuk menginginkan keduanya memang nyata, dan ini bukan sekadar pemecah seri. Pipeline yang membaca dokumen dan menghasilkan dek menggunakan dua model dengan dua jenis keluaran yang benar-benar berbeda, dan sikap yang berguna adalah mempertahankan perender halaman pada perangkat keras yang mampu menampungnya serta mengarahkan pekerjaan pembacaan dan penalaran ke sesuatu yang di-hosting di balik endpoint yang sama dengan segala hal lainnya.
Apa yang akan membuat ini menjadi halaman closing yang lebih baik?
Tiga hal, dan hanya satu di antaranya yang tentang tolok ukur. Reproduksi independen atas 82,94 dan penurunan referensi 1,00 poin akan memindahkan AesCode-8B dari klaim vendor menjadi hasil, dan akan memungkinkan pertanyaan ukuran 8B-versus-8B dijawab berdasarkan meritnya. Penyedia yang mengambil checkpoint tersebut akan meruntuhkan kolom deployment dan mengubah "seminggu GPU" menjadi "satu panggilan API." Dan makalah yang dirujuk kartu model sebagai sedang ditinjau — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — akan menjawab pertanyaan yang tidak dapat dijawab kartu model: apa yang dilakukan rubrik visual ketika graf desain yang menjadi dasar penilaiannya sendiri salah.
Sampai salah satunya hadir, pembacaan yang dapat dipertahankan adalah yang sempit. AesCode-8B adalah yang lebih menarik di antara kedua model ini dan yang kurang dapat digunakan. Ia sangat baik pada bagian-bagian desain visual yang dapat diperiksa mesin, sedang-sedang saja pada bagian yang tidak dapat diotomatiskan, dan ia termasuk keluarga generasi Qwen3 yang sama dengan model yang dibandingkan dengannya tanpa diturunkan darinya. Qwen3-8B adalah model yang dapat Anda masukkan ke pipeline sore ini.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
