
AesCode 32B vs Qwen3.8 27B: Microsoft Membangunnya di Atas Qwen, dan Salah Satunya Dapat Dipanggil
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token · 85 tok/s
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Detail yang menata ulang seluruh perbandingan ini ada di baris kedua kartu model: AesCode 32B dimulai dari Qwen3-VL-32B-Instruct. Model kode khusus desain Microsoft adalah fine-tune Qwen3-VL, Apache 2.0, yang berada di repositori Hugging Face yang dibuat pada 29 September 2026, dengan commit berjudul "Release AesCode-32B" bertanggal 7 Oktober 2026 dan tanpa pengumuman apa pun dari Microsoft di mana pun. Qwen3.8 27B adalah ujung lain dari garis keturunan itu: model multimodal padat 27B berbobot terbuka milik vendor itu sendiri, dirilis pada 14 Agustus 2026 di bawah Apache 2.0, arsitektur penerus dari checkpoint VL yang di-fine-tune Microsoft. Jadi ini bukan pertarungan antara upaya andalan dua vendor. Ini adalah pertarungan antara model berbobot terbuka serbaguna milik satu lab dan fine-tune riset keluarga tersebut milik pesaing, dan perbedaan praktis di antara keduanya ternyata hampir seluruhnya tentang apa yang boleh Anda lakukan dengan berkas tersebut setelah Anda memilikinya.
Lisensi yang sama, keluarga yang sama, jumlah model yang berbeda
Keduanya Apache 2.0, keduanya menerima gambar maupun teks, dan keduanya mengembalikan teks. Setelah itu semuanya berbeda, dan baris deployment paling tajam perbedaannya.
• Parameter — AesCode 32B: 33B dense pada basis Qwen3-VL-32B-Instruct. Qwen3.8 27B: 27B dense, 28B dengan menghitung vision encoder, 64 lapisan pada ukuran tersembunyi 5120.
• Memori untuk menjalankannya — AesCode 32B: kartu model menyarankan merencanakan sekitar 65 GB memori akselerator hanya untuk parameter bf16, dan contoh serving-nya sendiri menggunakan paralelisme tensor empat arah. Qwen3.8 27B: sekitar 55,6 GB dalam bf16.
• Konteks — AesCode 32B: 24.576 token dalam konfigurasi yang dilaporkan, dengan prompt dan respons saat pelatihan dibatasi pada 8.192. Qwen3.8 27B: 262.144 token native, dapat diperluas hingga 1.000.000 dengan penskalaan YaRN.
• Atensi — AesCode 32B: diwarisi dari backbone Qwen3-VL. Qwen3.8 27B: hibrida, 48 lapisan atensi linear Gated DeltaNet berbanding 16 lapisan atensi penuh dengan rasio 3:1, itulah yang membuat jendela 262K terjangkau untuk dilayani.
• Untuk apa — AesCode 32B: menghasilkan artefak visual yang kaya informasi sebagai HTML dan CSS yang dapat diedit, plus penelitian tentang pembuatan kode multimodal. Qwen3.8 27B: pekerjaan agentic dan multimodal umum — pengodean, penggunaan komputer, pemahaman dokumen dan video, pemanggilan alat.
• Dari mana Anda mendapatkannya — AesCode 32B: unduhan Hugging Face; tidak ada penyedia inferensi yang menyebarkannya. Qwen3.8 27B: bobot, atau endpoint yang dihosting.
Konteksnya dua kali lipat, jejaknya sedikit lebih kecil, backbone satu generasi lebih baru, dan lisensi yang identik. Satu-satunya baris tempat AesCode 32B menang mutlak adalah baris pertama, dan kemenangan itu diraihnya pada fine-tune yang khusus untuk tugas.
Apa yang sebenarnya diukur pada masing-masing
Kedua rezim evaluasi itu tidak bersinggungan, dan berpura-pura sebaliknya adalah kesalahan umum pada halaman seperti ini.
Kartu Qwen3.8 27B luas sekaligus spesifik. Pengodean: Terminal-Bench 2.1 pada 73.0, SWE-bench Pro pada 61.7, QwenSWEBench pada 79.0, LiveCodeBench v6 pada 90.3. Penalaran: GPQA Diamond 89.2, Humanity's Last Exam 30.8. Penggunaan komputer: OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9. Visi: MathVision 94.6 dengan peningkatan waktu inferensi dari vendor dan 90.0 tanpanya, OmniDocBench 1.5 pada 91.1. Semua itu adalah angka milik vendor sendiri pada harness milik vendor sendiri — dengan catatan kaki yang patut dibaca, bahwa uji SWE-bench Pro dan QwenSWEBench menggunakan harness Claude Code, sehingga tidak dapat dibandingkan secara langsung dengan model yang dinilai pada harness berbeda.
AesCode 32B memiliki satu benchmark dan itu bertujuan tunggal: 300 sampel infografis, tiga generasi per prompt tanpa pemilihan, dirender dan dinilai di tujuh kanal. Sorotan utamanya adalah Overall sebesar 85,89 dengan gambar referensi yang disediakan, dibandingkan 81,28 untuk GPT-5.5 dan 80,39 untuk Claude Opus 4.8 di bawah harness yang sama — ditambah klaim bahwa AesCode 32B mengalahkan backbone Qwen3-VL-32B miliknya sendiri sebesar 22,4 poin pada dimensi Visual dan 24,8 pada Overall.
Tempatkan keduanya bersebelahan dan tidak ada yang selaras. Terminal-Bench mengukur apakah tugas shell selesai; evaluasi AesCode mengukur apakah teks infografis dapat terbaca, tata letaknya tidak meluap dari kanvas, dan tabelnya adalah tabel HTML sungguhan. Tidak ada metrik bersama, tidak ada harness bersama, dan tidak ada tugas bersama. Satu-satunya pernyataan yang jujur adalah bahwa AesCode 32B jauh lebih baik dalam artefak desain daripada backbone-nya sendiri, dan Qwen3.8 27B adalah model umum yang kuat — dan tidak ada dari kedua klaim itu yang memberi tahu Anda apa pun tentang yang lain.

Kesenjangan bukti kali ini nyata, dalam satu arah
Benchmark vendor adalah hal yang lazim di industri ini, jadi penting bahwa keduanya berbeda dalam seberapa banyak klaim vendor mereka yang telah diperiksa oleh pihak lain.
Qwen3.8 27B dirilis dengan tabel milik vendor sendiri dan kemudian mengumpulkan hasil eksternal dalam beberapa minggu. Catatan independen model tersebut mencakup studi agen hukum yang dijalankan oleh perusahaan AI hukum Harvey bersama startup memori Engram, di mana Qwen3.8 27B yang diadaptasi memimpin setiap model yang diuji dalam studi tersebut termasuk Claude Opus 4.8 pada 250 tugas hukum — dengan catatan penting bahwa model yang diadaptasi tersebut telah mempelajari korpus 100 juta token firma uji terlebih dahulu, sehingga ini adalah hasil tentang adaptasi sama seperti tentang modelnya. Ini mencakup penempatan di papan peringkat WebDev Code Arena dan posisi teratas untuk bobot terbuka di papan peringkat Image-to-WebDev Arena.ai, yang keduanya merupakan klaim peringkat yang disampaikan vendor alih-alih metodologi yang dipublikasikan. Dan ini mencakup papan pihak ketiga dengan skor yang dipublikasikan: Artificial Analysis mencatat Qwen3.8 27B pada 33.70 di Intelligence Index-nya dengan biaya per tugas yang diselesaikan sekitar $1.01, dan mempublikasikan rincian token di baliknya.
AesCode 32B tidak memiliki semua itu. Tidak ada penempatan di arena, tidak ada pencantuman di papan peringkat, tidak ada reproduksi pihak ketiga, tidak ada uji throughput independen — dan bukan karena ada yang memeriksa lalu menilainya kurang, tetapi karena checkpoint yang tidak dilayani oleh penyedia mana pun memang tidak dapat dievaluasi oleh harness eksternal sejak awal. Angka-angkanya milik vendor, dihitung oleh tumpukan verifier yang sama yang melatih model, pada sampel yang dipilih vendor, terhadap baseline yang dijalankan vendor. Rilis ini luar biasa transparan soal metode — nama kanal reward, jumlah rollout, parameter decoding, dan tingkat kegagalannya semuanya dipublikasikan — tetapi transparansi tentang bagaimana sebuah angka dihasilkan tidak sama dengan angka itu dihasilkan oleh orang lain.
Yang memerlukan kartu tersimpan
Di sinilah silsilah berhenti menjadi hal sepele dan mulai menjadi penentu keputusan.
AesCode 32B meminta Anda menyediakan 65 GB memori akselerator, jalur penyajian multimodal, dan kesediaan menjalankan model yang belum diumumkan sebagai early adopter. Contoh serving-nya sendiri menggunakan paralelisme tensor empat arah, dan model ini didokumentasikan untuk konteks 24.576 token tanpa opsi hosted yang bisa dijadikan fallback. Jika Anda sudah memiliki perangkat kerasnya dan pipeline Anda benar-benar membutuhkan fine-tuning khusus desain, itu pertukaran yang wajar. Bagi sebagian besar tim, ini adalah proyek dua minggu sebelum output pertama yang berguna.
Qwen3.8 27B di-host sendiri di infrastruktur milik OrcaRouter dan dapat dipanggil hari ini dengan harga $0,33 per juta token input dan $2,40 per juta output, dengan konteks 262.144 token serta input teks, gambar, dan video. Itu adalah tarif daftar yang diteruskan tanpa markup tambahan dari pihak kami, dan model ini berada pada kunci yang sama dengan lebih dari 200 model lainnya, sehingga perbandingan terhadap alternatif apa pun di katalog hanyalah parameter permintaan, bukan kontrak kedua. Itulah keseluruhan perkara praktisnya, dan itu perkara besar: model yang secara keluarga tertinggal satu generasi dari tulang punggung AesCode 32B adalah model yang dapat Anda evaluasi sore ini, dengan prompt Anda sendiri, seharga beberapa sen.
Ada poin tingkat kedua di sini yang dipertegas oleh sudut perutean. Karena AesCode 32B adalah fine-tune dari checkpoint Qwen3-VL, keluarga ini memberi Anda cara murah untuk menguji apakah sisi hosted dari arsitektur tersebut berfungsi sama sekali sebelum Anda berkomitmen untuk self-hosting apa pun. Qwen3-VL 235B A22B Instruct tersedia dengan harga $0.40 per juta input dan $1.60 output, dan Qwen3-VL 8B Instruct dengan harga $0.18 dan $0.70. Keduanya bukan AesCode 32B dan tidak satu pun telah dilatih untuk kualitas desain — tetapi "dapatkah model bahasa-visi membaca tangkapan layar kami dan menulis markup yang kami butuhkan" dapat dijawab dengan model-model itu hanya dengan beberapa sen, dan failover otomatis di bawah endpoint yang sama berarti hari buruk penyedia tidak akan melumpuhkan pipeline.

Siapa yang harus memilih yang mana?
Ambil AesCode 32B jika artefaknya adalah hasil akhir yang harus diserahkan. Anda memproduksi slide, dasbor, poster, atau laporan dalam jumlah besar, Anda memerlukan keluaran terstruktur yang tetap dapat diedit dan di-diff — model ini menghasilkan dokumen HTML lengkap, menggunakan struktur tabel HTML sungguhan dan spesifikasi ECharts sehingga keduanya tetap dapat diperiksa — dan Anda memiliki perangkat keras atau anggaran untuk menyewanya. Terimalah tiga hal saat masuk: tidak ada verifikasi independen untuk angka apa pun, sekitar 65 GB untuk bobotnya, dan konteks 24K yang akan membatasi dokumen panjang. Tingkat kegagalan batas kanvas parah sebesar 4,3% yang dilaporkan kartu tersebut, dibandingkan 34,7% untuk GPT-5.5, adalah angka tunggal paling menjanjikan dalam rilis ini, dan itu juga milik Microsoft.
Ambil Qwen3.8 27B jika Anda membutuhkan model multimodal berbobot terbuka serbaguna yang benar-benar bisa dijalankan dan benar-benar bisa dilayani. Konteks 262K, dapat diperluas hingga satu juta; ukuran deployment yang muat di tempat yang AesCode 32B tidak muat; posisi lisensi yang tidak berbeda; adanya pengukuran independen atas kualitasnya dan biaya per tugas yang diselesaikan; serta opsi hosted yang berarti Anda dapat mulai hari ini dan melakukan self-host nanti tanpa menulis ulang integrasi. Desain atensi bertahap dan per lapisan adalah alasan konteks panjangnya terjangkau, dan konteks panjang adalah hal yang paling sering dibutuhkan pipeline desain dan dokumen.
Dan jika Anda membutuhkan keduanya — generator artefak desain sekaligus pekerja serba bisa — pemisahan yang masuk akal bukanlah menjalankan dua model visi-bahasa kelas 30B di perangkat Anda sendiri. Arahkan lalu lintas umum ke sisi hosted dan biarkan model spesialis tetap self-hosted, di balik satu kunci, di mana gangguan penyedia di salah satu jalur menjadi peristiwa failover, bukan insiden.

Hal yang perlu diperhatikan
Posisi AesCode 32B berubah total jika ia menjadi dapat dipanggil. Saat ini, satu-satunya kelemahan nyata model ini adalah akses, dan itu adalah kondisi sementara — penyedia inferensi yang mengambil checkpoint, atau Microsoft yang menerbitkan endpoint, mengubah pengadaan 65 GB menjadi pemilihan model. Sampai saat itu, ringkasan jujur dari perbandingan ini adalah bahwa fine-tune lebih baik pada satu tugas, model umum lebih baik dalam hal dapat digunakan, dan model umum kebetulan adalah leluhurnya: Microsoft memilih checkpoint Qwen3-VL sebagai dasar untuk dikembangkan karena itu adalah basis multimodal terbuka terkuat yang tersedia, yang dengan sendirinya merupakan hal paling berguna yang bisa dikatakan oleh perbandingan ini tentang Qwen3.8 27B.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
