Kartu judul hero untuk 'AesCode-32B' dengan subjudul 'Microsoft mengunggah bobot 33B yang menulis presentasi sebagai HTML yang dapat diedit - dan tidak mengumumkan apa pun', tiga chip bertuliskan '33B parameter, BF16', 'Dasar: Qwen3-VL-32B-Instruct' dan 'Tidak ada API yang dihosting', ikon garis datar berupa jendela peramban yang memuat tata letak slide dengan panel bagan dan dua baris tabel, serta baris footer bertuliskan 'Berdasarkan microsoft/AesCode-32B di Hugging Face dan github.com/microsoft/AesCode, dibaca pada 11 Oktober 2026.'; logo OrcaRouter berada di sudut kanan bawah kanvas yang diperluas.
Guides & Insights

AesCode-32B: Model 33B Senyap Microsoft yang Menulis Dek sebagai HTML yang Dapat Diedit

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Stempel waktu pada AesCode-32B tidak saling sesuai, dan ketidaksesuaian itu merupakan sebagian besar dari yang dapat dilaporkan. Repositori Hugging Face microsoft/AesCode-32B dibuat pada 29 September 2026, tetapi semua isinya tiba dalam satu commit bertanggal 7 Oktober 2026 yang pesannya hanya "Release AesCode-32B" — dan stack pelatihan yang membuat hasilnya dapat direproduksi di-push ke github.com/microsoft/AesCode pada 8 Oktober. Microsoft tidak mengumumkan apa pun: tidak ada postingan blog, tidak ada pracetak arXiv, tidak ada pengajuan ke papan peringkat, tidak ada halaman model di situsnya sendiri. Yang ada adalah model visi-bahasa berparameter 33 miliar yang menerima prompt dan menghasilkan dokumen HTML lengkap dan mandiri — slide, poster, dasbor — plus pendamping yang lebih kecil, microsoft/AesCode-8B. Keduanya di-fine-tune dari model visi Qwen3-VL — Qwen3-VL-32B-Instruct dan Qwen3-VL-8B-Instruct masing-masing, keduanya Apache 2.0, dan keduanya dapat diunduh hari ini.

Id repo-nya bertuliskan microsoft/AesCode-32B dan kartunya dibuka dengan trik: AesCode memasangkan prompt Anda dengan gambar yang dihasilkan dari prompt yang sama, menggunakan gambar itu sebagai referensi estetika, dan mengikuti teks untuk konten yang sebenarnya. Generator gambar menyusun halaman yang menawan dan salah merender angka-angka di dalamnya; model kode membuat angka-angkanya benar dan tidak bisa melihat bagaimana halaman itu tampak. AesCode adalah upaya untuk mendapatkan keduanya, dan ringkasan jujurnya per 11 Oktober 2026 adalah bahwa bobotnya nyata dan dapat diperiksa, angka benchmark-nya milik lab itu sendiri pada harness yang ditulis lab tersebut, dan belum ada pihak di luar Microsoft yang menerbitkan angka untuknya. Tulisan ini menjaga ketiga kategori itu tetap terpisah sepanjang keseluruhannya.

Apa yang sebenarnya ada di repositori, byte demi byte

A headless-browser capture of the Hugging Face model page for microsoft/AesCode-32B, showing the repo heading, a Like count of 1, 'License: apache-2.0', the card intro text, the sentence describing training with GDPO, and the bulleted Paper, Code and Companion links; the surrounding Hugging Face navigation and search chrome is included.

Mulailah dari apa yang dapat Anda verifikasi tanpa mempercayai satu kata pun dari kartu model. Repositori 32B berisi empat belas shard safetensors dengan total 66.714.912.704 byte, yang pada BF16 kira-kira 33,4 miliar parameter — konsisten dengan "33B params" pada kartu tersebut dan peringatannya bahwa bobot saja membutuhkan sekitar 65 GB memori akselerator. Konfigurasi mendeklarasikan Qwen3VLForConditionalGeneration sebagai arsitektur dan qwen3_vl sebagai tipe model, jadi ini bukan arsitektur baru dan tidak membutuhkannya: ini dimuat dengan transformers>=4.57, dan kartu tersebut menyertakan perintah vLLM yang menyajikannya di empat rank tensor-paralel dengan dua gambar diizinkan per prompt dan batas 24.576 token.

Penghitung interaksi adalah bagian paling sepi dari rilis ini. Dua unduhan dan satu suka pada repositori 32B saat penulisan. Tidak ada entri dalam pemetaan penyedia inferensi Hugging Face, yang berarti tidak ada endpoint yang dihosting yang terhubung di balik halaman repo, dan tidak ada build GGUF, MLX, atau llama.cpp yang dipromosikan di mana pun. Untuk model yang menyandang nama Microsoft dan membawa hasil yang mengalahkan GPT-5.5 pada tabel milik vendor sendiri, itu adalah jejak yang sangat kecil — dan itu adalah bukti terkuat yang tersedia bahwa ini dipasang tanpa peluncuran di belakangnya.

Repositori kode pendamping melengkapi separuh lainnya dari lini masa, dan di sinilah pertanyaan tentang tanggal rilis menjadi benar-benar ambigu. microsoft/AesCodedibuat pada 23 Juli 2026 — sepuluh minggu sebelum bobotnya — dan memuat empat belas commit, yang semuanya ditulis oleh kontributor yang sama dan semuanya memiliki stempel waktu dalam selisih dua puluh detik dari yang lain pada 8 Oktober 2026, antara pukul 23:14:04 dan 23:14:24 UTC. Isinya mencakup spesifikasi untuk menghasilkan prompt dan persyaratan yang dapat diverifikasi, pipeline data yang membangun grafik desain dan pertanyaan rubrik, tahap SFT cold-start, loop pembelajaran penguatan GDPO, verifier rendering berbasis Playwright, pengujian, dan README yang mendokumentasikan semuanya. Tidak ada rilis dan tidak ada tag, deskripsi repositori kosong, dan repositori ini memiliki satu bintang.

A headless-browser capture of the github.com/microsoft/AesCode repository page, showing the org and repo name 'microsoft / AesCode', the line 'No description, website, or topics provided', the README summary listing overview, results and the reproduction guide, a commit count of 14, an MIT licence label, and the top-level directory tree including assets, data_prep, eval and examples/hospital_dashboard.

Jadi tanggal berapa rilisnya? Catatan repositori menyebut 29 September. Commit yang membawa model itu menyebut 7 Oktober. Kode yang menjelaskan bagaimana model itu dibuat menyebut 8 Oktober. Tiga stempel waktu dalam satu rentang dua minggu, tak satu pun disertai kalimat dari Microsoft yang menyatakan "kami merilis ini." Anggap 7–8 Oktober sebagai tanggal yang berlaku untuk artifak yang benar-benar akan diunduh kebanyakan orang, dan 29 September sebagai tanggal repositori itu dipesan. Siapa pun yang mengatakan AesCode-32B "diluncurkan" pada hari tertentu sedang memilih salah satu stempel waktu itu atas nama Anda.

Mekanismenya: sebuah gambar sebagai panduan estetika, sebuah grafik sebagai imbalannya

Klaim teknis kartu tersebut sempit dan spesifik, yang merupakan nilai plusnya. Model dilatih dengan penyetelan halus terawasi cold-start pada 3.000 demonstrasi dengan laju pembelajaran 1e-5, lalu dengan GDPO — varian optimisasi kebijakan relatif grup — atas 7.408 prompt selama 520 langkah. Model 8B menggunakan resep yang sama dan berhenti pada 400 langkah. Proses RL menggunakan mesin hibrida FSDP-vLLM milik verl tanpa critic dan tanpa model reward yang dilatih secara terpisah, AdamW pada 5e-6 konstan tanpa warmup, 128 prompt per langkah dengan delapan rollout masing-masing, serta prompt dan respons masing-masing dibatasi pada 8.192 token.

Yang membuat reward ini tidak biasa adalah bahwa ia bukan skalar tunggal. Setiap target pelatihan dijelaskan sebagai graf desain yang mencakup seluruh kanvas, sehingga properti individual dapat diatribusikan secara terpisah. Dari graf itu muncul tujuh kanal — eksekusi, teks, batas, grafik tabel, tata letak, ruang kosong, dan desain — masing-masing dinormalisasi dalam grup rollout-nya sebelum agregasi agar satu sinyal dominan tidak menenggelamkan yang lain. Verifikator deterministik menilai apa yang dapat diparsing dari kode dan rendering-nya; penilai visi-bahasa menilai apa yang tidak dapat, menggunakan rubrik yang terkait dengan elemen dan relasi graf itu sendiri. HTML kandidat dinilai dengan merendernya di browser Playwright yang dijalankan dalam sandbox dengan permintaan eksternal diblokir, yang mengekspor DOM, gaya terhitung, kotak pembatas, status konsol, dan tangkapan layar.

Konsekuensi teknisnya layak disebutkan karena tampak pada keluaran yang Anda terima: model dilatih untuk mengeluarkan tabel sebagai struktur tabel HTML sungguhan dan bagan sebagai spesifikasi ECharts, sehingga keduanya dapat diperiksa secara langsung alih-alih terkunci di dalam piksel. Itulah perbedaan antara dek yang dapat Anda serahkan kepada desainer dan dek yang dapat Anda serahkan kepada linter. Persyaratan reproduksinya pun sebanding beratnya — README meminta Python 3.10, CUDA 12.6, dan sebuah node dengan delapan GPU B200, menyematkan commit verl tertentu dan menyatakan dengan gamblang bahwa diperlukan patch terhadapnya karena verl bawaan tidak mendukung Qwen3-VL, serta memperingatkan bahwa tanpa pustaka sistem Playwright browser gagal diluncurkan dan halaman mendapat skor nol, dan bahwa tanpa stack OCR yang disematkan, kanal reward terkait mengembalikan nol alih-alih abstain dan secara diam-diam merusak sinyal.

Tabel tolok ukur, dan empat alasan untuk tidak berpegang terlalu ketat padanya

Angka-angka utama AesCode-32B berasal dari 300 sampel infografis, tiga generasi per prompt pada temperature 0,8 dan top-p 0,95, hingga 12.000 token keluaran masing-masing, tanpa pemilihan di antara generasi. Skor berupa persentase. Dengan referensi, model 32B melaporkan Teks 95,34, Batas 97,27, Tabel/Diagram 90,37, dan rata-rata Aturan 94,33; pada sisi visual, Konten 85,76, Tata Letak 90,58, Gaya 55,99, untuk rata-rata Visual 77,44 dan Keseluruhan 85,89. Dalam tabel yang sama, GPT-5.5 dengan referensi memperoleh skor Keseluruhan 81,28 dan Claude Opus 4.8 dengan referensi memperoleh 80,39, sedangkan backbone Qwen3-VL-32B-Instruct yang menjadi dasar pelatihan model memperoleh skor 61,10.

A single-column scoreboard headed 'AesCode-32B - the scoreboard' with six rows reading 'Parameters: 33B BF16 (66.7 GB of weights)', 'Base model: Qwen3-VL-32B-Instruct', 'Overall (vendor): 85.89 vs GPT-5.5 at 81.28', 'Boundary: 97.27 - severe overflow on 4.3% of samples', 'Style: 55.99 - no model in the table clears 60' and 'Hosted API: none - self-host only', with a footer line reading 'All figures vendor-reported by Microsoft on its own rubric; no independent run has been published.'; the OrcaRouter logo sits in the bottom-right corner of the extended canvas.

Ada empat peringatan yang perlu disampaikan bersamaan dengan angka-angka itu, dan tidak satu pun merupakan celaan terhadap pekerjaan tersebut. Pertama, setiap baris, termasuk baris GPT-5.5 dan Claude Opus 4.8, dijalankan oleh Microsoft pada harness Microsoft dengan rubrik Microsoft — itu bukan angka lab lain, melainkan pengukuran Microsoft terhadap model pesaing, dan kartu itu sendiri menyebut rubrik tersebut "spesifik terhadap sampel" untuk setiap grafik desain. Kedua, rubrik tersebut dihasilkan oleh pipeline yang sama yang menghasilkan data pelatihan, yang justru merupakan setup di mana sebuah tolok ukur dapat bergeser ke arah kekuatan suatu model; kartu itu terus terang tentang keterbatasan rubrik tersebut — Style, yang mensyaratkan sebuah desain tidak perlu revisi visual lebih lanjut sebelum dikirim, disebut "plafon bersama untuk setiap sistem" dan tidak ada model dalam tabel yang melewati 60. Ketiga, tidak ada pengukuran independen atas model ini di mana pun: tidak ada entri papan peringkat pihak ketiga, tidak ada reproduksi, dan dengan hanya dua unduhan, hampir pasti belum ada orang di luar lab yang menjalankannya. Keempat, perbandingannya secara halus asimetris dengan cara yang patut diperhatikan — semua baris AesCode-32B dikondisikan referensi, sehingga model diukur dalam konfigurasi yang menjadi tujuan pelatihannya, yang diakui kartu itu dengan menunjukkan bahwa kualitas tetap paling tinggi ketika referensi disediakan.

Satu hasil dalam tabel yang bertahan lebih baik daripada headline adalah klaim ketahanan, bukan klaim kualitas. Tidak memberikan gambar referensi saat inferensi hanya membuat AesCode-8B kehilangan 1,00 poin Visual, dibandingkan dengan 19,55 untuk backbone Qwen3-VL-8B-Instruct-nya dan 10,04 untuk GPT-5.5. Argumen kartu tersebut adalah bahwa pelatihan dengan kondisi referensi menginternalisasi perencanaan visual ke dalam kebijakan, alih-alih mengajari model menyalin apa yang dilihatnya. Itu dilaporkan vendor dan belum direproduksi, dan itu juga jenis klaim yang bisa dipastikan oleh satu uji coba independen — dan jenis yang paling penting dalam produksi, tempat Anda tidak akan selalu memiliki gambar referensi yang tersedia.

Berapa biaya untuk menjalankannya, dan apa artinya itu bagi perbandingan

Tidak ada yang murah dari model ini untuk dihosting sendiri. Sepuluh hingga dua belas ribu token keluaran adalah ukuran kerja satu artefak, dan dokumen HTML lengkap dengan spesifikasi ECharts lebih mendekati batas atas rentang itu daripada batas bawahnya, jadi setiap proses generasi adalah dekode yang panjang. Resep penyajian kartu itu sendiri meminta empat GPU dengan paralelisme tensor untuk menampung sekitar 65 GB parameter BF16, dan resep pelatihannya meminta delapan B200. Itu mesin sungguhan, bukan deployment hobi, dan itu menetapkan syarat perbandingannya: model-model yang dibandingkan dengan AesCode-32B disewa per token, dan model itu sendiri disewa per jam GPU, entah Anda memiliki perangkat kerasnya atau tidak.

Bentuk praktis dari perbandingan itu adalah inti mengapa sebuah lapisan routing ada, dan penting untuk bersikap tepat tentang apa yang kami host dan tidak kami host. AesCode-32B tidak ada di katalog OrcaRouter dan kami tidak menyediakannya — tidak ada endpoint terhosting untuknya di mana pun yang dapat saya verifikasi, termasuk milik Microsoft. Yang ada di katalog adalah sisi lain dari perbandingan ini: model terhosting yang akan Anda gunakan sebagai tolok ukur untuk menguji generator artefak yang dihosting sendiri, termasuk GPT-5.5 dan model visi Qwen3-VL yang lebih kecil, dapat diakses melalui satu kunci API pada harga daftar penyedia dengan markup 0%, yang berarti perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama. Membandingkan endpoint sewaan dengan model yang Anda jalankan sendiri tidak memerlukan kontrak kedua atau SDK kedua, dan DSL routing memungkinkan panggilan yang dihosting sendiri berada di samping panggilan terhosting di balik satu endpoint. Jika AesCode-32B ternyata bagus pada satu hal yang diklaim kartu modelnya, biaya untuk mengetahuinya adalah tagihan GPU, dan biaya alternatif yang Anda bandingkan dengannya adalah satu kunci yang mungkin sudah Anda miliki.

Apa yang bisa Anda lakukan dengannya hari ini, dan apa yang tidak ada

• Unduh dan jalankan — bobotnya Apache 2.0, mengikuti backbone Qwen3-VL, dengan empat belas shard BF16 dan jalur transformers yang berfungsi di atas versi 4.57 dan resep vLLM di kartu.

• Reproduksi pelatihan — kodenya berlisensi MIT dan cukup lengkap untuk bermakna: verifier reward, pembangun rubrik, tahap SFT dan GDPO, commit verl yang dipin beserta patch yang menambahkan dukungan Qwen3-VL, dan README yang mencantumkan mode kegagalan alih-alih menyembunyikannya.

• Evaluasi secara tanpa referensi — model menerima prompt dengan atau tanpa gambar referensi, dan klaim kartu yang paling dapat diuji terletak pada konfigurasi tersebut.

• Dapatkan API untuknya — Anda tidak bisa. Tidak ada endpoint yang dihosting, tidak ada pemetaan penyedia inferensi di repositori, dan tidak ada build GGUF atau MLX; menjalankannya berarti menjalankan perangkat kerasnya.

• Baca makalahnya — Anda belum bisa. Kartu itu menautkan makalah berjudul AesCode: Generasi Kode Estetis dengan Reward Cross-Modal yang Terpisah, dan entri BibTeX-nya sendiri mencantumkan tempat publikasi sebagai "Sedang ditinjau" dan tahunnya 2027. Pencarian di arXiv tidak menghasilkan makalah dengan judul itu. Ada makalah Microsoft yang berbeda dan lebih awal dengan nama yang nyaris identik — Estetika Kode dengan Umpan Balik Reward Agentik dari Oktober 2025, yang merilis model AesCoder-4B dan dataset AesCode-358K — dan tidak ada apa pun di kartu AesCode-32B yang mengutipnya atau menyatakan hubungan dengannya. Jika Anda mencari bacaan latar dan malah menemukan yang itu, Anda sedang membaca tentang model berbeda yang dibuat oleh penulis yang tumpang-tindih.

• Bandingkan di papan peringkat publik — belum. Tidak ada indeks pihak ketiga yang tampaknya telah mengevaluasinya, yang tidak mengherankan untuk repositori dengan dua unduhan.

Siapa yang harus peduli, dan siapa yang tidak.

Audiens untuk ini lebih sempit daripada yang disiratkan tabel headline dan lebih spesifik daripada "siapa pun yang membangun dengan model." Jika produk Anda mengubah prompt menjadi presentasi, poster, laporan, atau dasbor yang harus diedit oleh seseorang setelahnya, Anda sudah menemukan pilihan yang menjadi sasaran model ini: pembuatan gambar memberi Anda persegi panjang indah yang tidak dapat Anda ubah, dan pembuatan kode memberi Anda sesuatu yang dapat diedit yang tampak seperti dirangkai oleh kompilator. Model open-weights 33B yang menghasilkan dokumen HTML lengkap dengan tabel sungguhan dan spesifikasi ECharts, yang tetap berada dalam sekitar satu poin dari kualitas yang dikondisikan referensinya ketika Anda tidak punya referensi untuk diberikan kepadanya, dan yang dapat Anda fine-tune sesuai gaya internal Anda sendiri di bawah Apache 2.0, adalah hal yang benar-benar berguna untuk ada. Tidak ada model lain yang melakukan pekerjaan persis itu pada ukuran ini dengan ketentuan ini.

Sebaliknya: segala yang Anda ketahui tentang kualitas berasal dari tabel yang dibuat vendor, rubrik di baliknya dihasilkan oleh pipeline yang sama yang membuat data pelatihan, dan satu-satunya plafon yang diakui kartu tersebut — Style di bawah 60 untuk setiap sistem yang diuji — justru merupakan dimensi yang paling dipedulikan oleh produk yang sensitif terhadap desain. Tim yang punya alasan kepatuhan untuk menjalankan generasi di internal dan memiliki node delapan-GPU cadangan sudah cukup untuk mulai hari ini. Tim yang memilih model untuk produksi minggu depan tidak punya angka independen sebagai dasar memilih, dan tidak boleh membaca 85.89 dibanding 81.28 sebagai hasil yang sudah final.

Apa yang akan membuat ini menjadi sebuah cerita?

Empat hal, yang belum ada satu pun. Sebuah pengumuman — Microsoft belum mengatakan apa pun, dan makalah yang dirujuk kartu model tersebut secara eksplisit sedang dalam peninjauan, jadi laporan teknis dengan detail pelatihan di luar ringkasan kartu model itu bisa muncul kapan saja. Sebuah pengujian independen — klaim ketahanan tanpa referensi dan skor Boundary, yang menurut kartu model tersebut mengalami kegagalan parah pada 4,3% sampel versus 34,7% untuk GPT-5.5, keduanya murah untuk diuji dan keduanya layak diuji. Dukungan serving di luar resep vendor — build GGUF atau entri runtime arus utama akan mengubah narasi perangkat keras lebih daripada benchmark apa pun. Dan poin data kedua tentang pertanyaan ukuran: model 8B yang mencetak 82,94 Overall dibandingkan 85,89 milik 32B pada tabel yang sama adalah selisih dua poin untuk seperempat parameter, hal semacam itu entah akan direproduksi atau diam-diam berhenti disebutkan.

Sampai salah satu dari hal-hal itu terwujud, deskripsi yang akurat tentang AesCode-32B adalah ini: bobot nyata di bawah lisensi permisif, tumpukan pelatihan yang cukup terperinci untuk direproduksi oleh lab yang perlengkapannya memadai, tabel tolok ukur yang merupakan pengukuran satu perusahaan atas modelnya sendiri dan atas dua pesaingnya, serta riwayat repositori yang tidak memungkinkan Anda menyebut satu hari tertentu sebagai tanggal peluncuran. Ini adalah artefak yang lebih menarik daripada yang disiratkan oleh penghitung dua unduhannya, dan artefak yang kurang terbukti daripada yang disiratkan oleh nilai 85.89-nya. Kedua bagian kalimat itu adalah pembacaan yang jujur pada 11 Oktober 2026.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari