
GLM-5.3-Flash, Lima Minggu Kemudian: 42 Independen, Uji Coba Eksploitasi Tingkat Mythos, dan Agen GLM yang Membangun Ulang Stack Penyajiannya Sendiri
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token · 87 tok/s
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
GLM-5.3-Flash telah melayani lalu lintas produksi selama lima minggu, dan pada 17 September 2026 Zhipu AI mengatakan sesuatu tentang di mana: perusahaan mengungkapkan bahwa setiap permintaan produksi untuk GLM-5.3-Flash kini berjalan di atas armada lebih dari 100.000 akselerator AI Tiongkok yang diproduksi di dalam negeri, bahwa model itu beralih dari boot pertama di perangkat keras tersebut menjadi menjalankan seluruh beban kerja aktifnya dalam waktu kurang dari dua minggu, dan bahwa throughput end-to-end naik 3,2x sepanjang periode yang sama. Bagian yang paling banyak diberitakan adalah siapa yang mengerjakan pekerjaan itu. Sebagian besar pekerjaan itu tidak dilakukan oleh tim infrastruktur, melainkan oleh agen yang digerakkan oleh GLM-5.3 sendiri, yang membaca hambatan, mengusulkan perbaikan, dan menulis kode sistem inferensi, sementara para insinyur menetapkan tujuan, membangun lingkungan umpan balik, dan meninjau apa pun yang bersinggungan dengan semantik numerik, konkurensi, atau risiko produksi. GLM-5.3-Flash adalah model multimodal 320 miliar total, 18 miliar aktif (320B-A18B) yang diluncurkan dan di-open-source-kan oleh Zhipu pada 26 Agustus 2026 — "Ox Alpha" anonim yang diungkapkan perusahaan hari itu — dan saudaranya yang lebih besar, GLM-5.3, adalah model unggulan 743B yang dijadikan acuan penetapan harganya. Tidak ada satu pun dari ketiga angka dalam pengungkapan hari ini yang berasal dari kami atau dari pihak lain mana pun: angka-angka itu milik Zhipu sendiri. Model unggulan juga bukan lagi satu-satunya pembanding yang penting: pada ExploitBench, evaluasi independen tentang seberapa jauh sebuah model menaiki tangga eksploit Chrome sungguhan, GLM-5.3-Flash kini terukur setara dengan Claude Mythos Preview, model frontier tertutup yang dirilis pengembangnya hanya kepada defender yang telah diverifikasi, dengan biaya per percobaan hanya sebagian kecilnya.
Itu kabar baiknya, dan itu nyata tetapi disampaikan oleh pihak vendor. Tiga hal lain telah berubah sejak tulisan ini pertama kali terbit pada hari peluncuran, dan dua di antaranya berimbas ke arah sebaliknya. Artificial Analysis kini telah menerbitkan pengukurannya sendiri atas model tersebut, dan angkanya bukan angka Zhipu. Diskon peluncuran yang menjadikan ini model mumpuni termurah di pasar berakhir sesuai jadwal pada 9 September dan tidak diperpanjang. Dan sebuah lembaga evaluasi pihak ketiga, Generality Labs, telah menerbitkan uji ExploitBench-nya sendiri yang di dalamnya GLM-5.3-Flash mencetak skor di atas rata-rata tiga kali pengujian Claude Mythos Preview pada tangga yang sama — dengan biaya sekitar enam sen untuk setiap dolar. Bagi siapa pun yang menandai model ini pada akhir Agustus sebagai “yang murah,” perhitungannya hari ini berbeda dari sebelumnya, dan judul yang jujur adalah judul yang campur aduk: ekonomi penyajiannya benar-benar membaik, harganya naik karena sebuah promosi berakhir, angka kecerdasan yang banyak dikutip tidak bertahan saat pertama kali berhadapan dengan harness independen, dan perbandingan kemampuan yang memang berpihak pada model ini adalah satu uji tunggal tanpa telaah sejawat yang menurut penulisnya sendiri tidak boleh ditafsirkan secara berlebihan.
Zhipu adalah satu-satunya sumber untuk ukuran klaster, linimasa dua minggu, dan angka 3,2x — tidak ada audit independen atas satu pun dari semua itu, dan perusahaan itu sendiri mengatakan bahwa mereka belum mencapai peningkatan diri rekursif, menggambarkan hasilnya sebagai loop skala minimum, bukan hal yang sesungguhnya. Apa yang bisa diperiksa, kami periksa: satu artefak konkret dalam laporan ini yang berada di luar tembok Zhipu — perbaikan presisi pada kernel Flash Linear Attention — benar-benar telah di-merge ke upstream, dan kami mengonfirmasinya. Jika sebuah angka di bawah berasal dari Zhipu, asalnya disebutkan. Jika berasal dari Artificial Analysis, yang disebutkan justru itu. Jika berasal dari Generality Labs — lembaga evaluasi keselamatan di balik angka eksploitasi dalam tulisan ini — hal itu disebutkan, bersama dengan catatan-catatan yang dilampirkan sendiri oleh para penulisnya: satu kali eksekusi, 41 bug, metode yang diterbitkan sendiri, tanpa reproduksi pihak ketiga, dan pertanyaan kontaminasi yang mereka ajukan atas inisiatif sendiri. Jika sebuah angka berasal dari Anthropic — satu-satunya angka di sini yang berasal dari lab yang memiliki kepentingan kompetitif dalam jawabannya — isi tulisan menyebutkan model mana yang sebenarnya diukur, karena tidak semuanya adalah model ini.
Apa yang sebenarnya dirilis
GLM-5.3-Flash adalah model mixture-of-experts dengan total 320B / aktif 18B dan 45 lapisan, yang membuat jejak aktifnya sedikit lebih dari setengah milik GLM-5.2 yang sekitar 32B. Kemampuan utamanya adalah modalitas: secara native model ini menerima input teks, gambar, dan video — model GLM-5 pertama yang melakukannya — alih-alih mengarahkan visi melalui adaptor terpisah. Konteksnya mencapai 1 juta token, dan Zhipu mengklaim biaya penyajian konteks panjang berada di sekitar sepertiga dari GLM-5.3.
Dari segi arsitektur, Zhipu menggambarkannya sebagai model frontier open-source pertama yang memadukan attention hibrida sparse-plus-linear dengan Manifold-Constrained Hyper-Connections (mHC) untuk penskalaan, serta mekanisme IndexPool yang memampatkan empat vektor kunci indexer menjadi satu kumpulan berbobot guna memangkas latensi konteks panjang. Pra-pelatihan dijalankan pada korpus multimodal 30 triliun token. Tidak ada satu pun dari itu yang diaudit secara independen — itu adalah Zhipu yang menggambarkan modelnya sendiri — tetapi klaim efisiensi penyajiannya cukup spesifik untuk diuji sekarang, karena bobotnya sudah tersedia di depan tumpukan inferensi open-source, dan laporan 17 September itu menambahkan gambaran rinci pertama tentang bagaimana sisi penyajian sebenarnya dibangun.
Sekilas lembar spesifikasi hari peluncuran:
Parameter — total 320B / aktif 18B, 45 lapisan, MoE.
• Modalitas — input teks, gambar, dan video native; output teks.
• Jendela konteks — hingga 1.000.000 token.
• Lisensi — MIT, bobot terbuka di Hugging Face sejak hari peluncuran.
• Harga — $0.15 / $0.50 per juta token (input / output), $0.03 per juta input yang di-cache.

Kartu itu adalah cuplikan kondisi saat hari peluncuran, dan dua barisnya sudah berubah sejak 26 Agustus. Angka AA Index masih merupakan klaim Zhipu sendiri dan kini dibantah oleh pengukuran independen — selengkapnya di bawah. Harga diskon yang ditampilkannya sudah tidak berlaku; promosi berakhir pada 9 September. Jumlah parameter, jendela konteks, lisensi, dan modalitas merupakan fakta terkini yang tidak berubah, dan itulah yang menjadi tujuan utama gambar tersebut.
Pekan Ox Alpha, dan apa yang sebenarnya diuji oleh giveaway gratis itu
Pengungkapan itu mengakhiri sepekan spekulasi. Pada 20 Agustus, sebuah model anonim muncul di platform API AI pihak ketiga dengan jendela konteks 1 juta token, input teks/gambar/video, dan harga nol, lalu dengan cepat menjadi model yang paling banyak dipanggil di grafik mingguan platform tersebut. Komunitas melacaknya kembali ke keluarga GLM milik Zhipu dalam 48 jam — pola anonim-lalu-diklaim yang sama yang sebelumnya telah mengidentifikasi model dari laboratorium Tiongkok lain — dan para analis secara luas menduga varian Flash dari GLM-5.3. Pengumuman 26 Agustus mengonfirmasi dugaan itu: pekan gratis tersebut adalah uji yang disengaja, dan perusahaan mengatakan bahwa uji anonim itu memproses lebih dari 62 triliun token dalam enam hari di seluruh platform pengodean tempat model itu ditawarkan, semuanya dilayani dari chip Tiongkok domestik.
Klausul terakhir itu tampak seperti catatan kaki saat itu. Ternyata justru itulah intinya. Pekan gratis itu bukan terutama gimik pemasaran atau bahkan uji beban terhadap model; itu adalah uji beban armada akselerator di bawahnya, yang dijalankan pada skala di mana kegagalan akan menjadi publik dan gratis. Tiga pekan kemudian, Zhipu menggambarkan armada yang sama menangani 100% lalu lintas produksi model tersebut.

Logika penetapan harga minggu itu masih berlaku, dengan satu koreksi. Model yang digratiskan pada harga $0 selama seminggu lalu diluncurkan pada sepersepuluh harga model unggulan dengan diskon tambahan 50% adalah langkah sengaja untuk menciptakan pasar di segmen anggaran, dan keterangan "waktu terbatas" selalu menjadi bagian yang perlu diperhatikan. Kami menandainya sebagai hal yang bisa ditarik kembali. Itu ditarik kembali sesuai jadwal — yang layak dikatakan terus terang, karena berakhirnya diskon adalah satu-satunya perubahan dalam cerita ini yang muncul di tagihan.
Tumpukan penyajian yang dibangun ulang oleh agen
Laporan teknis Zhipu pada 17 September adalah deskripsi terperinci pertama tentang bagaimana GLM-5.3-Flash dilayani di silikon Tiongkok, dan klaim utamanya adalah bahwa sebuah model membantu mengoptimalkan sistem yang menjalankannya. Perusahaan menyebut mekanisme ini umpan balik padat: uji kebenaran, log eksekusi, trace, microbenchmark, dan metrik end-to-end dirangkai sehingga agen dapat memvalidasi hipotesis secara lokal alih-alih menunggu deployment penuh dan uji beban setelah setiap perubahan. Agar hal itu berhasil, Zhipu mengatakan umpan balik tersebut harus lokal, murah, dan dapat diperiksa secara objektif — terikat pada kernel atau jalur kode tertentu, cukup cepat untuk dilakukan iterasi, dan benar atau salah tanpa manusia dalam loop.
Dengan loop itu sudah diterapkan, agen menemukan dan memperbaiki tiga hal yang telah dijelaskan perusahaan secara terperinci:
• Jalur paralel konteks di dalam kernel KDA kehilangan presisi seiring bertambahnya panjang sekuens, karena tl.dot secara default memakai TF32 meskipun inputnya FP32, sehingga galat pembulatan makin menumpuk seiring panjang konteks. Perbaikannya menyematkan presisi input ke tf32x3, dengan fallback ke ieee pada platform yang tidak mendukung TF32. Yang ini paling menarik dari ketiganya, karena ini satu-satunya klaim dalam laporan tersebut yang keluar dari infrastruktur milik Zhipu sendiri: perubahan ini di-merge ke upstream di Flash Linear Attention sebagai PR #1180, yang kami periksa dan konfirmasi telah di-merge pada 27 Agustus 2026.
• Transfer KV tidak tumpang tindih dengan penjadwalan DeepEP. Baik dispatch intranode maupun combine intranode sama-sama tidak melepaskan GIL Python pada versi DeepEP yang digunakan, sehingga membuat thread transfer terhambat di belakangnya; catatan berbahasa Inggris dan berbahasa Tionghoa dari tulisan yang sama menyebut overhead yang dihasilkan masing-masing di atas 20% dan di atas 30%. Setelah perbaikan, Zhipu mengatakan selisih terhadap baseline khusus prefill-nya turun di bawah 1%.
• Kernel decode menghitung ulang normalisasi dan gating FP32 yang sama empat kali, sekali per tile dimensi-V. Memecah pekerjaan pembagian memangkas waktu kernel sebesar 9,6%, dan menggabungkan tile-tile tersebut ke dalam satu blok thread — sehingga normalisasi dijalankan sekali — menghasilkan percepatan 1,71x.
Di sekitar perbaikan itu terdapat perubahan struktural: ReplaySSM, yang menukar komputasi dengan memori on-chip karena akselerator memiliki lebih sedikit memori tersebut dibandingkan GPU yang awalnya menjadi target penulisan stack ini; paralelisme tensor intra-node untuk meredakan tekanan yang sama; caching campuran INT8, FP8, dan BF16 untuk memperluas kapasitas; serta arsitektur terdisagregasi Encode-Prefill-Decode yang menjadwalkan ketiga tahap inferensi secara terpisah alih-alih sebagai satu pipeline. Zhipu juga menyebutkan kendala-kendalanya secara jujur — memori on-chip dan bandwidth interkoneksi yang terbatas, perangkat lunak yang belum matang, cakupan kernel yang belum lengkap, dan dokumentasi yang minim — serta mengatakan bahwa pihaknya belum mencapai peningkatan diri rekursif, dengan menggambarkan hasilnya sebagai loop berskala minimum.
Bacalah laporan itu dengan skeptis, karena insentifnya sudah jelas. Zhipu tidak akan mengatakan berapa banyak pekerjaan yang dilakukan agen versus berapa banyak yang dilakukan para insinyur, dan tidak ada audit eksternal atas angka throughput, linimasa dua minggu, atau ukuran klaster. Pembingkaian umpan balik padat juga mementingkan diri sendiri dengan cara yang spesifik: ia membuat klaim yang paling terdengar mengesankan ("model kami meningkatkan dirinya sendiri") bertumpu pada bukti yang paling tidak dapat diverifikasi (lingkaran internal yang tidak bisa diperiksa siapa pun). Yang mencegah kisah ini menjadi pemasaran murni adalah bahwa klaimnya yang paling konkret dapat difalsifikasi dan ternyata benar — perbaikan kernel tf32x3 memang ada di repositori upstream, bertanggal 27 Agustus, tiga minggu sebelum siklus pemberitaan seputar hal itu.
Berapa biayanya, dalam dolar sebenarnya
Daftar tarif ini milik Zhipu, dan sederhana: $0.15 per juta token masukan, $0.50 per juta token keluaran, dan $0.03 per juta token masukan yang di-cache. Itu adalah harga daftar per hari ini. Promosi peluncuran diskon 50% berlangsung hingga 9 September 2026 dan tidak diperpanjang, jadi angka $0.075 / $0.25 / $0.015 yang beredar luas pada akhir Agustus tidak lagi tersedia di API milik vendor itu sendiri. Dibandingkan dengan $1.40 / $4.40 yang dipublikasikan GLM-5.3, Flash masih berada di sekitar sepersepuluh pada harga daftar — diskonnya hanyalah bonus di atas harga yang memang sudah menjadi daya tarik utamanya, bukan harga itu sendiri. Artificial Analysis menghitung tarif campuran sekitar $0.10 per juta token pada komposisi cache-hit/masukan/keluaran 7:2:1, dan mencantumkan kecepatan keluaran sekitar 117 token per detik, yang digambarkannya sebagai sangat cepat, meskipun AA mencatat bahwa angka kecepatan tersebut menggambarkan API pihak pertama milik model itu, bukan pengujian yang dijalankan AA.
Kisah biaya Zhipu yang lebih luas adalah alasan harga bisa tetap di posisi itu. Dalam hasil setengah tahunnya, yang diterbitkan pada 31 Agustus, perusahaan mengatakan biaya inferensi per token pada armada domestiknya yang berjumlah 100.000 akselerator telah turun 80% sejak awal 2026, dan bahwa margin bruto API naik dari -0,4% menjadi 24,6% sebagai hasil dari skala, penetapan harga, dan penyajian yang lebih murah. Itu adalah angka perusahaan dari perusahaan yang melapor kepada pemegang saham, dan angka tersebut tidak diaudit oleh kami; anggap itu sebagai arah yang jelas, bukan angka yang presisi. Uraian penyajian di atas adalah mekanisme di balik klaim tersebut — lebih sedikit lintasan kernel yang redundan, tekanan memori yang lebih rendah, tumpang tindih yang lebih baik — yang merupakan cerita yang lebih kredibel daripada sekadar persentase, meskipun persentase itulah yang akan dikutip.
Klaim efisiensi terhadap produk unggulan tidak berubah: komputasi attention turun 3,0x dan KV cache turun 4,4x dibandingkan GLM-5.3, menurut laporan vendor, dengan Zhipu mengakui bahwa KV cache-nya masih sedikit lebih besar daripada milik DeepSeek V4 Flash dan Kimi K3. Klaim saat peluncuran tentang peningkatan penyajian end-to-end sebesar 3x pada chip domestik kini dinyatakan sebagai 3,2x, diukur dari boot pertama hingga lalu lintas produksi penuh. Kedua angka tersebut milik Zhipu, dan dua catatan yang memuatnya berjarak tiga minggu — tidak ada satu pun di sini yang telah direproduksi di luar perusahaan.
Mengapa pengungkapan ini penting — dan ke mana angka utamanya pergi
Berikut koreksi yang paling penting bagi siapa pun yang membaca liputan peluncuran dan mencamkan angka itu. Materi Zhipu menempatkan GLM-5.3-Flash pada 57 di Artificial Analysis Intelligence Index, setara dengan Claude Opus 4.8. Artificial Analysis sejak itu menerbitkan pengukurannya sendiri atas model tersebut pada Intelligence Index v4.3, dan angkanya 42 — dibandingkan 47 untuk GPT-5.6 Sol (max) pada versi yang sama. Angka 57 itu tidak pernah menjadi angka independen; itu angka Zhipu, dan pengukuran independen menempatkan model tersebut sekitar lima poin di bawah rentang yang berdekatan dengan frontier dan jauh di bawah angka utama vendor. Pada indeks terkini yang sama, GLM-5.3 sendiri terukur 45, sehingga angka 60 untuk model unggulan yang muncul dalam liputan peluncuran kami tidak lagi cocok dengan apa yang Artificial Analysis terbitkan hari ini. Selisih 15 poin antara klaim dan pengukuran bukanlah perbedaan pembulatan, dan itu adalah hal paling berguna yang bisa diambil pembaca dari pembaruan ini — dengan satu kualifikasi yang ditambahkan bagian di bawah ini, karena pengukuran independen kedua dalam kisah ini menunjukkan arah yang berlawanan.
Yang bertahan setelah koreksi itu lebih sempit tetapi tetap nyata. GLM-5.3-Flash adalah model multimodal berbobot terbuka dengan konteks 1M serta masukan gambar dan video native, dengan harga sekitar sepersepuluh harga daftar model unggulan sekawanannya — kombinasi yang tidak punya padanan langsung dari laboratorium terdepan AS, yang model multimodal sebandingnya jauh lebih mahal dan dirilis secara tertutup. Pembingkaian Zhipu sendiri, "kecerdasan terdepan, biaya kilat," adalah bagian yang terkena imbasnya: pada angka terukur 42, ia adalah model hemat yang kuat, bukan model terdepan dengan diskon. Pengukuran independen juga menempatkannya dengan nyaman di atas median untuk model berbobot terbuka berukuran serupa, yang merupakan pencapaian nyata bagi model dengan 18B parameter aktif dan sepersepuluh biaya inferensi — hanya saja itu pencapaian yang berbeda dari yang tersirat dalam liputan peluncurannya.
Angka independen lainnya — dan itu berpihak pada model
Jika hasil Artificial Analysis menurunkan pamor GLM-5.3-Flash, yang ini sebaliknya, dan itu fakta paling aneh dalam kisah ini. ExploitBench, yang dibangun di Carnegie Mellon, tidak bertanya apakah sebuah model dapat membuat target crash. Ia menilai pendakiannya: mencapai kode rentan, memicu bug, membangun primitif yang dapat digunakan kembali, dan akhirnya pembajakan aliran kendali penuh dengan eksekusi kode arbitrer, dinilai secara mekanis terhadap V8 produksi dengan sandbox keamanan diaktifkan. Generality Labs menjalankan GLM-5.3-Flash pada 41 bug dengan anggaran 1 miliar token per bug alih-alih batas 300 giliran yang biasa pada benchmark itu, dengan argumen bahwa giliran adalah proksi yang buruk untuk apa yang sebenarnya dibelanjakan pembeli dan dolar adalah kendala yang jujur. GLM-5.3-Flash mencapai eksekusi kode arbitrer penuh pada 13 dari 41, dan skor kemampuan rata-rata 64,8% dari maksimum tangga tersebut. Tiga run yang dipublikasikan Claude Mythos Preview mencetak 9, 10, dan 11 pada tangga yang sama — rata-rata 10, atau 62,2%. Pembingkaian Generality sendiri, yang dicetak di bawah grafik, adalah bahwa GLM-5.3-Flash “mungkin setingkat Mythos dalam hal siber” pada pengukuran ini. Run ExploitBench milik Anthropic sendiri, yang dipublikasikan 29 September, melaporkan urutan yang sama pada tingkat absolut yang jauh lebih rendah — meskipun pada GLM-5.3 unggulan, bukan pada Flash: ia menghitung eksploit end-to-end per percobaan alih-alih kemajuan tangga, dan menempatkan GLM-5.3 pada 50 dari 410 berbanding 56 dari 410 milik Mythos Preview. Aturan penghitungan yang berbeda, urutan yang serupa — itulah tepatnya sebabnya angka ExploitBench tidak boleh dikutip tanpa aturan yang disertakan.
Alasan yang penting adalah penyebut di baliknya. Uji coba itu memberi harga token keluaran GLM-5.3-Flash pada $0,25 per juta — tarif peluncuran diskon 50% miliknya, yang sejak itu telah berakhir — dibandingkan dengan harga historis Claude Mythos Preview sebesar $125 per juta, selisih 500 kali lipat. Pada paritas biaya, uji coba tersebut menghabiskan $16,81 per kerentanan, dibandingkan dengan $297,17 milik Mythos, dan dari situlah angka sekitar 6% berasal. Bacalah klaim itu dengan cermat, karena versi yang beredar adalah versi yang salah. Bukanlah bahwa GLM-5.3-Flash adalah pengembang eksploit yang lebih baik daripada Claude Mythos Preview. Melainkan bahwa satu dolar token GLM-5.3-Flash memberi kira-kira apa yang diberikan satu dolar token Mythos pada tugas spesifik ini, dan bahwa Anda mampu membeli jauh lebih banyak dolar token yang pertama.
Caveat dari Generality sendiri lebih berharga daripada judul utamanya. Mereka menyatakan dengan gamblang bahwa satu kali eksekusi tidak menetapkan paritas di seluruh bidang siber secara keseluruhan, bahwa kontaminasi masih menjadi pertanyaan terbuka — ExploitBench mungkin telah dijadikan sasaran pelatihan dengan cara tertentu — dan bahwa empat dari 41 sampel mengalami galat dan dinilai dengan meneruskan hasil terakhir yang teramati, yang jika ada justru meremehkan model tersebut. Mereka juga menerbitkan tindak lanjut pada 28 September yang memperumit seluruh perbandingan. Menjalankan GLM-5.3-Flash melalui tujuh harness agen yang berbeda dengan anggaran 250 juta token, pada sepuluh sampel yang dipilih untuk mencakup rentang kesulitan, bobot yang sama memperoleh skor 10,6 dengan harness Codex — di atas referensi 10,02 Claude Mythos Preview — dan 6,2 dengan harness Claude Code, bahkan di bawah konfigurasi asli tolok ukur yang dibatasi giliran pada 6,4. Harness mengubah skor lebih besar daripada perbandingan model, dan para penulis mengatakan subset sepuluh sampel itu mungkin tidak representatif. Bahwa grafik tersebut beredar luas pada 2 Oktober dengan argumen bahwa penskalaan komputasi saat pengujian sedang menghapus kesenjangan antar tingkat model adalah klaim tentang industri, bukan temuan evaluasi: yang ditemukan evaluasi adalah bahwa model terbuka yang murah, jika diberi anggaran alih-alih batas giliran, dapat mencapai spesialis eksploit milik laboratorium terdepan pada satu tangga.
Ini bukan lagi kisah satu laboratorium. Penilaian Frontier Red Team milik Anthropic sendiri, yang diterbitkan 29 September, menjalankan GLM-5.3-Flash — varian yang lebih kecil — dalam sesi human-in-the-loop: diberi detail publik tentang celah Chrome yang telah ditambal plus satu celah lain, tanpa arahan berarti, model tersebut merangkainya menjadi eksploit ARM64 yang andal yang melewati pengerasan autentikasi pointer, dalam 20 menit perhatian manusia dan delapan jam kerja model — $20,40 dengan tarif API Zhipu. Penilaian yang sama adalah sumber angka ExploitBench 50-dari-410 di atas, dan bagian itu mengukur GLM-5.3, model unggulan 743B, bukan Flash — sebuah perbedaan yang sebagian besar diratakan oleh liputan atas laporan tersebut. Dua pihak independen, harness berbeda, anggaran berbeda, arah yang sama. Keduanya juga merupakan hasil satu kali laboratorium dan tidak ada yang merupakan hasil yang direproduksi, dan hanya uji Generality yang melaporkan angka dolar untuk Flash, bukan untuk model unggulan. Bacaan praktisnya adalah yang dinyatakan Anthropic secara terang-terangan: bobotnya dapat diunduh, abliterasi GLM-5.3-Flash membutuhkan sekitar 600 jam GPU, dan model yang biayanya di bawah satu dolar per jam untuk dijalankan adalah jenis masalah ketersediaan yang berbeda daripada model yang berada di balik program penyaringan.
{{1}}Cobalah, dan bagaimana lapisan routing itu cocok{{/1}}
Aksesnya mudah. API milik Zhipu sendiri menyediakannya dengan tarif daftar di atas, bobot berlisensi MIT tersedia di Hugging Face pada zai-org/GLM-5.3-Flash dalam FP8 dan BF16, dan produk coding Zhipu — ZCode dan GLM Coding Plan — sudah menyertakannya. Untuk self-hosting, vLLM dan SGLang keduanya mendukungnya. Dua catatan praktis jika Anda menempuh jalur itu: cookbook SGLang memuat peringatan perubahan terbuka bahwa input visi dapat dibuang secara diam-diam pada build transformers sebelum 5.13, yang tidak akan memunculkan galat dan hanya akan memberi Anda pembacaan teks saja dari permintaan gambar; dan jalur AMD masih belum menjadi sebuah resep. PR pengaktifan gfx950 pada hari peluncuran awal (sgl-project/sglang #37653) ditutup tanpa digabungkan pada 6 September dan digantikan oleh serangkaian pull request hari-nol gfx950 yang lebih luas — mHC melalui AITER, pengindeks DSA k-pool, penyajian FP8 dan MXFP4 — beberapa di antaranya masih terbuka pada 17 September. Pengaktifan pada perangkat keras kelas MI350X sedang berjalan, belum dirilis, dan masih belum ada angka throughput AMD yang independen.
Di sisi perutean, situasinya telah berubah sejak peluncuran: GLM-5.3-Flash kini ada dalam daftar OrcaRouter, bersama sisa lini GLM. Kami meneruskan harga daftar penyedia apa adanya dengan markup 0% dan tanpa biaya tambahan router, yang justru merupakan mekanisme yang penting bagi model yang harganya baru saja berubah — diskon yang berakhir di sisi Zhipu adalah harga yang Anda bayar di sini, pada hari yang sama, tanpa kontrak kedua untuk dinegosiasikan ulang dan tanpa perubahan kode. Penerusan itu berlaku dua arah, dan perlu dinyatakan secara eksplisit: promosi yang kedaluwarsa adalah kenaikan harga nyata pada tagihan Anda, dan hal itu terjadi di sini pada saat yang sama ketika terjadi di sisi hulu. Jika Anda mempertimbangkan Flash dibandingkan GLM-5.3 atau model hemat lainnya, keduanya berada di balik satu kunci dengan failover otomatis antar penyedia, yang merupakan cara murah untuk mencoba model yang skor independennya masih dalam proses stabilisasi tanpa mempertaruhkan jalur produksi padanya. Ini juga bentuk yang tepat untuk hasil di atas, dan dengan alasan yang lebih blak-blakan daripada sekadar kenyamanan: bobot yang sama mendapat skor 10.6 atau 6.2 pada tolok ukur yang sama tergantung pada harness agen mana yang menjalankannya, jadi yang sebenarnya diuji pembeli adalah kombinasi scaffold-dan-model, dan menukar model di balik scaffold yang tetap di bawah satu kunci lebih murah daripada berkomitmen pada salah satunya.

Tontonan Berikutnya
Empat hal menentukan sisa cerita ini. Pertama, apakah 42 bergerak: model ini telah digunakan secara luas oleh publik sejak Agustus, jadi jika evaluasi internal Zhipu dan harness AA tidak setuju karena alasan struktural — penghitungan token penalaran, verbositas, evaluasi yang diberi bobot besar oleh vendor — itu seharusnya muncul saat indeks direvisi, bukan sebagai kesenjangan satu kali. Kedua, apakah hasil eksploitasi dapat direproduksi. Generality Labs menjalankan 41 bug sekali, pada harness-nya sendiri, dan mengatakan demikian; tindak lanjut harness menunjukkan bobot yang sama bergerak empat poin hanya karena pilihan harness, jadi angka yang akan menyelesaikannya adalah tim kedua yang menjalankan ulang 41 dengan anggaran yang ditetapkan dalam dolar dan harness dibuat konstan. Ketiga, apakah laporan silikon domestik mendapatkan sumber kedua. Zhipu adalah satu-satunya pihak yang mampu menyatakan ukuran kluster, linimasa dua minggu, dan 3.2x, dan satu-satunya klaim yang dapat diverifikasi secara independen di dalamnya — perbaikan kernel yang digabungkan — adalah klaim yang kecil. Keempat, harga: diskonnya sudah hilang, dan pertanyaan menariknya adalah apakah diskon itu kembali sebagai promosi ketika Zhipu membutuhkan volume, atau apakah tarif daftar sekarang menjadi batas bawah.
Benang merahnya adalah bahwa GLM-5.3-Flash diminta membuktikan dua hal berbeda sekaligus — bahwa model murah bisa cukup baik, dan bahwa akselerator Tiongkok dapat melayaninya dalam skala besar — dan pengungkapan 17 September adalah jawaban Zhipu untuk pertanyaan kedua, yang disampaikan oleh model yang turut menulisnya. Pertanyaan pertama kini punya dua angka independen yang menyertainya dan keduanya menunjuk ke arah berlawanan: angka 42 pada indeks kecerdasan, jauh di bawah angka utama vendor, dan uji eksploitasi yang berada setingkat dengan spesialis dari lab terdepan dengan biaya seperdua puluhnya. Keduanya bisa sama-sama benar, dan celah di antara keduanya — bukan salah satu angkanya — adalah tempat keputusan sebenarnya dibuat.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
