
GLM-5.3-Flash Terungkap: "Ox Alpha" Anonim Ternyata Model Multimodal Terdepan Terbuka Milik Zhipu Selama Ini
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
Model yang menghabiskan seminggu di puncak tangga penggunaan platform coding pihak ketiga akhirnya memiliki nama dan harga. Pada 26 Agustus 2026, Zhipu AI mengonfirmasi bahwa model gratis "Ox Alpha" yang terus digunakan para pengembang sejak 20 Agustus adalah GLM-5.3-Flash — model mixture-of-experts dengan total 320 miliar parameter dan 18 miliar parameter aktif (320B-A18B), rilis multimodal asli pertama dalam seri GLM-5, dan salah satu model kelas frontier termurah di semua kartu tarif saat diluncurkan. Zhipu mematok harga GLM-5.3-Flash sepersepuluh dari tarif API andalannya, GLM-5.3, atau seperdua puluh selama diskon terbatas, dan bobot terbukanya — berlisensi MIT — telah diunggah ke Hugging Face pada hari yang sama. Tidak seperti GLM-5.3 yang bobotnya masih ditunggu hingga akhir bulan, model ini dapat di-host sendiri minggu ini, bukan minggu depan.
Inilah versi singkatnya: Zhipu merilis model besar termurahnya sebagai open-source, yang mengungguli GLM-5.2 miliknya sendiri di berbagai tolok ukur meskipun hanya menjalankan sebagian kecil dari parameter aktif, dan vendor menempatkan skor Artificial Analysis Intelligence Index-nya di angka 57 — menyamai Claude Opus 4.8, menurut materi peluncuran Zhipu. Setiap angka tolok ukur yang dilampirkan pada peluncuran ini berasal dari laporan vendor dan belum direproduksi hingga tulisan ini dibuat; harga dan jumlah parameter adalah fakta terkini.
Apa yang sebenarnya dirilis
GLM-5.3-Flash adalah MoE dengan total 320B / 18B aktif dengan 45 lapisan, yang menempatkan jejak aktifnya sedikit di atas setengah dari ~32B parameter aktif GLM-5.2. Kemampuan utamanya adalah modalitas: secara native menerima input teks, gambar, dan video — model GLM-5 pertama yang melakukannya — daripada merutekan visi melalui adaptor terpisah. Konteks mencapai 1 juta token, dan Zhipu mengklaim biaya penyajian konteks panjang kira-kira sepertiga dari biaya GLM-5.3.
{{1}}Dari sisi arsitektur, Zhipu menggambarkannya sebagai{{/1}} {{2}}model frontier open-source pertama yang menggunakan desain hibrida sparse-attention-plus-linear-attention, dipadukan dengan Manifold-Constrained Hyper-Connections (mHC) untuk penskalaan dan mekanisme IndexPool yang mengompresi empat vektor kunci indexer menjadi satu kolam berbobot untuk memangkas latensi konteks panjang.{{/2}} {{3}}Prapelatihan dilakukan pada korpus multimodal berisi 30 triliun token.{{/3}} {{4}}Semua ini belum diaudit secara independen — ini adalah deskripsi Zhipu tentang modelnya sendiri — tetapi{{/4}} {{5}}klaim efisiensi penyajiannya cukup spesifik untuk diuji{{/5}} {{6}}setelah bobotnya tersedia di tumpukan inferensi open-source.{{/6}}
Sekilas lembar spesifikasi hari peluncuran:
Parameter — total 320B / aktif 18B, 45 lapisan, MoE.
• Modalitas — input teks, gambar, dan video secara native; output teks.
• Jendela konteks — hingga 1.000.000 token.
• Lisensi — MIT, bobot terbuka tersedia di Hugging Face saat peluncuran.
• Harga — $0,15 / $0,50 per juta token (input / output), $0,03 per juta input yang di-cache; promo diskon 50% hingga 9 September 2026 menurunkannya menjadi $0,075 / $0,25 / $0,015. Pada daftar harga, itu kira-kira sepersepuluh dari $1,40 / $4,40 milik GLM-5.3.

Minggu Alpha Ox
Pengungkapan ini menutup seminggu spekulasi. Pada 20 Agustus, sebuah model anonim muncul di platform API AI pihak ketiga dengan jendela konteks 1 juta token, input teks/gambar/video, dan harga nol, dan dengan cepat menjadi model yang paling banyak dipanggil di tangga mingguan platform tersebut. Komunitas menelusurinya kembali ke keluarga GLM milik Zhipu dalam waktu 48 jam — pola anonim-lalu-diklaim yang sama yang sebelumnya digunakan untuk mengidentifikasi model dari laboratorium China lainnya — dan para analis banyak menebak bahwa itu adalah GLM-5.3 varian Flash. Pengumuman 26 Agustus mengonfirmasi tebakan tersebut dan menambahkan detail bahwa minggu gratis itu adalah uji coba yang disengaja: Zhipu mengatakan bahwa peluncuran anonim tersebut mencetak rekor volume panggilan di platform coding tempat model itu ditawarkan, dengan seluruh lalu lintas dilayani dari chip China domestik.
Konteks minggu gratis itu penting bagi ekspektasi harga. Sebuah model yang digratiskan selama seminggu, lalu diluncurkan dengan harga sepersepuluh dari harga model unggulan, disertai diskon terbatas hingga seperdua puluh dari harga tersebut, adalah langkah penciptaan pasar yang disengaja di segmen anggaran — dan kata "waktu terbatas" adalah bagian yang perlu diwaspadai. Diskon adalah keputusan harga yang bisa ditarik kembali; bobot terbuka MIT tidak bisa.

Berapa biayanya, dalam dolar sebenarnya
Kartu tarif Zhipu telah keluar dalam dolar aktual, bukan sekadar rasio: $0,15 per juta token input, $0,50 per juta token output, dan $0,03 per juta token input cache. Dibandingkan dengan harga publikasi GLM-5.3 sebesar $1,40 / $4,40, angka tersebut sekitar sepersepuluh dari harga daftar, dan promosi peluncuran diskon 50% yang berlaku hingga 9 September 2026 menurunkannya menjadi $0,075 / $0,25 / $0,015 — sekitar seperduapuluh. Zhipu juga menyebut biaya model per tugas AA Intelligence Index sekitar $0,045, menurut laporan vendor, yang menjadi angka di balik klaim "1/40 dari Opus 4.8". Untuk model yang mencetak skor di kisaran yang sama dengan model yang dihargai 10–40x lebih tinggi, narasi ekonominya nyata; tetapi detailnya adalah diskon peluncuran bersifat sementara dan biaya per tugas bergantung pada seberapa banyak kata yang dihasilkan model saat dipakai dalam produksi.
Zhipu mengklaim keunggulan biaya berasal dari kisah efisiensinya. Dibandingkan dengan GLM-5.3, vendor melaporkan komputasi attention turun 3.0x dan KV cache turun 4.4x, serta mengklaim komputasi attention terendah di antara model-model kelas anggaran yang dibandingkan — GLM-5.3, DeepSeek V4 Flash, dan Kimi K3 — sambil mengakui bahwa KV cache-nya masih sedikit lebih besar daripada milik DeepSeek V4 Flash dan Kimi K3. Di sisi serving, pada chip domestik Tiongkok, Zhipu melaporkan peningkatan performa serving end-to-end sebesar 3x dibandingkan baseline, mencapai biaya per-token yang disebutnya sebanding dengan GPU NVIDIA mainstream. Semua itu dilaporkan sendiri oleh vendor dan belum ada satu pun yang direproduksi secara independen; angka-angka itulah yang tepat untuk diverifikasi terhadap open weights.
Mengapa pengungkapan ini penting
Singkirkan benchmark-nya, peluncuran ini tetap mengubah lanskap model terbuka dalam dua hal. Pertama, model ini adalah model multimodal berbobot terbuka di kelas frontier dengan harga ekonomis — kombinasi lisensi MIT, konteks 1M, input gambar/video asli, dan biaya per tugas satu digit sen tidak memiliki padanan langsung dari laboratorium frontier AS, yang model multimodal setaranya berbiaya satu orde magnitudo lebih mahal dan dirilis tertutup. Kedua, model ini menggerus flagship Zhipu sendiri: GLM-5.3 adalah model 743B yang mencetak skor 60 terukur independen pada AA Intelligence Index bulan ini, dan GLM-5.3-Flash diposisikan sebagai 'kecerdasan frontier, biaya kilat' melawan keluarga yang sama tersebut. Narasi Zhipu adalah bahwa model yang lebih kecil dan lebih murah dapat menangkap sebagian besar kemampuan flagship — yang, jika klaim coding dan agen dari vendor itu terbukti, adalah argumen ekonomi pasca-pelatihan yang sama yang telah menjadi pusat perhatian industri sepanjang tahun.
Satu catatan penting menjaga hal ini tetap dalam perspektif. Skor AA Index 57 milik GLM-5.3-Flash berasal dari materi peluncuran Zhipu sendiri, belum dari papan peringkat Artificial Analysis, dan perbandingan coding dengan Claude Opus 4.8 adalah evaluasi internal Zhipu di Z.ai Code Bench. Anggaplah skor 57 dan kesetaraan coding tersebut sebagai klaim hingga pengukuran independen hadir — model ini telah diuji secara luas secara anonim, jadi angka dari pihak ketiga seharusnya segera muncul.
{{1}}Cobalah, dan bagaimana lapisan routing itu cocok{{/1}}
Akses pada hari pertama tersedia melalui API milik Zhipu sendiri, bobot terbuka di Hugging Face (zai-org/GLM-5.3-Flash, MIT), serta produk coding Zhipu — ZCode dan GLM Coding Plan, yang mencakup sejumlah kartu pengalaman harian. Untuk self-hosting, lisensi MIT ditambah dukungan vLLM dan SGLang berarti klaim efisiensi pelayanan di atas dapat langsung diverifikasi.
Di sisi routing, GLM-5.3-Flash sendiri belum masuk daftar OrcaRouter pada pembaruan ini. Anggota keluarga GLM lainnya sudah tersedia: GLM-5.3 mulai aktif di sisi kami pada hari yang sama saat API Zhipu dibuka, dengan harga daftar Zhipu dan markup 0% yang diteruskan. Penerusan itulah mekanisme yang penting untuk peluncuran seperti ini — perubahan harga vendor, baik diskonnya bertahan maupun tarifnya berubah kemudian, muncul di sisi kami pada hari yang sama, tanpa negosiasi ulang. Jika Anda ingin menjalankan Flash bersama lini GLM lainnya dengan satu kunci begitu tersedia, itulah pengaturannya; sampai saat itu, bobot model di Hugging Face adalah cara tercepat untuk mengujinya sendiri.

Tontonan Berikutnya
Tiga hal menentukan kisah sebenarnya dalam beberapa minggu ke depan. Pertama, pengukuran independen Artificial Analysis terhadap 57 — model tersebut sudah berjalan di dunia nyata sebagai Ox Alpha, jadi papan peringkat seharusnya cepat menyusul. Kedua, apakah promo diskon 50% — yang saat ini dijadwalkan berakhir pada 9 September 2026 — diperpanjang melampaui tanggal tersebut, karena itu menentukan biaya kondisi tunak Flash. Ketiga, bobot GLM-5.3, yang masih dijanjikan rilis sekitar 28 Agustus — minggu yang sama dengan rilisnya bobot MIT Flash, yang akan memberi komunitas bobot terbuka dua tingkat dari keluarga yang sama untuk dibandingkan sekaligus.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
