
Ox Alpha Terungkap: Z.AI Merilisnya dengan Bobot Terbuka sebagai GLM-5.3-Flash
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 144 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Pada malam Rabu, 26 Agustus, misteri itu berakhir seperti yang diprediksi forensik. Z.AI — laboratorium Beijing di balik seri GLM — merilis model yang selama ini diuji secara tersamar sebagai produk open-weight, dengan nama GLM-5.3-Flash, tepatnya sub-nama yang menjadi titik temu forensik tokenizer dan pasar prediksi. Ox Alpha, model anonim yang memuncaki tangga penggunaan sejak muncul pada 20 Agustus, kini menjadi model yang dipublikasikan dan dapat dihosting sendiri: lisensi MIT, total 320B parameter dengan 18B aktif per token, jendela konteks 1.048.576 token, dan input teks/gambar/video seperti yang diiklankan pada daftar tersebut, serta bobot di Hugging Face. Pengungkapan ini juga menjawab teka-teki terbesar minggu anonim tersebut — bagaimana model yang tidak dimiliki siapa pun dapat memproses 100 triliun token per hari: Z.AI menyatakan bahwa layanan tersebut sepenuhnya berjalan di sekitar 100.000 chip AI buatan China, pertama kalinya silikon China membawa lalu lintas global berskala frontier. Kapasitas itu juga memunculkan tebakan salah terpopuler minggu itu — pada skala tersebut, banyak pengamat, yang didorong oleh unggahan misterius para peneliti Google DeepMind, berpendapat bahwa Ox Alpha pasti Gemini yang berjalan di perangkat keras NVIDIA; pengungkapan itu juga mengoreksi hal tersebut. Malam yang sama, Alibaba merilis Qwen3.8-Flash-Next, pratinjau open-weight arsitektur Qwen4 — dalam satu malam, dua rilis open-weight kelas frontier dari laboratorium China. Empat rilis anonim sebelum Ox Alpha semuanya pada akhirnya diklaim oleh laboratorium China: dari Zhipu AI, GLM-5; dari Xiaomi, MiMo-V2-Pro; dari Ant Group, Lingxi Ling-2.6-flash; dan dari Meituan, LongCat-2.0. Ox Alpha bukan lagi eksperimen eksklusif platform; ia adalah model yang dapat dihosting sendiri oleh pengembang.
Setiap angka dalam tulisan ini adalah klaim operator itu sendiri, data dari daftar platform itu sendiri, pengumuman publik, atau fingerprinting komunitas. Angka DeepSWE adalah pengukuran komunitas dari peneliti independen Ben Davis — rangkaian penuh 113 tugas, bukan entri papan peringkat resmi, meskipun angka ~63% kini hampir sejajar dengan skor DeepSWE v1.1 yang dilaporkan vendor Z.AI sendiri, yakni 63,4. Pertanyaan identitas telah tuntas: pada 26 Agustus, Z.AI merilis Ox Alpha sebagai model open-weight dengan nama GLM-5.3-Flash — lisensi MIT, total 320B parameter dengan 18B aktif — mengonfirmasi sub-nama yang menjadi titik temu forensik tokenizer dan video-encoder. Arsitektur, jumlah parameter, dan harga kini dipublikasikan perusahaan; yang masih berupa pernyataan vendor, bukan verifikasi independen, adalah rangkaian tolok ukur dan klaim Z.AI bahwa layanan pada minggu anonim itu berjalan di sekitar 100.000 chip AI domestik Tiongkok dengan biaya per-token yang sebanding dengan perangkat keras NVIDIA mainstream — klaim perusahaan yang kini telah diulang banyak media, bukan angka yang diaudit. Hipotesis Gemini awal — yang lahir dari kapasitas 100T token/hari dan didorong oleh unggahan-unggahan samar dari para peneliti Google DeepMind — ternyata salah, dan perilisan ini mengakhirinya. Peringkat kualitas yang diatribusikan kepada analis teortaxesTex — beserta sarannya bahwa Ox Alpha yang dilatih lebih lanjut dapat menjadi tulang punggung bagi GLM 5.5 yang lebih kuat — adalah penilaian analis itu sendiri dari sebuah unggahan media sosial, bukan pengukuran independen atau pernyataan Zhipu. Demo animasi berulang yang dijelaskan di bawah ini juga merupakan laporan komunitas — unggahan pengembang di X, yang digaungkan di forum-forum pengembang Tiongkok — bukan klaim kapabilitas vendor, dan operator tidak mengumumkan fitur semacam itu.
Apa yang kita tahu — dan apa yang tidak kita tahu.
Versi cepat:
• Operator menggambarkan Ox Alpha sebagai "model frontier yang dibangun untuk pengkodean yang efisien, pekerjaan agentik yang berkelanjutan, dan penggunaan produksi dunia nyata" — model penalaran yang ditujukan untuk rekayasa perangkat lunak jangka panjang dan alur kerja yang menggabungkan teks dengan konteks visual.
• Ia memiliki jendela konteks 1.048.576 token (1M), batas keluaran 131.072 token, serta menerima masukan teks, gambar, dan video — yang pertama dari rilis anonim yang mengiklankan masukan video, dan kemampuan yang dikonfirmasi oleh rilis GLM-5.3-Flash sebagai bawaan, bukan sekadar tempelan.
It was free for one week: $0 per million tokens in and out, with the operator claiming "generous rate limits, near-unlimited usage" and 100 trillion tokens per day of serving capacity — capacity the reveal would later say was provisioned on roughly 100,000 domestic Chinese chips.
• Terkonfirmasi: pada 26 Agustus, Z.AI merilis Ox Alpha sebagai model open-weight dengan nama GLM-5.3-Flash — berlisensi MIT, 320B total parameter dengan 18B aktif — yang persis sesuai dengan titik temu tokenizer sub-nama, video-encoder, forensik kode error, dan pasar prediksi. Analis independen teortaxesTex menilai levelnya kira-kira setara dengan GLM-5.3, terlepas dari aspek visi, dan berpendapat bahwa Ox Alpha yang dilatih lebih lanjut dapat menjadi mesin utama di balik GLM 5.5 yang jauh lebih kuat.
• Pembacaan flash-multimodal kini didukung oleh sebuah demo: ketika diminta untuk membuat animasi berulang dari seekor pelikan yang mengendarai sepeda dan membuka ponsel yang memutar animasi yang sama, Ox Alpha menjawab dengan animasi berulang yang mandiri dalam satu file HTML/SVG — demo komunitas, bukan klaim vendor.
• Data aktivitas awal di platform sudah menunjukkan lalu lintas produksi nyata, termasuk agen pengkodean dari Nous Research dan editor Zed.
• Perusahaan kini telah merilisnya — pada 26 Agustus Z.AI merilis Ox Alpha sebagai GLM-5.3-Flash berbobot terbuka di bawah lisensi MIT, sekaligus mengakhiri pertanyaan tentang identitas, spesifikasi, dan harga: 320B total parameter dengan 18B aktif, multimodal secara native, dengan harga resmi Z.AI $0.15 untuk input / $0.50 untuk output per juta token dan promo peluncuran 50% yang dinyatakan hanya berlaku hingga 9 September — tanggal yang kini telah lewat delapan hari, dengan tarif diskon masih yang diberlakukan. Z.AI juga mengungkapkan bahwa pelayanan 100T token/hari selama seminggu anonim itu berjalan di atas sekitar 100.000 chip domestik Tiongkok, sebuah hal pertama pada skala tersebut. Yang tidak disertakan dalam pengungkapan itu adalah tolok ukur independen — skor model tersebut dilaporkan vendor — jadi angka independen yang paling representatif tetap hasil uji DeepSWE lengkap 113 tugas dari Ben Davis pada sekitar 63%, setara dengan GPT-5.6 Sol mid.
Apa itu Ox Alpha
Deskripsi platform menggambarkan Ox Alpha sebagai "model penalaran yang dirancang untuk pengkodean, pekerjaan agen berkelanjutan, dan beban kerja produksi — rekayasa perangkat lunak jangka panjang, penalaran kompleks, dan alur kerja yang menggabungkan teks dengan konteks visual." Itu adalah posisi yang spesifik: model ini dibangun untuk loop agen yang berjalan lama dan untuk kode, bukan untuk obrolan umum. Konteks 1M adalah petunjuknya — itu cukup ruang untuk sesi agen multi-jam atau repositori besar — dan batas output 131K memungkinkan generasi tunggal yang panjang. Model ini mendukung pemanggilan alat dan fungsi serta output JSON terstruktur, yang merupakan sisa dari daftar periksa agen.

Input video adalah item paling khas pada lembar tersebut. Tidak ada model anonim sebelumnya yang mengiklankannya, dan model yang dapat menerima bingkai video sekaligus teks dan gambar ditujukan untuk kelas beban kerja yang berbeda dari rilis chat-tuned yang mendahuluinya. Ini juga, sebagaimana analisis forensik nantinya akan menunjukkan, salah satu penanda identitas terkuat yang dapat dibawa model. Semua ini — deskripsi, spesifikasi, angka kecepatan — berasal dari operator dan daftar platform. Rilis GLM-5.3-Flash mengonfirmasi spesifikasi utama (320B-A18B, multimodal asli); angka kecepatan dan kapasitas tetap merupakan klaim vendor.
{{1}}Kisah multimodal mendapatkan demo konkret minggu ini.{{/1}} {{2}}Developer Chetaslua — yang probe sisi server-nya merupakan bagian dari jejak fingerprinting — mengunggah sebuah tes di mana ia meminta Ox Alpha untuk membuat loop dari seekor pelikan yang mengendarai sepeda dan membuka ponsel yang memutar animasi yang sama: sebuah loop referensial-diri di dalam loop tersebut.{{/2}} {{3}}Laporannya menunjukkan model tersebut menghasilkan animasi HTML/SVG satu file — seekor pelikan dengan kaki dua segmen yang benar-benar mengayuh, kecepatan roda yang tersinkronisasi dengan kecepatan tanah, latar belakang paralaks, dan imbal hasil ponsel-di-dalam-loop.{{/3}} {{4}}Forum-forum developer Tiongkok secara terpisah menjalankan prompt sepeda-pelikan mereka sendiri dan mendiskusikan hasilnya, sehingga demo tersebut bukan klaim tunggal yang tidak dapat diverifikasi.{{/4}} {{5}}Karena keluarannya berupa kode, hal ini konsisten dengan spesifikasi platform yang hanya mengeluarkan teks: pemahaman multimodal dan generasi kode kreatif yang bekerja bersama, bukan sintesis video asli.{{/5}} {{6}}Kesimpulan Chetaslua — bahwa ini adalah imbal hasil dari multimodalitas, dan bahwa model open-source yang mumpuni akan hadir bersamanya — adalah perkiraannya sendiri, bukan pernyataan vendor; operator belum mengumumkan apa pun.{{/6}}
Penawaran gratis selama seminggu
Promosinya agresif. Gratis selama seminggu penayangannya, "batas tarif yang murah hati, penggunaan hampir tanpa batas," dan klaim kapasitas 100 triliun token per hari, dengan catatan operator yang mengundang pengguna untuk "lihat apa yang bisa Anda lakukan." Jika ditafsirkan secara harfiah, 100 triliun token per hari akan menempatkan operator ini di antara penyedia inferensi terbesar di mana pun — klaim tersebut lebih terdengar seperti tantangan uji beban daripada spesifikasi, yang sesuai dengan polanya: rilis anonim adalah cara sebuah lab mendapatkan lalu lintas dunia nyata berskala frontier tanpa menampilkan namanya. Pembacaan yang terkonfirmasi membuat klaim skala tersebut menjadi konkret, bukan sekadar lebih mudah dipahami: Z.AI mengungkapkan bahwa layanan 100 triliun token/hari berjalan di sekitar 100.000 chip AI domestik Tiongkok — pertama kalinya rilis kelas frontier dilayani pada skala tersebut tanpa perangkat keras NVIDIA. Pengungkapan itu masih merupakan klaim perusahaan, kini diulang oleh berbagai media tetapi belum diaudit secara independen, dan membawa pernyataan vendor kedua yang lebih lunak: Z.AI mengatakan biaya per token pada kluster domestik sebanding dengan GPU NVIDIA arus utama.
Sisi lain dari "gratis selama seminggu" adalah bahwa harga yang menyusul setelahnya tidak diketahui — pengungkapan itu menjawabnya. Harga daftar yang dipublikasikan Z.AI untuk GLM-5.3-Flash adalah $0,15 per juta token masukan, $0,50 per juta token keluaran, dan $0,03 per juta masukan yang di-cache. Promo peluncuran diskon 50% dinyatakan berlaku hingga 9 September 2026, yang memotongnya menjadi $0,075 / $0,25. Delapan hari setelah tanggal itu, tarif diskon masih menjadi tarif yang diberlakukan: saat dibaca ulang pada 17 September 2026, halaman model z-ai/glm-5.3-flash memasang harga masukan $0,075, keluaran $0,25, dan pembacaan cache $0,0173 per juta token, tanpa label promosi apa pun. Dibandingkan dengan harga daftar GLM-5.3 sebesar $1,40 / $4,40, itu kira-kira seperdua puluh. Konsekuensi praktisnya adalah tanggal berakhir 9 September itu sudah kedaluwarsa, bukan mengikat — pengembang yang menganggarkan berdasarkan $0,15 / $0,50 sedang menganggarkan berdasarkan angka yang saat ini tidak dikenakan kepada siapa pun. Yang tidak dijelaskan oleh halaman harga adalah mengapa. Daftar model Z.AI sendiri masih mencantumkan $0,15 / $0,50 untuk GLM-5.3-Flash, jadi apakah promo diperpanjang, dijadikan permanen, atau sekadar dibiarkan berjalan bukan sesuatu yang bisa kami telusuri sumbernya; tarif diskon adalah fakta yang teramati pada tanggal ini, dan penyebabnya tetap terbuka.
Benchmark penuh pertama — dan hasilnya setara dengan GPT-5.6 Sol mid
Ox Alpha masih belum tercatat di pelacak independen seperti Artificial Analysis atau LMArena — kata "frontier" adalah klaim operator itu sendiri, dan angka-angka tolok ukur yang dipublikasikan Z.AI bersamaan dengan rilis GLM-5.3-Flash (DeepSWE v1.1 63.4, AutomationBench 48.8, Artificial Analysis Intelligence Index 57) dilaporkan oleh vendor, bukan skor independen. Yang berubah sejak peluncuran adalah angka-angka yang diukur komunitas mulai beredar — dan gambarnya menyempit. Di Kingbench, hasil uji awal menempatkan Ox Alpha pada 87.5, tepat di bawah 91.25 milik GLM-5.3. Di DeepSWE, peneliti independen Ben Davis pertama kali menjalankan subset 10 tugas dan melaporkan 80% Pass@1, mengungguli Claude Fable 5 (65%), GLM-5.3 dan Grok 4.6 (62%), serta GPT-5.6 Sol (52%). Ia kemudian menyelesaikan uji penuh terhadap seluruh set DeepSWE yang terdiri dari 113 tugas, dan hasil terkoreksinya sekitar 63% — kurang lebih sejajar dengan GPT-5.6 Sol mid. Angka 80% pada subset memang mencolok, tetapi sepuluh tugas kurang dari 9% dari tolok ukur; Davis sendiri menandai angka set penuh sebagai angka yang "jauh lebih masuk akal." Ini adalah angka yang diukur komunitas, bukan tolok ukur vendor dan bukan skor papan peringkat resmi — tetapi uji penuh adalah angka paling representatif yang didapat siapa pun dari model ini, dan sekarang angka tersebut hampir sejajar dengan skor DeepSWE v1.1 yang dilaporkan vendor Z.AI sendiri, yaitu 63.4 — sebuah pemeriksaan silang yang berguna, meskipun angka perusahaan itu adalah klaim, bukan hasil pengukuran.
Satu perbandingan kini lebih penting daripada saat peluncuran. DeepSeek V4 Pro 0813 — build GA dari produk unggulan DeepSeek yang dirilis pada 13 Agustus — melaporkan DeepSWE sebesar 62,7 pada kartu benchmark milik DeepSeek sendiri, berbanding 12,8 untuk DeepSeek V4 Pro Preview sebelumnya. Kedua angka tersebut dilaporkan vendor dan belum direproduksi oleh laboratorium independen hingga tulisan ini dibuat. Jika dibaca bersama hasil community full-set GLM-5.3-Flash yang sekitar 63% dan DeepSWE v1.1 milik Z.AI sendiri sebesar 63,4, skor 62,7 dari DeepSeek menempatkan dua klaim coding-agent asal China yang paling dikenal pada kisaran 60-an bawah yang sama. Selisih sepuluh poin yang tampak seperti ciri khas Ox Alpha diukur terhadap DeepSeek V4 Flash 0731, model kecil yang lebih murah; jika dibandingkan dengan produk unggulan DeepSeek, GLM-5.3-Flash sejajar, bukan unggul sepuluh poin.
Pelajaran lainnya adalah tentang angka itu sendiri. Analis teortaxesTex — yang telah melacak estimasi-estimasi ini sejak pekan anonim — mencatat bahwa laporan pertama tentang Ox Alpha juga memberikan DeepSWE 80%: itu adalah subset 10-tugas Davis yang mencolok, dan hasil akhir pada set lengkap 113-tugas adalah 63%. Dengan 62,7 resmi DeepSeek V4 Pro 0813 di kisaran yang sama, pengamatannya adalah bahwa belum ada yang mendekati 80% yang direproduksi secara sah — angka 80% itu terus muncul di awal kehidupan publik sebuah model dan terus menetap di kisaran 60-an rendah setelah set lengkap dijalankan. Itu adalah pembacaan analisnya, bukan pengukuran, tetapi itulah lensa yang tepat untuk tajuk DeepSWE berikutnya, termasuk yang tentang GLM-5.3-Flash itu sendiri.

Yang juga ada adalah penggunaannya. Data aktivitas platform menunjukkan lalu lintas produksi nyata dalam beberapa jam pertama — termasuk Hermes Agent, proyek coding agentik dari Nous Research, dan editor Zed. Keduanya persis merupakan kasus penggunaan "kerja dan coding agentik berkelanjutan" yang menjadi sasaran model ini. Ini bukan skor, tetapi ini adalah sinyal: para pengembang dengan beban kerja nyata memutuskan bahwa pertaruhan anonim kelas frontier yang gratis itu layak untuk dicoba. Sebelum hasil penuh DeepSWE keluar, adopsi awal itu adalah satu-satunya bukti yang ada; angka ~63% untuk set penuh kini memberi model ini jangkar tolok ukur untuk membandingkannya.
Tulisan kecil tentang retensi data
Pengumuman minggu gratis tersebut mengklaim "zero data retention." Listing model di platform menceritakan kisah yang lebih bernuansa: prompt dan completion disimpan oleh penyedia, tetapi tidak digunakan untuk pelatihan, sesuai ketentuan model siluman platform. Perbedaan ini penting jika Anda hendak menempelkan kode proprietary ke dalam jendela 1M-token milik penyedia yang anonim hingga Z.AI tampil pada 26 Agustus. Perlakukan "zero data retention" sebagai pemasaran sampai Z.AI menerbitkan ketentuan yang menyatakannya secara tersurat — dan arahkan apa pun yang tidak ingin Anda biarkan tercatat melalui model terpisah yang dapat diidentifikasi.
Buku pedoman model anonim
Ox Alpha adalah rilis anonim kelima dalam enam bulan, dan empat sebelumnya berakhir dengan cara yang sama — debut anonim, ledakan lalu lintas gratis, lalu sebuah perusahaan yang melangkah maju:
• Pony Alpha (Februari 2026) — dikonfirmasi oleh Zhipu AI sekitar lima hari setelah peluncuran sebagai GLM-5, produk unggulan MoE dengan 744 miliar parameter.
• Hunter Alpha (11 Maret) — model gratis dengan parameter triliunan dan konteks 1M yang menjadi cerita spekulasi musim semi, banyak yang menduga sebagai DeepSeek V4; terungkap sebagai MiMo-V2-Pro milik Xiaomi, dengan pendamping Healer Alpha yang diidentifikasi sebagai MiMo-V2-Omni.
• Elephant Alpha (April) — model teks gratis yang berfokus pada efisiensi, yang diklaim Ant Group sebagai Lingxi Ling-2.6-flash sekitar dua minggu setelah kemunculannya.
• Owl Alpha (akhir April) — model yang berfokus pada agen dengan pemanggilan alat bawaan dan konteks ~1M yang oleh Meituan dikonfirmasi sebagai LongCat-2.0 pada 30 Juni, model triliunan parameter pertama yang dilatih dan dilayani sepenuhnya di atas chip Tiongkok domestik.
• Ox Alpha (20 Agustus) — terungkap pada 26 Agustus sebagai GLM-5.3-Flash, model 320B-A18B berlisensi MIT dengan bobot terbuka; identitas, lisensi, dan spesifikasinya semuanya resmi pada hari yang sama saat topengnya dibuka.

Mengapa meluncurkan model bagus di balik topeng? Pembacaan standar, yang dibuat konkret oleh siklus Hunter Alpha, adalah bahwa anonimitas menghilangkan bias merek dari evaluasi, dan penggunaan gratis mengumpulkan data evaluasi dunia nyata dari banyak sumber {{1}}dalam skala frontier{{/1}} sementara semua orang berdebat tentang pemiliknya. Sebagaimana salah satu analisis tentang pola ini mengatakannya, {{2}}"the lack of a brand is the marketing."{{/2}} Keuntungan tambahannya adalah kecepatan: {{3}}model anonim dapat menjangkau audiens developer global dalam hitungan jam tanpa acara peluncuran, dan misteri itu sendiri menjadi distribusi.{{/3}}
Siapa Ox Alpha?
Hingga perilisan 26 Agustus, tidak ada perusahaan yang mengklaimnya dan Zhipu AI tidak berkata apa-apa — tetapi situasi bukti kuat berubah dalam 48 jam setelah debut model tersebut, dan analisis forensik di bawah ini adalah alasan mengapa pengungkapan — sebagai GLM-5.3-Flash — diterima dengan sedikit kejutan. Angka kapasitas sempat bekerja melawan forensik: 100 triliun token per hari tampak seperti ciri khas laboratorium kelas atas di silikon NVIDIA, dan teori bahwa Ox Alpha adalah Gemini baru — yang didorong oleh unggahan misterius dari para peneliti Google DeepMind — memiliki momentum nyata hingga bukti tokenizer, dan kemudian rilis Z.AI sendiri, mengakhirinya. Sinyal terkuat adalah tokenizer. Alat sidik jari buatan komunitas, modelprint, menjalankan sembilan pemeriksaan infrastruktur terhadap Ox Alpha dan menemukan bahwa alat tersebut cocok dengan GLM-5.3 milik Z.ai pada enam pemeriksaan, dengan keempat jumlah tokenizer ternormalisasi cocok dengan keluarga GLM sementara kandidat non-GLM terbaik hanya mencapai dua dari empat. Peneliti independen Ben Davis melaporkan bahwa jumlah token Ox Alpha cocok persis dengan GLM-5.3 pada 25 prompt pengujian, dengan hanya perbedaan konstan +75 token yang ia kaitkan dengan pembungkus tersembunyi. Pencocokan tokenizer adalah sinyal identitas yang paling sulit dipalsukan — sebuah model tidak dapat mengubah cara ia membagi teks tanpa pelatihan ulang.
Jalur video merupakan tanda tangan kedua. Konsumsi token video Ox Alpha cocok persis dengan GLM-5V-Turbo pada empat sampel terkontrol — mekanisme sampling bingkai, penskalaan durasi, dan resolusi yang sama — sementara MiMo v2.5, Qwen 3.8 Max, dan GLM-4.6V semuanya berbeda. Itu petunjuk kuat: penanganan video tertanam dalam model, bukan sekadar tambahan. Tumpukan sidik jari lainnya sejalan dengan pembacaan yang sama: Ox Alpha menolak input audio seperti GLM-5V, memiliki kode error "1301" khas GLM, menghasilkan gaya keluaran yang serupa (sekitar 1,3 emoji per 1.000 karakter), membawa konfigurasi parameter dan API terbatas yang sama dengan yang muncul pada daftar GLM-5.3 di platform dua hari sebelum Ox Alpha diluncurkan, serta memiliki batas pengetahuan mendekati November 2025.
Identifikasi ini memiliki preseden dalam playbook Zhipu sendiri: Pony Alpha, rilis anonim bulan Februari, ternyata adalah GLM-5, diklaim sekitar lima hari setelah peluncuran. Interpretasi analis yang beredar minggu ini — bahwa Ox Alpha adalah GLM-5.3, diduga model Flash — diamini oleh Pliny the Liberator, yang mengatakan agennya telah mengonfirmasi "Ox-alpha berasal dari Zai, keluarga GLM-5.X." Analis independen teortaxesTex membuat penilaian yang sama soal kualitas dan menambahkan klaim waktu: ia menilai Ox Alpha kira-kira setara level GLM-5.3, terlepas dari aspek visi, dan menganggap kecepatan merilisnya sebagai bagian yang paling mencolok — mengompresi GLM-5.3 yang hanya-teks dan merilisnya dengan visi yang berfungsi dalam hitungan hari setelah peluncuran 14 Agustus. Itu adalah penilaian satu analis, bukan skor independen, dan ia berpendapat hal itu seharusnya memberi jeda pada narasi "China merilis model-model yang masih panas dari cetakan." Postingan terbarunya menumpuk tebakan peta jalan di atas interpretasi itu: siklus pembaruan GLM-5 mungkin pendek; Ox Alpha cukup dekat dengan GLM-5.3 sehingga menggunakannya sebagai subagen hampir tidak masuk akal — "cukup jalankan ox @4 sebagai gantinya" adalah singkatannya untuk menjalankan model secara langsung; dan Ox Alpha yang dilatih lebih lanjut akan sangat masuk akal sebagai pekerja keras, dalam kata-katanya "hewan beban," untuk GLM 5.5 yang jauh lebih kuat. Itu adalah spekulasi satu analis tentang peta jalan, bukan pernyataan Zhipu. Pertanyaan sub-nama, sebaliknya, sudah tuntas: pada 26 Agustus Z.AI merilis Ox Alpha sebagai GLM-5.3-Flash. Kerumitan yang sebelumnya membuat label Flash berada di sisi "diduga" — GLM-5.3 diluncurkan 14 Agustus sebagai model khusus teks, sementara Ox Alpha menawarkan input video — justru itulah yang diselesaikan oleh rilis tersebut: GLM-5.3-Flash adalah model yang berbeda dan memang multimodal sejak awal, bukan model khusus teks yang sama. Teori alternatif — tim MiMo milik Xiaomi, DeepSeek — telah dilontarkan dan sebagian besar dikesampingkan berdasarkan bukti tokenizer dan video, dan rilis tersebut menuntaskan pertanyaan keluarga sepenuhnya.Argumen Davis soal mengapa label Flash itu penting ternyata bersifat praktis: karena Ox Alpha benar-benar GLM-5.3-Flash yang berkinerja pada level menengah GPT-5.6 Sol, model itu kini dapat dijalankan secara lokal — bobotnya ada di Hugging Face dan SGLang, vLLM, serta TokenSpeed melayaninya — yang mengubah model coding frontier kelas menengah menjadi biaya perangkat keras sekali bayar, bukan tagihan per-token, bagi siapa pun yang bersedia menghostingnya.
Pembingkaian geopolitik adalah milik para analis, bukan milik buktinya: "Ini memberikan tekanan yang lebih besar lagi pada US Frontier Labs, dan jarak dengan China semakin menyempit." Itu adalah interpretasi tentang apa arti model tingkat Zhipu gratis yang berjalan pada skala frontier bagi tatanan kompetitif — dan pengungkapan perangkat keras memberinya keunggulan yang tidak dimiliki para analis. Melayani 100 triliun token per hari pada sekitar 100.000 chip domestik adalah demonstrasi berskala besar pertama bahwa tumpukan teknologi China tanpa silikon NVIDIA dapat membawa lalu lintas inferensi frontier — skenario yang diperingatkan oleh CEO NVIDIA Jensen Huang di Dwarkesh Podcast musim semi ini, ketika ia berargumen bahwa kontrol ekspor akan mempercepat tumpukan teknologi China yang independen dari NVIDIA dan bahwa model frontier yang berjalan paling baik pada perangkat keras domestik China akan menjadi "hasil yang mengerikan" bagi Amerika Serikat. Angka paritas biaya Z.AI masih merupakan klaim vendor, tetapi peristiwanya sendiri nyata. Malam yang sama mempertegas hal tersebut di sisi model: saat Z.AI merilis GLM-5.3-Flash, Alibaba mengirimkan Qwen3.8-Flash-Next, pratinjau bobot terbuka dari arsitektur Qwen4. Dua rilis bobot terbuka kelas frontier dari China dalam satu malam adalah wujud nyata dari apa yang oleh para pengamat disebut "hari besar bagi open source China."
Haruskah Anda mengembangkannya minggu ini?
Pekan gratis sudah berakhir, tetapi uji coba ini masih murah: tarif yang sebenarnya diberlakukan pada 17 September adalah $0,075 masuk / $0,25 keluar per juta token, bukan harga daftar $0,15 / $0,50 — promo peluncuran 50% yang dinyatakan berakhir 9 September masih berlaku delapan hari kemudian. Jika Anda mengerjakan pekerjaan agentik berhorison panjang, menulis kode pada konteks panjang, atau menjalankan pipeline yang padat video, itulah tepat persimpangan tempat Ox Alpha diposisikan — dan dengan bobot yang terbuka, Anda dapat menjalankan uji coba di perangkat keras Anda sendiri alih-alih atas kemurahan platform anonim. Dua peringatan. Pertama, label "frontier" masih merupakan klaim: kartu skor GLM-5.3-Flash dilaporkan oleh vendor, dan satu-satunya angka independen yang solid — hasil DeepSWE Davis sekitar 63% — kuat tetapi jauh dari 80% viral dari subset 10 tugas awal. Kedua, harga $0 dibatasi waktu, dan pengungkapan itu menetapkan harga untuk apa yang menyusul — murah untuk kemampuannya, tetapi tidak lagi gratis. Yang dihilangkan oleh rilis bobot terbuka adalah ketergantungan: file-file sudah dirilis, sehingga model dapat di-host sendiri alih-alih disewa. Itulah bentuk sebuah uji coba, bukan ketergantungan.
Cara yang aman untuk produksi dalam menjalankan pengujian seperti itu adalah rantai fallback: model eksperimental menjawab saat kondisinya sehat, dan permintaan beralih ke model yang terbukti begitu macet, error, atau hilang. Itulah gunanya lapisan routing. Pengungkapan ini membuat pilihan fallback menjadi sepele: Ox Alpha adalah GLM-5.3-Flash, dan model itu sendiri aktif di OrcaRouter dengan nama aslinya pada $0.075 masuk / $0.25 keluar per juta token, dengan pembacaan cache sebesar $0.0173 — tarif peluncuran diskon 50% yang dinyatakan berakhir 9 September dan, per 17 September, masih menjadi harga di halaman tersebut alih-alih angka daftar $0.15 / $0.50. Ini diteruskan dengan markup 0%, satu API di lebih dari 200 model, dengan failover otomatis sehingga lonjakan trafik minggu peluncuran tidak menjadi pemadaman Anda. Uji coba model baru di depan dengan fallback yang terbukti di belakangnya dalam rantai; ketika harga berubah, angka yang Anda lihat di OrcaRouter adalah angka yang Anda bayar, pada hari yang sama. Atau lewati API sepenuhnya — bobotnya terbuka, jadi self-hosting GLM-5.3-Flash di belakang rantai yang sama juga menjadi pilihan.
Apa yang harus ditonton
Enam hal akan mengungkap sisa ceritanya. Tolok ukur independen: kartu skor GLM-5.3-Flash dilaporkan oleh vendor, uji DeepSWE ~63% milik Davis adalah satu-satunya angka independen yang solid sejauh ini, angka resmi 62,7 milik DeepSeek V4 Pro 0813 kini berada di rentang yang sama, dan entri Artificial Analysis atau LMArena — atau adu langsung independen — akan menjadi pemeriksaan akhir apakah "frontier" itu fakta atau slogan. Lintasan harga: pertanyaan kondisi mapan sudah punya jawaban berdasarkan bukti sejauh ini — promo 50% dinyatakan berakhir pada 9 September, namun pada 17 September tarif diskon $0.075 / $0.25 masih yang disajikan, jadi angka promo, bukan harga daftar $0.15 / $0.50, yang menjadi dasar penganggaran; yang tetap belum terpecahkan adalah penyebabnya, karena harga daftar Z.AI sendiri tidak berubah. Klaim perangkat keras: Z.AI mengatakan minggu anonim itu berjalan di atas sekitar 100.000 chip domestik dengan biaya setara NVIDIA — uji publik pertama atas hal itu dalam skala besar adalah apakah klaim tersebut bertahan terhadap peninjauan independen, dan apakah tumpukan domestik menjadi default untuk lini GLM. Hitungan adopsi: apakah lalu lintas yang memuncaki platform yang ditarik Ox Alpha di balik topeng berubah menjadi penerapan self-hosted dan API sekarang setelah ia memiliki nama, lisensi, dan harga. Sekuelnya: apakah GLM-5.3-Flash menempatkan Ox Alpha sebagai batu loncatan — petunjuk teortaxesTex adalah bahwa versi yang dilatih lebih lanjut menjadi pekerja utama untuk GLM 5.5 yang jauh lebih kuat, yang akan menjadikan rilis ini fondasi GLM berikutnya. Dan reaksinya: dengan Qwen3.8-Flash-Next mendarat pada malam yang sama dan pengungkapan chip domestik di belakangnya, tekanan ada pada lab-lab frontier AS — dan pada debat kontrol ekspor — untuk menjawab; perhatikan apakah tindak lanjut cepat, langkah harga, atau respons kebijakan muncul di sisi lain celah.
Putusan jujurnya: Ox Alpha adalah eksperimen yang luar biasa murah di kedua arah. Platform ini menguji apakah model kelas terdepan anonim dengan harga $0 bisa memenangkan trafik produksi nyata dalam sepekan — ternyata bisa, cukup meyakinkan sehingga Z.AI tidak hanya maju pada hari keenam tetapi juga merilis bobotnya sebagai model terbuka pada malam yang sama. Anda bisa menguji apakah model ini layak mendapat tempat di stack Anda, kini tanpa risiko anonimitas: GLM-5.3-Flash adalah model bernama, berlisensi MIT, dapat di-hosting sendiri dengan harga yang dipublikasikan, dan pertanyaan perangkat keras juga mendapat jawaban — Z.AI mengatakan bahwa layanan 100T token/hari berjalan di sekitar 100.000 chip domestik Tiongkok, dinyatakan perusahaan tetapi kini banyak dilaporkan. Yang masih harus dipelajari adalah apakah “frontier” bertahan terhadap pengukuran independen, apakah klaim paritas biaya chip domestik Z.AI tetap berlaku pada skala besar, mengapa promo peluncuran 50% masih menjadi harga yang disajikan delapan hari setelah tanggal berakhir 9 September yang dinyatakan, dan apakah pengungkapan ini menggambarkan GLM-5.3-Flash sebagai pekerja utama untuk GLM 5.5 yang lebih kuat, seperti yang disiratkan teortaxesTex. Jalankan eksperimennya, tetapi jalankan dengan cadangan di bawahnya.
Dibandingkan dalam artikel ini4
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
