
Ox Alpha: Lembar Spesifikasi Lengkap untuk Model Siluman yang Kini Dirilis sebagai GLM-5.3-Flash
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 316 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 196 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Ox Alpha adalah nama anonim yang GLM-5.3-Flash dipratinjau dengannya, nama itu diungkapkan pada 26 Agustus 2026, dan ini bukan model yang bisa Anda panggil hari ini. Daftar pratinjau yang membawa nama Ox Alpha tidak lagi menyajikannya; model di baliknya memiliki halaman vendor, bobot berlisensi MIT, kartu tarif yang dipublikasikan, dan permukaan API yang terdokumentasi, semuanya milik Z.ai. Halaman ini adalah rujukan untuk model tersebut — envelope-nya, modalitasnya, kartu tarifnya, permukaan endpoint-nya, setiap angka benchmark yang dipublikasikan beserta revisi atau harness yang dilampirkan padanya, dan, karena alias tersebut masih menghasilkan hasil pencarian yang tipis dan membingungkan, pernyataan gamblang tentang apa yang tidak terdokumentasikan di mana pun. Semua yang ada di bawah ini dibaca pada 2026-09-28 dari dokumentasi model dan halaman harga Z.ai sendiri, dari kartu model Z.ai di Hugging Face, dari Artificial Analysis, dan dari katalog kami sendiri; angka yang dipublikasikan vendor dan angka yang diukur oleh pihak independen dilabeli secara terpisah, dan tidak ada apa pun di sini yang disimpulkan dari kemiripan.
Apa yang dimaksud dengan nama Ox Alpha saat ini
Alias itu sudah dipensiunkan, dan vendor-lah yang mempensiunkannya. Dokumentasi Z.ai sendiri untuk GLM-5.3-Flash menyebutkan bahwa model tersebut diuji secara anonim dengan nama ox-alpha sebelum dirilis, untuk mengumpulkan umpan balik pengguna, dan bahwa uji anonim itu menjadi model paling populer pada minggu tersebut. Penanda yang dapat diberi tanggal itu singkat dan spesifik: daftar stealth menunjukkan Ox Alpha dirilis pada 20 Agustus 2026, dan pengungkapannya muncul pada 26 Agustus — tanggal yang sama dengan yang tercantum di halaman dokumentasi Z.ai dan tanggal rilis yang sama yang dicatat katalog kami untuk z-ai/glm-5.3-flash.
Ada dua hal yang mengikuti dari itu, dan keduanya penting bagi pembaca yang mencari nama tersebut.
• Alias bukan sebuah rute. Katalog kami mengembalikan "model not found" untuk pencarian stealth/ox-alpha, dibaca pada 2026-09-28. Tidak ada yang bisa dipanggil dengan nama itu, karena produk vendor tersebut menyandang nama vendornya.
• Tidak ada pula repositori bobot milik vendor dengan alias tersebut. Pencarian Hugging Face untuk ox-alpha menghasilkan unggahan komunitas yang dibuat selama periode stealth pada akhir Agustus 2026, ditambah repositori yang hanya berisi kartu dari 27 September 2026 yang tidak memuat bobot dan mengarah ke rilis resmi Z.ai. Nama repositori adalah label yang dipilih oleh pengunggahnya; itu bukan dokumentasi apa pun. Organisasi Z.ai sendiri menerbitkan model tersebut sebagai zai-org/GLM-5.3-Flash, dengan repositori yang dibuat pada 2026-08-25 dalam UTC.
Pertanyaan penyedia yang mendominasi pekan anonim sudah tertutup, dan ditutup dengan cara biasa: sebuah lab maju dan mencantumkan namanya pada model itu. Yang tersisa adalah spesifikasi, dan itulah yang dibahas halaman ini. Kisah penemuan — fingerprinting yang mendahului pengungkapan, garis keturunan model anonim yang menjadi bagiannya, dan pengungkapan perangkat keras penyajian yang menyertainya — ada di artikel kami sebelumnya tentang investigasi Ox Alpha, dan halaman ini tidak membahas ulang satu pun dari itu.
Amplop, sebagaimana didokumentasikan oleh vendor

Ini adalah angka-angka yang dilaporkan oleh Z.ai, yang dibaca dari halaman dokumentasi vendor itu sendiri pada 2026-09-28, dan tiga dari empat dimensi envelope dikonfirmasi secara independen — catatan model Artificial Analysis memuat total 320B yang sama, 18B aktif, konteks 1.000.000 token, dan lisensi MIT, dan kartu katalog kami sendiri memuat batas konteks dan output.
• Context window — 1.000.000 token (dokumentasi Z.ai; Artificial Analysis; kartu katalog kami sendiri, yang mencantumkan 1.000.000)
• Output maksimum — 128K token (dokumentasi Z.ai); kartu kami mencatat 128.000
• Input — teks, gambar, video dan file (dokumentasi Z.ai, dibaca 2026-09-28); kartu kami mencantumkan teks, gambar dan video, dan tidak mengklaim input file
• Output — hanya teks, di setiap sumber
• Parameter — total 320B dengan 18B diaktifkan per token (dokumentasi dan kartu model Z.ai; Artificial Analysis secara independen mencatat 320B dan 18B)
• Lisensi — MIT, dengan bobot yang dipublikasikan di Hugging Face (kartu model vendor; Artificial Analysis mengklasifikasikan model tersebut sebagai bobot terbuka di bawah lisensi permisif)
• Arsitektur — hibrida dari attention sparse dan linear, yang oleh Z.ai digambarkan sebagai model frontier sumber terbuka pertama yang menggabungkan keduanya, mengurangi komputasi attention sebesar 3,01× dan KV cache sebesar 4,44× dibandingkan GLM-5.3, ditambah langkah IndexPool yang memampatkan empat vektor kunci indexer menjadi satu pada konteks panjang, dan Manifold-Constrained Hyper-Connections untuk efisiensi penskalaan. Semua berdasarkan pernyataan vendor; tidak ada audit arsitektur independen yang dapat dikutip.
• Pra-pelatihan — korpus multimodal 30 triliun token (dinyatakan oleh Z.ai). Vendor tidak menerbitkan angka total komputasi pelatihan dan tidak memberikan rincian parameter per lapisan selain angka utama 320B/18B.
Satu klaim envelope telah menyempit sejak peluncuran, dan dokumentasi terkini adalah yang patut dikutip. Pengungkapan perangkat keras penyajian yang beredar pada Agustus menempatkan kapasitas pekan anonim pada sekitar 100.000 chip domestik Tiongkok. Dokumentasi Z.ai sebagaimana tertulis saat ini menyatakan model tersebut disajikan "di seluruh puluhan ribu akselerator yang dikembangkan secara domestik," dengan peningkatan penyajian end-to-end 3× dibandingkan baseline vendor sendiri pada perangkat keras yang sama dan biaya per token yang digambarkan vendor sebanding dengan GPU NVIDIA arus utama. Puluhan ribu adalah yang dikatakan halaman itu sekarang; angka yang lebih besar adalah angka dari era peluncuran. Keduanya merupakan klaim perusahaan, tidak ada yang diaudit secara independen, dan arah revisinya menurun.
Kartu tarif, dan mengapa angka yang ditayangkan itulah yang penting
Halaman harga Z.ai mencantumkan GLM-5.3-Flash sebesar $0.15 per juta token masukan, $0.03 per juta token masukan yang di-cache, dan $0.50 per juta token keluaran, serta tier FlashX yang serumpun sebesar $0.37 / $0.075 / $1.25. Itu adalah harga daftar vendor, yang dibaca dari halaman vendor sendiri pada 2026-09-28.
Tarif yang sebenarnya diberlakukan pada rute kami hari ini lebih rendah, dan inilah poin praktis dari bagian ini. Baca pada 2026-09-28, kartu OrcaRouter untuk z-ai/glm-5.3-flash mencantumkan harga input $0.075 per juta token, output $0.25 per juta dan cache read $0.0173 per juta. Itu setengah dari tarif daftar vendor, pada model yang sama, pada hari yang sama — angka diskon, bukan angka utama, tanpa label promosi pada kartu tersebut. Liputan kami sebelumnya tentang model ini mencatat selisih yang sama setelah jendela promosi yang disebutkan berakhir; pengamatan itu masih berlaku hari ini, dan kami masih tidak dapat menemukan sumber alasannya, jadi kami melaporkan angka yang diberlakukan dan membiarkan penyebabnya terbuka.
Input yang di-cache adalah titik ketika ketiga sumber terlihat berbeda, yang merupakan pengingat berguna bahwa "$0.03" dalam sebuah tabel belum tentu merupakan harga yang benar-benar dibayar siapa pun. Halaman vendor menyebutkan $0.03 per juta token input yang di-cache; catatan model Artificial Analysis memuat harga cache-hit sebesar $0.026; rute kami menyajikan pembacaan cache sebesar $0.0173. Ketiganya dibaca pada atau tak lama sebelum 2026-09-28, ketiganya dilaporkan oleh vendor atau platform. Kami mengutip angka daftar vendor sebagai angka daftar dan angka yang dilayani sebagai jumlah yang sebenarnya ditagihkan kepada pemanggil.
Jalankan perhitungan untuk tugas agen yang representatif — 100.000 token masukan dan 10.000 token keluaran, tanpa cache hit:
• Dengan tarif daftar vendor — 100.000 token × $0,15/1Jt = $0,015, ditambah 10.000 × $0,50/1Jt = $0,005, jadi $0,020 per panggilan
• Dengan tarif yang dilayani rute kami saat ini — $0,0075 ditambah $0,0025, jadi $0,010 per panggilan, tepat setengahnya
Itulah alasan utamanya untuk memeriksa harga yang disajikan, bukan harga daftar, sebelum Anda menentukan ukuran beban kerja: pada agen dengan horizon panjang yang menjalankan ribuan panggilan per hari, selisih antara kedua angka tersebut adalah selisih antara dua anggaran. OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, itulah sebabnya diskon yang sedang dijalankan vendor muncul di kartu harga kami alih-alih diserap di suatu tempat di tengah.
Modalitas dan permukaan endpoint
Vendor mendokumentasikan satu bentuk antarmuka dan dua kode model: glm-5.3-flash dan glm-5.3-flashx, keduanya dilayani melalui Chat Completion API. Gambar dimasukkan sebagai blok konten dengan tipe image_url pada array konten pesan, menerima baik URL — yang direkomendasikan vendor — atau data URL base64, dan beberapa blok gambar dapat dikirim dalam satu pesan. Streaming didukung, dan Z.ai merekomendasikan mengaktifkan stream dan tool_stream bersama-sama untuk permintaan streaming. Pemanggilan alat, caching konteks, dan output JSON terstruktur semuanya merupakan kemampuan yang didokumentasikan; thinking didukung tetapi, seperti yang dijelaskan bagian berikutnya, bukan opsional.
FlashX adalah tier penyajian terpisah dari model yang sama, bukan kemampuan terpisah: Z.ai mendokumentasikannya pada 200 token per detik, dan menyatakan bahwa layanan ini belum tersedia di GLM Coding Plan. Ini bukan tier yang ada di katalog kami, dan bukan yang dijelaskan oleh angka-angka di halaman ini.
Di rute kami, permukaan endpoint lebih sempit dan layak dinyatakan secara persis. Kartu untuk z-ai/glm-5.3-flash mengekspos POST /v1/chat/completions — hanya chat completions, tanpa endpoint protokol kedua — dan menerima reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens dan stop. Chip kapabilitas pada kartu adalah vision, tools, JSON dan reasoning. Konteks adalah 1.000.000 token dan output maksimum 128.000, sesuai dengan dokumentasi vendor.
Upaya dan pemikiran: pengaturan yang menentukan setiap angka benchmark
Ini adalah bagian dari spesifikasi yang paling mengubah cara Anda membaca skor, dan vendor mendokumentasikannya secara tepat. GLM-5.3-Flash menerima reasoning_effort sebagai parameter dengan tiga tingkat — low, high, dan max — dan nilai default-nya adalah max jika Anda tidak memberikan apa pun, atau jika Anda memberikan apa pun yang bukan low atau high. Proses berpikir tidak dapat dimatikan: vendor menyatakan bahwa thinking.type hanya mendukung enabled. Flag clear_thinking pada templat chat default-nya false, dan Z.ai merekomendasikan untuk memberikannya secara eksplisit sebagai true untuk skenario chat. Pengaturan sampling yang direkomendasikan vendor adalah temperature 1 dan top_p 0.95, dan vendor mengatakan secara terang-terangan bahwa reproduksi benchmark dan leaderboard harus mempertahankan max effort default.
Baca kedua fakta itu bersama-sama, dan konsekuensinya bagi siapa pun yang membandingkan angka tidak terhindarkan: skor yang dikutip tanpa tingkat upaya bukanlah pengukuran yang lengkap, karena setelan low, high, dan max adalah titik operasi yang berbeda dari model yang sama, dan default adalah yang paling mahal di antara ketiganya. Kartu kami memaparkan reasoning dan reasoning_effort di antara parameter yang didukungnya, sehingga setelan itu dapat dijangkau melalui rute, bukan hanya melalui vendor.
Lembar tolok ukur, dengan revisi terlampir
Z.ai menerbitkan tabel benchmark untuk GLM-5.3-Flash, dan sepenuhnya dilaporkan oleh vendor — catatan independen Artificial Analysis tidak mereproduksi baris-baris ini. Angka utama pengodean dan agentic dari vendor adalah DeepSWE v1.1 pada 63.4 berbanding 46.2 milik GLM-5.2, dan AutomationBench v1.0.6 pada 48.8 berbanding 26.2 milik GLM-5.2. Sisa lembar ini, sebagaimana katalog kami sendiri memuatnya dengan Z.ai sebagai sumber yang disebutkan: Humanity's Last Exam dengan tools 55.3, Agents' Last Exam 26.3, NL2Repo 56.3, Chartography dengan tools 78, penalaran CharXiv dengan tools 89.4, dan di sisi visi MMVU 80.5, MVBench 77.8 dan BabyVision 53.4.
Dua baris vendor layak membuat catatan kakinya disertakan ke dalam kalimat, karena baris-barislah yang paling mungkin dikutip pembaca tanpa catatan kaki tersebut. Evaluasi coding internal Z.ai, Z.ai Code Bench v1.0, menempatkan GLM-5.3-Flash pada 29,0 dengan upaya maksimum melawan Claude Opus 4.8 pada 29,5 — hampir seri pada harness milik vendor sendiri, dijalankan pada Claude Code 2.1.207, dilaporkan oleh vendor. Itu bukan perbandingan independen dan bukan perbandingan dengan upaya yang disetarakan yang dijalankan pihak ketiga; itu adalah Z.ai yang melakukan benchmark pada modelnya terhadap pesaing pada evaluasinya sendiri. Dan vendor menyebut Artificial Analysis Intelligence Index sebesar 57 pada $0,045 per tugas, dengan menyebut revisinya sebagai v4.1.1.
Angka terakhir itu perlu dipisahkan dari apa yang dipublikasikan Artificial Analysis saat ini, karena keduanya tidak dapat diletakkan berdampingan sebagai sebuah pergerakan. Halaman Artificial Analysis sendiri untuk GLM-5.3-Flash, yang dibaca pada 2026-09-28, melaporkan Intelligence Index sebesar 41.8 pada Indeks v4.3.2, yang tercatat pada max effort. v4.3.2 mencakup sepuluh evaluasi — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, dan AA-LCR v1.1 — sedangkan v4.1.1 tidak. Dua revisi indeks, dua kumpulan tugas, dua angka. Tidak ada yang salah; keduanya bukan pengukuran yang sama, dan mengutip 57 di samping 41.8 seolah-olah model tersebut telah bergerak akan menjadi kesalahan di kedua arah.
Yang memang dikuatkan oleh catatan independen adalah cakupan spesifikasinya, bukan skornya: Artificial Analysis secara independen mencatat 320B total parameter, 18B diaktifkan, jendela konteks 1.000.000 token, lisensi MIT, bobot terbuka, dan tanggal rilis 2026-08-26, serta mencantumkan harga vendor $0,15 untuk input dan $0,50 untuk output per juta token dengan harga cache-hit $0,026. Ketika vendor mempublikasikan skor dan pihak independen tidak, kami menyatakannya; jika pihak independen mengonfirmasi spesifikasi, itu adalah kelas fakta terkuat di halaman ini.
Tidak ada adu langsung yang setara di sini, dan mengatakan hal itu lebih berguna daripada membuat satu. Belum ada yang menerbitkan rangkaian pengujian GLM-5.3-Flash melawan Claude Opus 4.8, GPT-6 Sol, atau Grok 4.7 pada effort yang dinyatakan di harness yang sama — perbandingan Z.ai sendiri ada di bench miliknya sendiri, pada effort maksimum, melawan default pesaing. Sampai itu berubah, perbandingan jujur antara model ini dan apa pun yang lain adalah pada harga, envelope, dan permukaan endpoint, yang merupakan tiga hal di halaman ini yang bisa dibaca semua orang dari angka yang sama.
Apa yang tidak didokumentasikan, dinyatakan secara gamblang
Halaman referensi untuk model dengan permukaan informasi yang tipis hanya berguna jika jujur tentang celah-celahnya, dan yang ini memiliki beberapa.
• Tidak ada batas pengetahuan vendor. Dokumentasi Z.ai dan kartu model Hugging Face tidak menyebutkannya, dan catatan Artificial Analysis membiarkan bidang itu null. Perkiraan dari jendela stealth merupakan kerja komunitas, bukan angka dari vendor, dan halaman ini tidak mengulanginya seolah-olah itu angka vendor.
• Tidak ada catatan kaki harness untuk sebagian besar lembar benchmark. Kartu model memang memuat catatan kaki untuk uji HLE with-tools — temperature 1,0, top_p 0,95, panjang generasi maksimum 163.840 token, evaluasi hingga konteks 300.000 token dengan strategi pengelolaan konteks, dan GPT-5.6 Luna pada effort sedang sebagai model juri — serta untuk NL2Repo dan DeepSWE, yang menurut vendor dijalankan dengan harness mini-swe-agent. Baris-baris lainnya hanyalah persentase tanpa keterangan harness atau effort.
• Tidak ada penjelasan tentang selisih harga input yang di-cache. Tiga angka untuk kuantitas yang sama pada model yang sama, dan tidak ada sumber yang menyatakan mengapa angka-angka itu berbeda.
• Tidak ada tolok ukur independen untuk periode penyajian anonim. Daftar stealth-nya sudah hilang; apa pun yang diukurnya tidak dapat diukur lagi, dan tidak ada pihak ketiga yang menerbitkan pengujian terhadap alias tersebut selama masih aktif.
• Tidak ada perbandingan pihak ketiga dengan upaya yang sepadan, karena alasan yang diberikan di atas.
• Tidak ada konfirmasi vendor mengenai jumlah chip pada masa peluncuran. Dokumentasi menyebutkan puluhan ribu akselerator domestik; angka 100.000 tidak tercantum di halaman tersebut.
Sebut saja: apa yang katalog kami sajikan, diverifikasi hari ini

Model di balik Ox Alpha kini aktif di katalog kami dengan namanya sendiri, diperiksa hari ini, bukan diasumsikan. Pembacaan API model OrcaRouter untuk z-ai/glm-5.3-flash pada 2026-09-28 mengembalikan kartu secara lengkap: konteks 1.000.000 token, keluaran maksimum 128.000, masukan teks, gambar, dan video dengan keluaran teks, chip kemampuan visi, tools, JSON, dan penalaran, tanggal rilis 2026-08-26, tidak dideprekasi dan tidak dihapus dari daftar, dengan harga $0,075 per juta token masukan, $0,25 per juta token keluaran, dan $0,0173 per juta token masukan yang di-cache, melalui endpoint tunggal POST /v1/chat/completions.
Pengukuran playground tujuh hari kami sendiri pada kartu itu, untuk periode yang sama, menunjukkan 61,8 token keluaran per detik, waktu p50 hingga token pertama sebesar 7,39 detik, dan tingkat kesalahan sebesar 1,47%. Angka-angka tersebut adalah angka pihak pertama tentang penyajian kami, bukan angka vendor dan bukan tolok ukur independen, dan karena itulah angka-angka itu satu-satunya angka kecepatan di halaman ini.
Alias itu sendiri tidak ada di rute ini. Jika Anda sampai di sini setelah mencari Ox Alpha, model yang perlu dipanggil adalah z-ai/glm-5.3-flash, dan bentuk permintaannya adalah yang dijelaskan di atas. Ia berada pada kunci yang sama dengan semua hal lain di katalog — satu API untuk 200+ model, harga dari penyedia diteruskan tanpa markup tambahan, dan failover otomatis jika penyedia tersendat, sehingga model yang sedang Anda uji coba tidak harus menjadi model yang menjadi tumpuan jalur produksi Anda.

Satu klarifikasi tentang apa sebenarnya halaman ini, karena pembaca yang tiba dari nama model itu sendiri berhak mendapatkannya. Ini adalah halaman referensi untuk model yang sudah ada di katalog, bukan laporan peluncuran: GLM-5.3-Flash berasal dari 26 Agustus 2026, dan kehadirannya di sini bertumpu pada fakta bahwa nama Ox Alpha terus dicari tanpa halaman khusus untuk dituju, bukan pada kebaruan peluncurannya. Tanggal di atas digunakan untuk memberi tanggal pada model, bukan sebagai berita. Yang akan mengubah halaman ini adalah salah satu dari empat hal — uji benchmark independen pada tingkat upaya yang dinyatakan, batas pengetahuan yang dinyatakan vendor, perubahan pada tarif yang diberlakukan, atau keputusan oleh Z.ai untuk menyatakan berapa jumlah chip pada era peluncuran yang sebenarnya. Sampai salah satu dari hal-hal itu terwujud, spesifikasi di atas adalah keseluruhan dari apa yang didokumentasikan vendor, dan celah-celah yang dicantumkan di bagian sebelumnya sama-sama menjadi bagian dari jawaban seperti halnya angka-angka itu.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
