
NV-Reason-CT vs GLM-5.2: Salah Satunya Sudah Dideprecated, dan Bukan yang Anda Pikirkan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 97 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 182 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Model yang lebih lama dalam perbandingan ini adalah model yang sedang dipensiunkan. GLM-5.2dirilis pada 16 Juni 2026; NV-Reason-CTmemiliki aktivitas repositori bertanggal antara 2 dan 25 September 2026. Anda tentu menduga yang September itu adalah kuantitas yang belum pasti dan yang Juni adalah pilihan yang sudah mapan. Yang terjadi justru sebaliknya pada poros yang penting bagi pipeline teks: GLM-5.2 telah digantikan oleh GLM-5.3, yang dirilis pada 18 Agustus 2026, dan kini model itu menyandang penanda deprecation pada papan peringkat independen tempat angkanya dipublikasikan. NV-Reason-CT, apa pun yang masih belum terselesaikan mengenainya, adalah rilis terkini dari satu-satunya hal yang ia kerjakan.
Jadi, kalimat berguna pertama di artikel ini adalah kalimat yang paling kecil kemungkinannya sudah dimiliki pembaca: jika Anda memulai build teks hari ini dan langsung mengambil GLM-5.2 karena kebiasaan, berhenti dan lihat GLM-5.3 terlebih dahulu. Biayanya $1,26 per juta token masukan dan $3,96 per juta token keluaran, dibandingkan $1,40 dan $4,40 milik GLM-5.2 — model ini lebih baru sekaligus lebih murah — dan indeks kecerdasan independennya 44,8 berbanding 33,7, yang merupakan kenaikan satu langkah pada skala yang sama, bukan sekadar pergeseran menyamping. Itu adalah keputusan yang terpisah dari apa pun yang berkaitan dengan CT, dan keputusan itu layak diambil secara terpisah.
Dua model, dan dua jenis basi yang berbeda
Ada perbedaan nyata antara model yang sudah tua dan model yang sudah digantikan, dan pasangan ini membuatnya menjadi konkret.
• Apa fungsinya — NV-Reason-CT membaca volume CT dada atau abdomen dan menghasilkan temuan terstruktur berdasarkan region anatomi; GLM-5.2 adalah model bahasa khusus teks untuk penalaran, kode, dan pekerjaan dokumen panjang
• Dirilis — artefak NV-Reason-CT bertanggal 2 hingga 25 September 2026; GLM-5.2 pada 16 Juni 2026, dengan GLM-5.3 menyusul pada 18 Agustus 2026
• Status generasi — NV-Reason-CT adalah versi 0.1, rilis awal, belum diumumkan; GLM-5.2 adalah generasi sebelumnya dari lini produk yang sudah dipasarkan
• Kedudukan independen — tidak ada pengukuran independen atas NV-Reason-CT; GLM-5.2 terukur pada 33,7 di Artificial Analysis Intelligence Index, dengan penanda penghentian penggunaan, dibandingkan dengan GLM-5.3 pada 44,8
• Lisensi dan akses — bobot OpenMDW-1.1 yang Anda unduh; dibandingkan dengan model berbobot terbuka yang dilayani pada $1,40 dan $4,40 per juta token dengan pembacaan cache sebesar $0,26
• Konteks — 13.824 token visual per volume tanpa jendela obrolan; dibandingkan dengan 1.000.000 token masuk dan 128.000 token keluar
• Penggunaan yang dinyatakan — hanya untuk penelitian dan pendidikan, bukan perangkat medis; menentang penerapan untuk tujuan umum
Kata "deprecated" melakukan tugas yang presisi di sini dan sebaiknya tidak dibaca secara berlebihan. Penanda deprecation pada papan peringkat berarti evaluator tidak lagi memperlakukan model tersebut sebagai model terkini, biasanya karena sudah ada penerus yang menggantikannya. Ini tidak berarti bobotnya telah ditarik, API dimatikan, atau model berhenti berfungsi. Tim dengan pipeline yang disetel terhadap GLM-5.2 tidak dalam masalah. Yang dimaksud adalah bahwa angka-angkanya merupakan snapshot dari sebelum GLM-5.3 ada, dan mencampurnya dengan angka terkini untuk model lain sama dengan membandingkan pengukuran Juni dengan lanskap September.
Angka-angka yang dimiliki masing-masing pihak, dan berapa nilainya
Rekam jejak GLM-5.2 luar biasa padat dan berasal dari dua sumber yang berselisih dengan cara yang mendidik.
Dari laporan Z.ai sendiri, model ini mencatat 99,12 pada τ²-Bench, 62,1 pada SWE-bench Pro, 54,7 pada Humanity's Last Exam dengan alat, dan 82,7 sebagai angka terbaik yang dilaporkan pada Terminal-Bench 2.1. Di sisi independen, Artificial Analysis mengukur model yang sama pada 77,9 di Terminal-Bench 2.1, 33,7 pada Intelligence Index miliknya, 89,5 pada GPQA Diamond, dan 41,1 pada Humanity's Last Exam. Ada angka vendor lain — 99,2 pada AIME 2026, 92,5 pada HMMT February 2026, 91 pada IMOAnswerBench, 74,4 pada FrontierSWE, 63,7 pada ProgramBench, 76,8 pada MCP-Atlas — dan semuanya berasal dari Z.ai.
Ada dua hal tentang daftar itu yang layak disebut. Pertama, selisih 4,8 poin pada Terminal-Bench 2.1 antara angka terbaik yang dilaporkan vendor, 82,7, dan angka independen 77,9 bukanlah sebuah kontradiksi. Angka terbaik yang dilaporkan vendor biasanya adalah yang terbaik dari beberapa harness, dan angka Terminus-2 milik Z.ai sendiri untuk benchmark yang sama adalah 81 — pengukuran independen itu berada di dalam rentang milik vendor sendiri. Kedua, perbedaan pada Humanity's Last Exam lebih besar: 41,1 secara independen versus angka vendor 40,5 tanpa alat dan 54,7 dengan alat, yang berarti angka utama 54,7 adalah angka berbantuan alat dan 41,1 adalah angka tanpa bantuan alat. Mengutip 54,7 di samping skor tanpa bantuan alat milik model lain akan menjadi kesalahan nyata.
Rekam jejak NV-Reason-CT tidak memiliki struktur dua sumber semacam itu, dan di situlah tepatnya ia lebih lemah. Hasil CT-RATE-nya — 0,614 F1 dan 0,871 AUROC pada delapan belas label, dengan ambang batas seragam tetap dan prompt ya/tidak langsung serta tanpa classification head atau adaptasi khusus tugas — adalah milik NVIDIA sendiri. Model-model yang dibandingkan dengannya dalam makalah itu (VoxelFM 0,581, Pillar-0 0,544, ClinFusion-8B 0,442, CT-CLIP 0,398, Merlin 0,358, MedGemma 1.5 0,303) semuanya adalah model pencitraan. Belum ada yang direproduksi secara independen, dan model tersebut sudah dapat diunduh selama berminggu-minggu. Ia juga melaporkan macro-F1 turunan laporan sebesar 0,592 dan studi pendahuluan ahli radiologi yang menghubungkan tinjauan berbantuan dengan pengurangan 50% dalam rata-rata waktu interpretasi yang dilaporkan, yang oleh para penulis sendiri ditandai sebagai sampel kecil yang parah.
Jadi perbandingan provenans tidak menguntungkan model yang lebih baru, dan inilah poin yang layak direnungkan. GLM-5.2 adalah model yang lebih lama, yang sudah digantikan, dan angkanya lebih dapat dipercaya daripada NV-Reason-CT, karena seseorang di luar perusahaan menjalankan perangkat ujinya. Menjadi mutakhir tidak sama dengan sudah terverifikasi.

Mengapa deprekasi ini lebih penting daripada yang terdengar
Ada kegagalan spesifik yang hendak dicegah oleh perbandingan ini, dan itu sama sekali tidak berkaitan dengan CT.
Tim yang membangun pipeline teks klinis mencari model open-weight untuk dijalankan di perangkat keras mereka sendiri, karena datanya sensitif. Mereka menemukan GLM-5.2, yang berlisensi MIT dengan 743 miliar parameter dan sekitar 40 miliar aktif, sesuai dengan kebutuhan itu, dan memiliki rekam jejak benchmark yang terdokumentasi baik. Mereka melakukan tuning terhadapnya. Enam bulan kemudian mereka menemukan bahwa generasi saat ini adalah GLM-5.3, bahwa model itu berkonteks 1M dengan batas keluaran 128K, bahwa biayanya lebih murah pada $1.26 dan $3.96, dan bahwa keputusan yang mereka pikir sedang mereka ambil — model open-weight mana yang akan dijadikan standar — sebenarnya adalah keputusan tentang generasi mana, dan mereka membuatnya secara tidak sengaja.
Itu adalah kecelakaan mahal yang baru ditemukan terlambat, dan dapat dihindari dengan satu pencarian. Panduan konkretnya:
• Periksa apakah model yang akan Anda jadikan standar adalah generasi terkini — penanda penghentian dukungan di papan peringkat adalah sinyal tercepat, dan daftar model milik vendor itu sendiri adalah yang otoritatif
• Jangan mencampurkan snapshot Juni dengan angka September — Indeks GLM-5.2 sebesar 33,7 diukur sebelum GLM-5.3 ada, dan menempatkannya di samping indeks model terkini berarti membandingkan dua momen berbeda dalam bidang yang bergerak
• Hati-hati dengan namanya — penawaran "GLM-5.3 Prime" adalah tier penyajian yang membawa bobot yang sama dengan harga daftar sekitar dua kali lipat, bukan model tersendiri. Periksa bobot di balik SKU mana pun sebelum membayar harga premium untuknya
• Anggap tarif utama yang lebih rendah sebagai pertanyaan, bukan jawaban — GLM-5.3 yang lebih murah daripada pendahulunya adalah hal yang tidak biasa dan layak diverifikasi terhadap beban kerja Anda sendiri daripada sekadar berasumsi
Tidak ada dari semua itu yang menjadikan GLM-5.2 pilihan yang buruk. Model 743B berlisensi MIT dengan harga $1,40 dan $4,40 yang telah menjadi dasar tuning bagi sebuah tim adalah hal yang sepenuhnya wajar untuk terus dijalankan, dan model pertengahan generasi dengan rekam jejak yang mapan terkadang justru persis seperti yang diinginkan oleh alur kerja yang teregulasi. Intinya, itu harus menjadi pilihan yang dibuat secara sengaja, bukan default yang diwarisi dari daftar yang mutakhir pada bulan Juli.
Jebakan dalam membandingkan model teks dengan model CT
Alasan mengapa pasangan ini bisa tampak masuk akal adalah bahwa keduanya merupakan model dengan bobot terbuka yang dirilis pada 2026, dan pembaca yang memindai katalog melihat dua item baris yang sebanding. Keduanya tidak sebanding dan ketidakcocokannya memiliki bentuk yang spesifik.
GLM-5.2 menampung 1,000,000 token. Satu volume CT NV-Reason-CT membutuhkan 13,824 token visual. Dengan aritmetika itu, GLM-5.2 dapat menampung tujuh puluh studi CT dan masih memiliki ruang, yang mengundang kesimpulan bahwa model teks dengan konteks yang cukup panjang membuat model pencitraan menjadi redundan. Kesimpulan itu tidak dapat ditarik, dan alasannya adalah antarmuka, bukan anggaran.
13.824 token itu bukan sebuah ringkasan. Itu adalah kubus 384 milimeter yang di-resample menjadi isotropik 2 mm, dipotong menjadi patch 8 x 8 x 8 pada grid 24 x 24 x 24, lalu diserahkan ke backbone bahasa tanpa downsampling spasial dan tanpa lapisan penggabungan — itulah sebabnya jalur aktifnya adalah 4,35B parameter dari total 4,69B, dan sebabnya komputasi dihabiskan untuk mempertahankan resolusi alih-alih memampatkannya. GLM-5.2 hanya teks. Ia sama sekali tidak memiliki jalur penglihatan, jadi pertanyaan tentang bagaimana ia akan menangani pemindaian tidak muncul; jawabannya adalah ia tidak dapat diberi pemindaian itu dalam bentuk apa pun. Dua kartu model tersebut menjelaskan perbedaan anggaran token sebesar enam ratus kali lipat yang tidak ada hubungannya dengan perbandingan itu, karena salah satunya tidak memiliki cara untuk menerima input.
Kesalahan sebaliknya juga sama mungkinnya. NV-Reason-CT mendukung dada dan abdomen, menerima file NIfTI alih-alih prompt, tidak memiliki penggunaan alat, dan kartu modelnya membatasinya untuk riset dan pendidikan serta menyatakan bahwa ini bukan perangkat medis dan bahwa outputnya bisa salah. Ia tidak dapat menormalisasi korpus laporan, menulis harness evaluasi, atau bernalar atas dokumen pedoman. Model pencitraan 4,7B bukan pengganti model teks 743B, begitu pula sebaliknya.

Menaruh setengah teks pada satu tombol
Jika pertanyaannya adalah model teks mana yang harus dipakai untuk menjalankan pekerjaan pipeline, jawabannya saat ini mungkin GLM-5.3, bukan GLM-5.2 — dan keduanya ada di katalog kami di bawah satu kunci. z-ai/glm-5.2 dilayani dengan tarif daftar penyedia Z.ai tanpa markup, dan GLM-5.3 bersamanya, di dalam satu API yang mencakup lebih dari 200 model. Menjaga keduanya tetap tersedia lebih penting dari biasanya selama pergantian generasi: Anda dapat mengukur penerusnya pada korpus Anda sendiri sebelum berkomitmen, menyimpan model yang sedang berlaku sebagai cadangan selama proses itu, dan beralih tanpa kontrak kedua atau perubahan kode.
Tarif pass-through layak mendapat satu kalimat karena alasan yang sama dengan pentingnya hal itu pada model apa pun yang vendornya menetapkan ulang harga. Karena tidak ada lapisan markup di antaranya, perubahan tarif vendor sampai ke sisi kami pada hari yang sama. Failover otomatis menangani provider yang performanya menurun di tengah batch, yang untuk tugas ekstraksi panjang adalah kegagalan yang benar-benar menghabiskan waktu semalaman, dan DSL routing memungkinkan Anda mengirim permintaan individual ke model yang seharusnya menanganinya alih-alih mengarahkan semuanya ke satu endpoint.
NV-Reason-CT tidak ada di platform kami, dan tidak ada model NVIDIA pun yang ada di sana. Hal itu layak dinyatakan secara gamblang daripada dibiarkan menjadi kesimpulan sendiri: sisi CT dari arsitektur ini adalah bobot yang diunduh di perangkat keras Anda sendiri, di bawah lisensi yang mengizinkannya dan model card yang melarang penggunaan klinis. Kami tidak menghostingnya dan kami tidak akan menulis kalimat yang menyiratkan sebaliknya.
Urutan untuk membuat keputusan-keputusan ini
Urutan yang tepat untuk build klinis bukanlah urutan yang disiratkan oleh perbandingan tersebut.
Mulailah dengan pertanyaan generasi teks, dan mulailah dengan memeriksa generasi mana yang terkini — GLM-5.3 alih-alih GLM-5.2, dari segi harga dan kemampuan terukur, kecuali Anda punya alasan untuk tetap bertahan. Lalu ukur latensi per studi model CT di perangkat keras Anda sendiri, karena angka itu tidak dipublikasikan dan menentukan sisa anggaran. Lalu rancang pipeline agar kedua bagiannya dapat diganti secara independen, karena yang satu berada pada siklus hidup yang berdekatan dengan pratinjau dan yang lainnya berada pada versi 0.1.
Satu hal yang tidak boleh dilakukan adalah memperlakukan keduanya sebagai pilihan. Model teks 743B yang telah digantikan dan model CT 4.69B yang terkini tidak memiliki tugas yang sama. Perbandingan itu layak dilakukan hanya demi apa yang diungkapkannya: bahwa artefak yang lebih baru memiliki bukti yang lebih lemah yang mendasarinya, bahwa yang lebih tua diam-diam sudah di luar generasi, dan bahwa kedua fakta itu tak terlihat oleh siapa pun yang membaca baris katalog yang mencantumkan keduanya berdampingan seolah-olah keduanya adalah alternatif.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
