Kartu hero yang dihasilkan untuk perbandingan GPT-6.1 Sol versus GLM-5.3, berjudul 'Tujuh poin indeks, 2,8 kali biayanya', dengan lencana bertuliskan 'GPT-6.1 Sol: $0.72 per tugas indeks', 'GLM-5.3: $2.01 per tugas indeks' dan 'Bobot GLM-5.3: dapat diunduh sejak 25 Agustus 2026', catatan kaki bertuliskan 'Angka independen menurut Artificial Analysis v4.3.2, upaya maksimal; kartu yang dihasilkan AI', dan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

GPT-6.1 Sol vs GLM-5.3: Bobot Telah Dirilis, dan Tagihannya Tidak Berubah

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Open​AI merilis GPT-6.1 Sol pada 29 September 2026 dalam keynote DevDay-nya, dan Z.ai merilis GLM-5.3 enam minggu lebih awal, pada 18 Agustus 2026, lalu menahan checkpoint itu selama seminggu. Masa penahanan itu sudah berakhir: zai-org/GLM-5.3 telah tersedia di Hugging Face sejak 25 Agustus, sebuah checkpoint BF16/FP8 dengan sekitar 753 miliar parameter, yang sekitar 40 miliar di antaranya aktif per token, dan sejak itu telah melampaui 1,4 juta unduhan. Jadi pertanyaan yang paling sering diajukan oleh berbagai perbandingan sejak Agustus — apakah ini model terbuka atau model sewaan? — kini memiliki jawaban, dan jawabannya tidak mengubah aritmetika. Di papan peringkat independen, GPT-6.1 Sol mencetak 51,8 dan berbiaya $0,72 per tugas indeks yang diselesaikan; GLM-5.3 mencetak 44,8 dan berbiaya $2,01. Anda sekarang dapat memiliki model yang lebih murah per token namun tetap membayar hampir tiga kali lipat per pekerjaan yang selesai.

Apa sebenarnya masing-masing model

GPT-6.1 Sol adalah model GPT-6 kelas menengah milik OpenAI, satu tingkat di bawah GPT-6 Astra yang menjadi andalan dan di atas GPT-6 Luna yang hemat. Model ini memiliki jendela konteks 1.050.000 token dengan batas keluaran 128.000 token serta batas pengetahuan 30 April 2026, dan menerima teks, gambar, dan berkas sebagai masukan. Penalaran berjalan dari rendah hingga maks dengan default sedang; nilai tidak ada dan minimal yang dahulu diterima GPT-6 Sol kini mengembalikan galat, yang diatasi oleh panduan migrasi OpenAI sendiri dengan memberi tahu pengembang untuk menggantinya dengan rendah. Biayanya $2,00 per juta token masukan dan $10,00 per juta token keluaran, dengan masukan yang di-cache $0,10.

GLM-5.3 adalah andalan Z.ai saat ini untuk rekayasa perangkat lunak dan pekerjaan agentik jangka panjang, dibangun di atas basis mixture-of-experts yang sama dengan GLM-5.2 dengan peningkatan yang berasal dari pasca-pelatihan, bukan dari model yang lebih besar. Model ini masukan teks, keluaran teks — tanpa visi, berapa pun harganya — dengan jendela 1 juta token, batas keluaran 128.000 token, dan thinking yang selalu aktif. Tidak ada mode non-reasoning, yang merupakan batasan keras untuk panggilan yang sensitif terhadap latensi. Z.ai mencantumkannya pada $1,40 masuk dan $4,40 keluar per juta token dengan input yang di-cache sebesar $0,26; katalog kami sendiri memuatnya pada $1,26 dan $3,96 dengan pembacaan cache $0,234, jadi kartu vendor adalah angka yang lebih konservatif dan angka yang perlu dijadikan dasar argumen.

Kartu tarif, dan baris yang membalikkannya

Satu baris per dimensi, kedua sisi pada masing-masing:

• Masukan — GPT-6.1 Sol $2.00 per 1M vs GLM-5.3 $1.40 per 1M; GLM 30% lebih murah
• Keluaran — GPT-6.1 Sol $10.00 per 1M vs GLM-5.3 $4.40 per 1M; GLM 56% lebih murah
• Masukan yang di-cache — GPT-6.1 Sol $0.10 per 1M vs GLM-5.3 $0.26 per 1M; urutannya terbalik, Sol 2.6× lebih murah
• Klausa konteks panjang — GPT-6.1 Sol menetapkan harga ulang untuk seluruh permintaan di atas 272,000 token masukan pada 2× masukan dan cache serta 1.5× keluaran vs GLM-5.3 yang tidak memiliki klausa serupa pada kartu yang dipublikasikan
• Konteks dan keluaran — 1,050,000 masuk / 128,000 keluar vs 1M masuk / 128,000 keluar; perbedaan 5%, tidak material
• Modalitas — teks, gambar, dan berkas masuk, teks keluar vs hanya teks
• Batas bawah penalaran — GPT-6.1 Sol low, medium (default), high, xhigh, max vs GLM-5.3 selalu aktif, tidak ada batas bawah untuk diturunkan
• Bobot — tertutup, hanya API vs terbuka, dapat diunduh, FP8
• Skor independen, Artificial Analysis v4.3.2 pada upaya maksimal — 51.8 vs 44.8
• Biaya independen per tugas indeks — $0.72 vs $2.01
• Token keluaran untuk proses indeks — 67 juta vs 210 juta

<img src="2.png" alt="Papan skor perbandingan dua kolom yang dihasilkan, berjudul 'GPT-6.1 Sol vs GLM-5.3 - papan skor'. Kolom kiri 'GPT-6.1 Sol': baris-baris bertuliskan 'Indeks Kecerdasan: 51.8', 'Biaya per tugas indeks: $0.72', 'Harga input: $2.00 per 1 juta', 'Harga output: $10.00 per 1 juta', 'Token output pada proses indeks: 67 juta', 'Bobot: tertutup'. Kolom kanan 'GLM-5.3': baris-baris bertuliskan 'Indeks Kecerdasan: 44.8', 'Biaya per tugas indeks: $2.01', 'Harga input: $1.40 per 1 juta', 'Harga output: $4.40 per 1 juta', 'Token output pada proses indeks: 210 juta', 'Bobot: terbuka di Hugging Face'. Bagian footer bertuliskan 'Angka independen menurut Artificial Analysis v4.3.2 pada upaya maksimal; harga daftar vendor.' Logo OrcaRouter berada di sudut kanan bawah." /> Pasangan terakhir itulah titik di mana pertarungan ini diputuskan, dan itu bukan efek yang samar.

A generated two-column comparison scoreboard titled 'GPT-6.1 Sol vs GLM-5.3 - the scoreboard'. Left column 'GPT-6.1 Sol': rows reading 'Intelligence Index: 51.8', 'Cost per index task: $0.72', 'Input price: $2.00 per 1M', 'Output price: $10.00 per 1M', 'Output tokens on index run: 67M', 'Weights: closed'. Right column 'GLM-5.3': rows reading 'Intelligence Index: 44.8', 'Cost per index task: $2.01', 'Input price: $1.40 per 1M', 'Output price: $4.40 per 1M', 'Output tokens on index run: 210M', 'Weights: open on Hugging Face'. A footer reads 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.' The OrcaRouter logo sits in the bottom-right corner.

Masalah 210 juta token

Artificial Analysis menjalankan rangkaian sepuluh evaluasi yang sama terhadap setiap model di papan peringkat dan mempublikasikan jumlah token di balik setiap skor. GLM-5.3 menghasilkan sekitar 210 juta token output untuk menyelesaikan pengujian tersebut. GPT-6.1 Sol menghasilkan 67 juta. Jika dibandingkan dengan kelas pembanding masing-masing model di papan peringkat, 210 juta milik GLM-5.3 berada di atas median kelas sekitar 140 juta, sedangkan 67 juta milik Sol berada jauh di bawah median sekitar 81 juta dari kelas unggulan tempat model itu dinilai. Karena output adalah sisi yang mahal dari setiap kartu tarif, diskon utama 56% GLM-5.3 pada lini output tidak bertahan saat dihadapkan pada pengukuran: model ini mengeluarkan 3,1× token dengan harga 0,44×, dan 3,1 × 0,44 adalah 1,37 — GLM-5.3 adalah model yang lebih mahal untuk beban kerja ini meskipun kartu tarifnya jauh lebih murah.

Angka biaya per tugas milik papan peringkat itu sendiri mengonfirmasi arah dan ukuran kasarnya. $2,01 dibanding $0,72 adalah 2,8×, lebih besar daripada yang disiratkan oleh rasio token saja, karena GLM-5.3 juga membayar lebih pada pos input dan cache per tugas. Ada baiknya kita bersikap tepat mengenai apa yang dibuktikan dan tidak dibuktikan oleh hal ini: uji indeks tersebut adalah sepuluh evaluasi tetap, dan verbositas pada uji tersebut tidak sama dengan verbositas pada trafik Anda. Tetapi bagi pembeli, token adalah yang ditagihkan, dan bentuk perbedaannya sama pada kumpulan tugas mana pun di mana model harus menghasilkan jawaban panjang.

Offset parsialnya adalah baris input yang di-cache. Pembacaan cache GLM-5.3 adalah $0,26 terhadap basis $1,40, dan milik GPT-6.1 Sol adalah $0,10 terhadap basis $2,00 — Sol menang dengan faktor 2,6 pada tarif yang mendominasi beban kerja apa pun dengan prefiks yang stabil. Jika lalu lintas Anda berupa korpus tetap yang besar dengan jawaban satu paragraf, GLM-5.3 dengan jelas merupakan opsi yang lebih murah dan Anda sebaiknya memilihnya. Jika lalu lintas Anda tampak seperti lalu lintas yang menjadi sasaran kedua model ini dibuat — loop agen, penyuntingan berskala repositori, keluaran panjang yang dihasilkan — keunggulan input yang di-cache menyusut menjadi derau dibandingkan rasio token 3×.

Di mana nomor vendor berakhir

Angka peluncuran Z.ai kuat dan, seperti biasa, belum direproduksi. Terminal-Bench 2.1 pada 88,2, DeepSWE v1.1 pada 66,9, CyberGym pada 84,5, ExploitBench pada 54,4, AutomationBench pada 48,2, GDPval-AA v2 pada 1769 Elo. Satu angka yang patut dibaca dua kali adalah Terminal-Bench 3.0 pada 28,3 — benchmark penerusnya, dan koreksi terhadap 88,2 pada benchmark yang lebih lama. Sebuah model bisa unggul pada benchmark yang menjadi sasaran pascapelatihannya dan biasa saja pada generasi berikutnya dari benchmark yang sama.

Angka peluncuran Open​AI untuk GPT-6.1 Sol sepenuhnya dibingkai seputar biaya per tugas yang diselesaikan alih-alih skor mentah: DeepSWE v1.1 mengalahkan yang terbaik dari GPT-6 Sol dengan selisih 6,4 poin persentase pada upaya penalaran yang lebih rendah, AutomationBench 1.0.6 unggul 2,2 poin atas Claude Opus 5.5 pada upaya sedang, OSWorld 2.0 naik tujuh poin pada GPT-6 Sol pada upaya maksimum, Terminal-Bench Science 0.1 lebih dari dua kali lipat GPT-6 Sol dengan biaya per tugas kurang dari setengahnya. Perhatikan bahwa ini adalah Open​AIharness Open​AI dengan pengaturan Open​AI kumpulan benchmark terpilih, dan bahwa tidak satu pun dari ini telah direproduksi secara independen.

Tumpang tindih antara kumpulan yang dipublikasikan kedua vendor itu tipis, dan satu-satunya perbandingan langsung yang tersedia ada pada tolok ukur yang sama: Z.ai melaporkan 66,9 pada DeepSWE v1.1, OpenAI melaporkan 68,8 untuk GPT-6 Sol — model yang digantikan oleh 6.1 — dan peningkatan 6,4 poin untuk 6.1 Sol dibandingkan pendahulunya sendiri. Terpaut dua poin pada perbandingan yang dilaporkan vendor, dan sekitar enam poin pada delta OpenAI sendiri. Itu mendekati perbandingan terkontrol, dan sejalan dengan apa yang dikatakan dewan independen: hampir setara dalam kemampuan, kesenjangan lebar dalam biaya menuntaskan pekerjaan.

Satu API, atau dua kontrak

Kedua model ini ada di OrcaRouter, dan itulah bagian yang tidak biasa dari pasangan ini. GPT-6.1 Sol masuk ke katalog dengan harga daftar OpenAI sendiri pada hari peluncurannya — $2,00 dan $10,00 per juta token, input cache $0,10, dengan tarif bertingkat pada 272.000 token menjadi $4,00 dan $15,00 yang diteruskan persis seperti yang dicantumkan vendor — dan GLM-5.3 berada di sampingnya dengan harga $1,26 dan $3,96 serta biaya pembacaan cache $0,234. Tidak ada yang ditambahkan di atas keduanya: platform meneruskan harga daftar penyedia tanpa perubahan, itulah sebabnya pemotongan harga vendor muncul di sisi kami pada hari yang sama, bukan setelah reseller menegosiasikan ulang.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the listing dated 2026-08-18, the model described as Z.ai (Zhipu AI)'s latest flagship for complex software engineering and long-horizon agentic tasks, a 1M-token context with 128K maximum output, text in and text out, and the pass-through list price of $1.26 input and $3.96 output per million tokens, with the page's own pricing tabs and a 4.00 s median time to first token visible.

Hal itu lebih penting untuk pasangan spesifik ini dibandingkan untuk sebagian besar. Keputusan di antara keduanya bukanlah "mana yang lebih baik" — melainkan ambang batas pada panjang keluaran Anda sendiri, dan ambang itu akan bergeser saat pertama kali Z.ai mempertajam kartu tarifnya atau OpenAI mengubah batas tier dari tier 6.1. Menahan keduanya di balik satu kunci, dengan failover otomatis di antara keduanya dan aturan perutean yang Anda ubah di konfigurasi, bukan di deployment, itulah yang memungkinkan Anda menguji ambang batas itu pada lalu lintas nyata alih-alih memperdebatkannya. Jika cache line Sol menang untuk beban kerja Anda, rutekan ke sana; jika panjang jawaban Anda tetap pendek dan kartu tarif flat GLM-5.3 tanpa jurang konteks menang di segmen itu, rutekan ke sana saja — kunci yang sama, tanpa kontrak kedua, tanpa tagihan kedua.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Yang mana, jika kamu harus memilih hari ini

• Output panjang yang dihasilkan, loop agentik, pekerjaan yang padat output — GPT-6.1 Sol, dan selisihnya mendekati tiga kali lipat setelah jumlah token diterapkan. Di sinilah kartu tarif menipu sementara pengukurannya tidak.
• Prefiks stabil, jawaban singkat — GLM-5.3. Tarif input yang di-cache dan tarif inputnya benar-benar lebih baik dan verbositasnya tidak pernah sempat merugikan.
• Permintaan apa pun di atas 272.000 token input — GLM-5.3, karena GPT-6.1 Sol menetapkan harga ulang untuk seluruh permintaan pada batas tersebut dan kartu GLM-5.3 tidak memiliki langkah yang setara.
• Apa pun dengan gambar atau dokumen sebagai input visual — GPT-6.1 Sol. GLM-5.3 hanya teks dan ini bukan perbandingan yang dekat.
• Inferensi di dalam batas Anda sendiri, atau lindung nilai terhadap perubahan ketentuan vendor — GLM-5.3, dan sekarang unduhannya sudah ada, bukan sekadar dijanjikan. Anggarkan untuk perangkat kerasnya: checkpoint-nya adalah artefak FP8 yang besar dan self-hosting adalah keputusan modal, bukan keputusan API.
• Panggilan yang sensitif terhadap latensi — keduanya bukan pilihan tanpa kehati-hatian. GLM-5.3 tidak punya cara untuk mematikan penalaran; GPT-6.1 Sol memiliki batas bawah di tingkat rendah, dan waktu ke token pertamanya sendiri di papan independen terukur 332 detik dibandingkan median papan sebesar 3,7.

Dibandingkan dalam artikel ini3

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari