
GPT-6 Astra vs Tencent HY4 Preview: Satu Model Memiliki Jejak Audit dan Model Lainnya Memiliki Tabel Benchmark
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Tencent HY4 Preview dan GPT-6 Astra adalah dua rute termurah menuju pengodean agentik yang mendekati frontier yang tersedia saat ini jika Anda membaca angka dari vendor masing-masing, dan keduanya adalah dua model yang paling tidak bisa dibandingkan di tingkat itu jika Anda membaca angka dari pihak lain. Tencent HY4 Preview dirilis dan dibuka sebagai open source pada 28 Agustus 2026 di bawah Apache 2.0, dengan harga $0,834 per juta token masukan dan $2,501 per juta token keluaran, dengan arsitektur mixture-of-experts 770 miliar parameter, jendela konteks yang melampaui satu juta token, dan batas keluaran 64.000 token. GPT-6 Astra telah tersedia secara umum sejak 3 September 2026 dengan harga $10,00 dan $50,00, dengan jendela 1.050.000 token dan keluaran maksimum 128.000. Keunggulan Astra didukung oleh delapan evaluasi pihak ketiga yang dipublikasikan; keunggulan HY4 Preview didukung oleh uji terminal, pemanggilan alat, dan evaluasi buta milik Tencent sendiri, dan tidak oleh apa pun yang lain. Asimetri itu tidak berarti model yang lebih murah lebih lemah. Artinya, salah satu dari dua perbandingan ini dapat diperiksa dan yang lain harus dipercaya, dan keputusan praktisnya pun berbeda karenanya.
Apa yang sebenarnya diberikan oleh rilis Apache 2.0 kepada Anda
Lisensi adalah bagian dari adu ini yang tidak dapat diungkapkan oleh tabel harga. Tencent HY4 Preview bukan teaser yang dihosting dengan branding open-weight — bobotnya dapat diunduh dari Hugging Face, GitHub, ModelScope, dan GitCode, yang berarti model ini tetap bertahan apa pun keputusan Tencent mengenai penetapan harganya sendiri, endpoint-nya sendiri, atau minatnya yang terus berlanjut untuk melayaninya.
• Arsitektur — 770B parameter total, 49B aktif per token, 78 lapisan, 256 pakar yang dirutekan plus satu pakar bersama, dan lapisan prediksi multi-token native untuk decoding spekulatifbr /> • Karakteristik penyajian — 54,6 token output per detik dan waktu median 6,26 detik ke token pertama, diukur di semua rute OrcaRouter selama jendela tujuh hari bergulirbr /> • Konteks dan batas atas — jendela 1.048.576 token terhadap output maksimum 64.000 tokenbr /> • Cakupan masukan — hanya teks; tidak ada gambar, tidak ada file, tidak ada audiobr /> • Kontrol penalaran — tiga tingkat, tinggi, rendah, dan tidak ada, dengan tinggi sebagai default, plus rekomendasi sampling yang terdokumentasi suhu 0,9 dan top_p 1,0br /> • Keandalan — tingkat kesalahan 2,8% selama jendela tujuh hari yang sama, dibandingkan 10,3% pada rute Astra
Pasangan angka terakhir itu adalah hal yang paling bisa ditindaklanjuti di halaman ini, dan itu adalah jenis angka yang tidak diterbitkan vendor mana pun tentang modelnya sendiri. Skor benchmark independen Astra lebih tinggi dan rutenya telah gagal pada kira-kira satu dari sepuluh permintaan selama sepekan terakhir, sementara model yang sama sekali tidak memiliki skor independen telah gagal pada satu dari tiga puluh lima. Tidak satu pun dari angka itu merupakan pernyataan tentang model itu sendiri — tingkat kesalahan mengukur rute, batas laju, dan upstream, bukan bobotnya — tetapi itulah angka yang benar-benar dialami oleh sistem produksi.

Di mana angka-angka Tencent dapat diperiksa dengan milik pihak lain
Ini, sejauh bukti yang dipublikasikan, adalah peluang yang benar-benar tidak biasa: Astra dan HY4 Preview keduanya memiliki angka Terminal-Bench 2.1, dan hanya salah satunya yang dilaporkan vendor.
• Terminal-Bench 2.1, menjalankan terminal sungguhan — GPT-6 Astra 88,4, dievaluasi secara independen; Tencent HY4 Preview 85,4, dilaporkan vendorbr /> • Pemanggilan alat — Astra 41,4 pada τ²-Banking, dievaluasi secara independen; HY4 Preview 74,1 pada Toolathlon-Verified, dilaporkan vendor, pada pengujian yang berbedabr /> • Rekayasa perangkat lunak — HY4 Preview 64,3 pada DeepSWE, naik dari 28,0 pada pendahulunya Hy3, dilaporkan vendorbr /> • Tugas agen — HY4 Preview 37,1 pass@1 pada APEX-Agents, dilaporkan vendorbr /> • Preferensi manusia — rata-rata 2,99 dari 4,00 pada 203 tugas rekayasa yang dinilai oleh 163 ahli, dijalankan vendor, dibandingkan dengan GLM-5.3 pada 2,92 dan Kimi K3 pada 2,94br /> • Indeks independen — GPT-6 Astra 54,7 Intelligence Index dan 96,1 GPQA Diamond, pihak ketiga; tidak ada indeks setara untuk HY4 Preview
Baris Terminal-Bench adalah yang patut direnungkan. Selisih 3 poin antara angka independen 88,4 dan 85,4 yang dilaporkan vendor berada jauh di dalam rentang yang dapat dihasilkan oleh harness yang berbeda, scaffold yang berbeda, atau suhu sampling yang berbeda, yang berarti pembacaan yang jujur bukanlah "Astra tiga poin lebih baik" melainkan "model open-weight termurah di tier ini mengklaim paritas, dan klaim itu setidaknya masuk akal." Framing Tencent sendiri berhati-hati dalam hal ini: mereka menggambarkan DeepSWE sebagai "secara bertahap mempersempit kesenjangan" alih-alih menutupnya, dan satu klaim paritasnya yang bersih — hasil imbang Terminal-Bench dengan model tertutup teratas dari vendor lain — justru merupakan klaim yang paling membutuhkan pengukuran kedua.
Ada juga perubahan yang perlu diketahui, karena perubahan ini menggeser sisi ekonominya, bukan skornya. Pada 7 September 2026, Tencent mendorong optimisasi ke build pratinjau langsung yang dikatakannya memangkas putaran penalaran dan konsumsi token per tugas pada pekerjaan kompleks. Karena model menagih per token, lebih sedikit token per tugas yang diselesaikan menurunkan biaya tugas itu meskipun tarif per tokennya tidak berubah. Besaran penghematan tersebut adalah hasil pengukuran Tencent sendiri dan tidak ada pihak di luar Tencent yang mereproduksinya — tetapi mekanismenya nyata dan itulah alasan pratinjau yang dirilis pada Agustus bisa jauh lebih murah untuk dioperasikan pada Oktober daripada yang disiratkan oleh tulisan peluncurannya.
Batas 64.000 token adalah spesifikasi yang menentukan deployment.
Di bagian tengah lembar spesifikasi terdapat kendala yang lebih dulu menggigit, dan itu bukan soal kualitas. Output maksimum HY4 Preview adalah 64.000 token, sementara Astra 128.000, pada model yang tujuan yang dinyatakannya adalah agen pengodean dan rantai penggunaan alat yang panjang. File yang dihasilkan, patch multi-file, laporan terstruktur yang panjang — inilah output yang menabrak batas atas, dan pada sebuah eksekusi agen kegagalannya bukan jawaban yang sedikit lebih buruk, melainkan jawaban yang terpotong yang harus dideteksi dan ditangani oleh pipeline di sekitarnya.
Kedua model menerima sekitar satu juta token masukan, jadi kasus pembacaan dokumen benar-benar seri. Perbedaannya sepenuhnya ada di sisi generasi, dan itu faktor dua, bukan kesalahan pembulatan. Tambahkan perbedaan pada sisi masukan — Astra menerima gambar dan berkas, HY4 Preview hanya teks — dan gambaran yang muncul adalah pembagian kerja yang rapi, bukan peringkat: model berbobot terbuka untuk loop agen teks-masuk, teks-keluar yang hasil akhirnya adalah panggilan alat atau diff, dan model tertutup untuk apa pun yang harus melihat sesuatu atau menulis sesuatu yang panjang.
Apa yang bisa didapat dari 20× laju keluaran, baris demi baris
• Harga input — Tencent HY4 Preview $0,834 per 1 juta token vs GPT-6 Astra $10,00, sekitar 12×br /> • Harga output — HY4 Preview $2,501 per 1 juta vs Astra $50,00, sekitar 20×br /> • Input yang di-cache — HY4 Preview $0,042 per 1 juta vs Astra $1,00, sekitar 24×br /> • Langkah permintaan panjang — Astra menetapkan ulang harga seluruh permintaan di atas 272.000 token input menjadi $20,00 dan $75,00; kartu HY4 Preview tidak memiliki langkah yang setarabr /> • Tarif input efektif pada prompt 400.000 token — HY4 Preview tidak berubah di $0,834 vs Astra $20,00, sekitar 24×br /> • Biaya per juta token untuk loop agen biasa, rasio input terhadap output 4:1 — HY4 Preview sekitar $1,17 vs Astra sekitar $18,00br /> • Biaya satu bulan sebesar 100 juta token pada rasio yang sama — HY4 Preview sekitar $117 vs Astra sekitar $1.800
Garis input yang di-cache adalah garis yang skalanya paling buruk bagi sisi yang mahal, karena loop agen mengirim ulang system prompt dan awalan percakapan yang sama pada setiap giliran. Pada $0,042 versus $1,00, token termurah dalam loop panjang 24 kali lebih murah pada model Tencent, yang justru merupakan beban kerja tempat perbedaan kecil per token paling cepat menumpuk. Biaya per tugas, metrik yang akan menyelesaikan ini dengan rapi, sama sekali tidak dipublikasikan oleh Tencent — jadi satu-satunya cara untuk mendapatkan angka yang penting adalah menjalankan kedua model melalui kumpulan tugas Anda sendiri dan membaca objek usage.

Apa yang ditambahkan router di sini, dengan tingkat kesalahan yang sudah diketahui
Kedua model ada di katalog OrcaRouter — tencent/hy4-preview dan openai/gpt-6-astra — di balik satu endpoint yang kompatibel dengan OpenAI, masing-masing dengan tarif daftar dari penyedia itu sendiri yang diteruskan dengan markup 0%. Detail terakhir itu lebih penting pada pasangan ini dibandingkan pada sebagian besar pasangan lain, karena tarif daftar model Tencent dipublikasikan dalam yuan: angka dolar di atas adalah tarif hasil konversi yang benar-benar Anda lihat, bukan selisih harga reseller, dan jika Tencent mengubah harganya, perubahan itu langsung berlaku di sini pada hari yang sama, bukan pada perpanjangan kontrak berikutnya.
DSL routing adalah titik di mana kedua model berhenti menjadi sekadar alternatif. Aturan yang wajar untuk pasangan ini adalah eskalasi pada output: kirim loop ke model murah, dan ketika respons kembali dalam keadaan terpotong karena batas 64.000 token atau gagal pada pemeriksaan skema Anda, ulangi langkah itu dengan openai/gpt-6-astra, yang memiliki ruang output dua kali lipat. Failover otomatis adalah separuh argumen lainnya, dan itu bukan hal teoretis ketika salah satu dari dua rute tersebut telah mengalami error pada satu dari sepuluh permintaan selama sepekan terakhir — proses agen yang panjang yang dipatok pada satu model akan mati bersama konteks yang terakumulasi, dan tak satu pun dari model ini cukup murah untuk dijalankan ulang dari awal secara tidak sengaja.

Apa yang akan mengubah perbandingan ini?
Tiga hal, diurutkan berdasarkan seberapa besar dampaknya. Evaluasi independen atas HY4 Preview — model ini telah tersedia untuk publik selama enam minggu, tidak memiliki indeks pihak ketiga, tidak ada angka Terminal-Bench yang direproduksi, dan tidak ada angka biaya per tugas, dan satu-satunya evaluasi buta yang dijalankan vendor adalah satu-satunya data preferensi manusia yang ada. Biaya per tugas yang diselesaikan yang dipublikasikan untuk kedua model, yang akan menggantikan setiap rasio dalam artikel ini dengan satu angka. Dan keputusan Tencent tentang inferensi pihak ketiga, karena bobot Apache 2.0 dapat dilayani oleh siapa saja, dan begitu host pesaing menyediakan HY4 Preview, harga di sisi murah dari perbandingan ini menjadi pasar, bukan daftar harga.
Sampai saat itu, ringkasan yang dapat digunakan lebih sempit daripada unggahan peluncuran kedua vendor dan lebih jujur daripada papan skor: GPT-6 Astra adalah model yang klaim kemampuannya telah diperiksa, dengan batas keluaran dua kali lipat dan rute yang gagal pada satu dari sepuluh permintaan. Tencent HY4 Preview adalah model yang klaim kemampuannya belum diperiksa, dengan arsitektur yang dipublikasikan, lisensi terbuka, harga sepertiga, dan tingkat kesalahan yang jauh lebih rendah dalam rentang waktu yang sama. Jika pekerjaan Anda bersifat teks masuk, teks keluar dan muat dalam 64.000 token yang dihasilkan, model yang lebih murah bukanlah kompromi — melainkan jawaban yang tepat, dan satu-satunya yang Anda korbankan adalah jejak audit.
Aturan alami untuk pasangan ini adalah eskalasi pada output: kirim loop ke model murah, dan ketika respons kembali terpotong terhadap plafon 64.000 token atau gagal pada pemeriksaan skema Anda, ulangi langkah itu dengan openai/gpt-6-astra, yang memiliki ruang output dua kali lipat.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
