
Tencent HY4 Preview vs tencent-hy3: Enam Kali Lipat Harganya, dan Apa yang Sebenarnya Didapat dari Lompatan Itu
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0259Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0258Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0166Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
Tencent HY4 Preview adalah model pertama dalam keluarga Hunyuan yang dengan sengaja membuat pendahulunya terlihat murah: Tencent memasang harga input enam kali lipat harga tencent-hy3 dan harga output empat setengah kali lipatnya, dan materi peluncurannya menyatakan bahwa harga premium itu layak. Dirilis dan bersumber terbuka pada 28 Agustus 2026, Tencent HY4 Preview melaporkan skor rekayasa perangkat lunak di DeepSWE yang lebih dari dua kali lipat skor Hy3 yang 28,0, skor penggerak terminal 85,4 di Terminal-Bench 2.1, serta jendela konteks yang melonjak dari 256K menjadi lebih dari satu juta token. tencent-hy3, yang resmi rilis pada 6 Juli, adalah kuda kerja matang dalam keluarga ini — 295B total parameter, 21B aktif, seperempat dari konteks, dan harga yang lebih mirip angka pembulatan. Ini bukan pertandingan yang dibiarkan ketat oleh lembar spesifikasi. Pertanyaannya adalah apakah selisihnya sepadan dengan uang untuk beban kerja yang benar-benar Anda jalankan, dan jawabannya berbeda tergantung jenis beban kerjanya.
Papan skor: tempat keduanya sebenarnya berbeda.
Setiap tolok ukur dalam materi Tencent dilaporkan oleh vendor — dijalankan pada pengaturan evaluasi milik Tencent sendiri saat peluncuran setiap model, belum direproduksi oleh laboratorium independen, dan untuk model unggulannya, model tersebut baru dipublikasikan kurang dari sehari. Anggap skor tersebut sebagai batas atas yang diyakini Tencent berhasil dicapai, dan lebih bobotkan polanya daripada angka tunggal mana pun. Polanya sangat jelas, dan terfokus pada pekerjaan rekayasa agen (agentic engineering) daripada pengetahuan umum:
• DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. Ini adalah lompatan tunggal terbesar dalam pasangan ini, lebih dari dua kali lipat pada tolok ukur rekayasa perangkat lunak skala repositori, dan ini adalah angka yang memisahkan model obrolan dari model yang Anda berikan seluruh basis kode.
• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4, yang menurut Tencent menyamai Claude Opus 5 dan melampaui DeepSeek V4 Pro. tencent-hy3: 71.7 sebagaimana dilaporkan saat peluncurannya pada bulan Juli. Mengoperasikan terminal sungguhan hingga selesai pada tugas multi-langkah adalah jenis pekerjaan berhorizon panjang yang justru menjadi kelemahan terbesar Hy3.
• Terverifikasi Toolathlon — Pratinjau Tencent HY4: 74,1, yang menurut Tencent melampaui Qwen 3.8 Max dan GPT-5.6 Sol. Angka Hy3 yang sebanding tidak dipublikasikan.
Uji buta internal — 163 ahli menilai 203 tugas rekayasa dengan skor 2,99/4,00 untuk Tencent HY4 Preview, sedikit mengungguli GLM-5.3 yang mendapat 2,92 dan Kimi K3 yang mendapat 2,94. Ini adalah penilaian peninjau Tencent terhadap tugas-tugas Tencent; anggap saja sebagai indikasi arah.

Benang merah yang konsisten: peningkatan ada pada pengendalian terminal, pemanggilan tool, dan tugas berskala repositori — posisi produktivitas yang terus didorong Tencent sejak Hy3, kini dengan daya komputasi yang mendukungnya.
Premium harga, baris demi baris
Di sinilah perbandingan berhenti menjadi soal gengsi. Harga daftar Tencent, per juta token:
• Input — Tencent HY4 Preview: 6 yuan (~US$0.85). tencent-hy3: 1 yuan (~US$0.14). Enam kali lipat.
• Keluaran — Pratinjau Tencent HY4: 18 yuan (~US$2.50). tencent-hy3: 4 yuan (~US$0.56). Empat setengah kali.
• Cache hit — Tencent HY4 Preview: 0.3 yuan. tencent-hy3: 0.25 yuan. Hampir sama, yang lebih penting daripada yang terlihat, karena loop agen terus-menerus mengirim ulang prompt sistem dan prefiks percakapan yang sama.
Jalankan beban kerja pengkodean agen yang realistis melalui angka gabungan — misalnya, {{1}}20 juta token input dan 4 juta token output dalam sebulan, anggaran agen pengembang tunggal yang sibuk{{/1}}. Tencent HY4 Preview: {{2}}120 yuan ditambah 72 yuan, sekitar 192 yuan (~US$27){{/2}}. tencent-hy3: {{3}}20 yuan ditambah 16 yuan, sekitar 36 yuan (~US$5){{/3}}. Model unggulannya membutuhkan biaya {{4}}lebih dari lima kali lipat untuk dijalankan dengan campuran token yang sama{{/4}} — {{5}}dan ia akan meminta lebih banyak token output per tugas, karena ia berpikir lebih lama{{/5}}.
Itu bukan alasan untuk menghindari Tencent HY4 Preview; lompatan DeepSWE justru jenis kemampuan yang menjadi alasan versi premium dibeli. Itu adalah alasan untuk menentukan harga beban kerja sebelum Anda mengarahkannya ke sana. Dan di situlah lapisan routing membuktikan nilainya: tencent-hy3 sudah ada di OrcaRouter dengan harga daftar penyedia — markup 0%, jadi angka yang Anda lihat adalah harga penyedia layanan itu sendiri, bukan versi yang dijual kembali dengan markup — dengan failover otomatis antarpenyedia, dan perubahan harga vendor berlaku di sisi kami pada hari yang sama.
Empat kali lipat konteks, dua kali lipat komputasi aktif.
• Arsitektur — Tencent HY4 Preview: total 770B, 49B MoE aktif. tencent-hy3: total 295B, 21B aktif. Model unggulan tersebut menggunakan sekitar 2.3 kali lebih banyak komputasi pada setiap token.
• Jendela konteks — {{1}}Tencent HY4 Preview: lebih dari 1 juta token. tencent-hy3: 256K.{{/1}} Seluruh repositori atau sekumpulan dokumen keuangan dapat muat di jendela model unggulan tersebut sebagai satu permintaan; {{2}}pada Hy3, pekerjaan yang sama memerlukan chunking, retrieval, atau loop agen.{{/2}}
• Kontrol penalaran — tencent-hy3 hadir dengan pengaturan reasoning_effort per permintaan (no_think, low, high) plus lapisan speculative-decoding yang membuatnya tetap cepat. Tencent HY4 Preview, menurut pengakuan Tencent sendiri, cenderung berpikir lama sebelum keluaran pertama dan terlalu memverifikasi diri pada tugas-tugas kompleks — menghabiskan token untuk memeriksa ulang pekerjaan yang sudah diselesaikannya.
Baris terakhir itu adalah perbedaan tersembunyi untuk penggunaan yang sensitif terhadap latensi. {{1}}Hy3 dapat diminta untuk menjawab langsung; Tencent HY4 Preview, setidaknya dalam bentuk awal ini, sering kali mau tidak mau berpikir.{{/1}} Untuk chat berlatensi rendah atau pipeline ekstraksi dengan throughput tinggi, {{2}}kemampuan ekstra dari model unggulan itu terbuang sia-sia dan pemikiran ekstranya menjadi beban.{{/2}} Untuk pekerjaan rekayasa batch offline, {{3}}beban itulah yang justru membeli jawaban yang lebih baik.{{/3}}
Pajak pratinjau: apa yang masih dimiliki Hy3
"Preview" ada di nama Tencent HY4 Preview dan memang berperilaku seperti itu. Tidak ada input visi atau multimodal — model ini hanya teks, sehingga apa pun yang terkait gambar atau video tetap berada pada model yang sudah Anda gunakan untuk itu. Uji coba gratis dua minggu di WorkBuddy dan CodeBuddy hanyalah sekadar cicipan, bukan sebuah paket. Tencent telah menyatakan dengan jelas bahwa ini adalah iterasi awal Hy4, dengan peningkatan pra-pelatihan dan pasca-pelatihan yang masih akan datang dengan irama yang telah menghasilkan versi besar kira-kira setiap dua bulan sejak Februari. Tolok ukur independen untuk model unggulan ini: belum ada, di mana pun.
tencent-hy3 adalah kebalikan dari semua itu. Ini adalah rilis resmi dan stabil yang telah digunakan dalam produksi sejak Juli. Tingkat gratisnya berjalan hingga 30 September. Tingkat penalarannya memberi Anda kenop, bukan temperamen, dan lapisan decoding spekulatif serta 21B parameter aktifnya menjadikannya bagian keluarga yang murah, cepat, dan dapat diprediksi — model yang Anda arahkan ke jalur default dan lupakan.

Siapa yang harus memilih yang mana
Pilih Tencent HY4 Preview saat tugasnya adalah inti persoalan — tugas rekayasa perangkat lunak yang berat, konteks skala repositori, alur kerja agentik di mana jawaban yang lebih baik sepadan dengan biaya token lima kali lipat dan Anda mampu menanggung latensi model yang berpikir sebelum berbicara. Pilih tencent-hy3 saat tugasnya adalah keterbatasan — throughput tinggi, latensi rendah, anggaran ketat, atau tugas apa pun di mana Anda ingin model menjawab, bukan berpikir panjang.
Pola praktis untuk pemasangan seperti ini adalah eskalasi: rutekan model yang murah dan mudah dikendalikan di jalur default, lalu eskalasi ke model unggulan hanya ketika tugas menuntutnya. Itulah tujuan DSL perutean OrcaRouter — menggabungkan beberapa model ke dalam satu panggilan sehingga kebijakannya adalah konfigurasi, bukan kode — dan failover otomatis berarti jalur Hy3 tetap melayani bahkan ketika salah satu penyedia mengalami penurunan. OrcaRouter belum merutekan Tencent HY4 Preview; Tencent belum membuka model tersebut untuk inferensi pihak ketiga, jadi untuk saat ini model itu berjalan di endpoint Tencent Cloud TokenHub milik vendor dan pada deployment mandiri dari bobot terbuka. Sementara itu, tencent-hy3 sudah ada dalam katalog hari ini dengan harga sesuai daftar penyedia — dan begitu model unggulan dibuka, ia akan masuk ke lapisan perutean yang sama dengan cara yang sama, mengubah peralihan dari satu model ke model lainnya menjadi perubahan satu baris, bukan penulisan ulang.

Kesimpulannya membosankan dengan cara yang terbaik: produk unggulannya sepadan dengan harga premium untuk pekerjaan yang memang dibanderol, dan kuda beban tetap menjadi pilihan yang tepat untuk semua hal yang sekadar perlu diselesaikan. Kesenjangan harga enam kali lipat itu nyata, kesenjangan DeepSWE 28-ke-64 itu nyata, dan keduanya tidak saling meniadakan — Anda hanya perlu tahu yang mana yang Anda beli.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
