Kartu judul utama untuk perbandingan 'Tencent HY4 Preview vs GPT-5.6 Sol'. Sorotan tengah bertuliskan 'Toolathlon-Verified 74.1 - klaim bobot terbuka melawan garis depan', dengan anotasi 'Tencent melaporkan modelnya lebih unggul dari GPT-5.6 Sol dalam pemanggilan alat agen'. Kartu kiri 'Tencent HY4 Preview' mencantumkan 'Bobot terbuka, 770B / 49B aktif', '¥6 / ¥18 per 1M', 'Tidak ada skor independen'. Kartu kanan 'GPT-5.6 Sol' mencantumkan 'API tertutup, unggulan OpenAI', '$4 / $20 dasar per 1M', 'Terminal-Bench 2.1: 88.8'. Catatan kaki berbunyi 'Angka HY4 Preview dilaporkan vendor; angka Sol direproduksi secara luas.' Logo OrcaRouter ditempatkan di pojok kanan bawah.
Guides & Insights

Tencent HY4 Preview vs GPT-5.6 Sol: Klaim Panggilan Alat yang Menempatkan Open Weights Melawan Frontier

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tencent HY4 Preview adalah model open-weight pertama dalam beberapa bulan yang kartu peluncurannya secara eksplisit mengklaim kemenangan atas GPT-5.6 Sol. Angka yang dimaksud adalah Toolathlon-Verified, sebuah tolok ukur untuk pemanggilan alat agen, di mana Tencent melaporkan HY4 Preview pada 74.1 — di depan Qwen3.8-Max dan, menurut perbandingan Tencent sendiri, di depan GPT-5.6 Sol. Di semua dimensi lainnya, kedua model ini sebenarnya tidak sepadan: GPT-5.6 Sol adalah model frontier unggulan tertutup milik Ope​nAI yang diukur secara independen, sementara Tencent HY4 Preview adalah pratinjau open-weight berkekuatan 770 miliar parameter yang dirilis pagi ini dengan kartu skor hasil laporan vendor dan tanpa verifikasi pihak ketiga.

Jadi pertanyaan yang menarik bukanlah "model mana yang lebih pintar" — melainkan apakah penantang open-weight dengan harga input sekitar seperenam dari harga Sol dapat secara kredibel mengklaim sebagian dari batas terdepan, dan apa yang harus dilakukan tim terhadap klaim yang saat ini tidak dapat diverifikasi.

Klaim yang membuat ini menjadi pertandingan yang sesungguhnya.

Toolathlon-Verified mengukur seberapa andal sebuah model mengendalikan alat dalam satu tugas agentik penuh — membaca hasil, memutuskan panggilan berikutnya, memulihkan diri dari kesalahan — alih-alih seberapa baik ia menulis satu fungsi tunggal. Ini penting karena porsi terbesar dari belanja API riil pada model-model frontier dialokasikan untuk loop agen, bukan untuk penyelesaian satu kali. Skor 74.1 milik Tencent pada tolok ukur tersebut adalah klaim spesifik yang menempatkan HY4 Preview dalam percakapan GPT-5.6 Sol, dan angka itu layak direnungkan sejenak: ini adalah jenis angka yang, jika bertahan di bawah replikasi independen, membuat percakapan biaya antara open-weight vs frontier tertutup menjadi nyata. Jika tidak bertahan, angka itu menjadi sekadar kartu skor vendor lain yang lenyap saat diuji dengan harness pihak ketiga.

Dua cara untuk membeli kecerdasan

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• Parameter — HY4 Preview 770B total / 49B aktif, bobot terbuka vs GPT-5.6 Sol, jumlah parameter tidak diungkapkan, API tertutup

• Konteks — HY4 Preview >1M token vs GPT-5.6 Sol 1.05M token, output maksimum 128K

• Harga per 1M — HY4 Preview ¥6 masuk / ¥18 keluar (≈$0.85 / $2.50) vs GPT-5.6 Sol $4.00 / $20.00 pada tingkat dasar, naik menjadi $8.00 / $30.00 untuk permintaan konteks besar, pembacaan cache $0.40

• Modalitas input — HY4 Preview hanya teks dalam pratinjau ini vs GPT-5.6 Sol input teks dan gambar

• Mode penalaran — HY4 Preview tidak memiliki padanan yang dipublikasikan vs mode Ultra GPT-5.6 Sol (hingga 16 subagen paralel) dan upaya penalaran Max

• Verifikasi independen — HY4 Preview belum ada vs GPT-5.6 Sol hadir di setiap papan peringkat utama, dengan peringkat konteks 1.05M di tingkat teratas tes gabungan konteks panjang

Kolom harga adalah tempat seluruh pertandingan berlangsung. Pada tingkat dasar, GPT-5.6 Sol berharga $4,00 untuk satu juta token masukan dan $20,00 untuk satu juta token keluaran. Tencent HY4 Preview berharga sekitar $0,85 dan $2,50 dengan kurs saat ini. Untuk beban kerja yang memindahkan banyak token keluaran — seperti yang dilakukan pengkodean agen — model dengan bobot terbuka dibanderol sekitar seperdelapan dari model tertutup, dan kesenjangan itu tetap bertahan bahkan dengan catatan bahwa angka Sol didukung oleh lebih banyak verifikasi.

Di mana GPT-5.6 Sol masih unggul.

Verifikasi adalah keunggulan pertama. GPT-5.6 Sol telah tersedia secara umum sejak 9 Juli dan diukur secara independen sejak: 88.8 pada Terminal-Bench 2.1 dengan penalaran dasar, 91.9 dalam mode Ultra, 53.6 pada Agents' Last Exam (rekor saat perilisan), 94.6 pada GPQA Diamond, dan 64.6 SWE-bench Pro. Ope​nAI juga melaporkan peningkatan efisiensi token sebesar 54% pada tugas pemrograman agen dibandingkan unggulan sebelumnya. Itu adalah angka-angka yang dapat Anda temukan direproduksi di luar dokumentasi Ope​nAI sendiri, yang merupakan karakteristik yang justru tidak dimiliki Tencent HY4 Preview saat ini.

Kemampuan adalah keunggulan kedua, dan sifatnya struktural, bukan marjinal. GPT-5.6 Sol menerima input gambar; HY4 Preview hanya mendukung teks dalam pratinjau ini, dengan Tencent mengakui bahwa kemampuan visi harus menunggu rilis penuh. GPT-5.6 Sol menyertakan mode Ultra — konfigurasi multi-agen yang mengoordinasikan sub-agen paralel dengan biaya token tiga hingga empat kali lipat, berguna untuk tugas-tugas rekayasa berjangka panjang yang justru menjadi ajang persaingan kedua model tersebut. Jalur penggunaan komputer dan pemanggilan alat terprogram Sol terdokumentasi, dijalankan dalam skala produksi, dan diuji beban. Klaim Toolathlon-Verified Tencent, jika dapat direplikasi, mempersempit kesenjangan penggunaan alat; namun tidak menutup kesenjangan multimodal atau multi-agen, yang tidak dicoba oleh HY4 Preview.

Di mana HY4 Preview benar-benar menarik.

Kesampingkan teater tolok ukur, dan tiga hal nyata tetap ada. Pertama, harga: pada ¥6/¥18 — kira-kira $0,85/$2,50 — Tencent memangkas harga setiap model mutakhir Barat untuk token keluaran dengan faktor empat hingga delapan, dan memangkas harga rekan-rekan China-nya yang berbobot terbuka untuk token masukan. Kedua, bobot terbuka: MoE dengan 49B aktif dapat digunakan pada satu node dengan cara yang tidak akan pernah bisa dilakukan oleh arsitektur Sol yang tidak diungkapkan, dan bobotnya sudah tersedia di HuggingFace, ModelScope, dan GitHub. Ketiga, konteks dan lintasan rekayasa: DeepSWE 64.3 dan jendela konteks lebih dari 1M ditujukan untuk beban kerja agen berhorizon panjang yang sama yang menjadi target mode Ultra Sol, dengan biaya yang jauh lebih rendah.

Catatan jujurnya adalah bahwa semua ini belum pernah diuji terhadap tolok ukur independen. Kisah optimasi mandiri yang diceritakan Tencent — peningkatan throughput end-to-end sebesar 31.8% dari model yang berulang kali menyempurnakan tumpukan inferensinya sendiri — diukur secara internal. Kemenangan dalam uji buta atas GLM 5.3 dan Kimi K3 juga dijalankan secara internal. Setiap hal menarik tentang HY4 Preview, saat ini, masih sebatas klaim.

Keputusan

Jika Anda membangun sistem produksi saat ini, GPT-5.6 Sol adalah pilihan yang dapat dipertanggungjawabkan, dan dapat diakses melalui OrcaRouter dengan harga daftar berjenjang milik OpenAI sendiri — $4.00/$20.00 di tingkat dasar, $8.00/$30.00 di atasnya, diteruskan tanpa markup, sehingga setiap perubahan harga vendor langsung berlaku di pihak kami pada hari yang sama. Jika alur kerja Anda berbasis agen dan banyak menggunakan tool, struktur berjenjang berarti Anda harus memeriksa ukuran input aktual Anda terhadap ambang batas token $272K, bukan mengasumsikan tarif flat.

Jika Anda bersedia menjalankan evaluasi bayangan, HY4 Preview cukup murah untuk layak diuji sungguhan: arahkan beban kerja pemanggilan tool Anda melalui Sol hari ini, jalankan prompt yang sama terhadap HY4 Preview melalui API Tencent sendiri, dan bandingkan pada tugas bergaya Toolathlon Anda sendiri. Dan jika skor independennya sesuai dengan yang dikatakan Tencent, jalur perpindahannya singkat — model bobot terbuka masuk ke router dan aturan failover Anda menukar endpoint, dengan tarif ¥6/¥18 vendor diteruskan tanpa perubahan. Itulah struktur jujur dari pertandingan ini: model frontier terverifikasi yang bisa Anda bangun hari ini, berhadapan dengan penantang terbuka yang belum terverifikasi, cukup murah untuk diuji, dan diposisikan untuk mengarahkan pembicaraan harga ke seluruh kelas model bobot terbuka.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

Apa yang harus ditonton

• Replikasi independen pertama dari Toolathlon-Verified. Jika harness pihak ketiga mengonfirmasi HY4 Preview di angka 70-an, argumen "open weights tidak bisa melakukan penggunaan alat agentik" akan runtuh.

• Apakah Tencent meluncurkan visi sebelum rilis penuh Hy4. Sifat teks-saja membatasi HY4 Preview pada subset ketat dari beban kerja yang ditangani GPT-5.6 Sol.

• Biaya token aktual dari kecenderungan berpikir panjang HY4 Preview. Pada ¥18 per juta output, verifikasi diri yang bertele-tele menggerus keunggulan harga lebih cepat daripada pada model $20.

• Apakah harga berjenjang Sol akan mengalami pemotongan lagi sebelum peluncuran penuh Hy4. Pass-through pada router berarti penurunan terlihat pada hari yang sama.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube