
Tencent HY4 Preview vs Qwen3.8-Max: Adu Kekuatan Open-Weight Agustus
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Tencent HY4 Preview vs Qwen3.8-Max adalah bentrokan yang selama ini mengarah ke bulan ini. Qwen3.8-Max milik Alibaba mencapai ketersediaan umum pada 3 Agustus dan menjadi Qwen kelas Max pertama dengan bobot terbuka pada 12 Agustus; Tencent HY4 Preview hadir pagi ini, 25 hari kemudian, dengan kartu peluncuran yang menyebut Qwen3.8-Max secara langsung — Tencent melaporkan HY4 Preview meraih 74,1 pada Toolathlon-Verified, unggul dari Qwen3.8-Max pada tolok ukur tersebut. Keduanya adalah andalan China dengan bobot terbuka, keduanya dipatok dengan harga yang menarik, dan hanya satu di antaranya yang memiliki skor independen.
Kedua model ini dipisahkan oleh lebih dari sekadar skala — Qwen3.8-Max memiliki 2,4 triliun parameter dibandingkan 770 miliar milik HY4 Preview — tetapi pada benchmark agentik yang penting bagi pembeli, keduanya menyasar target yang sama: pekerjaan berdurasi panjang di mana model membaca, memanggil alat, dan melakukan iterasi tanpa keterlibatan manusia dalam prosesnya. Justru di wilayah itulah generasi open-weight bulan Agustus berusaha membuktikan bahwa mereka dapat menggantikan model frontier tertutup, dan langkah pertama Tencent adalah membidik rilis terbuka terbesar bulan itu.
Papan skor

• Skala — HY4 Preview 770B total / 49B aktif vs Qwen3.8-Max 2.4T total / ~95B aktif
• Konteks — HY4 Preview >1M token vs Qwen3.8-Max 1M token di API (262K native dalam open weights, dapat diperluas hingga ~1.01M)
• Harga per 1M — HY4 Preview ¥6 masuk / ¥18 keluar (≈$0.85 / $2.50) vs Qwen3.8-Max $2.00 masuk / $6.00 keluar, pembacaan cache $0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (dilaporkan vendor) vs Qwen3.8-Max 86.6
• Modalitas — keduanya hanya teks dalam bentuk open-weight; API Qwen3.8-Max menambahkan input gambar dan video, sementara pratinjau HY4 Preview tidak.
• Skor independen — HY4 Preview none vs Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58
Kedua kartu tersebut menceritakan kisah yang sama dari sisi yang berlawanan. Pada Terminal-Bench 2.1, skor 86.6 milik Qwen3.8-Max dan 85.4 milik HY4 Preview hanya terpaut satu setengah poin — satu poin menguntungkan Qwen, dan angka HY4 belum diaudit. Dari segi harga, HY4 Preview lebih murah untuk input maupun output per token. Dari segi verifikasi, Qwen3.8-Max memiliki Intelligence Index independen sebesar 58 dan Agentic Index sebesar 58; HY4 Preview tidak memiliki apa-apa selain siaran persnya sendiri. Selisih ini merupakan pola klasik dari seorang penantang yang datang dengan harga lebih baik dan klaim yang belum terbukti, melawan petahana yang telah terverifikasi.
Membaca klaim Toolathlon
Toolathlon-Verified mengukur keandalan penggunaan alat agenik — seberapa konsisten sebuah model menggerakkan alat melalui tugas penuh yang melibatkan kesalahan, pemulihan, dan panggilan multi-langkah. Skor 74.1 Tencent diarahkan langsung pada bagian terkuat dari profil Qwen3.8-Max, karena Indeks Agenik Qwen sebesar 58 dan OSWorld-Verified 86.1 adalah angka-angka yang membuat klaim agenik Alibaba kredibel. Qwen3.8-Max juga mencatatkan 82.8 pada IFBench (kepatuhan instruksi) dan 93.0 pada PaperBench (kerja agenik kelas riset), keduanya mengungguli model-model seperti GPT-5.6 Sol di tabel milik vendor itu sendiri. Jadi Tencent memilih satu tolok ukur yang di dalamnya ia mengklaim kemenangan langsung atas model terbuka terbesar bulan ini — dan klaim tersebut saat ini sama terverifikasinya dengan baris vendor tunggal lainnya: tidak terverifikasi sama sekali.
Terverifikasi vs dilaporkan vendor
Ini adalah sumbu di mana pertandingannya paling tidak adil, dan asimetri ini perlu dijelaskan secara eksplisit. Indeks Kecerdasan Qwen3.8-Max sebesar 58 berasal dari Artificial Analysis, Indeks Agennya sebesar 58 juga berasal dari Artificial Analysis, dan pengukur independen yang sama yang memberinya skor tersebut juga mengukur kelemahannya: tingkat halusinasi 40% pada AA-Omniscience, naik dari 23% pada generasi sebelumnya, dan 64 putaran agen per tugas yang sangat besar — model ini bekerja keras, dan Anda membayar untuk setiap putaran. Tencent HY4 Preview tidak memiliki semua instrumentasi itu. Kekuatannya hanyalah klaim, dan mode kegagalannya — Tencent sendiri menandai pemikiran panjang dan verifikasi diri berlebihan — adalah pengakuan, bukan pengukuran.
Bagi tim yang memilih di antara keduanya, kesenjangan verifikasi bukanlah hal yang abstrak. Perilaku Qwen3.8-Max yang mencapai 64 putaran per tugas adalah pendorong biaya nyata dan terukur: pada harga $2/$6, ia masih menjadi agen termahal per tugas yang diselesaikan dalam beberapa perbandingan pihak ketiga, dan sejumlah tim melaporkan bahwa jumlah putaran tersebut mengikis keunggulan harganya. Perilaku setara HY4 Preview tidak diketahui — bisa jadi lebih murah per tugas daripada yang disarankan harga per tokennya yang sudah rendah, atau kebiasaan verifikasi mandirinya bisa menghabiskan selisihnya. Belum ada yang bisa memberi tahu Anda yang mana, karena belum ada orang di luar Tencent yang menjalankannya.
Harga dan kepraktisan open-weights
Per token, HY4 Preview lebih murah di kedua sisi pembukuan: ¥6/¥18 dibandingkan dengan $2.00/$6.00 milik Qwen3.8-Max, dan cache hit sebesar ¥0.3 dibandingkan $0.25. Itu menjadikan HY4 Preview flagship open-weight termurah untuk input maupun output, titik. Tetapi "open weights" datang dengan dua set cetakan kecil yang berbeda. Rilis open-weights Qwen3.8-Max — Qwen3.8-2.4T-A95B — hanya berupa teks dengan mode berpikir yang selalu aktif, konteks native 262K, bukan 1M seperti di API, serta lisensi khusus dengan ketentuan berjenjang skala: diwajibkan menampilkan nama model jika pengguna bulanan di atas 100 juta, dan lisensi terpisah untuk bisnis Model-as-a-Service berskala besar. Bobot Tencent HY4 Preview sudah ada di HuggingFace, ModelScope, dan GitHub sejak pagi ini, tetapi ketentuan lisensi pastinya dan apakah bobot tersebut sesuai dengan API yang dilayankan belum dinyatakan dengan tingkat kejelasan yang sama. Kedua model dapat diunduh; tidak ada yang bisa langsung dipakai tanpa penyesuaian.
Intinya
Qwen3.8-Max adalah pilihan yang lebih aman dalam segala hal yang membuat verifikasi memberikan keamanan: dinilai secara independen untuk kecerdasan dan pekerjaan agen, mode kegagalan yang diketahui, lisensi yang pasti, dan tiga minggu umpan balik produksi. Ini juga pilihan yang lebih mahal per token, dan perilaku turn-heavy yang terukur merupakan risiko biaya yang diketahui. Tencent HY4 Preview adalah taruhan nilai: lebih murah untuk input maupun output, klaim Terminal-Bench yang sebanding, dan klaim Toolathlon-Verified langsung terhadap Qwen — semuanya belum diverifikasi pada hari pertama. Jika Anda menempatkan model open-weight ke produksi minggu ini, Qwen3.8-Max adalah pilihan yang dapat dipertahankan dan tersedia di OrcaRouter dengan harga daftar Alibaba — $2.00/$6.00, diteruskan tanpa markup. HY4 Preview adalah proyek evaluasi: jalankan melalui API Tencent sendiri untuk tugas bergaya Toolathlon Anda, pertahankan jalur produksi pada model yang terverifikasi, dan ketika skor independen keluar — atau ketika HY4 Preview mencapai router dan tarif ¥6/¥18 menjadi pass-through pada hari yang sama — pergantiannya adalah aturan routing, bukan penulisan ulang.


Apa yang harus ditonton
• Putaran independen pertama dari HY4 Preview pada harness agenik. Toolathlon-Verified 74.1 adalah angka yang ingin dimenangkan Tencent; Agentic Index pihak ketiga akan menjadi konfirmasinya.
• Jumlah giliran terukur HY4 Preview. 64 giliran per tugas Qwen3.8-Max adalah kisah peringatan; apakah HY4 Preview lebih murah per tugas yang diselesaikan adalah keseluruhan argumen ekonomi.
• Syarat lisensi pada bobot. Syarat-syarat ini akan menentukan apakah "terbuka" berarti "dapat digunakan dalam skala Anda" untuk HY4 Preview, sebagaimana ketentuan Lisensi Qwen3.8-Max berlaku untuk model Alibaba.
Apakah salah satu vendor menurunkan harga lagi. Pada bulan di mana dua flagship open-weight dipasarkan dengan penetapan harga yang agresif, penerusan pada router membuat penurunan harga lebih lanjut terlihat pada hari yang sama.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
