Kartu judul utama untuk perbandingan 'Tencent HY4 Preview vs Qwen3.8-Max'. Sebuah banner tengah berbunyi 'Pertarungan open-weight bulan Agustus', dengan keterangan 'Dua flagship open-weight, selisih 25 hari'. Kartu kiri 'Tencent HY4 Preview' mencantumkan '770B / 49B aktif, diluncurkan 28 Agustus', '¥6 / ¥18 per 1M', 'Tidak ada skor independen'. Kartu kanan 'Qwen3.8-Max' mencantumkan '2.4T / ~95B aktif, diluncurkan 3 Agustus', '$2.00 / $6.00 per 1M', 'Indeks AA 58'. Catatan kaki berbunyi 'Angka HY4 Preview dilaporkan vendor; skor Qwen3.8-Max menurut Artificial Analysis.' Logo OrcaRouter dikompositkan di pojok kanan bawah.
Guides & Insights

Tencent HY4 Preview vs Qwen3.8-Max: Adu Kekuatan Open-Weight Agustus

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tencent HY4 Preview vs Qwen3.8-Max adalah bentrokan yang selama ini mengarah ke bulan ini. Qwen3.8-Max milik Alibaba mencapai ketersediaan umum pada 3 Agustus dan menjadi Qwen kelas Max pertama dengan bobot terbuka pada 12 Agustus; Tencent HY4 Preview hadir pagi ini, 25 hari kemudian, dengan kartu peluncuran yang menyebut Qwen3.8-Max secara langsung — Tencent melaporkan HY4 Preview meraih 74,1 pada Toolathlon-Verified, unggul dari Qwen3.8-Max pada tolok ukur tersebut. Keduanya adalah andalan China dengan bobot terbuka, keduanya dipatok dengan harga yang menarik, dan hanya satu di antaranya yang memiliki skor independen.

Kedua model ini dipisahkan oleh lebih dari sekadar skala — Qwen3.8-Max memiliki 2,4 triliun parameter dibandingkan 770 miliar milik HY4 Preview — tetapi pada benchmark agentik yang penting bagi pembeli, keduanya menyasar target yang sama: pekerjaan berdurasi panjang di mana model membaca, memanggil alat, dan melakukan iterasi tanpa keterlibatan manusia dalam prosesnya. Justru di wilayah itulah generasi open-weight bulan Agustus berusaha membuktikan bahwa mereka dapat menggantikan model frontier tertutup, dan langkah pertama Tencent adalah membidik rilis terbuka terbesar bulan itu.

Papan skor

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Skala — HY4 Preview 770B total / 49B aktif vs Qwen3.8-Max 2.4T total / ~95B aktif

• Konteks — HY4 Preview >1M token vs Qwen3.8-Max 1M token di API (262K native dalam open weights, dapat diperluas hingga ~1.01M)

• Harga per 1M — HY4 Preview ¥6 masuk / ¥18 keluar (≈$0.85 / $2.50) vs Qwen3.8-Max $2.00 masuk / $6.00 keluar, pembacaan cache $0.25

• Terminal-Bench 2.1 — HY4 Preview 85.4 (dilaporkan vendor) vs Qwen3.8-Max 86.6

• Modalitas — keduanya hanya teks dalam bentuk open-weight; API Qwen3.8-Max menambahkan input gambar dan video, sementara pratinjau HY4 Preview tidak.

• Skor independen — HY4 Preview none vs Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58

Kedua kartu tersebut menceritakan kisah yang sama dari sisi yang berlawanan. Pada Terminal-Bench 2.1, skor 86.6 milik Qwen3.8-Max dan 85.4 milik HY4 Preview hanya terpaut satu setengah poin — satu poin menguntungkan Qwen, dan angka HY4 belum diaudit. Dari segi harga, HY4 Preview lebih murah untuk input maupun output per token. Dari segi verifikasi, Qwen3.8-Max memiliki Intelligence Index independen sebesar 58 dan Agentic Index sebesar 58; HY4 Preview tidak memiliki apa-apa selain siaran persnya sendiri. Selisih ini merupakan pola klasik dari seorang penantang yang datang dengan harga lebih baik dan klaim yang belum terbukti, melawan petahana yang telah terverifikasi.

Membaca klaim Toolathlon

Toolathlon-Verified mengukur keandalan penggunaan alat agenik — seberapa konsisten sebuah model menggerakkan alat melalui tugas penuh yang melibatkan kesalahan, pemulihan, dan panggilan multi-langkah. Skor 74.1 Tencent diarahkan langsung pada bagian terkuat dari profil Qwen3.8-Max, karena Indeks Agenik Qwen sebesar 58 dan OSWorld-Verified 86.1 adalah angka-angka yang membuat klaim agenik Alibaba kredibel. Qwen3.8-Max juga mencatatkan 82.8 pada IFBench (kepatuhan instruksi) dan 93.0 pada PaperBench (kerja agenik kelas riset), keduanya mengungguli model-model seperti GPT-5.6 Sol di tabel milik vendor itu sendiri. Jadi Tencent memilih satu tolok ukur yang di dalamnya ia mengklaim kemenangan langsung atas model terbuka terbesar bulan ini — dan klaim tersebut saat ini sama terverifikasinya dengan baris vendor tunggal lainnya: tidak terverifikasi sama sekali.

Terverifikasi vs dilaporkan vendor

Ini adalah sumbu di mana pertandingannya paling tidak adil, dan asimetri ini perlu dijelaskan secara eksplisit. Indeks Kecerdasan Qwen3.8-Max sebesar 58 berasal dari Artificial Analysis, Indeks Agennya sebesar 58 juga berasal dari Artificial Analysis, dan pengukur independen yang sama yang memberinya skor tersebut juga mengukur kelemahannya: tingkat halusinasi 40% pada AA-Omniscience, naik dari 23% pada generasi sebelumnya, dan 64 putaran agen per tugas yang sangat besar — model ini bekerja keras, dan Anda membayar untuk setiap putaran. Tencent HY4 Preview tidak memiliki semua instrumentasi itu. Kekuatannya hanyalah klaim, dan mode kegagalannya — Tencent sendiri menandai pemikiran panjang dan verifikasi diri berlebihan — adalah pengakuan, bukan pengukuran.

Bagi tim yang memilih di antara keduanya, kesenjangan verifikasi bukanlah hal yang abstrak. Perilaku Qwen3.8-Max yang mencapai 64 putaran per tugas adalah pendorong biaya nyata dan terukur: pada harga $2/$6, ia masih menjadi agen termahal per tugas yang diselesaikan dalam beberapa perbandingan pihak ketiga, dan sejumlah tim melaporkan bahwa jumlah putaran tersebut mengikis keunggulan harganya. Perilaku setara HY4 Preview tidak diketahui — bisa jadi lebih murah per tugas daripada yang disarankan harga per tokennya yang sudah rendah, atau kebiasaan verifikasi mandirinya bisa menghabiskan selisihnya. Belum ada yang bisa memberi tahu Anda yang mana, karena belum ada orang di luar Tencent yang menjalankannya.

Harga dan kepraktisan open-weights

Per token, HY4 Preview lebih murah di kedua sisi pembukuan: ¥6/¥18 dibandingkan dengan $2.00/$6.00 milik Qwen3.8-Max, dan cache hit sebesar ¥0.3 dibandingkan $0.25. Itu menjadikan HY4 Preview flagship open-weight termurah untuk input maupun output, titik. Tetapi "open weights" datang dengan dua set cetakan kecil yang berbeda. Rilis open-weights Qwen3.8-Max — Qwen3.8-2.4T-A95B — hanya berupa teks dengan mode berpikir yang selalu aktif, konteks native 262K, bukan 1M seperti di API, serta lisensi khusus dengan ketentuan berjenjang skala: diwajibkan menampilkan nama model jika pengguna bulanan di atas 100 juta, dan lisensi terpisah untuk bisnis Model-as-a-Service berskala besar. Bobot Tencent HY4 Preview sudah ada di HuggingFace, ModelScope, dan GitHub sejak pagi ini, tetapi ketentuan lisensi pastinya dan apakah bobot tersebut sesuai dengan API yang dilayankan belum dinyatakan dengan tingkat kejelasan yang sama. Kedua model dapat diunduh; tidak ada yang bisa langsung dipakai tanpa penyesuaian.

Intinya

Qwen3.8-Max adalah pilihan yang lebih aman dalam segala hal yang membuat verifikasi memberikan keamanan: dinilai secara independen untuk kecerdasan dan pekerjaan agen, mode kegagalan yang diketahui, lisensi yang pasti, dan tiga minggu umpan balik produksi. Ini juga pilihan yang lebih mahal per token, dan perilaku turn-heavy yang terukur merupakan risiko biaya yang diketahui. Tencent HY4 Preview adalah taruhan nilai: lebih murah untuk input maupun output, klaim Terminal-Bench yang sebanding, dan klaim Toolathlon-Verified langsung terhadap Qw​en — semuanya belum diverifikasi pada hari pertama. Jika Anda menempatkan model open-weight ke produksi minggu ini, Qwen3.8-Max adalah pilihan yang dapat dipertahankan dan tersedia di OrcaRouter dengan harga daftar Ali​baba — $2.00/$6.00, diteruskan tanpa markup. HY4 Preview adalah proyek evaluasi: jalankan melalui API Tencent sendiri untuk tugas bergaya Toolathlon Anda, pertahankan jalur produksi pada model yang terverifikasi, dan ketika skor independen keluar — atau ketika HY4 Preview mencapai router dan tarif ¥6/¥18 menjadi pass-through pada hari yang sama — pergantiannya adalah aturan routing, bukan penulisan ulang.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

Apa yang harus ditonton

• Putaran independen pertama dari HY4 Preview pada harness agenik. Toolathlon-Verified 74.1 adalah angka yang ingin dimenangkan Tencent; Agentic Index pihak ketiga akan menjadi konfirmasinya.

• Jumlah giliran terukur HY4 Preview. 64 giliran per tugas Qwen3.8-Max adalah kisah peringatan; apakah HY4 Preview lebih murah per tugas yang diselesaikan adalah keseluruhan argumen ekonomi.

• Syarat lisensi pada bobot. Syarat-syarat ini akan menentukan apakah "terbuka" berarti "dapat digunakan dalam skala Anda" untuk HY4 Preview, sebagaimana ketentuan Lisensi Qwen3.8-Max berlaku untuk model Alibaba.

Apakah salah satu vendor menurunkan harga lagi. Pada bulan di mana dua flagship open-weight dipasarkan dengan penetapan harga yang agresif, penerusan pada router membuat penurunan harga lebih lanjut terlihat pada hari yang sama.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube