Kartu judul pahlawan untuk perbandingan 'Tencent HY4 Preview vs Kimi K3'. Kartu bergaya papan skor di tengah bertuliskan 'Uji buta internal, skala 4 poin' dengan 'Tencent HY4 Preview 2.99' di kiri dan 'Kimi K3 2.94' di kanan. Kartu kiri 'Tencent HY4 Preview' mencantumkan '770B / 49B aktif, bobot terbuka', '¥6 / ¥18 per 1M', 'Pratinjau teks saja'. Kartu kanan 'Kimi K3' mencantumkan '2.8T / 104B aktif, bobot terbuka', '$3.00 / $15.00 per 1M', 'Visi asli, Indeks AA 57'. Footer berbunyi 'Uji buta dijalankan oleh Tencent dengan 163 insinyur pada 203 tugas; hasil dilaporkan vendor.' Logo OrcaRouter ditempatkan di sudut kanan bawah.
Guides & Insights

Pratinjau Tencent HY4 vs Kimi K3: Uji Buta yang Dipilih Tencent untuk Dipublikasikan

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tencent HY4 Preview vs Kimi K3 adalah satu-satunya pertandingan dalam peluncuran model ini yang dipilih sendiri oleh Tencent untuk dijalankan. Dalam uji buta internalnya — 163 insinyur, 203 tugas rekayasa, dinilai dengan skala empat poin — HY4 Preview mencetak 2.99/4.00 dibandingkan Kimi K3 yang 2.94, dan tajuk utama Tencent menyebutnya sebagai kemenangan. Tulisan halus dari kemenangan itu layak dibaca perlahan: HY4 Preview mengalahkan Kimi K3 pada 51.2% tugas, seri pada 7.9%, dan kalah pada 40.9%. Tingkat kemenangan bersih 10 poin itu nyata, tetapi itu adalah keunggulan tipis melawan model yang memiliki sepertiga dari total jumlah parameter dan kurang dari separuh parameter aktif — dan seluruh pengujian dilakukan oleh Tencent.

Kimi K3 adalah flagship open-weight Moonshot dengan 2,8 triliun parameter, model open terbesar yang pernah dirilis, dan titik acuan yang diukur oleh setiap laboratorium China sejak 16 Juli. Tencent memilihnya sebagai lawan karena ia adalah standar open-weight — yang membuat tugas artikel ini menjadi sangat konkret: baca satu-satunya perbandingan head-to-head yang ditawarkan sang penantang, dan putuskan seberapa berharganya.

Tolok ukur yang Tencent pilih untuk dipublikasikan

Uji buta tersebut dinilai oleh insinyur Tencent sendiri pada tugas-tugas rekayasa milik Tencent sendiri, yang merupakan hal pertama yang perlu Anda diskon. Kumpulan tugas yang dikurasi perusahaan adalah lingkungan yang tepat di mana model baru bisa menampilkan performa terbaiknya. Bahkan dengan mengakui hal itu, bentuk hasilnya tetap informatif: 51,2% kemenangan berbanding 40,9% kekalahan adalah selisih yang tipis, dan tingkat seri 7,9% berarti kedua model berimbang pada sebagian besar tugas. Pada tugas-tugas sulit, yaitu tugas yang membedakan model frontier dari yang lain, kesenjangannya selalu di tempat yang sama — dan judul Tencent, "sedikit di depan Kimi K3," dirumuskan dengan jujur, yang bukanlah sesuatu yang dipublikasikan oleh setiap laboratorium.

Skala bukanlah takdir.

Perbandingan parameter membuat hasilnya terlihat mengesankan atau mencurigakan, tergantung pada keyakinan awal Anda. Kimi K3 memiliki total 2,8 triliun parameter dengan 104 miliar aktif — 896 pakar, 16 aktif per token — dan dilatih untuk selalu bernalar dengan chain-of-thought yang terbuka. HY4 Preview memiliki total 770 miliar dengan 49 miliar aktif, sepertiga dari skala total dan kurang dari setengah komputasi aktif. Model yang lebih kecil meraih kemenangan tipis dalam uji buta atas model yang lebih besar adalah arah pergerakan yang selama ini menjadi tren di seluruh bidang open-weight — Qwen3.8-Max, dengan 2,4T, dan GLM-5.2, dengan 753B, telah saling beradu pada benchmark agentik selama berbulan-bulan — jadi hasilnya masuk akal, bukan mengada-ada. Yang terpenting, hasil ini belum diverifikasi oleh siapa pun di luar Tencent.

Papan skor

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Skala — HY4 Preview 770B total / 49B aktif vs Kimi K3 2.8T total / 104B aktif

• Konteks — HY4 Preview >1M token vs Kimi K3 1M token

• Harga per 1M — HY4 Preview ¥6 masuk / ¥18 keluar (≈$0.85 / $2.50) vs Kimi K3 $3.00 masuk / $15.00 keluar, cache hits $0.30

• Modalitas — HY4 Preview khusus teks vs Kimi K3 input gambar dan video asli

• Penalaran — HY4 Preview tanpa mode yang dipublikasikan vs Kimi K3 penalaran yang selalu aktif dengan rantai pemikiran yang dialirkan

• Skor independen — HY4 Preview none vs Kimi K3 AA Intelligence Index 57, tiga besar secara global saat rilis.

Pada baris di mana kedua belah pihak melaporkan angka, model-model tersebut mengelompok. Tencent melaporkan HY4 Preview sebesar 37,1 pada APEX-Agents, pada dasarnya sejajar dengan Kimi K3 yang mencapai 37,2 — hampir seri yang diprediksi papan skor uji buta. Toolathlon-Verified HY4 Preview sebesar 74,1 dan DeepSWE 64,3 tidak memiliki padanan Kimi K3 yang saya pegang, sementara FrontierSWE 81,2, ProgramBench 77,8, dan BrowseComp 91,2 milik Kimi K3 tidak memiliki padanan HY4 Preview. Papan skor jujur bahwa kedua kartu itu nyaris tidak tumpang tindih, dan itu sendiri merupakan peringatan tentang memperlakukan baris dari salah satu vendor sebagai gambaran lengkap model tersebut.

Visi adalah perbedaan nyata terbesar.

Bagi developer yang memilih di antara keduanya hari ini, kesenjangan strukturalnya bukanlah kecerdasan — melainkan modalitas input. Kimi K3 bersifat multimodal secara native: ia menerima input gambar dan video melalui encoder MoonViT-V2-nya dan termasuk model terbuka terbaik dalam tugas-tugas visi, menempati peringkat kedua secara global di arena visi. Tencent HY4 Preview hanya mendukung teks dalam pratinjau ini, dan Tencent telah menyatakan bahwa visi harus menunggu rilis penuh. Beban kerja apa pun yang membutuhkan tangkapan layar, pemahaman UI, atau grounding visual sudah pasti menjadi milik Kimi K3, apa pun hasil uji buta terhadap teks engineering. Jika pekerjaan Anda murni kode, dokumen, dan output terminal, kesenjangan itu tidak relevan; begitu sebuah tugas melibatkan pengamatan terhadap sesuatu, hal itu menentukan siapa pemenangnya.

Pertanyaan biaya

Per token, HY4 Preview jauh lebih murah: kira-kira $0.85/$2.50 dibandingkan $3.00/$15.00 milik Kimi K3, dengan cache hit pada ¥0.3 (sekitar empat sen) dibandingkan $0.30. Namun, kedua model memiliki perilaku token yang berlawanan sehingga mempersempit kesenjangan tersebut. Kimi K3 selalu bernalar dan mengalirkan chain-of-thought-nya, yang membuat token keluaran membengkak pada setiap permintaan; para pengulas mencatat bahwa model ini lebih lambat — sekitar 62 token per detik — dan boros token untuk loop agen. HY4 Preview, menurut catatan rilis Tencent sendiri, "cenderung berpikir terlalu panjang dan melakukan verifikasi diri yang berlebihan" pada tugas yang kompleks. Keduanya sama-sama membakar token keluaran ekstra; HY4 Preview hanya mengenakan biaya yang lebih murah untuk token-token tersebut. Perbandingan yang adil adalah biaya per tugas yang diselesaikan, dan belum ada orang di luar Tencent yang mengukurnya untuk HY4 Preview.

Putusan

Tencent HY4 Preview adalah penantang yang lebih murah, lebih kecil, dan belum terverifikasi yang mengklaim keunggulan tipis dalam uji buta dibandingkan standar open-weight; Kimi K3 adalah petahana yang lebih besar, terverifikasi, dan memiliki kemampuan visi, dengan harga empat hingga lima kali lebih mahal per token serta Intelligence Index independen sebesar 57. Kartu benchmark kedua model tidak sepenuhnya independen — skor utama Kimi K3 juga dilaporkan oleh Moonshot, meskipun Index 57-nya tidak. Jika beban kerja Anda multimodal, Kimi K3 adalah satu-satunya pilihan dalam perbandingan ini. Jika hanya teks dan engineering, HY4 Preview adalah taruhan bernilai dengan head-to-head yang nyata, meskipun dijalankan vendor, dan jalur murahnya adalah mengarahkan Kimi K3 pada kunci produksi — model ini aktif di OrcaRouter dengan harga daftar Moonshot $3.00/$15.00, diteruskan tanpa markup — sementara Anda menjalankan HY4 Preview melalui API Tencent sendiri untuk beban kerja bayangan. Ketika HY4 Preview mencapai router, kunci yang sama dan aturan failover yang sama akan menangani keduanya, dan tarif Tencent sebesar ¥6/¥18 akan diteruskan tanpa perubahan.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

Apa yang harus ditonton

• Uji ulang independen terhadap tugas-tugas tes buta. Tingkat kemenangan 51,2% adalah klaim yang paling dapat diuji dalam peluncuran ini, dan pengujian pihak ketiga akan menyelesaikannya dalam seminggu.

• Apakah HY4 Preview hadir dengan kemampuan vision sebelum perilisan Hy4 penuh. Hal itulah yang akan mengubah pertandingan nilai berbasis teks ini menjadi pertarungan flagship yang sesungguhnya.

• Biaya per tugas selesai pada harness agenik standar. Kedua model sama-sama boros token; siapa pun yang lebih murah per tugas selesai akan memenangkan argumen produksi.

• Respon Kimi K3 terhadap tekanan harga. Jika Moonshot memotong tarif output $15, bingkai "penantang murah vs standar mahal" berbalik.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube