Kartu judul hero untuk pratinjau Tencent Hy4. Judul di tengah berbunyi 'Tencent Hy4 Preview — bobot terbuka, vLLM sejak hari pertama'. Baris subjudul berbunyi '770B MoE · 49B aktif · konteks 1M'. Empat chip spesifikasi berbunyi 'Bobot terbuka (Apache 2.0)', 'vLLM + SGLang sejak hari pertama', 'Serving 8x GPU (FP8)', '¥6 / ¥18 per MTok'. Baris footer berbunyi 'Dirilis 28 Agustus 2026 · Berjalan di vLLM'. Logo OrcaRouter ditempatkan di sudut kanan bawah.
Guides & Insights

Tencent Hy4 Preview Berjalan di vLLM Sejak Hari Pertama: MoE Open-Weight 770B yang Benar-Benar Dapat Anda Sajikan

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ketika Tencent Hy4 Preview diluncurkan pada 28 Agustus 2026, ia melakukan sesuatu yang sebagian besar flagship kelas frontier lewati pada hari pertama: ia dirilis dalam keadaan dapat langsung dijalankan. Di samping bobot terbuka, Tencent dan tim vLLM menerbitkan image Docker yang sudah dibuat, resep penyajian resmi, dan dukungan kerangka kerja yang digabungkan di dalam vLLM itu sendiri, sehingga model berbobot terbuka terbesar yang pernah diproduksi lini Hunyuan — total 770 miliar parameter, 49 miliar aktif per token — sudah tersedia di belakang endpoint yang kompatibel dengan OpenAI pada GPU Anda sendiri dalam hitungan jam setelah pengumuman tersebut. Kisah runtime hari-pertama inilah yang menjadi berita dalam tulisan ini, karena "berjalan di vLLM" bukanlah catatan kaki untuk model sebesar ini. Itulah perbedaan antara siaran pers dan sesuatu yang bisa Anda gunakan dalam produksi.

Sisa peluncurannya adalah paket berwujud pratinjau yang biasa, dan peringatannya sama pentingnya dengan angka-angkanya. Tencent menyebut Tencent Hy4 Preview sebagai iterasi awal, menandai penalaran yang terlalu panjang dan verifikasi-diri yang berlebihan sebagai perilaku yang diketahui, dan menerbitkan tabel tolok ukur yang sepenuhnya dilaporkan sendiri — belum ada laboratorium independen yang menilainya, dan modelnya baru berusia dua hari sejak tulisan ini dibuat. Semua itu tidak mengubah inti praktisnya: bobotnya adalah Apache 2.0, jendela konteksnya 1 juta token, dan dukungan vLLM sejak hari pertama berarti jalur hosting mandiri itu nyata, bukan sekadar aspirasi.

Apa sebenarnya Tencent Hy4 Preview itu

Tencent memposisikan Tencent Hy4 Preview sebagai penerus Hy3 (total 295B, konteks 256K), yang kira-kira menggandakan kapasitas aktif dan melipatgandakan empat kali jendela konteks. Arsitekturnya layak dibaca baris demi baris, karena setiap baris mengubah apa yang boleh dilakukan model open-weight di perangkat keras Anda.

Arsitektur — Mixture-of-Experts dengan total 770 miliar parameter dan 49 miliar aktif per token di seluruh 78 lapisan. Lapisan pertama bersifat padat (dense); 77 lapisan lainnya merutekan setiap token melalui 256 pakar (expert) yang dirutekan plus satu pakar bersama, mengaktifkan 8 teratas. Rasio sparsity sekitar 16:1 inilah yang menjaga biaya inferensi tetap dalam rentang yang benar-benar dapat dijalankan oleh tim yang serius.

• Jendela konteks — 1.048.576 token asli, salah satu yang terluas dari model open-weight mana pun. Repositori lengkap, refaktor multi-file, batch dokumen panjang: masalah satu-permintaan.

• Perhatian — Gated Deep​Seek Sparse Attention (Gated DSA) dengan IndexCache, sebuah desain sparse-attention yang menghitung indeks sparse baru hanya pada 21 dari 78 lapisan dan menggunakannya kembali pada 57 lapisan lainnya. Itulah mengapa menyajikannya bukan sekadar "vLLM yang lebih besar" — ia membutuhkan backend yang memahami sparse attention.

• Decoding spekulatif bawaan — lapisan MTP (prediksi multi-token) dengan total sekitar 10B / 0,7B parameter aktif tertanam di dalam model, sehingga vLLM dan SGLang dapat menyusun token tanpa Anda menghosting model draf terpisah.

• Bobot — Apache 2.0, dalam bentuk checkpoint BF16 dan FP8, dipublikasikan ke Hugging Face, ModelScope, GitCode, dan CNB.

Apa arti sebenarnya dari "day-zero vLLM"

Dukungan kerangka kerja yang digabungkan pada hari peluncuran adalah peristiwa konkret di balik sinyal tersebut — perubahan vLLM yang menambahkan Tencent Hy4 Preview (PR #54160) masuk dalam periode yang sama dengan rilis, dan resep resminya menargetkan vLLM 0.29.0 atau lebih baru. Dalam praktiknya, itu berarti jalur penyajian hanyalah satu perintah, bukan debugging kernel selama seminggu.

docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview

Bendera-bendera itu penting, dan masing-masing memetakan ke sesuatu dalam model, bukan sekadar boilerplate:

--attention-backend FLASHMLA_SPARSE — wajib, bukan opsional. Sparse attention Gated DSA dari Tencent Hy4 Preview tidak berjalan dengan benar pada backend dense bawaan, dan flag inilah yang ditetapkan oleh resep resmi.

• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — mengaktifkan lapisan MTP bawaan model untuk decoding spekulatif, tiga token draf di depan. Tidak perlu model draf terpisah untuk digunakan.

• --tool-call-parser hy_v4 dan --reasoning-parser hy_v4 — parser kustom yang memberi tahu server bagaimana Tencent Hy4 Preview mengeluarkan panggilan alat dan chain-of-thought-nya, dengan --enable-auto-tool-choice yang memungkinkan model memutuskan kapan harus memanggil alat.

Tencent merekomendasikan temperature 0.9 dan top_p 1.0 untuk sampling. Penalaran secara default menggunakan chain-of-thought dengan upaya "high" yang ditujukan untuk matematika, coding, dan tugas-tugas kompleks; jika Anda menginginkan respons langsung tanpa pemikiran panjang, Anda mengirimkan upaya penalaran no_think dalam permintaan, bukan mengganti bobot.

A screenshot of the official vLLM recipe page for tencent/Hy4-preview (recipes.vllm.ai/tencent/Hy4-preview, captured August 30, 2026). It shows the model spec chips '770B | 49B | 1,048,576 ctx | vLLM 0.29.0+', a note describing the built-in 10B MTP layer for speculative decoding and the hy_v4 tool/reasoning parsers, and the prebuilt docker run command with --tensor-parallel-size 8, --attention-backend FLASHMLA_SPARSE, and the hy_v4 parsers.

Dukungan hari-pertama tidak hanya untuk vLLM, yang mana itu sendiri luar biasa untuk rilis yang baru semuda ini. SGLang merilis citra multi-arsitektur yang telah dibangun sebelumnya (lmsysorg/sglang:hy4-preview) dengan decoding spekulatif gaya NEXTN pada hari yang sama, dan ekosistem Ascend mendapatkan dukungan 0-hari melalui vLLM-Ascend menggunakan bobot terkuantisasi W8A8 di 16 NPU Atlas 800I A3. Rilis bobot terbuka sering kali membutuhkan waktu berminggu-minggu bagi ekosistem serving untuk mengejar; yang ini hanya memerlukan hitungan jam.

Skor yang layak dikutip

Setiap tolok ukur yang diterbitkan Tencent untuk Tencent Hy4 Preview dilaporkan oleh vendor — dijalankan pada pengaturan evaluasi milik Tencent sendiri, belum direproduksi oleh laboratorium independen mana pun, dan model tersebut telah publik selama dua hari. Bacalah sebagai batas tertinggi yang diyakini Tencent telah dicapainya, bukan sebagai fakta yang sudah mapan. Verifikasi independen tidak akan ada sampai pihak ketiga menjalankannya; belum ada apa pun di papan peringkat publik yang mencerminkan model ini.

A single-model scoreboard titled 'Tencent Hy4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (Apache 2.0)', 'Price: ¥6 / ¥18 per MTok (¥0.3 cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 30, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Angka utamanya adalah Terminal Bench 2.1, sebuah pengujian seberapa baik sebuah model mengoperasikan terminal sungguhan saat menulis kode. Tencent melaporkan skor Tencent Hy4 Preview sebesar 85,4, yang menurut klaimnya menyaingi Claude Opus 5 dan mengungguli DeepSeek V4 Pro, serta mengalahkan pendahulunya sendiri, Hy3, dengan selisih 14,6 poin. Angka tunggal itulah yang menjadi andalan rilis ini—klaim yang menempatkan model open-weight setara dengan model frontier tertutup termahal dalam tes pengkodean agentik yang sulit—dan klaim itulah yang paling membutuhkan konfirmasi independen.

Sisa tabel internal—semua angka milik Tencent sendiri: DeepSWE, sebuah benchmark rekayasa perangkat lunak, melonjak dari 28.0 pada Hy3 menjadi 64.3. SWE-bench Pro mencapai 65.7 dan SWE-bench Multilingual mencapai 82.9. Pada Toolathlon-Verified, sebuah tes pemanggilan alat, Tencent melaporkan 74.1, yang menurut klaimnya melampaui Qwen 3.8 Max dan GPT-5.6 Sol serta mendekati Kimi K3 dan Claude Opus 5. Pada APEX-Agents pass@1, angkanya berada di 37.1, sedikit di belakang Kimi K3 yang 37.2. Dan dalam evaluasi buta internal terpisah, 163 pakar rekrutan Tencent menilai 203 tugas rekayasa dengan skor 2.99 dari 4.00, sedikit mengungguli GLM-5.3 yang 2.92 dan Kimi K3 yang 2.94.

Dua pola perlu diperhatikan. Setiap angka kuat ada pada pekerjaan rekayasa agen — penggerak terminal, pemanggilan alat, tugas berskala repositori — dan tidak ada satu pun pada pengetahuan atau penalaran generik, yang sesuai dengan posisi produktivitas, bukan sekadar kebetulan. Dan Tencent menggambarkan DeepSWE serta yang lainnya sebagai mempersempit, bukan menutup, kesenjangan; satu-satunya klaim kesetaraan yang bersih dan dapat dipasarkan adalah hasil imbang Terminal Bench 2.1, dan klaim itulah yang paling layak diuji dengan beban kerja Anda sendiri.

Berapa biaya sebenarnya untuk menjalankannya

Perhitungan self-hosting adalah hal pertama yang harus jujur. Ini bukan model GPU tunggal dan bukan model desktop. Checkpoint FP8 beratnya mendekati satu terabyte, dan resep resmi mengasumsikan paralelisme tensor 8 — delapan GPU bandwidth tinggi dengan interkoneksi cepat (perangkat keras referensi Tencent untuk FP8 adalah 8×B300, dengan BF16 penuh membutuhkan 16×B200). Jika Anda tidak memiliki jejak itu, Anda tidak akan bisa self-host dengan murah, dan backend sparse-attention berarti tidak ada jalan pintas untuk memori cache KV pada konteks 1M-token.

Satu tambahan di minggu peluncuran mengubah sebagian perhitungan bagi tim yang menginginkan bobot terbuka tanpa jejak model unggulan. Tim Hy dari Tencent merilis build GGUF terkompresi dari Tencent Hy4 Preview, menyusutkan rilis BF16 ~1.5 TB menjadi sekitar 200 GiB dengan skema kuantisasi campuran per lapisan yang mereka sebut MIX-STQ1_0 — tensor pakar dalam jumlah besar turun ke sekitar 1.3 bit sementara lapisan yang kritis terhadap aliran residual mempertahankan presisi lebih tinggi. Pada evaluasi Tencent sendiri, perubahan akurasinya kecil — SWE-bench Multilingual 82.9 menjadi 81.3, MCP Atlas 83.7 menjadi 83.2, IFBench 73.5 menjadi 72.5 — sebuah trade-off yang disebut vendor hampir tanpa kehilangan. Itu adalah angka-angka Tencent pada pengaturan Tencent, sejauh ini belum direproduksi. Model 200 GiB masih bukan model GPU tunggal, tetapi taruhannya jauh lebih kecil daripada checkpoint FP8 yang mendekati satu terabyte, dan ini membuka jalur bobot terbuka untuk node multi-GPU yang lebih kecil daripada yang diasumsikan resep delapan B300.

Jalur API adalah tempat harga menjadi menarik. Di TokenHub Tencent Cloud, Tencent Hy4 Preview terdaftar dengan harga 6 yuan (~US$0.83) per juta token input, 18 yuan (~US$2.50) per juta token output, dan 0.3 yuan (~US$0.04) per juta token untuk cache hits. Output sekitar $2.50 per juta jauh di bawah harga output $25 per juta dari model frontier tertutup teratas, dan tingkat cache-hit yang murah membuat loop agentic yang panjang — di mana prompt sistem dan prefiks percakapan yang sama terus dikirim ulang — menjadi sangat terjangkau.

Tencent juga memberikan akses gratis selama dua minggu ke Tencent Hy4 Preview di dalam WorkBuddy dan CodeBuddy selagi model ini masih baru, jadi cara termurah untuk mencobanya minggu ini adalah gratis — dan WorkBuddy adalah tempat posisi produktivitas menjadi konkret. Dalam percakapan WorkBuddy apa pun, pemilih model beralih antara pratinjau Hy3 dan Hy4, sehingga pembagian antara kerja produktivitas kantor dan analisis di satu sisi serta pengodean di sisi lain adalah pilihan per tugas, bukan keputusan deployment. Pembagian itu sesuai dengan target yang dituju Tencent untuk model ini, dan uji langsung di WorkBuddy menunjukkan model tersebut mampu menghasilkan artefak kompleks dalam satu kali proses — prototipe game low-poly yang dapat dimainkan dari satu perintah, review bisnis kuartalan lengkap yang disusun dari sepuluh lampiran tanpa intervensi manual, dan, dalam demo penguji yang beredar minggu ini, simulasi lubang hitam. Ini adalah pengamatan komunitas pada aplikasi milik Tencent sendiri, bukan tolok ukur vendor — tetapi ini adalah sinyal langsung pertama tentang apa yang dilakukan model pada tugas multi-langkah yang nyata, dan semuanya gratis untuk direproduksi sebelum Anda mengeluarkan biaya apa pun.

Keputusan biaya adalah titik di mana lapisan routing mengubah perhitungannya, dan kami akan jujur tentang peran kami sendiri di dalamnya: OrcaRouter belum merutekan Tencent Hy4 Preview, karena Tencent belum membuka model ini untuk platform inferensi pihak ketiga — model ini berjalan di endpoint TokenHub milik Tencent Cloud dan pada deployment self-hosted dari bobot terbuka, dan kami tidak mengklaim melayani apa yang tidak kami layani. Yang dihadirkan lapisan routing adalah kerangka keputusan di sekitarnya. Jika Anda memilih antara node 8-GPU dan sebuah API, disiplin pass-through yang sama yang dijalankan katalog lainnya berlaku pada hari Tencent membukanya: OrcaRouter meneruskan harga daftar penyedia tanpa markup, sehingga pemotongan harga vendor langsung aktif di sisi kami pada hari yang sama, bukan dijual kembali dengan markup. Dan untuk model yang baru berusia dua hari dengan satu-satunya bukti adalah benchmark dari vendornya, failover otomatis adalah cara yang aman untuk mengujinya — letakkan model yang sudah terbukti di jalur kritis Anda dan Tencent Hy4 Preview di sampingnya, gunakan model tersebut pada tugas-tugas di mana profil biayanya menang, lalu beralih kembali (failback) begitu tidak menang, semuanya melalui satu API dan satu kunci.

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent Hy4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

Batas-batas yang tidak muat di lembar spesifikasi

Tencent mencantumkan keterbatasan yang diketahui secara gamblang, dan hal itu harus membentuk setiap keputusan penerapan. Tencent Hy4 Preview adalah model teks, titik — tanpa masukan visi atau multimodal — jadi apa pun yang berkaitan dengan gambar atau video berada di model lain. Tencent juga menyoroti perilaku mulai lambat pada tugas kompleks (berpikir lama sebelum keluaran pertama) dan kecenderungan untuk terlalu memverifikasi diri sendiri, menghabiskan token untuk memeriksa ulang pekerjaan yang telah dilakukan. Kombinasi itu justru salah untuk obrolan yang sensitif terhadap latensi dan justru dapat ditoleransi untuk pekerjaan rekayasa batch offline, yang memberi tahu Anda di mana Tencent mengharapkan Anda menjalankannya.

Ada dua klaim dalam materi peluncuran yang layak mendapat perhatian tersendiri karena keduanya berkaitan dengan cara model tersebut dibangun, bukan pada skor yang dicapainya. Tencent mengatakan bahwa Tencent Hy4 Preview ikut serta dalam pengembangan dirinya sendiri — membantu mengoptimalkan metode pelatihan, strategi data, kerangka evaluasi, dan operator tingkat rendah yang menghasilkannya, sebuah lingkaran peningkatan diri rekursif awal — dan bahwa model tersebut secara otonom mengoptimalkan sistem inferensinya sendiri sehingga menghasilkan peningkatan throughput ujung-ke-ujung sebesar 31.8% dibandingkan baseline. Di sisi ilmiah, Tencent melaporkan bahwa model tersebut memajukan batas bawah yang diketahui dari masalah Blaschke–Lebesgue dalam geometri konveks dari 0.380799 menjadi 0.41104, serta percepatan 2.0x pada simulasi bilayer fosfolipid dengan 32,512 atom hingga 54.9 milidetik per langkah. Seperti halnya semua pemberitaan lain pada hari pertama, semua ini adalah laporan dari Tencent sendiri.

Dan ketiadaan yang paling penting adalah verifikasi. Belum ada skor independen untuk Tencent Hy4 Preview di mana pun — tidak di papan peringkat publik, tidak dari lab evaluasi pihak ketiga, tidak dalam entri Artificial Analysis. Modelnya terlalu baru untuk itu. Tes buta pakar internal adalah sinyal yang berguna tentang bagaimana peninjau Tencent sendiri melihatnya dibandingkan dengan GLM-5.3 dan Kimi K3, tetapi itu adalah peninjau Tencent yang menilai tugas-tugas Tencent. Semua yang melampaui lembar spesifikasi adalah klaim yang menunggu pemeriksaan.

Siapa yang harus menjalankan Tencent Hy4 Preview minggu ini?

Jawaban jujurnya terbagi menjadi tiga kelompok minggu ini, dan salah satunya tidak membutuhkan perangkat keras sama sekali. Jika Anda hanya ingin merasakan apa yang dilakukan Tencent Hy4 Preview, akses WorkBuddy gratis adalah jalur tercepat — tanpa GPU, tanpa kunci API, buka percakapan, alihkan pemilih model ke Hy4 preview, lalu berikan tugas Work atau Coding. Jika Anda memiliki GPU dan menjalankan beban kerja teknik secara batch — tugas agen jangka panjang, analisis skala repositori, evaluasi offline — model ini layak diuji secara serius sekarang juga: bobotnya terbuka, jendela konteksnya berskala repositori, jalur vLLM hanya satu perintah, dan build GGUF minggu peluncuran menurunkan ambang batas perangkat keras untuk uji coba. Jika Anda menjalankan chat produksi yang sensitif terhadap latensi, atau apa pun yang multimodal, atau apa pun yang tidak bisa Anda pertaruhkan pada model yang satu-satunya buktinya adalah tolok ukur dari vendor itu sendiri, tunggu — Tencent telah melakukan iterasi kira-kira setiap dua bulan sejak Februari, dan mereka sudah mengatakan bahwa batch model Hy4 berikutnya akan segera hadir, jadi pratinjau ini secara eksplisit merupakan iterasi awal.

Bagi semua orang lainnya, postur yang berguna adalah pola perutean: buktikan di samping model yang sudah Anda percaya, dengan biaya yang bisa Anda tinggalkan, dan skalakan hanya di tempat angka-angkanya bertahan pada beban kerja Anda sendiri. Itulah fungsi perute — pada hari Tencent membuka model ini untuk inferensi pihak ketiga, model ini bergabung dengan katalog satu API, 200-plus model, penerusan harga daftar seperti lainnya, dan perkakas failover serta komposisi sudah akan tersedia. Sampai saat itu, bobotnya ada di Hugging Face, API-nya di Tencent Cloud, dan uji coba gratisnya di WorkBuddy — dan klaim bahwa model berbobot terbuka mencapai tingkat teratas dalam pengodean agenik akhirnya memiliki angka spesifik yang melekat padanya. Angka itu milik Tencent. Pengujiannya milik Anda.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube