Kartu judul hero untuk 'Tencent Hy-MT2-7B Kini Memiliki API yang Dihosting' dengan subjudul 'Apa yang Diubah Penerjemah $0,295 per Juta Output', menampilkan ikon layanan cloud, glif terjemahan, garis konektor API, dan chip label harga bertuliskan $0,074 / $0,295 per 1M token, dengan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

Tencent Hy-MT2-7B Kini Punya API yang Dihosting: Apa yang Berubah dengan Penerjemah $0,295 per Juta Output

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tencent Hy-MT2-7B, model penerjemahan open-source yang dirilis Tencent Hunyuan pada 21 Mei 2026, mulai dapat dipanggil melalui API yang di-host minggu ini: sekitar 19 Agustus 2026, model dense 7B tersebut diluncurkan di endpoint Tencent Cloud yang di-host dengan harga $0,074 per juta token masukan dan $0,295 per juta token keluaran, dengan jendela konteks 8.192 token. Model ini tidak datang sendirian — Tencent Hy-MT2-1.8B dan Tencent Hy-MT2-30B-A3B muncul di backend yang sama dalam satu hari. Bobot modelnya telah tersedia di Hugging Face dan ModelScope selama tiga bulan; yang baru adalah bahwa sebuah tim kini dapat memanggilnya tanpa menyewa GPU, membangun llama.cpp dari kode sumber, atau mengirimkan toolchain 1,25-bit on-device. Untuk beban kerja penerjemahan, itulah perbedaan antara sebuah eksperimen dan keputusan produk.

Apa yang baru saja dirilis

Titik akhir komersial adalah milik Tencent Cloud sendiri, diekspos melalui API vendor dan beberapa platform pihak ketiga. Ketiga ukuran masing-masing berjalan dalam konteks 8K dengan penyelesaian 4.096 token; ketiganya menerima keluaran terstruktur melalui skema JSON di bidang response_format mereka, dan tidak ada yang menerapkan pemanggilan fungsi. Spesifikasi praktisnya, dalam satu baris per dimensi:

Tencent Hy-MT2-7B — $0,074 input / $0,295 output per 1 juta token, konteks 8.192, dense ~7B, mendukung output terstruktur, tanpa panggilan alat.

Tencent Hy-MT2-1.8B — $0,044 masuk / $0,177 keluar per 1 juta token, konteks 8.192, padat 1,8B, tanpa pemanggilan alat.

Tencent Hy-MT2-30B-A3B — $0.074 input / $0.295 output per 1 juta token, konteks 8,192, MoE 30B total / 3B aktif, mendukung output terstruktur, tanpa panggilan alat.

Titik harga utamanya adalah tingkat output 7B: di bawah tiga per sepuluh sen per seribu token output, untuk model yang menurut Tencent mampu bersaing dengan model yang satu orde magnitudo lebih besar. Terjemahan adalah salah satu dari sedikit beban kerja LLM di mana token output hampir mencakup seluruh tagihan, sehingga harga output menjadi angka yang menentukan apakah sebuah pipeline layak secara volume.

A single-column scoreboard titled 'Tencent Hy-MT2-7B — the scoreboard' listing six rows: Params dense 7B; Price $0.074 / $0.295 per 1M; Context 8,192 tokens; FLORES-200 86.89 (~97.9% of Gemini 3.1 Pro Think); WMT25 63.86 / 71.21 / 82.24; License Apache-2.0, with the footer 'All figures vendor-reported; API price as listed Aug 2026.'

Model di balik endpoint

Hy-MT2 adalah keluarga "berpikir cepat" dari Tencent: alih-alih menghabiskan rangkaian pemikiran yang panjang untuk setiap kalimat, ia dirancang untuk bereaksi seperti cara penerjemah profesional — cermat saat sumbernya ambigu, cepat saat tidak. 7B adalah bagian tengah yang seimbang dari keluarga ini, model padat berlisensi Apache-2.0, yang mencakup 33 bahasa ditambah lima pasang bahasa minoritas dan dialek Tionghoa (di antaranya Tibet, Kazakh, Mongolia, Uyghur, dan Kanton). Yang membedakannya dari LLM generik yang melakukan penerjemahan adalah kepatuhan terhadap instruksi: ia akan mempertahankan istilah glosarium di seluruh dokumen, menerapkan gaya yang ditentukan, membiarkan pembatas dan kunci JSON tetap utuh, serta menerima instruksi personalisasi dalam bahasa sehari-hari. Tencent merilis IFMTBench, sebuah tolok ukur terbuka untuk keterampilan itu, bersama dengan bobot model, dan wajah konsumen — program mini Tencent Hy Translate, dengan aplikasi iOS dan Android yang sedang dalam proses — dibangun di atas keluarga ini.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-7B (captured August 23 2026) showing the model name, Apache-2.0 license, and the family description covering 33 languages plus five minority-language and dialect pairs.

Angka-angka, dengan tanda bintang yang menyertainya.

Semua hal di bawah ini merupakan evaluasi milik Tencent sendiri, yang diterbitkan di kartu model dan dalam laporan yang menyertainya; tidak ada satu pun yang telah direproduksi secara independen pada saat penulisan ini. Pada jalur terjemahan umum XX⇔XX FLORES-200, model 7B mencetak 86.89 XCOMET-XXL, yang menurut Tencent setara dengan sekitar 97,9% dari Gemini 3.1 Pro (Think). Dalam mode "fast-thinking"-nya, model ini diklaim mengungguli model umum sumber terbuka termasuk DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B, dan Gemma4-26B-A4B. Pada WMT25, skornya meningkat di semua lini dibandingkan generasi sebelumnya — 63.86/71.21/82.24 versus 61.59/68.85/75.91 milik Hy-MT1.5-7B, dengan peningkatan terbesar pada GEMBA — dan pada DomainMTBench (keuangan, politik, pendidikan) ia mencatat 94.92 XCOMET / 92.79 GEMBA. Kemampuannya mengikuti instruksi adalah aspek yang paling terlihat membedakannya dari LM terjemahan setahun lalu: 89.73 sederhana / 72.67 kompleks / 83.14 total pada IFMTBench.

Apa yang diubah oleh API terkelola pada alur penerjemahan

Self-hosting 7B sebenarnya mudah untuk ukuran hal-hal semacam ini — ia berjalan di satu A100 atau RTX 4090, dan build FP8 serta GGUF terkuantisasi sudah tersedia. Tetapi "mudah di-self-host" bukan berarti "nol operasional." Jalur GGUF saat ini bergantung pada llama.cpp dengan kernel STQ milik Tencent, jalur FP8 membutuhkan stack yang tepat, dan harus ada yang menjaganya. Endpoint ter-hosting menghilangkan semua itu: tanpa GPU, tanpa build kernel, tanpa perencanaan kapasitas, dan harga per-token yang tetap berapa pun tingkat utilisasinya. Bagi tim yang memproses jutaan kalimat terjemahan per hari, prediktabilitas itu lebih penting daripada benchmark utama — dan itulah alasan mengapa minggu ini lebih penting daripada peluncuran bulan Mei.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2 (captured August 23 2026, English) showing the header 'Hy-MT2: High-Performance Multilingual Translation Model', the 2026-05-21 publication date, and a summary line about translating across 33 languages.

Pertanyaan routing yang belum ditanyakan siapa pun

Karena model ini baru berusia tiga hari di sisi API, cara realistis untuk mengadopsinya adalah cara Anda mengadopsi penyedia baru mana pun: letakkan di belakang aturan routing dengan failover otomatis sehingga endpoint yang belum teruji tidak akan pernah bisa menjatuhkan jalur produksi, dan biarkan volume yang memutuskan apakah ia layak mendapatkan slot permanen. Justru pola itulah yang disusun oleh DSL routing OrcaRouter di lebih dari 200 model yang kami bawa — dan perlu ditegaskan di sini: Tencent Hy-MT2-7B tidak ada dalam katalog OrcaRouter pada saat penulisan ini, jadi ini bukan cerita "memanggilnya melalui kami". Yang relevan adalah model penetapan harga. OrcaRouter meneruskan harga daftar setiap penyedia dengan markup 0%, sehingga ketika vendor memotong tarif, pemotongan tersebut langsung aktif di platform pada hari yang sama. Untuk beban kerja terjemahan bervolume tinggi, pertanyaan yang harus diajukan untuk setiap endpoint bukanlah "berapa harga portal hari ini" melainkan "berapa harga daftar per-token sebenarnya yang dibebankan penyedia, dan adakah sesuatu yang berada di antara itu dan saya." Dengan output $0,295/M, Tencent Hy-MT2-7B baru saja membuat pertanyaan itu menarik.

Tontonan Berikutnya

Tiga hal mengikuti dari pekan ini. Pertama, {{1}}saudara 1.8B dan 30B-A3B kini sama-sama dapat dipanggil{{/1}}, sehingga keputusan "ukuran mana" menjadi pertanyaan API yang nyata, bukan keputusan self-hosting (keluarga ini memiliki halaman perbandingan sendiri, tetapi versi singkatnya: 1.8B untuk on-device dan tingkatan termurah, 30B-A3B untuk domain kelas profesional, 7B di antaranya). Kedua, kemitraan Tencent dengan WMT26 menawarkan penghargaan kepada tim yang menggunakan model Hy-MT dalam tugas General Machine Translation dan Video Subtitle Translation — sebuah sinyal bahwa Tencent bermaksud menjadikan keluarga ini sebagai default terjemahan terbuka dalam MT kompetitif. Ketiga, aplikasi iOS dan Android dengan inferensi on-device, jika dirilis sesuai pengumuman, akan menjadikan 1.8B sebagai model terjemahan terbuka yang paling banyak terpasang di dunia. API yang dihosting adalah bagian yang berubah pekan ini; lintasan keluarga ini telah ditetapkan pada bulan Mei.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube