
Tencent HY-MT2 1.8B Mendapatkan API Terhosting: Penerjemah 440MB Milik Tencent Masuk ke Cloud
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 426 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 183 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Tencent HY-MT2 1.8B, anggota kompak dari keluarga penerjemah Hy-MT2 yang di-open-source oleh Tencent Hunyuan pada 21 Mei 2026, kini dapat dipanggil melalui API komersial yang di-hosting, bukan hanya self-hosted — daftar API model ini mulai tayang pada 20 Agustus 2026, dengan harga kira-kira $0,044 per juta token input dan $0,177 per juta token output. Tanggal peluncuran itu lebih penting dari biasanya, karena 1.8B bukan sekadar checkpoint open-source lainnya: ini adalah model yang dibuat Tencent untuk membuktikan bahwa model penerjemah terkuantisasi 440MB dapat berjalan sepenuhnya di ponsel, dan dalam tiga bulan sejak rilis open-source, model ini juga telah dikirimkan dalam mini-program HyTranslate milik Tencent sendiri serta aplikasi iOS dan Android yang menyusul. Artikel ini membahas tentang apa yang berubah dengan peluncuran API ter-hosting, apa sebenarnya model ini, dan angka mana yang sebaiknya Anda percaya.
Apa yang sebenarnya berubah pada 20 Agustus
Sampai sekarang, menggunakan Tencent HY-MT2 1.8B berarti salah satu dari dua hal: memuat bobot Apache-2.0 ke dalam transformers, vLLM, SGLang, atau llama.cpp sendiri, atau menggunakan produk terjemahan konsumen Tencent. API yang dihosting adalah jalur ketiga — Anda mengirim teks melalui HTTP, dan Tencent Cloud menyediakan endpoint 1.8B. Model ini mempertahankan konteks 8.192 token dan output maksimum 4.096 token, hanya memproses teks, dan dihargai sekitar $0,044 per juta token input dan $0,177 per juta token output. Bagi tim yang volume penerjemahannya tidak menentu, itu menghilangkan hambatan "harus mengoperasikan GPU" untuk mencoba model tersebut.

Separuh lainnya dari cerita ini adalah aplikasinya. Mini-program HyTranslate diluncurkan bersamaan dengan rilis open-source pada bulan Mei dengan input suara, prasetel gaya, dan mode luring. Aplikasi iOS dan Android — yang mengunduh model on-device untuk penerjemahan tanpa jaringan — telah dirilis sejak saat itu. Model 1.8B adalah tulang punggung dari kisah luring tersebut: dengan kuantisasi ekstrem 1,25-bit dari AngelSlim, model ini menyusut hingga sekitar 440MB penyimpanan dan berjalan secara lokal di silikon ponsel Apple, Qualcomm, dan MediaTek, dengan Tencent melaporkan inferensi 1,5x lebih cepat dibandingkan build 4-bit generasi sebelumnya pada Apple A15.
Apa itu 1.8B
HY-MT2-1.8B adalah LM kausal hanya-dekoder yang padat, dibangun di atas arsitektur hunyuan_v1_dense — sekitar 2 miliar parameter dalam praktiknya meskipun namanya 1.8B — dengan template obrolan dan tanpa prompt sistem default. Model ini menerjemahkan antara 33 bahasa plus lima pasangan bahasa minoritas dan dialek, termasuk Tionghoa, Inggris, Jepang, Korea, Prancis, Spanyol, Rusia, Arab, Thai, Vietnam, Indonesia, Hindi, Bengali, Tamil, serta pasangan dialek Tibet, Uyghur, Kazakh, Mongolia, dan Kanton. Berbeda dengan model penerjemahan encoder-decoder klasik, model ini disetel dengan instruksi: Anda memberi prompt dengan bahasa target dan instruksi opsional, dan model ini dapat mempertahankan struktur JSON dan HTML, menghormati glosarium, mencocokkan register, dan menggunakan konteks sekitarnya untuk menghilangkan ambiguitas. Kelas kemampuan itulah yang dimiliki bersama oleh model saudara 7B dan 30B-A3B, dan yang dirilis bersama dengan tolok ukur IFMTBench milik Tencent untuk menilainya.
Di mana posisi benchmark
Klaim kualitas tersebut perlu dibaca dengan saksama karena hampir semuanya berasal dari Tencent sendiri dan belum direproduksi oleh laboratorium independen hingga tulisan ini dibuat. Tencent melaporkan HY-MT2-1.8B mencapai 89,9% dari skor rata-rata FLORES-200 Gemini 3.1 Pro (7B di 97,9%, 30B-A3B di 98,6%), 96,7% dari Gemini pada set tes gaya GEMBA di dunia nyata, dan 96,2% pada DomainMTBench di delapan domain profesional. Beberapa liputan pers membulatkan angka FLORES-200 menjadi 88,1%; README vendor mencantumkan 89,9%. Tencent juga mengklaim bahwa model 1.8B secara keseluruhan melampaui API terjemahan komersial arus utama dari penyedia seperti Microsoft dan Doubao. Reproduksi independen belum ada, jadi anggap semua itu sebagai bukti indikatif yang dilaporkan vendor, bukan fakta yang diaudit. Yang tidak bergantung pada vendor: set bahasa 33+5 sudah tetap, lisensi Apache-2.0 nyata, dan checkpoint terkuantisasi 440MB yang berjalan di ponsel dapat diamati secara independen.

Cara Anda menggunakannya, dan berapa biayanya
• Self-hosted — bobot Apache-2.0 dari Hugging Face atau ModelScope; jalankan dengan transformers (>=5.6.0), vLLM, SGLang, atau build GGUF llama.cpp. Biayanya adalah tagihan GPU Anda; build 1.25-bit berjalan di perangkat kelas CPU.

• API yang Dihosting — Tencent Cloud menyediakan model 1.8B dengan harga sekitar $0,044 per juta token input dan $0,177 per juta token output pada saat penulisan ini; API dari vendor itu sendiri dan beberapa platform pihak ketiga menyediakannya.
• Konsumen — Mini-program HyTranslate serta aplikasi iOS/Android, termasuk terjemahan offline melalui model yang diunduh di perangkat.
Sampling yang direkomendasikan untuk 1.8B: temperature 0.7, top-p 0.6, top-k 20, penalti pengulangan 1.05, token maksimum 4096.
Jika Anda membangun pipeline penerjemahan alih-alih meluncurkan aplikasi konsumen, hal yang menarik dari model seperti ini adalah harganya yang terus berubah — Tencent telah memangkas tarif API Hy-MT2-Pro-nya pada bulan Juni. Itulah tepatnya skenario keberadaan router markup 0%: karena pass-through mengikuti harga daftar penyedia, penurunan harga dari vendor akan muncul pada tagihan di hari yang sama, bukan setelah gateway Anda menetapkan ulang harga. Model itu sendiri belum masuk daftar OrcaRouter saat tulisan ini dibuat, jadi Anda perlu menghosting sendiri bobotnya atau memanggil API Tencent Cloud secara langsung; argumen failover dan kunci tunggal berlaku untuk tumpukan penerjemahan yang lebih luas yang Anda bangun di sekitarnya, di mana memadukan model on-device kecil untuk lalu lintas massal yang murah dengan model yang lebih besar untuk pasangan bahasa yang sulit adalah jenis komposisi yang memang dirancang untuk diekspresikan oleh routing.
Intinya
Tencent HY-MT2 1.8B sudah menarik pada bulan Mei sebagai penerjemah Apache-2.0 seukuran ponsel; daftar API terkelola pada 20 Agustus menjadikannya kandidat bagi tim yang ingin mengevaluasinya tanpa perlu menyiapkan infrastruktur. Angka kualitasnya dilaporkan oleh vendor, set bahasanya sengaja dibuat mainstream daripada maksimal, dan jejak on-device-nya adalah hal yang benar-benar membedakannya. Jika pasangan bahasa Anda termasuk dalam 33 bahasa tersebut, kini lebih murah dari sebelumnya untuk mengetahui apakah klaim tersebut berlaku untuk konten Anda.
