Kartu judul hero untuk 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B' dengan subjudul 'Pilihan Kualitas Sisi Server atau Penerjemah 440MB di Setiap Ponsel', menampilkan ikon server dan ikon ponsel pintar dengan timbangan di antara keduanya, chip 440MB, dan dua label nama model, dengan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: Pilihan Berkualitas Sisi Server atau Penerjemah 440MB di Setiap Ponsel

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tencent Hy-MT2-7B dan Tencent Hy-MT2-1.8B adalah dua ujung dari keluarga yang sama, sama-sama dirilis sebagai sumber terbuka pada 21 Mei 2026, dan keduanya dapat diakses melalui API yang dihosting minggu ini — 7B sekitar 19 Agustus dan 1.8B sehari kemudian, masing-masing dilayani oleh Tencent Cloud. Keduanya bukan pesaing dalam arti biasa, karena tujuan penggunaannya hampir tidak tumpang tindih. 7B adalah pilihan untuk kualitas: model padat yang berjalan pada satu GPU atau melalui API dengan biaya $0,074 per juta token input dan $0,295 per juta token output. 1.8B adalah pilihan untuk perangkat: model yang dikuantisasi hingga 440 megabyte, berjalan di ponsel secara sepenuhnya luring, dengan biaya $0,044 / $0,177 per juta token pada tier API. Jika Anda harus memilih di antara keduanya, jawabannya sebagian besar ditentukan oleh tempat terjemahan harus terjadi — dan hanya sebagai pertimbangan kedua oleh tolok ukur, yang perbedaannya jauh lebih kecil daripada yang tersirat dari kesenjangan parameter empat kali lipat.

Jawaban satu baris

Pilih 7B ketika penerjemahan terjadi di pusat data dan Anda menginginkan kualitas terbaik per dolar server — di API atau di GPU kelas A100 tunggal. Pilih 1.8B ketika penerjemahan harus terjadi di perangkat, luring, atau dengan biaya serendah mungkin per token. Jika keduanya berada di cloud yang sama dan anggaran bukan faktor penentu, 7B menang dalam hal kualitas. Jika konten bersifat rahasia, diatur, atau perlu bekerja tanpa jaringan, 1.8B adalah satu-satunya dari keduanya yang bisa.

Spesifikasi, Berdampingan

Parameter — 7B dense vs 1.8B dense.

Jejak kuantisasi — FP8 dan GGUF turun hingga beberapa GB dibanding 440MB melalui kuantisasi AngelSlim 1.25-bit.

FLORES-200 (XX⇔XX) — 86.89 berbanding 79.77 XCOMET-XXL, kira-kira 97.9% berbanding 89.9% dari Gemini 3.1 Pro (Think), dilaporkan vendor.

WMT25 — 7B: 63.86/71.21/82.24; 1.8B mengungguli API komersial Microsoft dan Doubao pada ketiga metrik.

DomainMTBench (GEMBA) — 92,79 vs 91,08, dilaporkan vendor.

Harga API — $0.074 / $0.295 vs $0.044 / $0.177 per 1 juta token (masukan/keluaran).

Konteks — keduanya 8.192 token.

Penerapan — satu A100 / RTX 4090 atau API cloud vs chip on-device Apple, Qualcomm, dan MediaTek, offline.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B — the scoreboard'. Left column Hy-MT2-7B: Params 7B dense; FLORES-200 86.89; DomainMTBench GEMBA 92.79; API price $0.074 / $0.295; Deployment GPU or API; Best for quality in the cloud. Right column Hy-MT2-1.8B: Params 1.8B dense; FLORES-200 79.77; DomainMTBench GEMBA 91.08; API price $0.044 / $0.177; Deployment 440MB on-device; Best for offline and edge. Footer: Figures vendor-reported, unreproduced.

Kesenjangan kualitas memang nyata, tetapi lebih sempit daripada kesenjangan ukuran.

Semua hal berikut adalah evaluasi Tencent sendiri yang belum direproduksi. Pada FLORES-200, 7B unggul delapan poin XCOMET di atas 1.8B (86,89 berbanding 79,77), yang merupakan celah yang mendasari positioning "balanced" versus "on-device". Namun pada DomainMTBench — tolok ukur terjemahan domain yang mencakup keuangan, politik, dan pendidikan — 1.8B berada dalam jarak 1,7 poin GEMBA dari 7B (91,08 hingga 92,79). Dan posisi 1.8B terhadap dunia yang lebih luas adalah detail yang terus mengejutkan banyak orang: Tencent melaporkan bahwa model ini mengungguli API terjemahan komersial Microsoft dan Doubao pada ketiga metrik WMT25, serta mengungguli Tower-Plus-72B, sebuah model yang ukurannya empat puluh kali lebih besar. Jadi pada teks domain biasa, model kecil itu jauh lebih dekat dengan saudara besarnya daripada yang disiratkan oleh perbedaan parameter empat kali lipat. Keunggulan sebenarnya dari 7B tampak pada ekor terjemahan umum dan pada instruksi sulit, di mana keunggulan FLORES-nya dan skor tugas kompleks IFMTBench yang lebih tinggi menciptakan jarak yang jelas antara keduanya.

Fork penerapan

7B memerlukan infrastruktur — baik API cloud atau satu GPU kelas A100, dengan operasi-operasi biasa yang melekat. 1.8B, pada 440MB dengan kuantisasi 1,25-bit AngelSlim, berjalan di chip yang sama seperti aplikasi ponsel biasa, 1,5× lebih cepat daripada generasi Hy-MT1.5 sebelumnya, dan tidak memerlukan jaringan sama sekali. Itu mengubah privasi dari fitur menjadi bawaan: untuk kontrak, catatan medis, atau apa pun yang diatur, data tidak pernah meninggalkan perangkat, yang merupakan properti yang tidak dapat dibeli oleh harga per-token di sisi server. Tawar-menawarnya terlihat pada terjemahan umum bergaya FLORES, di mana kapasitas ekstra 7B terlihat — dan pada instruksi apa pun yang cukup kompleks untuk mendorong total 83,14 IFMTBench 1.8B melawan batas yang lebih tinggi dari 7B.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured August 23 2026) showing the model name and the on-device positioning with 33-language support and the 440MB AngelSlim quantization claim.

Perhitungan biaya

Pada tingkat API, kedua model sama-sama murah; 1.8B lebih murah. Dengan $0,044 / $0,177 versus $0,074 / $0,295 per juta, model kecil berjalan sekitar 40% di bawah 7B pada kedua sisi tagihan — dengan satu juta token output per hari yang stabil, kira-kira $70 per hari versus $118. Di perangkat, 1.8B tidak memakan biaya per token, yang merupakan angka yang mendominasi perbandingan server mana pun dalam volume besar. Argumen tandingan 7B bukan soal harga, melainkan ruang gerak (headroom): jika korpus Anda condong ke teknis, hukum, atau banyak instruksi, margin kualitas 7B justru hal yang terlihat sebagai lebih sedikit penerjemahan ulang — dan penerjemahan ulang adalah biaya satuan yang sebenarnya dalam MT profesional.

A generated infographic titled 'The deployment fork' with two branches: a cloud-server card labelled 'Hy-MT2-7B — server: one GPU or the API, $0.074 / $0.295' and a smartphone card labelled 'Hy-MT2-1.8B — on-device: 440MB, offline, free per token', with the footer 'Same family, released May 21 2026; both now API-callable.'

Merute dua ukuran tersebut

Pada saat tulisan ini dibuat, tidak ada satu pun model yang tercantum dalam katalog OrcaRouter, jadi penggambaran yang jujur adalah bahwa keduanya disajikan melalui cloud milik Tencent sendiri dan beberapa platform pihak ketiga. Perbandingan ini tetap memberikan pelajaran routing yang menjadi dasar blog ini: ketika dua model tumpang tindih dalam kapabilitas tetapi berbeda dalam harga dan latensi, penerapan yang rasional bukan "pilih satu" melainkan "rute berdasarkan beban kerja" — bagian bervolume tinggi dan berkesulitan rendah ke model kecil yang murah, bagian sulit ke model berkualitas, dengan failover otomatis sehingga gangguan pada salah satu model tidak pernah menghentikan pipeline. Justru pola inilah yang disusun DSL routing OrcaRouter di antara 200+ model yang kami sediakan, dengan harga daftar setiap penyedia diteruskan dengan markup 0%. Jika keluarga model penerjemahan Tencent bergabung ke katalog, ia adalah penghuni alami berikutnya.

Putusan

Jika penerjemahan terjadi di pusat data Anda, gunakan Tencent Hy-MT2-7B — melalui API jika Anda menginginkan nol operasi, pada satu GPU jika Anda ingin memilikinya sendiri — dan berhentilah membaca. Jika penerjemahan harus terjadi di perangkat, secara luring, atau di bawah persyaratan kerahasiaan, gunakan Tencent Hy-MT2-1.8B dan ukuran 440MB-nya sudah pasti menang. Satu-satunya kasus yang benar-benar sulit adalah beban kerja cloud bervolume menengah di mana kualitas 7B dan harga 1.8B sama-sama dapat dibenarkan. Dalam kasus tersebut, jangan memutuskan berdasarkan tolok ukur vendor: selisih GEMBA yang dilaporkan berada di bawah dua poin, jadi jalankan keduanya pada teks domain Anda sendiri dan biarkan data Anda yang memilih.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube