
Tencent Hy-MT2-7B Kini Punya API yang Dihosting: Apa yang Berubah dengan Penerjemah $0,295 per Juta Output
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
Tencent Hy-MT2-7B, model penerjemahan open-source yang dirilis Tencent Hunyuan pada 21 Mei 2026, mulai dapat dipanggil melalui API yang di-host minggu ini: sekitar 19 Agustus 2026, model dense 7B tersebut diluncurkan di endpoint Tencent Cloud yang di-host dengan harga $0,074 per juta token masukan dan $0,295 per juta token keluaran, dengan jendela konteks 8.192 token. Model ini tidak datang sendirian — Tencent Hy-MT2-1.8B dan Tencent Hy-MT2-30B-A3B muncul di backend yang sama dalam satu hari. Bobot modelnya telah tersedia di Hugging Face dan ModelScope selama tiga bulan; yang baru adalah bahwa sebuah tim kini dapat memanggilnya tanpa menyewa GPU, membangun llama.cpp dari kode sumber, atau mengirimkan toolchain 1,25-bit on-device. Untuk beban kerja penerjemahan, itulah perbedaan antara sebuah eksperimen dan keputusan produk.
Apa yang baru saja dirilis
Titik akhir komersial adalah milik Tencent Cloud sendiri, diekspos melalui API vendor dan beberapa platform pihak ketiga. Ketiga ukuran masing-masing berjalan dalam konteks 8K dengan penyelesaian 4.096 token; ketiganya menerima keluaran terstruktur melalui skema JSON di bidang response_format mereka, dan tidak ada yang menerapkan pemanggilan fungsi. Spesifikasi praktisnya, dalam satu baris per dimensi:
• Tencent Hy-MT2-7B — $0,074 input / $0,295 output per 1 juta token, konteks 8.192, dense ~7B, mendukung output terstruktur, tanpa panggilan alat.
• Tencent Hy-MT2-1.8B — $0,044 masuk / $0,177 keluar per 1 juta token, konteks 8.192, padat 1,8B, tanpa pemanggilan alat.
• Tencent Hy-MT2-30B-A3B — $0.074 input / $0.295 output per 1 juta token, konteks 8,192, MoE 30B total / 3B aktif, mendukung output terstruktur, tanpa panggilan alat.
Titik harga utamanya adalah tingkat output 7B: di bawah tiga per sepuluh sen per seribu token output, untuk model yang menurut Tencent mampu bersaing dengan model yang satu orde magnitudo lebih besar. Terjemahan adalah salah satu dari sedikit beban kerja LLM di mana token output hampir mencakup seluruh tagihan, sehingga harga output menjadi angka yang menentukan apakah sebuah pipeline layak secara volume.

Model di balik endpoint
Hy-MT2 adalah keluarga "berpikir cepat" dari Tencent: alih-alih menghabiskan rangkaian pemikiran yang panjang untuk setiap kalimat, ia dirancang untuk bereaksi seperti cara penerjemah profesional — cermat saat sumbernya ambigu, cepat saat tidak. 7B adalah bagian tengah yang seimbang dari keluarga ini, model padat berlisensi Apache-2.0, yang mencakup 33 bahasa ditambah lima pasang bahasa minoritas dan dialek Tionghoa (di antaranya Tibet, Kazakh, Mongolia, Uyghur, dan Kanton). Yang membedakannya dari LLM generik yang melakukan penerjemahan adalah kepatuhan terhadap instruksi: ia akan mempertahankan istilah glosarium di seluruh dokumen, menerapkan gaya yang ditentukan, membiarkan pembatas dan kunci JSON tetap utuh, serta menerima instruksi personalisasi dalam bahasa sehari-hari. Tencent merilis IFMTBench, sebuah tolok ukur terbuka untuk keterampilan itu, bersama dengan bobot model, dan wajah konsumen — program mini Tencent Hy Translate, dengan aplikasi iOS dan Android yang sedang dalam proses — dibangun di atas keluarga ini.

Angka-angka, dengan tanda bintang yang menyertainya.
Semua hal di bawah ini merupakan evaluasi milik Tencent sendiri, yang diterbitkan di kartu model dan dalam laporan yang menyertainya; tidak ada satu pun yang telah direproduksi secara independen pada saat penulisan ini. Pada jalur terjemahan umum XX⇔XX FLORES-200, model 7B mencetak 86.89 XCOMET-XXL, yang menurut Tencent setara dengan sekitar 97,9% dari Gemini 3.1 Pro (Think). Dalam mode "fast-thinking"-nya, model ini diklaim mengungguli model umum sumber terbuka termasuk DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B, dan Gemma4-26B-A4B. Pada WMT25, skornya meningkat di semua lini dibandingkan generasi sebelumnya — 63.86/71.21/82.24 versus 61.59/68.85/75.91 milik Hy-MT1.5-7B, dengan peningkatan terbesar pada GEMBA — dan pada DomainMTBench (keuangan, politik, pendidikan) ia mencatat 94.92 XCOMET / 92.79 GEMBA. Kemampuannya mengikuti instruksi adalah aspek yang paling terlihat membedakannya dari LM terjemahan setahun lalu: 89.73 sederhana / 72.67 kompleks / 83.14 total pada IFMTBench.
Apa yang diubah oleh API terkelola pada alur penerjemahan
Self-hosting 7B sebenarnya mudah untuk ukuran hal-hal semacam ini — ia berjalan di satu A100 atau RTX 4090, dan build FP8 serta GGUF terkuantisasi sudah tersedia. Tetapi "mudah di-self-host" bukan berarti "nol operasional." Jalur GGUF saat ini bergantung pada llama.cpp dengan kernel STQ milik Tencent, jalur FP8 membutuhkan stack yang tepat, dan harus ada yang menjaganya. Endpoint ter-hosting menghilangkan semua itu: tanpa GPU, tanpa build kernel, tanpa perencanaan kapasitas, dan harga per-token yang tetap berapa pun tingkat utilisasinya. Bagi tim yang memproses jutaan kalimat terjemahan per hari, prediktabilitas itu lebih penting daripada benchmark utama — dan itulah alasan mengapa minggu ini lebih penting daripada peluncuran bulan Mei.

Pertanyaan routing yang belum ditanyakan siapa pun
Karena model ini baru berusia tiga hari di sisi API, cara realistis untuk mengadopsinya adalah cara Anda mengadopsi penyedia baru mana pun: letakkan di belakang aturan routing dengan failover otomatis sehingga endpoint yang belum teruji tidak akan pernah bisa menjatuhkan jalur produksi, dan biarkan volume yang memutuskan apakah ia layak mendapatkan slot permanen. Justru pola itulah yang disusun oleh DSL routing OrcaRouter di lebih dari 200 model yang kami bawa — dan perlu ditegaskan di sini: Tencent Hy-MT2-7B tidak ada dalam katalog OrcaRouter pada saat penulisan ini, jadi ini bukan cerita "memanggilnya melalui kami". Yang relevan adalah model penetapan harga. OrcaRouter meneruskan harga daftar setiap penyedia dengan markup 0%, sehingga ketika vendor memotong tarif, pemotongan tersebut langsung aktif di platform pada hari yang sama. Untuk beban kerja terjemahan bervolume tinggi, pertanyaan yang harus diajukan untuk setiap endpoint bukanlah "berapa harga portal hari ini" melainkan "berapa harga daftar per-token sebenarnya yang dibebankan penyedia, dan adakah sesuatu yang berada di antara itu dan saya." Dengan output $0,295/M, Tencent Hy-MT2-7B baru saja membuat pertanyaan itu menarik.
Tontonan Berikutnya
Tiga hal mengikuti dari pekan ini. Pertama, {{1}}saudara 1.8B dan 30B-A3B kini sama-sama dapat dipanggil{{/1}}, sehingga keputusan "ukuran mana" menjadi pertanyaan API yang nyata, bukan keputusan self-hosting (keluarga ini memiliki halaman perbandingan sendiri, tetapi versi singkatnya: 1.8B untuk on-device dan tingkatan termurah, 30B-A3B untuk domain kelas profesional, 7B di antaranya). Kedua, kemitraan Tencent dengan WMT26 menawarkan penghargaan kepada tim yang menggunakan model Hy-MT dalam tugas General Machine Translation dan Video Subtitle Translation — sebuah sinyal bahwa Tencent bermaksud menjadikan keluarga ini sebagai default terjemahan terbuka dalam MT kompetitif. Ketiga, aplikasi iOS dan Android dengan inferensi on-device, jika dirilis sesuai pengumuman, akan menjadikan 1.8B sebagai model terjemahan terbuka yang paling banyak terpasang di dunia. API yang dihosting adalah bagian yang berubah pekan ini; lintasan keluarga ini telah ditetapkan pada bulan Mei.
