
North Small Translate 1.0 vs Hy-MT2: Dua Penerjemah MoE, Satu Kesenjangan Bukti
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 juta token
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Kedua keluarga ini dibangun di atas pertaruhan yang sama — bahwa jaringan sparse mixture-of-experts yang dilatih lanjut untuk penerjemahan mengalahkan model serbaguna yang diminta menerjemahkan — dan keduanya sampai pada pertaruhan itu dari arah yang berlawanan. Hy-MT2, keluarga penerjemahan tiga model milik Tencent Hunyuan yang diunggulkan oleh Hy-MT2-30B-A3B MoE, dirilis sebagai open source pada 21 Mei 2026 di bawah Apache 2.0 dengan laporan teknis, benchmark sumber terbuka, dan tabel perbandingan lengkap. North Small Translate 1.0, penerjemah MoE milik Cohere dengan 218 miliar parameter dan 25 miliar parameter aktif, didokumentasikan dalam catatan rilis tertanggal 9 September 2026, dan bukti kualitasnya hanya berupa satu angka tanpa metrik apa pun yang dilampirkan padanya. Arsitekturnya seirama. Dokumentasinya tidak, dan perbedaan itulah hal paling berguna untuk dipahami sebelum memilih salah satunya.
Satu keluarga, tiga ukuran versus satu model besar
Hy-MT2 bukanlah satu model tunggal melainkan sebuah rangkaian: model dense 1,8B untuk pekerjaan di perangkat, model dense 7B untuk satu GPU, dan 30B-A3B MoE sebagai andalan dengan tiga miliar parameter aktif per token. Ketiganya berlisensi Apache 2.0, tanpa pembatasan akses, dan dirilis bersama dengan kuantisasi FP8, GGUF, 2-bit, dan 1,25-bit, serta tolok ukur pengikutan instruksi IFMTBench dan makalah pendamping. Tencent melaporkan bahwa keluarga ini menerjemahkan di antara 33 bahasa ditambah lima bahasa minoritas dan dialek.
North Small Translate 1.0 adalah satu titik dalam ruang ukuran, dan titik yang besar: 218B parameter total, 25B aktif, 128 pakar dengan delapan diaktifkan per token plus pakar bersama, dan atensi yang bergantian dengan rasio 3:1 antara lapisan jendela geser (jendela 4.096, RoPE) dan lapisan global yang tidak membawa embedding posisional. Jendelanya 16K masuk dan 16K keluar untuk bahasa Inggris plus 49 bahasa lain, dengan Arab Standar Modern, Jerman, Prancis, Jepang, Korea, Rusia, dan Ukraina ditetapkan sebagai tier satu. Yang perlu dicatat, bentuknya bukan hal baru — Command A+ dari Cohere pada Mei 2026 menggunakan konfigurasi 218B/25B yang sama — sehingga ini menjadikannya pasca-pelatihan yang dikhususkan untuk penerjemahan dari inti yang sudah ada, bukan arsitektur baru.
• Parameter — North Small Translate 1.0: 218B total / 25B aktif vs Hy-MT2-30B-A3B: 30B total / 3B aktif, dengan versi dense 1.8B dan 7B
• Konteks — 16K input dan 16K output vs jendela kerja 8K, konfigurasi menyebutkan hingga 262.144 posisi
• Bahasa — 50 (Inggris + 49) vs 33 ditambah 5 bahasa minoritas dan dialek
• Lisensi — CC BY-NC 4.0, komersial melalui Model Vault vs Apache 2.0, tanpa pembatasan
• Bukti yang dipublikasikan — satu angka WMT26 tanpa nama, yang dilaporkan vendor vs laporan teknis, tolok ukur terbuka, dan hasil yang disebutkan namanya pada FLORES-200, WMT25 GEMBA dan XCOMET-XXL
• Penyajian — vLLM dengan cohere_melody>=0.9.0, decoding greedy direkomendasikan dibandingkan transformers, vLLM, SGLang, dan llama.cpp
• Diumumkan — 9 September 2026 (bobot dibatasi di Hugging Face sejak 14 Agustus) vs 21 Mei 2026

Kesenjangan bukti adalah inti persoalannya
Rilis Tencent disertai bukti. Ada makalah di arXiv, sebuah benchmark yang ditulis dan dirilis sebagai sumber terbuka oleh perusahaan khusus untuk mengukur kepatuhan terhadap instruksi penerjemahan, serta tabel hasil yang menyebutkan para pesaingnya. FLORES-200 English-to-X menempatkan 30B-A3B pada 93,85 berbanding Gemini 3.1 Pro pada 94,42 dan GPT-5.5 pada 94,16. Metrik GEMBA era WMT25 menempatkannya pada 84,34 — skor tertinggi dalam perbandingan Tencent sendiri, di atas GPT-5.5 pada 83,41 dan 83,29 dalam dua modenya, Gemini 3.1 Pro pada 82,23, DeepSeek-V4-Pro pada 81,99, dan Kimi K2.6 pada 81,68. XCOMET-XXL menempatkannya pada 62,89, di belakang varian 7B-nya sendiri. Pada IFMTBench, model ini mencapai 85,7% kepatuhan instruksi secara keseluruhan, dengan subskor 91,94% yang hanya berselisih seperseratus poin dari Gemini 3.1 Pro dan subskor terpisah, 85,55%, yang membuatnya unggul mutlak atas model Gemini 3.1 Pro.
Semua itu adalah pengukuran Tencent sendiri dan tidak ada satu pun yang telah direproduksi secara independen. Tetapi semuanya diberi nama, dapat dibandingkan, dan dapat difalsifikasi — pembaca tahu persis uji mana yang harus dijalankan untuk berargumen.
Catatan rilis Cohere menawarkan satu angka: WMT26 83.60, naik menjadi 84.36 dalam apa yang disebutnya sebagai alur kerja penerjemahan multi-pass agentik. Tidak ada metrik yang disebutkan di mana pun pada kartu model atau di dokumentasi. Tidak ada halaman hasil WMT26 yang diterbitkan untuk model ini. Korpus pelatihan, jumlah token, dan pipeline data tidak diungkapkan, padahal laporan teknis Command A Translate 2025 telah menguraikan teknik penyaringan tingkat kesulitan secara terperinci. Semua itu bukan bukti model yang lebih buruk. Itu adalah bukti yang lebih sedikit, yang merupakan hal berbeda dan sama pentingnya ketika Anda memutuskan apa yang akan diterapkan di produksi.
Tolok ukur bersama yang sebenarnya belum diterbitkan oleh kedua belah pihak
Ada satu titik singgung yang sesungguhnya antara keduanya, dan itu layak mendapat satu paragraf karena hanya di sanalah perbandingan yang adil dapat terjadi. Tencent adalah mitra WMT26, yang mensponsori tugas penerjemahan subtitle video dengan hadiah yang didanai Hunyuan. Satu-satunya angka yang dipublikasikan Cohere adalah angka WMT26. Jadi kedua organisasi berada di dalam siklus evaluasi 2026 yang sama, dan satu-satunya metrik yang bisa dijadikan dasar adu langsung justru adalah metrik yang hanya salah satu dari mereka yang mempublikasikan apa pun — dan mempublikasikannya tanpa menyebutkan metrik tersebut.
Itulah celah yang perlu dicermati. Jika Cohere melampirkan nama metrik pada 83,60, atau jika halaman hasil WMT26 menyertakan sistem North Small Translate, perbandingannya menjadi nyata. Sampai saat itu, menumpuk angka FLORES-200 dan GEMBA milik Tencent dengan angka WMT26 Cohere yang tidak berlabel akan menjadi fabrikasi yang dibalut sebagai analisis.

Lisensi dan penerapan
Hy-MT2 berlisensi Apache 2.0 tanpa pembatasan: penggunaan komersial, fine-tuning, turunan, dan redistribusi, semuanya tanpa perlu percakapan. North Small Translate 1.0 berlisensi CC BY-NC 4.0, gratis untuk penggunaan non-komersial, dengan penerapan komersial dialihkan melalui Model Vault milik Cohere dengan harga yang tidak dipublikasikan. Untuk apa pun yang dikirimkan ke pelanggan, perbedaan itu menentukan keputusan sebelum tolok ukur dibaca.
Kisah perangkat kerasnya mengikuti pola yang sama secara terbalik. Hy-MT2 mencakup build terkuantisasi 440MB yang berjalan di ponsel hingga 30B-A3B, yang tiga miliar parameter aktifnya menjaga komputasi per token tetap moderat untuk kelas kualitasnya; runtime mencakup transformers, vLLM, SGLang, dan llama.cpp. North Small Translate 1.0 menerbitkan kebutuhan perangkat keras minimum per checkpoint — empat B200 atau delapan H100 untuk BF16, dua B200 atau empat H100 untuk FP8, satu B200 atau dua H100 untuk NVFP4 W4A16 — dan merekomendasikan greedy decoding agar selaras dengan produksi. Keunggulan penyeimbang Cohere adalah model tersebut berjalan di tier gratis Chat V2 API-nya, gratis untuk kunci uji coba dan produksi hingga batas laju tercapai, sehingga mengevaluasinya tidak memakan biaya.
Haruskah Anda beralih, dan beralih ke apa?
Pertanyaan tentang peralihan ini benar-benar asimetris di sini. Berpindah dari Hy-MT2 ke North Small Translate 1.0 bukanlah peningkatan performa yang saat ini bisa Anda justifikasi — ini adalah taruhan pada model yang satu-satunya klaim publiknya adalah satu angka, dipertukarkan dengan keluarga model yang memiliki laporan yang diterbitkan dan lisensi yang dapat digunakan. Yang layak dilakukan adalah mengevaluasi: model Cohere gratis untuk dipanggil, mencakup lima puluh bahasa termasuk kumpulan bahasa Eropa yang lebih luas, dan memberi Anda keluaran 16K per proses, yang tidak dimiliki jendela kerja 8K milik Hy-MT2.
Evaluasi itu adalah kasus di mana lapisan perutean membuktikan nilainya, karena jawaban jujur untuk sebagian besar tumpukan multibahasa adalah kedua model tetap dipertahankan. OrcaRouter menempatkan katalog lebih dari 200 model di balik satu kunci, jadi mencoba model terjemahan kedua adalah perubahan konfigurasi dan bukan kontrak vendor kedua atau perubahan kode — Anda mengarahkan klien yang kompatibel dengan OpenAI yang sama ke id model yang berbeda dan membandingkan pada teks Anda sendiri. Harga daftar penyedia diteruskan dengan markup 0%, jadi perubahan harga yang dihosting langsung berlaku di sisi kami pada hari yang sama tanpa spread tambahan di atasnya, dan rantai failover menjaga produksi tetap pada model yang sudah berfungsi sementara model baru sedang dinilai. Baik North Small Translate 1.0 maupun Hy-MT2 tidak ada dalam katalog kami saat ini, jadi ini bukan rekomendasi untuk membeli keduanya dari kami — ini adalah argumen untuk tidak melakukan hard-code pada keputusan sebelum Anda menjalankan pengujian.

Putusan
Hy-MT2 dari Tencent adalah pilihan yang lebih aman, dan berdasarkan buktinya tidak ada yang mendekati: Apache 2.0, tiga ukuran, sebuah makalah, tolok ukur terbuka, empat rangkaian evaluasi yang disebutkan namanya, dan kemitraan WMT26. North Small Translate 1.0 dari Cohere adalah yang lebih menarik — 218 miliar parameter MoE khusus terjemahan dengan jendela keluaran 16K dan lima puluh bahasa, tingkat evaluasi gratis, dan skor 83,60 yang belum diperiksa siapa pun di luar Cohere.
Jika Anda butuh keputusan kuartal ini, pilih keluarga yang punya bukti. Jika Anda punya korpus dan waktu seminggu, jalankan sebagiannya lewat tier gratis dan cari tahu apakah 83.60 tanpa nama milik Cohere berarti sesuatu pada dokumen Anda — karena itu pertanyaan yang tidak akan dijawab oleh tabel vendor mana pun untuk Anda, dan satu angka yang dipilih Cohere untuk diterbitkan justru tepat angka yang tidak diberinya nama.
