
North Small Translate 1.0 vs Hy-MT2-7B: Satu GPU Melawan Dua B200
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 juta token
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Pertarungan paling ketat dalam penerjemahan terbuka saat ini mungkin juga yang paling tidak kentara. Hy-MT2-7B adalah anak tengah dari keluarga penerjemahan Tencent Hunyuan, dirilis sebagai sumber terbuka di bawah Apache 2.0 pada 21 Mei 2026, dan berjalan di satu RTX 4090 atau A100 dengan sekitar 16GB VRAM. North Small Translate 1.0 adalah penerjemah sparse mixture-of-experts milik Cohere dengan 218 miliar parameter, didokumentasikan dalam catatan rilis perusahaan pada 9 September 2026, dengan deployment minimum dua B200 pada FP8 atau satu B200 dalam bentuk NVFP4 W4A16. Keduanya adalah spesialis penerjemahan. Keduanya terkini. Salah satunya dapat Anda jalankan dari sebuah workstation, dan fakta tunggal itu membingkai ulang seluruh perbandingan — karena tolok ukur tempat keduanya paling ingin dinilai secara setara tidak ada.
Mulailah dari amplopnya, bukan skornya.
Biaya deployment adalah dimensi yang menentukan sebagian besar integrasi nyata, dan di sini kedua model tersebut jauh berbeda. Hy-MT2-7B adalah model dense HunYuanDenseV1 dengan sekitar delapan miliar parameter dengan build FP8 dan GGUF yang dipublikasikan, plus versi MLX 8-bit dari komunitas untuk Apple silicon. Catatan deployment Tencent mencantumkan transformers 5.6.0 atau lebih baru, vLLM, SGLang, dan llama.cpp sebagai runtime yang didukung, dan panduan inferensinya membatasi generasi pada 8.192 token meskipun konfigurasinya mengiklankan hingga 262.144 posisi. Satu GPU konsumen atau workstation modern saja sudah cukup untuk menjalankannya.
North Small Translate 1.0 adalah kelas objek yang berbeda. Total 218B parameternya dengan 25B aktif terbagi di antara 128 pakar dengan delapan aktif per token ditambah pakar bersama, dan Cohere menerbitkan perangkat keras minimum untuk masing-masing dari tiga checkpoint-nya: empat B200 atau delapan H100 untuk BF16, dua B200 atau empat H100 untuk FP8, satu B200 atau dua H100 untuk build NVFP4 W4A16. Serving dijalankan melalui vLLM dengan cohere_melody>=0.9.0, dan Cohere merekomendasikan dekode greedy agar sesuai dengan produksi. Output membawa <|START_TEXT|> dan <|END_TEXT|> penanda yang tidak terdaftar sebagai token khusus.
• Shape — North Small Translate 1.0: total 218B / 25B aktif sparse MoE, 128 pakar vs Hy-MT2-7B: padat, sekitar 8B
• Konteks — 16K input dan 16K output vs jendela kerja 8K, konfigurasi menyebutkan hingga 262.144 posisi
• Perangkat keras minimum — 1×B200 pada W4A16, 2×B200 atau 4×H100 pada FP8 vs satu GPU kelas RTX 4090 dalam ~16GB
• Format yang dipublikasikan — BF16, FP8, NVFP4 W4A16 vs base, FP8, GGUF, serta MLX 8-bit dari komunitas
• Bahasa — 50 (Inggris + 49) vs 33 bahasa ditambah 5 bahasa minoritas dan dialek
• Lisensi — CC BY-NC 4.0, komersial melalui Model Vault vs Apache 2.0, tanpa pembatasan
• Kualitas yang dilaporkan — WMT26 83.60, metrik tidak disebutkan, dilaporkan vendor vs tabel vendor yang disebutkan namanya pada FLORES-200, WMT25 GEMBA, XCOMET-XXL dan IFMTBench

Masalah benchmark
Inilah inti jujur dari perbandingan ini: kita tidak dapat memberi peringkat pada kedua model ini satu terhadap yang lain, dan siapa pun yang mengatakan sebaliknya sedang mengarang angka. Tencent menerbitkan empat evaluasi bernama. Pada terjemahan Inggris-ke-X FLORES-200, 7B mencetak 93,52, di belakang 94,42 milik Gemini 3.1 Pro dan 94,16 milik GPT-5.5 tetapi cukup dekat untuk berarti. Pada metrik GEMBA terkait WMT25, ia mencetak 82,24 melawan 84,34 milik 30B-A3B dan 83,41 milik GPT-5.5. Pada XCOMET-XXL, ia mengungguli semuanya di tabel perbandingan Tencent dengan 63,86 — di depan Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro, dan Kimi K2.6. Pada skor kepatuhan terhadap instruksi IFMTBench, ia berada di 83,14%. Semua ini adalah angka Tencent sendiri, tidak ada yang direproduksi secara independen, dan semua itu masih jauh lebih banyak daripada yang ditawarkan Cohere.
Cohere menerbitkan satu angka saja: skor WMT26 sebesar 83,60, yang naik menjadi 84,36 dalam alur kerja multi-pass agentik. Tidak ada metrik yang disebutkan di kartu model atau di catatan rilis, dan tidak ada halaman hasil WMT26 yang dipublikasikan terhadap model ini. Asimetri itu bukan bukti bahwa model Cohere lebih lemah atau lebih kuat. Artinya, perbandingan yang paling diinginkan pembaca — tes yang sama, metrik yang sama, kedua model — tidak dapat dilakukan dari bukti publik, dan rentang empat poin di dalam kedua angka Cohere sendiri (83,60 hingga 84,36) sudah lebih besar daripada sebagian besar selisih dalam tabel Tencent.
Bahasa dan dokumen panjang
North Small Translate 1.0 mencakup lima puluh bahasa dan varian lokal, dengan Arab Standar Modern, Jerman, Prancis, Jepang, Korea, Rusia, dan Ukraina ditetapkan sebagai tier satu, dan model ini menerima serta menghasilkan 16.000 token di kedua sisi. Hy-MT2-7B mencakup tiga puluh tiga bahasa plus lima bahasa minoritas dan dialek termasuk Tibet, Uyghur, dan Kanton. Tidak ada daftar yang merupakan superset dari yang lain — Tencent menjangkau Kanton dan Uyghur, Cohere menjangkau kumpulan lokal Eropa yang lebih luas — jadi deployment multibahasa mungkin mendapati bahwa ia memerlukan keduanya hanya berdasarkan cakupan.
Jendela keluaran adalah perbedaan yang lebih senyap. Enam belas ribu token keluaran berarti dokumen prosedur lengkap dalam sekali proses, dengan terminologi dan register yang konsisten di seluruh dokumen karena model melihat semuanya. Jendela 8K tidak demikian, dan solusi sementara kalimat demi kalimat memunculkan kembali persis masalah konsistensi lintas segmen yang hendak diukur oleh tolok ukur kepatuhan instruksi penerjemahan seperti IFMTBench.

Lisensi, sekali lagi, lebih menentukan daripada tabel.
North Small Translate 1.0 adalah CC BY-NC 4.0. Bobotnya gratis untuk pekerjaan non-komersial, dan penerapan komersial dilakukan melalui Model Vault milik Cohere di bawah lisensi yang dibeli tanpa harga yang dipublikasikan. Hy-MT2-7B adalah Apache 2.0 dan tanpa pembatasan akses — penggunaan komersial, penyetelan halus, dan turunannya semuanya diizinkan tanpa perlu berbicara dengan siapa pun. Untuk produk komersial, urutan tindakannya sudah jelas dengan sendirinya: Hy-MT2-7B dapat diterapkan hari ini dan model Cohere dapat dievaluasi hari ini, dan tidak ada baris benchmark yang mengubah urutan itu.
Keunggulan yang mengimbangi dari Cohere adalah tier gratisnya. North Small Translate 1.0 berjalan di tier gratis Chat V2, gratis untuk kunci uji coba maupun produksi hingga batas laju tercapai, sehingga evaluasi tidak memakan biaya apa pun selain waktu. Hy-MT2-7B memiliki API komersial yang dihosting — Tencent menetapkan harga tier hosted keluarga ini sekitar US$0,044 per juta token input dan US$0,177 per juta token output — dan self-hosting di GPU Anda sendiri adalah jalur yang benar-benar gratis.
Apa yang sebenarnya disiratkan oleh "multi-pass"
Keputusan Cohere untuk menerbitkan baik 83,60 maupun 84,36 adalah detail paling informatif dalam catatan rilisnya, karena hal itu menyiratkan perusahaan percaya bahwa alur kerja mengalahkan satu panggilan. Itu adalah taruhan yang sama yang dibuat Tencent dengan mekanisme berbeda: 30B-A3B unggulannya menang pada GEMBA dan XCOMET sementara Gemini 3.1 Pro menang pada FLORES-200, yang berarti sistem terbaik bukanlah satu model melainkan sebuah panel. Fusi model OrcaRouter menjalankan beberapa model sebagai panel dan merekonsiliasi jawaban mereka dalam satu panggilan, yang merupakan versi tingkat platform dari gagasan multi-pass yang dikejar kedua vendor — dan ini menyatu dengan sisi perutean, tempat satu kunci mencakup katalog lebih dari 200 model pada harga daftar penyedia dengan markup 0%, sehingga perubahan harga vendor sampai ke sisi kami pada hari yang sama alih-alih pada perpanjangan kontrak berikutnya.
Kerangka berpikir itu juga menyelesaikan masalah bukti yang menjadi pembuka artikel ini. Ketika dua vendor menerbitkan tolok ukur yang tidak saling tumpang tindih dan tidak ada satu pun yang memiliki evaluasi independen, cara memilihnya bukanlah dengan memercayai sebuah tabel. Melainkan dengan menjalankan keduanya pada dokumen Anda sendiri dan membiarkan ketidaksepakatan itu muncul pada teks nyata — yang justru menjadi peran panel dan rantai failover.

Yang mana, dan kapan
Jika Anda memerlukan model terjemahan yang berjalan di perangkat keras yang sudah Anda miliki, dalam produk komersial, tanpa perlu membahas lisensi, Hy-MT2-7B menang hanya berkat cakupan penerapannya — dan hasil yang diterbitkan vendor, meskipun belum direproduksi, setidaknya disebutkan namanya, dapat dibandingkan, dan mendekati frontier. Jika Anda menerjemahkan dokumen panjang ke dalam lima puluh bahasa Cohere, memerlukan 16K keluaran yang konsisten per proses, dan memiliki anggaran dua B200 atau kesediaan menjalankan evaluasi pada tier gratis Cohere sebelum memutuskan, North Small Translate 1.0 adalah mesin yang lebih mumpuni pada setiap dimensi yang diungkapkan.
Yang tidak dilakukan kedua model itu adalah menghilangkan kebutuhan untuk menguji. Cohere telah memberi Anda satu angka tanpa nama dan cara gratis untuk memeriksanya. Tencent telah memberi Anda sebuah tabel dan unduhan seukuran GPU. Angka 83,60 adalah janji, bukan hasil — dan satu-satunya tempat janji itu dibuktikan adalah pada korpus Anda sendiri.
