Kartu hero berjudul "North Small Translate 1.0 vs Hy-MT2-7B" dengan subjudul "Satu GPU melawan dua B200", di atas dua kartu: North Small Translate 1.0 (218B MoE / 25B aktif, CC BY-NC 4.0) dan Hy-MT2-7B (8B dense, sekitar 16GB VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-7B: Satu GPU Melawan Dua B200

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pertarungan paling ketat dalam penerjemahan terbuka saat ini mungkin juga yang paling tidak kentara. Hy-MT2-7B adalah anak tengah dari keluarga penerjemahan Tencent Hunyuan, dirilis sebagai sumber terbuka di bawah Apache 2.0 pada 21 Mei 2026, dan berjalan di satu RTX 4090 atau A100 dengan sekitar 16GB VRAM. North Small Translate 1.0 adalah penerjemah sparse mixture-of-experts milik Cohere dengan 218 miliar parameter, didokumentasikan dalam catatan rilis perusahaan pada 9 September 2026, dengan deployment minimum dua B200 pada FP8 atau satu B200 dalam bentuk NVFP4 W4A16. Keduanya adalah spesialis penerjemahan. Keduanya terkini. Salah satunya dapat Anda jalankan dari sebuah workstation, dan fakta tunggal itu membingkai ulang seluruh perbandingan — karena tolok ukur tempat keduanya paling ingin dinilai secara setara tidak ada.

Mulailah dari amplopnya, bukan skornya.

Biaya deployment adalah dimensi yang menentukan sebagian besar integrasi nyata, dan di sini kedua model tersebut jauh berbeda. Hy-MT2-7B adalah model dense HunYuanDenseV1 dengan sekitar delapan miliar parameter dengan build FP8 dan GGUF yang dipublikasikan, plus versi MLX 8-bit dari komunitas untuk Apple silicon. Catatan deployment Tencent mencantumkan transformers 5.6.0 atau lebih baru, vLLM, SGLang, dan llama.cpp sebagai runtime yang didukung, dan panduan inferensinya membatasi generasi pada 8.192 token meskipun konfigurasinya mengiklankan hingga 262.144 posisi. Satu GPU konsumen atau workstation modern saja sudah cukup untuk menjalankannya.

North Small Translate 1.0 adalah kelas objek yang berbeda. Total 218B parameternya dengan 25B aktif terbagi di antara 128 pakar dengan delapan aktif per token ditambah pakar bersama, dan Cohere menerbitkan perangkat keras minimum untuk masing-masing dari tiga checkpoint-nya: empat B200 atau delapan H100 untuk BF16, dua B200 atau empat H100 untuk FP8, satu B200 atau dua H100 untuk build NVFP4 W4A16. Serving dijalankan melalui vLLM dengan cohere_melody>=0.9.0, dan Cohere merekomendasikan dekode greedy agar sesuai dengan produksi. Output membawa <|START_TEXT|> dan <|END_TEXT|> penanda yang tidak terdaftar sebagai token khusus.

Shape — North Small Translate 1.0: total 218B / 25B aktif sparse MoE, 128 pakar vs Hy-MT2-7B: padat, sekitar 8B

Konteks — 16K input dan 16K output vs jendela kerja 8K, konfigurasi menyebutkan hingga 262.144 posisi

Perangkat keras minimum — 1×B200 pada W4A16, 2×B200 atau 4×H100 pada FP8 vs satu GPU kelas RTX 4090 dalam ~16GB

Format yang dipublikasikan — BF16, FP8, NVFP4 W4A16 vs base, FP8, GGUF, serta MLX 8-bit dari komunitas

Bahasa — 50 (Inggris + 49) vs 33 bahasa ditambah 5 bahasa minoritas dan dialek

Lisensi — CC BY-NC 4.0, komersial melalui Model Vault vs Apache 2.0, tanpa pembatasan

Kualitas yang dilaporkan — WMT26 83.60, metrik tidak disebutkan, dilaporkan vendor vs tabel vendor yang disebutkan namanya pada FLORES-200, WMT25 GEMBA, XCOMET-XXL dan IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

Masalah benchmark

Inilah inti jujur dari perbandingan ini: kita tidak dapat memberi peringkat pada kedua model ini satu terhadap yang lain, dan siapa pun yang mengatakan sebaliknya sedang mengarang angka. Tencent menerbitkan empat evaluasi bernama. Pada terjemahan Inggris-ke-X FLORES-200, 7B mencetak 93,52, di belakang 94,42 milik Gemini 3.1 Pro dan 94,16 milik GPT-5.5 tetapi cukup dekat untuk berarti. Pada metrik GEMBA terkait WMT25, ia mencetak 82,24 melawan 84,34 milik 30B-A3B dan 83,41 milik GPT-5.5. Pada XCOMET-XXL, ia mengungguli semuanya di tabel perbandingan Tencent dengan 63,86 — di depan Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro, dan Kimi K2.6. Pada skor kepatuhan terhadap instruksi IFMTBench, ia berada di 83,14%. Semua ini adalah angka Tencent sendiri, tidak ada yang direproduksi secara independen, dan semua itu masih jauh lebih banyak daripada yang ditawarkan Cohere.

Cohere menerbitkan satu angka saja: skor WMT26 sebesar 83,60, yang naik menjadi 84,36 dalam alur kerja multi-pass agentik. Tidak ada metrik yang disebutkan di kartu model atau di catatan rilis, dan tidak ada halaman hasil WMT26 yang dipublikasikan terhadap model ini. Asimetri itu bukan bukti bahwa model Cohere lebih lemah atau lebih kuat. Artinya, perbandingan yang paling diinginkan pembaca — tes yang sama, metrik yang sama, kedua model — tidak dapat dilakukan dari bukti publik, dan rentang empat poin di dalam kedua angka Cohere sendiri (83,60 hingga 84,36) sudah lebih besar daripada sebagian besar selisih dalam tabel Tencent.

Bahasa dan dokumen panjang

North Small Translate 1.0 mencakup lima puluh bahasa dan varian lokal, dengan Arab Standar Modern, Jerman, Prancis, Jepang, Korea, Rusia, dan Ukraina ditetapkan sebagai tier satu, dan model ini menerima serta menghasilkan 16.000 token di kedua sisi. Hy-MT2-7B mencakup tiga puluh tiga bahasa plus lima bahasa minoritas dan dialek termasuk Tibet, Uyghur, dan Kanton. Tidak ada daftar yang merupakan superset dari yang lain — Tencent menjangkau Kanton dan Uyghur, Cohere menjangkau kumpulan lokal Eropa yang lebih luas — jadi deployment multibahasa mungkin mendapati bahwa ia memerlukan keduanya hanya berdasarkan cakupan.

Jendela keluaran adalah perbedaan yang lebih senyap. Enam belas ribu token keluaran berarti dokumen prosedur lengkap dalam sekali proses, dengan terminologi dan register yang konsisten di seluruh dokumen karena model melihat semuanya. Jendela 8K tidak demikian, dan solusi sementara kalimat demi kalimat memunculkan kembali persis masalah konsistensi lintas segmen yang hendak diukur oleh tolok ukur kepatuhan instruksi penerjemahan seperti IFMTBench.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Lisensi, sekali lagi, lebih menentukan daripada tabel.

North Small Translate 1.0 adalah CC BY-NC 4.0. Bobotnya gratis untuk pekerjaan non-komersial, dan penerapan komersial dilakukan melalui Model Vault milik Cohere di bawah lisensi yang dibeli tanpa harga yang dipublikasikan. Hy-MT2-7B adalah Apache 2.0 dan tanpa pembatasan akses — penggunaan komersial, penyetelan halus, dan turunannya semuanya diizinkan tanpa perlu berbicara dengan siapa pun. Untuk produk komersial, urutan tindakannya sudah jelas dengan sendirinya: Hy-MT2-7B dapat diterapkan hari ini dan model Cohere dapat dievaluasi hari ini, dan tidak ada baris benchmark yang mengubah urutan itu.

Keunggulan yang mengimbangi dari Cohere adalah tier gratisnya. North Small Translate 1.0 berjalan di tier gratis Chat V2, gratis untuk kunci uji coba maupun produksi hingga batas laju tercapai, sehingga evaluasi tidak memakan biaya apa pun selain waktu. Hy-MT2-7B memiliki API komersial yang dihosting — Tencent menetapkan harga tier hosted keluarga ini sekitar US$0,044 per juta token input dan US$0,177 per juta token output — dan self-hosting di GPU Anda sendiri adalah jalur yang benar-benar gratis.

Apa yang sebenarnya disiratkan oleh "multi-pass"

Keputusan Cohere untuk menerbitkan baik 83,60 maupun 84,36 adalah detail paling informatif dalam catatan rilisnya, karena hal itu menyiratkan perusahaan percaya bahwa alur kerja mengalahkan satu panggilan. Itu adalah taruhan yang sama yang dibuat Tencent dengan mekanisme berbeda: 30B-A3B unggulannya menang pada GEMBA dan XCOMET sementara Gemini 3.1 Pro menang pada FLORES-200, yang berarti sistem terbaik bukanlah satu model melainkan sebuah panel. Fusi model OrcaRouter menjalankan beberapa model sebagai panel dan merekonsiliasi jawaban mereka dalam satu panggilan, yang merupakan versi tingkat platform dari gagasan multi-pass yang dikejar kedua vendor — dan ini menyatu dengan sisi perutean, tempat satu kunci mencakup katalog lebih dari 200 model pada harga daftar penyedia dengan markup 0%, sehingga perubahan harga vendor sampai ke sisi kami pada hari yang sama alih-alih pada perpanjangan kontrak berikutnya.

Kerangka berpikir itu juga menyelesaikan masalah bukti yang menjadi pembuka artikel ini. Ketika dua vendor menerbitkan tolok ukur yang tidak saling tumpang tindih dan tidak ada satu pun yang memiliki evaluasi independen, cara memilihnya bukanlah dengan memercayai sebuah tabel. Melainkan dengan menjalankan keduanya pada dokumen Anda sendiri dan membiarkan ketidaksepakatan itu muncul pada teks nyata — yang justru menjadi peran panel dan rantai failover.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Yang mana, dan kapan

Jika Anda memerlukan model terjemahan yang berjalan di perangkat keras yang sudah Anda miliki, dalam produk komersial, tanpa perlu membahas lisensi, Hy-MT2-7B menang hanya berkat cakupan penerapannya — dan hasil yang diterbitkan vendor, meskipun belum direproduksi, setidaknya disebutkan namanya, dapat dibandingkan, dan mendekati frontier. Jika Anda menerjemahkan dokumen panjang ke dalam lima puluh bahasa Cohere, memerlukan 16K keluaran yang konsisten per proses, dan memiliki anggaran dua B200 atau kesediaan menjalankan evaluasi pada tier gratis Cohere sebelum memutuskan, North Small Translate 1.0 adalah mesin yang lebih mumpuni pada setiap dimensi yang diungkapkan.

Yang tidak dilakukan kedua model itu adalah menghilangkan kebutuhan untuk menguji. Cohere telah memberi Anda satu angka tanpa nama dan cara gratis untuk memeriksanya. Tencent telah memberi Anda sebuah tabel dan unduhan seukuran GPU. Angka 83,60 adalah janji, bukan hasil — dan satu-satunya tempat janji itu dibuktikan adalah pada korpus Anda sendiri.