
North Small Translate 1.0 vs Hy-MT2-1.8B: Model 218GB Berbanding 440MB
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 juta token
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Salah satunya muat di ponsel. Hy-MT2-1.8B, model penerjemahan on-device milik Tencent Hunyuan yang di-open-source-kan di bawah Apache 2.0 pada 21 Mei 2026, menyusut menjadi 440 megabita berkat kuantisasi 1,25-bit AngelSlim dan berjalan di silikon ponsel Apple, Qualcomm, dan MediaTek. North Small Translate 1.0, model mixture-of-experts 218 miliar parameter yang didokumentasikan Cohere dalam catatan rilisnya pada 9 September 2026, menyertakan set bobot FP8 sekitar 218 gigabita dan setidaknya menuntut dua B200. Itu sekitar lima ratus kali lipat penyimpanan untuk salah satunya, dan pertanyaan yang menarik bukanlah mana yang lebih baik — melainkan untuk apa masing-masing sebenarnya, dan lisensi mana yang memungkinkan Anda mengirimkannya.
Perbedaan ukuran bukanlah perbedaan kualitas
Ada godaan untuk membaca 218B versus 1.8B sebagai pemeringkatan kemampuan yang lugas. Tidak demikian, karena dua alasan. Pertama, North Small Translate 1.0 adalah model sparse mixture-of-experts dengan hanya 25 miliar parameter yang aktif per token, sehingga komputasi per tokennya berada di liga yang berbeda dari jumlah parameternya. Kedua, kedua model tersebut dioptimalkan terhadap tujuan yang berbeda: 1.8B milik Tencent dibuat agar cukup kecil untuk berjalan offline di ponsel, dan model Cohere dibuat untuk menampung seluruh dokumen dalam konteks dan menerjemahkannya sebagai satu kesatuan.
Perbedaan itu terlihat pada jendela konteks. Konfigurasi Hy-MT2-1.8B mengiklankan hingga 262.144 posisi, tetapi panduan inferensi Tencent sendiri membatasi generasi pada 8.192 token — jendela kerja praktisnya adalah 8K. North Small Translate 1.0 mendokumentasikan 16K masukan dan 16K keluaran, yang merupakan dua kali jendela masukan dan, yang lebih penting, 16K penuh dari keluaran. Jika unit kerja Anda adalah manual layanan, anggaran keluaran itu adalah fiturnya. Jika unit kerja Anda adalah pesan chat, itu tidak relevan.
• Total parameter — North Small Translate 1.0: 218B MoE, 25B aktif vs Hy-MT2-1.8B: 1.8B dense
• Konteks — 16K masuk dan 16K keluar vs jendela kerja 8K (konfigurasi mengiklankan hingga 262.144 posisi; panduan Tencent menyebutkan 8.192)
• Bahasa — 50 (Inggris + 49) vs 33 bahasa ditambah 5 bahasa minoritas dan dialek
• Lisensi — CC BY-NC 4.0, komersial melalui Model Vault vs Apache 2.0, tanpa pembatasan
• Jejak terkuantisasi — FP8 ~218GB, NVFP4 W4A16 ~109GB vs 440MB pada 1,25-bit, FP8 dan GGUF juga telah dipublikasikan
• Perangkat keras minimum — 2×B200 atau 4×H100 pada FP8 vs ponsel

Apa yang sebenarnya dirilis Tencent dalam 1.8B
1.8B adalah anggota terkecil dari keluarga tiga model — 1.8B, 7B, dan andalan MoE 30B-A3B — semuanya dirilis bersama dengan tolok ukur pendamping bernama IFMTBench yang mengukur kemampuan mengikuti instruksi penerjemahan alih-alih kualitas terjemahan mentah. Tencent merilis kuantisasi FP8, GGUF, 2-bit, dan 1.25-bit bersama bobot dasarnya, dan versi 1.25-bit-lah yang menghasilkan angka 440MB dan klaim percepatan inferensi 1,5x dibandingkan generasi Hy-MT1.5 sebelumnya. Penyajian didukung melalui transformers 5.6.0 dan yang lebih baru, vLLM, SGLang, dan llama.cpp, dengan jalur GGUF bergantung pada kernel STQ yang sudah masuk ke llama.cpp. Pengambilan sampel yang direkomendasikan adalah temperature 0.7, top_p 0.6, top_k 20, repetition penalty 1.05, dan tidak ada system prompt bawaan — kebalikan dari pendekatan Cohere.
Ini juga, tidak seperti North Small Translate 1.0, merupakan model dengan adopsi yang terlihat. Repositori Hugging Face telah diunduh lebih dari 23.000 kali dan memperoleh sekitar 1.200 suka. Repositori utama Cohere menunjukkan 26 unduhan dan nol suka saat ini ditulis.
Lisensi adalah perbedaan yang lebih tajam
Inilah bagian yang seharusnya menentukan lebih banyak penerapan ketimbang tabel tolok ukur. Hy-MT2-1.8B berlisensi Apache 2.0 tanpa pembatasan akses — penggunaan komersial, fine-tuning, karya turunan, redistribusi, semuanya diizinkan. North Small Translate 1.0 berlisensi CC BY-NC 4.0: bobotnya gratis untuk penggunaan nonkomersial, dan penerapan komersial memerlukan lisensi berbayar melalui Model Vault milik Cohere, yang harganya tidak dipublikasikan.
Sederhananya: jika Anda sedang membangun sebuah produk, model Tencent adalah model yang bisa Anda rilis hari ini tanpa perlu percakapan, sedangkan model Cohere adalah model yang hanya bisa Anda evaluasi. Asimetri itu tidak membuat model Cohere menjadi lebih buruk, tetapi mengubah urutan operasi — Anda mengevaluasi milik Cohere, dan Anda bisa men-deploy milik Tencent.
Bukti kualitas bersifat asimetris, dan kedua sisi dilaporkan oleh vendor.
Tidak ada satu pun dari kedua model itu yang memiliki evaluasi independen di belakangnya, jadi perlakukan setiap angka di sini sebagai klaim dari masing-masing pembuatnya. Perbedaannya adalah seberapa banyak yang telah dipaparkan oleh para pembuatnya. Tencent menerbitkan tabel perbandingan lengkap dan laporan teknis: pada terjemahan Inggris-ke-X FLORES-200, Hy-MT2-1.8B mencatat 90,00 berbanding 94,42 milik Gemini 3.1 Pro dan 94,16 milik GPT-5.5 — sedikit tertinggal dari model-model terdepan tetapi hanya berselisih beberapa poin, dari model yang muat di ponsel. Pada skor keseluruhan pengikutan instruksi IFMTBench, 1.8B berada di 69,36%, jauh di belakang saudara sekandungnya sendiri 30B-A3B di 85,7% dan Gemini 3.1 Pro di 89,08%, yang merupakan pembacaan jujur atas trade-off tersebut: model mungil ini jauh lebih tidak andal dalam mengikuti instruksi pemformatan dan terminologi daripada kemampuannya menerjemahkan.
Cohere menerbitkan satu angka — skor WMT26 sebesar 83,60, yang naik menjadi 84,36 dengan alur kerja multi-pass agentic — tanpa mencantumkan nama metrik dan tanpa halaman hasil WMT26 untuk memverifikasinya. Itu bukan perbandingan yang dapat kami lakukan. Satu angka tanpa nama tidak dapat diadu dengan tabel tolok ukur yang bernama, dan berpura-pura sebaliknya akan menjadi hal paling menyesatkan yang bisa dilakukan artikel ini.

Penyeimbang dari Tencent adalah bahwa angka-angkanya berasal dari tempat yang dapat diperiksa pembaca. Repositori Hy-MT2 menerbitkan ikhtisar keluarga, tiga ukuran model, dan runtime yang didukung masing-masing model bersama tabel benchmark — itulah yang membuat angka FLORES-200 dan IFMTBench benar-benar dapat diperiksa, dan yang membuat satu angka tanpa nama milik Cohere mencolok sebagai kontras.

Berapa biaya untuk menelepon masing-masing
1.8B milik Tencent memiliki API komersial yang dihosting yang diluncurkan pada Agustus 2026, dengan harga sekitar $0,044 per juta token masukan dan $0,177 per juta token keluaran — murah secara absolut, dan dihargai per token. Model Cohere berjalan di tier gratis Chat V2, gratis untuk kunci uji coba dan produksi hingga batas laju tercapai, jadi biaya evaluasinya nol tetapi biaya produksinya adalah kontrak yang harus Anda negosiasikan. Self-hosting membalikkan perhitungan sepenuhnya: 440MB di ponsel versus dua B200, yang merupakan perbedaan yang diukur dalam orde besaran, bukan persentase.
Alasan kesenjangan itu layak disebutkan dalam artikel tentang platform routing adalah bahwa tier murah dan tier mahal bukanlah pesaing — keduanya adalah dua posisi dalam sebuah kaskade, dan kaskade adalah hal yang memang menjadi tujuan sebuah router. OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, sehingga pemotongan harga vendor pada endpoint terjemahan terkelola langsung berlaku di sisi kami pada hari yang sama tanpa selisih harga reseller yang perlu dinegosiasikan ulang, dan rantai failover memungkinkan model yang lebih kecil menyerap sebagian besar lalu lintas sementara model yang lebih berat menangani permintaan yang gagal ditanganinya. Coba dulu yang murah, naikkan ke tingkat berikutnya untuk kasus-kasus sulit, dan biarkan lapisan routing yang menyimpan kebijakan alih-alih kode aplikasi Anda.
Mana yang harus Anda pilih
Jika penerjemahan Anda terjadi di perangkat, secara offline, di bawah anggaran penyimpanan per megabita, atau di dalam produk komersial yang tidak berminat menegosiasikan lisensi, Hy-MT2-1.8B adalah jawabannya dan North Small Translate 1.0 tidak masuk hitungan. Jika unit kerja Anda adalah dokumen panjang dalam salah satu dari lima puluh bahasa yang didukung Cohere, jika Anda memerlukan keluaran 16K dalam satu kali proses, dan jika lisensi komersial adalah sesuatu yang bersedia dibeli oleh organisasi Anda, maka model Cohere adalah mesin yang lebih mampu pada setiap dimensi yang diungkapkan — dengan catatan bahwa kualitasnya bertumpu pada satu angka yang belum direproduksi.
Dan bagi sebagian besar tim, jawaban jujurnya adalah keduanya, dalam urutan itu: model 440MB mengerjakan pekerjaan rutin dengan biaya yang sangat kecil, model 218B menangani dokumen-dokumen yang penting, dan keputusan tentang permintaan mana yang diarahkan ke mana adalah aturan perutean, bukan penulisan ulang. Kesenjangan antara kedua model ini bukanlah kesenjangan yang harus ditutup. Ini adalah spektrum yang harus dimanfaatkan.
