Kartu judul hero untuk 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B' dengan subjudul 'Titik Manis Dense atau Flagship MoE dengan Harga yang Sama', menampilkan dua ikon tumpukan model dengan tanda sama dengan di antara keduanya dan dua chip label harga identik yang diberi label $0.074 / $0.295, dengan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: Titik Manis Dense atau Andalan MoE dengan Harga yang Sama

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Inilah kejutan di inti perbandingan ini: Tencent Hy-MT2-7B, model 7B padat (dense), dan Tencent Hy-MT2-30B-A3B, unggulan mixture-of-experts dengan total 30 miliar parameter dan sekitar 3 miliar aktif, keduanya dapat dipanggil melalui API terkelola minggu ini — yang 7B sekitar 19 Agustus 2026, yang 30B-A3B sehari kemudian, keduanya dilayani oleh Tencent Cloud — dengan harga yang persis sama: $0,074 per juta token input dan $0,295 per juta token output. Keluarga model ini dirilis sebagai sumber terbuka bersamaan pada 21 Mei 2026, jadi tidak ada model yang benar-benar baru; harga API yang identik inilah yang membuat perbandingan ini benar-benar aneh. Biasanya model yang lebih besar lebih mahal dan Anda mempertimbangkan selisih harga terhadap keuntungannya. Di sini, unggulan tidak memerlukan biaya tambahan per token, dan keputusannya menyempit menjadi satu pertanyaan: apa, jika ada, yang dikorbankan oleh 7B karena padat dan kecil?

Kejutan harga yang sama

Paritas harga 30B-A3B adalah bukti bahwa tawaran MoE bekerja sesuai fungsinya. Arsitekturnya menyimpan 30B pengetahuan tetapi hanya mengaktifkan sekitar 3B per token, sehingga Tencent Cloud dapat menyajikannya dengan tarif per token yang sama dengan 7B — sama $0.074 / $0.295, sama konteks 8.192 token, sama dukungan output terstruktur, sama keterbatasan tanpa pemanggilan fungsi. Di API, model "professional" tidak lebih mahal. Tangkapannya berpindah ke tempat lain: ke jejak memori, kompleksitas penyajian, dan latensi, di mana desain 7B yang lebih padat dan lebih sederhana memiliki keunggulan struktural yang tidak dapat diungkapkan oleh harga per token.

Spesifikasi, Berdampingan

Arsitektur — padat ~7B vs MoE 30B total / ~3B aktif.

Harga API — $0.074 / $0.295 vs $0.074 / $0.295 per 1 juta token (identik).

Konteks — keduanya 8.192 token.

Posisi — titik manis yang seimbang vs flagship kelas profesional.

FLORES-200 — 7B: 86,89 XCOMET-XXL, ≈97,9% dari Gemini 3.1 Pro (Think); 30B-A3B: skor terjemahan umum terbaik dari keluarga ini (angka yang dilaporkan vendor).

Perbandingan Deep​Seek / K​imi — keduanya mengalahkan DeepSeek-V4-Pro dan Kimi K2.6 dalam mode berpikir cepat, menurut laporan vendor.

Jejak — satu A100 / RTX 4090 vs bobot skala 30B (build terkuantisasi kelas 18GB di disk dan lebih banyak lagi di VRAM).

Default inferensi — temp 0,7, top_p 0,6, top_k 20 vs temp 0,7, top_p 1,0, top_k -1.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B — the scoreboard'. Left column Hy-MT2-7B: Architecture dense 7B; API price $0.074 / $0.295; FLORES-200 86.89; Context 8,192; Footprint single GPU; Role balanced sweet spot. Right column Hy-MT2-30B-A3B: Architecture MoE 30B / 3B active; API price $0.074 / $0.295; FLORES-200 tops the family; Context 8,192; Footprint data-center VRAM; Role professional-grade. Footer: Prices identical as listed Aug 2026; figures vendor-reported.

Di mana 30B-A3B sebenarnya menang

Tencent memposisikan 30B-A3B sebagai anggota kelas profesional dari keluarga model ini, dan bukti yang mereka publikasikan mendukung label tersebut untuk jenis teks tertentu. Pada materi yang sarat domain — klausul hukum, teks medis, dokumentasi teknis — lini GEMBA-nya di DomainMTBench adalah yang terkuat di keluarga ini, dilaporkan mencapai sekitar 99% dari baseline Gemini 2.5 Pro, dan skor terjemahan umumnya mengungguli 7B pada kurva FLORES milik keluarga itu sendiri. Pengetahuan ekstra 27B yang tidak aktif tersebut adalah jenis kapasitas yang justru tampak ketika sebuah kalimat membawa terminologi padat, bukan prosa biasa: klausul "indemnification shall survive termination" dalam kontrak tidak banyak membebani model 7B, tetapi dokumen M&A lengkap dengan glosarium justru akan membebaninya. 30B-A3B juga merupakan pilihan paling aman untuk pasangan bahasa Mandarin ke bahasa minoritas (Tibet, Uyghur, Mongolia), di mana Tencent melaporkan angka terbaiknya.

Di mana 7B tetap menang

Keunggulan 7B bersifat operasional dan nyata. Pertama, self-hosting: 7B muat di satu A100 atau RTX 4090 dan memiliki cakupan kerangka kerja terluas — Transformers, vLLM, SGLang, dan llama.cpp melalui GGUF semuanya telah teruji. 30B-A3B, bahkan setelah dikuantisasi, tetap membutuhkan VRAM skala pusat data, dan lebih sedikit orang yang menggunakannya dalam tumpukan serving produksi. Kedua, latensi dan kesederhanaan serving: model 7B yang padat lebih mudah dijaga tetap panas, dan sampling yang disarankan lebih mendekati decode standar. Ketiga, di API, harga yang identik berarti 7B membutuhkan biaya yang sama persis per token dengan model unggulan — jadi satu-satunya alasan memilih model yang lebih kecil adalah karena untuk teks umum yang bersih, kesenjangan kualitasnya terlalu tipis untuk disadari. 7B sudah mencapai sekitar 97,9% dari Gemini 3.1 Pro (Think) pada FLORES-200; poin ekstra model unggulan berada di puncak kurva yang masing-masing semakin sulit terlihat dalam praktik.

Kesenjangan, diukur secara jujur

Semua hal di dua bagian terakhir adalah evaluasi internal Tencent, dan cara jujur untuk membacanya adalah bahwa kedua model tersebut cukup dekat dalam terjemahan biasa sehingga korpus Anda yang menentukan. Pada teks bersih umum, skor ~97,9%-dari-Gemini pada model 7B berarti keunggulan model unggulan diukur dalam pecahan kecil XCOMET — nyata di papan peringkat, sulit dirasakan di tiket dukungan. Pada teks domain padat dan pasangan bahasa minoritas, keunggulan GEMBA dan FLORES yang dilaporkan model unggulan justru berada di area di mana penerjemah profesional (manusia atau model) menunjukkan nilainya, dan di mana penerjemahan ulang paling mahal. Tidak ada tolok ukur independen untuk kedua model saat tulisan ini dibuat; satu hal yang disepakati kedua kartu vendor adalah bahwa masing-masing ukuran mengungguli DeepSeek-V4-Pro dan Kimi K2.6 dalam mode berpikir cepat keluarga tersebut.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-30B-A3B (captured August 23 2026) showing the MoE architecture (30B total / 3B active), Apache-2.0 license, and the professional-grade positioning.

Merutekan keluarga

Tidak satu pun dari kedua model tersebut tercantum dalam katalog OrcaRouter hingga saat tulisan ini dibuat, sehingga keduanya dilayani melalui cloud Tencent sendiri dan sejumlah platform pihak ketiga. Pelajaran yang paling praktis tetaplah soal routing. Karena harga API-nya identik, ini adalah contoh klasik untuk routing beban kerja, bukan sekadar memilih satu model: kirim porsi terjemahan umum bervolume tinggi ke 7B, dan porsi yang padat serta sarat domain ke 30B-A3B, dengan failover otomatis sehingga lonjakan latensi di endpoint MoE tidak akan pernah menghentikan pipeline. Itulah pola yang disusun DSL routing OrcaRouter di antara 200+ model yang kami bawa — dispatch berbobot biaya, harga daftar penyedia diteruskan dengan markup 0% — dan pola ini lebih cocok untuk keluarga model ini daripada untuk kebanyakan model lain, karena vendor telah menetapkan harga kedua tingkatan tersebut agar pembagiannya netral secara ekonomi.

Putusan

Pada harga API yang identik, jawaban default adalah 7B: biaya per token yang sama, lebih sederhana untuk di-host sendiri, dan nyaris setara pada teks umum. Pilih 30B-A3B ketika korpusnya padat secara profesional — hukum, medis, teknis, atau terjemahan bahasa minoritas — di mana keunggulan domain flagship yang dilaporkan sebanding dengan footprint yang lebih besar dan latensinya. Dan jika beban kerja Anda merupakan campuran keduanya, jangan memilih: arahkan bagian umum ke 7B dan bagian sulit ke flagship. Itu bukan kompromi di antara keduanya; itu adalah satu-satunya cara untuk mendapatkan keduanya dengan harga yang ditetapkan Tencent.

A generated infographic titled 'Same price, different model' with two identical cards both labelled '$0.074 / $0.295 per 1M tokens': one 'Dense 7B — simpler to serve, near-flagship on clean text', the other 'MoE 30B-A3B — 30B knowledge, 3B active, professional domains', with the footer 'The MoE bargain: bigger model, same per-token cost.'

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube