Hero-kaart met als kop "North Small Translate 1.0 vs Hy-MT2" en als ondertitel "Twee MoE-vertalers, één bewijskloof", boven twee kaarten: North Small Translate 1.0 (218B MoE / 25B actief, één niet nader genoemde WMT26-waarde) en Hy-MT2-30B-A3B (30B MoE / 3B actief, paper, benchmark, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2: Twee MoE-vertalers, één bewijskloof

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Beide families waren gebouwd op dezelfde gok — dat een schaars mixture-of-experts-netwerk dat voor vertaling is nagetraind, een algemeen model dat wordt gevraagd te vertalen verslaat — en ze kwamen er langs tegengestelde wegen op uit. Hy-MT2, de uit drie modellen bestaande vertaalfamilie van Tencent Hunyuan met als blikvanger de Hy-MT2-30B-A3B MoE, werd op 21 mei 2026 onder Apache 2.0 open-source gemaakt met een technisch rapport, een open-source benchmark en een volledige vergelijkingstabel. North Small Translate 1.0, de MoE-vertaler van Cohere met 218 miljard parameters en 25 miljard actieve parameters, werd gedocumenteerd in een releaseopmerking van 9 september 2026, en het kwaliteitsbewijs ervan komt neer op één enkel getal zonder dat er een metriek aan is gekoppeld. De architecturen rijmen. De documentatie niet, en dat verschil is het nuttigste om te begrijpen voordat je een van beide kiest.

Eén familie, drie formaten tegen één groot model

Hy-MT2 is niet één model, maar een reeks: een 1,8B dense model voor on-device werk, een 7B dense model voor één GPU, en de 30B-A3B MoE als vlaggenschip met drie miljard actieve parameters per token. Alle drie zijn Apache 2.0, zonder toegangsbeperkingen, en worden samen uitgebracht met FP8-, GGUF-, 2-bit- en 1.25-bit-kwantisaties plus de IFMTBench-benchmark voor het volgen van instructies en een begeleidend paper. Tencent meldt dat de familie tussen 33 talen plus vijf minderheidstalen en dialecten vertaalt.

North Small Translate 1.0 is één punt in de ruimte van modelgroottes, en een groot: 218B totale parameters, 25B actief, 128 experts met acht geactiveerd per token plus gedeelde experts, en aandacht die in een 3:1-verhouding afwisselt tussen sliding-window-lagen (venster 4.096, RoPE) en globale lagen zonder positionele embeddings. Het venster is 16K in en 16K uit voor Engels plus 49 andere talen, waarbij Modern Standaardarabisch, Duits, Frans, Japans, Koreaans, Russisch en Oekraïens als tier-one zijn aangemerkt. Opmerkelijk is dat de vorm niet nieuw is — Cohere's Command A+ uit mei 2026 gebruikte dezelfde 218B/25B-configuratie — waardoor dit een op vertaling gespecialiseerde post-train van een bestaande kern is in plaats van een nieuwe architectuur.

Parameters — North Small Translate 1.0: 218B totaal / 25B actief vs. Hy-MT2-30B-A3B: 30B totaal / 3B actief, met 1,8B en 7B dense varianten

Context — 16K in en 16K uit versus een 8K-werkvenster, config geeft aan tot 262.144 posities te ondersteunen

Talen — 50 (Engels + 49) vs 33 plus 5 minderheidstalen en dialecten

Licentie — CC BY-NC 4.0, commercieel via Model Vault vs Apache 2.0, zonder toegangsbeperking

Gepubliceerd bewijs — één niet nader genoemd WMT26-cijfer, door de leverancier gerapporteerd versus een technisch rapport, een open benchmark en benoemde resultaten op FLORES-200, WMT25 GEMBA en XCOMET-XXL

Serveren — vLLM met cohere_melody>=0.9.0, greedy decoding aanbevolen in vergelijking met transformers, vLLM, SGLang en llama.cpp

Aangekondigd — 9 september 2026 (gewichten afgeschermd op Hugging Face sinds 14 augustus) versus 21 mei 2026

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-30B-A3B across six rows: Parameters 218B MoE / 25B active vs 30B MoE / 3B active; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Evidence one unnamed WMT26 figure vs FLORES-200 93.85 and GEMBA 84.34; Technical report none published vs arXiv paper and IFMTBench. Footer notes all figures are vendor-reported by Tencent and Cohere and none is independently reproduced.

De bewijskloof is het echte verhaal

De release van Tencent kwam met bewijzen. Er is een paper op arXiv, een benchmark die het bedrijf zelf schreef en als open source uitbracht, specifiek om het volgen van vertaalinstructies te meten, en een resultatentabel waarin de concurrenten worden genoemd. FLORES-200 Engels-naar-X zet de 30B-A3B op 93,85, tegenover Gemini 3.1 Pro op 94,42 en GPT-5.5 op 94,16. De GEMBA-metriek uit het WMT25-tijdperk zet het op 84,34 — de hoogste score in de eigen vergelijking van Tencent, vóór GPT-5.5 met 83,41 en 83,29 in zijn twee modi, Gemini 3.1 Pro met 82,23, DeepSeek-V4-Pro met 81,99 en Kimi K2.6 met 81,68. XCOMET-XXL plaatst het op 62,89, achter zijn eigen 7B-tegenhanger. Op IFMTBench bereikt het een algehele instructieopvolging van 85,7%, met een deelscore van 91,94% die binnen een honderdste punt van Gemini 3.1 Pro ligt, en een aparte deelscore, 85,55%, waarop het ronduit vooroploopt op het Gemini 3.1 Pro-model.

Elk daarvan is een meting van Tencent zelf en geen ervan is onafhankelijk gereproduceerd. Maar ze hebben een naam, ze zijn vergelijkbaar en ze zijn falsifieerbaar — een lezer weet precies welke test hij moet uitvoeren om te argumenteren.

De release note van Cohere noemt één cijfer: WMT26 83,60, oplopend naar 84,36 onder wat het een agentische vertaalworkflow met meerdere rondes noemt. Nergens op de modelkaart of in de documentatie wordt een metriek genoemd. Er is geen WMT26-resultatenpagina voor dit model gepubliceerd. Het trainingscorpus, het aantal tokens en de datapijplijn worden niet bekendgemaakt, terwijl het technische rapport van Command A Translate uit 2025 een techniek voor moeilijkheidsfiltering in detail had beschreven. Niets daarvan is bewijs voor een slechter model. Het is bewijs van minder bewijs, wat iets anders is en net zo veel uitmaakt wanneer je beslist wat je in productie neemt.

De gedeelde maatstaf die geen van beide partijen daadwerkelijk heeft gepubliceerd

Er is één echt raakpunt tussen de twee, en dat verdient een alinea omdat het de enige plek is waar een eerlijke vergelijking zou kunnen plaatsvinden. Tencent is een WMT26-partner en sponsort een taak voor het vertalen van videondertitels met door Hunyuan gefinancierde prijzen. Het enige gepubliceerde cijfer van Cohere is een WMT26-cijfer. Dus beide organisaties bevinden zich in dezelfde evaluatiecyclus van 2026, en de enige metriek waarop een rechtstreekse vergelijking beslecht zou kunnen worden, is precies degene waar slechts één van hen iets heeft gepubliceerd — en dan nog zonder de metriek te noemen.

Dat is de kloof die je in de gaten moet houden. Als Cohere een metrieknaam aan de 83,60 koppelt, of als de WMT26-resultatenpagina's een North Small Translate-systeem bevatten, wordt de vergelijking echt. Tot die tijd zou het afzetten van de FLORES-200- en GEMBA-cijfers van Tencent tegen het niet-gelabelde WMT26-cijfer van Cohere een verzinsel zijn dat zich voordoet als analyse.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Licentie en implementatie

Hy-MT2 is Apache 2.0 zonder enige vorm van toegangsbeperking: commercieel gebruik, fine-tuning, afgeleide werken en herdistributie, allemaal zonder dat er een gesprek aan te pas komt. North Small Translate 1.0 is CC BY-NC 4.0, gratis voor niet-commercieel gebruik, waarbij commerciële implementatie via Cohere's Model Vault verloopt tegen een prijs die niet gepubliceerd is. Voor alles wat aan klanten wordt geleverd, beslecht dat verschil de beslissing voordat de benchmarks worden gelezen.

Het hardwareverhaal volgt hetzelfde patroon, maar dan omgekeerd. Hy-MT2 bestrijkt een gequantiseerde build van 440MB die op een handset draait tot de 30B-A3B, waarvan de drie miljard actieve parameters de rekenkracht per token bescheiden houden voor zijn kwaliteitsklasse; de runtimes ondersteunen transformers, vLLM, SGLang en llama.cpp. North Small Translate 1.0 publiceert de minimale hardware per checkpoint — vier B200's of acht H100's voor BF16, twee B200's of vier H100's voor FP8, één B200 of twee H100's voor NVFP4 W4A16 — en raadt greedy decoding aan om productie te evenaren. Het compenserende voordeel van Cohere is dat het model draait op de gratis tier van zijn Chat V2 API, gratis voor trial- en productiesleutels tot de rate limits zijn bereikt, waardoor het evalueren ervan niets kost.

Moet je overstappen, en waarnaar?

De vraag over de overstap is hier echt asymmetrisch. De overstap van Hy-MT2 naar North Small Translate 1.0 is geen prestatieverbetering die je momenteel kunt rechtvaardigen — het is een gok op een model waarvan de enige publieke claim één getal is, afgewogen tegen een familie met een gepubliceerd rapport en een inzetbare licentie. Wat wel de moeite waard is, is evalueren: het Cohere-model is gratis aan te roepen, dekt vijftig talen waaronder een bredere Europese set, en geeft je 16K uitvoer per doorgang, wat het 8K-werkvenster van Hy-MT2 niet doet.

Die evaluatie is precies het geval waarin een routeringslaag zijn waarde bewijst, want het eerlijke antwoord voor de meeste meertalige stacks is dat beide modellen blijven. OrcaRouter zet een catalogus van meer dan 200 modellen achter één sleutel, dus het uitproberen van een tweede vertaalmodel is een configuratiewijziging en niet een tweede leverancierscontract of een codewijziging — je richt dezelfde OpenAI-compatibele client op een andere model-id en vergelijkt op je eigen tekst. De adviesprijs van de provider wordt doorgegeven met 0% opslag, dus een prijswijziging bij de hostingpartij is dezelfde dag live aan onze kant, zonder dat er een marge bovenop komt, en failover-ketens houden productie op het model dat al werkt terwijl het nieuwe wordt beoordeeld. Noch North Small Translate 1.0 noch Hy-MT2 staat vandaag in onze catalogus, dus dit is geen aanbeveling om een van beide bij ons te kopen — het is het argument om de beslissing niet hard te coderen voordat je de test hebt uitgevoerd.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Het vonnis

Tencents Hy-MT2 is de veiligere keuze, en op basis van het bewijs is het niet eens dichtbij: Apache 2.0, drie groottes, een paper, een open benchmark, vier genoemde evaluatiesuites en een WMT26-partnerschap. Coheres North Small Translate 1.0 is de interessantere — 218 miljard parameters aan vertaalspecifieke MoE achter een uitvoervenster van 16K en vijftig talen, een gratis evaluatieniveau, en een 83,60 die niemand buiten Cohere heeft gecontroleerd.

Als je dit kwartaal een beslissing moet nemen, kies dan de familie met de bonnetjes. Als je een corpus en een week hebt, haal dan een deel ervan door de gratis tier en ontdek of de naamloze 83,60 van Cohere iets betekent voor jouw documenten — want dat is een vraag die geen enkele leverancierstabel voor je kan beantwoorden, en het enige getal dat Cohere ervoor koos te publiceren, is precies het getal dat het weigerde te noemen.