
North Small Translate 1.0 vs Hy-MT2: Twee MoE-vertalers, één bewijskloof
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Beide families waren gebouwd op dezelfde gok — dat een schaars mixture-of-experts-netwerk dat voor vertaling is nagetraind, een algemeen model dat wordt gevraagd te vertalen verslaat — en ze kwamen er langs tegengestelde wegen op uit. Hy-MT2, de uit drie modellen bestaande vertaalfamilie van Tencent Hunyuan met als blikvanger de Hy-MT2-30B-A3B MoE, werd op 21 mei 2026 onder Apache 2.0 open-source gemaakt met een technisch rapport, een open-source benchmark en een volledige vergelijkingstabel. North Small Translate 1.0, de MoE-vertaler van Cohere met 218 miljard parameters en 25 miljard actieve parameters, werd gedocumenteerd in een releaseopmerking van 9 september 2026, en het kwaliteitsbewijs ervan komt neer op één enkel getal zonder dat er een metriek aan is gekoppeld. De architecturen rijmen. De documentatie niet, en dat verschil is het nuttigste om te begrijpen voordat je een van beide kiest.
Eén familie, drie formaten tegen één groot model
Hy-MT2 is niet één model, maar een reeks: een 1,8B dense model voor on-device werk, een 7B dense model voor één GPU, en de 30B-A3B MoE als vlaggenschip met drie miljard actieve parameters per token. Alle drie zijn Apache 2.0, zonder toegangsbeperkingen, en worden samen uitgebracht met FP8-, GGUF-, 2-bit- en 1.25-bit-kwantisaties plus de IFMTBench-benchmark voor het volgen van instructies en een begeleidend paper. Tencent meldt dat de familie tussen 33 talen plus vijf minderheidstalen en dialecten vertaalt.
North Small Translate 1.0 is één punt in de ruimte van modelgroottes, en een groot: 218B totale parameters, 25B actief, 128 experts met acht geactiveerd per token plus gedeelde experts, en aandacht die in een 3:1-verhouding afwisselt tussen sliding-window-lagen (venster 4.096, RoPE) en globale lagen zonder positionele embeddings. Het venster is 16K in en 16K uit voor Engels plus 49 andere talen, waarbij Modern Standaardarabisch, Duits, Frans, Japans, Koreaans, Russisch en Oekraïens als tier-one zijn aangemerkt. Opmerkelijk is dat de vorm niet nieuw is — Cohere's Command A+ uit mei 2026 gebruikte dezelfde 218B/25B-configuratie — waardoor dit een op vertaling gespecialiseerde post-train van een bestaande kern is in plaats van een nieuwe architectuur.
• Parameters — North Small Translate 1.0: 218B totaal / 25B actief vs. Hy-MT2-30B-A3B: 30B totaal / 3B actief, met 1,8B en 7B dense varianten
• Context — 16K in en 16K uit versus een 8K-werkvenster, config geeft aan tot 262.144 posities te ondersteunen
• Talen — 50 (Engels + 49) vs 33 plus 5 minderheidstalen en dialecten
• Licentie — CC BY-NC 4.0, commercieel via Model Vault vs Apache 2.0, zonder toegangsbeperking
• Gepubliceerd bewijs — één niet nader genoemd WMT26-cijfer, door de leverancier gerapporteerd versus een technisch rapport, een open benchmark en benoemde resultaten op FLORES-200, WMT25 GEMBA en XCOMET-XXL
• Serveren — vLLM met cohere_melody>=0.9.0, greedy decoding aanbevolen in vergelijking met transformers, vLLM, SGLang en llama.cpp
• Aangekondigd — 9 september 2026 (gewichten afgeschermd op Hugging Face sinds 14 augustus) versus 21 mei 2026

De bewijskloof is het echte verhaal
De release van Tencent kwam met bewijzen. Er is een paper op arXiv, een benchmark die het bedrijf zelf schreef en als open source uitbracht, specifiek om het volgen van vertaalinstructies te meten, en een resultatentabel waarin de concurrenten worden genoemd. FLORES-200 Engels-naar-X zet de 30B-A3B op 93,85, tegenover Gemini 3.1 Pro op 94,42 en GPT-5.5 op 94,16. De GEMBA-metriek uit het WMT25-tijdperk zet het op 84,34 — de hoogste score in de eigen vergelijking van Tencent, vóór GPT-5.5 met 83,41 en 83,29 in zijn twee modi, Gemini 3.1 Pro met 82,23, DeepSeek-V4-Pro met 81,99 en Kimi K2.6 met 81,68. XCOMET-XXL plaatst het op 62,89, achter zijn eigen 7B-tegenhanger. Op IFMTBench bereikt het een algehele instructieopvolging van 85,7%, met een deelscore van 91,94% die binnen een honderdste punt van Gemini 3.1 Pro ligt, en een aparte deelscore, 85,55%, waarop het ronduit vooroploopt op het Gemini 3.1 Pro-model.
Elk daarvan is een meting van Tencent zelf en geen ervan is onafhankelijk gereproduceerd. Maar ze hebben een naam, ze zijn vergelijkbaar en ze zijn falsifieerbaar — een lezer weet precies welke test hij moet uitvoeren om te argumenteren.
De release note van Cohere noemt één cijfer: WMT26 83,60, oplopend naar 84,36 onder wat het een agentische vertaalworkflow met meerdere rondes noemt. Nergens op de modelkaart of in de documentatie wordt een metriek genoemd. Er is geen WMT26-resultatenpagina voor dit model gepubliceerd. Het trainingscorpus, het aantal tokens en de datapijplijn worden niet bekendgemaakt, terwijl het technische rapport van Command A Translate uit 2025 een techniek voor moeilijkheidsfiltering in detail had beschreven. Niets daarvan is bewijs voor een slechter model. Het is bewijs van minder bewijs, wat iets anders is en net zo veel uitmaakt wanneer je beslist wat je in productie neemt.
De gedeelde maatstaf die geen van beide partijen daadwerkelijk heeft gepubliceerd
Er is één echt raakpunt tussen de twee, en dat verdient een alinea omdat het de enige plek is waar een eerlijke vergelijking zou kunnen plaatsvinden. Tencent is een WMT26-partner en sponsort een taak voor het vertalen van videondertitels met door Hunyuan gefinancierde prijzen. Het enige gepubliceerde cijfer van Cohere is een WMT26-cijfer. Dus beide organisaties bevinden zich in dezelfde evaluatiecyclus van 2026, en de enige metriek waarop een rechtstreekse vergelijking beslecht zou kunnen worden, is precies degene waar slechts één van hen iets heeft gepubliceerd — en dan nog zonder de metriek te noemen.
Dat is de kloof die je in de gaten moet houden. Als Cohere een metrieknaam aan de 83,60 koppelt, of als de WMT26-resultatenpagina's een North Small Translate-systeem bevatten, wordt de vergelijking echt. Tot die tijd zou het afzetten van de FLORES-200- en GEMBA-cijfers van Tencent tegen het niet-gelabelde WMT26-cijfer van Cohere een verzinsel zijn dat zich voordoet als analyse.

Licentie en implementatie
Hy-MT2 is Apache 2.0 zonder enige vorm van toegangsbeperking: commercieel gebruik, fine-tuning, afgeleide werken en herdistributie, allemaal zonder dat er een gesprek aan te pas komt. North Small Translate 1.0 is CC BY-NC 4.0, gratis voor niet-commercieel gebruik, waarbij commerciële implementatie via Cohere's Model Vault verloopt tegen een prijs die niet gepubliceerd is. Voor alles wat aan klanten wordt geleverd, beslecht dat verschil de beslissing voordat de benchmarks worden gelezen.
Het hardwareverhaal volgt hetzelfde patroon, maar dan omgekeerd. Hy-MT2 bestrijkt een gequantiseerde build van 440MB die op een handset draait tot de 30B-A3B, waarvan de drie miljard actieve parameters de rekenkracht per token bescheiden houden voor zijn kwaliteitsklasse; de runtimes ondersteunen transformers, vLLM, SGLang en llama.cpp. North Small Translate 1.0 publiceert de minimale hardware per checkpoint — vier B200's of acht H100's voor BF16, twee B200's of vier H100's voor FP8, één B200 of twee H100's voor NVFP4 W4A16 — en raadt greedy decoding aan om productie te evenaren. Het compenserende voordeel van Cohere is dat het model draait op de gratis tier van zijn Chat V2 API, gratis voor trial- en productiesleutels tot de rate limits zijn bereikt, waardoor het evalueren ervan niets kost.
Moet je overstappen, en waarnaar?
De vraag over de overstap is hier echt asymmetrisch. De overstap van Hy-MT2 naar North Small Translate 1.0 is geen prestatieverbetering die je momenteel kunt rechtvaardigen — het is een gok op een model waarvan de enige publieke claim één getal is, afgewogen tegen een familie met een gepubliceerd rapport en een inzetbare licentie. Wat wel de moeite waard is, is evalueren: het Cohere-model is gratis aan te roepen, dekt vijftig talen waaronder een bredere Europese set, en geeft je 16K uitvoer per doorgang, wat het 8K-werkvenster van Hy-MT2 niet doet.
Die evaluatie is precies het geval waarin een routeringslaag zijn waarde bewijst, want het eerlijke antwoord voor de meeste meertalige stacks is dat beide modellen blijven. OrcaRouter zet een catalogus van meer dan 200 modellen achter één sleutel, dus het uitproberen van een tweede vertaalmodel is een configuratiewijziging en niet een tweede leverancierscontract of een codewijziging — je richt dezelfde OpenAI-compatibele client op een andere model-id en vergelijkt op je eigen tekst. De adviesprijs van de provider wordt doorgegeven met 0% opslag, dus een prijswijziging bij de hostingpartij is dezelfde dag live aan onze kant, zonder dat er een marge bovenop komt, en failover-ketens houden productie op het model dat al werkt terwijl het nieuwe wordt beoordeeld. Noch North Small Translate 1.0 noch Hy-MT2 staat vandaag in onze catalogus, dus dit is geen aanbeveling om een van beide bij ons te kopen — het is het argument om de beslissing niet hard te coderen voordat je de test hebt uitgevoerd.

Het vonnis
Tencents Hy-MT2 is de veiligere keuze, en op basis van het bewijs is het niet eens dichtbij: Apache 2.0, drie groottes, een paper, een open benchmark, vier genoemde evaluatiesuites en een WMT26-partnerschap. Coheres North Small Translate 1.0 is de interessantere — 218 miljard parameters aan vertaalspecifieke MoE achter een uitvoervenster van 16K en vijftig talen, een gratis evaluatieniveau, en een 83,60 die niemand buiten Cohere heeft gecontroleerd.
Als je dit kwartaal een beslissing moet nemen, kies dan de familie met de bonnetjes. Als je een corpus en een week hebt, haal dan een deel ervan door de gratis tier en ontdek of de naamloze 83,60 van Cohere iets betekent voor jouw documenten — want dat is een vraag die geen enkele leverancierstabel voor je kan beantwoorden, en het enige getal dat Cohere ervoor koos te publiceren, is precies het getal dat het weigerde te noemen.
