
North Small Translate 1.0 vs Hy-MT2-1.8B: 218GB aan model tegenover 440MB
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Een van deze past op een telefoon. Hy-MT2-1.8B, het vertaalmodel voor op het toestel van Tencent Hunyuan dat op 21 mei 2026 onder Apache 2.0 open source is gemaakt, krimpt tot 440 megabyte met AngelSlim 1,25-bitskwantisatie en draait op Apple-, Qualcomm- en MediaTek-telefoonchips. North Small Translate 1.0, het mixture-of-expertsmodel met 218 miljard parameters dat Cohere op 9 september 2026 in zijn release notes documenteerde, levert een FP8-gewichtenset in de orde van 218 gigabyte en vraagt minimaal om twee B200's. Dat is ongeveer vijfhonderd keer de opslag voor een van hen, en de interessante vraag is niet welke beter is — maar waarvoor elk ervan eigenlijk dient, en welke licentie je toestaat het uit te brengen.
Het grootteverschil is geen kwaliteitsverschil
Het is verleidelijk om 218B tegenover 1.8B te lezen als een directe capaciteitenranking. Dat is het niet, om twee redenen. De eerste is dat North Small Translate 1.0 een sparse mixture-of-experts-model is met slechts 25 miljard parameters die per token actief zijn, waardoor de rekenkracht per token in een andere klasse valt dan het aantal parameters. De tweede is dat de twee modellen zijn geoptimaliseerd voor verschillende doelstellingen: de 1.8B van Tencent was gebouwd om klein genoeg te zijn om offline op een mobiele telefoon te draaien, en het model van Cohere was gebouwd om een heel document in de context te houden en het als één geheel te vertalen.
Dat verschil is afleesbaar in de contextvensters. De configuratie van Hy-MT2-1.8B vermeldt tot 262.144 posities, maar de eigen inferentierichtlijnen van Tencent beperken de generatie tot 8.192 tokens — het praktische werkvenster is 8K. North Small Translate 1.0 documenteert 16K invoer en 16K uitvoer, wat het dubbele is van het invoervenster en, belangrijker nog, een volledige 16K aan output. Als je werkeenheid een servicehandleiding is, dan is dat outputbudget juist de functie. Als je werkeenheid een chatbericht is, is het irrelevant.
• Totale parameters — North Small Translate 1.0: 218B MoE, 25B actief vs Hy-MT2-1.8B: 1,8B dense
• Context — 16K in en 16K uit tegenover een werkvenster van 8K (de configuratie claimt tot 262.144 posities; de richtlijn van Tencent zegt 8.192)
• Talen — 50 (Engels + 49) tegenover 33 talen plus 5 minderheidstalen en dialecten
• Licentie — CC BY-NC 4.0, commercieel via Model Vault vs Apache 2.0, zonder toegangsbeperking
• Gekwantiseerde voetafdruk — FP8 ~218GB, NVFP4 W4A16 ~109GB versus 440MB bij 1,25-bit, FP8 en GGUF ook gepubliceerd
• Minimale hardware — 2×B200 of 4×H100 op FP8 versus een handset

Wat Tencent daadwerkelijk heeft uitgebracht in de 1.8B
De 1.8B is het kleinste lid van een familie van drie modellen — 1.8B, 7B en een 30B-A3B MoE-vlaggenschip — allemaal samen uitgebracht met een bijbehorende benchmark genaamd IFMTBench die het opvolgen van vertaalinstructies meet in plaats van ruwe vertaalkwaliteit. Tencent leverde FP8-, GGUF-, 2-bit- en 1,25-bit-kwantisaties samen met de basisgewichten, en de 1,25-bit-versie is degene die het cijfer van 440MB en een geclaimde 1,5x inferentiesnelheidsverhoging ten opzichte van de vorige Hy-MT1.5-generatie oplevert. Het serveren wordt ondersteund via transformers 5.6.0 en later, vLLM, SGLang en llama.cpp, waarbij het GGUF-pad afhankelijk is van een STQ-kernel die in llama.cpp is opgenomen. Aanbevolen sampling is temperatuur 0,7, top_p 0,6, top_k 20, herhalingsstraf 1,05, en er is geen standaard systeemprompt — het omgekeerde van de aanpak van Cohere.
Het is ook, in tegenstelling tot North Small Translate 1.0, een model met zichtbare adoptie. De Hugging Face-repository is meer dan 23.000 keer gedownload en heeft ongeveer 1.200 likes. De belangrijkste repository van Cohere vertoonde 26 downloads en nul likes toen dit werd geschreven.
De licentie is het scherpere verschil
Dit is het onderdeel dat meer implementaties zou moeten bepalen dan de benchmarktabel doet. Hy-MT2-1.8B is Apache 2.0 zonder toegangsbeperkingen — commercieel gebruik, fine-tuning, afgeleide werken, herdistributie, allemaal toegestaan. North Small Translate 1.0 is CC BY-NC 4.0: de gewichten zijn gratis voor niet-commercieel gebruik, en commerciële inzet vereist een gekochte licentie via Cohere's Model Vault, waarvoor geen prijs wordt gepubliceerd.
Simpel gezegd: als je een product bouwt, is het model van Tencent het model dat je vandaag kunt uitbrengen zonder voorafgaand gesprek, en dat van Cohere is het model dat je alleen maar kunt evalueren. Die asymmetrie maakt het model van Cohere niet slechter, maar verandert de volgorde van handelingen — je evalueert dat van Cohere, en dat van Tencent kun je uitrollen.
Kwaliteitsevidentie is asymmetrisch, en beide kanten worden door leveranciers gerapporteerd
Geen van beide modellen heeft een onafhankelijke evaluatie achter zich, dus beschouw elk getal hier als een claim van de maker. Het verschil zit erin hoeveel de makers op tafel hebben gelegd. Tencent publiceerde een volledige vergelijkingstabel en een technisch rapport: op FLORES-200-vertaling van Engels naar X scoort Hy-MT2-1.8B 90,00 tegenover 94,42 van Gemini 3.1 Pro en 94,16 van GPT-5.5 — bescheiden achter de frontiermodellen, maar binnen een paar punten, van een model dat op een telefoon past. Op de algemene instructieopvolgingsscore van IFMTBench komt de 1.8B uit op 69,36%, ruim achter zijn eigen 30B-A3B-broer op 85,7% en Gemini 3.1 Pro op 89,08%, wat de eerlijke lezing van de afweging is: het kleine model volgt opmaak- en terminologie-instructies veel minder betrouwbaar dan het vertaalt.
Cohere publiceerde één getal — een WMT26-score van 83,60, die stijgt naar 84,36 met een agentische workflow met meerdere passes — zonder dat er een metrieknaam aan verbonden was en zonder een WMT26-resultatenpagina om het tegen te controleren. Dat is geen vergelijking die wij kunnen maken. Een enkel naamloos getal kan niet tegen een tabel met benoemde benchmarks worden afgezet, en doen alsof dat wel kan, zou het meest misleidende zijn dat dit artikel zou kunnen doen.

Het tegenwicht van Tencent is dat zijn cijfers afkomstig zijn van een plek die een lezer kan inspecteren. De Hy-MT2-repository publiceert het familieoverzicht, de drie modelgroottes en de runtimes die elk ondersteunt, naast de benchmarktabel — wat de FLORES-200- en IFMTBench-cijfers überhaupt controleerbaar maakt, en wat het ene naamloze cijfer van Cohere door het contrast juist opvallend maakt.

Wat het kost om elk te bellen
Het 1.8B-model van Tencent heeft een gehoste commerciële API die in augustus 2026 is gelanceerd, geprijsd op ongeveer $0,044 per miljoen inputtokens en $0,177 per miljoen outputtokens — goedkoop in absolute termen, en per token geprijsd. Het model van Cohere draait op de gratis tier van Chat V2, gratis voor proef- en productiesleutels totdat de rate limits zijn bereikt, dus de evaluatiekosten zijn nul, maar de productiekosten zijn een contract waarover je moet onderhandelen. Zelf hosten keert de rekensom volledig om: 440MB op een telefoon tegenover twee B200's, een verschil dat in ordes van grootte wordt gemeten in plaats van in percentages.
De reden dat die kloof het vermelden waard is in een stuk over een routeringsplatform, is dat de goedkope laag en de dure laag geen concurrenten zijn — het zijn twee posities in een cascade, en cascades zijn waar een router voor bedoeld is. OrcaRouter geeft de lijstprijs van de provider door met 0% opslag, dus een prijsverlaging van een leverancier op een gehost vertaalendpoint is dezelfde dag bij ons live, zonder resellermarge die opnieuw onderhandeld moet worden, en failover-ketens laten een kleiner model het grootste deel van het verkeer opvangen, terwijl een zwaarder model de aanvragen overneemt die het niet aankan. Probeer eerst de goedkope, escaleer bij de moeilijke gevallen, en laat de routeringslaag het beleid dragen in plaats van je applicatiecode.
Welke je zou moeten kiezen
Als je vertaling op een apparaat plaatsvindt, offline, binnen een opslagbudget per megabyte, of in een commercieel product dat geen zin heeft in licentieonderhandelingen, dan is Hy-MT2-1.8B het antwoord en doet North Small Translate 1.0 niet mee. Als je werkeenheid een lang document is in een van de vijftig talen die Cohere ondersteunt, als je 16K aan output in één enkele doorgang nodig hebt, en als een commerciële licentie iets is dat je organisatie bereid is te kopen, dan is Coheres model op elk bekendgemaakt aspect de capabelere machine — met de kanttekening dat de kwaliteit ervan op één enkel niet-gereproduceerd cijfer berust.
En voor de meeste teams is het eerlijke antwoord beide, in die volgorde: het 440MB-model doet het routinewerk tegen verwaarloosbare kosten, het 218B-model behandelt de documenten die ertoe doen, en de beslissing over welke aanvraag waarheen gaat is een routeringsregel in plaats van een herschrijving. Het gat tussen deze twee modellen is geen gat dat gedicht moet worden. Het is een spectrum om te gebruiken.
