
North Small Translate 1.0 vs Hy-MT2-7B: Eén GPU tegen twee B200's
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
De meest nabije confrontatie in open vertaling op dit moment is misschien ook de minst voor de hand liggende. Hy-MT2-7B is het middelste kind van de vertaalfamilie van Tencent Hunyuan, open source gemaakt onder Apache 2.0 op 21 mei 2026, en het draait op één RTX 4090 of A100 in ongeveer 16 GB VRAM. North Small Translate 1.0 is Coheres 218 miljard parameter sparse mixture-of-experts-vertaler, gedocumenteerd in de release notes van het bedrijf op 9 september 2026, met een minimale implementatie van twee B200's bij FP8 of één B200 in zijn NVFP4 W4A16-vorm. Beide zijn vertaalspecialisten. Beide zijn actueel. Eén ervan kun je vanaf een workstation serveren, en dat enkele feit herkadert de hele vergelijking — want de benchmark waarop ze het liefst op gelijke voet beoordeeld zouden worden, bestaat niet.
Begin met de envelop, niet met de scores
De kosten van deployment zijn de dimensie die de meeste echte integraties bepaalt, en hier ontlopen de twee modellen elkaar aanzienlijk. Hy-MT2-7B is een dense HunYuanDenseV1-model van ongeveer acht miljard parameters met gepubliceerde FP8- en GGUF-builds, plus door de community gemaakte MLX 8-bit-versies voor Apple silicon. De deploymentnotities van Tencent vermelden transformers 5.6.0 of later, vLLM, SGLang en llama.cpp als ondersteunde runtimes, en de inferentierichtlijnen beperken de generatie tot 8.192 tokens, ook al adverteert de configuratie met maximaal 262.144 posities. Eén moderne consumenten- of workstation-GPU volstaat.
North Small Translate 1.0 is een ander soort object. De totale 218B parameters met 25B actief zijn verdeeld over 128 experts, met acht actief per token plus gedeelde experts, en Cohere publiceert minimale hardware voor elk van zijn drie checkpoints: vier B200's of acht H100's voor BF16, twee B200's of vier H100's voor FP8, één B200 of twee H100's voor de NVFP4 W4A16-build. Serving verloopt via vLLM met cohere_melody>=0.9.0, en Cohere raadt greedy decoding aan om de productie te evenaren. De output draagt <|START_TEXT|> en <|END_TEXT|> markers die niet als speciale tokens zijn geregistreerd.
• Vorm — North Small Translate 1.0: 218B totaal / 25B actief sparse MoE, 128 experts vs Hy-MT2-7B: dense, ongeveer 8B
• Context — 16K in en 16K uit versus een 8K-werkvenster, config geeft aan tot 262.144 posities te ondersteunen
• Minimale hardware — 1×B200 bij W4A16, 2×B200 of 4×H100 bij FP8 versus één GPU van de RTX 4090-klasse in ~16GB
• Gepubliceerde formaten — BF16, FP8, NVFP4 W4A16 t.o.v. basis, FP8, GGUF, plus community MLX 8-bit
• Talen — 50 (Engels + 49) tegenover 33 talen plus 5 minderheidstalen en dialecten
• Licentie — CC BY-NC 4.0, commercieel via Model Vault vs Apache 2.0, zonder toegangsbeperking
• Gerapporteerde kwaliteit — WMT26 83.60, metriek niet nader genoemd, door leverancier gerapporteerd vs. tabellen van genoemde leveranciers op FLORES-200, WMT25 GEMBA, XCOMET-XXL en IFMTBench

Het benchmarkprobleem
Dit is de eerlijke kern van deze onderlinge vergelijking: we kunnen deze twee modellen niet tegen elkaar rangschikken, en wie je iets anders vertelt, verzint een getal. Tencent heeft vier met naam genoemde evaluaties gepubliceerd. Op FLORES-200 Engels-naar-X-vertaling scoort de 7B 93,52, achter de 94,42 van Gemini 3.1 Pro en de 94,16 van GPT-5.5, maar dichtbij genoeg om ertoe te doen. Op de aan WMT25 gerelateerde GEMBA-maatstaf scoort hij 82,24 tegen de 84,34 van de 30B-A3B en de 83,41 van GPT-5.5. Op XCOMET-XXL staat hij met 63,86 bovenaan in Tencents hele vergelijkingstabel — vóór Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro en Kimi K2.6. Op de instructieopvolgingsscore van IFMTBench komt hij uit op 83,14%. Dit zijn allemaal Tencents eigen cijfers, geen ervan is onafhankelijk gereproduceerd, en ze zijn nog steeds veel meer dan wat Cohere heeft geboden.
Cohere publiceerde één enkel cijfer: een WMT26-score van 83,60, die stijgt naar 84,36 onder een agentische workflow met meerdere doorgangen. Er wordt geen metriek genoemd op de modelkaart of in de release-opmerking, en er is geen WMT26-resultatenpagina voor dit model gepubliceerd. Die asymmetrie is geen bewijs dat het model van Cohere zwakker of sterker is. Het betekent dat de vergelijking die een lezer het liefst wil — dezelfde test, dezelfde metriek, beide modellen — niet kan worden gemaakt op basis van openbaar bewijs, en het vierpuntsverschil binnen de twee eigen cijfers van Cohere (83,60 tot 84,36) is al groter dan de meeste verschillen in de tabel van Tencent.
Talen en het lange document
North Small Translate 1.0 dekt vijftig talen en localevarianten, waarbij Modern Standaardarabisch, Duits, Frans, Japans, Koreaans, Russisch en Oekraïens als tier één zijn aangemerkt, en het accepteert en genereert 16.000 tokens aan beide zijden. Hy-MT2-7B dekt drieëndertig talen plus vijf minderheidstalen en dialecten, waaronder Tibetaans, Oeigoers en Kantonees. Geen van beide lijsten is een superset van de andere — Tencent bereikt Kantonees en Oeigoers, Cohere bereikt een bredere reeks Europese locales — dus een meertalige implementatie kan vaststellen dat ze beide nodig heeft, alleen al op basis van dekking.
Het uitvoervenster is het rustigere verschil. Zestienduizend tokens aan output betekent een volledig proceduredocument in één keer, met terminologie en register die consistent zijn over het geheel, omdat het model alles heeft gezien. Een 8K-venster doet dat niet, en de workaround per zin herintroduceert precies de consistentieproblemen tussen segmenten die benchmarks voor het opvolgen van vertaalinstructies zoals IFMTBench juist zijn ontworpen om te meten.

De licentie, opnieuw, beslist meer dan de tabel
North Small Translate 1.0 valt onder CC BY-NC 4.0. De gewichten zijn gratis voor niet-commercieel werk, en commerciële uitrol verloopt via Cohere's Model Vault onder een gekochte licentie zonder gepubliceerde prijs. Hy-MT2-7B is Apache 2.0 en zonder toegangsdrempel — commercieel gebruik, fine-tuning en afgeleiden zijn allemaal toegestaan zonder overleg. Voor een commercieel product schrijft de volgorde van uitvoering zichzelf voor: Hy-MT2-7B is vandaag inzetbaar en het model van Cohere is vandaag te evalueren, en geen enkele benchmarkregel verandert die volgorde.
Het compenserende voordeel van Cohere is de gratis tier. North Small Translate 1.0 draait op de gratis tier van Chat V2, gratis voor zowel proef- als productiesleutels totdat de snelheidslimieten zijn bereikt, dus een evaluatie kost alleen tijd. Hy-MT2-7B heeft een gehoste commerciële API — Tencent heeft de gehoste tier van de familie geprijsd op ongeveer $0,044 per miljoen inputtokens en $0,177 per miljoen outputtokens — en zelf hosten op je eigen GPU is de werkelijk gratis route.
Wat 'multi-pass' in werkelijkheid betekent
Coheres beslissing om zowel een 83,60 als een 84,36 te publiceren is het meest informatieve detail in de releasenote, want het zegt dat het bedrijf gelooft dat een workflow beter is dan één enkele aanroep. Dat is dezelfde gok die Tencent waagde met een ander mechanisme: zijn vlaggenschip 30B-A3B wint op GEMBA en XCOMET, terwijl Gemini 3.1 Pro wint op FLORES-200, wat betekent dat het beste systeem niet één model is maar een panel. OrcaRouters modelfusie laat meerdere modellen als een panel draaien en verzoent hun antwoorden binnen één enkele aanroep, wat de platformbrede versie is van het multi-pass-idee dat beide leveranciers najagen — en het combineert met de routeringskant, waar één sleutel een catalogus van meer dan 200 modellen dekt tegen de listprijs van de provider met 0% markup, zodat een prijswijziging van een leverancier dezelfde dag bij ons landt in plaats van bij de volgende contractverlenging.
Die framing lost ook het bewijsprobleem op waarmee dit artikel opende. Wanneer twee leveranciers niet-overlappende benchmarks publiceren en geen van beide een onafhankelijke evaluatie heeft, is de manier om te kiezen niet om een tabel te vertrouwen. Het is om beide op je eigen documenten te draaien en de onenigheid zichtbaar te laten worden op echte tekst — precies waarvoor een panel en een failover-keten dienen.

Welke, en wanneer?
Als u een vertaalmodel nodig hebt dat op hardware draait die u al bezit, in een commercieel product, zonder een licentiegesprek, dan wint Hy-MT2-7B alleen al op basis van de prestatie-envelop — en de door de leverancier gepubliceerde resultaten zijn, ongereproduceerd als ze zijn, ten minste benoemd, vergelijkbaar en dicht bij de frontier. Als u lange documenten naar Cohere's vijftig talen vertaalt, 16K consistente output per pass nodig hebt, en ofwel een budget voor twee B200's hebt of bereid bent de evaluatie op Cohere's gratis tier uit te voeren voordat u beslist, dan is North Small Translate 1.0 de capabelere machine op elke bekendgemaakte as.
Wat geen van beide modellen doet, is de noodzaak om te testen wegnemen. Cohere heeft je één niet nader genoemd getal gegeven en een gratis manier om het te controleren. Tencent heeft je een tabel gegeven en een download ter grootte van een GPU. De 83,60 is een belofte, geen resultaat — en de enige plek waar die belofte wordt ingelost, is op je eigen corpus.
