Hero-kort med rubriken "North Small Translate 1.0 vs Hy-MT2-7B" och underrubriken "En GPU mot två B200:or", ovanför två kort: North Small Translate 1.0 (218B MoE / 25B aktiv, CC BY-NC 4.0) och Hy-MT2-7B (8B dense, cirka 16 GB VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-7B: En GPU mot två B200:or

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den jämnaste matchningen inom öppen översättning just nu kan också vara den minst uppenbara. Hy-MT2-7B är mellanbarnet i Tencent Hunyuans översättningsfamilj, med öppen källkod under Apache 2.0 den 21 maj 2026, och den körs på ett enda RTX 4090 eller A100 med cirka 16 GB VRAM. North Small Translate 1.0 är Coheres glesa mixture-of-experts-översättare med 218 miljarder parametrar, dokumenterad i företagets versionsanteckningar den 9 september 2026, med en minimidriftsättning på två B200:or i FP8 eller en B200 i dess NVFP4 W4A16-form. Båda är översättningsspecialister. Båda är aktuella. En av dem kan man köra från en arbetsstation, och just det faktumet sätter hela jämförelsen i ett nytt ljus — eftersom det benchmark där de helst skulle vilja bedömas på lika villkor inte existerar.

Börja med kuvertet, inte med poängen.

Driftskostnad är den dimension som avgör de flesta verkliga integrationer, och här är de två modellerna inte ens nära varandra. Hy-MT2-7B är en dense HunYuanDenseV1-modell med ungefär åtta miljarder parametrar, med publicerade FP8- och GGUF-byggen samt communityversioner av MLX i 8-bit för Apple silicon. Tencents driftsättningsanteckningar listar transformers 5.6.0 eller senare, vLLM, SGLang och llama.cpp som runtimes som stöds, och inferensvägledningen begränsar genereringen till 8 192 tokens trots att konfigurationen annonserar upp till 262 144 positioner. Ett enda modernt konsument- eller arbetsstations-GPU räcker.

North Small Translate 1.0 är en annan klass av objekt. Dess 218B totala parametrar med 25B aktiva är uppdelade över 128 experter med åtta aktiva per token plus delade experter, och Cohere publicerar minimihårdvara för var och en av sina tre checkpoints: fyra B200 eller åtta H100 för BF16, två B200 eller fyra H100 för FP8, en B200 eller två H100 för NVFP4 W4A16-bygget. Servering körs via vLLM med cohere_melody>=0.9.0, och Cohere rekommenderar greedy-avkodning för att matcha produktionsmiljön. Utdata har <|START_TEXT|> och <|END_TEXT|> markörer som inte är registrerade som specialtokens.

Arkitektur — North Small Translate 1.0: 218B totalt / 25B aktiva, gles MoE, 128 experter mot Hy-MT2-7B: tät, cirka 8B

Kontext — 16K in och 16K ut mot ett arbetsfönster på 8K, konfigurationen anger upp till 262 144 positioner

Minimikrav på hårdvara — 1×B200 vid W4A16, 2×B200 eller 4×H100 vid FP8 jämfört med en enda RTX 4090-klassad GPU i ~16 GB

Publicerade format — BF16, FP8, NVFP4 W4A16 jämfört med bas, FP8, GGUF, samt community-MLX 8-bit

Språk — 50 (engelska + 49) mot 33 språk plus 5 minoritetsspråk och dialekter

Licens — CC BY-NC 4.0, kommersiell via Model Vault vs Apache 2.0, ostängd

Rapporterad kvalitet — WMT26 83,60, måttet ej namngivet, leverantörsrapporterat jämfört med namngivna leverantörstabeller på FLORES-200, WMT25 GEMBA, XCOMET-XXL och IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

Benchmarkproblemet

Här är den ärliga kärnan i den här jämförelsen: vi kan inte rangordna dessa två modeller mot varandra, och den som säger något annat hittar på en siffra. Tencent publicerade fyra namngivna utvärderingar. På FLORES-200 engelska-till-X-översättning får 7B-modellen 93,52, bakom Gemini 3.1 Pro:s 94,42 och GPT-5.5:s 94,16 men tillräckligt nära för att spela roll. På det WMT25-angränsande GEMBA-måttet får den 82,24 mot 30B-A3B:s 84,34 och GPT-5.5:s 83,41. På XCOMET-XXL ligger den före allt annat i Tencents jämförelsetabell med 63,86 – före Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro och Kimi K2.6. På IFMTBench:s poäng för instruktionsföljning landar den på 83,14 %. Alla dessa är Tencents egna siffror, ingen av dem har reproducerats oberoende, och de är fortfarande långt mer än vad Cohere har erbjudit.

Cohere publicerade en enda siffra: en WMT26-poäng på 83,60, som stiger till 84,36 under ett agentiskt arbetsflöde med flera pass. Ingen metrik namnges på modellkortet eller i versionsmeddelandet, och ingen resultatsida för WMT26 har publicerats för den här modellen. Den asymmetrin är inte ett bevis för att Coheres modell är svagare eller starkare. Det betyder att den jämförelse en läsare helst vill se — samma test, samma metrik, båda modellerna — inte kan göras utifrån offentliga bevis, och fyrapoängsspridningen inom Coheres egna två siffror (83,60 till 84,36) är redan större än de flesta av skillnaderna i Tencents tabell.

Språk och det långa dokumentet

North Small Translate 1.0 täcker femtio språk och språkvarianter, med modern standardarabiska, tyska, franska, japanska, koreanska, ryska och ukrainska utsedda till nivå ett, och den tar emot och sänder ut 16 000 tokens på båda sidor. Hy-MT2-7B täcker trettiotre språk plus fem minoritetsspråk och dialekter, inklusive tibetanska, uiguriska och kantonesiska. Ingen av listorna är en övermängd av den andra – Tencent når kantonesiska och uiguriska, Cohere når en bredare uppsättning europeiska språkvarianter – så en flerspråkig driftsättning kan upptäcka att den behöver båda enbart av täckningsskäl.

Utdatafönstret är den tystare skillnaden. Sextontusen output-tokens innebär ett fullständigt procedurdokument i en enda omgång, med terminologi och register konsekventa genom hela dokumentet eftersom modellen såg allt. Ett 8K-fönster gör det inte, och lösningen att arbeta mening för mening återinför precis de problem med konsekvens mellan segment som översättningsbenchmarkar för instruktionsföljning, till exempel IFMTBench, byggdes för att mäta.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Licensen avgör återigen mer än tabellen

North Small Translate 1.0 är CC BY-NC 4.0. Vikterna är gratis för icke-kommersiellt arbete, och kommersiell driftsättning sker via Coheres Model Vault under en köpt licens utan offentliggjort pris. Hy-MT2-7B är Apache 2.0 och utan åtkomstbegränsningar – kommersiell användning, finjustering och derivat är alla tillåtna utan någon konversation. För en kommersiell produkt skriver arbetsordningen sig själv: Hy-MT2-7B kan driftsättas idag och Coheres modell kan utvärderas idag, och ingen benchmark-rad ändrar den ordningen.

Coheres uppvägande fördel är gratisnivån. North Small Translate 1.0 körs på gratisnivån i Chat V2, kostnadsfritt för både test- och produktionsnycklar tills hastighetsgränserna nås, så en utvärdering kostar inget annat än tid. Hy-MT2-7B har ett hostat kommersiellt API – Tencent prissatte familjens hostade nivå till ungefär 0,044 USD per miljon indatatoken och 0,177 USD per miljon utdatatoken – och egen hosting på din egen GPU är den genuint kostnadsfria vägen.

Vad "multi-pass" faktiskt innebär

Coheres beslut att publicera både ett 83,60 och ett 84,36 är den mest informativa detaljen i deras versionsmeddelande, eftersom det säger att företaget anser att ett arbetsflöde slår ett enskilt anrop. Det är samma satsning som Tencent gjorde med en annan mekanism: deras flaggskepp 30B-A3B vinner på GEMBA och XCOMET medan Gemini 3.1 Pro vinner på FLORES-200, vilket betyder att det bästa systemet inte är en modell utan en panel. OrcaRouters modellfusion kör flera modeller som en panel och sammanjämkar deras svar inom ett enda anrop, vilket är plattformsnivåversionen av idén om flera pass som båda leverantörerna jagar – och den kombineras med routningssidan, där en nyckel täcker en katalog med fler än 200 modeller till leverantörens listpris med 0 % påslag, så en prisförändring från en leverantör landar på vår sida samma dag i stället för vid nästa avtalsförnyelse.

Den inramningen löser också det bevisproblem som den här artikeln inleddes med. När två leverantörer publicerar icke-överlappande benchmarks och ingen av dem har en oberoende utvärdering, är sättet att välja inte att lita på en tabell. Det är att köra båda på dina egna dokument och låta oenigheten träda fram i verklig text – vilket är precis vad en panel och en failover-kedja är till för.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Vilken, och när?

Om du behöver en översättningsmodell som körs på hårdvara du redan äger, i en kommersiell produkt, utan en licensdiskussion, vinner Hy-MT2-7B enbart på styrkan i själva ramen — och dess leverantörspublicerade resultat är, även om de inte har reproducerats, åtminstone namngivna, jämförbara och nära frontlinjen. Om du översätter långa dokument till Coheres femtio språk, behöver 16K konsekvent utdata per körning och antingen har en budget för två B200 eller är beredd att köra utvärderingen på Coheres gratisnivå innan du bestämmer dig, är North Small Translate 1.0 den mer kapabla maskinen i varje redovisad dimension.

Det som ingen av modellerna gör är att ta bort behovet av att testa. Cohere har gett dig ett enda namnlöst nummer och ett gratis sätt att kontrollera det. Tencent har gett dig en tabell och en nedladdning i GPU-storlek. 83,60 är ett löfte, inte ett resultat – och det enda stället där det löftet avgörs är i din egen korpus.