Hero-kort med rubriken "North Small Translate 1.0 vs Hy-MT2-1.8B" och underrubriken "218 GB modell mot 440 MB", ovanför två kort: North Small Translate 1.0 (218B MoE, minst 2x B200) och Hy-MT2-1.8B (1,8B dense, 440 MB, körs på en mobil) med en konturikon föreställande en telefon.
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-1.8B: 218 GB modell mot 440 MB

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

En av dessa får plats på en telefon. Hy-MT2-1.8B, Tencent Hunyuans enhetsbaserade översättningsmodell med öppen källkod under Apache 2.0 den 21 maj 2026, krymper till 440 megabyte med AngelSlim 1,25-bitars kvantisering och körs på telefonkretsar från Apple, Qualcomm och MediaTek. North Small Translate 1.0, Coheres mixture-of-experts-modell med 218 miljarder parametrar som Cohere dokumenterade i sina versionsanteckningar den 9 september 2026, levereras med en FP8-viktuppsättning i storleksordningen 218 gigabyte och kräver minst två B200. Det är ungefär femhundra gånger lagringsutrymmet för en av dem, och den intressanta frågan är inte vilken som är bättre — det är vad var och en faktiskt är till för, och vilken licens som låter dig distribuera den.

Storleksskillnaden är inte en kvalitetsskillnad

Det är frestande att läsa 218B mot 1.8B som en direkt rangordning av förmåga. Det är det inte, av två skäl. Det första är att North Small Translate 1.0 är en gles mixture-of-experts-modell med endast 25 miljarder parametrar aktiva per token, så beräkningsmängden per token ligger i en annan liga än parameterantalet. Det andra är att de två modellerna optimerades mot olika mål: Tencents 1.8B byggdes för att vara tillräckligt litet för att kunna köras offline på en mobil, och Coheres modell byggdes för att hålla ett helt dokument i kontexten och översätta det som en enhet.

Den skillnaden är avläsbar i kontextfönstren. Konfigurationen för Hy-MT2-1.8B anger upp till 262 144 positioner, men Tencents egen vägledning för inferens begränsar genereringen till 8 192 token – det praktiska arbetsfönstret är 8K. North Small Translate 1.0 dokumenterar 16K in och 16K ut, vilket är dubbelt så stort som indatafönstret och, ännu viktigare, hela 16K utdata. Om din arbetsenhet är en servicemanual är den där utdatabudgeten själva finessen. Om din arbetsenhet är ett chattmeddelande är den irrelevant.

Totalt antal parametrar — North Small Translate 1.0: 218B MoE, 25B aktiva vs Hy-MT2-1.8B: 1,8B dense

Kontext — 16K in och 16K ut mot 8K arbetsfönster (konfigurationen annonserar upp till 262 144 positioner; Tencents riktlinjer säger 8 192)

Språk — 50 (engelska + 49) mot 33 språk plus 5 minoritetsspråk och dialekter

Licens — CC BY-NC 4.0, kommersiell via Model Vault vs Apache 2.0, ostängd

Kvantiserat minnesavtryck — FP8 ~218 GB, NVFP4 W4A16 ~109 GB mot 440 MB vid 1,25-bit, FP8 och GGUF har också publicerats

Minimikrav på hårdvara — 2×B200 eller 4×H100 vid FP8 mot en mobil

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-1.8B across six rows: Parameters 218B MoE / 25B active vs 1.8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Footprint about 218GB at FP8 vs 440MB at 1.25-bit; Minimum hardware 2x B200 vs a handset. Footer notes Hy-MT2 figures are vendor-reported by Tencent and Cohere's WMT26 83.60 is unaudited with an unnamed metric.

Vad Tencent faktiskt släppte i 1,8B

1.8B är den minsta medlemmen i en familj med tre modeller — 1.8B, 7B och en 30B-A3B MoE-flaggskip — alla släppta tillsammans med ett medföljande benchmark som heter IFMTBench, som mäter hur väl instruktioner för översättning följs snarare än rå översättningskvalitet. Tencent levererade FP8-, GGUF-, 2-bitars- och 1,25-bitarskvantiseringar tillsammans med basvikterna, och det är 1,25-bitsversionen som ger siffran 440 MB och en påstådd 1,5 gångers snabbare inferens jämfört med den tidigare Hy-MT1.5-generationen. Serving stöds via transformers 5.6.0 och senare, vLLM, SGLang och llama.cpp, där GGUF-vägen är beroende av en STQ-kärna som har landat i llama.cpp. Rekommenderad sampling är temperature 0,7, top_p 0,6, top_k 20, repetition penalty 1,05, och det finns ingen standardsystemprompt — motsatsen till Coheres tillvägagångssätt.

Den är också, till skillnad från North Small Translate 1.0, en modell med synlig adoption. Hugging Face-repot har laddats ner mer än 23 000 gånger och har omkring 1 200 gillningar. Coheres huvudrepo visade 26 nedladdningar och noll gillningar när detta skrevs.

Licensen är den skarpare skillnaden

Detta är den del som borde avgöra fler driftsättningar än benchmarktabellen gör. Hy-MT2-1.8B är Apache 2.0 utan gating – kommersiell användning, finjustering, derivatverk och vidaredistribution är allt tillåtet. North Small Translate 1.0 är CC BY-NC 4.0: vikterna är fria för icke-kommersiell användning, och kommersiell driftsättning kräver en köpt licens via Cohere's Model Vault, för vilken inget pris publiceras.

Enkelt uttryckt: om du bygger en produkt är Tencents modell den du kan leverera i dag utan en konversation, och Coheres är den du bara kan utvärdera. Den asymmetrin gör inte Cohere-modellen sämre, men den ändrar ordningen på åtgärderna – du utvärderar Coheres, och du kan driftsätta Tencents.

Kvalitetsbevis är asymmetriskt, och båda sidorna är leverantörsrapporterade.

Ingen av modellerna har en oberoende utvärdering bakom sig, så betrakta varje siffra här som ett påstående från dess tillverkare. Skillnaden ligger i hur mycket tillverkarna har lagt på bordet. Tencent publicerade en fullständig jämförelsetabell och en teknisk rapport: på FLORES-200 engelska-till-X-översättning får Hy-MT2-1.8B 90,00 mot Gemini 3.1 Pros 94,42 och GPT-5.5:s 94,16 — något efter frontmodellerna men inom några få poäng, från en modell som får plats i en telefon. På IFMTBench övergripande poäng för instruktionsföljning hamnar 1.8B på 69,36 %, långt efter sin egen 30B-A3B-syskonmodell på 85,7 % och Gemini 3.1 Pro på 89,08 %, vilket är den ärliga tolkningen av avvägningen: den lilla modellen följer formaterings- och terminologiinstruktioner mycket mindre tillförlitligt än den översätter.

Cohere publicerade en siffra – en WMT26-poäng på 83,60, som stiger till 84,36 med ett agentiskt arbetsflöde i flera pass – utan något angivet måttnamn och utan någon WMT26-resultatsida att kontrollera den mot. Det är inte en jämförelse vi kan göra. Ett enda namnlöst tal kan inte ställas mot en tabell med namngivna benchmarkar, och att låtsas något annat vore det mest vilseledande den här artikeln skulle kunna göra.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Tencents motvikt är att dess siffror kommer från något som en läsare kan granska. Hy-MT2-repositoriet publicerar familjeöversikten, de tre modellstorlekarna och de körtidsmiljöer som var och en stöder tillsammans med benchmarktabellen — vilket är vad som över huvud taget gör FLORES-200- och IFMTBench-siffrorna kontrollerbara, och vad som gör Coheres enda namnlösa siffra iögonfallande i kontrast.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Vad det kostar att ringa var och en

Tencents 1,8B har ett hostat kommersiellt API som lanserades i augusti 2026, prissatt till ungefär 0,044 USD per miljon indatatokens och 0,177 USD per miljon utdatatokens – billigt i absoluta tal och prissatt per token. Coheres modell körs på gratisnivån i Chat V2, kostnadsfri för test- och produktionsnycklar tills hastighetsgränserna nås, så utvärderingskostnaden är noll men produktionskostnaden är ett kontrakt du måste förhandla fram. Självhosting vänder helt på kalkylen: 440 MB på en mobiltelefon kontra två B200:or, vilket är en skillnad mätt i storleksordningar snarare än procent.

Anledningen till att den klyftan är värd att påpeka i en text om en routingplattform är att den billiga nivån och den dyra nivån inte är konkurrenter — de är två positioner i en kaskad, och kaskader är vad en router är till för. OrcaRouter förmedlar leverantörens listpris vidare med 0 % påslag, så en leverantörsprissänkning på en hostad översättningsendpoint är live hos oss samma dag utan att någon återförsäljarmarginal behöver omförhandlas, och failover-kedjor låter en mindre modell absorbera merparten av trafiken medan en tyngre modell tar de förfrågningar som den misslyckas med. Prova den billiga först, eskalera vid de svåra fallen och låt routinglagret hålla policyn i stället för din applikationskod.

Vilken du bör välja

Om din översättning sker på en enhet, offline, inom en lagringsbudget per megabyte, eller i en kommersiell produkt utan aptit på licensförhandlingar, är Hy-MT2-1.8B svaret och North Small Translate 1.0 är inte med i matchen. Om din arbetsenhet är ett långt dokument på ett av de femtio språk som Cohere stöder, om du behöver 16K utdata i en enda körning, och om en kommersiell licens är något som din organisation är villig att köpa, då är Coheres modell den mer kapabla maskinen i varje redovisad dimension — med förbehållet att dess kvalitet vilar på en enda icke reproducerad siffra.

Och för de flesta team är det ärliga svaret båda, i den ordningen: 440MB-modellen utför rutinarbetet till en försumbar kostnad, 218B-modellen hanterar de dokument som spelar roll, och beslutet om vilken begäran som ska gå vart är en dirigeringsregel snarare än en omskrivning. Gapet mellan dessa två modeller är inte ett gap som ska stängas. Det är ett spektrum som ska användas.