
Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: Kvalitetsvalet på serversidan eller en 440MB-översättare på varje telefon
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
Tencent Hy-MT2-7B och Tencent Hy-MT2-1.8B är de två bokstöden i samma familj, släppta som öppen källkod tillsammans den 21 maj 2026, och båda blev anropsbara via värdbaserade API:er denna vecka – 7B-modellen runt den 19 augusti och 1.8B-modellen en dag senare, båda levererade via Tencent Cloud. De är inte konkurrenter i vanlig bemärkelse, eftersom de knappt överlappar i vad de är till för. 7B-modellen är kvalitetsvalet: en tät modell som körs på en enda GPU eller via ett API till priset av 0,074 USD per miljon inmatningstokens och 0,295 USD per miljon utmatningstokens. 1.8B-modellen är valet för lokal enhet: en modell kvantiserad ner till 440 megabyte som körs på en telefon, helt offline, till 0,044 / 0,177 USD per miljon via API-nivån. Om du väljer mellan dem avgörs svaret främst av var översättningen måste ske – och endast sekundärt av riktmärken, som ligger mycket närmare varandra än vad den fyrdubbla skillnaden i parametrar antyder.
Ettradssvaret
Välj 7B när översättning sker i ett datacenter och du vill ha bästa kvalitet per serverdollar — via ett API eller på en enskild A100-klass GPU. Välj 1.8B när översättningen måste ske på en enhet, offline, eller till lägsta möjliga kostnad per token. Om båda finns i samma moln och budget inte är den avgörande faktorn vinner 7B på kvalitet. Om innehållet är konfidentiellt, reglerat, eller måste fungera utan nätverk är 1.8B den enda av de två som kan det.
Specifikationer, sida vid sida
• Parametrar — 7B dense vs 1.8B dense.
• Kvantiserat fotavtryck — FP8 och GGUF ner till några GB jämfört med 440MB via AngelSlim 1.25-bit kvantisering.
• FLORES-200 (XX⇔XX) — 86,89 mot 79,77 XCOMET-XXL, ungefär 97,9 % mot 89,9 % av Gemini 3.1 Pro (Think), enligt leverantörens uppgifter.
• WMT25 — 7B: 63.86/71.21/82.24; 1.8B slår Microsofts och Doubaos kommersiella API:er på alla tre mätvärdena.
• DomainMTBench (GEMBA) — 92,79 mot 91,08, enligt leverantören.
• API-pris — $0,074 / $0,295 jämfört med $0,044 / $0,177 per 1M tokens (in-/utdata).
• Kontext — båda 8 192 tokens.
• Driftsättning — en A100 / RTX 4090 eller moln-API jämfört med Apple-, Qualcomm- och MediaTek-chip i enheten, offline.

Kvalitetsgapet är verkligt men smalare än storleksgapet.
Allt följande är Tencent's egen utvärdering, inte oberoende reproducerad. På FLORES-200 ligger 7B-modellen åtta XCOMET-poäng före 1.8B-modellen (86,89 mot 79,77), vilket är klyftan som den "balanserade" positioneringen gentemot den "inbyggda" (on-device) bygger på. Men på DomainMTBench – benchmarken för domänöversättning som täcker finans, politik och utbildning – hamnar 1.8B-modellen inom 1,7 GEMBA-poäng från 7B-modellen (91,08 mot 92,79). Och 1.8B-modellens ställning mot omvärlden är detaljen som fortsätter överraska: Tencent rapporterar att den slår Microsofts och Doubaos kommersiella översättnings-API:er på samtliga tre WMT25-metrics, och överträffar Tower-Plus-72B, en modell som är fyrtio gånger så stor. Så på vanlig domäntext ligger den lilla modellen mycket närmare sin stora syskonmodell än vad fyra parametrar skulle antyda. 7B-modellens verkliga fördel syns på den allmänna översättningens långa svans och på svåra instruktioner, där dess FLORES-ledning och högre IFMTBench-poäng på komplexa uppgifter skapar klar vatten skiljer de två åt.
Distributionsgaffeln
7B behöver infrastruktur — antingen ett moln-API eller en enda A100-klass GPU, med de sedvanliga operationerna. 1.8B, på 440 MB med AngelSlims 1,25-bitars kvantisering, körs på samma chips som en typisk telefonapp, är 1,5× snabbare än den tidigare Hy-MT1.5-generationen och behöver inget nätverk alls. Det förvandlar integritet från en funktion till en standard: för avtal, medicinska journaler eller något reglerat lämnar datan aldrig enheten, vilket är en egenskap som inget per-token-pris kan köpa på serversidan. Avvägningen syns på FLORES-liknande allmän översättning, där 7B:s extra kapacitet visar sig — och på alla instruktioner som är tillräckligt komplexa för att pressa 1.8B:s 83,14 IFMTBench-total mot 7B:s högre tak.

Kostnadsmatematiken
På API-nivån är båda modellerna billiga; 1.8B är billigare. Vid $0,044 / $0,177 mot $0,074 / $0,295 per miljon, ligger den lilla modellen cirka 40 % under 7B på båda sidor av räkningen — vid stadiga en miljon utdatatokens om dagen, ungefär $70 per dag mot $118. På enheten kostar 1.8B noll per token, vilket är den siffra som dominerar en serverjämförelse vid volym. 7B:s motargument är inte priset utan utrymme: om din korpus lutar åt tekniskt, juridiskt eller instruktionstungt, är 7B:s kvalitetsmarginal precis den typ av sak som visar sig som färre omöversättningar — och omöversättningar är den verkliga enhetskostnaden inom professionell maskinöversättning.

Dirigering av de två storlekarna
Ingen av modellerna finns i OrcaRouters katalog i skrivande stund, så den ärliga beskrivningen är att båda tillhandahålls via Tencents eget moln och flera tredjepartsplattformar. Jämförelsen lär fortfarande ut den routingläxa som denna blogg bygger på: när två modeller överlappar i kapacitet men skiljer sig i pris och latens, är den rationella driftsättningen inte "välj en" utan "dirigera efter arbetsbelastning" – den del med hög volym och låg svårighetsgrad till den billiga lilla modellen, den svåra delen till kvalitetsmodellen, automatisk failover så att ett avbrott i endera aldrig stoppar pipelinen. Det är precis det mönster som OrcaRouters routnings-DSL sätter samman över de 200+ modeller vi har i sortimentet, där varje leverantörs listpris skickas vidare med 0 % påslag. Om Tencents översättningsfamilj ansluter sig till katalogen, är det den naturliga nästa hyresgästen.
Domen
Om översättningen sker i ditt datacenter, ta Tencent Hy-MT2-7B — på API:et om du vill ha noll drift, på en enda GPU om du vill äga den — och sluta läsa. Om översättningen måste ske på en enhet, offline eller under sekretesskrav, ta Tencent Hy-MT2-1.8B och det 440 MB stora fotavtrycket vinner per definition. Det enda verkligt svåra fallet är en molnarbetsbelastning med medelstor volym där 7B-modellens kvalitet och 1.8B-modellens pris båda är försvarbara. Där ska du inte besluta utifrån leverantörernas benchmarks: det rapporterade GEMBA-gapet är under två poäng, så kör båda på din egen domäns text och låt dina data avgöra.
