En hero-titelkort för 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B' med undertexten 'Den täta sötpunkten eller MoE-flaggskeppet till samma pris', som visar två modellstackikoner med ett likhetstecken mellan dem och två identiska prislappschips märkta $0,074 / $0,295, med OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: Den täta sötpunkten eller MoE-flaggskeppet till samma pris

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Här är överraskningen i hjärtat av denna jämförelse: Tencent Hy-MT2-7B, en tät 7B-modell, och Tencent Hy-MT2-30B-A3B, flaggskeppet med mixture-of-experts-arkitektur, med 30 miljarder parametrar totalt och cirka 3 miljarder aktiva, blev båda anropsbara via hostade API:er den här veckan — 7B-modellen runt den 19 augusti 2026, 30B-A3B en dag senare, båda tillhandahållna av Tencent Cloud — till exakt samma pris: 0,074 USD per miljon inmatningstokens och 0,295 USD per miljon utmatningstokens. Familjen släpptes som öppen källkod tillsammans den 21 maj 2026, så ingen av modellerna är ny; det är det identiska API-priset som gör denna jämförelse verkligt märklig. Vanligtvis kostar den större modellen mer, och man väger prispåslaget mot vinsten. Här kostar flaggskeppet inget extra per token, och beslutet reduceras till en enda fråga: vad, om något, avstår 7B-modellen från genom att vara tät och liten?

Överraskningen med samma pris

Prispariteten hos 30B-A3B är MoE-kapet som gör sitt jobb. Dess arkitektur rymmer 30B lagrad kunskap men aktiverar endast omkring 3B per token, så Tencent Cloud kan servera den till samma per-token-pris som 7B — samma $0.074 / $0.295, samma 8,192-tokens kontext, samma stöd för strukturerad utdata, samma begränsning utan funktionsanrop. På API:et är "professional"-modellen inte dyrare. Haken flyttas någon annanstans: till minnesavtryck, serveringskomplexitet och latens, där 7B:s tätare och enklare design har strukturella fördelar som ett per-token-pris inte kan uttrycka.

Specifikationer, sida vid sida

Arkitektur — tät ~7B jämfört med MoE 30B totalt / ~3B aktiva.

API-pris — $0,074 / $0,295 vs $0,074 / $0,295 per 1M tokens (identiskt).

Kontext — båda 8 192 tokens.

Positionering — balanserad sweet spot vs professionellt flaggskepp.

FLORES-200 — 7B: 86.89 XCOMET-XXL, ≈97.9% av Gemini 3.1 Pro (Think); 30B-A3B: familjens bästa allmänna översättningsresultat (siffror rapporterade av leverantören).

Deep​Seek / K​imi jämförelse — båda överträffar DeepSeek-V4-Pro och Kimi K2.6 i snabbtänkande-läge, enligt leverantören.

Fotavtryck — en enda A100 / RTX 4090 jämfört med vikter i 30B-skala (en kvantiserad modell i 18GB-klassen på disk och mer i VRAM).

Standardvärden för inferens — temp 0.7, top_p 0.6, top_k 20 jämfört med temp 0.7, top_p 1.0, top_k -1.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B — the scoreboard'. Left column Hy-MT2-7B: Architecture dense 7B; API price $0.074 / $0.295; FLORES-200 86.89; Context 8,192; Footprint single GPU; Role balanced sweet spot. Right column Hy-MT2-30B-A3B: Architecture MoE 30B / 3B active; API price $0.074 / $0.295; FLORES-200 tops the family; Context 8,192; Footprint data-center VRAM; Role professional-grade. Footer: Prices identical as listed Aug 2026; figures vendor-reported.

Där 30B-A3B faktiskt vinner

Tencent positionerar 30B-A3B som familjens professionella medlem, och den evidens företaget publicerar stöder den beteckningen för en specifik typ av text. På domäntungt material – juridiska klausuler, medicinsk text, teknisk dokumentation – är dess GEMBA-linje på DomainMTBench den starkaste i familjen, rapporterad till cirka 99 % av Gemini 2.5 Pro-baslinjen, och dess allmänna översättningspoäng överträffar 7B:ns på familjens egen FLORES-kurva. Den där vilande extra kunskapen på 27B är precis den typ av kapacitet som visar sig när en mening bär tät terminologi snarare än vanlig prosa: en kontraktsklausul med lydelsen ”skadeståndsskyldigheten ska överleva avtalets upphörande” belastar inte en 7B-modell särskilt mycket, men ett fullständigt M&A-dokument med en ordlista gör det. 30B-A3B är också det säkraste valet för kinesiska-till-minoritetsspråk-par (tibetanska, uiguriska, mongoliska), där Tencent rapporterar sina bästa siffror.

Där 7B vinner ändå

7B:ns fördelar är operativa, och de är verkliga. För det första, självhosting: 7B ryms på en enda A100 eller RTX 4090 och har den bredaste ramverkssupporten – Transformers, vLLM, SGLang och llama.cpp via GGUF är alla utprovade. 30B-A3B, även kvantiserad, kräver VRAM i datacenterklass och färre har kört den genom produktionsservingsstackar. För det andra, latens och enkel servering: en tät 7B är lättare att hålla varm, och dess rekommenderade sampling ligger närmare en standardavkodning. För det tredje, på API:n betyder det identiska priset att 7B kostar exakt lika mycket per token som flaggskeppet – så det enda skälet att välja den mindre modellen är att för ren generell text är kvalitetsskillnaden för tunn för att märkas. 7B ligger redan på ungefär 97,9 % av Gemini 3.1 Pro (Think) på FLORES-200; flaggskeppets extra poäng sitter ovanpå en kurva där varje enskild poäng är svårare att se i praktiken.

Klyftan, ärligt mätt

Allt i de två sista avsnitten är Tencent's egen utvärdering, och det ärliga sättet att läsa det är att de två modellerna ligger tillräckligt nära varandra i vanlig översättning för att ditt korpus ska avgöra. På allmän ren text innebär 7B-modellens ~97,9%-av-Gemini-poäng att flaggskeppets marginal mäts i små XCOMET-bråkdelar — verkliga på en leaderboard, svåra att känna i en supportärende. På täta domänspecifika texter och språkpar med minoritetsspråk ligger flaggskeppets rapporterade GEMBA- och FLORES-försprång precis där en professionell översättare (människa eller modell) förtjänar sitt existensberättigande, och där en nyöversättning är som dyrast. Det finns ingen oberoende benchmark för någon av modellerna i skrivande stund; det enda båda leverantörernas specifikationer är överens om är att varje storlek slår DeepSeek-V4-Pro och Kimi K2.6 i familjens snabbtänkta läge.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-30B-A3B (captured August 23 2026) showing the MoE architecture (30B total / 3B active), Apache-2.0 license, and the professional-grade positioning.

Routa familjen

Ingen av modellerna finns i OrcaRouters katalog i skrivande stund, så båda tillhandahålls via Tencents eget moln och flera tredjepartsplattformar. Routinglektionen är fortfarande den praktiska. Eftersom API-priserna är identiska är detta ett skolexempel på workload-routing snarare än ett enda val: skicka den högvolymiga generella översättningsdelen till 7B och den täta, domäntunga delen till 30B-A3B, med automatisk failover så att en latensspik på MoE-slutpunkten aldrig stoppar pipelinen. Det är det mönster som OrcaRouters routing-DSL komponerar över de 200+ modeller vi faktiskt erbjuder — kostnadsviktad dirigering, leverantörens listpris skickas vidare med 0 % påslag — och det passar den här familjen bättre än de flesta, eftersom leverantören har prissatt de två nivåerna för att göra uppdelningen ekonomiskt neutral.

Domen

Vid identiska API-priser är standardvalet 7B: samma kostnad per token, enklare att själv hosta, och inom ett hårstrå från flaggskeppet på generell text. Välj 30B-A3B när korpusen är professionellt tät — juridisk, medicinsk, teknisk eller minoritetsspråkig översättning — där flaggskeppets rapporterade domänfördel är värd det större fotavtrycket och latensen. Och om din arbetsbelastning är en blandning av båda, välj inte: dirigera den generella delen till 7B och den svåra delen till flaggskeppet. Det är ingen kompromiss mellan de två; det är det enda sättet att få båda till det pris Tencent satt.

A generated infographic titled 'Same price, different model' with two identical cards both labelled '$0.074 / $0.295 per 1M tokens': one 'Dense 7B — simpler to serve, near-flagship on clean text', the other 'MoE 30B-A3B — 30B knowledge, 3B active, professional domains', with the footer 'The MoE bargain: bigger model, same per-token cost.'

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube