
Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: Den täta sötpunkten eller MoE-flaggskeppet till samma pris
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
Här är överraskningen i hjärtat av denna jämförelse: Tencent Hy-MT2-7B, en tät 7B-modell, och Tencent Hy-MT2-30B-A3B, flaggskeppet med mixture-of-experts-arkitektur, med 30 miljarder parametrar totalt och cirka 3 miljarder aktiva, blev båda anropsbara via hostade API:er den här veckan — 7B-modellen runt den 19 augusti 2026, 30B-A3B en dag senare, båda tillhandahållna av Tencent Cloud — till exakt samma pris: 0,074 USD per miljon inmatningstokens och 0,295 USD per miljon utmatningstokens. Familjen släpptes som öppen källkod tillsammans den 21 maj 2026, så ingen av modellerna är ny; det är det identiska API-priset som gör denna jämförelse verkligt märklig. Vanligtvis kostar den större modellen mer, och man väger prispåslaget mot vinsten. Här kostar flaggskeppet inget extra per token, och beslutet reduceras till en enda fråga: vad, om något, avstår 7B-modellen från genom att vara tät och liten?
Överraskningen med samma pris
Prispariteten hos 30B-A3B är MoE-kapet som gör sitt jobb. Dess arkitektur rymmer 30B lagrad kunskap men aktiverar endast omkring 3B per token, så Tencent Cloud kan servera den till samma per-token-pris som 7B — samma $0.074 / $0.295, samma 8,192-tokens kontext, samma stöd för strukturerad utdata, samma begränsning utan funktionsanrop. På API:et är "professional"-modellen inte dyrare. Haken flyttas någon annanstans: till minnesavtryck, serveringskomplexitet och latens, där 7B:s tätare och enklare design har strukturella fördelar som ett per-token-pris inte kan uttrycka.
Specifikationer, sida vid sida
• Arkitektur — tät ~7B jämfört med MoE 30B totalt / ~3B aktiva.
• API-pris — $0,074 / $0,295 vs $0,074 / $0,295 per 1M tokens (identiskt).
• Kontext — båda 8 192 tokens.
• Positionering — balanserad sweet spot vs professionellt flaggskepp.
• FLORES-200 — 7B: 86.89 XCOMET-XXL, ≈97.9% av Gemini 3.1 Pro (Think); 30B-A3B: familjens bästa allmänna översättningsresultat (siffror rapporterade av leverantören).
• DeepSeek / Kimi jämförelse — båda överträffar DeepSeek-V4-Pro och Kimi K2.6 i snabbtänkande-läge, enligt leverantören.
• Fotavtryck — en enda A100 / RTX 4090 jämfört med vikter i 30B-skala (en kvantiserad modell i 18GB-klassen på disk och mer i VRAM).
• Standardvärden för inferens — temp 0.7, top_p 0.6, top_k 20 jämfört med temp 0.7, top_p 1.0, top_k -1.

Där 30B-A3B faktiskt vinner
Tencent positionerar 30B-A3B som familjens professionella medlem, och den evidens företaget publicerar stöder den beteckningen för en specifik typ av text. På domäntungt material – juridiska klausuler, medicinsk text, teknisk dokumentation – är dess GEMBA-linje på DomainMTBench den starkaste i familjen, rapporterad till cirka 99 % av Gemini 2.5 Pro-baslinjen, och dess allmänna översättningspoäng överträffar 7B:ns på familjens egen FLORES-kurva. Den där vilande extra kunskapen på 27B är precis den typ av kapacitet som visar sig när en mening bär tät terminologi snarare än vanlig prosa: en kontraktsklausul med lydelsen ”skadeståndsskyldigheten ska överleva avtalets upphörande” belastar inte en 7B-modell särskilt mycket, men ett fullständigt M&A-dokument med en ordlista gör det. 30B-A3B är också det säkraste valet för kinesiska-till-minoritetsspråk-par (tibetanska, uiguriska, mongoliska), där Tencent rapporterar sina bästa siffror.
Där 7B vinner ändå
7B:ns fördelar är operativa, och de är verkliga. För det första, självhosting: 7B ryms på en enda A100 eller RTX 4090 och har den bredaste ramverkssupporten – Transformers, vLLM, SGLang och llama.cpp via GGUF är alla utprovade. 30B-A3B, även kvantiserad, kräver VRAM i datacenterklass och färre har kört den genom produktionsservingsstackar. För det andra, latens och enkel servering: en tät 7B är lättare att hålla varm, och dess rekommenderade sampling ligger närmare en standardavkodning. För det tredje, på API:n betyder det identiska priset att 7B kostar exakt lika mycket per token som flaggskeppet – så det enda skälet att välja den mindre modellen är att för ren generell text är kvalitetsskillnaden för tunn för att märkas. 7B ligger redan på ungefär 97,9 % av Gemini 3.1 Pro (Think) på FLORES-200; flaggskeppets extra poäng sitter ovanpå en kurva där varje enskild poäng är svårare att se i praktiken.
Klyftan, ärligt mätt
Allt i de två sista avsnitten är Tencent's egen utvärdering, och det ärliga sättet att läsa det är att de två modellerna ligger tillräckligt nära varandra i vanlig översättning för att ditt korpus ska avgöra. På allmän ren text innebär 7B-modellens ~97,9%-av-Gemini-poäng att flaggskeppets marginal mäts i små XCOMET-bråkdelar — verkliga på en leaderboard, svåra att känna i en supportärende. På täta domänspecifika texter och språkpar med minoritetsspråk ligger flaggskeppets rapporterade GEMBA- och FLORES-försprång precis där en professionell översättare (människa eller modell) förtjänar sitt existensberättigande, och där en nyöversättning är som dyrast. Det finns ingen oberoende benchmark för någon av modellerna i skrivande stund; det enda båda leverantörernas specifikationer är överens om är att varje storlek slår DeepSeek-V4-Pro och Kimi K2.6 i familjens snabbtänkta läge.

Routa familjen
Ingen av modellerna finns i OrcaRouters katalog i skrivande stund, så båda tillhandahålls via Tencents eget moln och flera tredjepartsplattformar. Routinglektionen är fortfarande den praktiska. Eftersom API-priserna är identiska är detta ett skolexempel på workload-routing snarare än ett enda val: skicka den högvolymiga generella översättningsdelen till 7B och den täta, domäntunga delen till 30B-A3B, med automatisk failover så att en latensspik på MoE-slutpunkten aldrig stoppar pipelinen. Det är det mönster som OrcaRouters routing-DSL komponerar över de 200+ modeller vi faktiskt erbjuder — kostnadsviktad dirigering, leverantörens listpris skickas vidare med 0 % påslag — och det passar den här familjen bättre än de flesta, eftersom leverantören har prissatt de två nivåerna för att göra uppdelningen ekonomiskt neutral.
Domen
Vid identiska API-priser är standardvalet 7B: samma kostnad per token, enklare att själv hosta, och inom ett hårstrå från flaggskeppet på generell text. Välj 30B-A3B när korpusen är professionellt tät — juridisk, medicinsk, teknisk eller minoritetsspråkig översättning — där flaggskeppets rapporterade domänfördel är värd det större fotavtrycket och latensen. Och om din arbetsbelastning är en blandning av båda, välj inte: dirigera den generella delen till 7B och den svåra delen till flaggskeppet. Det är ingen kompromiss mellan de två; det är det enda sättet att få båda till det pris Tencent satt.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
