
Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: De dense sweet spot of het MoE-vlaggenschip voor dezelfde prijs
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
Dit is de verrassing in het hart van deze vergelijking: Tencent Hy-MT2-7B, een dense 7B-model, en Tencent Hy-MT2-30B-A3B, het mixture-of-experts-vlaggenschip met in totaal 30 miljard parameters en ongeveer 3 miljard actieve parameters, zijn deze week beide aanroepbaar geworden via gehoste API's — de 7B rond 19 augustus 2026, de 30B-A3B een dag later, beide aangeboden door Tencent Cloud — tegen exact dezelfde prijs: $0,074 per miljoen inputtokens en $0,295 per miljoen outputtokens. De familie werd op 21 mei 2026 gezamenlijk als open source uitgebracht, dus geen van beide modellen is nieuw; het is de identieke API-prijs die deze vergelijking werkelijk vreemd maakt. Gewoonlijk kost het grotere model meer en weeg je de meerprijs af tegen de winst. Hier kost het vlaggenschip niets extra's per token, en de beslissing komt neer op één enkele vraag: wat levert de 7B, als het al iets is, in door dense en klein te zijn?
De verrassing van dezelfde prijs
De prijspariteit van de 30B-A3B is het MoE-koopje dat zijn werk doet. Zijn architectuur bevat 30B aan opgeslagen kennis, maar activeert slechts ongeveer 3B per token, zodat Tencent Cloud het tegen hetzelfde tarief per token kan aanbieden als de 7B — dezelfde $0,074 / $0,295, dezelfde context van 8.192 tokens, dezelfde ondersteuning voor gestructureerde uitvoer, dezelfde beperking zonder functieaanroepen. Op de API is het "professional"-model niet duurder. Het addertje verschuift naar elders: naar geheugenvoetafdruk, serveringscomplexiteit en latentie, waar het dichtere, eenvoudigere ontwerp van de 7B structurele voordelen heeft die een prijs per token niet kan uitdrukken.
Specs naast elkaar
• Architectuur — dense ~7B vs MoE 30B totaal / ~3B actief.
• API-prijs — $0.074 / $0.295 vs $0.074 / $0.295 per 1M tokens (identiek).
• Context — beide 8.192 tokens.
• Positionering — evenwichtig middenpunt versus professioneel vlaggenschip.
• FLORES-200 — 7B: 86.89 XCOMET-XXL, ≈97.9% van Gemini 3.1 Pro (Think); 30B-A3B: de beste algemene vertaalscore van de familie (cijfers door leverancier gerapporteerd).
• vergelijking tussen DeepSeek en Kimi — beide verslaan DeepSeek-V4-Pro en Kimi K2.6 in de snelle denkmodus, volgens de leverancier.
• Voetafdruk — één A100 / RTX 4090 versus gewichten op 30B-schaal (een gekwantiseerde build van 18GB-klasse op schijf en meer in VRAM).
• Standaardinstellingen voor inferentie — temp 0.7, top_p 0.6, top_k 20 vs temp 0.7, top_p 1.0, top_k -1.

Waar de 30B-A3B daadwerkelijk wint
Tencent positioneert de 30B-A3B als het professionele lid van de familie, en het bewijs dat het publiceert ondersteunt dat label voor een specifiek soort tekst. Op domein-intensief materiaal — juridische clausules, medische teksten, technische documentatie — is de GEMBA-lijn op DomainMTBench de sterkste in de familie, gerapporteerd op ongeveer 99% van de Gemini 2.5 Pro-basislijn, en de algemene vertaalscore overtreft die van de 7B op de eigen FLORES-curve van de familie. Die sluimerende 27B aan extra kennis is precies het soort capaciteit dat naar voren komt wanneer een zin dichte terminologie bevat in plaats van gewoon proza: een contractbepaling als 'de vrijwaringsverplichting blijft van kracht na beëindiging' kost een 7B-model niet veel moeite, maar een volledig M&A-document met een woordenlijst wel. De 30B-A3B is ook de veiligste keuze voor Chinees-naar-minderheidstaalparen (Tibetaans, Oeigoers, Mongools), waar Tencent de beste cijfers rapporteert.
Waar de 7B toch wint
De voordelen van de 7B zijn operationeel en ze zijn echt. Ten eerste, self-hosting: de 7B past op een enkele A100 of RTX 4090 en heeft de breedste framework-dekking — Transformers, vLLM, SGLang en llama.cpp via GGUF worden allemaal getest. De 30B-A3B vereist, zelfs gekwantiseerd, VRAM op datacenterschaal en minder mensen hebben het in productie-serving-stacks getest. Ten tweede, latentie en serveringsgemak: een dichte 7B is gemakkelijker warm te houden, en de aanbevolen sampling ligt dichter bij een standaard decode. Ten derde, op de API betekent de identieke prijs dat de 7B exact hetzelfde per token kost als het vlaggenschip — dus de enige reden om het kleinere model te nemen is dat bij schone algemene tekst het kwaliteitsverschil te klein is om op te merken. De 7B haalt op FLORES-200 al ongeveer 97,9% van Gemini 3.1 Pro (Think); de extra punten van het vlaggenschip liggen bovenop een curve waar elk punt in de praktijk moeilijker te zien is.
De kloof, eerlijk gemeten
{{1}}Alles in de laatste twee secties{{/1}} {{2}}is Tencents eigen evaluatie{{/2}}, {{3}}en de eerlijke manier om het te lezen{{/3}} {{4}}is dat de twee modellen dicht genoeg bij elkaar liggen{{/4}} {{5}}voor gewone vertaling{{/5}} {{6}}dat jouw corpus de doorslag geeft{{/6}}. {{7}}Wat betreft algemene schone tekst{{/7}}, {{8}}de ~97.9%-van-Gemini-score van de 7B{{/8}} {{9}}houdt in dat de marge van het vlaggenschip{{/9}} {{10}}wordt gemeten in kleine XCOMET-fracties{{/10}} — {{11}}merkbaar op een leaderboard{{/11}}, {{12}}moeilijk te voelen in een supportticket{{/12}}. {{13}}Wat betreft dichte domeintekst en minderheidstalparen{{/13}}, {{14}}de gerapporteerde GEMBA- en FLORES-voorsprongen van het vlaggenschip{{/14}} {{15}}zijn precies waar een professionele vertaler (mens of model) zijn waarde bewijst{{/15}}, {{16}}en waar een hervertaling het duurst is{{/16}}. {{17}}Er is op het moment van schrijven geen onafhankelijke benchmark voor een van beide modellen{{/17}}; {{18}}het enige punt waar beide leverancierskaarten het over eens zijn{{/18}} {{19}}is dat elke modelgrootte DeepSeek-V4-Pro en Kimi K2.6 verslaat{{/19}} {{20}}in de snelle denkmodus van de familie{{/20}}.

Het routeren van de familie
Geen van beide modellen staat op het moment van schrijven in de catalogus van OrcaRouter, dus beide worden aangeboden via de eigen cloud van Tencent en verschillende externe platforms. De routeringsles is nog steeds de praktische. Omdat de API-prijzen identiek zijn, is dit een schoolvoorbeeld van workload-routing in plaats van één vaste keuze: stuur het deel met grote volumes algemene vertalingen naar de 7B en het dichte, domeinrijke deel naar de 30B-A3B, met automatische failover, zodat een latentiepiek op het MoE-endpoint de pijplijn nooit stillegt. Dat is het patroon dat de routing-DSL van OrcaRouter samenstelt over de 200+ modellen die we wél voeren — kostengewogen dispatch, de lijstprijs van de provider doorberekend tegen 0% opslag — en het past beter bij deze familie dan bij de meeste, omdat de leverancier de twee lagen zo heeft geprijsd dat de splitsing economisch neutraal is.
Het vonnis
Bij identieke API-prijzen is het standaardantwoord de 7B: dezelfde kosten per token, eenvoudiger om zelf te hosten, en op een haar na gelijk bij algemene teksten. Kies de 30B-A3B wanneer het corpus professioneel intensief is — juridisch, medisch, technisch, of vertaling van minderheidstalen — waar het gerapporteerde domeinvoordeel van het vlaggenschip de grotere voetafdruk en de latentie waard is. En als je workload een mix van beide is, kies dan niet: stuur het algemene deel naar de 7B en het moeilijke deel naar het vlaggenschip. Dat is geen compromis tussen de twee; het is de enige manier om beide te krijgen voor de prijs die Tencent heeft vastgesteld.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
