Een hero-titelkaart voor 'Tencent Hy-MT2-7B Now Has a Hosted API' met de ondertitel 'What a $0.295-per-Million-Output Translator Changes', met een cloudservice-icoon, een vertaalicoon, een API-verbindingslijn en een prijskaartje met het label $0.074 / $0.295 per 1M tokens, met het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Tencent Hy-MT2-7B heeft nu een gehoste API: wat een vertaler van $0,295 per miljoen output verandert

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Tencent Hy-MT2-7B, het open-source vertaalmodel Tencent Hunyuan dat op 21 mei 2026 werd uitgebracht, is deze week aanroepbaar geworden via een gehoste API: rond 19 augustus 2026 werd het dense 7B-model live op het gehoste endpoint van Tencent Cloud tegen $0,074 per miljoen invoertokens en $0,295 per miljoen uitvoertokens, met een contextvenster van 8.192 tokens. Het kwam niet alleen — Tencent Hy-MT2-1.8B en Tencent Hy-MT2-30B-A3B verschenen binnen een dag op dezelfde backend. De gewichten staan al drie maanden op Hugging Face en ModelScope; wat nieuw is, is dat een team het nu kan aanroepen zonder een GPU te huren, llama.cpp vanuit de broncode te bouwen of de 1,25-bit-on-device-toolchain te verzenden. Voor een vertaalworkload is dat het verschil tussen een experiment en een productbeslissing.

Wat er net is uitgebracht

Het commerciële eindpunt is van Tencent Cloud zelf, beschikbaar gesteld via de API van de leverancier en verschillende externe platforms. De drie formaten draaien elk in een 8K-context met 4.096-token completions; alle drie accepteren gestructureerde output via een JSON-schema in hun response_format-veld, en geen van hen implementeert function calling. De praktische specificatie, in één regel per dimensie:

Tencent Hy-MT2-7B — $0,074 in / $0,295 uit per 1M tokens, 8192 context, dense ~7B, met ondersteuning voor gestructureerde output, geen tool calls.

Tencent Hy-MT2-1.8B — $0,044 in / $0,177 uit per 1M tokens, 8.192 context, dense 1,8B, geen toolcalls.

Tencent Hy-MT2-30B-A3B — $0,074 invoer / $0,295 uitvoer per 1M tokens, 8.192 context, MoE 30B totaal / 3B actief, gestructureerde output ondersteund, geen toolcalls.

De headline-prijs is de outputsnelheid van de 7B: minder dan drie tiende van een cent per duizend outputtokens, voor een model waarvan Tencent claimt dat het standhoudt tegen modellen die een orde van grootte groter zijn. Vertaling is een van de weinige LLM-workloads waarbij outputtokens bijna de volledige rekening bepalen, dus de outputprijs is het getal dat bepaalt of een pipeline op schaal levensvatbaar is.

A single-column scoreboard titled 'Tencent Hy-MT2-7B — the scoreboard' listing six rows: Params dense 7B; Price $0.074 / $0.295 per 1M; Context 8,192 tokens; FLORES-200 86.89 (~97.9% of Gemini 3.1 Pro Think); WMT25 63.86 / 71.21 / 82.24; License Apache-2.0, with the footer 'All figures vendor-reported; API price as listed Aug 2026.'

Het model achter het eindpunt

Hy-MT2 is Tencent's 'fast-thinking'-familie: in plaats van lange denkketens aan elke zin te besteden, is het ontworpen om te reageren zoals een professionele vertaler dat doet — bedachtzaam waar de bron dubbelzinnig is, snel waar dat niet zo is. De 7B vormt het evenwichtige midden van de familie, een dicht model met een Apache-2.0-licentie, dat 33 talen bestrijkt plus vijf Chinese minderheidstaal- en dialectparen (waaronder Tibetaans, Kazachs, Mongools, Oeigoers en Kantonees). Wat het onderscheidt van een generieke LLM die vertalingen maakt, is het volgen van instructies: het handhaaft een woordenlijstterm in een document, past een opgegeven stijl toe, laat scheidingstekens en JSON-sleutels ongemoeid en accepteert personalisatie-instructies in gewone taal. Tencent heeft IFMTBench, een open benchmark voor precies die vaardigheid, samen met de gewichten uitgebracht, en het consumentengezicht — het Tencent Hy Translate-miniprogramma, met iOS- en Android-apps in de pijplijn — is op deze familie gebouwd.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-7B (captured August 23 2026) showing the model name, Apache-2.0 license, and the family description covering 33 languages plus five minority-language and dialect pairs.

De nummers, met het sterretje eraan

Alles hieronder is Tencent's eigen evaluatie, gepubliceerd op de modelkaart en in het bijbehorende rapport; niets daarvan is op dit moment onafhankelijk gereproduceerd. Op het XX⇔XX algemene-vertaaltraject van FLORES-200 scoort de 7B 86.89 XCOMET-XXL, wat Tencent schat op ongeveer 97,9% van Gemini 3.1 Pro (Think). In de "fast-thinking"-modus wordt beweerd dat het open-source algemene modellen voorbijstreft, waaronder DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B en Gemma4-26B-A4B. Op WMT25 verbeteren de scores op alle fronten ten opzichte van de vorige generatie — 63.86/71.21/82.24 tegenover 61.59/68.85/75.91 van Hy-MT1.5-7B, met de grootste winst op GEMBA — en op DomainMTBench (financiën, politiek, onderwijs) noteert het 94.92 XCOMET / 92.79 GEMBA. Het is op het gebied van instructie-opvolging dat het zich het duidelijkst onderscheidt van vertaal-LM's van een jaar geleden: 89.73 eenvoudig / 72.67 complex / 83.14 totaal op IFMTBench.

Wat een gehoste API verandert voor een vertaalpijplijn

{{1}}De 7B zelf hosten is echt makkelijk, voor zover het zulke dingen betreft — het draait op een enkele A100 of RTX 4090, en er bestaan gekwantiseerde FP8- en GGUF-builds.{{/1}} {{2}}Maar 'makkelijk zelf te hosten' is niet 'geen operationeel beheer'.{{/2}} {{3}}Het GGUF-pad hangt momenteel af van llama.cpp met de STQ-kernel van Tencent, het FP8-pad vereist de juiste stack, en iemand moet het in de gaten houden.{{/3}} {{4}}Een gehost endpoint haalt dat allemaal van tafel: geen GPU, geen kernel-build, geen capaciteitsplanning, en een prijs per token die vast is, ongeacht de bezettingsgraad.{{/4}} {{5}}Voor een team dat dagelijks miljoenen vertaalde zinnen verwerkt, doet die voorspelbaarheid er meer toe dan de spraakmakende benchmark — en dat is de reden dat deze week belangrijker is dan de lancering in mei was.{{/5}}

A screenshot of the Tencent Cloud techpedia page for Hy-MT2 (captured August 23 2026, English) showing the header 'Hy-MT2: High-Performance Multilingual Translation Model', the 2026-05-21 publication date, and a summary line about translating across 33 languages.

De routeringsvraag die nog niemand stelt

Omdat het model aan de API-kant pas drie dagen oud is, is de realistische manier om het te adopteren de manier waarop je elke gloednieuwe provider adopteert: zet het achter een routeringsregel met automatische failover, zodat een ongetest endpoint nooit een productiepad kan laten crashen, en laat het volume beslissen of het een vaste plek verdient. Dat is precies het patroon dat de routing-DSL van OrcaRouter samenstelt over de 200+ modellen die we wél voeren — en het is de moeite waard om hier precies te zijn: Tencent Hy-MT2-7B staat op het moment van schrijven niet in de catalogus van OrcaRouter, dus dit is geen verhaal van 'bel het via ons'. Wat wél ter zake doet, is het prijsmodel. OrcaRouter rekent de catalogusprijs van elke provider door met 0% opslag, dus wanneer een leverancier het tarief verlaagt, is die verlaging dezelfde dag al live op het platform. Voor een vertaalworkload met hoge volumes is de vraag die je aan elk endpoint moet stellen niet 'wat is de portalprijs vandaag', maar 'wat is de feitelijke catalogusprijs per token die de provider rekent, en zit er iets tussen die prijs en mij.' Met $0.295/M output heeft Tencent Hy-MT2-7B die vraag zojuist interessant gemaakt.

Wat nu te kijken

Uit deze week volgen drie dingen. Ten eerste: de 1.8B- en 30B-A3B-zustermodellen zijn nu gelijkwaardig aanroepbaar, dus de 'welke grootte'-keuze is een echte API-vraag in plaats van een beslissing over zelfhosting (de familie heeft eigen vergelijkingspagina's, maar de korte versie is: 1.8B voor on-device en de goedkoopste categorie, 30B-A3B voor professionele domeinen, 7B daartussenin). Ten tweede: Tencent's WMT26-partnerschap biedt prijzen aan teams die Hy-MT-modellen gebruiken bij de taken Algemene Machinevertaling en Videobijschriftvertaling — een signaal dat Tencent deze familie tot de standaard voor open vertaling in competitieve MT wil maken. Ten derde: de iOS- en Android-apps met on-device-inferentie zullen, als ze zoals aangekondigd uitkomen, de 1.8B het meest geïnstalleerde open vertaalmodel ter wereld maken. De gehoste API is het onderdeel dat deze week veranderde; de koers van de familie werd in mei uitgezet.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube