
Tencent Hy-MT2-7B har nu ett värdbaserat API: Vad en översättare för $0,295 per miljon utdata förändrar
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
Tencent Hy-MT2-7B, den öppen källkods-översättningsmodellen från Tencent Hunyuan, som släpptes den 21 maj 2026, blev möjlig att anropa via ett värdbaserat API denna vecka: runt den 19 augusti 2026 blev den täta 7B-modellen live på Tencent Clouds värdbaserade slutpunkt för 0,074 USD per miljon inmatningstokens och 0,295 USD per miljon utdatatokens, med ett kontextfönster på 8 192 tokens. Den kom inte ensam — Tencent Hy-MT2-1.8B och Tencent Hy-MT2-30B-A3B dök upp på samma backend inom en dag. Vikterna har legat på Hugging Face och ModelScope i tre månader; det nya är att ett team nu kan anropa grejen utan att hyra en GPU, bygga llama.cpp från källkod eller leverera 1.25-bit-on-device-verktygskedjan. För en översättningsarbetsbelastning är det skillnaden mellan ett experiment och ett produktbeslut.
Vad som precis släpptes
Den kommersiella slutpunkten är Tencent Clouds egen, exponerad via leverantörens API och flera tredjepartsplattformar. De tre storlekarna körs var och en i en 8K-kontext med slutföranden på 4 096 token; alla tre accepterar strukturerad utdata via ett JSON-schema i sitt response_format-fält, och ingen av dem implementerar funktionsanrop. Den praktiska specifikationen, en rad per dimension:
• Tencent Hy-MT2-7B — $0,074 in / $0,295 ut per 1M tokens, 8 192 kontext, tät ~7B, strukturerad utdata stöds, inga verktygsanrop.
• Tencent Hy-MT2-1.8B — 0,044 USD in / 0,177 USD ut per 1 miljon tokens, kontext på 8 192, tät 1,8B, inga verktygsanrop.
• Tencent Hy-MT2-30B-A3B — $0.074 in / $0.295 ut per 1M tokens, 8 192 kontext, MoE 30B totalt / 3B aktiv, strukturerad utdata stöds, inga verktygsanrop.
Den mest framträdande prispunkten är 7B-modellens utdatatakt: under tre tiondelar av en cent per tusen utdatatokens, för en modell som Tencent hävdar står sig mot modeller som är en storleksordning större. Översättning är en av de få LLM-arbetsbelastningar där utdatatokens utgör nästan hela kostnaden, så utdatapriset är den siffra som avgör om en pipeline är lönsam i volym.

Modellen bakom endpointen
Hy-MT2 är Tencents "snabbtänkande" familj: i stället för att lägga långa tankekedjor på varje mening är den utformad att reagera som en professionell översättare gör — eftertänksam där källan är tvetydig, snabb där den inte är det. 7B-modellen är den balanserade mitten av familjen, en tät modell licensierad under Apache-2.0, som täcker 33 språk plus fem kinesiska minoritetsspråk och dialektpar (bland dem tibetanska, kazakiska, mongoliska, uiguriska och kantonesiska). Det som skiljer den från en generisk LLM som översätter är instruktionsföljning: den håller en ordlisteterm genom ett dokument, tillämpar en specificerad stil, lämnar avgränsare och JSON-nycklar orörda och tar emot personanpassningsinstruktioner i klarspråk. Tencent släppte IFMTBench, en öppen benchmark för just den förmågan, tillsammans med vikterna, och konsumentgränssnittet — Tencent Hy Translate-miniprogrammet, med iOS- och Android-appar på väg — är byggt på denna familj.

Siffrorna, med asterisken bifogad.
Allt nedan är Tencents egen utvärdering, publicerad på modellkortet och i den medföljande rapporten; inget av detta har oberoende reproducerats i skrivande stund. På FLORES-200:s XX⇔XX-spår för allmän översättning uppnår 7B-modellen 86.89 XCOMET-XXL, vilket Tencent anger som ungefär 97.9 % av Gemini 3.1 Pro (Think). I sitt ”fast-thinking”-läge hävdas den överträffa generella modeller med öppen källkod, inklusive DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B och Gemma4-26B-A4B. På WMT25 förbättras dess resultat genomgående jämfört med föregående generation — 63.86/71.21/82.24 mot Hy-MT1.5-7B:s 61.59/68.85/75.91, med den största förbättringen på GEMBA — och på DomainMTBench (finans, politik, utbildning) noterar den 94.92 XCOMET / 92.79 GEMBA. Det är i instruktionsföljning som den tydligast skiljer sig från översättningsmodeller från för ett år sedan: 89.73 enkelt / 72.67 komplext / 83.14 totalt på IFMTBench.
Vad ett värdbaserat API förändrar för en översättningspipeline
Att self-hosta 7B är verkligen enkelt, så enkelt som sådant nu kan vara — den körs på en enda A100 eller RTX 4090, och kvantiserade FP8- och GGUF-byggen finns. Men "lätt att self-hosta" är inte "noll drift." GGUF-vägen är för närvarande beroende av llama.cpp med Tencents STQ-kernel, FP8-vägen kräver rätt stack, och någon måste sitta och passa den. En hostad endpoint tar bort allt det där: ingen GPU, inget kernelbygge, ingen kapacitetsplanering, och ett pris per token som är fast oavsett utnyttjande. För ett team som bearbetar miljontals översatta meningar om dagen väger den förutsägbarheten tyngre än benchmarkens rubriksiffra — och det är anledningen till att den här veckan betyder mer än majlanseringen gjorde.

Routeringsfrågan som ingen ställer ännu
Eftersom modellen är tre dagar gammal på API-sidan är det realistiska sättet att använda den detsamma som för vilken helt ny leverantör som helst: placera den bakom en routingregel med automatisk växling så att en otestad slutpunkt aldrig kan ta ner en produktionssökväg, och låt volymen avgöra om den förtjänar en permanent plats. Det är just det mönster som OrcaRouters routing-DSL komponerar över de 200+ modeller vi faktiskt har — och det är värt att vara precis här: Tencent Hy-MT2-7B finns inte i OrcaRouters katalog i skrivande stund, så detta är inte en "call it through us"-historia. Det som är relevant är prismodellen. OrcaRouter förmedlar varje leverantörs listpris med 0 % påslag, så när en leverantör sänker priset är sänkningen live på plattformen samma dag. För en högvolymöversättningsarbetsbelastning är frågan att ställa till vilken slutpunkt som helst inte "vad är portalpriset idag" utan "vad är det faktiska per-token listpriset som leverantören tar ut, och finns det något som ligger mellan det och mig." Vid $0.295/M utdata har Tencent Hy-MT2-7B just gjort den frågan intressant.
Vad du ska titta på härnäst
Tre saker följer av denna vecka. För det första är 1.8B- och 30B-A3B-syskonen nu lika anropsbara, så beslutet om "vilken storlek" är en verklig API-fråga snarare än ett beslut om självhysning (familjen har egna jämförelsesidor, men den korta versionen är: 1.8B för enhet och den billigaste nivån, 30B-A3B för professionella domäner, 7B däremellan). För det andra erbjuder Tencent priser genom sitt WMT26-partnerskap till team som använder Hy-MT-modeller i uppgifterna General Machine Translation och Video Subtitle Translation — en signal om att Tencent avser att göra denna familj till standard för öppen översättning inom konkurrenskraftig MT. För det tredje, om iOS- och Android-apparna med inferens på enheten levereras som annonserat, kommer de att göra 1.8B till den mest installerade öppna översättningsmodellen i världen. Den hostade API:n är den del som förändrades denna vecka; familjens bana fastställdes i maj.
