Karta tytułowa hero dla Tencent HY-MT2 1.8B otrzymuje hostowane API, podtytuł „Translator Tencent o wielkości 440 MB trafia do chmury", przedstawiająca smartfon z glifem językowym, chmurę dostarczającą kompaktowy układ 440 MB, globus z 33 kropkami, plakietkę z datą z napisem „Open source: 21 maja 2026 · Hostowane API: 20 sierpnia 2026" oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Tencent HY-MT2 1.8B otrzymuje hostowane API: 440MB tłumacz Tencenta trafia do chmury

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tencent HY-MT2 1.8B — kompaktowy członek rodziny modeli tłumaczeniowych Hy-MT2, którą Tencent Hunyuan udostępnił jako open-source 21 maja 2026 roku — można teraz wywoływać przez hostowane komercyjne API, a nie tylko w wersji hostowanej samodzielnie. Model pojawił się w ofercie API 20 sierpnia 2026 roku w cenie około 0,044 USD za milion tokenów wejściowych i 0,177 USD za milion tokenów wyjściowych. Ta data pojawienia się w ofercie API ma większe znaczenie niż miałaby zwykle, ponieważ model 1.8B nigdy nie był tylko kolejnym otwartym checkpointem: to model, który Tencent zbudował, aby udowodnić, że skwantowany model tłumaczeniowy o rozmiarze 440 MB może działać w całości na telefonie. W ciągu trzech miesięcy od wydania open-source trafiał też do własnego miniprogramu HyTranslate firmy Tencent oraz do wydanych później aplikacji na iOS i Androida. Ten artykuł opisuje, co zmienia uruchomienie hostowanego API, czym ten model naprawdę jest i którym liczbom należy ufać.

Co tak naprawdę zmieniło się 20 sierpnia

Do tej pory korzystanie z Tencent HY-MT2 1.8B oznaczało jedną z dwóch rzeczy: samodzielne wczytanie wag na licencji Apache-2.0 do transformers, vLLM, SGLang lub llama.cpp albo używanie konsumenckich produktów tłumaczeniowych Tencent. Hostowane API to trzecia ścieżka — wysyłasz tekst przez HTTP, a Tencent Cloud udostępnia endpoint 1.8B. Model zachowuje kontekst 8 192 tokenów i maksymalne wyjście 4 096 tokenów, obsługuje wyłącznie tekst, a jego cena wynosi około 0,044 USD za milion tokenów wejściowych i 0,177 USD za milion tokenów wyjściowych. Dla zespołów, których wolumen tłumaczeń jest nierównomierny, znika w ten sposób próg „musisz obsługiwać GPU”, który wcześniej blokował przetestowanie modelu.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2: High-Performance Multilingual Translation Model (captured Aug 20, 2026), showing the English page header with the Tencent Cloud nav, the title 'Hy-MT2: High-Performance Multilingual Translation Model for Real Use', and the table of contents starting with the model name.

Druga połowa historii to aplikacje. Miniprogram HyTranslate zadebiutował wraz z wydaniem open-source w maju, oferując wprowadzanie głosowe, presety stylów i tryb offline. Aplikacje na iOS i Androida — które pobierają model na urządzenie, aby tłumaczyć bez sieci — zostały już udostępnione. Model 1.8B jest koniem roboczym tej offline'owej historii: dzięki ekstremalnej kwantyzacji 1.25-bitowej AngelSlim zmniejsza się do około 440 MB pamięci i działa lokalnie na układach telefonów Apple, Qualcomm i MediaTek, a Tencent raportuje 1,5x szybszą inferencję niż poprzednia generacja w wersji 4-bitowej na Apple A15.

Co to jest 1.8B?

HY-MT2-1.8B to gęsty model przyczynowy typu decoder-only, zbudowany na architekturze hunyuan_v1_dense — w praktyce ma około 2 miliardów parametrów, mimo że nazwa sugeruje 1.8B — z szablonem czatu i bez domyślnego promptu systemowego. Tłumaczy między 33 językami oraz pięcioma parami języków mniejszościowych i dialektów, w tym: chiński, angielski, japoński, koreański, francuski, hiszpański, rosyjski, arabski, tajski, wietnamski, indonezyjski, hindi, bengalski, tamilski oraz pary dialektalne: tybetańska, ujgurska, kazachska, mongolska i kantońska. W przeciwieństwie do klasycznych modeli tłumaczeniowych typu enkoder-dekoder jest dostrojony do instrukcji: podaje się mu język docelowy i opcjonalne instrukcje, a on potrafi zachować strukturę JSON i HTML, uwzględniać glosariusz, dopasowywać rejestr językowy i wykorzystywać otaczający kontekst do rozstrzygania niejednoznaczności. Tę klasę możliwości dzielą siostrzane modele 7B i 30B-A3B, a do jej oceny równolegle wydano benchmark IFMTBench firmy Tencent.

Aktualny stan benchmarków

Twierdzenia dotyczące jakości warto przeczytać uważnie, ponieważ prawie wszystkie pochodzą od samego Tencenta i nie zostały dotąd zweryfikowane przez niezależne laboratorium. Tencent podaje, że HY-MT2-1.8B osiąga 89,9% średniego wyniku FLORES-200 modelu Ge​mini 3.1 Pro (wersja 7B – 97,9%, 30B-A3B – 98,6%), 96,7% wyniku Ge​mini na testowym zbiorze GEMBA-style opartym na rzeczywistych danych oraz 96,2% na DomainMTBench w ośmiu domenach profesjonalnych. Niektóre relacje prasowe zaokrągliły wynik FLORES-200 w dół do 88,1%; README od producenta podaje 89,9%. Tencent twierdzi również, że model 1.8B ogółem przewyższa popularne komercyjne API tłumaczeniowe, takie jak od Microsoftu i Doubao. Niezależne reprodukcje jeszcze nie istnieją, więc traktuj to wszystko jako deklarowane przez producenta dowody kierunkowe, a nie zweryfikowane fakty. To, co nie zależy od producenta: zestaw języków 33+5 jest stały, licencja Apache-2.0 jest realna, a skwantyzowany checkpoint o rozmiarze 440MB działający na telefonie można niezależnie zaobserwować.

A single-column spec scoreboard for Tencent HY-MT2 1.8B reading: Params: ~2B dense decoder-only; Languages: 33 + 5 dialect pairs; Released: May 21, 2026 · Apache-2.0; FLORES-200: 89.9% of Gemini 3.1 Pro; On-device: 440MB at 1.25-bit; API: ~$0.044 / $0.177 per 1M tokens; footer 'Benchmark figures vendor-reported; no independent scores yet.'

Jak tego używać i ile to kosztuje

• Samodzielne hostowanie — wagi Apache-2.0 z Hugging Face lub ModelScope; uruchamiaj przy użyciu transformers (>=5.6.0), vLLM, SGLang lub kompilacji GGUF llama.cpp. Koszt to twój rachunek za GPU; wersja 1,25-bitowa działa na urządzeniach klasy CPU.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured Aug 20, 2026) showing the model header, the Tencent attribution, the Translation / Transformers / Safetensors tags, a 36-languages tag, the hunyuan_v1_dense architecture label, the arxiv 2605.22064 link, the apache-2.0 license, and the 2B-params model size.

• Hostowane API — Tencent Cloud udostępnia model 1.8B po około 0,044 USD za milion tokenów wejściowych i 0,177 USD za milion tokenów wyjściowych w chwili pisania tego tekstu; własne API dostawcy i kilka platform zewnętrznych go udostępniają.

• Konsument — HyTranslate mini-program oraz aplikacje na iOS/Androida, w tym tłumaczenie offline za pomocą pobranego modelu na urządzeniu.

Zalecane próbkowanie dla modelu 1.8B: temperatura 0.7, top-p 0.6, top-k 20, współczynnik powtarzalności 1.05, maksymalna liczba tokenów 4096.

Jeśli budujesz potok tłumaczeniowy, a nie dostarczasz aplikacji konsumenckiej, interesującą rzeczą w takim modelu jest to, że jego cena jest ruchomym celem — Tencent już obniżył stawkę API Hy-MT2-Pro w czerwcu. To dokładnie scenariusz, dla którego istnieje router z zerową marżą: ponieważ opłata przechodzi dalej po cennikowej cenie dostawcy, obniżka cen przez dostawcę pojawia się na rachunku tego samego dnia, a nie po tym, jak Twoja brama przeliczy ceny. Sam model nie znajduje się obecnie na liście OrcaRouter w momencie pisania tego tekstu, więc musiałbyś hostować wagi we własnym zakresie lub wywoływać API Tencent Cloud bezpośrednio; argument o przełączaniu awaryjnym i pojedynczym kluczu odnosi się do szerszego stosu tłumaczeniowego, który wokół tego zbudujesz, gdzie mieszanie małego modelu działającego na urządzeniu dla taniego ruchu masowego z większym modelem do trudnych par językowych to rodzaj kompozycji, do wyrażania której stworzono routing.

Najważniejsze

Tencent HY-MT2 1.8B był już w maju interesujący jako tłumacz wielkości telefonu na licencji Apache-2.0; wpis z 20 sierpnia o hostowanym API czyni go kandydatem dla zespołów, które chcą go wypróbować bez stawiania infrastruktury. Wskaźniki jakości pochodzą od producenta, zestaw języków jest celowo mainstreamowy, a nie maksymalny, a zajętość na urządzeniu to to, co naprawdę go wyróżnia. Jeśli twoje pary językowe mieszczą się w jego 33, teraz taniej niż kiedykolwiek przekonasz się, czy te deklaracje sprawdzają się w przypadku twoich treści.