
Tencent HY-MT2 1.8B otrzymuje hostowane API: 440MB tłumacz Tencenta trafia do chmury
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 426 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 183 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Tencent HY-MT2 1.8B — kompaktowy członek rodziny modeli tłumaczeniowych Hy-MT2, którą Tencent Hunyuan udostępnił jako open-source 21 maja 2026 roku — można teraz wywoływać przez hostowane komercyjne API, a nie tylko w wersji hostowanej samodzielnie. Model pojawił się w ofercie API 20 sierpnia 2026 roku w cenie około 0,044 USD za milion tokenów wejściowych i 0,177 USD za milion tokenów wyjściowych. Ta data pojawienia się w ofercie API ma większe znaczenie niż miałaby zwykle, ponieważ model 1.8B nigdy nie był tylko kolejnym otwartym checkpointem: to model, który Tencent zbudował, aby udowodnić, że skwantowany model tłumaczeniowy o rozmiarze 440 MB może działać w całości na telefonie. W ciągu trzech miesięcy od wydania open-source trafiał też do własnego miniprogramu HyTranslate firmy Tencent oraz do wydanych później aplikacji na iOS i Androida. Ten artykuł opisuje, co zmienia uruchomienie hostowanego API, czym ten model naprawdę jest i którym liczbom należy ufać.
Co tak naprawdę zmieniło się 20 sierpnia
Do tej pory korzystanie z Tencent HY-MT2 1.8B oznaczało jedną z dwóch rzeczy: samodzielne wczytanie wag na licencji Apache-2.0 do transformers, vLLM, SGLang lub llama.cpp albo używanie konsumenckich produktów tłumaczeniowych Tencent. Hostowane API to trzecia ścieżka — wysyłasz tekst przez HTTP, a Tencent Cloud udostępnia endpoint 1.8B. Model zachowuje kontekst 8 192 tokenów i maksymalne wyjście 4 096 tokenów, obsługuje wyłącznie tekst, a jego cena wynosi około 0,044 USD za milion tokenów wejściowych i 0,177 USD za milion tokenów wyjściowych. Dla zespołów, których wolumen tłumaczeń jest nierównomierny, znika w ten sposób próg „musisz obsługiwać GPU”, który wcześniej blokował przetestowanie modelu.

Druga połowa historii to aplikacje. Miniprogram HyTranslate zadebiutował wraz z wydaniem open-source w maju, oferując wprowadzanie głosowe, presety stylów i tryb offline. Aplikacje na iOS i Androida — które pobierają model na urządzenie, aby tłumaczyć bez sieci — zostały już udostępnione. Model 1.8B jest koniem roboczym tej offline'owej historii: dzięki ekstremalnej kwantyzacji 1.25-bitowej AngelSlim zmniejsza się do około 440 MB pamięci i działa lokalnie na układach telefonów Apple, Qualcomm i MediaTek, a Tencent raportuje 1,5x szybszą inferencję niż poprzednia generacja w wersji 4-bitowej na Apple A15.
Co to jest 1.8B?
HY-MT2-1.8B to gęsty model przyczynowy typu decoder-only, zbudowany na architekturze hunyuan_v1_dense — w praktyce ma około 2 miliardów parametrów, mimo że nazwa sugeruje 1.8B — z szablonem czatu i bez domyślnego promptu systemowego. Tłumaczy między 33 językami oraz pięcioma parami języków mniejszościowych i dialektów, w tym: chiński, angielski, japoński, koreański, francuski, hiszpański, rosyjski, arabski, tajski, wietnamski, indonezyjski, hindi, bengalski, tamilski oraz pary dialektalne: tybetańska, ujgurska, kazachska, mongolska i kantońska. W przeciwieństwie do klasycznych modeli tłumaczeniowych typu enkoder-dekoder jest dostrojony do instrukcji: podaje się mu język docelowy i opcjonalne instrukcje, a on potrafi zachować strukturę JSON i HTML, uwzględniać glosariusz, dopasowywać rejestr językowy i wykorzystywać otaczający kontekst do rozstrzygania niejednoznaczności. Tę klasę możliwości dzielą siostrzane modele 7B i 30B-A3B, a do jej oceny równolegle wydano benchmark IFMTBench firmy Tencent.
Aktualny stan benchmarków
Twierdzenia dotyczące jakości warto przeczytać uważnie, ponieważ prawie wszystkie pochodzą od samego Tencenta i nie zostały dotąd zweryfikowane przez niezależne laboratorium. Tencent podaje, że HY-MT2-1.8B osiąga 89,9% średniego wyniku FLORES-200 modelu Gemini 3.1 Pro (wersja 7B – 97,9%, 30B-A3B – 98,6%), 96,7% wyniku Gemini na testowym zbiorze GEMBA-style opartym na rzeczywistych danych oraz 96,2% na DomainMTBench w ośmiu domenach profesjonalnych. Niektóre relacje prasowe zaokrągliły wynik FLORES-200 w dół do 88,1%; README od producenta podaje 89,9%. Tencent twierdzi również, że model 1.8B ogółem przewyższa popularne komercyjne API tłumaczeniowe, takie jak od Microsoftu i Doubao. Niezależne reprodukcje jeszcze nie istnieją, więc traktuj to wszystko jako deklarowane przez producenta dowody kierunkowe, a nie zweryfikowane fakty. To, co nie zależy od producenta: zestaw języków 33+5 jest stały, licencja Apache-2.0 jest realna, a skwantyzowany checkpoint o rozmiarze 440MB działający na telefonie można niezależnie zaobserwować.

Jak tego używać i ile to kosztuje
• Samodzielne hostowanie — wagi Apache-2.0 z Hugging Face lub ModelScope; uruchamiaj przy użyciu transformers (>=5.6.0), vLLM, SGLang lub kompilacji GGUF llama.cpp. Koszt to twój rachunek za GPU; wersja 1,25-bitowa działa na urządzeniach klasy CPU.

• Hostowane API — Tencent Cloud udostępnia model 1.8B po około 0,044 USD za milion tokenów wejściowych i 0,177 USD za milion tokenów wyjściowych w chwili pisania tego tekstu; własne API dostawcy i kilka platform zewnętrznych go udostępniają.
• Konsument — HyTranslate mini-program oraz aplikacje na iOS/Androida, w tym tłumaczenie offline za pomocą pobranego modelu na urządzeniu.
Zalecane próbkowanie dla modelu 1.8B: temperatura 0.7, top-p 0.6, top-k 20, współczynnik powtarzalności 1.05, maksymalna liczba tokenów 4096.
Jeśli budujesz potok tłumaczeniowy, a nie dostarczasz aplikacji konsumenckiej, interesującą rzeczą w takim modelu jest to, że jego cena jest ruchomym celem — Tencent już obniżył stawkę API Hy-MT2-Pro w czerwcu. To dokładnie scenariusz, dla którego istnieje router z zerową marżą: ponieważ opłata przechodzi dalej po cennikowej cenie dostawcy, obniżka cen przez dostawcę pojawia się na rachunku tego samego dnia, a nie po tym, jak Twoja brama przeliczy ceny. Sam model nie znajduje się obecnie na liście OrcaRouter w momencie pisania tego tekstu, więc musiałbyś hostować wagi we własnym zakresie lub wywoływać API Tencent Cloud bezpośrednio; argument o przełączaniu awaryjnym i pojedynczym kluczu odnosi się do szerszego stosu tłumaczeniowego, który wokół tego zbudujesz, gdzie mieszanie małego modelu działającego na urządzeniu dla taniego ruchu masowego z większym modelem do trudnych par językowych to rodzaj kompozycji, do wyrażania której stworzono routing.
Najważniejsze
Tencent HY-MT2 1.8B był już w maju interesujący jako tłumacz wielkości telefonu na licencji Apache-2.0; wpis z 20 sierpnia o hostowanym API czyni go kandydatem dla zespołów, które chcą go wypróbować bez stawiania infrastruktury. Wskaźniki jakości pochodzą od producenta, zestaw języków jest celowo mainstreamowy, a nie maksymalny, a zajętość na urządzeniu to to, co naprawdę go wyróżnia. Jeśli twoje pary językowe mieszczą się w jego 33, teraz taniej niż kiedykolwiek przekonasz się, czy te deklaracje sprawdzają się w przypadku twoich treści.
