
Tencent Hy-MT2-7B kontra Tencent Hy-MT2-1.8B: Wybór jakości po stronie serwera czy 440MB tłumacz na każdym telefonie?
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
Tencent Hy-MT2-7B i Tencent Hy-MT2-1.8B to dwa skrajne modele tej samej rodziny, udostępnione razem jako open source 21 maja 2026 roku. W tym tygodniu oba stały się dostępne przez hostowane API — wersja 7B około 19 sierpnia, a 1.8B dzień później, każda obsługiwana przez Tencent Cloud. Nie są to konkurenci w potocznym sensie, ponieważ w niewielkim stopniu pokrywają się pod względem przeznaczenia. Model 7B to wybór dla jakości: gęsty model działający na jednym GPU lub przez API w cenie 0,074 USD za milion tokenów wejściowych i 0,295 USD za milion tokenów wyjściowych. Model 1.8B to wybór na urządzenia: model skwantowany do 440 megabajtów, działający na telefonie w pełni offline, w cenie 0,044 / 0,177 USD za milion tokenów w warstwie API. Jeśli wybierasz między nimi, odpowiedź w dużej mierze zależy od tego, gdzie ma nastąpić tłumaczenie — a dopiero w drugiej kolejności od benchmarków, które są znacznie bliższe, niż sugerowałaby czterokrotna różnica w parametrach.
Jednowierszowa odpowiedź
Wybierz 7B, gdy tłumaczenie odbywa się w centrum danych i chcesz uzyskać najlepszą jakość za każdego dolara przeznaczonego na serwer — w API lub na pojedynczym GPU klasy A100. Wybierz 1.8B, gdy tłumaczenie musi odbywać się na urządzeniu, offline, lub przy najniższym możliwym koszcie na token. Jeśli oba działają w tej samej chmurze, a budżet nie jest czynnikiem decydującym, 7B wygrywa pod względem jakości. Jeśli treść jest poufna, podlegająca regulacjom, lub musi działać bez sieci, to 1.8B jest jedynym z tych dwóch, który może.
Specyfikacje obok siebie
• Parametry — 7B dense vs 1.8B dense.
• Rozmiar po kwantyzacji — FP8 i GGUF do kilku GB w porównaniu z 440MB dzięki kwantyzacji AngelSlim 1.25-bit.
• FLORES-200 (XX⇔XX) — 86,89 wobec 79,77 XCOMET-XXL, czyli mniej więcej 97,9% wobec 89,9% wyniku Gemini 3.1 Pro (Think), według danych producenta.
• WMT25 — 7B: 63.86/71.21/82.24; 1.8B pokonuje komercyjne API Microsoftu i Doubao we wszystkich trzech metrykach.
• DomainMTBench (GEMBA) — 92.79 vs 91.08, zgłoszone przez dostawcę.
• Cena API — $0.074 / $0.295 vs $0.044 / $0.177 za 1M tokenów (wejście/wyjście).
• Kontekst — oba po 8 192 tokeny.
• Wdrożenie — jedno A100 / RTX 4090 lub API w chmurze vs chipy Apple, Qualcomm i MediaTek na urządzeniu, offline.

Luka jakościowa jest realna, ale węższa niż luka rozmiarowa.
Wszystko poniższe to własna ocena Tencenta, niepotwierdzona niezależnie. W teście FLORES-200 model 7B wyprzedza model 1.8B o osiem punktów XCOMET (86,89 do 79,77) i na tej różnicy opiera się pozycjonowanie „zbalansowany” versus „na urządzeniu”. Ale na DomainMTBench — benchmarku tłumaczeń dziedzinowych obejmującym finanse, politykę i edukację — model 1.8B osiąga wynik zaledwie 1,7 punktu GEMBA od modelu 7B (91,08 do 92,79). A pozycja modelu 1.8B na tle szerszego świata to szczegół, który wciąż zaskakuje: Tencent podaje, że pokonuje komercyjne API tłumaczeniowe Microsoftu i Doubao we wszystkich trzech metrykach WMT25 oraz przewyższa Tower-Plus-72B, model czterdziestokrotnie większy. Tak więc w zwykłych tekstach dziedzinowych mały model jest znacznie bliżej swojego dużego rodzeństwa, niż sugerowałyby cztery parametry. Prawdziwa przewaga modelu 7B ujawnia się w ogonku tłumaczeń ogólnych i przy trudnych instrukcjach, gdzie jego prowadzenie w FLORES i wyższe wyniki w złożonych zadaniach IFMTBench wyraźnie oddzielają oba modele.
Fork wdrożeniowy
Model 7B wymaga infrastruktury — albo API w chmurze, albo pojedynczego GPU klasy A100, ze zwykłymi operacjami w zestawie. Model 1.8B, ważący 440 MB dzięki kwantyzacji 1,25-bitowej AngelSlim, działa na tych samych układach co typowa aplikacja telefoniczna, jest 1,5× szybszy od poprzedniej generacji Hy-MT1.5 i w ogóle nie potrzebuje sieci. To zmienia prywatność z funkcji w domyślny standard: w przypadku umów, dokumentacji medycznej czy czegokolwiek objętego regulacjami dane nigdy nie opuszczają urządzenia, co jest właściwością, której nie da się kupić żadną ceną za token po stronie serwera. Ten kompromis jest widoczny w ogólnym tłumaczeniu w stylu FLORES, gdzie ujawnia się dodatkowa pojemność modelu 7B — oraz przy każdym poleceniu na tyle złożonym, by zestawić wynik 83,14 IFMTBench modelu 1.8B z wyższym pułapem modelu 7B.

Matematyka kosztów
W warstwie API oba modele są tanie; 1.8B jest tańszy. Przy $0.044 / $0.177 wobec $0.074 / $0.295 za milion, mały model kosztuje około 40% mniej niż 7B po obu stronach rachunku — przy stałym milionie tokenów wyjściowych dziennie to mniej więcej $70 dziennie wobec $118. Na urządzeniu 1.8B kosztuje zero za token, co jest liczbą, która dominuje w każdym porównaniu serwerów przy dużej skali. Kontrargumentem dla 7B nie jest cena, ale zapas możliwości: jeśli Twój korpus skłania się ku treściom technicznym, prawnym lub bogatym w instrukcje, margines jakości 7B to dokładnie to, co przekłada się na mniejszą liczbę ponownych tłumaczeń — a ponowne tłumaczenia to realny koszt jednostkowy w profesjonalnym MT.

Trasowanie dwóch rozmiarów.
Na dzień pisania tego tekstu żaden z modeli nie znajduje się w katalogu OrcaRouter, więc uczciwe ujęcie jest takie, że oba są udostępniane przez własną chmurę Tencent i kilka platform zewnętrznych. To zestawienie wciąż pokazuje lekcję routingu, wokół której zbudowany jest ten blog: gdy dwa modele pokrywają się pod względem możliwości, ale różnią się ceną i opóźnieniem, racjonalne wdrożenie to nie „wybierz jeden”, lecz „kieruj ruchem według obciążenia” — część o dużej objętości i niskim stopniu trudności do taniego małego modelu, trudną część do modelu wysokiej jakości, automatyczne przełączanie awaryjne, aby awaria któregokolwiek z nich nigdy nie wstrzymywała potoku. To jest dokładnie ten wzorzec, który DSL routingu OrcaRouter komponuje dla ponad 200 modeli, które oferujemy, z ceną katalogową każdego dostawcy przekazywaną dalej z 0% marżą. Jeśli rodzina tłumaczeń Tencent dołączy do katalogu, będzie kolejnym naturalnym najemcą.
Werdykt
Jeśli tłumaczenie odbywa się w Twoim centrum danych, wybierz Tencent Hy-MT2-7B — przez API, jeśli chcesz zero obsługi, na pojedynczym GPU, jeśli chcesz posiadać go na własność — i przestań czytać. Jeśli tłumaczenie musi odbywać się na urządzeniu, offline lub przy wymogu poufności, wybierz Tencent Hy-MT2-1.8B, a rozmiar 440MB wygrywa z definicji. Jedynym naprawdę trudnym przypadkiem jest obciążenie chmurowe o średnim wolumenie, gdzie zarówno jakość 7B, jak i cena 1.8B są do obrony. W takim przypadku nie podejmuj decyzji na podstawie benchmarków dostawcy: raportowana różnica GEMBA wynosi poniżej dwóch punktów, więc uruchom oba na własnych tekstach z Twojej domeny i pozwól swoim danym wybrać.
