
Tencent Hy-MT2-7B ma teraz hostowany interfejs API: Co zmienia tłumacz kosztujący 0,295 dolara za milion tokenów wyjściowych
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
Tencent Hy-MT2-7B, otwartoźródłowy model tłumaczeniowy Tencent Hunyuan wydany 21 maja 2026 roku, w tym tygodniu stał się wywoływalny przez hostowane API: około 19 sierpnia 2026 roku gęsty model 7B został udostępniony na hostowanym punkcie końcowym Tencent Cloud w cenie 0,074 USD za milion tokenów wejściowych i 0,295 USD za milion tokenów wyjściowych, z oknem kontekstowym 8192 tokenów. Nie pojawił się sam — Tencent Hy-MT2-1.8B i Tencent Hy-MT2-30B-A3B zadebiutowały na tym samym backendzie w ciągu jednego dnia. Wagi są dostępne na Hugging Face i ModelScope od trzech miesięcy; nowością jest to, że zespół może teraz wywoływać ten model bez wynajmowania GPU, kompilowania llama.cpp ze źródeł ani wdrażania zestawu narzędzi 1.25-bit-on-device. Dla obciążenia tłumaczeniowego to różnica między eksperymentem a decyzją produktową.
Co właśnie wydano
Komercyjny endpoint jest własnością Tencent Cloud, udostępniany przez API dostawcy oraz kilka platform trzecich. Trzy rozmiary działają w kontekście 8K z dopełnieniami o długości 4096 tokenów; wszystkie trzy akceptują ustrukturyzowane wyjście za pomocą schematu JSON w polu response_format, a żaden z nich nie implementuje wywoływania funkcji. Praktyczna specyfikacja, w jednej linii na wymiar:
• Tencent Hy-MT2-7B — $0.074 za wejście / $0.295 za wyjście na 1M tokenów, kontekst 8192, gęsty ~7B, obsługa ustrukturyzowanych wyników, brak wywołań narzędzi.
• Tencent Hy-MT2-1.8B — $0,044 wejście / $0,177 wyjście za 1M tokenów, kontekst 8192, gęsty 1,8B, bez wywołań narzędzi.
• Tencent Hy-MT2-30B-A3B — $0.074 za wejście / $0.295 za wyjście na 1M tokenów, kontekst 8 192, MoE 30B łącznie / 3B aktywnych, obsługa ustrukturyzowanych wyników, brak wywołań narzędzi.
Głównym punktem cenowym jest stawka za tokeny wyjściowe modelu 7B: poniżej trzech dziesiątych centa za tysiąc tokenów wyjściowych — w przypadku modelu, który według Tencent nie ustępuje modelom o rząd wielkości większym. Tłumaczenie to jedno z niewielu zastosowań LLM, w których tokeny wyjściowe stanowią niemal całość rachunku, więc cena za tokeny wyjściowe decyduje o tym, czy dany pipeline jest opłacalny przy dużej skali.

Model stojący za endpointem
Hy-MT2 to rodzina „szybkiego myślenia” Tencent: zamiast poświęcać długie łańcuchy myśli na każde zdanie, została zaprojektowana tak, aby reagować jak profesjonalny tłumacz — rozważnie tam, gdzie źródło jest niejednoznaczne, i szybko tam, gdzie nie jest. Model 7B to zrównoważony środek rodziny, gęsty model na licencji Apache-2.0, obejmujący 33 języki oraz pięć par języków mniejszościowych i dialektów chińskich (m.in. tybetański, kazachski, mongolski, ujgurski i kantoński). Tym, co odróżnia go od generycznego LLM zajmującego się tłumaczeniem, jest wykonywanie instrukcji: utrzymuje termin z glosariusza w całym dokumencie, stosuje zadany styl, pozostawia nietknięte ograniczniki i klucze JSON oraz przyjmuje instrukcje personalizacji w prostym języku. Tencent wypuścił IFMTBench, otwarty benchmark właśnie dla tej umiejętności, wraz z wagami, a strona konsumencka — miniprogram Tencent Hy Translate, z aplikacjami na iOS i Androida w przygotowaniu — jest zbudowana na tej rodzinie.

Liczby z dołączoną gwiazdką.
Wszystko poniżej to własna ocena Tencentu, opublikowana na karcie modelu i w towarzyszącym raporcie; nic z tego nie zostało jak dotąd niezależnie odtworzone. Na ścieżce ogólnego tłumaczenia XX⇔XX w FLORES-200 model 7B uzyskuje 86,89 XCOMET-XXL, co Tencent szacuje na około 97,9% wyniku Gemini 3.1 Pro (Think). W trybie „szybkiego myślenia” ma rzekomo przewyższać otwartoźródłowe modele ogólne, w tym DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B i Gemma4-26B-A4B. Na WMT25 jego wyniki poprawiają się na całej linii względem poprzedniej generacji — 63,86/71,21/82,24 wobec 61,59/68,85/75,91 dla Hy-MT1.5-7B, z największym wzrostem w GEMBA — a na DomainMTBench (finanse, polityka, edukacja) osiąga 94,92 XCOMET / 92,79 GEMBA. To właśnie w podążaniu za instrukcjami najbardziej wyraźnie odróżnia się od modeli tłumaczeniowych sprzed roku: 89,73 proste / 72,67 złożone / 83,14 łącznie na IFMTBench.
Co zmienia hostowane API dla potoku tłumaczeniowego
Self-hostowanie 7B jest naprawdę łatwe, jak na tego typu rzeczy — działa na pojedynczym A100 lub RTX 4090, a istnieją skwantowane wersje FP8 i GGUF. Ale „łatwe do self-hostowania" to nie „zero operacji". Ścieżka GGUF zależy obecnie od llama.cpp z jądrem STQ od Tencent, ścieżka FP8 wymaga odpowiedniego stosu technologicznego, a ktoś musi tego pilnować. Hostowany endpoint usuwa to wszystko z gry: bez GPU, bez budowania jądra, bez planowania pojemności i ze stałą ceną za token, niezależną od wykorzystania. Dla zespołu przetwarzającego miliony przetłumaczonych zdań dziennie ta przewidywalność ma większe znaczenie niż benchmark z nagłówków — i to jest powód, dla którego ten tydzień ma większe znaczenie niż premiera w maju.

Pytanie dotyczące routingu, którego nikt jeszcze nie zadaje.
Ponieważ model ma zaledwie trzy dni po stronie API, realistycznym sposobem na jego wdrożenie jest sposób, w jaki wdraża się każdego nowego dostawcę: umieść go za regułą routingu z automatycznym failover, aby nieprzetestowany endpoint nigdy nie mógł wyłączyć ścieżki produkcyjnej, i pozwól wolumenowi zdecydować, czy zasłuży na stałe miejsce. To dokładnie ten wzorzec, który DSL routingu OrcaRouter realizuje w przypadku ponad 200 modeli, które prowadzimy — i warto być tu precyzyjnym: Tencent Hy-MT2-7B nie znajduje się w katalogu OrcaRouter w chwili pisania tego tekstu, więc nie jest to historia „wywołaj go przez nas”. Na temat jest natomiast model cenowy. OrcaRouter przekazuje ceny katalogowe każdego dostawcy z 0% marży, więc gdy dostawca obniży stawkę, obniżka jest aktywna na platformie tego samego dnia. W przypadku obciążenia związanego z tłumaczeniem dużego wolumenu pytanie, jakie należy zadać w odniesieniu do każdego endpointu, nie brzmi „jaka jest dziś cena w portalu”, ale „jaka jest faktyczna cena katalogowa za token pobierana przez dostawcę i czy coś znajduje się między nią a mną”. Przy 0,295 USD/M output, Tencent Hy-MT2-7B właśnie sprawił, że to pytanie stało się interesujące.
Co obejrzeć dalej
Z tego tygodnia wynikają trzy rzeczy. Po pierwsze, modele siostrzane 1.8B i 30B-A3B są teraz w równym stopniu dostępne przez API, więc decyzja „który rozmiar” to realne pytanie dotyczące API, a nie decyzja o samodzielnym hostowaniu (rodzina ma własne strony porównawcze, ale w skrócie: 1.8B do zastosowań na urządzeniu i w najtańszej warstwie, 30B-A3B do zastosowań profesjonalnych, 7B pomiędzy). Po drugie, partnerstwo Tencenta z WMT26 oferuje nagrody zespołom używającym modeli Hy-MT w zadaniach General Machine Translation i Video Subtitle Translation — to sygnał, że Tencent zamierza uczynić tę rodzinę domyślnym otwartym rozwiązaniem do tłumaczeń w konkurencyjnym MT. Po trzecie, aplikacje na iOS i Androida z wnioskowaniem na urządzeniu — jeśli zostaną wydane zgodnie z zapowiedziami — sprawią, że 1.8B stanie się najczęściej instalowanym otwartym modelem tłumaczeniowym na świecie. Hostowane API to część, która zmieniła się w tym tygodniu; trajektoria rodziny została wyznaczona w maju.
