Karta tytułowa hero dla 'Tencent Hy-MT2-7B ma teraz hostowane API' z podtytułem 'Co zmienia tłumacz za 0,295 USD za milion tokenów na wyjściu', pokazująca ikonę usługi w chmurze, glif tłumaczenia, linię łącznika API oraz chip z ceną oznaczony $0.074 / $0.295 za 1M tokenów, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Tencent Hy-MT2-7B ma teraz hostowany interfejs API: Co zmienia tłumacz kosztujący 0,295 dolara za milion tokenów wyjściowych

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tencent Hy-MT2-7B, otwartoźródłowy model tłumaczeniowy Tencent Hunyuan wydany 21 maja 2026 roku, w tym tygodniu stał się wywoływalny przez hostowane API: około 19 sierpnia 2026 roku gęsty model 7B został udostępniony na hostowanym punkcie końcowym Tencent Cloud w cenie 0,074 USD za milion tokenów wejściowych i 0,295 USD za milion tokenów wyjściowych, z oknem kontekstowym 8192 tokenów. Nie pojawił się sam — Tencent Hy-MT2-1.8B i Tencent Hy-MT2-30B-A3B zadebiutowały na tym samym backendzie w ciągu jednego dnia. Wagi są dostępne na Hugging Face i ModelScope od trzech miesięcy; nowością jest to, że zespół może teraz wywoływać ten model bez wynajmowania GPU, kompilowania llama.cpp ze źródeł ani wdrażania zestawu narzędzi 1.25-bit-on-device. Dla obciążenia tłumaczeniowego to różnica między eksperymentem a decyzją produktową.

Co właśnie wydano

Komercyjny endpoint jest własnością Tencent Cloud, udostępniany przez API dostawcy oraz kilka platform trzecich. Trzy rozmiary działają w kontekście 8K z dopełnieniami o długości 4096 tokenów; wszystkie trzy akceptują ustrukturyzowane wyjście za pomocą schematu JSON w polu response_format, a żaden z nich nie implementuje wywoływania funkcji. Praktyczna specyfikacja, w jednej linii na wymiar:

Tencent Hy-MT2-7B — $0.074 za wejście / $0.295 za wyjście na 1M tokenów, kontekst 8192, gęsty ~7B, obsługa ustrukturyzowanych wyników, brak wywołań narzędzi.

Tencent Hy-MT2-1.8B — $0,044 wejście / $0,177 wyjście za 1M tokenów, kontekst 8192, gęsty 1,8B, bez wywołań narzędzi.

Tencent Hy-MT2-30B-A3B — $0.074 za wejście / $0.295 za wyjście na 1M tokenów, kontekst 8 192, MoE 30B łącznie / 3B aktywnych, obsługa ustrukturyzowanych wyników, brak wywołań narzędzi.

Głównym punktem cenowym jest stawka za tokeny wyjściowe modelu 7B: poniżej trzech dziesiątych centa za tysiąc tokenów wyjściowych — w przypadku modelu, który według Tencent nie ustępuje modelom o rząd wielkości większym. Tłumaczenie to jedno z niewielu zastosowań LLM, w których tokeny wyjściowe stanowią niemal całość rachunku, więc cena za tokeny wyjściowe decyduje o tym, czy dany pipeline jest opłacalny przy dużej skali.

A single-column scoreboard titled 'Tencent Hy-MT2-7B — the scoreboard' listing six rows: Params dense 7B; Price $0.074 / $0.295 per 1M; Context 8,192 tokens; FLORES-200 86.89 (~97.9% of Gemini 3.1 Pro Think); WMT25 63.86 / 71.21 / 82.24; License Apache-2.0, with the footer 'All figures vendor-reported; API price as listed Aug 2026.'

Model stojący za endpointem

Hy-MT2 to rodzina „szybkiego myślenia” Tencent: zamiast poświęcać długie łańcuchy myśli na każde zdanie, została zaprojektowana tak, aby reagować jak profesjonalny tłumacz — rozważnie tam, gdzie źródło jest niejednoznaczne, i szybko tam, gdzie nie jest. Model 7B to zrównoważony środek rodziny, gęsty model na licencji Apache-2.0, obejmujący 33 języki oraz pięć par języków mniejszościowych i dialektów chińskich (m.in. tybetański, kazachski, mongolski, ujgurski i kantoński). Tym, co odróżnia go od generycznego LLM zajmującego się tłumaczeniem, jest wykonywanie instrukcji: utrzymuje termin z glosariusza w całym dokumencie, stosuje zadany styl, pozostawia nietknięte ograniczniki i klucze JSON oraz przyjmuje instrukcje personalizacji w prostym języku. Tencent wypuścił IFMTBench, otwarty benchmark właśnie dla tej umiejętności, wraz z wagami, a strona konsumencka — miniprogram Tencent Hy Translate, z aplikacjami na iOS i Androida w przygotowaniu — jest zbudowana na tej rodzinie.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-7B (captured August 23 2026) showing the model name, Apache-2.0 license, and the family description covering 33 languages plus five minority-language and dialect pairs.

Liczby z dołączoną gwiazdką.

Wszystko poniżej to własna ocena Tencentu, opublikowana na karcie modelu i w towarzyszącym raporcie; nic z tego nie zostało jak dotąd niezależnie odtworzone. Na ścieżce ogólnego tłumaczenia XX⇔XX w FLORES-200 model 7B uzyskuje 86,89 XCOMET-XXL, co Tencent szacuje na około 97,9% wyniku Gemini 3.1 Pro (Think). W trybie „szybkiego myślenia” ma rzekomo przewyższać otwartoźródłowe modele ogólne, w tym DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B i Gemma4-26B-A4B. Na WMT25 jego wyniki poprawiają się na całej linii względem poprzedniej generacji — 63,86/71,21/82,24 wobec 61,59/68,85/75,91 dla Hy-MT1.5-7B, z największym wzrostem w GEMBA — a na DomainMTBench (finanse, polityka, edukacja) osiąga 94,92 XCOMET / 92,79 GEMBA. To właśnie w podążaniu za instrukcjami najbardziej wyraźnie odróżnia się od modeli tłumaczeniowych sprzed roku: 89,73 proste / 72,67 złożone / 83,14 łącznie na IFMTBench.

Co zmienia hostowane API dla potoku tłumaczeniowego

Self-hostowanie 7B jest naprawdę łatwe, jak na tego typu rzeczy — działa na pojedynczym A100 lub RTX 4090, a istnieją skwantowane wersje FP8 i GGUF. Ale „łatwe do self-hostowania" to nie „zero operacji". Ścieżka GGUF zależy obecnie od llama.cpp z jądrem STQ od Tencent, ścieżka FP8 wymaga odpowiedniego stosu technologicznego, a ktoś musi tego pilnować. Hostowany endpoint usuwa to wszystko z gry: bez GPU, bez budowania jądra, bez planowania pojemności i ze stałą ceną za token, niezależną od wykorzystania. Dla zespołu przetwarzającego miliony przetłumaczonych zdań dziennie ta przewidywalność ma większe znaczenie niż benchmark z nagłówków — i to jest powód, dla którego ten tydzień ma większe znaczenie niż premiera w maju.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2 (captured August 23 2026, English) showing the header 'Hy-MT2: High-Performance Multilingual Translation Model', the 2026-05-21 publication date, and a summary line about translating across 33 languages.

Pytanie dotyczące routingu, którego nikt jeszcze nie zadaje.

Ponieważ model ma zaledwie trzy dni po stronie API, realistycznym sposobem na jego wdrożenie jest sposób, w jaki wdraża się każdego nowego dostawcę: umieść go za regułą routingu z automatycznym failover, aby nieprzetestowany endpoint nigdy nie mógł wyłączyć ścieżki produkcyjnej, i pozwól wolumenowi zdecydować, czy zasłuży na stałe miejsce. To dokładnie ten wzorzec, który DSL routingu OrcaRouter realizuje w przypadku ponad 200 modeli, które prowadzimy — i warto być tu precyzyjnym: Tencent Hy-MT2-7B nie znajduje się w katalogu OrcaRouter w chwili pisania tego tekstu, więc nie jest to historia „wywołaj go przez nas”. Na temat jest natomiast model cenowy. OrcaRouter przekazuje ceny katalogowe każdego dostawcy z 0% marży, więc gdy dostawca obniży stawkę, obniżka jest aktywna na platformie tego samego dnia. W przypadku obciążenia związanego z tłumaczeniem dużego wolumenu pytanie, jakie należy zadać w odniesieniu do każdego endpointu, nie brzmi „jaka jest dziś cena w portalu”, ale „jaka jest faktyczna cena katalogowa za token pobierana przez dostawcę i czy coś znajduje się między nią a mną”. Przy 0,295 USD/M output, Tencent Hy-MT2-7B właśnie sprawił, że to pytanie stało się interesujące.

Co obejrzeć dalej

Z tego tygodnia wynikają trzy rzeczy. Po pierwsze, modele siostrzane 1.8B i 30B-A3B są teraz w równym stopniu dostępne przez API, więc decyzja „który rozmiar” to realne pytanie dotyczące API, a nie decyzja o samodzielnym hostowaniu (rodzina ma własne strony porównawcze, ale w skrócie: 1.8B do zastosowań na urządzeniu i w najtańszej warstwie, 30B-A3B do zastosowań profesjonalnych, 7B pomiędzy). Po drugie, partnerstwo Tencenta z WMT26 oferuje nagrody zespołom używającym modeli Hy-MT w zadaniach General Machine Translation i Video Subtitle Translation — to sygnał, że Tencent zamierza uczynić tę rodzinę domyślnym otwartym rozwiązaniem do tłumaczeń w konkurencyjnym MT. Po trzecie, aplikacje na iOS i Androida z wnioskowaniem na urządzeniu — jeśli zostaną wydane zgodnie z zapowiedziami — sprawią, że 1.8B stanie się najczęściej instalowanym otwartym modelem tłumaczeniowym na świecie. Hostowane API to część, która zmieniła się w tym tygodniu; trajektoria rodziny została wyznaczona w maju.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube