Karta hero z nagłówkiem „North Small Translate 1.0 vs Hy-MT2-7B” i podtytułem „Jeden GPU przeciw dwóm B200”, nad dwiema kartami: North Small Translate 1.0 (218B MoE / 25B aktywnych, CC BY-NC 4.0) i Hy-MT2-7B (8B gęsty, około 16GB VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-7B: jedno GPU kontra dwa B200

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najbardziej wyrównany pojedynek w otwartym tłumaczeniu może być jednocześnie tym najmniej oczywistym. Hy-MT2-7B jest środkowym dzieckiem rodziny tłumaczeniowej Tencent Hunyuan, udostępnionym na licencji Apache 2.0 21 maja 2026 roku, i działa na pojedynczym RTX 4090 lub A100 przy około 16 GB VRAM. North Small Translate 1.0 to oparty na rzadkiej mieszaninie ekspertów (sparse mixture-of-experts) tłumacz Cohere o 218 miliardach parametrów, udokumentowany w informacjach o wydaniu firmy z 9 września 2026 roku, z minimalnym wdrożeniem dwóch B200 w FP8 lub jednego B200 w wersji NVFP4 W4A16. Oba są specjalistami od tłumaczenia. Oba są aktualne. Jednego z nich możesz uruchomić ze stacji roboczej, a ten jeden fakt zmienia sposób patrzenia na całe porównanie — bo benchmark, w którym najchętniej oceniano by je na równych zasadach, nie istnieje.

Zacznij od koperty, a nie od wyników

Koszt wdrożenia to wymiar, który decyduje o większości rzeczywistych integracji, i tutaj oba modele nie są sobie bliskie. Hy-MT2-7B to gęsty model HunYuanDenseV1 o około ośmiu miliardach parametrów z opublikowanymi kompilacjami FP8 i GGUF oraz społecznościowymi wersjami MLX 8-bit dla Apple silicon. Notatki wdrożeniowe Tencenta wymieniają transformers 5.6.0 lub nowsze, vLLM, SGLang i llama.cpp jako obsługiwane środowiska uruchomieniowe, a wskazówki dotyczące wnioskowania ograniczają generowanie do 8 192 tokenów, mimo że konfiguracja deklaruje do 262 144 pozycji. Wystarczy jeden nowoczesny konsumencki lub stacjonarny GPU.

North Small Translate 1.0 należy do zupełnie innej klasy obiektów. Jego łączne parametry 218B, z czego 25B aktywnych, są rozdzielone między 128 ekspertów, z ośmioma aktywnymi na token oraz ekspertami współdzielonymi, a Cohere publikuje minimalne wymagania sprzętowe dla każdego z trzech checkpointów: cztery B200s lub osiem H100s dla BF16, dwa B200s lub cztery H100s dla FP8, jeden B200 lub dwa H100s dla wersji NVFP4 W4A16. Serwowanie odbywa się przez vLLM z cohere_melody>=0.9.0, a Cohere zaleca dekodowanie zachłanne, aby dopasować się do produkcji. Dane wyjściowe zawierają <|START_TEXT|> i <|END_TEXT|>znaczniki, które nie są zarejestrowane jako tokeny specjalne:

Kształt — North Small Translate 1.0: 218B łącznie / 25B aktywnych w rzadkim MoE, 128 ekspertów w porównaniu z Hy-MT2-7B: gęsty, około 8B

Kontekst — 16K na wejściu i 16K na wyjściu w porównaniu z 8K okna roboczego, konfiguracja deklaruje do 262 144 pozycji

Minimalny sprzęt — 1×B200 przy W4A16, 2×B200 lub 4×H100 przy FP8 w porównaniu z pojedynczym GPU klasy RTX 4090 w ~16 GB

Opublikowane formaty — BF16, FP8, NVFP4 W4A16 vs base, FP8, GGUF oraz społecznościowy MLX 8-bit

Języki — 50 (angielski + 49) kontra 33 języki plus 5 języków mniejszościowych i dialektów

Licencja — CC BY-NC 4.0, komercyjne przez Model Vault vs Apache 2.0, bez ograniczeń

Zgłaszana jakość — WMT26 83.60, metryka nienazwana, dane zgłoszone przez dostawcę vs nazwane tabele dostawców w FLORES-200, WMT25 GEMBA, XCOMET-XXL i IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

Problem benchmarkowy

Oto uczciwy rdzeń tego starcia: nie możemy uszeregować tych dwóch modeli względem siebie, a każdy, kto twierdzi inaczej, wymyśla liczbę. Tencent opublikował cztery nazwane ewaluacje. W tłumaczeniu FLORES-200 z angielskiego na X model 7B osiąga 93,52, za wynikami 94,42 Gemini 3.1 Pro i 94,16 GPT-5.5, ale wystarczająco blisko, by mieć znaczenie. W metryce GEMBA powiązanej z WMT25 uzyskuje 82,24 wobec 84,34 modelu 30B-A3B i 83,41 GPT-5.5. W XCOMET-XXL wyprzedza wszystko w tabeli porównawczej firmy Tencent z wynikiem 63,86 — przed Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro i Kimi K2.6. W wyniku IFMTBench za przestrzeganie instrukcji osiąga 83,14%. Wszystkie te liczby są własnymi liczbami firmy Tencent, żadna nie została niezależnie odtworzona, a mimo to jest ich wciąż znacznie więcej niż to, co zaoferował Cohere.

Cohere opublikował jedną wartość: wynik WMT26 na poziomie 83,60, rosnący do 84,36 w agentowym, wieloprzebiegowym przepływie pracy. Na karcie modelu ani w notatce wydania nie podano nazwy żadnej metryki, a dla tego modelu nie opublikowano żadnej strony z wynikami WMT26. Ta asymetria nie jest dowodem na to, że model Cohere jest słabszy albo mocniejszy. Oznacza to, że porównania, którego czytelnik chce najbardziej — ten sam test, ta sama metryka, oba modele — nie można przeprowadzić na podstawie publicznych danych, a czteropunktowy rozrzut w obrębie dwóch własnych wartości Cohere (83,60 do 84,36) jest już większy niż większość różnic w tabeli Tencent.

Języki i długi dokument

North Small Translate 1.0 obsługuje pięćdziesiąt języków i wariantów lokalizacyjnych, przy czym współczesny standardowy arabski, niemiecki, francuski, japoński, koreański, rosyjski i ukraiński wyznaczono jako poziom pierwszy, a po obu stronach przyjmuje i generuje 16 000 tokenów. Hy-MT2-7B obsługuje trzydzieści trzy języki oraz pięć języków mniejszościowych i dialektów, w tym tybetański, ujgurski i kantoński. Żadna z tych list nie jest nadzbiorem drugiej — Tencent sięga po kantoński i ujgurski, Cohere obejmuje szerszy zestaw lokalizacji europejskich — więc wdrożenie wielojęzyczne może się okazać, że już ze względu na samo pokrycie potrzebuje obu.

Okno wyjściowe to ta mniej rzucająca się w oczy różnica. Szesnaście tysięcy tokenów wyjścia oznacza pełny dokument procedury w jednym przebiegu, ze spójną terminologią i rejestrem w całym tekście, ponieważ model widział go w całości. Okno 8K tego nie zapewnia, a obejście polegające na tłumaczeniu zdanie po zdaniu ponownie wprowadza dokładnie te problemy ze spójnością między segmentami, których mierzenie było celem benchmarków takich jak IFMTBench, służących ocenie przestrzegania instrukcji tłumaczeniowych.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Licencja znowu decyduje o więcej niż tabela

North Small Translate 1.0 jest objęty licencją CC BY-NC 4.0. Wagi są bezpłatne do zastosowań niekomercyjnych, a wdrożenie komercyjne odbywa się przez Model Vault firmy Cohere na podstawie wykupionej licencji bez opublikowanej ceny. Hy-MT2-7B jest objęty licencją Apache 2.0 i nie ma ograniczeń dostępu — użytkowanie komercyjne, dostrajanie i prace pochodne są dozwolone bez konieczności rozmowy. W przypadku produktu komercyjnego kolejność działań nasuwa się sama: Hy-MT2-7B można wdrożyć już dziś, a model Cohere można dziś ocenić, i żaden wiersz benchmarku nie zmienia tej kolejności.

Przewagą kompensującą Cohere jest darmowy plan. North Small Translate 1.0 działa w darmowym planie Chat V2, bezpłatnie zarówno dla kluczy próbnych, jak i produkcyjnych, dopóki nie zostaną osiągnięte limity szybkości, więc ewaluacja kosztuje tylko czas. Hy-MT2-7B ma hostowane komercyjne API — Tencent wycenił hostowany plan tej rodziny na około 0,044 USD za milion tokenów wejściowych i 0,177 USD za milion tokenów wyjściowych — a samodzielne hostowanie na własnym GPU to naprawdę darmowa ścieżka.

Co tak naprawdę oznacza „multi-pass”

Decyzja Cohere o opublikowaniu zarówno 83,60, jak i 84,36 to najbardziej pouczający szczegół w notatce o wydaniu, ponieważ mówi, że firma wierzy, iż przepływ pracy bije pojedyncze wywołanie. To ten sam zakład, który Tencent postawił z innym mechanizmem: jego flagowy 30B-A3B wygrywa na GEMBA i XCOMET, podczas gdy Gemini 3.1 Pro wygrywa na FLORES-200, co oznacza, że najlepszy system to nie jeden model, lecz panel. Fuzja modeli OrcaRouter uruchamia kilka modeli jako panel i uzgadnia ich odpowiedzi w ramach jednego wywołania, co jest wersją idei wielokrotnego przebiegu na poziomie platformy, za którą gonią obaj dostawcy — i współgra to ze stroną routingu, gdzie jeden klucz obejmuje katalog ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, więc zmiana ceny dostawcy trafia na naszą stronę tego samego dnia, a nie przy kolejnym odnowieniu umowy.

Takie ujęcie rozwiązuje też problem dowodowy, od którego rozpoczął się ten artykuł. Gdy dwóch dostawców publikuje niepokrywające się benchmarki i żaden nie ma niezależnej oceny, sposobem wyboru nie jest zaufanie tabeli. Trzeba uruchomić oba na własnych dokumentach i pozwolić, by rozbieżność ujawniła się na prawdziwym tekście — właśnie temu służą panel i łańcuch przełączania awaryjnego.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Który i kiedy

Jeśli potrzebujesz modelu tłumaczeniowego działającego na sprzęcie, który już posiadasz, w produkcie komercyjnym, bez rozmów o licencji, Hy-MT2-7B wygrywa już choćby na podstawie samego zestawu warunków — a jego wyniki opublikowane przez dostawcę, choć niepowtórzone, są przynajmniej nazwane, porównywalne i bliskie czołówki. Jeśli tłumaczysz długie dokumenty na pięćdziesiąt języków Cohere, potrzebujesz 16K spójnych danych wyjściowych na przebieg i masz albo budżet na dwa B200, albo gotowość do przeprowadzenia ewaluacji w darmowym planie Cohere przed podjęciem decyzji, North Small Translate 1.0 jest maszyną o większych możliwościach w każdym ujawnionym wymiarze.

Żaden z tych dwóch modeli nie usuwa potrzeby testowania. Cohere dało Ci jedną nienazwaną liczbę i darmowy sposób, by ją sprawdzić. Tencent dał Ci tabelę i plik do pobrania wielkości GPU. 83,60 to obietnica, a nie wynik — a jedynym miejscem, w którym ta obietnica zostaje rozstrzygnięta, jest Twój własny korpus.