
North Small Translate 1.0 vs Hy-MT2-7B: jedno GPU kontra dwa B200
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Najbardziej wyrównany pojedynek w otwartym tłumaczeniu może być jednocześnie tym najmniej oczywistym. Hy-MT2-7B jest środkowym dzieckiem rodziny tłumaczeniowej Tencent Hunyuan, udostępnionym na licencji Apache 2.0 21 maja 2026 roku, i działa na pojedynczym RTX 4090 lub A100 przy około 16 GB VRAM. North Small Translate 1.0 to oparty na rzadkiej mieszaninie ekspertów (sparse mixture-of-experts) tłumacz Cohere o 218 miliardach parametrów, udokumentowany w informacjach o wydaniu firmy z 9 września 2026 roku, z minimalnym wdrożeniem dwóch B200 w FP8 lub jednego B200 w wersji NVFP4 W4A16. Oba są specjalistami od tłumaczenia. Oba są aktualne. Jednego z nich możesz uruchomić ze stacji roboczej, a ten jeden fakt zmienia sposób patrzenia na całe porównanie — bo benchmark, w którym najchętniej oceniano by je na równych zasadach, nie istnieje.
Zacznij od koperty, a nie od wyników
Koszt wdrożenia to wymiar, który decyduje o większości rzeczywistych integracji, i tutaj oba modele nie są sobie bliskie. Hy-MT2-7B to gęsty model HunYuanDenseV1 o około ośmiu miliardach parametrów z opublikowanymi kompilacjami FP8 i GGUF oraz społecznościowymi wersjami MLX 8-bit dla Apple silicon. Notatki wdrożeniowe Tencenta wymieniają transformers 5.6.0 lub nowsze, vLLM, SGLang i llama.cpp jako obsługiwane środowiska uruchomieniowe, a wskazówki dotyczące wnioskowania ograniczają generowanie do 8 192 tokenów, mimo że konfiguracja deklaruje do 262 144 pozycji. Wystarczy jeden nowoczesny konsumencki lub stacjonarny GPU.
North Small Translate 1.0 należy do zupełnie innej klasy obiektów. Jego łączne parametry 218B, z czego 25B aktywnych, są rozdzielone między 128 ekspertów, z ośmioma aktywnymi na token oraz ekspertami współdzielonymi, a Cohere publikuje minimalne wymagania sprzętowe dla każdego z trzech checkpointów: cztery B200s lub osiem H100s dla BF16, dwa B200s lub cztery H100s dla FP8, jeden B200 lub dwa H100s dla wersji NVFP4 W4A16. Serwowanie odbywa się przez vLLM z cohere_melody>=0.9.0, a Cohere zaleca dekodowanie zachłanne, aby dopasować się do produkcji. Dane wyjściowe zawierają <|START_TEXT|> i <|END_TEXT|>znaczniki, które nie są zarejestrowane jako tokeny specjalne:
• Kształt — North Small Translate 1.0: 218B łącznie / 25B aktywnych w rzadkim MoE, 128 ekspertów w porównaniu z Hy-MT2-7B: gęsty, około 8B
• Kontekst — 16K na wejściu i 16K na wyjściu w porównaniu z 8K okna roboczego, konfiguracja deklaruje do 262 144 pozycji
• Minimalny sprzęt — 1×B200 przy W4A16, 2×B200 lub 4×H100 przy FP8 w porównaniu z pojedynczym GPU klasy RTX 4090 w ~16 GB
• Opublikowane formaty — BF16, FP8, NVFP4 W4A16 vs base, FP8, GGUF oraz społecznościowy MLX 8-bit
• Języki — 50 (angielski + 49) kontra 33 języki plus 5 języków mniejszościowych i dialektów
• Licencja — CC BY-NC 4.0, komercyjne przez Model Vault vs Apache 2.0, bez ograniczeń
• Zgłaszana jakość — WMT26 83.60, metryka nienazwana, dane zgłoszone przez dostawcę vs nazwane tabele dostawców w FLORES-200, WMT25 GEMBA, XCOMET-XXL i IFMTBench

Problem benchmarkowy
Oto uczciwy rdzeń tego starcia: nie możemy uszeregować tych dwóch modeli względem siebie, a każdy, kto twierdzi inaczej, wymyśla liczbę. Tencent opublikował cztery nazwane ewaluacje. W tłumaczeniu FLORES-200 z angielskiego na X model 7B osiąga 93,52, za wynikami 94,42 Gemini 3.1 Pro i 94,16 GPT-5.5, ale wystarczająco blisko, by mieć znaczenie. W metryce GEMBA powiązanej z WMT25 uzyskuje 82,24 wobec 84,34 modelu 30B-A3B i 83,41 GPT-5.5. W XCOMET-XXL wyprzedza wszystko w tabeli porównawczej firmy Tencent z wynikiem 63,86 — przed Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro i Kimi K2.6. W wyniku IFMTBench za przestrzeganie instrukcji osiąga 83,14%. Wszystkie te liczby są własnymi liczbami firmy Tencent, żadna nie została niezależnie odtworzona, a mimo to jest ich wciąż znacznie więcej niż to, co zaoferował Cohere.
Cohere opublikował jedną wartość: wynik WMT26 na poziomie 83,60, rosnący do 84,36 w agentowym, wieloprzebiegowym przepływie pracy. Na karcie modelu ani w notatce wydania nie podano nazwy żadnej metryki, a dla tego modelu nie opublikowano żadnej strony z wynikami WMT26. Ta asymetria nie jest dowodem na to, że model Cohere jest słabszy albo mocniejszy. Oznacza to, że porównania, którego czytelnik chce najbardziej — ten sam test, ta sama metryka, oba modele — nie można przeprowadzić na podstawie publicznych danych, a czteropunktowy rozrzut w obrębie dwóch własnych wartości Cohere (83,60 do 84,36) jest już większy niż większość różnic w tabeli Tencent.
Języki i długi dokument
North Small Translate 1.0 obsługuje pięćdziesiąt języków i wariantów lokalizacyjnych, przy czym współczesny standardowy arabski, niemiecki, francuski, japoński, koreański, rosyjski i ukraiński wyznaczono jako poziom pierwszy, a po obu stronach przyjmuje i generuje 16 000 tokenów. Hy-MT2-7B obsługuje trzydzieści trzy języki oraz pięć języków mniejszościowych i dialektów, w tym tybetański, ujgurski i kantoński. Żadna z tych list nie jest nadzbiorem drugiej — Tencent sięga po kantoński i ujgurski, Cohere obejmuje szerszy zestaw lokalizacji europejskich — więc wdrożenie wielojęzyczne może się okazać, że już ze względu na samo pokrycie potrzebuje obu.
Okno wyjściowe to ta mniej rzucająca się w oczy różnica. Szesnaście tysięcy tokenów wyjścia oznacza pełny dokument procedury w jednym przebiegu, ze spójną terminologią i rejestrem w całym tekście, ponieważ model widział go w całości. Okno 8K tego nie zapewnia, a obejście polegające na tłumaczeniu zdanie po zdaniu ponownie wprowadza dokładnie te problemy ze spójnością między segmentami, których mierzenie było celem benchmarków takich jak IFMTBench, służących ocenie przestrzegania instrukcji tłumaczeniowych.

Licencja znowu decyduje o więcej niż tabela
North Small Translate 1.0 jest objęty licencją CC BY-NC 4.0. Wagi są bezpłatne do zastosowań niekomercyjnych, a wdrożenie komercyjne odbywa się przez Model Vault firmy Cohere na podstawie wykupionej licencji bez opublikowanej ceny. Hy-MT2-7B jest objęty licencją Apache 2.0 i nie ma ograniczeń dostępu — użytkowanie komercyjne, dostrajanie i prace pochodne są dozwolone bez konieczności rozmowy. W przypadku produktu komercyjnego kolejność działań nasuwa się sama: Hy-MT2-7B można wdrożyć już dziś, a model Cohere można dziś ocenić, i żaden wiersz benchmarku nie zmienia tej kolejności.
Przewagą kompensującą Cohere jest darmowy plan. North Small Translate 1.0 działa w darmowym planie Chat V2, bezpłatnie zarówno dla kluczy próbnych, jak i produkcyjnych, dopóki nie zostaną osiągnięte limity szybkości, więc ewaluacja kosztuje tylko czas. Hy-MT2-7B ma hostowane komercyjne API — Tencent wycenił hostowany plan tej rodziny na około 0,044 USD za milion tokenów wejściowych i 0,177 USD za milion tokenów wyjściowych — a samodzielne hostowanie na własnym GPU to naprawdę darmowa ścieżka.
Co tak naprawdę oznacza „multi-pass”
Decyzja Cohere o opublikowaniu zarówno 83,60, jak i 84,36 to najbardziej pouczający szczegół w notatce o wydaniu, ponieważ mówi, że firma wierzy, iż przepływ pracy bije pojedyncze wywołanie. To ten sam zakład, który Tencent postawił z innym mechanizmem: jego flagowy 30B-A3B wygrywa na GEMBA i XCOMET, podczas gdy Gemini 3.1 Pro wygrywa na FLORES-200, co oznacza, że najlepszy system to nie jeden model, lecz panel. Fuzja modeli OrcaRouter uruchamia kilka modeli jako panel i uzgadnia ich odpowiedzi w ramach jednego wywołania, co jest wersją idei wielokrotnego przebiegu na poziomie platformy, za którą gonią obaj dostawcy — i współgra to ze stroną routingu, gdzie jeden klucz obejmuje katalog ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, więc zmiana ceny dostawcy trafia na naszą stronę tego samego dnia, a nie przy kolejnym odnowieniu umowy.
Takie ujęcie rozwiązuje też problem dowodowy, od którego rozpoczął się ten artykuł. Gdy dwóch dostawców publikuje niepokrywające się benchmarki i żaden nie ma niezależnej oceny, sposobem wyboru nie jest zaufanie tabeli. Trzeba uruchomić oba na własnych dokumentach i pozwolić, by rozbieżność ujawniła się na prawdziwym tekście — właśnie temu służą panel i łańcuch przełączania awaryjnego.

Który i kiedy
Jeśli potrzebujesz modelu tłumaczeniowego działającego na sprzęcie, który już posiadasz, w produkcie komercyjnym, bez rozmów o licencji, Hy-MT2-7B wygrywa już choćby na podstawie samego zestawu warunków — a jego wyniki opublikowane przez dostawcę, choć niepowtórzone, są przynajmniej nazwane, porównywalne i bliskie czołówki. Jeśli tłumaczysz długie dokumenty na pięćdziesiąt języków Cohere, potrzebujesz 16K spójnych danych wyjściowych na przebieg i masz albo budżet na dwa B200, albo gotowość do przeprowadzenia ewaluacji w darmowym planie Cohere przed podjęciem decyzji, North Small Translate 1.0 jest maszyną o większych możliwościach w każdym ujawnionym wymiarze.
Żaden z tych dwóch modeli nie usuwa potrzeby testowania. Cohere dało Ci jedną nienazwaną liczbę i darmowy sposób, by ją sprawdzić. Tencent dał Ci tabelę i plik do pobrania wielkości GPU. 83,60 to obietnica, a nie wynik — a jedynym miejscem, w którym ta obietnica zostaje rozstrzygnięta, jest Twój własny korpus.
