
North Small Translate 1.0 vs Hy-MT2: Dwa modele tłumaczeniowe MoE, jedna luka w dowodach
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Obie te rodziny powstały na tym samym założeniu — że rzadka sieć typu mixture-of-experts dostrojona do tłumaczenia bije model ogólnego przeznaczenia poproszony o tłumaczenie — i doszły do niego z przeciwnych kierunków. Hy-MT2, rodzina trzech modeli tłumaczeniowych Tencent Hunyuan, na czele której stoi Hy-MT2-30B-A3B typu MoE, została udostępniona jako open source 21 maja 2026 na licencji Apache 2.0 wraz z raportem technicznym, otwartym benchmarkiem i pełną tabelą porównawczą. North Small Translate 1.0, tłumacz MoE firmy Cohere z 218 miliardami parametrów, z których 25 miliardów jest aktywnych, został udokumentowany w nocie wydania z 9 września 2026, a dowody na jego jakość sprowadzają się do jednej liczby, do której nie przypisano żadnej metryki. Architektury są do siebie podobne. Dokumentacja już nie — i ta różnica jest tym, co najbardziej warto zrozumieć przed wyborem któregokolwiek z nich.
Jedna rodzina, trzy rozmiary kontra jeden duży model
Hy-MT2 to nie pojedynczy model, lecz cała rodzina: gęsty model 1.8B do pracy na urządzeniu, gęsty model 7B na pojedynczą GPU oraz 30B-A3B MoE jako model flagowy z trzema miliardami parametrów aktywnych na token. Wszystkie trzy są na licencji Apache 2.0, bez ograniczeń dostępu, i zostały udostępnione wraz z kwantyzacjami FP8, GGUF, 2-bitową i 1,25-bitową, a także z benchmarkiem IFMTBench do oceny podążania za instrukcjami i towarzyszącą publikacją. Tencent podaje, że rodzina tłumaczy między 33 językami oraz pięcioma językami i dialektami mniejszościowymi.
North Small Translate 1.0 jest pojedynczym punktem w przestrzeni rozmiarów, i to dużym: 218B parametrów łącznie, 25B aktywnych, 128 ekspertów z ośmioma aktywowanymi na token plus eksperci współdzieleni, oraz mechanizm uwagi przełączający się w stosunku 3:1 między warstwami z przesuwnym oknem (okno 4096, RoPE) a warstwami globalnymi nieposiadającymi osadzeń pozycyjnych. Jego okno wynosi 16K na wejściu i 16K na wyjściu dla języka angielskiego i 49 innych języków, przy czym współczesny standardowy arabski, niemiecki, francuski, japoński, koreański, rosyjski i ukraiński zostały określone jako tier-one. Co istotne, ten kształt nie jest nowy — Command A+ firmy Cohere z maja 2026 wykorzystywał tę samą konfigurację 218B/25B — co czyni to specjalizującym się w tłumaczeniu post-treningiem istniejącego rdzenia, a nie nową architekturą.
• Parametry — North Small Translate 1.0: 218B łącznie / 25B aktywnych vs Hy-MT2-30B-A3B: 30B łącznie / 3B aktywnych, z gęstymi wariantami 1.8B i 7B
• Kontekst — 16K na wejściu i 16K na wyjściu w porównaniu z 8K okna roboczego, konfiguracja deklaruje do 262 144 pozycji
• Języki — 50 (angielski + 49) vs 33 plus 5 języków mniejszościowych i dialektów
• Licencja — CC BY-NC 4.0, komercyjne przez Model Vault vs Apache 2.0, bez ograniczeń
• Opublikowane dowody — jedna nienazwana wartość WMT26, dane raportowane przez dostawcę vs raport techniczny, otwarty benchmark oraz nazwane wyniki dla FLORES-200, WMT25 GEMBA i XCOMET-XXL
• Serwowanie — vLLM z cohere_melody>=0.9.0, zalecane dekodowanie zachłanne w porównaniu z transformers, vLLM, SGLang i llama.cpp
• Ogłoszono — 9 września 2026 (wagi z ograniczonym dostępem na Hugging Face od 14 sierpnia) vs 21 maja 2026

Luka dowodowa to prawdziwa historia
Premiera Tencent przyszła z dowodami. Na arXiv jest artykuł, benchmark, który firma napisała i udostępniła jako open source specjalnie po to, by mierzyć podążanie za instrukcjami tłumaczeniowymi, oraz tabela wyników wymieniająca jej konkurentów. FLORES-200 English-to-X umieszcza 30B-A3B na poziomie 93,85 wobec 94,42 Gemini 3.1 Pro i 94,16 GPT-5.5. Metryka GEMBA z ery WMT25 daje mu 84,34 — najwyższy wynik w własnym porównaniu Tencenta, wyprzedzając GPT-5.5 z 83,41 i 83,29 w jego dwóch trybach, Gemini 3.1 Pro z 82,23, DeepSeek-V4-Pro z 81,99 i Kimi K2.6 z 81,68. XCOMET-XXL umieszcza go na 62,89, za jego własnym modelem 7B z tej samej rodziny. W IFMTBench osiąga 85,7% ogólnego wskaźnika podążania za instrukcjami, z podwynikiem 91,94%, który mieści się w odległości jednej setnej punktu od Gemini 3.1 Pro, oraz osobnym podwynikiem 85,55%, w którym zdecydowanie wyprzedza model Gemini 3.1 Pro.
Każdy z nich to własny pomiar Tencentu i żaden nie został niezależnie odtworzony. Ale są nazwane, są porównywalne i są falsyfikowalne — czytelnik dokładnie wie, który test przeprowadzić, aby się spierać.
Nota wydania Cohere podaje jedną liczbę: WMT26 83,60, rosnącą do 84,36 w ramach tak zwanego agentowego, wieloetapowego przepływu pracy tłumaczeniowej. Nigdzie na karcie modelu ani w dokumentacji nie podano nazwy żadnej metryki. Nie opublikowano żadnej strony z wynikami WMT26 dla tego modelu. Korpus treningowy, liczba tokenów i pipeline danych nie zostały ujawnione, podczas gdy raport techniczny Command A Translate z 2025 r. szczegółowo opisywał technikę filtrowania według trudności. Nic z tego nie jest dowodem na gorszy model. To dowód na mniejszą ilość dowodów, co jest czymś innym i ma równie duże znaczenie, gdy decydujesz, co wdrożyć do produkcji.
Wspólna miara, której żadna ze stron faktycznie nie opublikowała
Między nimi istnieje jeden prawdziwy punkt styczny i warto poświęcić mu akapit, bo to jedyne miejsce, w którym mogłoby dojść do uczciwego porównania. Tencent jest partnerem WMT26, sponsorującym zadanie tłumaczenia napisów wideo z nagrodami finansowanymi przez Hunyuan. Jedyna opublikowana liczba Cohere to wartość z WMT26. Obie organizacje znajdują się więc w tym samym cyklu oceny 2026, a jedyna metryka, w której można by rozstrzygnąć bezpośrednie starcie, jest dokładnie tą, w której tylko jedna z nich cokolwiek opublikowała — i opublikowała to, nie nazywając metryki.
To jest luka, której warto pilnować. Jeśli Cohere przypisze nazwę metryki do 83.60 albo jeśli strony wyników WMT26 będą zawierać system North Small Translate, porównanie stanie się realne. Do tego czasu zestawianie liczb Tencent dla FLORES-200 i GEMBA z nieoznaczoną wartością WMT26 Cohere byłoby fabrykacją przebraną za analizę.

Licencja i wdrożenie
Hy-MT2 jest objęty licencją Apache 2.0 bez żadnych ograniczeń dostępu: użycie komercyjne, dostrajanie, prace pochodne i redystrybucja — wszystko bez konieczności rozmowy. North Small Translate 1.0 jest objęty licencją CC BY-NC 4.0, darmowy do użytku niekomercyjnego, a wdrożenie komercyjne odbywa się przez Cohere's Model Vault w cenie, która nie została podana do publicznej wiadomości. W przypadku czegokolwiek, co trafia do klientów, ta różnica rozstrzyga decyzję, zanim jeszcze przeczyta się benchmarki.
Historia sprzętowa przebiega według tego samego schematu, tylko w odwrotnym kierunku. Hy-MT2 obejmuje zakres od skwantyzowanej wersji 440 MB, działającej na telefonie, aż po 30B-A3B, którego trzy miliardy aktywnych parametrów utrzymują obliczenia na token na umiarkowanym poziomie, jak na jego klasę jakości; środowiska wykonawcze obejmują transformers, vLLM, SGLang i llama.cpp. North Small Translate 1.0 publikuje minimalne wymagania sprzętowe dla każdego checkpointu — cztery B200 lub osiem H100 dla BF16, dwa B200 lub cztery H100 dla FP8, jeden B200 lub dwa H100 dla NVFP4 W4A16 — i zaleca dekodowanie zachłanne, aby dopasować się do środowiska produkcyjnego. Przewaga kompensująca Cohere polega na tym, że model działa w darmowym planie jej Chat V2 API, bezpłatnym dla kluczy próbnych i produkcyjnych, dopóki nie zostaną osiągnięte limity szybkości, więc jego ocena nic nie kosztuje.
Czy powinieneś się przełączyć i na co?
Kwestia przejścia jest tutaj naprawdę asymetryczna. Przejście z Hy-MT2 na North Small Translate 1.0 nie jest wzrostem wydajności, którego można by obecnie uzasadnić — to zakład na model, którego jedynym publicznym twierdzeniem jest jedna liczba, zestawiany z rodziną mającą opublikowany raport i licencję umożliwiającą wdrożenie. Warto natomiast przeprowadzić ocenę: model Cohere można wywoływać bezpłatnie, obsługuje pięćdziesiąt języków, w tym szerszy zestaw europejski, i daje 16K danych wyjściowych na przebieg, czego nie zapewnia 8K okno robocze Hy-MT2.
Ta ocena to właśnie ten przypadek, w którym warstwa routingu zarabia na siebie, bo szczera odpowiedź dla większości wielojęzycznych stosów brzmi: oba modele zostają. OrcaRouter stawia katalog ponad 200 modeli za jednym kluczem, więc wypróbowanie drugiego modelu tłumaczeniowego to zmiana konfiguracji, a nie drugi kontrakt z dostawcą czy zmiana kodu — wskazujesz tego samego klienta zgodnego z OpenAI na inny identyfikator modelu i porównujesz na własnym tekście. Cena katalogowa dostawcy jest przekazywana z 0% marży, więc zmiana ceny hostowanej jest u nas widoczna tego samego dnia, bez nakładania jakiejkolwiek dodatkowej marży, a łańcuchy przełączania awaryjnego utrzymują produkcję na modelu, który już działa, podczas gdy nowy jest oceniany. Ani North Small Translate 1.0, ani Hy-MT2 nie znajdują się dziś w naszym katalogu, więc nie jest to rekomendacja, by kupować którykolwiek z nich od nas — to argument przeciw zakodowaniu decyzji na sztywno, zanim przeprowadzisz test.

Werdykt
Hy-MT2 od Tencent to bezpieczniejszy wybór i pod względem dowodów nie ma nawet porównania: Apache 2.0, trzy rozmiary, artykuł, otwarty benchmark, cztery nazwane zestawy ewaluacyjne i partnerstwo WMT26. North Small Translate 1.0 od Cohere jest ciekawszy — 218 miliardów parametrów MoE wyspecjalizowanego w tłumaczeniu, z oknem wyjściowym 16K i pięćdziesięcioma językami, darmowy poziom ewaluacji oraz wynik 83,60, którego nikt poza Cohere nie sprawdził.
Jeśli w tym kwartale musisz podjąć decyzję, postaw na rodzinę z dowodami. Jeśli masz korpus i tydzień, przepuść jego część przez darmowy plan i sprawdź, czy nienazwane 83,60 Cohere cokolwiek znaczy w twoich dokumentach — bo to pytanie, na które żadna tabela dostawcy nie odpowie w twoim imieniu, a jedyna liczba, którą Cohere zdecydowało się opublikować, jest dokładnie tą, której nazwać odmówiło.
