Karta główna z nagłówkiem „North Small Translate 1.0 vs Hy-MT2” i podtytułem „Dwóch tłumaczy MoE, jedna luka w dowodach”, nad dwiema kartami: North Small Translate 1.0 (218B MoE / 25B aktywnych, jeden nieokreślony wynik WMT26) i Hy-MT2-30B-A3B (30B MoE / 3B aktywnych, praca, benchmark, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2: Dwa modele tłumaczeniowe MoE, jedna luka w dowodach

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Obie te rodziny powstały na tym samym założeniu — że rzadka sieć typu mixture-of-experts dostrojona do tłumaczenia bije model ogólnego przeznaczenia poproszony o tłumaczenie — i doszły do niego z przeciwnych kierunków. Hy-MT2, rodzina trzech modeli tłumaczeniowych Tencent Hunyuan, na czele której stoi Hy-MT2-30B-A3B typu MoE, została udostępniona jako open source 21 maja 2026 na licencji Apache 2.0 wraz z raportem technicznym, otwartym benchmarkiem i pełną tabelą porównawczą. North Small Translate 1.0, tłumacz MoE firmy Cohere z 218 miliardami parametrów, z których 25 miliardów jest aktywnych, został udokumentowany w nocie wydania z 9 września 2026, a dowody na jego jakość sprowadzają się do jednej liczby, do której nie przypisano żadnej metryki. Architektury są do siebie podobne. Dokumentacja już nie — i ta różnica jest tym, co najbardziej warto zrozumieć przed wyborem któregokolwiek z nich.

Jedna rodzina, trzy rozmiary kontra jeden duży model

Hy-MT2 to nie pojedynczy model, lecz cała rodzina: gęsty model 1.8B do pracy na urządzeniu, gęsty model 7B na pojedynczą GPU oraz 30B-A3B MoE jako model flagowy z trzema miliardami parametrów aktywnych na token. Wszystkie trzy są na licencji Apache 2.0, bez ograniczeń dostępu, i zostały udostępnione wraz z kwantyzacjami FP8, GGUF, 2-bitową i 1,25-bitową, a także z benchmarkiem IFMTBench do oceny podążania za instrukcjami i towarzyszącą publikacją. Tencent podaje, że rodzina tłumaczy między 33 językami oraz pięcioma językami i dialektami mniejszościowymi.

North Small Translate 1.0 jest pojedynczym punktem w przestrzeni rozmiarów, i to dużym: 218B parametrów łącznie, 25B aktywnych, 128 ekspertów z ośmioma aktywowanymi na token plus eksperci współdzieleni, oraz mechanizm uwagi przełączający się w stosunku 3:1 między warstwami z przesuwnym oknem (okno 4096, RoPE) a warstwami globalnymi nieposiadającymi osadzeń pozycyjnych. Jego okno wynosi 16K na wejściu i 16K na wyjściu dla języka angielskiego i 49 innych języków, przy czym współczesny standardowy arabski, niemiecki, francuski, japoński, koreański, rosyjski i ukraiński zostały określone jako tier-one. Co istotne, ten kształt nie jest nowy — Command A+ firmy Cohere z maja 2026 wykorzystywał tę samą konfigurację 218B/25B — co czyni to specjalizującym się w tłumaczeniu post-treningiem istniejącego rdzenia, a nie nową architekturą.

Parametry — North Small Translate 1.0: 218B łącznie / 25B aktywnych vs Hy-MT2-30B-A3B: 30B łącznie / 3B aktywnych, z gęstymi wariantami 1.8B i 7B

Kontekst — 16K na wejściu i 16K na wyjściu w porównaniu z 8K okna roboczego, konfiguracja deklaruje do 262 144 pozycji

Języki — 50 (angielski + 49) vs 33 plus 5 języków mniejszościowych i dialektów

Licencja — CC BY-NC 4.0, komercyjne przez Model Vault vs Apache 2.0, bez ograniczeń

Opublikowane dowody — jedna nienazwana wartość WMT26, dane raportowane przez dostawcę vs raport techniczny, otwarty benchmark oraz nazwane wyniki dla FLORES-200, WMT25 GEMBA i XCOMET-XXL

Serwowanie — vLLM z cohere_melody>=0.9.0, zalecane dekodowanie zachłanne w porównaniu z transformers, vLLM, SGLang i llama.cpp

Ogłoszono — 9 września 2026 (wagi z ograniczonym dostępem na Hugging Face od 14 sierpnia) vs 21 maja 2026

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-30B-A3B across six rows: Parameters 218B MoE / 25B active vs 30B MoE / 3B active; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Evidence one unnamed WMT26 figure vs FLORES-200 93.85 and GEMBA 84.34; Technical report none published vs arXiv paper and IFMTBench. Footer notes all figures are vendor-reported by Tencent and Cohere and none is independently reproduced.

Luka dowodowa to prawdziwa historia

Premiera Tencent przyszła z dowodami. Na arXiv jest artykuł, benchmark, który firma napisała i udostępniła jako open source specjalnie po to, by mierzyć podążanie za instrukcjami tłumaczeniowymi, oraz tabela wyników wymieniająca jej konkurentów. FLORES-200 English-to-X umieszcza 30B-A3B na poziomie 93,85 wobec 94,42 Gemini 3.1 Pro i 94,16 GPT-5.5. Metryka GEMBA z ery WMT25 daje mu 84,34 — najwyższy wynik w własnym porównaniu Tencenta, wyprzedzając GPT-5.5 z 83,41 i 83,29 w jego dwóch trybach, Gemini 3.1 Pro z 82,23, DeepSeek-V4-Pro z 81,99 i Kimi K2.6 z 81,68. XCOMET-XXL umieszcza go na 62,89, za jego własnym modelem 7B z tej samej rodziny. W IFMTBench osiąga 85,7% ogólnego wskaźnika podążania za instrukcjami, z podwynikiem 91,94%, który mieści się w odległości jednej setnej punktu od Gemini 3.1 Pro, oraz osobnym podwynikiem 85,55%, w którym zdecydowanie wyprzedza model Gemini 3.1 Pro.

Każdy z nich to własny pomiar Tencentu i żaden nie został niezależnie odtworzony. Ale są nazwane, są porównywalne i są falsyfikowalne — czytelnik dokładnie wie, który test przeprowadzić, aby się spierać.

Nota wydania Cohere podaje jedną liczbę: WMT26 83,60, rosnącą do 84,36 w ramach tak zwanego agentowego, wieloetapowego przepływu pracy tłumaczeniowej. Nigdzie na karcie modelu ani w dokumentacji nie podano nazwy żadnej metryki. Nie opublikowano żadnej strony z wynikami WMT26 dla tego modelu. Korpus treningowy, liczba tokenów i pipeline danych nie zostały ujawnione, podczas gdy raport techniczny Command A Translate z 2025 r. szczegółowo opisywał technikę filtrowania według trudności. Nic z tego nie jest dowodem na gorszy model. To dowód na mniejszą ilość dowodów, co jest czymś innym i ma równie duże znaczenie, gdy decydujesz, co wdrożyć do produkcji.

Wspólna miara, której żadna ze stron faktycznie nie opublikowała

Między nimi istnieje jeden prawdziwy punkt styczny i warto poświęcić mu akapit, bo to jedyne miejsce, w którym mogłoby dojść do uczciwego porównania. Tencent jest partnerem WMT26, sponsorującym zadanie tłumaczenia napisów wideo z nagrodami finansowanymi przez Hunyuan. Jedyna opublikowana liczba Cohere to wartość z WMT26. Obie organizacje znajdują się więc w tym samym cyklu oceny 2026, a jedyna metryka, w której można by rozstrzygnąć bezpośrednie starcie, jest dokładnie tą, w której tylko jedna z nich cokolwiek opublikowała — i opublikowała to, nie nazywając metryki.

To jest luka, której warto pilnować. Jeśli Cohere przypisze nazwę metryki do 83.60 albo jeśli strony wyników WMT26 będą zawierać system North Small Translate, porównanie stanie się realne. Do tego czasu zestawianie liczb Tencent dla FLORES-200 i GEMBA z nieoznaczoną wartością WMT26 Cohere byłoby fabrykacją przebraną za analizę.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Licencja i wdrożenie

Hy-MT2 jest objęty licencją Apache 2.0 bez żadnych ograniczeń dostępu: użycie komercyjne, dostrajanie, prace pochodne i redystrybucja — wszystko bez konieczności rozmowy. North Small Translate 1.0 jest objęty licencją CC BY-NC 4.0, darmowy do użytku niekomercyjnego, a wdrożenie komercyjne odbywa się przez Cohere's Model Vault w cenie, która nie została podana do publicznej wiadomości. W przypadku czegokolwiek, co trafia do klientów, ta różnica rozstrzyga decyzję, zanim jeszcze przeczyta się benchmarki.

Historia sprzętowa przebiega według tego samego schematu, tylko w odwrotnym kierunku. Hy-MT2 obejmuje zakres od skwantyzowanej wersji 440 MB, działającej na telefonie, aż po 30B-A3B, którego trzy miliardy aktywnych parametrów utrzymują obliczenia na token na umiarkowanym poziomie, jak na jego klasę jakości; środowiska wykonawcze obejmują transformers, vLLM, SGLang i llama.cpp. North Small Translate 1.0 publikuje minimalne wymagania sprzętowe dla każdego checkpointu — cztery B200 lub osiem H100 dla BF16, dwa B200 lub cztery H100 dla FP8, jeden B200 lub dwa H100 dla NVFP4 W4A16 — i zaleca dekodowanie zachłanne, aby dopasować się do środowiska produkcyjnego. Przewaga kompensująca Cohere polega na tym, że model działa w darmowym planie jej Chat V2 API, bezpłatnym dla kluczy próbnych i produkcyjnych, dopóki nie zostaną osiągnięte limity szybkości, więc jego ocena nic nie kosztuje.

Czy powinieneś się przełączyć i na co?

Kwestia przejścia jest tutaj naprawdę asymetryczna. Przejście z Hy-MT2 na North Small Translate 1.0 nie jest wzrostem wydajności, którego można by obecnie uzasadnić — to zakład na model, którego jedynym publicznym twierdzeniem jest jedna liczba, zestawiany z rodziną mającą opublikowany raport i licencję umożliwiającą wdrożenie. Warto natomiast przeprowadzić ocenę: model Cohere można wywoływać bezpłatnie, obsługuje pięćdziesiąt języków, w tym szerszy zestaw europejski, i daje 16K danych wyjściowych na przebieg, czego nie zapewnia 8K okno robocze Hy-MT2.

Ta ocena to właśnie ten przypadek, w którym warstwa routingu zarabia na siebie, bo szczera odpowiedź dla większości wielojęzycznych stosów brzmi: oba modele zostają. OrcaRouter stawia katalog ponad 200 modeli za jednym kluczem, więc wypróbowanie drugiego modelu tłumaczeniowego to zmiana konfiguracji, a nie drugi kontrakt z dostawcą czy zmiana kodu — wskazujesz tego samego klienta zgodnego z OpenAI na inny identyfikator modelu i porównujesz na własnym tekście. Cena katalogowa dostawcy jest przekazywana z 0% marży, więc zmiana ceny hostowanej jest u nas widoczna tego samego dnia, bez nakładania jakiejkolwiek dodatkowej marży, a łańcuchy przełączania awaryjnego utrzymują produkcję na modelu, który już działa, podczas gdy nowy jest oceniany. Ani North Small Translate 1.0, ani Hy-MT2 nie znajdują się dziś w naszym katalogu, więc nie jest to rekomendacja, by kupować którykolwiek z nich od nas — to argument przeciw zakodowaniu decyzji na sztywno, zanim przeprowadzisz test.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Werdykt

Hy-MT2 od Tencent to bezpieczniejszy wybór i pod względem dowodów nie ma nawet porównania: Apache 2.0, trzy rozmiary, artykuł, otwarty benchmark, cztery nazwane zestawy ewaluacyjne i partnerstwo WMT26. North Small Translate 1.0 od Cohere jest ciekawszy — 218 miliardów parametrów MoE wyspecjalizowanego w tłumaczeniu, z oknem wyjściowym 16K i pięćdziesięcioma językami, darmowy poziom ewaluacji oraz wynik 83,60, którego nikt poza Cohere nie sprawdził.

Jeśli w tym kwartale musisz podjąć decyzję, postaw na rodzinę z dowodami. Jeśli masz korpus i tydzień, przepuść jego część przez darmowy plan i sprawdź, czy nienazwane 83,60 Cohere cokolwiek znaczy w twoich dokumentach — bo to pytanie, na które żadna tabela dostawcy nie odpowie w twoim imieniu, a jedyna liczba, którą Cohere zdecydowało się opublikować, jest dokładnie tą, której nazwać odmówiło.