Karta hero z nagłówkiem „North Small Translate 1.0 vs Hy-MT2-1.8B” i podtytułem „218 GB modelu kontra 440 MB”, nad dwiema kartami: North Small Translate 1.0 (218B MoE, minimum 2x B200) oraz Hy-MT2-1.8B (1,8B dense, 440 MB, działa na telefonie) z ikoną konturową telefonu.
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-1.8B: 218GB modelu kontra 440MB

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jeden z nich mieści się na telefonie. Hy-MT2-1.8B, model tłumaczeniowy Tencent Hunyuan działający na urządzeniu, udostępniony na licencji Apache 2.0 21 maja 2026 r., dzięki kwantyzacji AngelSlim 1,25-bitowej zmniejsza się do 440 megabajtów i działa na procesorach telefonów Apple, Qualcomm i MediaTek. North Small Translate 1.0, model typu mixture-of-experts o 218 miliardach parametrów, który Cohere opisał w informacjach o wydaniu z 9 września 2026 r., jest dostarczany z zestawem wag FP8 rzędu 218 gigabajtów i wymaga co najmniej dwóch B200. To około pięćset razy więcej pamięci niż zajmuje jeden z nich, a ciekawe pytanie nie polega na tym, który jest lepszy — tylko na tym, do czego właściwie służy każdy z nich i która licencja pozwala ci go wdrożyć.

Różnica w rozmiarze to nie różnica w jakości.

Kuszące jest odczytywanie 218B w zestawieniu z 1.8B jako prostego rankingu możliwości. Tak jednak nie jest, z dwóch powodów. Po pierwsze, North Small Translate 1.0 to rzadki model typu mixture-of-experts z zaledwie 25 miliardami parametrów aktywnych na token, więc obliczenia przypadające na token należą do zupełnie innej ligi niż liczba parametrów. Po drugie, oba modele optymalizowano pod różne cele: model 1.8B Tencenta powstał, by był wystarczająco mały do działania offline na telefonie, a model Cohere powstał, by utrzymywać cały dokument w kontekście i tłumaczyć go jako jedną całość.

Ta różnica jest widoczna w oknach kontekstowych. Konfiguracja Hy-MT2-1.8B deklaruje do 262 144 pozycji, ale własne wytyczne Tencent dotyczące wnioskowania ograniczają generowanie do 8 192 tokenów — praktyczne okno robocze to 8K. North Small Translate 1.0 dokumentuje 16K na wejściu i 16K na wyjściu, co stanowi dwukrotność okna wejściowego i, co ważniejsze, pełne 16K wyjścia. Jeśli twoją jednostką pracy jest instrukcja serwisowa, ten budżet wyjściowy jest cechą. Jeśli twoją jednostką pracy jest wiadomość czatowa, jest nieistotny.

Łączna liczba parametrów — North Small Translate 1.0: 218 mld MoE, 25 mld aktywnych w porównaniu z Hy-MT2-1.8B: 1,8 mld gęstych

Kontekst — 16K na wejściu i 16K na wyjściu w porównaniu z 8K oknem roboczym (konfiguracja deklaruje do 262,144 pozycji; wytyczne Tencent mówią o 8,192)

Języki — 50 (angielski + 49) kontra 33 języki plus 5 języków mniejszościowych i dialektów

Licencja — CC BY-NC 4.0, komercyjne przez Model Vault vs Apache 2.0, bez ograniczeń

Rozmiar po kwantyzacji — FP8 ~218GB, NVFP4 W4A16 ~109GB w porównaniu z 440MB przy 1,25 bita, FP8 i GGUF również opublikowane

Minimalna konfiguracja sprzętowa — 2×B200 lub 4×H100 przy FP8 w porównaniu z telefonem

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-1.8B across six rows: Parameters 218B MoE / 25B active vs 1.8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Footprint about 218GB at FP8 vs 440MB at 1.25-bit; Minimum hardware 2x B200 vs a handset. Footer notes Hy-MT2 figures are vendor-reported by Tencent and Cohere's WMT26 83.60 is unaudited with an unnamed metric.

Co Tencent faktycznie wypuścił w 1.8B

1.8B to najmniejszy członek trzyosobowej rodziny modeli — 1.8B, 7B i flagowego MoE 30B-A3B — wypuszczonych razem z towarzyszącym benchmarkiem o nazwie IFMTBench, który mierzy podążanie za instrukcjami tłumaczeniowymi, a nie samą jakość tłumaczenia. Tencent udostępnił kwantyzacje FP8, GGUF, 2-bitową i 1,25-bitową wraz z wagami bazowymi, a to wersja 1,25-bitowa odpowiada za wartość 440 MB i deklarowane 1,5× przyspieszenie wnioskowania względem poprzedniej generacji Hy-MT1.5. Obsługa jest zapewniona przez transformers 5.6.0 i nowsze, vLLM, SGLang oraz llama.cpp, przy czym ścieżka GGUF zależy od jądra STQ dodanego do llama.cpp. Zalecane próbkowanie to temperatura 0,7, top_p 0,6, top_k 20, kara za powtórzenia 1,05, a domyślny prompt systemowy nie istnieje — czyli odwrotnie niż w podejściu Cohere.

W przeciwieństwie do North Small Translate 1.0 jest to także model, który cieszy się widocznym przyjęciem. Repozytorium Hugging Face zostało pobrane ponad 23 000 razy i ma około 1200 polubień. Główne repozytorium Cohere miało 26 pobrań i zero polubień w chwili pisania tego tekstu.

Licencja to wyraźniejsza różnica

To jest ta część, która powinna decydować o większej liczbie wdrożeń niż tabela benchmarków. Hy-MT2-1.8B jest objęty licencją Apache 2.0 bez ograniczeń dostępu — użycie komercyjne, dostrajanie, prace pochodne, redystrybucja — wszystko dozwolone. North Small Translate 1.0 jest na licencji CC BY-NC 4.0: wagi są darmowe do użytku niekomercyjnego, a wdrożenie komercyjne wymaga wykupienia licencji za pośrednictwem Cohere's Model Vault, dla której nie opublikowano ceny.

Mówiąc wprost: jeśli budujesz produkt, model Tencenta jest tym, który możesz wdrożyć już dziś bez żadnej rozmowy, a model Cohere jest tym, który możesz tylko ocenić. Ta asymetria nie czyni modelu Cohere gorszym, ale zmienia kolejność działań — model Cohere oceniasz, a model Tencenta możesz wdrożyć.

Dowody dotyczące jakości są asymetryczne, a obie strony są raportowane przez dostawców.

Za żadnym z tych modeli nie stoi niezależna ewaluacja, więc każdą liczbę tutaj traktuj jako twierdzenie jego twórcy. Różnica polega na tym, ile twórcy wyłożyli na stół. Tencent opublikował pełną tabelę porównawczą i raport techniczny: w tłumaczeniu FLORES-200 z angielskiego na X Hy-MT2-1.8B osiąga 90,00 wobec 94,42 Gemini 3.1 Pro i 94,16 GPT-5.5 — nieco za modelami frontierowymi, ale w granicach kilku punktów, w modelu, który mieści się w telefonie. W ogólnym wyniku IFMTBench za przestrzeganie instrukcji 1.8B osiąga 69,36%, znacznie poniżej swojego własnego modelu 30B-A3B na poziomie 85,7% i Gemini 3.1 Pro na 89,08%, co jest uczciwym odczytem kompromisu: malutki model znacznie mniej niezawodnie przestrzega instrukcji formatowania i terminologii, niż tłumaczy.

Cohere opublikował jedną liczbę — wynik WMT26 wynoszący 83,60, rosnący do 84,36 dzięki wieloprzebiegowemu workflow opartemu na agentach — bez podanej nazwy metryki i bez strony z wynikami WMT26, względem której można by ją sprawdzić. To nie jest porównanie, które możemy przeprowadzić. Pojedynczej nienazwanej liczby nie można zestawić z tabelą nazwanych benchmarków, a udawanie, że jest inaczej, byłoby najbardziej wprowadzającą w błąd rzeczą, jaką ten artykuł mógłby zrobić.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Przeciwwagą Tencentu jest to, że jego liczby pochodzą z miejsca, które czytelnik może sprawdzić. Repozytorium Hy-MT2 publikuje przegląd rodziny, trzy rozmiary modeli i środowiska uruchomieniowe obsługiwane przez każdy z nich obok tabeli benchmarków — to właśnie sprawia, że wyniki FLORES-200 i IFMTBench można w ogóle zweryfikować, a przez kontrast sprawia, że pojedyncza nienazwana liczba Cohere rzuca się w oczy.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Ile kosztuje połączenie z każdym z nich

Model 1.8B Tencenta ma hostowane komercyjne API, które uruchomiono w sierpniu 2026 r., w cenie około 0,044 USD za milion tokenów wejściowych i 0,177 USD za milion tokenów wyjściowych — tanio w kategoriach absolutnych i rozliczane za token. Model Cohere działa w darmowym planie Chat V2, bezpłatnie dla kluczy testowych i produkcyjnych, dopóki nie zostaną osiągnięte limity szybkości, więc koszt oceny wynosi zero, ale koszt produkcji to umowa, którą trzeba wynegocjować. Hostowanie własne całkowicie odwraca arytmetykę: 440 MB na telefonie versus dwa B200, co jest różnicą mierzoną w rzędach wielkości, a nie w procentach.

Powód, dla którego warto wspomnieć o tej luce w tekście o platformie routingu, jest taki, że tania warstwa i droga warstwa nie są konkurentami — to dwie pozycje w kaskadzie, a kaskady to właśnie domena routera. OrcaRouter przekazuje cenę katalogową dostawcy bez marży (0%), więc obniżka ceny dostawcy w hostowanym punkcie końcowym tłumaczenia obowiązuje po naszej stronie tego samego dnia, bez marży pośrednika do renegocjacji, a łańcuchy przełączania awaryjnego pozwalają mniejszemu modelowi przejąć większość ruchu, podczas gdy cięższy model obsługuje żądania, na których ten pierwszy zawodzi. Wypróbuj najpierw ten tani, eskaluj w trudnych przypadkach i pozwól, by polityka znajdowała się w warstwie routingu, a nie w kodzie aplikacji.

Który powinieneś wybrać

Jeśli twoje tłumaczenie odbywa się na urządzeniu, offline, w ramach budżetu pamięci masowej na megabajt albo wewnątrz produktu komercyjnego, który nie ma ochoty na negocjacje licencyjne, to Hy-MT2-1.8B jest odpowiedzią, a North Small Translate 1.0 nie wchodzi w grę. Jeśli twoją jednostką pracy jest długi dokument w jednym z pięćdziesięciu języków obsługiwanych przez Cohere, jeśli potrzebujesz 16K wyjścia w jednym przebiegu i jeśli licencja komercyjna to coś, co twoja organizacja jest gotowa kupić, to model Cohere jest bardziej wydajną maszyną w każdym ujawnionym wymiarze — z zastrzeżeniem, że jego jakość opiera się na pojedynczej niepowtórzonej liczbie.

A dla większości zespołów uczciwa odpowiedź brzmi: jedno i drugie, w tej kolejności: model 440MB wykonuje rutynową pracę przy znikomym koszcie, model 218B obsługuje dokumenty, które mają znaczenie, a decyzja o tym, które żądanie trafia gdzie, jest regułą routingu, a nie przepisaniem. Przepaść między tymi dwoma modelami nie jest przepaścią do zamknięcia. To spektrum, które należy wykorzystać.