“North Small Translate 1.0 vs Hy-MT2-1.8B”라는 제목과 “모델 218GB 대 440MB”라는 부제가 달린 히어로 카드가 두 카드 위에 있습니다. 두 카드는 North Small Translate 1.0(218B MoE, 최소 2x B200)과 Hy-MT2-1.8B(1.8B dense, 440MB, 핸드셋에서 실행)이며, 휴대폰 윤곽선 아이콘이 함께 있습니다.
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-1.8B: 모델 218GB 대 440MB

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 중 하나는 휴대폰에 들어간다. Hy-MT2-1.8B는 2026년 5월 21일 Apache 2.0으로 오픈소스화된 Tencent Hunyuan의 온디바이스 번역 모델로, AngelSlim 1.25비트 양자화에서 440메가바이트로 줄어들어 Apple, Qualcomm, MediaTek 휴대폰 실리콘에서 실행된다. North Small Translate 1.0은 2026년 9월 9일 Cohere가 릴리스 노트에 문서화한 2180억 매개변수 전문가 혼합 모델로, 약 218기가바이트 규모의 FP8 가중치 세트를 제공하며 최소 두 대의 B200을 요구한다. 이는 그중 하나의 저장 용량이 대략 500배라는 뜻이며, 흥미로운 질문은 어느 쪽이 더 나은가가 아니라 각각이 실제로 무엇을 위한 것이고 어느 라이선스가 이를 배포할 수 있게 해 주는가이다.

크기의 차이는 품질의 차이가 아니다

218B를 1.8B와 나란히 놓고 단순한 역량 순위로 읽고 싶은 유혹이 든다. 하지만 그렇지 않다. 두 가지 이유 때문이다. 첫째, North Small Translate 1.0은 토큰당 250억 개의 파라미터만 활성화되는 희소 전문가 혼합 모델이므로, 토큰당 연산량은 파라미터 수와는 차원이 다르다. 둘째, 두 모델은 서로 다른 목표에 맞춰 최적화되었다. Tencent의 1.8B는 휴대폰에서 오프라인으로 실행할 수 있을 만큼 작게 만들어졌고, Cohere의 모델은 전체 문서를 컨텍스트에 담아 하나의 단위로 번역하도록 만들어졌다.

그 차이는 컨텍스트 윈도에서 확인할 수 있습니다. Hy-MT2-1.8B의 구성은 최대 262,144개 포지션을 표방하지만, 텐센트 자체의 추론 가이드라인은 생성을 8,192토큰으로 제한합니다 — 실질적인 작업 윈도는 8K입니다. North Small Translate 1.0은 입력 16K, 출력 16K를 문서화하는데, 이는 입력 윈도의 두 배이며, 더 중요하게는 무려 16K의 출력입니다. 작업 단위가 서비스 매뉴얼이라면, 그 출력 예산이 바로 핵심 기능입니다. 작업 단위가 채팅 메시지라면, 그것은 무관합니다.

총 파라미터 — North Small Translate 1.0: 218B MoE, 25B 활성 vs Hy-MT2-1.8B: 1.8B 덴스

컨텍스트 — 입력 16K, 출력 16K 대 8K 작업 윈도우 (설정에는 최대 262,144개 포지션이 광고되지만, Tencent의 안내는 8,192개)

언어 — 50개(영어 + 49개) vs 33개 언어 및 5개 소수 언어와 방언

라이선스 — CC BY-NC 4.0, Model Vault를 통한 상업적 이용 vs Apache 2.0, 게이트 없음

양자화된 풋프린트 — FP8 약 218GB, NVFP4 W4A16 약 109GB, 1.25비트에서 440MB와 대비, FP8 및 GGUF도 공개

최소 하드웨어 — FP8 기준 2×B200 또는 4×H100 vs 핸드셋

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-1.8B across six rows: Parameters 218B MoE / 25B active vs 1.8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Footprint about 218GB at FP8 vs 440MB at 1.25-bit; Minimum hardware 2x B200 vs a handset. Footer notes Hy-MT2 figures are vendor-reported by Tencent and Cohere's WMT26 83.60 is unaudited with an unnamed metric.

텐센트가 1.8B에서 실제로 내놓은 것

1.8B는 3개 모델 패밀리 중 가장 작은 구성원이다 — 1.8B, 7B, 그리고 30B-A3B MoE 플래그십 — 모두 원시 번역 품질이 아니라 번역 지시 수행 능력을 측정하는 IFMTBench라는 동반 벤치마크와 함께 공개되었다. 텐센트는 기본 가중치와 함께 FP8, GGUF, 2비트 및 1.25비트 양자화를 제공했으며, 440MB라는 수치와 이전 Hy-MT1.5 세대 대비 1.5배 추론 속도 향상 주장을 만들어내는 것은 바로 1.25비트 버전이다. 서빙은 transformers 5.6.0 이상, vLLM, SGLang 및 llama.cpp를 통해 지원되며, GGUF 경로는 llama.cpp에 반영된 STQ 커널에 의존한다. 권장 샘플링은 temperature 0.7, top_p 0.6, top_k 20, 반복 패널티 1.05이며, 기본 시스템 프롬프트는 없다 — Cohere의 접근 방식과 정반대다.

또한 North Small Translate 1.0과 달리, 이 모델은 실제 채택 사례가 눈에 띕니다. Hugging Face 리포지토리는 23,000회 이상 다운로드되었고 약 1,200개의 좋아요를 받았습니다. 이 글을 작성한 시점에 Cohere의 주요 리포지토리는 다운로드 26회, 좋아요 0개를 기록했습니다.

라이선스가 더 뚜렷한 차이입니다

이것이 벤치마크 표보다 더 많은 배포를 좌우해야 하는 부분이다. Hy-MT2-1.8B는 게이팅이 없는 Apache 2.0이다 — 상업적 사용, 파인튜닝, 파생 저작물, 재배포가 모두 허용된다. North Small Translate 1.0은 CC BY-NC 4.0이다: 가중치는 비상업적 사용에는 무료이며, 상업적 배포에는 Cohere의 Model Vault를 통해 구매한 라이선스가 필요하고, 그 가격은 공개되어 있지 않다.

쉽게 말해: 제품을 만들고 있다면 Tencent의 모델은 별도 논의 없이 오늘 바로 출시할 수 있는 모델이고, Cohere의 모델은 평가만 해볼 수 있는 모델이다. 이런 비대칭이 Cohere 모델을 더 나쁘게 만드는 것은 아니지만, 작업 순서를 바꾼다 — Cohere의 것은 평가하고, Tencent의 것은 배포할 수 있다.

품질 증거는 비대칭적이며, 양측 모두 공급업체가 보고한 것이다.

두 모델 모두 이를 뒷받침하는 독립적 평가가 없으므로, 여기 있는 모든 수치는 해당 개발사의 주장으로 받아들여야 합니다. 차이는 각 개발사가 얼마나 많은 정보를 내놓았는가에 있습니다. 텐센트는 전체 비교표와 기술 보고서를 공개했습니다. FLORES-200 영어→X 번역에서 Hy-MT2-1.8B는 90.00을 기록했으며, 이는 Gemini 3.1 Pro의 94.42, GPT-5.5의 94.16과 비교됩니다. 최전선 모델들보다 소폭 뒤처지지만 몇 점 차이 안이며, 휴대폰에 들어가는 모델이 낸 결과입니다. IFMTBench의 전체 지시 수행 점수에서 1.8B는 69.36%로, 자사의 30B-A3B 형제 모델인 85.7%와 Gemini 3.1 Pro의 89.08%에 크게 뒤처집니다. 이것이 이 절충에 대한 솔직한 해석입니다. 초소형 모델은 서식과 용어 지침을 번역할 때보다 훨씬 덜 안정적으로 따릅니다.

Cohere는 WMT26 점수 83.60이라는 수치 하나를 발표했고, 에이전트형 다중 패스 워크플로를 사용하면 84.36으로 오른다고 했지만, 지표 이름은 붙이지 않았으며 이를 대조해 확인할 WMT26 결과 페이지도 없습니다. 그것은 우리가 할 수 있는 비교가 아닙니다. 이름 없는 숫자 하나를 이름이 붙은 벤치마크 표와 맞세울 수는 없으며, 그렇지 않은 척하는 것은 이 기사가 할 수 있는 가장 오해를 불러일으키는 일일 것입니다.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

텐센트의 균형추는 그 수치들이 독자가 직접 살펴볼 수 있는 곳에서 나온다는 점이다. Hy-MT2 저장소는 제품군 개요와 세 가지 모델 크기, 그리고 각 모델이 지원하는 런타임을 벤치마크 표와 함께 공개한다. 바로 이 점이 FLORES-200과 IFMTBench 수치를 애초에 검증 가능하게 만들고, 대조적으로 Cohere의 이름 없는 단일 수치를 눈에 띄게 만든다.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

각각 통화하는 데 드는 비용

Tencent의 1.8B에는 2026년 8월에 출시된 호스팅형 상용 API가 있으며, 가격은 백만 입력 토큰당 약 $0.044, 백만 출력 토큰당 $0.177입니다. 절대 금액으로는 저렴하고, 토큰당 가격이 매겨집니다. Cohere의 모델은 Chat V2의 무료 티어에서 실행되며, 레이트 리밋에 도달할 때까지 체험용 및 프로덕션 키에 무료이므로 평가 비용은 0이지만 프로덕션 비용은 협상해야 하는 계약입니다. 셀프 호스팅은 이 계산을 완전히 뒤집습니다. 핸드셋에서 440MB 대 B200 두 대로, 이는 퍼센트가 아니라 자릿수로 측정되는 차이입니다.

라우팅 플랫폼에 관한 글에서 그 격차를 언급할 가치가 있는 이유는, 저렴한 티어와 비싼 티어가 경쟁자가 아니라 하나의 캐스케이드에서 두 위치를 차지하며, 캐스케이드야말로 라우터의 존재 이유이기 때문입니다. OrcaRouter는 제공업체 정가를 0% 마크업으로 그대로 전달합니다. 따라서 호스팅 번역 엔드포인트에 대한 공급업체의 가격 인하가 재판매업체 마진을 재협상할 필요 없이 당일 우리 쪽에도 적용되며, 페일오버 체인을 통해 더 작은 모델이 트래픽의 대부분을 흡수하는 반면, 더 무거운 모델이 실패한 요청을 처리하도록 합니다. 저렴한 모델을 먼저 시도하고, 어려운 사례에서는 에스컬레이션하며, 애플리케이션 코드가 아니라 라우팅 계층이 정책을 보유하도록 하세요.

어느 것을 선택해야 할까요

번역이 기기에서, 오프라인으로, 메가바이트당 저장 공간 예산 아래에서, 또는 라이선스 협상을 할 의향이 없는 상용 제품 안에서 이루어진다면, Hy-MT2-1.8B가 답이며 North Small Translate 1.0은 경쟁 상대가 아니다. 작업 단위가 Cohere가 지원하는 50개 언어 중 하나로 된 긴 문서이고, 단일 패스로 16K의 출력이 필요하며, 조직에서 상용 라이선스를 구매할 의향이 있다면, Cohere의 모델은 공개된 모든 측면에서 더 성능이 뛰어난 머신이다 — 단, 그 품질이 단 하나의 재현되지 않은 수치에 근거한다는 단서가 따른다.

그리고 대부분의 팀에게 정직한 답은 둘 다이며, 순서도 그렇습니다. 440MB 모델은 아주 적은 비용으로 일상적인 작업을 처리하고, 218B 모델은 중요한 문서를 담당하며, 어떤 요청을 어디로 보낼지에 대한 결정은 재작성이 아니라 라우팅 규칙입니다. 이 두 모델 사이의 간극은 메워야 할 간극이 아닙니다. 그것은 활용해야 할 스펙트럼입니다.