"North Small Translate 1.0 vs Hy-MT2"라는 제목과 "두 MoE 번역기, 하나의 증거 격차"라는 부제목이 있는 히어로 카드가 두 카드 위에 있습니다: North Small Translate 1.0(218B MoE / 25B 활성, 이름이 밝혀지지 않은 WMT26 수치 하나)과 Hy-MT2-30B-A3B(30B MoE / 3B 활성, 논문, 벤치마크, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2: 두 MoE 번역기, 하나의 증거 격차

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 제품군 모두 같은 가설 — 번역을 위해 사후 학습된 희소 전문가 혼합(MoE) 네트워크가 범용 모델에 번역을 시키는 것보다 낫다는 가설 — 위에 세워졌으며, 서로 반대 방향에서 그 지점에 도달했다.Hy-MT2는 텐센트 훈위안의 3개 모델 번역 제품군으로, Hy-MT2-30B-A3B MoE가 대표 주자이며, 2026년 5월 21일 Apache 2.0 라이선스로 기술 보고서, 오픈소스 벤치마크, 전체 비교표와 함께 오픈소스로 공개되었다.North Small Translate 1.0은 Cohere의 2180억 파라미터, 250억 활성 MoE 번역기로, 2026년 9월 9일자 릴리스 노트에 문서화되었으며, 그 품질 근거라고 할 만한 것은 아무 지표도 붙지 않은 숫자 하나뿐이다. 아키텍처는 서로 닮았다. 문서는 닮지 않았고, 그 차이가 둘 중 하나를 선택하기 전에 이해해야 할 가장 유용한 점이다.

하나의 패밀리, 하나의 대형 모델에 맞선 세 가지 크기

Hy-MT2는 단일 모델이 아니라 하나의 제품군입니다. 온디바이스 작업을 위한 1.8B dense 모델, 단일 GPU를 위한 7B dense 모델, 그리고 토큰당 30억 개 파라미터가 활성화되는 플래그십 30B-A3B MoE로 구성됩니다. 세 모델 모두 Apache 2.0이며, 게이트 제한 없이 FP8, GGUF, 2비트 및 1.25비트 양자화와 IFMTBench 명령 수행 벤치마크, 그리고 함께 제공되는 논문과 동시에 공개되었습니다. Tencent는 이 제품군이 33개 언어와 5개 소수 언어 및 방언을 번역한다고 보고했습니다.

North Small Translate 1.0은 크기 공간에서 하나의 점이며, 그것도 큰 점이다: 총 218B 매개변수, 25B 활성, 토큰당 8개가 활성화되는 128개 전문가와 공유 전문가, 그리고 어텐션이 슬라이딩 윈도우 레이어(윈도우 4,096, RoPE)와 위치 임베딩을 갖지 않는 전역 레이어 사이에서 3:1 비율로 교차한다. 윈도우는 영어와 49개 다른 언어에 걸쳐 입력 16K, 출력 16K이며, 현대 표준 아랍어, 독일어, 프랑스어, 일본어, 한국어, 러시아어, 우크라이나어가 1등급으로 지정되어 있다. 주목할 점은, 이 형태는 새로운 것이 아니다 — 2026년 5월 Cohere의 Command A+가 동일한 218B/25B 구성을 사용했다 — 따라서 이것은 새로운 아키텍처라기보다 기존 코어를 번역 특화로 포스트트레인한 것이다.

매개변수 — North Small Translate 1.0: 총 218B / 활성 25B, Hy-MT2-30B-A3B: 총 30B / 활성 3B, 1.8B 및 7B dense 형제 모델 포함

컨텍스트 — 입력 16K, 출력 16K vs 8K 작업 창, 설정상 최대 262,144개 위치 지원

언어 — 50개(영어 + 49개) 대 33개 + 5개 소수 언어 및 방언

라이선스 — CC BY-NC 4.0, Model Vault를 통한 상업적 이용 vs Apache 2.0, 게이트 없음

공개된 근거 — 이름이 밝혀지지 않은 WMT26 수치 하나, 벤더 자체 보고 대 기술 보고서, 공개 벤치마크, 그리고 FLORES-200, WMT25 GEMBA 및 XCOMET-XXL에 대한 명시된 결과

서빙을 사용하는 vLLMcohere_melody>=0.9.0, transformers, vLLM, SGLang, llama.cpp 대비 그리디 디코딩 권장

발표 — 2026년 9월 9일 (8월 14일부터 Hugging Face에서 가중치 제한 공개) vs 2026년 5월 21일

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-30B-A3B across six rows: Parameters 218B MoE / 25B active vs 30B MoE / 3B active; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Evidence one unnamed WMT26 figure vs FLORES-200 93.85 and GEMBA 84.34; Technical report none published vs arXiv paper and IFMTBench. Footer notes all figures are vendor-reported by Tencent and Cohere and none is independently reproduced.

증거의 공백이 진짜 핵심이다

Tencent의 발표에는 증빙 자료가 함께했다. arXiv에 논문이 있고, 번역 지시 수행 능력을 측정하기 위해 회사가 직접 작성해 오픈소스로 공개한 벤치마크가 있으며, 경쟁사들의 이름을 명시한 결과 표가 있다. FLORES-200 English-to-X에서 30B-A3B는 93.85로, Gemini 3.1 Pro는 94.42, GPT-5.5는 94.16이다. WMT25 시대의 GEMBA 지표에서는 84.34로, Tencent의 자체 비교에서 가장 높은 점수다. 두 모드에서 각각 83.41과 83.29를 기록한 GPT-5.5, 82.23의 Gemini 3.1 Pro, 81.99의 DeepSeek-V4-Pro, 81.68의 Kimi K2.6보다 앞선다. XCOMET-XXL에서는 62.89로, 자사의 7B 형제 모델보다 낮다. IFMTBench에서는 전체 지시 수행률 85.7%에 도달했으며, Gemini 3.1 Pro와 0.01점 차이 안에 드는 91.94%의 세부 점수와, Gemini 3.1 Pro 모델을 완전히 앞서는 별도의 세부 점수 85.55%를 기록했다.

그 각각은 모두 Tencent 자체의 측정치이며, 그중 어느 것도 독립적으로 재현된 적이 없다. 그러나 그것들은 이름이 붙어 있고, 서로 비교할 수 있으며, 반증 가능하다 — 독자는 반론을 제기하기 위해 정확히 어떤 테스트를 실행해야 하는지 안다.

Cohere의 릴리스 노트는 한 가지 수치를 제시한다: WMT26 83.60, 그리고 자사가 에이전트형 다중 패스 번역 워크플로라고 부르는 방식에서는 84.36으로 상승한다. 모델 카드나 문서 어디에도 어떤 지표인지 이름이 명시되어 있지 않다. 이 모델을 대상으로 한 WMT26 결과 페이지는 게시되지 않았다. 학습 코퍼스, 토큰 수, 데이터 파이프라인은 공개되지 않았는데, 반면 Command A Translate의 2025년 기술 보고서에서는 난이도 필터링 기법을 상세히 설명했었다. 그중 어느 것도 더 나쁜 모델이라는 증거는 아니다. 그것은 증거가 더 적다는 증거이며, 이는 다른 문제이고, 프로덕션에 무엇을 투입할지 결정할 때 그만큼 중요하다.

어느 쪽도 실제로 공개한 적 없는 공통의 잣대

두 조직 사이에 실제로 맞닿는 지점이 하나 있는데, 공정한 비교가 이루어질 수 있는 유일한 곳이므로 한 단락을 할애할 가치가 있다. 텐센트는 WMT26 파트너로서, Hunyuan이 자금을 지원하는 상금과 함께 영상 자막 번역 과제를 후원하고 있다. Cohere가 공개한 단 하나의 수치는 WMT26 수치다. 따라서 두 조직 모두 같은 2026 평가 주기 안에 있으며, 정면 비교가 판가름될 수 있는 바로 그 지표는 정확히 둘 중 한 곳만 무언가를 공개한 지표다 — 그것도 그 지표의 이름을 밝히지 않고 공개했다.

바로 그것이 지켜봐야 할 격차다. Cohere가 83.60에 지표 이름을 붙이거나, WMT26 결과 페이지에 North Small Translate 시스템이 포함된다면, 그 비교는 실제가 된다. 그때까지는 Tencent의 FLORES-200 및 GEMBA 수치를 Cohere의 라벨 없는 WMT26 수치와 나란히 놓는 것은 분석으로 포장한 날조일 뿐이다.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

라이선스 및 배포

Hy-MT2는 게이팅이 없는 Apache 2.0입니다. 상업적 사용, 파인튜닝, 파생물, 재배포가 모두 별도 협의 없이 가능합니다. North Small Translate 1.0은 CC BY-NC 4.0으로 비상업적 사용은 무료지만, 상업적 배포는 공개되지 않은 가격의 Cohere의 Model Vault를 통해 이루어집니다. 고객에게 출시할 제품이라면, 그 차이만으로도 벤치마크를 읽기도 전에 결정이 끝납니다.

하드웨어 이야기도 같은 패턴을 거꾸로 따른다. Hy-MT2는 핸드셋에서 구동되는 440MB 양자화 빌드부터 30B-A3B에 이르기까지 아우르는데, 30B-A3B의 30억 개 활성 파라미터 덕분에 해당 품질 등급에서 토큰당 연산량이 적정 수준으로 유지된다. 런타임은 transformers, vLLM, SGLang, llama.cpp를 포괄한다. North Small Translate 1.0은 체크포인트별 최소 하드웨어를 공개한다 — BF16은 B200 4개 또는 H100 8개, FP8은 B200 2개 또는 H100 4개, NVFP4 W4A16은 B200 1개 또는 H100 2개 — 그리고 프로덕션에 맞추기 위해 그리디 디코딩을 권장한다. Cohere의 상쇄적 이점은 이 모델이 자사의 Chat V2 API 무료 등급에서 실행된다는 것으로, 속도 제한에 도달할 때까지 트라이얼 및 프로덕션 키에 무료로 제공되므로 평가 비용이 전혀 들지 않는다.

바꿔야 할까요? 그렇다면 무엇으로?

여기서 전환 문제는 정말로 비대칭적입니다. Hy-MT2에서 North Small Translate 1.0으로 옮기는 것은 현재 정당화할 수 있는 성능 향상이 아닙니다. 그것은 공개된 주장이라고는 숫자 하나뿐인 모델에 거는 베팅이며, 공개 보고서와 배포 가능한 라이선스를 갖춘 제품군과 맞바꾸는 것입니다. 할 가치가 있는 일은 평가입니다. Cohere 모델은 무료로 호출할 수 있고, 더 넓은 유럽어 세트를 포함한 50개 언어를 지원하며, 한 번에 16K 출력을 제공합니다. 이는 Hy-MT2의 8K 작업 창으로는 할 수 없는 일입니다.

그 평가는 라우팅 계층이 제값을 하는 경우입니다. 대부분의 다국어 스택에서 솔직한 답은 두 모델 모두 유지된다는 것이기 때문입니다. OrcaRouter는 200개가 넘는 모델 카탈로그를 하나의 키 뒤에 배치하므로, 두 번째 번역 모델을 시험해 보는 것은 구성 변경일 뿐, 두 번째 공급업체 계약이나 코드 변경이 아닙니다. 동일한 OpenAI 호환 클라이언트를 다른 모델 id로 지정하고 여러분의 텍스트로 비교하면 됩니다. 공급업체 정가는 0% 마크업으로 전달되므로, 호스팅 가격 변경은 추가 스프레드가 얹히지 않은 채 당일 우리 쪽에 반영되며, 페일오버 체인은 새 모델을 평가하는 동안 프로덕션을 이미 작동하는 모델에 유지합니다. North Small Translate 1.0과 Hy-MT2는 현재 우리 카탈로그에 없으므로, 이것은 우리에게서 둘 중 하나를 구매하라는 권장이 아니라 — 테스트를 실행해 보기 전에 결정을 하드코딩하지 말라는 주장입니다.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

평결

텐센트의 Hy-MT2는 더 안전한 선택이며, 증거를 보면 격차는 크다: Apache 2.0, 세 가지 크기, 논문, 공개 벤치마크, 이름이 붙은 네 가지 평가 스위트, 그리고 WMT26 파트너십. Cohere의 North Small Translate 1.0은 더 흥미로운 쪽이다 — 16K 출력 창과 50개 언어를 갖춘 번역 특화 MoE 2,180억 파라미터, 무료 평가 티어, 그리고 Cohere 밖에서는 아무도 검증하지 않은 83.60.

이번 분기에 결정을 내려야 한다면, 근거를 갖춘 패밀리를 택하라. 코퍼스와 일주일이 있다면, 그중 일부를 무료 티어로 돌려보고 Cohere의 이름 없는 83.60이 당신의 문서에서 의미가 있는지 알아내라 — 왜냐하면 그것은 어떤 공급업체의 표도 당신을 대신해 답해 주지 못할 질문이며, Cohere가 공개하기로 선택한 단 하나의 숫자는 바로 그것이 이름 붙이기를 거부한 숫자이기 때문이다.