“North Small Translate 1.0 vs Hy-MT2-7B”라는 제목과 “B200 두 장에 맞서는 GPU 하나”라는 부제가 있는 히어로 카드가 두 카드 위에 있습니다: North Small Translate 1.0(218B MoE / 25B 활성, CC BY-NC 4.0) 및 Hy-MT2-7B(8B dense, 약 16GB VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-7B: GPU 하나로 B200 두 개에 맞서다

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

현재 오픈 번역 분야에서 가장 박빙의 맞대결은 어쩌면 가장 의외의 맞대결이기도 합니다. Hy-MT2-7B는 텐센트 훈위안(Tencent Hunyuan) 번역 제품군의 중간에 위치한 모델로, 2026년 5월 21일 Apache 2.0 라이선스로 오픈소스화되었으며, 단일 RTX 4090 또는 A100에서 약 16GB의 VRAM으로 실행됩니다. North Small Translate 1.0은 코히어(Cohere)의 2180억 매개변수 희소 전문가 혼합(MoE) 번역기로, 2026년 9월 9일자 회사 릴리스 노트에 문서화되어 있으며, 최소 배포 사양은 FP8 기준 B200 2대 또는 NVFP4 W4A16 형태의 B200 1대입니다. 둘 다 번역 전문 모델입니다. 둘 다 최신입니다. 그중 하나는 워크스테이션에서 서빙할 수 있는데, 바로 이 단 하나의 사실이 비교 전체의 구도를 뒤바꿉니다. 두 모델이 가장 동등한 조건에서 평가받고 싶어 할 그 벤치마크가 존재하지 않기 때문입니다.

점수가 아니라 봉투부터 시작하세요

배포 비용은 대부분의 실제 통합을 결정하는 차원이며, 여기서 두 모델은 차이가 크다. Hy-MT2-7B는 약 80억 개 파라미터의 덴스 HunYuanDenseV1 모델로, 공개된 FP8 및 GGUF 빌드와 Apple silicon용 커뮤니티 MLX 8비트 버전을 갖추고 있습니다. Tencent의 배포 노트에는 transformers 5.6.0 이상, vLLM, SGLang, llama.cpp가 지원 런타임으로 나열되어 있으며, 추론 지침은 구성이 최대 262,144개 포지션을 내세우는데도 생성 길이를 8,192 토큰으로 제한합니다. 최신 소비자용 또는 워크스테이션 GPU 한 장이면 이를 처리할 수 있습니다.

North Small Translate 1.0은 다른 범주의 객체입니다. 총 218B 파라미터 중 25B가 활성 상태이며, 토큰당 8개가 활성화되는 128개 전문가와 공유 전문가로 분할되어 있습니다. Cohere는 세 가지 체크포인트 각각에 대한 최소 하드웨어를 공개합니다: BF16의 경우 B200 4개 또는 H100 8개, FP8의 경우 B200 2개 또는 H100 4개, NVFP4 W4A16 빌드의 경우 B200 1개 또는 H100 2개. 서빙은 vLLM을 통해 실행되며, cohere_melody>=0.9.0을 사용합니다. 그리고 Cohere는 프로덕션과 일치하도록 그리디 디코딩을 권장합니다. 출력은 <|START_TEXT|><|END_TEXT|> 마커를 포함하며, 이 마커들은 특수 토큰으로 등록되지 않습니다.

형태 — North Small Translate 1.0: 총 218B / 활성 25B 희소 MoE, 전문가 128개 vs Hy-MT2-7B: 덴스, 약 8B

컨텍스트 — 입력 16K, 출력 16K vs 8K 작업 창, 설정상 최대 262,144개 위치 지원

최소 하드웨어 — W4A16 기준 1×B200, FP8 기준 2×B200 또는 4×H100 vs ~16GB의 단일 RTX 4090급 GPU

공개된 형식 — BF16, FP8, NVFP4 W4A16 vs 베이스, FP8, GGUF, 그리고 커뮤니티 MLX 8비트

언어 — 50개(영어 + 49개) vs 33개 언어 및 5개 소수 언어와 방언

라이선스 — CC BY-NC 4.0, Model Vault를 통한 상업적 이용 vs Apache 2.0, 게이트 없음

보고된 품질 — WMT26 83.60, 지표명 미공개, FLORES-200, WMT25 GEMBA, XCOMET-XXL 및 IFMTBench에서 벤더 자체 보고 대 명시된 벤더 표

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

벤치마크 문제

이 대결의 솔직한 핵심은 이렇습니다: 우리는 이 두 모델을 서로 비교해 순위를 매길 수 없으며, 그렇지 않다고 말하는 사람은 숫자를 지어내고 있는 것입니다. Tencent는 네 가지 이름 붙은 평가를 공개했습니다. FLORES-200 영어→X 번역에서 7B는 93.52를 기록해, Gemini 3.1 Pro의 94.42와 GPT-5.5의 94.16에는 뒤지지만 유의미할 만큼 근접합니다. WMT25에 준하는 GEMBA 지표에서는 82.24점으로 30B-A3B의 84.34, GPT-5.5의 83.41과 맞섭니다. XCOMET-XXL에서는 63.86으로 Tencent의 비교표에 있는 모든 항목을 앞섭니다 — Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro, Kimi K2.6보다 앞서 있습니다. IFMTBench의 명령 수행 점수에서는 83.14%를 기록합니다. 이 모든 수치는 Tencent 자체 수치이며, 어느 것도 독립적으로 재현된 적이 없고, 그래도 Cohere가 제시한 것보다는 훨씬 많습니다.

Cohere는 단 하나의 수치를 공개했습니다: WMT26 점수 83.60, 그리고 에이전트형 다중 패스 워크플로에서는 84.36까지 상승합니다. 모델 카드나 릴리스 노트 어디에도 어떤 지표인지 명시되어 있지 않으며, 이 모델에 대한 WMT26 결과 페이지도 공개되지 않았습니다. 그 비대칭성은 Cohere의 모델이 더 약하거나 더 강하다는 증거가 아닙니다. 그것은 독자가 가장 원하는 비교 — 동일한 테스트, 동일한 지표, 두 모델 모두 — 를 공개된 증거만으로는 할 수 없음을 의미하며, Cohere 자체의 두 수치(83.60~84.36) 안에 있는 네 포인트 격차는 이미 Tencent의 표에 있는 대부분의 격차보다 큽니다.

언어와 긴 문서

North Small Translate 1.0은 50개 언어와 로캘 변형을 지원하며, 현대 표준 아랍어, 독일어, 프랑스어, 일본어, 한국어, 러시아어, 우크라이나어를 1등급으로 지정하고, 양쪽 방향 모두에서 16,000 토큰을 입력받고 출력합니다. Hy-MT2-7B는 티베트어, 위구르어, 광둥어를 포함한 5개 소수 언어 및 방언과 함께 33개 언어를 지원합니다. 어느 목록도 다른 목록의 상위 집합이 아닙니다 — Tencent는 광둥어와 위구르어에 도달하고, Cohere는 더 넓은 범위의 유럽 로캘에 도달합니다 — 따라서 다국어 배포에서는 커버리지만을 이유로도 둘 모두가 필요할 수 있습니다.

출력 창은 더 미묘한 차이입니다. 출력 16,000토큰은 한 번에 전체 절차 문서를 의미하며, 모델이 전체를 보았기 때문에 문서 전반에서 용어와 문체가 일관됩니다. 8K 창은 그렇지 못하며, 문장별로 처리하는 우회 방식은 IFMTBench 같은 번역 지시 따르기 벤치마크가 측정하기 위해 만들어진 바로 그 세그먼트 간 일관성 문제를 다시 불러옵니다.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

라이선스가, 또다시, 테이블보다 더 많은 것을 결정한다

North Small Translate 1.0은 CC BY-NC 4.0입니다. 가중치는 비상업적 작업에는 무료이며, 상업적 배포는 공개된 가격 없이 구매한 라이선스에 따라 Cohere의 Model Vault를 통해 이루어집니다. Hy-MT2-7B는 Apache 2.0이며 게이트가 없습니다 — 상업적 사용, 파인튜닝, 파생물이 모두 별도의 협의 없이 허용됩니다. 상업용 제품이라면 작업 순서는 저절로 정해집니다: Hy-MT2-7B는 오늘 배포할 수 있고 Cohere의 모델은 오늘 평가할 수 있으며, 어떤 벤치마크 항목도 그 순서를 바꾸지 않습니다.

Cohere의 상쇄 우위는 무료 티어다. North Small Translate 1.0은 Chat V2의 무료 티어에서 실행되며, 속도 제한에 도달하기 전까지는 체험판 키와 프로덕션 키 모두 무료로 쓸 수 있으므로 평가 비용은 시간 외에는 들지 않는다. Hy-MT2-7B는 호스팅 상용 API를 제공하는데, Tencent는 이 제품군의 호스팅 티어 가격을 입력 100만 토큰당 약 $0.044, 출력 100만 토큰당 $0.177로 책정했으며, 자체 GPU에서 셀프 호스팅하는 것이 진정으로 무료인 경로다.

“multi-pass”가 실제로 의미하는 바

Cohere가 83.60과 84.36을 모두 공개하기로 한 결정은 릴리스 노트에서 가장 많은 정보를 담은 세부 사항입니다. 왜냐하면 이는 회사가 단일 호출보다 워크플로를 더 신뢰한다는 뜻이기 때문입니다. 이는 Tencent가 다른 메커니즘으로 건 같은 베팅입니다. Tencent의 플래그십 30B-A3B는 GEMBA와 XCOMET에서 앞서는 반면 Gemini 3.1 Pro는 FLORES-200에서 앞서는데, 이는 최고의 시스템이 하나의 모델이 아니라 패널임을 의미합니다. OrcaRouter의 모델 퓨전은 여러 모델을 패널로 실행하고 단일 호출 안에서 그 답변들을 조정하는데, 이는 두 공급업체가 추구하는 다중 패스 아이디어의 플랫폼 수준 버전이며, 라우팅 측면과도 결합됩니다. 여기서 하나의 키로 공급업체 정가에 0% 마크업으로 200개가 넘는 모델 카탈로그를 이용할 수 있으므로, 공급업체의 가격 변경이 다음 계약 갱신 때가 아니라 같은 날 우리 쪽에 반영됩니다.

그러한 프레이밍은 이 글의 서두에서 제기한 증거 문제도 해결해 줍니다. 두 공급업체가 서로 겹치지 않는 벤치마크를 공개하고 어느 쪽에도 독립적인 평가가 없다면, 선택하는 방법은 표를 믿는 것이 아닙니다. 두 제품 모두를 자신의 문서에서 실행해 보고, 실제 텍스트에서 불일치가 드러나게 하는 것입니다. 바로 이를 위한 것이 패널과 페일오버 체인입니다.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

어느 것이며, 언제인가요?

이미 보유한 하드웨어에서, 상용 제품 안에서, 라이선스 논의 없이 돌아가는 번역 모델이 필요하다면, Hy-MT2-7B는 그 허용 범위 하나만으로도 승리합니다 — 그리고 아직 재현되지는 않았지만 공급업체가 공개한 결과는 적어도 이름이 붙어 있고, 비교 가능하며, 최전선에 가깝습니다. 긴 문서를 Cohere의 50개 언어로 번역해야 하고, 패스당 16K의 일관된 출력이 필요하며, B200 두 장을 쓸 예산이 있거나 결정하기 전에 Cohere의 무료 티어에서 평가를 실행할 의향이 있다면, North Small Translate 1.0이 공개된 모든 축에서 더 유능한 머신입니다.

두 모델 모두 테스트할 필요성을 없애주지는 않는다. Cohere는 이름 없는 숫자 하나와 그것을 확인할 수 있는 무료 방법을 줬다. Tencent는 표 하나와 GPU급 다운로드를 줬다. 83.60은 결과가 아니라 약속이며, 그 약속이 판가름 나는 곳은 오직 당신 자신의 코퍼스뿐이다.