
Tencent Hy-MT2-7B 대 Tencent Hy-MT2-1.8B: 서버 측 품질 선택인가, 아니면 모든 휴대폰에 탑재되는 440MB 번역기인가
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
Tencent Hy-MT2-7B와 Tencent Hy-MT2-1.8B는 같은 제품군의 양 끝을 이루는 모델로, 2026년 5월 21일에 함께 오픈소스로 공개되었으며, 이번 주에는 두 모델 모두 호스팅 API를 통해 호출할 수 있게 되었습니다(7B는 8월 19일경, 1.8B는 하루 뒤). 각각 Tencent Cloud가 서비스합니다. 이 두 모델은 일반적인 의미의 경쟁자가 아닙니다. 용도가 거의 겹치지 않기 때문입니다. 7B는 품질 선택지입니다. 단일 GPU에서 실행되는 밀집 모델이거나 API로 제공되며, API 가격은 입력 100만 토큰당 $0.074, 출력 100만 토큰당 $0.295입니다. 1.8B는 온디바이스 선택지입니다. 440MB로 양자화되어 완전히 오프라인으로 휴대폰에서 실행되는 모델이며, API 계층에서는 100만 토큰당 $0.044 / $0.177입니다. 둘 중 하나를 선택해야 한다면, 답은 대개 번역이 이루어져야 하는 위치에 따라 결정됩니다. 벤치마크 결과는 매개변수 격차가 네 배인 데서 암시되는 것보다 훨씬 가깝기 때문에, 벤치마크는 부차적인 고려 사항에 불과합니다.
한 줄 답변
번역이 데이터 센터에서 이루어지고 서버 달러당 최고의 품질을 원한다면 — API 또는 단일 A100급 GPU에서 — 7B를 선택하세요. 번역이 기기에서, 오프라인으로, 또는 토큰당 가능한 최저 비용으로 이루어져야 한다면 1.8B를 선택하세요. 둘 다 같은 클라우드에 있고 예산이 결정 요인이 아니라면, 7B가 품질에서 승리합니다. 콘텐츠가 기밀, 규제 대상이거나 네트워크 없이 작동해야 한다면, 두 모델 중에서 1.8B만이 가능합니다.
사양, 나란히
• 파라미터 — 7B dense 대 1.8B dense.
• 양자화된 용량 — FP8 및 GGUF는 수 GB까지 줄어드는 반면, AngelSlim 1.25비트 양자화를 사용하면 440MB까지 줄어듭니다.
• FLORES-200 (XX⇔XX) — 86.89 대 79.77 XCOMET-XXL, Gemini 3.1 Pro (Think) 대비 약 97.9% 대 89.9%, 공급업체 보고 기준.
• WMT25 — 7B: 63.86/71.21/82.24; 1.8B는 세 가지 지표 모두에서 Microsoft 및 Doubao 상용 API를 능가했습니다.
• DomainMTBench (GEMBA) — 92.79 대 91.08, 공급업체 보고 기준.
• API 가격 — $0.074 / $0.295 대비 $0.044 / $0.177 (1M 토큰당 입력/출력).
• 컨텍스트 — 둘 다 8,192 토큰.
• 배포 — A100 / RTX 4090 하나 또는 클라우드 API 대비 Apple, Qualcomm, MediaTek 온디바이스 칩, 오프라인.

품질 격차는 실재하지만 규모 격차만큼 크지는 않다.
다음 내용은 모두 Tencent의 자체 평가이며, 외부에서 재현된 결과가 아닙니다. FLORES-200에서 7B는 1.8B보다 XCOMET 기준 8포인트 앞섰습니다(86.89 대 79.77). 'balanced'와 'on-device' 포지셔닝은 바로 이 격차에 기반을 둡니다. 하지만 금융·정치·교육을 망라하는 도메인 번역 벤치마크인 DomainMTBench에서 1.8B는 7B에 GEMBA 기준 1.7포인트 차이로 근접했습니다(91.08 대 92.79). 그리고 1.8B가 더 넓은 시장에서 보여주는 경쟁력은 사람들을 계속 놀라게 하는 대목입니다. Tencent는 1.8B가 WMT25의 세 가지 지표 모두에서 Microsoft와 Doubao의 상용 번역 API를 이겼으며, 자신보다 40배나 큰 모델인 Tower-Plus-72B도 능가했다고 보고합니다. 따라서 일반 도메인 텍스트에서 이 작은 모델은 파라미터 수가 암시하는 것보다 큰 형제 모델에 훨씬 더 가깝습니다. 7B의 진짜 우위는 일반 번역의 롱테일 영역과 까다로운 지시문에서 드러나며, 여기서 7B의 FLORES 리드와 더 높은 IFMTBench 복잡 과업 점수가 두 모델 사이에 확실한 격차를 만들어 냅니다.
배포 포크
7B 모델은 인프라가 필요하다 — 클라우드 API든 단일 A100급 GPU든, 거기에는 통상적인 운영 작업이 따른다. 1.8B 모델은 AngelSlim의 1.25비트 양자화로 440MB에 불과하며, 일반적인 스마트폰 앱과 같은 칩에서 실행된다. 속도는 이전 세대인 Hy-MT1.5보다 1.5배 빠르고 네트워크가 전혀 필요 없다. 이로써 프라이버시는 선택 기능이 아니라 기본값이 된다. 계약서, 의료 기록, 또는 규제 대상이라면 무엇이든 데이터가 기기를 떠나지 않으며, 이는 서버 측에서 토큰당 가격으로는 살 수 없는 속성이다. 이러한 절충은 FLORES 방식의 일반 번역에서 드러난다. 7B의 추가 용량이 발휘되는 자리이며, 1.8B의 83.14 IFMTBench 총점을 7B의 더 높은 상한선과 겨루게 할 만큼 복잡한 명령에서도 마찬가지다.

비용 계산
API 계층에서 두 모델 모두 저렴합니다. 1.8B가 더 저렴하죠. 백만 개당 $0.044 / $0.177 대 $0.074 / $0.295로, 소형 모델은 7B보다 양쪽 모두에서 약 40% 낮은 비용을 보입니다. 하루에 백만 개의 출력 토큰을 꾸준히 처리한다고 가정하면, 하루 약 $70 대 $118입니다. 온디바이스에서 1.8B는 토큰당 비용이 0이며, 이는 대규모 볼륨에서 어떤 서버 비교보다도 우위를 점하는 수치입니다. 7B의 반론은 가격이 아니라 여유분(headroom)입니다. 코퍼스가 기술, 법률 또는 지시문 중심으로 치우쳐 있다면, 7B의 품질 여유는 정확히 재번역 횟수를 줄여주는 요소로 드러납니다. 그리고 재번역은 전문 기계 번역에서 실제 단위 비용입니다.

두 크기 라우팅
이 글을 쓰는 시점 기준으로 두 모델 모두 OrcaRouter의 카탈로그에 등록되어 있지 않으므로, 솔직히 말하자면 두 모델 모두 Tencent 자체 클라우드와 여러 서드파티 플랫폼을 통해 서비스된다. 그럼에도 이 대결 구도는 이 블로그가 기반을 둔 라우팅 교훈을 잘 보여준다. 두 모델이 역량에서는 겹치지만 가격과 지연 시간에서 차이가 날 때, 합리적인 배포 방식은 '하나를 고르는 것'이 아니라 '워크로드별 라우팅'이다. 즉, 대량이고 난이도가 낮은 작업은 저렴한 소형 모델로, 까다로운 작업은 고품질 모델로 보내고, 둘 중 하나에 장애가 발생해도 파이프라인이 멈추지 않도록 자동 장애 조치(failover)를 구성하는 것이다. 이것이 바로 OrcaRouter의 라우팅 DSL이 우리가 보유한 200개 이상의 모델에서 구성하는 패턴이며, 각 제공업체의 정가는 0% 마크업으로 그대로 전달된다. Tencent의 번역 제품군이 카탈로그에 합류한다면, 그것은 자연스러운 다음 테넌트가 될 것이다.
평결
번역이 데이터 센터에서 이루어진다면 Tencent Hy-MT2-7B를 선택하라 — 운영을 전혀 원하지 않으면 API로, 직접 소유하려면 단일 GPU로 실행하면 된다. 그만큼 간단하다. 번역이 기기에서, 오프라인으로, 또는 기밀 유지 요건 하에 이루어져야 한다면 Tencent Hy-MT2-1.8B를 선택하라. 440MB 용량이 정의상 승리한다. 진정으로 까다로운 경우는 중간 규모의 클라우드 워크로드로, 7B의 품질과 1.8B의 가격이 모두 타당한 경우다. 이때는 벤더 벤치마크로 결정하지 말라. 보고된 GEMBA 격차는 2포인트 미만이므로, 자체 도메인 텍스트로 두 모델을 모두 실행하고 데이터가 선택하게 하라.
