
Tencent HY-MT2 1.8B, 호스팅 API 제공: Tencent의 440MB 번역기가 클라우드로 전환
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 426 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 183 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Tencent HY-MT2 1.8B는 2026년 5월 21일 Tencent Hunyuan이 오픈소스로 공개한 Hy-MT2 번역 제품군의 컴팩트 모델로, 이제 자체 호스팅뿐만 아니라 호스팅 상용 API를 통해서도 호출할 수 있게 되었습니다. 이 모델의 API 등록은 2026년 8월 20일에 공개되었으며, 입력 토큰 100만 개당 약 0.044달러, 출력 토큰 100만 개당 약 0.177달러입니다. 이 등록 날짜는 보통 때보다 더 중요합니다. 1.8B는 결코 또 하나의 평범한 오픈 체크포인트가 아니었기 때문입니다. 이는 440MB 양자화 번역 모델이 전적으로 휴대폰에서 실행될 수 있음을 입증하기 위해 Tencent가 만든 모델이며, 오픈소스 공개 이후 3개월 동안 Tencent 자체 HyTranslate 미니 프로그램과 그 뒤를 이은 iOS 및 Android 앱에도 탑재되어 배포되었습니다. 이 기사는 호스팅 API 출시가 무엇을 바꾸는지, 모델이 실제로 무엇인지, 그리고 어떤 수치를 신뢰해야 하는지에 대한 내용입니다.
8월 20일에 실제로 무엇이 바뀌었나요?
지금까지 Tencent HY-MT2 1.8B를 사용하는 방법은 두 가지 중 하나였습니다: Apache-2.0 가중치를 transformers, vLLM, SGLang 또는 llama.cpp에 직접 로드하거나, Tencent의 소비자용 번역 제품을 사용하는 것이었죠. 호스팅된 API는 세 번째 경로입니다. HTTP를 통해 텍스트를 보내면 Tencent Cloud가 1.8B 엔드포인트를 제공합니다. 이 모델은 8,192토큰 컨텍스트와 최대 4,096토큰 출력을 유지하며, 텍스트만 처리하고, 가격은 입력 토큰 100만 개당 약 $0.044, 출력 토큰 100만 개당 약 $0.177입니다. 번역 볼륨이 들쭉날쭉한 팀에게는 이는 모델을 시도하는 데 필요한 'GPU 운영 필수'라는 진입 장벽을 제거합니다.

이야기의 나머지 절반은 앱입니다. {{1}}HyTranslate 미니 프로그램은 5월 오픈소스 릴리스와 함께 음성 입력, 스타일 프리셋, 오프라인 모드를 갖추고 출시되었습니다.{{/1}} {{2}}온디바이스 모델을 다운로드하여 네트워크 없이 번역할 수 있는 iOS 및 Android 앱도 이후 출시되었습니다.{{/2}} {{3}}1.8B 모델은 오프라인 경험의 핵심입니다. {{KEEP}}AngelSlim's 1.25-bit extreme quantization{{/KEEP}}을 적용하면 저장 공간이 약 440MB로 줄어들며, Apple, Qualcomm, MediaTek 폰 실리콘에서 로컬로 실행됩니다. Tencent에 따르면 Apple A15에서 이전 세대의 4비트 빌드보다 추론 속도가 1.5배 빠릅니다.{{/3}}
1.8B가 무엇인지
HY-MT2-1.8B는 hunyuan_v1_dense 아키텍처를 기반으로 구축된 밀집형(dense) 디코더 전용 인과 언어 모델(causal LM)로, 1.8B라는 이름과 달리 실제 파라미터 수는 약 20억 개이며, 채팅 템플릿을 갖추고 기본 시스템 프롬프트는 없다. 중국어, 영어, 일본어, 한국어, 프랑스어, 스페인어, 러시아어, 아랍어, 태국어, 베트남어, 인도네시아어, 힌디어, 벵골어, 타밀어와 티베트어, 위구르어, 카자흐어, 몽골어, 광둥어 방언 쌍을 포함해 총 33개 언어와 5개 소수 언어·방언 쌍 간 번역을 지원한다. 기존의 인코더-디코더 번역 모델과 달리 지시 튜닝(instruction-tuned) 방식으로 설계되어, 대상 언어와 선택적 지시를 프롬프트로 입력하면 JSON 및 HTML 구조를 보존하고, 용어집을 반영하며, 문체를 맞추고, 주변 맥락을 활용해 모호성을 해소할 수 있다. 이러한 기능 등급은 형제 모델인 7B 및 30B-A3B 모델도 공유하며, 이를 평가하기 위해 Tencent의 IFMTBench 벤치마크가 함께 출시되었다.
벤치마크 현황
품질 주장은 주의 깊게 읽을 가치가 있는데, 거의 모두가 Tencent 자체의 것이며, 현재까지 독립 연구소에 의해 재현되지 않았기 때문이다. Tencent는 HY-MT2-1.8B가 Gemini 3.1 Pro의 평균 FLORES-200 점수의 89.9%(7B는 97.9%, 30B-A3B는 98.6%), 실제 GEMBA 스타일 테스트 세트에서 Gemini 점수의 96.7%, 8개 전문 도메인에 걸친 DomainMTBench에서 96.2%를 기록했다고 보고한다. 일부 언론 보도는 FLORES-200 수치를 88.1%로 내려 보도했으며, 공급업체 README에는 89.9%로 기재되어 있다. Tencent는 또한 1.8B가 Microsoft 및 Doubao와 같은 제공업체의 주류 상용 번역 API를 전반적으로 능가한다고 주장한다. 독립적인 재현 결과는 아직 없으므로, 이 모든 것을 검증된 사실이 아닌 공급업체가 보고한 방향성 증거로 간주해야 한다. 공급업체에 의존하지 않는 점은 다음과 같다: 33+5 언어 세트는 고정되어 있고, Apache-2.0 라이선스는 실제이며, 휴대폰에서 실행되는 440MB 양자화 체크포인트는 독립적으로 관찰 가능하다.

어떻게 사용하는지, 그리고 비용이 얼마인지
• 자가 호스팅 — Hugging Face 또는 ModelScope의 Apache-2.0 가중치를 사용하며, transformers (>=5.6.0), vLLM, SGLang 또는 llama.cpp GGUF 빌드로 실행할 수 있습니다. 비용은 GPU 사용료이며, 1.25-bit 빌드는 CPU급 기기에서 실행됩니다.

호스팅 API — Tencent Cloud는 이 글을 쓰는 시점 기준으로 1.8B를 입력 토큰 100만 개당 약 $0.044, 출력 토큰 100만 개당 약 $0.177에 제공합니다. 벤더의 자체 API와 여러 타사 플랫폼에서도 이를 지원합니다.
소비자 — HyTranslate 미니 프로그램과 iOS/Android 앱, 다운로드된 온디바이스 모델을 통한 오프라인 번역 포함.
1.8B 권장 샘플링: temperature 0.7, top-p 0.6, top-k 20, repetition penalty 1.05, 최대 토큰 4096.
소비자용 앱을 출시하는 대신 번역 파이프라인을 구축하는 상황이라면, 이런 모델의 흥미로운 점은 가격이 계속 변동한다는 것입니다. Tencent는 이미 6월에 Hy-MT2-Pro API 요금을 인하했습니다. 0% 마크업 라우터가 존재하는 이유가 정확히 이런 시나리오입니다. 패스스루가 공급업체 정가 기준이므로, 공급업체의 가격 인하는 게이트웨이가 요금을 재조정한 후가 아니라 당일 청구서에 반영됩니다. 이 모델은 현재 작성 시점에 OrcaRouter의 목록에 없으므로, 가중치를 자체 호스팅하거나 Tencent Cloud API를 직접 호출하면 됩니다. 페일오버와 단일 키 논리는 그 주변에 구축할 더 넓은 번역 스택에 적용되며, 저렴한 대량 트래픽용 소형 온디바이스 모델과 어려운 언어 쌍용 대형 모델을 혼합하는 것이 바로 라우팅이 표현하고자 설계된 구성 방식입니다.
요점
Tencent HY-MT2 1.8B는 5월에 이미 휴대폰 크기의 Apache-2.0 번역기로서 흥미로운 존재였습니다. 8월 20일 호스팅 API 등재로 인프라를 직접 구축하지 않고 평가하려는 팀에게 유력한 후보가 되었습니다. 품질 수치는 공급업체가 보고한 것이며, 언어 세트는 최대한 다양하게 구성하기보다 의도적으로 주류 언어에 초점을 맞추었고, 온디바이스 설치 용량이야말로 이 제품의 진정한 차별점입니다. 사용자의 언어 쌍이 이 33개 안에 포함된다면, 이제 그 주장이 사용자의 콘텐츠에 맞는지 확인하는 비용이 그 어느 때보다 저렴해졌습니다.
