
Tencent Hy-MT2-7B, 이제 호스팅 API 제공: 백만 출력당 $0.295인 번역기가 가져오는 변화
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
Tencent Hy-MT2-7B, 2026년 5월 21일 Tencent Hunyuan이 공개한 오픈소스 번역 모델이 이번 주 호스팅 API를 통해 호출 가능해졌다. 2026년 8월 19일경, dense 7B 모델이 Tencent Cloud의 호스팅 엔드포인트에서 입력 토큰 100만 개당 0.074달러, 출력 토큰 100만 개당 0.295달러의 요금으로 운영을 시작했으며, 8,192토큰 컨텍스트 창을 지원한다. 이 모델은 혼자 온 것이 아니다. Tencent Hy-MT2-1.8B와 Tencent Hy-MT2-30B-A3B도 하루 안에 같은 백엔드에서 운영되기 시작했다. 가중치는 3개월 전부터 Hugging Face와 ModelScope에 올라와 있었다. 새로운 점은 이제 GPU를 임대하거나 llama.cpp를 소스에서 빌드하거나 1.25비트 온디바이스 툴체인을 배포하지 않아도 팀이 이 모델을 호출할 수 있다는 것이다. 번역 워크로드에 있어 이는 실험과 제품 결정 사이의 차이다.
방금 출시된 것
상용 엔드포인트는 Tencent Cloud 자체 것으로, 공급업체의 API와 여러 타사 플랫폼을 통해 노출됩니다. 세 가지 크기는 각각 8K 컨텍스트와 4,096토큰 완성으로 실행됩니다. 세 모델 모두 response_format 필드의 JSON 스키마를 통해 구조화된 출력을 허용하며, 어느 것도 함수 호출을 구현하지 않습니다. 실용적인 사양은 차원당 한 줄로 다음과 같습니다:
• Tencent Hy-MT2-7B — 1M 토큰당 입력 $0.074 / 출력 $0.295, 8,192 컨텍스트, 덴스 ~7B, 구조화된 출력 지원, 도구 호출 없음.
• Tencent Hy-MT2-1.8B — 1M 토큰당 입력 $0.044 / 출력 $0.177, 8,192 컨텍스트, 덴스 1.8B, 도구 호출 없음.
• Tencent Hy-MT2-30B-A3B — 1M 토큰당 $0.074 입력 / $0.295 출력, 8,192 컨텍스트, MoE 총 30B / 활성 3B, 구조화된 출력 지원, 도구 호출 없음.
헤드라인 가격 포인트는 7B의 출력 속도입니다: 출력 토큰 1,000개당 0.3센트 미만으로, 텐센트가 주장하기에 한 자릿수 더 큰 모델에 맞먹는 성능을 가진 모델입니다. 번역은 출력 토큰이 거의 전체 비용을 차지하는 몇 안 되는 LLM 워크로드 중 하나이므로, 출력 가격은 파이프라인이 대규모로 운영 가능한지 여부를 결정하는 숫자입니다.

엔드포인트 뒤에 있는 모델
Hy-MT2는 텐센트의 "fast-thinking"(빠른 사고) 제품군입니다. 모든 문장에 긴 추론 과정을 적용하는 대신, 전문 번역가처럼 반응하도록 설계되었습니다. 즉, 원문이 모호한 부분에서는 신중하게, 모호하지 않은 부분에서는 빠르게 처리합니다. 7B는 이 제품군에서 균형 잡힌 중간 모델로, Apache-2.0 라이선스의 밀집 모델이며 33개 언어와 5개의 중국 소수민족 언어·방언 쌍(티베트어, 카자흐어, 몽골어, 위구르어, 광둥어 등)을 지원합니다. 일반 LLM의 번역과 차별화되는 점은 지시 수행(instruction-following) 능력입니다. 문서 전체에서 용어집 항목을 일관되게 유지하고, 지정된 스타일을 적용하며, 구분 기호와 JSON 키는 그대로 두고, 일반 언어로 된 개인화 지시를 따릅니다. 텐센트는 이러한 능력을 정확히 평가하는 오픈 벤치마크인 IFMTBench를 가중치와 함께 공개했으며, 소비자용 제품인 Tencent Hy Translate 미니 프로그램(iOS 및 Android 앱 출시 예정)도 이 제품군을 기반으로 구축되었습니다.

별표가 붙은 숫자들
아래 내용은 전부 Tencent가 자체적으로 평가한 것으로, 모델 카드와 첨부 보고서에 게재된 것이다. 이 글을 쓰는 시점에는 그중 어느 것도 독립적으로 재현되지 않았다. FLORES-200의 XX⇔XX 일반 번역 트랙에서 7B 모델은 XCOMET-XXL 86.89점을 기록했으며, Tencent는 이를 Gemini 3.1 Pro(Think)의 약 97.9% 수준으로 본다. 이 모델은 "fast-thinking" 모드에서 DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B, Gemma4-26B-A4B를 포함한 오픈소스 범용 모델들을 능가한다고 주장된다. WMT25에서는 이전 세대 대비 전 부문에서 점수가 개선되었다 — Hy-MT1.5-7B의 61.59/68.85/75.91 대비 63.86/71.21/82.24로, 가장 큰 향상은 GEMBA에서 나타났다 — 그리고 DomainMTBench(금융·정치·교육)에서는 XCOMET 94.92 / GEMBA 92.79를 기록했다. 지시 수행 능력은 1년 전 번역 언어모델과 가장 두드러지게 차별화되는 부분으로, IFMTBench에서 단순 89.73 / 복잡 72.67 / 전체 83.14를 기록했다.
호스팅 API가 번역 파이프라인에 가져오는 변화
7B를 자체 호스팅하는 것은 이런 종류의 것들치고는 정말로 쉽다. 단일 A100 또는 RTX 4090에서 실행되며, 양자화된 FP8 및 GGUF 빌드도 존재한다. 하지만 "자체 호스팅이 쉽다"는 것이 "운영 부담이 전혀 없다"는 뜻은 아니다. GGUF 방식은 현재 Tencent의 STK 커널을 사용하는 llama.cpp에 의존하고, FP8 방식은 올바른 스택이 필요하며, 누군가가 이를 계속 관리해야 한다. 호스팅 엔드포인트는 그러한 모든 부담을 없애준다. GPU도, 커널 빌드도, 용량 계획도 필요 없고, 사용률과 관계없이 토큰당 가격이 고정되어 있다. 하루에 수백만 개의 번역 문장을 처리하는 팀에게 있어 그 예측 가능성은 표면적인 벤치마크보다 더 중요하다. 그리고 그것이 이번 주가 5월 출시보다 더 중요한 이유다.

아직 아무도 제기하지 않은 라우팅 질문
모델이 API 쪽에서 출시된 지 사흘밖에 되지 않았으므로, 이를 도입하는 현실적인 방법은 새로운 공급업체를 도입할 때와 동일합니다. 즉, 자동 장애 조치(failover)가 있는 라우팅 규칙 뒤에 두어 검증되지 않은 엔드포인트가 프로덕션 경로를 절대 무너뜨릴 수 없게 하고, 트래픽 규모가 영구 슬롯을 얻을 자격이 있는지 결정하게 하는 것입니다. 이것이 바로 OrcaRouter의 라우팅 DSL이 우리가 실제로 보유한 200개 이상의 모델 전반에 걸쳐 구성하는 패턴입니다. 그리고 여기서 정확히 짚어둘 가치가 있습니다. Tencent Hy-MT2-7B는 이 글을 쓰는 현재 OrcaRouter의 카탈로그에 등재되어 있지 않으므로, 이는 "우리를 통해 호출하세요"라는 이야기가 아닙니다. 주제가 되는 것은 가격 책정 모델입니다. OrcaRouter는 각 공급업체의 공식 가격을 0% 마크업으로 전달하므로, 공급업체가 요금을 인하하면 그 인하가 같은 날 플랫폼에 반영됩니다. 대량 번역 워크로드의 경우 어떤 엔드포인트에 물어야 할 질문은 "오늘 포털 가격이 얼마인가"가 아니라 "공급업체가 실제로 청구하는 토큰당 공식 가격은 얼마이며, 그 가격과 나 사이에 무엇이 개입하는가"입니다. 출력 $0.295/M이라는 가격으로 Tencent Hy-MT2-7B는 방금 그 질문을 흥미롭게 만들었습니다.
다음에 볼 콘텐츠
이번 주에서 도출된 것은 세 가지입니다. 첫째, 1.8B와 30B-A3B 형제 모델은 이제 동등하게 호출할 수 있으므로, "어느 크기를 선택할지"는 자체 호스팅 결정이 아니라 실제 API 질문이 되었습니다. (이 제품군에는 자체 비교 페이지가 있지만, 요약하면 1.8B는 온디바이스 및 최저 요금제용, 30B-A3B는 전문가급 영역용, 7B는 그 중간입니다.) 둘째, Tencent의 WMT26 파트너십은 General Machine Translation 및 Video Subtitle Translation 태스크에서 Hy-MT 모델을 사용하는 팀에 상을 수여합니다. 이는 Tencent가 이 제품군을 경쟁적 기계 번역(MT) 분야의 오픈 번역 기본값으로 삼으려는 신호입니다. 셋째, 온디바이스 추론을 지원하는 iOS 및 Android 앱이 발표된 대로 출시된다면, 1.8B가 세계에서 가장 많이 설치된 오픈 번역 모델이 될 것입니다. 이번 주에 변경된 부분은 호스팅 API이며, 이 제품군의 궤적은 5월에 설정되었습니다.
