
Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: 같은 가격에 만나는 Dense 최적 지점인가, MoE 플래그십인가
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
이 매치업의 핵심에 놀라운 사실이 숨어 있습니다. Tencent Hy-MT2-7B(조밀한 7B 모델)와 총 300억 개의 파라미터 중 약 30억 개만 활성화되는 전문가 혼합(MoE) 플래그십 모델인 Tencent Hy-MT2-30B-A3B가 이번 주에 모두 호스팅 API를 통해 호출 가능해졌습니다. 7B는 2026년 8월 19일경, 30B-A3B는 하루 뒤에 Tencent Cloud를 통해 서비스되기 시작했으며, 가격은 정확히 동일합니다. 입력 토큰 100만 개당 $0.074, 출력 토큰 100만 개당 $0.295입니다. 이 제품군은 2026년 5월 21일에 함께 오픈소스로 공개된 터라 어느 모델도 새로운 것이 아닙니다. 이 비교를 정말 이상하게 만드는 것은 바로 동일한 API 가격입니다. 보통은 더 큰 모델이 더 비싸고, 사용자는 추가 비용과 그에 따른 이점을 저울질하게 됩니다. 그런데 여기서는 플래그십이 토큰당 추가 비용이 전혀 들지 않으므로, 결정은 단 한 가지 질문으로 압축됩니다. 조밀하고 작은 7B 모델은, 과연 무엇을(있다면) 포기하는 것일까요?
같은 가격의 놀라움
30B-A3B의 가격 동등성은 MoE의 가성비가 제 역할을 하고 있음을 보여줍니다. 이 아키텍처는 30B의 저장된 지식을 보유하지만 토큰당 약 3B만 활성화하므로, Tencent Cloud는 7B와 동일한 토큰당 요금으로 서비스를 제공할 수 있습니다. 동일한 $0.074 / $0.295, 동일한 8,192-토큰 컨텍스트, 동일한 구조화 출력 지원, 동일한 함수 호출 불가 제한까지도 말이죠. API에서 'professional' 모델은 더 비싸지 않습니다. 문제는 다른 곳으로 옮겨갑니다. 메모리 사용량, 서비스 복잡성, 지연 시간에서 7B의 더 조밀하고 단순한 설계가 토큰당 가격으로는 표현할 수 없는 구조적 이점을 가지기 때문입니다.
사양, 나란히
• 아키텍처 — 밀집형 약 7B vs MoE 총 30B / 활성 약 3B.
• API 가격 — 1M 토큰당 $0.074 / $0.295 vs $0.074 / $0.295 (동일함).
• 컨텍스트 — 둘 다 8,192 토큰.
• 포지셔닝 — 프로페셔널급 플래그십과 비교한 균형 잡힌 최적의 선택.
• FLORES-200 — 7B: 86.89 XCOMET-XXL, Gemini 3.1 Pro(Think)의 ≈97.9%; 30B-A3B: 제품군 중 최고의 일반 번역 점수(수치는 공급업체 보고 기준).
• DeepSeek / Kimi 비교 — 둘 다 빠른 사고 모드에서 DeepSeek-V4-Pro와 Kimi K2.6을 능가하며, 공급업체 보고에 따르면.
• 풋프린트 — 단일 A100 / RTX 4090 대 30B급 가중치(디스크 기준 18GB급 양자화 빌드, VRAM에는 그 이상).
• 추론 기본값 — temp 0.7, top_p 0.6, top_k 20 대비 temp 0.7, top_p 1.0, top_k -1.

30B-A3B가 실제로 이기는 부분
Tencent는 30B-A3B를 제품군의 전문가급 구성원으로 포지셔닝하며, 공개된 증거는 특정 유형의 텍스트에 대해 그 평가를 뒷받침합니다. 전문 분야 비중이 높은 자료(법률 조항, 의료 텍스트, 기술 문서)에서 DomainMTBench의 GEMBA 라인은 제품군 내에서 가장 강력하며, Gemini 2.5 Pro 기준선의 약 99%로 보고됩니다. 일반 번역 점수는 제품군 자체 FLORES 곡선에서 7B를 능가합니다. 유휴 상태의 추가 지식 27B는 문장이 평범한 산문이 아닌 밀도 높은 전문 용어를 담을 때 드러나는 바로 그런 역량입니다. 계약서에 나오는 'indemnification shall survive termination' 같은 조항은 7B 모델을 크게 부담시키지 않지만, 용어집이 포함된 전체 M&A 문서는 부담을 줍니다. 또한 30B-A3B는 중국어-소수 언어 쌍(티베트어, 위구르어, 몽골어)에 가장 안전한 선택이며, Tencent는 이 분야에서 최고의 수치를 보고합니다.
어쨌든 7B가 이기는 곳
7B의 장점은 운영적인 것이며 실질적입니다. 첫째, 자체 호스팅: 7B는 단일 A100 또는 RTX 4090에 들어가며 가장 넓은 프레임워크 지원 범위를 갖습니다 — Transformers, vLLM, SGLang, GGUF를 통한 llama.cpp가 모두 실행 검증되었습니다. 30B-A3B는 양자화를 해도 데이터 센터 규모의 VRAM을 요구하며, 프로덕션 서빙 스택에서 이를 검증한 사람은 더 적습니다. 둘째, 지연 시간과 서빙 단순성: 밀집형 7B는 유지가 더 쉽고, 권장 샘플링 방식은 표준 디코딩에 더 가깝습니다. 셋째, API 측면에서 동일한 가격은 7B가 플래그십과 토큰당 비용이 정확히 같다는 것을 의미합니다 — 따라서 더 작은 모델을 선택하는 유일한 이유는 깨끗한 일반 텍스트에서 품질 격차가 느끼기에는 너무 미미하기 때문입니다. 7B는 이미 FLORES-200에서 Gemini 3.1 Pro (Think)의 약 97.9%를 달성합니다; 플래그십의 추가 점수는 각 점수가 실제로 더 보기 어려운 곡선 위에 있습니다.
솔직하게 측정된 격차
마지막 두 섹션의 모든 내용은 Tencent 자체 평가이며, 이를 정직하게 읽는 방법은 두 모델이 일반 번역에서 충분히 근접하여 어떤 코퍼스를 사용하는지가 결과를 결정한다는 것입니다. 일반적인 깨끗한 텍스트에서 7B의 Gemini 대비 약 97.9% 점수는 플래그십의 우위가 작은 XCOMET 분수로 측정된다는 것을 의미합니다. 리더보드에서는 실질적이지만, 지원 티켓에서는 체감하기 어렵습니다. 밀도 높은 도메인 텍스트와 소수 언어 쌍에서 플래그십의 보고된 GEMBA 및 FLORES 우위는 바로 전문 번역가(인간 또는 모델)가 제 값을 하는 지점이며, 재번역 비용이 가장 많이 드는 지점입니다. 현재 시점에서 두 모델 모두에 대한 독립적인 벤치마크는 없습니다. 두 공급업체 카드가 동의하는 유일한 점은 각 크기가 해당 제품군의 빠른 사고 모드에서 DeepSeek-V4-Pro와 Kimi K2.6을 이긴다는 것입니다.

가족 라우팅
이 글을 쓰는 시점 기준으로 두 모델 모두 OrcaRouter의 카탈로그에 없으므로, 둘 다 Tencent 자체 클라우드와 여러 타사 플랫폼을 통해 제공됩니다. 라우팅 교훈은 여전히 실용적입니다. API 가격이 동일하기 때문에 이는 단일 선택보다 워크로드 라우팅에 대한 전형적인 사례입니다: 대용량 일반 번역 부분은 7B로 보내고, 밀도 높고 도메인 특화된 부분은 30B-A3B로 보내며, 자동 장애 조치를 통해 MoE 엔드포인트의 지연 시간 급증이 파이프라인을 지연시키지 않도록 합니다. 이것이 OrcaRouter의 라우팅 DSL이 우리가 보유한 200개 이상의 모델에서 구성하는 패턴입니다 — 비용 가중 디스패치, 공급업체 목록 가격을 0% 마크업으로 전달 — 그리고 이는 대부분의 경우보다 이 제품군에 더 잘 맞습니다. 공급업체가 두 등급을 경제적으로 중립으로 분할되도록 가격을 책정했기 때문입니다.
평결
{{1}}API 가격이 동일하다면 기본 선택은 7B입니다.{{/1}} {{2}}토큰당 비용이 같고, 자체 호스팅이 더 간단하며, 일반 텍스트에서는 거의 차이가 없기 때문입니다.{{/2}} {{3}}법률, 의료, 기술 또는 소수 언어 번역처럼 전문성이 요구되는 밀도 높은 말뭉치를 다룰 때는 30B-A3B를 선택하세요. 플래그십 모델의 도메인 우위가 더 큰 용량과 지연 시간을 감수할 가치가 있는 경우입니다.{{/3}} {{4}}두 유형이 섞인 워크로드를 처리한다면 선택하지 마세요. 일반적인 부분은 7B로, 어려운 부분은 플래그십으로 라우팅하십시오.{{/4}} {{5}}이는 둘 사이의 절충안이 아닙니다. Tencent가 책정한 가격으로 두 모델을 모두 활용할 수 있는 유일한 방법입니다.{{/5}}

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
