
Tencent Hy4 Preview, 첫날부터 vLLM에서 실행: 실제로 서빙할 수 있는 770B 오픈 가중치 MoE
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
2026년 8월 28일 Tencent Hy4 Preview가 출시되었을 때, 그것은 대부분의 프론티어급 플래그십 모델들이 출시 첫날에는 하지 않는 일을 해냈습니다: 바로 실행 가능한 상태로 배포된 것입니다. 오픈 가중치와 함께, Tencent와 vLLM 팀은 사전 빌드된 Docker 이미지, 공식 서빙 레시피, 그리고 vLLM 자체에 통합된 프레임워크 지원을 함께 공개했습니다. 그 결과 Hunyuan 라인업이迄今 생산한 가장 큰 오픈 가중치 모델 — 총 7,700억 개의 파라미터, 토큰당 활성화되는 490억 개의 파라미터 — 는 발표 후 몇 시간 만에 여러분의 GPU에서 OpenAI 호환 엔드포인트 뒤에서 실행되고 있었습니다. 이 포스트가 다루는 뉴스는 바로 그 제로데이 런타임 스토리입니다. 왜냐하면 "vLLM에서 실행된다"는 것은 이 규모의 모델에게는 각주에 불과한 일이 아니기 때문입니다. 그것은 보도자료와 실제 프로덕션에 투입할 수 있는 무언가의 차이입니다.
출시의 나머지는 전형적인 프리뷰 형태의 패키지이며, 주의사항은 숫자만큼이나 중요합니다. 텐센트는 Tencent Hy4 Preview를 초기 반복 버전이라고 부르며, 지나치게 긴 추론과 과도한 자체 검증을 알려진 동작으로 명시하고, 전적으로 자체 보고된 벤치마크 표를 게시합니다. 아직 독립 연구소의 평가는 없었고, 이 글을 쓰는 시점 기준으로 모델은 출시된 지 이틀밖에 되지 않았습니다. 그렇다고 해서 실질적인 핵심이 바뀌지는 않습니다. 가중치는 Apache 2.0이고, 컨텍스트 창은 100만 토큰이며, 출시 첫날부터의 vLLM 지원은 자체 호스팅 경로가 구상이 아니라 현실임을 의미합니다.
텐센트 Hy4 Preview가 실제로 무엇인지
Tencent는 Tencent Hy4 Preview를 Hy3(총 295B, 256K 컨텍스트)의 후속 모델로 내세우며, 활성 용량을 약 두 배로, 컨텍스트 창을 네 배로 확장한다. 이 아키텍처는 한 줄 한 줄 읽어볼 가치가 있다. 각 줄이 오픈 가중치 모델이 사용자 하드웨어에서 수행할 수 있는 작업의 범위를 바꾸기 때문이다.
• 아키텍처 — 총 770B 파라미터와 토큰당 49B 활성 파라미터를 가진 Mixture-of-Experts로, 78개 레이어로 구성됩니다. 첫 번째 레이어는 밀집(dense) 레이어이며, 나머지 77개 레이어는 각 토큰을 256개의 라우팅 전문가와 1개의 공유 전문가를 거치게 하여 상위 8개를 활성화합니다. 대략 16:1의 희소성 비율 덕분에 추론 비용이 실제로 운영 가능한 팀이라면 감당할 수 있는 범위로 유지됩니다.
• 컨텍스트 창 — 기본 1,048,576 토큰으로, 모든 오픈 가중치 모델 중 가장 넓은 수준입니다. 전체 저장소, 다중 파일 리팩터링, 긴 문서 일괄 처리 — 모두 단일 요청으로 해결되는 문제입니다.
• 어텐션 — Gated DeepSeek Sparse Attention(Gated DSA) with IndexCache는 78개 레이어 중 단 21개 레이어에서만 새로운 희소 인덱스를 계산하고, 나머지 57개 레이어에서는 이를 재사용하는 희소 어텐션 설계입니다. 그래서 이를 서빙하는 것은 단순히 "더 큰 vLLM"이 아니라, 희소 어텐션을 이해하는 백엔드가 필요합니다.
• 내장형 추측 디코딩 — 총 약 10B / 활성 파라미터 0.7B 규모의 MTP(다중 토큰 예측) 레이어가 모델 내부에 포함되어 있어, 별도의 드래프트 모델을 호스팅하지 않아도 vLLM과 SGLang에서 토큰을 드래프트할 수 있습니다.
• 가중치 — Apache 2.0, BF16 및 FP8 체크포인트 모두, Hugging Face, ModelScope, GitCode, 그리고 CNB에 게시됨.
"day-zero vLLM"이 실제로 의미하는 것
출시일에 병합된 프레임워크 지원이 이 신호 뒤에 있는 구체적인 사건입니다 — Tencent Hy4 Preview를 추가하는 vLLM 변경(PR #54160)이 릴리스와 같은 시기에 반영되었고, 공식 레시피는 vLLM 0.29.0 이상을 대상으로 합니다. 실제로 이는 서빙 경로가 한 줄의 명령어라는 뜻이지, 일주일 동안의 커널 디버깅이 아니라는 뜻입니다.
docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview
플래그는 중요하며, 각각은 단순한 상용구가 아니라 모델의 특정 요소에 매핑됩니다:
• --attention-backend FLASHMLA_SPARSE — 필수이며, 선택 사항이 아닙니다. Tencent Hy4 Preview의 Gated DSA 희소 어텐션은 기본 dense 백엔드에서 올바르게 실행되지 않으며, 이 플래그는 공식 레시피가 설정하는 값입니다.
• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — 모델에 내장된 MTP 레이어를 활성화하여 추측 디코딩(speculative decoding)을 수행하며, 세 개의 드래프트 토큰을 미리 생성합니다. 별도의 드래프트 모델을 배포할 필요가 없습니다.
• --tool-call-parser hy_v4 및 --reasoning-parser hy_v4 — Tencent Hy4 Preview가 도구 호출과 추론 과정을 어떻게 출력하는지 서버에 알려주는 사용자 정의 파서이며, --enable-auto-tool-choice를 사용하면 모델이 도구를 호출할 시점을 결정할 수 있습니다.
Tencent는 샘플링에 temperature 0.9와 top_p 1.0을 권장합니다. 추론은 기본적으로 수학, 코딩 및 복잡한 작업을 대상으로 하는 "high" 노력의 chain-of-thought 방식입니다. 긴 사고 과정 없이 직접적인 응답을 원한다면 가중치를 교체하는 대신 요청에 no_think 추론 노력을 전달하십시오.

출시 당일 지원이 vLLM 전용만은 아니라는 점 자체가 이렇게 새로운 릴리스로서는 주목할 만하다. SGLang은 같은 날 NEXTN 스타일의 추측 디코딩을 포함한 사전 빌드된 멀티 아키텍처 이미지(lmsysorg/sglang:hy4-preview)를 배포했으며, Ascend 생태계는 vLLM-Ascend를 통해 16개의 Atlas 800I A3 NPU에서 W8A8 양자화 가중치를 사용하여 당일 지원을 확보했다. 오픈 가중치 릴리스는 서빙 생태계가 따라잡는 데 종종 몇 주가 걸리지만, 이번에는 몇 시간이 걸렸다.
인용할 가치가 있는 점수
Tencent가 Tencent Hy4 Preview에 대해 발표한 모든 벤치마크는 벤더가 보고한 것입니다 — Tencent 자체 평가 환경에서 실행되었고, 어떤 독립 연구소도 재현하지 않았으며, 모델이 공개된 지 이틀밖에 되지 않았습니다. 이를 Tencent가 도달했다고 믿는 상한선으로 읽되, 확립된 사실로 읽지 마십시오. 제3자가 실행하기 전에는 독립적인 검증이 존재하지 않을 것입니다; 공개 리더보드에는 아직 이 모델을 반영한 것이 없습니다.

헤드라인 수치는 Terminal Bench 2.1로, 코딩 중 실제 터미널을 모델이 얼마나 잘 다루는지 측정하는 테스트입니다. 텐센트는 Tencent Hy4 Preview가 85.4를 기록했다고 보고하며, 이는 Claude Opus 5와 동률을 이루고 DeepSeek V4 Pro를 능가하며, 자사 이전 모델 Hy3보다 14.6포인트 높은 수치라고 주장합니다. 이 단일 수치가 이번 릴리스를 이끕니다. 오픈 가중치 모델이 가장 비싼 폐쇄형 프론티어 모델과 어려운 에이전트 기반 코딩 테스트에서 동등한 수준에 도달했다는 주장이 바로 그것이며, 이는 독립적인 확인이 가장 필요한 주장입니다.
내부 테이블의 나머지 부분, 모두 텐센트 자체 수치: 소프트웨어 엔지니어링 벤치마크인 DeepSWE는 Hy3에서 28.0에서 64.3으로 점프합니다. SWE-bench Pro는 65.7, SWE-bench Multilingual은 82.9입니다. 도구 호출 테스트인 Toolathlon-Verified에서 텐센트는 74.1을 보고하며, 이는 Qwen 3.8 Max와 GPT-5.6 Sol을 능가하고 Kimi K3와 Claude Opus 5에 근접한다고 밝혔습니다. APEX-Agents pass@1에서는 37.1로 Kimi K3의 37.2에 약간 뒤처집니다. 그리고 별도의 내부 블라인드 평가에서 텐센트가 모집한 163명의 전문가가 203개의 엔지니어링 작업을 4.00점 만점에 2.99점으로 평가하여 GLM-5.3의 2.92와 Kimi K3의 2.94를 약간 앞질렀습니다.
주목할 만한 패턴이 두 가지 있다. 강력한 수치는 모두 에이전틱 엔지니어링 작업(터미널 구동, 도구 호출, 저장소 규모 작업)에서 나왔고, 일반 지식이나 추론에서는 나오지 않았는데, 이는 우연이 아니라 생산성 중심 포지셔닝과 부합한다. 그리고 Tencent는 DeepSWE와 다른 모델들이 격차를 '해소'하는 것이 아니라 '좁히는' 것이라고 설명한다. 깔끔하고 시장에 내세울 만한 유일한 동등성 주장은 Terminal Bench 2.1 동률이며, 이는 자체 워크로드로 테스트해볼 가치가 가장 큰 주장이다.
실제로 실행하는 데 드는 비용
솔직히 말하자면 셀프 호스팅 비용 계산이 가장 먼저 짚고 넘어가야 할 문제입니다. 이 모델은 단일 GPU 모델도, 데스크톱 모델도 아닙니다. FP8 체크포인트는 가중치가 거의 1테라바이트에 달하며, 공식 레시피는 텐서 병렬화 8을 전제로 합니다. 즉 고속 상호 연결을 갖춘 고대역폭 GPU 8개가 필요합니다(Tencent의 FP8 참조 하드웨어는 8×B300이며, 전체 BF16을 원한다면 16×B200이 필요합니다). 이런 규모의 인프라가 없다면 저렴하게 셀프 호스팅할 수 없고, 희소 어텐션 백엔드 특성상 1M 토큰 컨텍스트에서 KV 캐시 메모리를 우회할 지름길도 없습니다.
출시 주간 애드온 하나가 플래그십 규모 없이 오픈 웨이트를 원하는 팀들에게 그 계산의 일부를 바꿔 놓는다. Tencent의 Hy 팀은 Tencent Hy4 Preview의 압축된 GGUF 빌드를 출시했는데, 약 1.5TB BF16 릴리스를 대략 200GiB로 줄였으며, MIX-STQ1_0이라고 부르는 레이어별 혼합 양자화 방식을 사용했다. 대량의 전문가 텐서는 약 1.3비트까지 떨어지지만, 잔차 스트림에 중요한 레이어는 더 높은 정밀도를 유지한다. Tencent 자체 평가에서 정확도 변화는 작다 — SWE-bench Multilingual 82.9에서 81.3, MCP Atlas 83.7에서 83.2, IFBench 73.5에서 72.5 — 이는 공급업체가 거의 무손실이라고 부르는 트레이드오프다. 이는 Tencent의 설정에서 나온 Tencent의 수치이며, 아직 재현되지 않았다. 200GiB 모델은 여전히 단일 GPU 모델은 아니지만, 거의 테라바이트급 FP8 체크포인트보다 훨씬 더 작은 베팅이며, 8개의 B300 구성이 가정하는 것보다 더 작은 멀티 GPU 노드로도 오픈 웨이트 경로에 접근할 수 있게 해준다.
가격이 흥미로워지는 곳은 API 경로입니다. Tencent Cloud의 TokenHub에서 Tencent Hy4 Preview는 입력 토큰 100만 개당 6위안(약 US$0.83), 출력 토큰 100만 개당 18위안(약 US$2.50), 캐시 적중 토큰 100만 개당 0.3위안(약 US$0.04)으로 책정되어 있습니다. 출력 비용이 100만 개당 약 2.50달러라는 것은 최고 수준의 폐쇄형 프런티어 모델의 출력 가격(100만 개당 25달러)보다 훨씬 낮은 수준이며, 저렴한 캐시 적중률 덕분에 동일한 시스템 프롬프트와 대화 접두사가 계속해서 다시 전송되는 긴 에이전트 루프가 비정상적으로 저렴해집니다.
Tencent는 또한 새 모델인 Tencent Hy4 Preview를 WorkBuddy와 CodeBuddy에서 2주간 무료로 제공하고 있다. 따라서 이번 주에 가장 저렴하게 체험하는 방법은 무료이며, WorkBuddy에서 생산성 포지셔닝이 구체화된다. WorkBuddy의 모든 대화에서 모델 선택기는 Hy3와 Hy4 preview 사이를 전환하므로, 한쪽의 사무 생산성·분석 작업과 다른 쪽의 코딩이라는 구분은 배포 결정이 아니라 작업별 선택이다. 이러한 구분은 Tencent가 모델을 겨냥한 지점과 일치하며, WorkBuddy에서의 실사용 테스트에서는 복잡한 산출물을 한 번에 생성하는 모습이 확인된다 — 단일 프롬프트에서 플레이 가능한 로우폴리 게임 프로토타입, 수동 개입 없이 첨부 파일 10개로 완성된 전체 분기 비즈니스 리뷰, 그리고 이번 주에 퍼진 테스터 데모에서는 블랙홀 시뮬레이션까지. 이는 벤더 벤치마크가 아니라 Tencent 자체 앱에 대한 커뮤니티 관찰이지만, 실제 다단계 작업에서 모델이 무엇을 하는지에 대한 첫 번째 실사용 신호이며, 비용을 지출하기 전에 무료로 재현해 볼 수 있다.
비용 결정은 정확히 라우팅 레이어가 계산을 바꾸는 지점이며, 우리는 그 안에서 우리의 역할에 대해 솔직하게 말하겠습니다: {{1}}OrcaRouter는 아직 Tencent Hy4 Preview를 라우팅하지 않습니다. Tencent가 이 모델을 제3자 추론 플랫폼에 개방하지 않았기 때문입니다. 이 모델은 Tencent Cloud 자체 TokenHub 엔드포인트와 오픈 가중치의 자체 호스팅 배포 환경에서 실행되며, 우리는 제공하지 않는 것을 제공한다고 주장하지 않습니다.{{/1}} 라우팅 레이어가 제공하는 것은 그 주변의 의사결정 프레임워크입니다. 8-GPU 노드와 API 사이에서 선택하는 경우, 카탈로그의 나머지 부분이 따르는 동일한 패스스루 원칙이 Tencent가 이를 개방하는 날 적용됩니다: {{2}}OrcaRouter는 공급업체 목록 가격을 마크업 없이 그대로 전달하므로, 공급업체의 가격 인하는 재판매 및 마크업을 거치지 않고 당일 우리 쪽에 반영됩니다.{{/2}} 그리고 출시 이틀밖에 안 된 모델로서 유일한 증거가 공급업체의 벤치마크뿐인 경우, 자동 장애 조치가 안전한 테스트 방법입니다. 검증된 모델을 핵심 경로에 두고 그 옆에 Tencent Hy4 Preview를 배치하여, 비용 프로필이 유리한 작업에서는 교체 투입하고 유리하지 않은 순간에는 즉시 복귀시키면 됩니다. 이 모든 것이 하나의 API와 하나의 키로 이루어집니다.

스펙 시트에 담을 수 없는 한계들
텐센트는 알려진 한계점들을 숨김없이 나열하며, 이는 배포 결정을 좌우해야 합니다. Tencent Hy4 Preview는 텍스트 모델 그 자체입니다. 비전이나 멀티모달 입력이 없으므로 이미지나 비디오와 관련된 작업은 다른 모델에 맡겨야 합니다. 텐센트는 또한 복잡한 작업에서 느린 시작 동작(첫 출력 전 오래 생각하는 것)과 과도한 자체 검증 경향, 즉 이미 수행한 작업을 재확인하면서 토큰을 낭비하는 문제를 지적합니다. 이러한 조합은 지연 시간에 민감한 채팅에는 정확히 부적합하고, 오프라인 배치 엔지니어링 작업에는 정확히 감당할 수 있는 수준이므로, 텐센트가 어디에서 실행하길 기대하는지 알 수 있습니다.
출시 자료에 담긴 두 가지 주장은 모델이 무엇을 해냈는지가 아니라 어떻게 구축되었는지에 관한 것이므로 별도로 주목할 필요가 있다. 텐센트는 Tencent Hy4 Preview가 자체 개발에 참여했다고 밝혔다. 즉, 이 모델을 만드는 데 사용된 훈련 방법, 데이터 전략, 평가 프레임워크, 저수준 연산자(로우레벨 오퍼레이터)를 최적화하는 데 기여했다는 것이며, 이는 초기 형태의 재귀적 자기 개선 루프라고 할 수 있다. 또한 자체 추론 시스템을 자율적으로 최적화하여 기준 대비 엔드투엔드 처리량을 31.8% 향상시켰다고 한다. 과학적 측면에서 텐센트는 볼록 기하학의 Blaschke–Lebesgue 문제에서 알려진 하한을 0.380799에서 0.41104로 끌어올렸고, 32,512개 원자로 구성된 인지질 이중층 시뮬레이션에서 단계당 54.9밀리초로 2.0배 속도 향상을 달성했다고 보고했다. 출시 첫날의 다른 모든 내용과 마찬가지로, 이 역시 텐센트의 자체 주장이다.
그리고 가장 중요한 결여는 검증입니다. Tencent Hy4 Preview에 대한 독립적인 점수는 아직 어디에도 없습니다 — 공개 리더보드에도, 제3자 평가 기관에도, Artificial Analysis 등재에도 없습니다. 이 모델은 그러기에는 너무 새로운 모델입니다. 내부 전문가 블라인드 테스트는 Tencent 자체 검토자들이 GLM-5.3 및 Kimi K3와 비교해 어떻게 보는지에 대한 유용한 신호이지만, 그것은 Tencent의 과제에 대한 Tencent 검토자들의 평가입니다. 사양표 위의 모든 것은 검증을 기다리는 주장일 뿐입니다.
이번 주에 Tencent Hy4 Preview를 누가 실행해야 하나요?
솔직한 답은 이번 주에 세 가지 그룹으로 나뉘며, 그중 하나는 하드웨어가 전혀 필요 없습니다. Tencent Hy4 Preview가 어떤 기능을 하는지 그냥 느껴보고 싶다면, 무료 WorkBuddy 액세스가 가장 빠른 경로입니다. GPU도, API 키도 필요 없이 대화를 열고 모델 선택기를 Hy4 preview로 전환한 다음 Work 또는 Coding 태스크를 넘기면 됩니다. GPU를 보유하고 엔지니어링 워크로드를 배치로 실행하는 경우(장기 에이전트 태스크, 리포지토리 규모 분석, 오프라인 평가)라면 지금 이 모델을 진지하게 테스트할 가치가 있습니다. 가중치가 공개되어 있고, 컨텍스트 창이 리포지토리 규모이며, vLLM 경로는 명령어 한 줄이면 되고, 출시 주간 GGUF 빌드가 시험 실행을 위한 하드웨어 장벽을 낮춰줍니다. 지연 시간에 민감한 프로덕션 채팅, 멀티모달 작업, 또는 공급업체 자체 벤치마크만이 유일한 증거인 모델을 감당할 수 없는 상황이라면 기다리세요. Tencent는 2월 이후 약 두 달에 한 번씩 업데이트해 왔고, 이미 다음 Hy4 모델 배치가 나올 것이라고 밝혔습니다. 따라서 이 프리뷰는 명백히 초기 반복 버전입니다.
다른 모든 사람들에게 유용한 자세는 라우팅 패턴입니다: 이미 신뢰하는 모델 옆에서 검증하고, 포기할 수 있는 비용으로 시도하며, 자신의 워크로드에서 수치가 유지되는 곳에서만 확장하는 것입니다. 그것이 라우터가 존재하는 이유입니다 — Tencent가 이 모델을 제3자 추론에 개방하는 날, 그것은 하나의 API, 200개 이상의 모델, 정가 패스스루 카탈로그에 다른 모델들과 함께 합류하게 되며, 장애 조치 및 구성 도구는 이미 준비되어 있을 것입니다. 그때까지, 가중치는 Hugging Face에 있고, API는 Tencent Cloud에 있으며, 무료 체험판은 WorkBuddy에 있습니다 — 그리고 오픈 가중치 모델이 에이전틱 코딩의 최상위 계층에 도달했다는 주장은 마침내 구체적인 숫자를 갖게 되었습니다. 그 숫자는 Tencent의 것입니다. 테스트는 여러분의 것입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
