
Tencent Hy4 프리뷰 공개: 백만 토큰 컨텍스트를 갖춘 770B MoE, 입력 토큰 100만 개당 ¥6
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
2026년 8월 28일에 공개 및 오픈소스로 배포된 Tencent Hy4 Preview는 6개월 만에 나온 Tencent의 세 번째 플래그십 모델로, 연구 이정표의 의미를 넘어 가격 이벤트가 된 모델입니다. 7,700억 개의 파라미터(토큰당 490억 개 활성화)를 가진 mixture-of-experts 모델이며, 기본 컨텍스트 창은 100만 토큰입니다. Apache License 2.0에 따라 BF16과 FP8 형식으로 공개되었으며, 오늘부터 Hugging Face, GitHub, ModelScope, GitCode에서 다운로드할 수 있습니다. Tencent는 입력 토큰 100만 개당 6위안(약 US$0.83), 출력 토큰 100만 개당 18위안(약 US$2.50)으로 가격을 책정했으며, 이는 최상위권 오픈 가중치 모델을 시장의 거의 모든 폐쇄형 프런티어 모델보다 낮은 가격에 공급하는 것입니다. 한 번의 출시, 세 가지 얼굴: 직접 실행할 수 있는 오픈 가중치, Tencent Cloud의 TokenHub API, 그리고 Tencent 자체 제품인 WorkBuddy, CodeBuddy, Yuanbao, ima에 이미 적용된 동일한 가중치입니다. 실제로 출시된 것, Tencent가 주장하는 성능 점수, 그리고 아직 아무도 검증하지 않은 것은 다음과 같습니다.
엔지니어링 스토리는 파라미터 수보다 중요합니다. 각 요소가 비용에 영향을 미치는 지렛대이기 때문입니다. 모델은 78개 레이어로 구성되어 있습니다: 첫 번째 레이어는 표준 밀집 피드포워드 네트워크이고, 나머지 77개는 각각 256개의 라우팅 전문가와 1개의 공유 전문가를 가진 MoE 레이어로, 토큰당 상위 8개의 라우팅 전문가를 활성화합니다. 이 대략 16:1의 희소성 비율 덕분에 770B 모델의 서빙 비용이 저렴해집니다. 주어진 토큰에서는 오직 49B 슬라이스만 작업을 수행하기 때문입니다. 전용 멀티 토큰 예측 레이어(10B 파라미터, 활성 0.7B)는 추측 디코딩을 가능하게 하며, 어텐션 스택은 장기 컨텍스트 메모리 사용을 제어하기 위해 IndexCache를 사용하는 gated DeepSeek Sparse Attention을 채택합니다. 추론은 장기 사고 code>high/code> 모드와 토큰 절약 code>no_think/code> 모드입니다. 실제 워크로드와 접촉했을 때 헤드라인 가격이 유지될지를 결정하는 것은 바로 이러한 세부 사항들이며, 모델이 하이쿠를 쓸 수 있는지 여부와는 무관합니다.
주석이 달린 사양 시트
릴리스 노트를 한 줄씩 읽어야 합니다. 각 줄은 오픈 가중치 모델이 무엇을 할 수 있는지를 조용히 바꾸기 때문입니다.
• 파라미터 — {{1}}총 770B, 토큰당 49B 활성화{{/1}}, {{2}}약 16:1의 희소성 비율로 소규모 팀도 실제로 감당할 수 있는 수준의 서비스 비용을 유지합니다.{{/2}}
• 컨텍스트 — 기본 1,048,576토큰 윈도우, Hy3의 256K의 4배. 전체 저장소, 다중 파일 리팩터링, 72개 문서 금융 패키지 — 단일 요청 문제.
• 라이선스 — BF16 원본과 FP8 양자화 릴리스 모두 Apache License 2.0을 적용하며, 이는 독점 조항 없이 셀프 호스팅, 파인튜닝, 상업적 사용이 가능함을 의미합니다.
• 추론 스택 — Tencent는 지원되는 서빙 프레임워크로 vLLM과 SGLang을 나열하는데, 이 둘은 오픈 가중치 생태계가 실제로 표준으로 삼는 프레임워크입니다.
• API — Tencent Cloud의 TokenHub 엔드포인트: 입력 토큰 100만 개당 ¥6, 출력 토큰 100만 개당 ¥18, 캐시 히트 시 100만 개당 ¥0.3.
• 제품 통합 — Tencent가 WorkBuddy, CodeBuddy(국내 및 해외), Yuanbao, ima에서 제공하는 것과 동일한 가중치를 가져와 실행할 수 있습니다. CodeBuddy는 출시와 함께 모델을 2주간 무료로 체험할 수 있습니다.
텐센트는 또한 출시 노트에는 좀처럼 실리지 않는 추론 엔지니어링 수치를 보고합니다. 바로 연산자 융합과 통신 최적화를 통한 종단 간(end-to-end) 처리량 31.8% 향상입니다. 이런 디테일은 연구소가 연구 산출물로 출시하는 모델과 기업이 프로덕션 트래픽을 처리할 것으로 기대하는 모델을 구분 짓는 기준이 됩니다. 그리고 출시 첫날 기준으로 보면, 이는 텐센트 외부에서는 아무도 아직 측정하지 못한 바로 그런 주장이기도 합니다.
인용할 가치가 있는 점수
Tencent가 Tencent Hy4 Preview에 대해 공개한 모든 벤치마크는 공급업체 보고 방식입니다. 즉, Tencent 자체 평가 환경에서 실행되었으며, 독립 연구소에서 재현하지 못했고, 모델이 공개된 지 하루도 채 되지 않았습니다. 이런 수치는 Tencent가 달성했다고 믿는 상한선으로 보면 됩니다.

핵심 수치는 Terminal Bench 2.1로, 코딩 중 모델이 실제 터미널을 얼마나 잘 다루는지 측정하는 테스트다. 텐센트는 85.4를 기록했다고 보고했으며, 이는 Claude Opus 5와 동률이고 DeepSeek V4 Pro를 능가하며 자사 이전 모델 Hy3보다 14.6포인트 높은 수치라고 한다. 이 숫자 하나는 많은 것을 함의한다. 오픈 가중치 모델이 까다로운 에이전트형 코딩 테스트에서 가장 비싼 폐쇄형 프론티어 모델과 동등한 수준이라는 주장의 근거이며, 독립적인 확인이 가장 필요한 주장이기도 하다. 나머지 내부 테이블을 보면 DeepSWE는 Hy3의 28.0에서 64.3으로 뛰어올랐고, 텐센트는 이를 1급 모델과의 격차를 "점차 좁히고 있다"고 설명한다. 도구 호출 테스트인 Toolathlon-Verified는 74.1을 기록했으며, APEX-Agents pass@1은 37.1로 Kimi K3의 37.2에 근소하게 뒤졌다. SWE-bench Pro는 65.7, SWE-bench Multilingual은 82.9다. 별도의 내부 블라인드 테스트에서는 163명의 전문가가 203개 엔지니어링 작업을 4.00점 만점에 2.99점으로 평가해 GLM-5.3의 2.92와 Kimi K3의 2.94를 근소하게 앞질렀다.
두 가지 패턴이 두드러진다. 첫째, 모든 강력한 수치는 에이전틱 엔지니어링 작업(터미널 구동, 도구 호출, 리포지토리 규모 작업)에서 나왔으며, 일반 채팅이나 지식 관련 수치는 하나도 없다. 이는 소프트웨어 엔지니어링, 사무 및 데이터 분석, 게임 개발, 과학 연구 전반에 걸쳐 모델을 "생산성을 위해 구축되었다"고 포지셔닝한 텐센트의 전략과 일치한다. 둘째, 텐센트는 DeepSWE와 그 외 모델들이 격차를 좁히는 중이지, 완전히 해소하는 것은 아니라고 신중하게 표현한다. 깔끔하고 마케팅할 만한 유일한 동등성 주장은 Terminal Bench 2.1 동률이며, 이 주장이야말로 자체 워크로드로 테스트해볼 가치가 가장 높다.
백만 개당 ¥6이 실제로 사주는 것
가격 책정에서 이번 릴리스는 흥미로운 단계를 지나 파괴적인 단계로 접어든다. 출력 토큰 100만 개당 18위안(약 US$2.50)이라는 가격이면, 출력 토큰 100만 개를 소모하는 긴 에이전트형 코딩 세션 비용이 최고급 폐쇄형 프론티어 모델에서 같은 세션을 실행할 때의 약 10분의 1에 불과하다. 게다가 캐시 적중 요금이 0.3위안에 불과해 에이전트 루프가 다시 보내는 시스템 프롬프트와 대화 프리픽스 비용도 대부분 경쟁사의 캐싱보다 훨씬 저렴하다. 텐센트 자체 데모에서는 이 모델이 단일 패스로 금융 문서 72개를 처리하는 모습을 보여주는데, 이런 요금 수준이라면 그런 배치 작업은 예산을 압박하는 항목이 아니라 매일 감당할 수 있는 일상 작업이 된다.
이것은 또한 라우팅 계층이 계산을 바꾸는 지점이기도 하며, 이에 대해 정확히 짚고 넘어갈 가치가 있습니다.{{1}} OrcaRouter는 아직 Tencent Hy4 Preview를 라우팅하지 않습니다. Tencent가 이 모델을 제3자 추론 플랫폼에 개방하지 않았기 때문에, 이 모델은 Tencent Cloud의 TokenHub 엔드포인트와 공개된 가중치의 자체 호스팅 배포에서만 실행되며, 우리는 제공하지 않는 것을 제공한다고 주장하지 않습니다. 그러나 가격 인하가 의미를 갖게 만드는 원칙은 나머지 카탈로그가 운영되는 방식과 동일합니다. OrcaRouter는 공급업체의 공시 가격을 마크업 없이 그대로 전달하므로, 공급업체가 토큰을 6위안으로 책정하면 여러분이 저희 측에서 지불하는 금액도 6위안입니다. 재판매되고 마크업된 버전이 아니라요. 그리고 공급업체가 가격을 변경하는 날, 그 변경 사항은 같은 날 저희 측에 반영됩니다.{{/1}} 200개 이상의 모델을 위한 하나의 API, 한 공급업체에 일시적 장애가 발생하면 공급업체 간 자동 장애 조치, 그리고 모델을 단일 호출로 결합하는 라우팅 DSL: 이것이 Tencent가 개방하는 순간 Tencent Hy4 Preview를 라우팅할 메커니즘이며, 어느 쪽에도 프로덕션 경로를 걸지 않고 검증되지 않은 새 모델을 검증된 모델 옆에서 실행하는 데 이미 사용할 수 있는 메커니즘이기도 합니다.

다시 읽어볼 만한 주장들
출시 자료에는 모델이 어떻게 구축되었는지에 관한 두 가지 사항이 있는데, 이는 모델이 무엇을 득점했는지에 관한 것이 아니라 별도로 주목할 가치가 있습니다.
첫 번째는 자기 개선 루프입니다. 텐센트는 Tencent Hy4 Preview가 자체 연구 개발에 참여했다고 밝혔습니다. 이 모델은 자신을 만들어낸 훈련 방법, 데이터 전략, 평가 시스템, 그리고 저수준 연산자를 최적화하는 데 사용되었습니다. 이는 초기 단계의 재귀적 자기 향상 사이클입니다. 모델이 자신의 다음 버전 설계를 돕고, 텐센트가 이를 출시된 기능으로 공개하는 구조입니다. 이는 큰 주장이며, 전적으로 자체 보고에 기반한 것입니다.
두 번째는 수학적 결과입니다. Tencent는 이 모델이 볼록 기하학에서 오랜 미해결 문제인 Blaschke–Lebesgue 문제(일정한 폭을 가진 최소 부피 도형)의 기존 하한을 0.380799에서 0.41104로 끌어올려 Meissner 사면체 추측에 약 2% 이내로 근접했다고 보고합니다. Tencent는 또한 32,512개 원자로 구성된 인지질 이중층 시뮬레이션에서 2.0배 속도 향상을 달성해 스텝당 54.9밀리초로 단축했다고 보고합니다. 이런 결과는 보통 모델이 자체 논문을 발표할 만한 수준인데, 여기서는 출시 홍보 포인트에 불과합니다. 그리고 첫날의 다른 모든 것과 마찬가지로 이 역시 Tencent 자체 주장입니다.
정직한 간극
Tencent는 알려진 한계를 명확히 나열합니다. 비전이나 멀티모달 입력은 없습니다. Tencent Hy4 Preview는 텍스트 모델이며, 그것이 전부입니다. 따라서 이미지나 비디오와 관련된 모든 것은 다른 모델에 속합니다. Tencent는 또한 복잡한 작업에서 느린 시작 동작(첫 출력 전에 오래 생각하는 것)과 이미 수행한 작업을 다시 확인하는 데 토큰을 소모하는 과도한 자체 검증 경향을 지적합니다. 그 조합은 지연 시간에 민감한 채팅에는 정확히 부적합하고 오프라인 배치 엔지니어링 작업에는 정확히 감당할 수 있는 수준으로, Tencent가 어디에서 실행하길 기대하는지 알려줍니다.
그리고 가장 중요한 부재는 검증입니다. Tencent Hy4 Preview에 대한 독립적인 점수는 아직 어디에도 없습니다 — 공개 리더보드에도, 제3자 평가 랩에도 없습니다. 모델이 너무 새롭습니다. 내부 전문가 블라인드 테스트는 Tencent 자체 검토자들이 GLM-5.3 및 Kimi K3와 비교해 어떻게 보는지에 대한 유용한 신호이지만, 이는 Tencent의 과제에 대한 Tencent의 검토자들입니다. 사양서 이상의 모든 것은 검사를 기다리는 주장입니다.

실제로 오늘 시도해 보는 방법
실용적인 경로는 짧습니다. Hugging Face, GitHub, ModelScope 또는 GitCode에서 가중치를 내려받아 vLLM이나 SGLang으로 서빙하거나, 호스팅 엔드포인트를 정가에 이용하려면 Tencent Cloud의 TokenHub API를 호출하거나, CodeBuddy나 WorkBuddy에서 사용할 수 있습니다. Tencent는 현재 2주 무료 체험을 진행 중입니다. Hy3 모델의 무료 이용은 9월 30일까지이며, Tencent의 개발 주기(약 2개월마다 한 번의 메이저 업데이트)를 감안하면 Hy4 정식 버전이 프리뷰 직후 곧 출시될 것으로 보입니다.
솔직한 요약: 오픈 가중치, 770B, 백만 컨텍스트 모델이 입력 토큰 100만 개당 ¥6에 제공되는 것은 오늘 현재 실제로 존재하는 사실입니다. 그리고 여기에 붙은 가장 강력한 벤치마크는 아직 아무도 재현하지 못한 폐쇄형 프런티어 모델과의 동률이라는 벤더의 주장입니다. 직접 내려받아 실제로 관심 있는 테스트를 실행해 보시고, 가격이 여전히 핵심인지는 증거가 판단하게 하세요.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
