'Tencent HY4 Preview vs tencent-hy3' 히어로 타이틀 카드. 헤드라인: '가격은 6배 — 그 도약이 실제로 사다주는 것'. 왼쪽 패널 'Tencent HY4 Preview' (새 플래그십, 2026년 8월 28일) — 칩: '770B / 49B MoE', '1M context', 'DeepSWE 64.3'. 오른쪽 패널 'tencent-hy3' (검증된 워크호스) — 칩: '295B / 21B MoE', '256K context', 'DeepSWE 28.0'. 푸터: '가격: MTok당 ¥6/¥18 대 ¥1/¥4. 벤치마크는 벤더 제공 기준.'
Guides & Insights

Tencent HY4 프리뷰 vs tencent-hy3: 6배 비싼 가격, 그 도약이 실제로 가져다주는 것

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Tencent HY4 Preview는 Hunyuan 제품군 중 의도적으로 이전 모델이 저렴해 보이게 만드는 첫 번째 모델입니다. Tencent는 이 모델의 입력 가격을 tencent-hy3의 6배, 출력 가격을 4.5배로 책정했으며, 출시 자료는 그 프리미엄이 정당하다고 주장합니다. 2026년 8월 28일에 출시되고 오픈소스로 공개된 Tencent HY4 Preview는 DeepSWE에서 Hy3의 28.0을 두 배 이상 웃도는 소프트웨어 엔지니어링 점수, Terminal-Bench 2.1에서 85.4의 터미널 구동 점수를 보고하며, 컨텍스트 창도 256K에서 백만 토큰 이상으로 도약합니다. 7월 6일에 정식 출시된 tencent-hy3는 이 제품군의 성숙한 주력 모델로, 총 2,950억 개의 파라미터, 활성 파라미터 210억 개, 컨텍스트의 4분의 1, 그리고 반올림 오류에 가까운 가격표를 갖추고 있습니다. 사양표는 이 경쟁을 접전으로 남겨두지 않습니다. 문제는 실제로 구동하는 작업에 비해 그 격차가 돈값을 하는지 여부이며, 답은 워크로드에 따라 갈립니다.

점수판: 두 가지가 실제로 갈라지는 지점

텐센트 자료의 모든 벤치마크는 벤더가 보고한 것이다. 각 모델 출시 시점에 텐센트 자체 평가 환경에서 실행되었고, 독립 연구실에 의한 재현은 없었다. 플래그십 모델은 공개된 지 하루도 채 되지 않았다. 점수는 텐센트가 달성했다고 믿는 상한선으로 간주하고, 어떤 단일 수치보다 패턴에 더 비중을 두어야 한다. 그 패턴은 명백하며, 일반 지식보다 에이전트 엔지니어링 작업에 집중되어 있다:

• DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. 이는 페어링에서 가장 큰 단일 도약으로, 저장소 규모의 소프트웨어 엔지니어링 벤치마크에서 두 배 이상의 증가이며, 채팅 모델과 전체 코드베이스를 넘겨받는 모델을 구분 짓는 숫자입니다.

• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4, Tencent에 따르면 Claude Opus 5와 동률이며 DeepSeek V4 Pro를 능가합니다. tencent-hy3: 7월 출시 당시 보고된 바와 같이 71.7. 다단계 작업에서 실제 터미널을 끝까지 구동하는 것은 Hy3가 가장 취약했던 장기적 작업 유형에 정확히 해당합니다.

Toolathlon 검증 — Tencent HY4 Preview: 74.1, Tencent에 따르면 Qwen 3.8 MaxGPT-5.6 Sol을 능가하는 수치입니다. 비교 가능한 Hy3 수치는 공개되지 않았습니다.

• 내부 블라인드 테스트 — 163명의 전문가가 203개의 엔지니어링 작업을 평가한 결과, Tencent HY4 Preview가 2.99/4.00을 기록하며 GLM-5.3의 2.92와 Kimi K3의 2.94를 약간 앞질렀습니다. 이는 Tencent의 작업을 Tencent의 리뷰어가 평가한 것이므로 방향성 지표로만 간주하세요.

A two-column comparison scoreboard titled 'Tencent HY4 Preview vs tencent-hy3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active params: 770B / 49B', 'Context window: 1M', 'DeepSWE: 64.3', 'Terminal-Bench 2.1: 85.4', 'Input price per MTok: ¥6 (~$0.85)', 'Output price per MTok: ¥18 (~$2.50)'. Right column 'tencent-hy3': 'Total / active params: 295B / 21B', 'Context window: 256K', 'DeepSWE: 28.0', 'Terminal-Bench 2.1: 71.7', 'Input price per MTok: ¥1 (~$0.14)', 'Output price per MTok: ¥4 (~$0.56)'. A footer reads 'Benchmarks vendor-reported by Tencent at each model's launch.'

일관된 흐름: 성과는 터미널 구동, 도구 호출, 리포지토리 규모 작업에서 나타난다 — Hy3 이후 Tencent가 밀어붙여 온 생산성 포지셔닝이며, 이제는 이를 뒷받침할 컴퓨팅까지 갖추게 되었다.

가격 프리미엄, 줄별로

여기서부터 비교는 더 이상 자랑거리에 관한 것이 아닙니다. Tencent의 백만 토큰당 정가:

• 입력 — Tencent HY4 Preview: 6위안 (~US$0.85). tencent-hy3: 1위안 (~US$0.14). 6배.

• 출력 — Tencent HY4 Preview: 18위안 (약 US$2.50). tencent-hy3: 4위안 (약 US$0.56). 4.5배.

• 캐시 적중 — Tencent HY4 Preview: 0.3위안. tencent-hy3: 0.25위안. 거의 동일한 가격이지만, 이는 보기보다 더 중요한 의미를 지닙니다. 에이전트 루프가 동일한 시스템 프롬프트와 대화 접두사를 끊임없이 다시 보내기 때문입니다.

현실적인 에이전틱 코딩 워크로드를 혼합 기준으로 실행해 보자. 예를 들어 한 달에 입력 토큰 2천만 개와 출력 토큰 4백만 개를 사용하는, 바쁜 단일 개발자 에이전트 예산이다. Tencent HY4 Preview: 120위안 + 72위안, 약 192위안 (약 US$27). tencent-hy3: 20위안 + 16위안, 약 36위안 (약 US$5). 플래그십 모델은 동일한 토큰 구성에서 실행 비용이 5배 이상 더 들며, 더 오래 생각하기 때문에 작업당 더 많은 출력 토큰을 요구할 것이다.

그것은 Tencent HY4 Preview를 피할 이유가 아닙니다. DeepSWE 점프는 프리미엄을 지불하고 살 만한 바로 그런 능력입니다. 오히려 그것은 워크로드를 라우팅하기 전에 가격을 산정해야 하는 이유이며, 라우팅 계층이 제 역할을 하는 지점이기도 합니다. tencent-hy3는 이미 OrcaRouter에 공급업체 정가로 등록되어 있습니다 — 0% 마크업, 즉 표시된 숫자는 서빙 공급업체의 자체 가격이지 재판매되어 마크업된 버전이 아닙니다 — 공급업체 간 자동 장애 조치를 갖추고 있으며, 공급업체 가격 변경은 같은 날 우리 쪽에도 반영됩니다.

{{1}}컨텍스트 4배{{/1}}, {{2}}활성 컴퓨팅 2배{{/2}}

• 아키텍처 — Tencent HY4 Preview: 총 770B, 활성 MoE 49B. tencent-hy3: 총 295B, 활성 21B. 플래그십 모델은 모든 토큰에 약 2.3배의 연산을 투입합니다.

• 컨텍스트 창 — Tencent HY4 Preview: 1M 토큰 이상. tencent-hy3: 256K. 전체 리포지토리 또는 금융 문서 배치는 플래그십 모델의 창에 단일 요청으로 들어맞습니다. Hy3에서는 동일한 작업에 청킹(chunking), 검색(retrieval), 또는 에이전트 루프(agent loop)가 필요합니다.

• 추론 제어 — tencent-hy3은 요청별 reasoning_effort 설정(no_think, low, high)과 속도를 유지해 주는 speculative-decoding 레이어를 제공합니다. Tencent HY4 Preview는 Tencent의 자체 인정에 따르면 첫 출력 전에 길게 생각하는 경향이 있으며, 복잡한 작업에서는 이미 수행한 작업을 다시 확인하느라 토큰을 소모하며 과도하게 자체 검증을 수행합니다.

마지막 줄이 지연 시간에 민감한 사용에서 가장 중요한 숨은 차이입니다. Hy3는 직접 답하도록 지시받을 수 있지만, Tencent HY4 Preview는 적어도 이 초기 형태에서는 생각하지 않을 수 없습니다. 저지연 채팅이나 높은 처리량의 추출 파이프라인에서는 플래그십의 추가 기능이 낭비되고, 추가적인 사고는 세금과 같습니다. 오프라인 배치 엔지니어링 작업의 경우, 그 세금이 바로 더 나은 답변을 얻는 대가입니다.

미리보기 세금: Hy3가 여전히 갖고 있는 것

"Preview"는 Tencent HY4 Preview라는 이름에 들어 있으며, 실제로도 그 이름값을 한다. 비전 입력이나 멀티모달 입력은 없다. 이 모델은 텍스트 전용이므로, 이미지나 비디오와 관련된 작업은 기존에 그 용도로 사용하던 모델에 그대로 맡겨야 한다. WorkBuddy와 CodeBuddy의 2주 무료 체험은 맛보기에 불과하며, 정식 플랜이 아니다. Tencent는 이것이 Hy4의 초기 버전임을 분명히 밝혔으며, 사전 학습(pre-training)과 사후 학습(post-training) 개선이 2월 이후 약 두 달마다 주요 버전을 출시해 온 주기에 맞춰 계속 이어질 예정이다. 플래그십 모델에 대한 독립적인 벤치마크는 아직 어디에도 없다.

tencent-hy3는 그 모든 것과 정반대입니다. 7월부터 프로덕션에서 사용된 공식적이고 안정적인 릴리스입니다. 무료 티어는 9월 30일까지입니다. 추론 수준은 기질이 아니라 다이얼을 제공하며, 추측 디코딩 레이어와 210억 개의 활성 매개변수 덕분에 이 패밀리에서 저렴하고 빠르며 예측 가능한 절반이 됩니다. 기본 경로에 지정해 두고 잊어버리는 모델입니다.

Screenshot of Tencent's official Hugging Face model card for the Hy4 Preview release, showing the model's open-weights download options, the 770B-parameter mixture-of-experts specification, and the million-token context window.

누가 어떤 것을 골라야 하나요

작업이 핵심일 때 Tencent HY4 Preview를 선택하세요 — 어려운 소프트웨어 엔지니어링 작업, 저장소 규모의 컨텍스트, 더 나은 답변이 토큰 비용의 5배를 정당화하고 말하기 전에 생각하는 모델의 지연 시간을 감당할 수 있는 에이전틱 워크플로우. 제약이 핵심일 때 tencent-hy3를 선택하세요 — 높은 처리량, 낮은 지연 시간, 빠듯한 예산, 또는 모델이 숙고보다는 답변을 하길 원하는 모든 작업.

이런 짝(pairing)에 대한 실용적인 패턴은 에스컬레이션입니다: 기본 경로에는 저렴하고 제어 가능한 모델을 배치하고, 작업이 요구할 때만 플래그십으로 에스컬레이션하는 것입니다. 이것이 바로 OrcaRouter의 라우팅 DSL이 존재하는 이유입니다 — 여러 모델을 하나의 호출로 구성하여 정책을 코드가 아닌 구성으로 만드는 것 — 그리고 자동 장애 조치(failover)는 하나의 공급자가 성능이 저하되어도 Hy3의 경로가 계속 서비스를 제공한다는 것을 의미합니다. OrcaRouter는 아직 Tencent HY4 Preview를 라우팅하지 않습니다. Tencent는 해당 모델을 제3자 추론(inference)에 개방하지 않았기 때문에, 현재로서는 공급업체 자체의 Tencent Cloud TokenHub 엔드포인트와 오픈 가중치(open weights)의 자체 호스팅 배포에서 실행됩니다. 한편 tencent-hy3는 오늘 현재 공급업체의 정가로 카탈로그에 등록되어 있습니다. 그리고 플래그십이 개방되는 날에는 동일한 방식으로 동일한 라우팅 계층에 자리 잡게 되어, 한 모델에서 다른 모델로의 교체가 재작성이 아닌 한 줄 변경으로 이루어집니다.

Screenshot of the OrcaRouter model page for tencent/hy3, showing its provider list price and availability through the one-API routing catalog — the half of this family that can be routed today.

평결은 가장 좋은 의미에서 지루하다. 플래그십은 책정된 작업에 대해 정확히 그만한 프리미엄의 가치가 있고, 워크호스는 처리해야 할 모든 일에 여전히 올바른 선택이다. 6배의 가격 차이는 실재하고, 28대 64 DeepSWE 격차도 실재하며, 어느 쪽도 다른 쪽을 상쇄하지 않는다. 단지 자신이 어떤 것을 사는지 알기만 하면 된다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube