
Tencent HY4 프리뷰 vs Kimi K3: Tencent가 공개하기로 선택한 블라인드 테스트
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
Tencent HY4 Preview와 Kimi K3의 대결은 이번 모델 출시에서 Tencent가 직접 선택한 유일한 매치업입니다. 내부 블라인드 테스트(엔지니어 163명, 엔지니어링 작업 203개, 4점 척도 평가)에서 HY4 Preview는 2.99/4.00을 기록해 Kimi K3의 2.94를 앞질렀고, Tencent는 이를 승리라고 헤드라인에 내세웠습니다. 그 승리의 세부 내용은 천천히 읽어볼 가치가 있습니다. HY4 Preview는 작업의 51.2%에서 Kimi K3를 이겼고, 7.9%에서 비겼으며, 40.9%에서 졌습니다. 10%포인트의 순승률은 실질적이지만, 이는 총 파라미터 수가 3분의 1, 활성 파라미터 수가 절반 미만인 모델을 상대로 한 근소한 우위입니다. 게다가 전체 테스트는 Tencent가 직접 진행했습니다.
Kimi K3는 Moonshot의 2.8조 파라미터 오픈 가중치 플래그십 모델로, 지금까지 공개된 가장 큰 오픈 모델이자 7월 16일 이후 모든 중국 연구소가 비교 기준으로 삼아온 레퍼런스 포인트다. Tencent가 그것을 상대로 선택한 이유는 그것이 오픈 가중치 표준이기 때문이다. 이는 이 기사의 임무를 특이할 정도로 구체적으로 만든다. 도전자가 자진해서 나선 단 한 번의 맞대결을 읽고, 그것이 어떤 가치를 지니는지 판단하라는 것이다.
Tencent가 공개하기로 선택한 벤치마크
블라인드 테스트는 Tencent 자체 엔지니어들이 Tencent 자체 엔지니어링 태스크를 대상으로 채점한 결과이므로, 가장 먼저 할인해서 봐야 할 부분이다. 기업이 자체 선별한 태스크 세트는 새 모델이 가장 좋은 성과를 낼 수 있는 환경이다. 그 점을 인정하더라도, 결과의 형태는 시사하는 바가 있다. 51.2%의 승리와 40.9%의 패배는 그리 큰 격차가 아니며, 7.9%의 무승부율은 대부분의 태스크에서 두 모델이 거의 대등하다는 뜻이다. 어려운 태스크, 즉 프런티어 모델이 차별화되는 바로 그 태스크들에서는 격차가 늘 그래왔던 자리에 그대로 있다. 그리고 Tencent의 'Kimi K3보다 약간 앞선다'는 헤드라인은 정직하게 쓰인 표현인데, 모든 연구소가 그런 식으로 발표하는 것은 아니다.
규모는 운명이 아니다
{{1}}파라미터 비교는 사전 신념(priors)에 따라 결과가 인상적이거나 의심스럽게 보이게 만든다.{{/1}} {{2}}Kimi K3는 총 2.8조 개의 파라미터에 활성 파라미터는 1,040억 개로 — 896개 전문가 중 토큰당 16개가 활성화된다 — 항상 켜진 추론과 노출된 사고 사슬(chain-of-thought)로 훈련되었다.{{/2}} {{3}}HY4 Preview는 총 7,700억 개에 활성 파라미터는 490억 개로, 총 규모의 3분의 1에 불과하고 활성 연산량은 절반에도 미치지 못한다.{{/3}} {{4}}더 작은 모델이 블라인드 테스트에서 더 큰 모델을 근소한 차이로 이기는 것은 오픈 웨이트(open-weight) 분야 전체가 지향해 온 추세다 — 2.4T의 Qwen3.8-Max와 753B의 GLM-5.2가 수개월째 에이전트 벤치마크에서 접전을 벌여 왔다 — 따라서 이 결과는 터무니없기보다는 그럴듯하다.{{/4}} {{5}}결정적으로, 이 결과는 텐센트(Tencent) 외부의 누구에게도 검증되지 않았다.{{/5}}
점수판

• 규모 — HY4 Preview 총 770B / 활성 49B vs Kimi K3 총 2.8T / 활성 104B
• 컨텍스트 — HY4 Preview >1M 토큰 vs Kimi K3 1M 토큰
• 1M당 가격 — HY4 Preview 입력 ¥6 / 출력 ¥18 (≈$0.85 / $2.50) vs Kimi K3 입력 $3.00 / 출력 $15.00, 캐시 적중 $0.30
• 모달리티 — HY4 Preview 텍스트 전용 vs Kimi K3 네이티브 이미지·비디오 입력
• 추론 — HY4 Preview는 공개 모드가 없는 반면, Kimi K3는 스트리밍 chain-of-thought를 통한 상시 추론을 제공합니다
• 독립 점수 — HY4 Preview 없음 vs Kimi K3 AA Intelligence Index 57, 출시 당시 전 세계 상위 3위
양쪽 모두 숫자를 보고하는 행에서는 모델들이 군집을 이룬다. 텐센트는 APEX-Agents에서 HY4 Preview를 37.1로 보고하며, 이는 Kimi K3의 37.2와 사실상 동률이다. 이는 블라인드 테스트 스코어보드가 예측할 만한 근소한 동점이다. HY4 Preview의 Toolathlon-Verified 74.1 및 DeepSWE 64.3은 내가 확보한 Kimi K3의 결과에는 대응하는 값이 없고, Kimi K3의 FrontierSWE 81.2, ProgramBench 77.8, BrowseComp 91.2도 HY4 Preview에는 대응하는 값이 없다. 스코어보드는 두 카드가 거의 겹치지 않는다는 점을 정직하게 보여주며, 이는 어느 쪽 공급업체의 행을 해당 모델에 대한 완전한 설명으로 취급하는 것에 대한 경고이기도 하다.
비전이 가장 큰 진정한 차이점이다.
오늘 두 가지 중 하나를 선택해야 하는 개발자에게 구조적 격차는 지능이 아니라 입력 방식입니다. Kimi K3는 기본적으로 멀티모달이며, MoonViT-V2 인코더를 통해 이미지와 비디오 입력을 받고, 비전 작업에서 최고 수준의 오픈 모델 중 하나로 Vision Arena에서 전 세계 2위를 기록했습니다. Tencent HY4 Preview는 이번 프리뷰에서 텍스트 전용이며, Tencent는 비전 기능이 정식 출시 때까지 기다려야 한다고 밝혔습니다. 스크린샷, UI 이해, 또는 시각적 근거가 필요한 모든 워크로드는 블라인드 테스트가 엔지니어링 텍스트에 대해 뭐라고 말하든 기본적으로 Kimi K3의 몫입니다. 당신의 작업이 순전히 코드, 문서, 터미널 출력에만 국한된다면 그 격차는 중요하지 않습니다. 하지만 어떤 작업이 무언가를 '보는' 것을 포함하는 순간, 그 격차가 승부를 결정합니다.
비용 문제
토큰당 단가로 보면 HY4 Preview는 현격히 저렴합니다. 약 $0.85/$2.50인 반면 Kimi K3는 $3.00/$15.00이며, 캐시 적중 가격은 HY4가 ¥0.3(약 4센트), Kimi가 $0.30입니다. 하지만 두 모델은 토큰 사용 특성이 정반대여서 그 격차를 좁힙니다. Kimi K3는 항상 추론 모드로 작동하며 사고 과정(chain-of-thought)을 스트리밍하므로 모든 요청에서 출력 토큰이 늘어납니다. 리뷰어들은 이 모델이 더 느리고(초당 약 62토큰) 에이전트 루프에서 토큰을 많이 소모한다고 지적했습니다. HY4 Preview는 Tencent 자체 릴리스 노트에 따르면 복잡한 작업에서 "지나치게 긴 사고와 과도한 자체 검증" 경향이 있습니다. 두 모델 모두 추가 출력 토큰을 소모하지만, HY4 Preview는 그에 대한 요금이 더 낮을 뿐입니다. 공정한 비교는 완료된 작업당 비용(cost-per-completed-task)이며, Tencent 외에는 아무도 HY4 Preview의 그것을 측정하지 못했습니다.
평결
Tencent HY4 Preview는 더 저렴하고, 더 작고, 검증되지 않은 도전자로, 오픈 가중치 표준 모델 대비 근소한 블라인드 테스트 우위를 주장합니다. Kimi K3는 더 크고, 검증되었으며, 비전 기능을 갖춘 기존 모델로, 토큰당 비용이 4~5배 더 비싸고 독립적인 인텔리전스 지수 57을 보유하고 있습니다. 두 모델의 벤치마크 카드 모두 완전히 독립적이지는 않습니다. Kimi K3의 주요 점수도 Moonshot이 보고한 것이지만, Index 57은 그렇지 않습니다. 워크로드가 멀티모달이라면, 이 대결에서 Kimi K3가 유일한 선택입니다. 텍스트와 엔지니어링 중심이라면, HY4 Preview는 공급업체가 운영하지만 실제 헤드투헤드 기록을 가진 가성비 선택입니다. 저렴한 방법은 프로덕션 키에 Kimi K3를 라우팅하는 것입니다. OrcaRouter에서 Moonshot의 정가 $3.00/$15.00로 제공되며, 마크업 없이 그대로 전달됩니다. 한편 HY4 Preview는 섀도우 워크로드에서 Tencent 자체 API를 통해 실행할 수 있습니다. HY4 Preview가 라우터에 도달하면 동일한 키와 동일한 장애 조치 규칙이 두 모델을 모두 처리하며, Tencent의 ¥6/¥18 요금이 변경 없이 그대로 전달됩니다.


볼 것
• 블라인드 테스트 작업의 독립적 재실행. 51.2%의 승률은 이번 출시에서 가장 검증 가능한 단일 주장이며, 제3자 테스트 하네스가 일주일 안에 이를 판가름할 것입니다.
HY4 Preview가 정식 Hy4 출시 전에 비전을 탑재할지 여부. 그것이 이 상황을 텍스트 전용 가치 대결에서 진정한 플래그십 싸움으로 바꿀 것이다.
• 표준 에이전틱 하네스에서 완료된 작업당 비용. 두 모델 모두 토큰 사용량이 많다. 완료된 작업당 더 저렴한 쪽이 프로덕션 논쟁에서 승리한다.
Kimi K3의 가격 압력에 대한 대응. Moonshot이 $15 출력 요금을 인하하면, "저렴한 도전자 vs 비싼 표준"이라는 구도가 뒤집힌다.
