'Tencent HY4 Preview vs Kimi K3' 비교를 위한 히어로 타이틀 카드. 중앙의 스코어보드 스타일 카드에는 '내부 블라인드 테스트, 4점 척도'라고 적혀 있고, 왼쪽에는 'Tencent HY4 Preview 2.99', 오른쪽에는 'Kimi K3 2.94'가 표시됩니다. 왼쪽 카드 'Tencent HY4 Preview'에는 '770B / 49B 활성, 오픈 가중치', '1M당 ¥6 / ¥18', '텍스트 전용 프리뷰'가 나열되어 있습니다. 오른쪽 카드 'Kimi K3'에는 '2.8T / 104B 활성, 오픈 가중치', '1M당 $3.00 / $15.00', '네이티브 비전, AA Index 57'이 나열되어 있습니다. 하단에는 'Tencent가 163명의 엔지니어와 함께 203개 태스크에 걸쳐 실시한 블라인드 테스트이며, 결과는 공급업체 보고 기준입니다.'라는 문구가 있습니다. OrcaRouter 로고는 오른쪽 하단 모서리에 합성되어 있습니다.
Guides & Insights

Tencent HY4 프리뷰 vs Kimi K3: Tencent가 공개하기로 선택한 블라인드 테스트

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Tencent HY4 Preview와 Kimi K3의 대결은 이번 모델 출시에서 Tencent가 직접 선택한 유일한 매치업입니다. 내부 블라인드 테스트(엔지니어 163명, 엔지니어링 작업 203개, 4점 척도 평가)에서 HY4 Preview는 2.99/4.00을 기록해 Kimi K3의 2.94를 앞질렀고, Tencent는 이를 승리라고 헤드라인에 내세웠습니다. 그 승리의 세부 내용은 천천히 읽어볼 가치가 있습니다. HY4 Preview는 작업의 51.2%에서 Kimi K3를 이겼고, 7.9%에서 비겼으며, 40.9%에서 졌습니다. 10%포인트의 순승률은 실질적이지만, 이는 총 파라미터 수가 3분의 1, 활성 파라미터 수가 절반 미만인 모델을 상대로 한 근소한 우위입니다. 게다가 전체 테스트는 Tencent가 직접 진행했습니다.

Kimi K3는 Moonshot의 2.8조 파라미터 오픈 가중치 플래그십 모델로, 지금까지 공개된 가장 큰 오픈 모델이자 7월 16일 이후 모든 중국 연구소가 비교 기준으로 삼아온 레퍼런스 포인트다. Tencent가 그것을 상대로 선택한 이유는 그것이 오픈 가중치 표준이기 때문이다. 이는 이 기사의 임무를 특이할 정도로 구체적으로 만든다. 도전자가 자진해서 나선 단 한 번의 맞대결을 읽고, 그것이 어떤 가치를 지니는지 판단하라는 것이다.

Tencent가 공개하기로 선택한 벤치마크

블라인드 테스트는 Tencent 자체 엔지니어들이 Tencent 자체 엔지니어링 태스크를 대상으로 채점한 결과이므로, 가장 먼저 할인해서 봐야 할 부분이다. 기업이 자체 선별한 태스크 세트는 새 모델이 가장 좋은 성과를 낼 수 있는 환경이다. 그 점을 인정하더라도, 결과의 형태는 시사하는 바가 있다. 51.2%의 승리와 40.9%의 패배는 그리 큰 격차가 아니며, 7.9%의 무승부율은 대부분의 태스크에서 두 모델이 거의 대등하다는 뜻이다. 어려운 태스크, 즉 프런티어 모델이 차별화되는 바로 그 태스크들에서는 격차가 늘 그래왔던 자리에 그대로 있다. 그리고 Tencent의 'Kimi K3보다 약간 앞선다'는 헤드라인은 정직하게 쓰인 표현인데, 모든 연구소가 그런 식으로 발표하는 것은 아니다.

규모는 운명이 아니다

{{1}}파라미터 비교는 사전 신념(priors)에 따라 결과가 인상적이거나 의심스럽게 보이게 만든다.{{/1}} {{2}}Kimi K3는 총 2.8조 개의 파라미터에 활성 파라미터는 1,040억 개로 — 896개 전문가 중 토큰당 16개가 활성화된다 — 항상 켜진 추론과 노출된 사고 사슬(chain-of-thought)로 훈련되었다.{{/2}} {{3}}HY4 Preview는 총 7,700억 개에 활성 파라미터는 490억 개로, 총 규모의 3분의 1에 불과하고 활성 연산량은 절반에도 미치지 못한다.{{/3}} {{4}}더 작은 모델이 블라인드 테스트에서 더 큰 모델을 근소한 차이로 이기는 것은 오픈 웨이트(open-weight) 분야 전체가 지향해 온 추세다 — 2.4T의 Qwen3.8-Max와 753B의 GLM-5.2가 수개월째 에이전트 벤치마크에서 접전을 벌여 왔다 — 따라서 이 결과는 터무니없기보다는 그럴듯하다.{{/4}} {{5}}결정적으로, 이 결과는 텐센트(Tencent) 외부의 누구에게도 검증되지 않았다.{{/5}}

점수판

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• 규모 — HY4 Preview 총 770B / 활성 49B vs Kimi K3 총 2.8T / 활성 104B

• 컨텍스트 — HY4 Preview >1M 토큰 vs Kimi K3 1M 토큰

• 1M당 가격 — HY4 Preview 입력 ¥6 / 출력 ¥18 (≈$0.85 / $2.50) vs Kimi K3 입력 $3.00 / 출력 $15.00, 캐시 적중 $0.30

• 모달리티 — HY4 Preview 텍스트 전용 vs Kimi K3 네이티브 이미지·비디오 입력

• 추론 — HY4 Preview는 공개 모드가 없는 반면, Kimi K3는 스트리밍 chain-of-thought를 통한 상시 추론을 제공합니다

• 독립 점수 — HY4 Preview 없음 vs Kimi K3 AA Intelligence Index 57, 출시 당시 전 세계 상위 3위

양쪽 모두 숫자를 보고하는 행에서는 모델들이 군집을 이룬다. 텐센트는 APEX-Agents에서 HY4 Preview를 37.1로 보고하며, 이는 Kimi K3의 37.2와 사실상 동률이다. 이는 블라인드 테스트 스코어보드가 예측할 만한 근소한 동점이다. HY4 Preview의 Toolathlon-Verified 74.1 및 DeepSWE 64.3은 내가 확보한 Kimi K3의 결과에는 대응하는 값이 없고, Kimi K3의 FrontierSWE 81.2, ProgramBench 77.8, BrowseComp 91.2도 HY4 Preview에는 대응하는 값이 없다. 스코어보드는 두 카드가 거의 겹치지 않는다는 점을 정직하게 보여주며, 이는 어느 쪽 공급업체의 행을 해당 모델에 대한 완전한 설명으로 취급하는 것에 대한 경고이기도 하다.

비전이 가장 큰 진정한 차이점이다.

오늘 두 가지 중 하나를 선택해야 하는 개발자에게 구조적 격차는 지능이 아니라 입력 방식입니다. Kimi K3는 기본적으로 멀티모달이며, MoonViT-V2 인코더를 통해 이미지와 비디오 입력을 받고, 비전 작업에서 최고 수준의 오픈 모델 중 하나로 Vision Arena에서 전 세계 2위를 기록했습니다. Tencent HY4 Preview는 이번 프리뷰에서 텍스트 전용이며, Tencent는 비전 기능이 정식 출시 때까지 기다려야 한다고 밝혔습니다. 스크린샷, UI 이해, 또는 시각적 근거가 필요한 모든 워크로드는 블라인드 테스트가 엔지니어링 텍스트에 대해 뭐라고 말하든 기본적으로 Kimi K3의 몫입니다. 당신의 작업이 순전히 코드, 문서, 터미널 출력에만 국한된다면 그 격차는 중요하지 않습니다. 하지만 어떤 작업이 무언가를 '보는' 것을 포함하는 순간, 그 격차가 승부를 결정합니다.

비용 문제

토큰당 단가로 보면 HY4 Preview는 현격히 저렴합니다. 약 $0.85/$2.50인 반면 Kimi K3는 $3.00/$15.00이며, 캐시 적중 가격은 HY4가 ¥0.3(약 4센트), Kimi가 $0.30입니다. 하지만 두 모델은 토큰 사용 특성이 정반대여서 그 격차를 좁힙니다. Kimi K3는 항상 추론 모드로 작동하며 사고 과정(chain-of-thought)을 스트리밍하므로 모든 요청에서 출력 토큰이 늘어납니다. 리뷰어들은 이 모델이 더 느리고(초당 약 62토큰) 에이전트 루프에서 토큰을 많이 소모한다고 지적했습니다. HY4 Preview는 Tencent 자체 릴리스 노트에 따르면 복잡한 작업에서 "지나치게 긴 사고와 과도한 자체 검증" 경향이 있습니다. 두 모델 모두 추가 출력 토큰을 소모하지만, HY4 Preview는 그에 대한 요금이 더 낮을 뿐입니다. 공정한 비교는 완료된 작업당 비용(cost-per-completed-task)이며, Tencent 외에는 아무도 HY4 Preview의 그것을 측정하지 못했습니다.

평결

Tencent HY4 Preview는 더 저렴하고, 더 작고, 검증되지 않은 도전자로, 오픈 가중치 표준 모델 대비 근소한 블라인드 테스트 우위를 주장합니다. Kimi K3는 더 크고, 검증되었으며, 비전 기능을 갖춘 기존 모델로, 토큰당 비용이 4~5배 더 비싸고 독립적인 인텔리전스 지수 57을 보유하고 있습니다. 두 모델의 벤치마크 카드 모두 완전히 독립적이지는 않습니다. Kimi K3의 주요 점수도 Moonshot이 보고한 것이지만, Index 57은 그렇지 않습니다. 워크로드가 멀티모달이라면, 이 대결에서 Kimi K3가 유일한 선택입니다. 텍스트와 엔지니어링 중심이라면, HY4 Preview는 공급업체가 운영하지만 실제 헤드투헤드 기록을 가진 가성비 선택입니다. 저렴한 방법은 프로덕션 키에 Kimi K3를 라우팅하는 것입니다. OrcaRouter에서 Moonshot의 정가 $3.00/$15.00로 제공되며, 마크업 없이 그대로 전달됩니다. 한편 HY4 Preview는 섀도우 워크로드에서 Tencent 자체 API를 통해 실행할 수 있습니다. HY4 Preview가 라우터에 도달하면 동일한 키와 동일한 장애 조치 규칙이 두 모델을 모두 처리하며, Tencent의 ¥6/¥18 요금이 변경 없이 그대로 전달됩니다.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

볼 것

• 블라인드 테스트 작업의 독립적 재실행. 51.2%의 승률은 이번 출시에서 가장 검증 가능한 단일 주장이며, 제3자 테스트 하네스가 일주일 안에 이를 판가름할 것입니다.

HY4 Preview가 정식 Hy4 출시 전에 비전을 탑재할지 여부. 그것이 이 상황을 텍스트 전용 가치 대결에서 진정한 플래그십 싸움으로 바꿀 것이다.

• 표준 에이전틱 하네스에서 완료된 작업당 비용. 두 모델 모두 토큰 사용량이 많다. 완료된 작업당 더 저렴한 쪽이 프로덕션 논쟁에서 승리한다.

Kimi K3의 가격 압력에 대한 대응. Moonshot이 $15 출력 요금을 인하하면, "저렴한 도전자 vs 비싼 표준"이라는 구도가 뒤집힌다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube