
Tencent HY4 Preview vs GPT-5.6 Sol: 오픈 가중치를 최전선과 맞서게 하는 도구 호출 주장
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
Tencent HY4 Preview는 출시 카드에서 GPT-5.6 Sol에 대한 우위를 명시적으로 주장하는 몇 달 만의 첫 번째 오픈 가중치(open-weight) 모델입니다. 문제의 수치는 에이전트형 도구 호출(agentic tool-calling)을 평가하는 벤치마크인 Toolathlon-Verified로, Tencent는 HY4 Preview가 74.1을 기록했다고 보고했습니다. 이는 Qwen3.8-Max보다 높은 수치이며, Tencent 자체 비교에 따르면 GPT-5.6 Sol보다도 앞선 것입니다. 다른 모든 측면에서 두 모델은 사실상 동급이 아닙니다. GPT-5.6 Sol은 OpenAI의 폐쇄형 플래그십 프런티어 모델로 독립적으로 측정된 성능을 갖추고 있으며, Tencent HY4 Preview는 7,700억 개 파라미터를 가진 오픈 가중치 프리뷰로, 오늘 아침 출시되었고 공급업체가 보고한 성과표만 있을 뿐 제3자 검증이 없습니다.
그래서 흥미로운 질문은 '어느 모델이 더 똑똑한가'가 아니라, Sol 입력 가격의 약 6분의 1에 해당하는 오픈 웨이트 도전자가 프런티어의 일부를 설득력 있게 차지할 수 있는지, 그리고 팀이 현재 검증할 수 없는 주장에 대해 어떻게 대처해야 하는지입니다.
이것을 진짜 대결로 만드는 주장
Toolathlon-Verified는 단일 함수를 얼마나 잘 작성하는지보다는, 전체 에이전트 작업에서 도구를 얼마나 안정적으로 구동하는지 — 결과를 읽고, 다음 호출을 결정하고, 오류에서 복구하는 과정 — 를 측정합니다. 이것이 중요한 이유는 프론티어 모델에 대한 실제 API 지출의 가장 큰 몫이 일회성 완료가 아니라 에이전트 루프에 사용되기 때문입니다. 해당 벤치마크에서 Tencent의 74.1이라는 수치는 HY4 Preview를 GPT-5.6 Sol의 대화에 등장하게 한 구체적인 주장이며, 잠시 곱씹어 볼 가치가 있습니다. 이 수치는 독립적 재현 검증에서도 유지된다면 오픈 가중치 모델과 폐쇄형 프론티어 모델 간 비용 논의를 현실로 만들어 주는 종류의 숫자입니다. 유지되지 않는다면, 제3자 하네스 앞에서 증발해 버리는 또 하나의 벤더 성적표가 될 뿐입니다.
지능을 구매하는 두 가지 방법

파라미터 — HY4 Preview 총 770B / 활성 49B, 오픈 가중치 vs GPT-5.6 Sol, 파라미터 수 미공개, 비공개 API
• 컨텍스트 — HY4 Preview 1M 이상 토큰 vs GPT-5.6 Sol 1.05M 토큰, 최대 출력 128K
• 1M당 가격 — HY4 Preview ¥6 입력 / ¥18 출력 (≈$0.85 / $2.50) vs GPT-5.6 Sol 기본 티어 $4.00 / $20.00, 대형 컨텍스트 요청 시 $8.00 / $30.00로 상승, 캐시 읽기 $0.40
• 입력 방식 — HY4 Preview는 이번 프리뷰에서 텍스트 전용이며, GPT-5.6 Sol은 텍스트 및 이미지 입력을 지원합니다.
• 추론 모드 — HY4 Preview는 공개된 동급 기능이 없음 vs GPT-5.6 Sol의 Ultra 모드(최대 16개 병렬 하위 에이전트) 및 Max reasoning effort
• 독립적 검증 — HY4 Preview는 아직 없음 vs GPT-5.6 Sol은 모든 주요 리더보드에 존재하며, 1.05M-컨텍스트가 장문 컨텍스트 종합 테스트 최상위권에 랭크됨
가격 열이 바로 전체 승부가 갈리는 곳입니다. 기본 티어에서 GPT-5.6 Sol은 입력 토큰 100만 개당 4.00달러, 출력 토큰 100만 개당 20.00달러입니다. Tencent HY4 Preview는 현재 환율 기준으로 약 0.85달러와 2.50달러입니다. 출력 토큰을 많이 소비하는 워크로드(에이전틱 코딩이 대표적)의 경우, 오픈 가중치 모델은 폐쇄형 모델의 약 8분의 1 가격으로 책정되어 있으며, 이러한 격차는 Sol의 수치가 훨씬 더 많은 검증을 거친 것이라는 단서를 감안하더라도 유지됩니다.
GPT-5.6 Sol이 여전히 우위를 점하고 있는 곳
검증이 첫 번째 장점입니다. GPT-5.6 Sol은 7월 9일부터 일반 공개되었으며, 그 이후로 독립적으로 측정된 결과는 다음과 같습니다: 기본 추론에서 Terminal-Bench 2.1 88.8, Ultra 모드에서 91.9, Agents' Last Exam에서 53.6(출시 당시 기록), GPQA Diamond에서 94.6, 그리고 SWE-bench Pro에서 64.6입니다. OpenAI는 또한 자체 이전 플래그십 대비 에이전트 프로그래밍 작업에서 토큰 효율성이 54% 개선되었다고 보고합니다. 이 수치들은 OpenAI 자체 문서 외부에서도 재현된 것을 확인할 수 있는 숫자이며, 이는 오늘날 Tencent HY4 Preview가 결여하고 있는 바로 그 특성입니다.
능력은 두 번째 차별점이며, 이는 미미한 차이가 아니라 구조적인 차이입니다. GPT-5.6 Sol은 이미지 입력을 지원하지만, HY4 Preview는 이번 프리뷰에서 텍스트 전용이며 Tencent는 비전 기능이 정식 출시까지 기다려야 한다고 인정했습니다. GPT-5.6 Sol은 Ultra 모드를 탑재했습니다. 이는 3~4배의 토큰 비용으로 병렬 하위 에이전트를 조정하는 멀티 에이전트 구성으로, 두 모델이 실제로 경쟁하게 될 장기 엔지니어링 작업에 정확히 유용합니다. 또한 Sol의 컴퓨터 사용 및 프로그램적 도구 호출 경로는 문서화되어 있고, 프로덕션 규모에서 검증되었으며, 부하 테스트를 거쳤습니다. Tencent의 Toolathlon-Verified 주장이 재현된다면 도구 사용 격차를 줄일 수는 있지만, HY4 Preview가 시도조차 하지 않는 멀티모달 또는 멀티 에이전트 격차를 해소하지는 못합니다.
HY4 Preview가 진정으로 흥미로운 지점
벤치마크 극장은 제쳐 두고, 실제로 남는 것은 세 가지입니다. 첫째, 가격입니다. ¥6/¥18(약 $0.85/$2.50)로 Tencent는 출력 토큰 기준으로 모든 서양 프런티어 모델을 4~8배나 저렴하게 공급하며, 입력 토큰 기준으로는 자사의 중국 오픈웨이트 경쟁사들보다도 가격을 낮췄습니다. 둘째, 오픈웨이트입니다. 49B 활성 MoE는 단일 노드에 배포할 수 있는데, 이는 Sol의 비공개 아키텍처로는 절대 불가능한 일입니다. 또한 가중치는 이미 HuggingFace, ModelScope, GitHub에 공개되어 있습니다. 셋째, 컨텍스트와 엔지니어링 방향입니다. DeepSWE 64.3과 100만 이상의 컨텍스트 윈도우는 Sol의 Ultra 모드가 목표로 하는 것과 동일한 장기적 에이전트 작업 부하를 겨냥하고 있으며, 비용은 극히 일부에 불과합니다.
솔직히 말하자면, 이 중 어느 것도 독립적인 벤치마크 검증을 거치지 않았습니다. 텐센트가 주장하는 자기 최적화 스토리, 즉 모델이 자체 추론 스택을 반복 개선해 31.8%의 엔드투엔드 처리량 향상을 얻었다는 결과도 내부 측정에 불과합니다. GLM 5.3과 Kimi K3를 상대로 한 블라인드 테스트 우승도 내부적으로 진행된 것입니다. 오늘날 HY4 Preview에 관한 모든 흥미로운 점은 그저 주장일 뿐입니다.
결정
오늘날 프로덕션 시스템을 구축하고 있다면 GPT-5.6 Sol은 합리적인 선택이며, OrcaRouter를 통해 OpenAI 자체 계층형 가격표 그대로 — 기본 계층에서는 $4.00/$20.00, 그 이상 계층에서는 $8.00/$30.00 — 마크업 없이 이용할 수 있습니다. 따라서 공급업체의 가격 변동은 당일 저희 쪽에도 반영됩니다. 워크플로가 에이전트 기반이고 도구 사용이 많은 경우, 계층 구조상 균일 요금을 가정하기보다는 실제 입력 크기를 $272K 토큰 임계값과 대조해 확인해야 합니다.
섀도 평가를 수행할 의향이 있다면, HY4 Preview는 실제 평가를 해볼 만큼 충분히 저렴합니다. 오늘 Sol을 통해 도구 호출 워크로드를 라우팅하고, 동일한 프롬프트를 Tencent 자체 API를 통해 HY4 Preview에 실행하여 자체 Toolathlon 스타일 태스크에서 비교해 보세요. 독립 점수가 Tencent가 예상한 대로 나온다면 전환 경로는 짧습니다. 오픈 웨이트 모델을 라우터에 투입하고 장애 조치 규칙이 엔드포인트를 교체하면, 공급업체의 ¥6/¥18 요금이 그대로 적용됩니다. 이것이 이 맞대결의 정직한 구조입니다: 오늘 바로 구축할 수 있는 검증된 프론티어 모델과, 테스트할 만큼 저렴하고 가격 논의를 오픈 웨이트 클래스 전체로 이끌 수 있는 위치에 있는 검증되지 않은 오픈 챌린저의 대결입니다.


볼 것
• Toolathlon-Verified의 첫 번째 독립적 재현. 제3자 하네스가 HY4 Preview가 70점대임을 확인한다면, "오픈 가중치는 에이전트 도구 사용을 할 수 없다"는 주장은 무너진다.
• Tencent가 전체 Hy4 출시 전에 비전을 제공할지 여부. 텍스트 전용은 HY4 Preview를 GPT-5.6 Sol이 처리하는 작업의 엄격한 하위 집합으로 제한합니다.
• HY4 Preview의 장기 사고 경향으로 인한 실제 토큰 비용. 출력 100만 토큰당 ¥18에서, 장황한 자체 검증은 $20 모델보다 가격 이점을 더 빨리 잠식합니다.
• Sol의 단계별 가격이 Hy4가 정식 출시되기 전에 또 한 번 인하될지 여부. 라우터의 패스스루 덕분에 인하는 당일에 바로 확인된다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
