
Tencent HY4 Preview vs Qwen3.8-Max: 8월의 오픈 웨이트 대결
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
Tencent HY4 Preview 대 Qwen3.8-Max는 이번 달이 준비해 오던 충돌입니다. {{1}}Alibaba의 Qwen3.8-Max는 8월 3일에 일반 공개(GA)를 시작했고, 8월 12일에는 오픈 웨이트를 갖춘 최초의 Max급 Qwen이 되었습니다. 25일 후인 오늘 아침, Tencent HY4 Preview는 Qwen3.8-Max를 직접 거론한 출시 카드와 함께 등장했습니다 — Tencent는 Toolathlon-Verified에서 HY4 Preview가 74.1점을 기록하여 해당 벤치마크에서 Qwen3.8-Max보다 앞선다고 밝혔습니다.{{/1}} {{2}}둘 다 오픈 웨이트를 갖춘 중국 플래그십이며, 둘 다 판매를 겨냥한 가격으로 책정되었고, 독립적인 평가 점수를 보유한 것은 단 하나뿐입니다.{{/2}}
두 모델은 단순한 규모 차이 이상으로 갈라져 있습니다. Qwen3.8-Max는 2.4조 개의 파라미터를 가진 반면, HY4 Preview는 7,700억 개입니다. 하지만 구매자에게 중요한 에이전트 벤치마크에서는 둘 다 같은 목표를 겨냥합니다. 바로 모델이 인간의 개입 없이 읽고, 도구를 호출하고, 반복하는 장기(long-horizon) 작업입니다. 이것이 바로 8월 오픈 가중치 세대가 폐쇄형 프런티어 모델을 대체할 수 있음을 증명하려는 영역이며, Tencent의 첫 번째 행보는 이번 달 가장 큰 오픈 릴리즈를 공략한 것이었습니다.
점수판

• 규모 — HY4 Preview 총 770B / 활성 49B vs Qwen3.8-Max 총 2.4T / 활성 약 95B
• 컨텍스트 — API 기준 HY4 Preview는 1M 토큰 이상, Qwen3.8-Max는 1M 토큰 (오픈 가중치 기본 262K, ~1.01M까지 확장 가능)
• 1M당 가격 — HY4 Preview 입력 ¥6 / 출력 ¥18 (≈$0.85 / $2.50) vs Qwen3.8-Max 입력 $2.00 / 출력 $6.00, 캐시 읽기 $0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (벤더 보고) 대 Qwen3.8-Max 86.6
• 모달리티 — 오픈 가중치 형태에서는 둘 다 텍스트 전용입니다. Qwen3.8-Max API는 이미지 및 비디오 입력을 지원하지만, HY4 Preview는 지원하지 않습니다.
• 독립 점수 — HY4 Preview 없음 vs Qwen3.8-Max AA 지능 지수 58, 에이전틱 지수 58
두 카드는 같은 이야기를 반대편에서 전합니다. Terminal-Bench 2.1에서 Qwen3.8-Max의 86.6과 HY4 Preview의 85.4는 1.5포인트 차이입니다 — Qwen 쪽으로 1포인트 유리하며, HY4 수치는 검증되지 않았습니다. 가격 면에서 HY4 Preview는 토큰당 입력과 출력 모두 더 저렴합니다. 검증 면에서 Qwen3.8-Max는 독립적인 Intelligence Index 58과 Agentic Index 58을 보유한 반면, HY4 Preview는 자체 보도자료 외에는 아무것도 없습니다. 이러한 격차는 더 나은 가격과 입증되지 않은 주장을 앞세운 도전자가 검증된 기존 업체에 맞서는 전형적인 패턴입니다.
Toolathlon 주장 읽기
Toolathlon-Verified는 에이전트형 도구 사용 신뢰도, 즉 모델이 오류·복구·다단계 호출을 포함한 전체 작업을 도구와 함께 얼마나 일관되게 수행하는지를 측정합니다. Tencent의 74.1은 Qwen3.8-Max 프로필에서 가장 강력한 부분을 정조준한 것입니다. Qwen의 Agentic Index 58과 OSWorld-Verified 86.1이 바로 Alibaba의 에이전트 주장을 그럴듯하게 만든 수치이기 때문입니다. Qwen3.8-Max는 또한 IFBench(지시 수행)에서 82.8, PaperBench(연구급 에이전트 작업)에서 93.0을 기록하며, 두 항목 모두 공급업체 자체 표에서 GPT-5.6 Sol 같은 모델을 앞섰습니다. 그래서 Tencent는 이달 최대 오픈 모델을 상대로 직접적인 승리를 주장할 수 있는 단 하나의 벤치마크를 선택했습니다. 그리고 그 주장은 현재 여타 단일 공급업체 기록과 마찬가지로 전혀 검증할 수 없습니다.
검증 vs 공급업체 보고
이 축은 매치업이 가장 불공평한 지점이며, 그 비대칭성은 분명히 언급할 가치가 있습니다. Qwen3.8-Max의 Intelligence Index 58은 Artificial Analysis에서, Agentic Index 58도 Artificial Analysis에서 비롯되었습니다. 그 점수를 부여한 동일한 독립 평가 하네스는 약점도 함께 측정했습니다. AA-Omniscience에서 환각률 40% — 이전 세대의 23%에서 상승했습니다 — 그리고 작업당 무려 64회의 에이전틱 턴이 발생합니다. 모델이 열심히 작동하지만, 매 턴마다 비용을 지불해야 합니다. Tencent HY4 Preview에는 그러한 계측 수단이 전혀 없습니다. 그 강점은 주장일 뿐이며, 실패 모드 — Tencent 스스로도 긴 사고와 과도한 자기 검증을 지적합니다 — 는 측정이 아니라 인정에 불과합니다.
둘 중 하나를 선택하려는 팀에게 검증 격차는 추상적이지 않습니다. Qwen3.8-Max의 작업당 64턴 동작은 실제로 측정된 비용 요인입니다. $2/$6 가격에서도 일부 타사 비교에서 완료된 작업당 가장 비싼 에이전트로 남아 있으며, 팀들은 턴 수가 가격 우위를 잠식한다고 보고했습니다. HY4 Preview의 동등한 동작은 알려져 있지 않습니다. 이미 낮은 토큰당 가격이 시사하는 것보다 작업당 더 저렴할 수도 있고, 자체 검증 습관이 그 차이를 잡아먹을 수도 있습니다. 아직 어느 쪽인지 말해 줄 수 있는 사람은 없습니다. 텐센트 외부에서는 아무도 실행해 보지 않았기 때문입니다.
가격과 오픈 가중치의 실용성
토큰당 기준으로 HY4 Preview는 입력과 출력 양쪽 모두에서 더 저렴합니다. Qwen3.8-Max의 $2.00/$6.00에 비해 ¥6/¥18이고, 캐시 적중은 $0.25에 비해 ¥0.3입니다. 따라서 HY4 Preview는 입력 또는 출력 어느 쪽에서든 가장 저렴한 오픈 가중치 플래그십 모델입니다. 그렇지만 '오픈 가중치'에는 두 가지 다른 세부 조항이 따릅니다. Qwen3.8-Max의 오픈 가중치 릴리스인 Qwen3.8-2.4T-A95B는 텍스트 전용이며 추론이 강제되고, 기본 컨텍스트가 API의 1M이 아닌 262K이며, 규모별 조건이 있는 맞춤형 라이선스를 사용합니다. 월 활성 사용자 1억 명 이상일 때 모델 이름 표시 요구사항, 그리고 대규모 Model-as-a-Service 사업을 위한 별도 라이선스가 그것입니다. Tencent HY4 Preview의 가중치는 오늘 아침 기준으로 HuggingFace, ModelScope, GitHub에 올라와 있지만, 정확한 라이선스 조건과 가중치가 제공되는 API와 일치하는지 여부는 그런 식으로 명확하게 밝혀지지 않았습니다. 두 모델 모두 다운로드할 수 있지만, 어느 쪽도 바로 적용하기는 까다롭습니다.
요점
Qwen3.8-Max는 검증이 안전을 확보해 주는 모든 측면에서 더 안전한 선택입니다: {{1}}지능과 에이전트 작업에 대한 독립적 평가, 알려진 실패 모드, 확정된 라이선스, 그리고 3주간의 프로덕션 피드백{{/1}}. 또한 토큰당 비용이 더 높은 선택이며, 측정된 턴-헤비(turn-heavy) 동작은 알려진 비용 위험입니다. {{2}}Tencent HY4 Preview는 가성비 선택지입니다{{/2}}: {{3}}입력과 출력 모두에서 더 저렴하고, 유사한 Terminal-Bench 수치를 주장하며, Qwen에 대한 직접적인 Toolathlon-Verified 주장이 있습니다 — 그러나 출시 첫날에는 모두 검증되지 않았습니다{{/3}}. 이번 주에 오픈웨이트 모델을 프로덕션에 투입한다면, Qwen3.8-Max는 {{4}}방어 가능한 선택{{/4}}이며 OrcaRouter에서 Alibaba의 공시 가격 — {{5}}$2.00/$6.00, 마크업 없이 전가된 가격{{/5}}으로 제공됩니다. HY4 Preview는 평가용 프로젝트입니다: Tencent 자체 API를 통해 자신만의 Toolathlon 스타일 작업에 대해 실행해 보고, {{6}}프로덕션 경로는 검증된 모델에 유지하십시오{{/6}}. 독립적인 점수가 발표되거나 — HY4 Preview가 라우터에 도달하여 ¥6/¥18 요금이 당일 전가되면 — {{7}}교체는 재작성이 아닌 라우팅 규칙일 뿐입니다{{/7}}.


볼 것
• 에이전트 하네스에서 HY4 Preview의 첫 번째 독립 실행. Toolathlon-Verified 74.1은 텐센트가 획득하고 싶어하는 수치이며, 제3자 Agentic Index가 그 확인이 될 것이다.
• HY4 Preview의 측정된 턴 수. Qwen3.8-Max의 작업당 64턴은 경고의 교훈입니다. HY4 Preview가 완료된 작업당 더 저렴한지 여부가 전체 경제적 논쟁입니다.
• 가중치에 대한 라이선스 조건. 이 라이선스 조건들은 Qwen3.8-Max 라이선스 조건이 Alibaba의 모델에 대해 그랬던 것처럼, HY4 Preview에서 "오픈"이 "당신의 규모에서 사용 가능"을 의미하는지 여부를 결정할 것이다.
• 두 공급업체 중 어느 쪽이 다시 가격을 인하하는지 여부. 두 개의 오픈 가중치 플래그십이 공격적인 가격으로 출시된 달에는, 라우터의 가격 전가로 인해 추가 인하가 당일 바로 확인된다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
