DeepSeek V4 Pro와 Qwen3.8 Max 비교를 위한 히어로 타이틀 카드, 부제: '추론 전문가 vs 중국의 올라운더'
Guides & Insights

DeepSeek V4 Pro vs Qwen3.8 Max: 추론 전문가 vs 중국의 만능형 모델

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

열흘 간격으로 중국에서 가장 주목받은 두 모델이 출시됐다: 알리바바가 출시한 Qwen3.8 Max는 2026년 8월 3일에 — 에이전트, 사무 업무, 멀티모달 이해를 위한 올라운더로 내세우는 2.4조 매개변수 스파스 MoE 플래그십 — 그리고 D​eepSeek가 출시한 공식 버전인 DeepSeek V4 Pro는 8월 12일에, 1.6T 총 매개변수와 출력 토큰 기준 Q​wen의 약 7분의 1 가격을 가진 추론 및 코딩 특화 모델이다. 두 모델은 같은 개발자 지갑을 노리지만 플래그십의 용도에 대해서는 의견이 다르다. Qwen3.8 Max는 모든 것을 라우팅하는 하나의 모델이 되기를 원하고, DeepSeek V4 Pro는 어려운 작업을 에스컬레이션하는 하나의 모델이 되기를 원한다.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

주요 시사점

• Qwen3.8 Max는 중국 일반 리더보드에서 더 높은 원시 성능을 자랑하는 모델(SuperCLUE 1위, 7월)이자, 더 강력한 멀티모달/엔터프라이즈 패키지입니다 — 비디오 입력, 내장 도구, 구조화된 출력이 모두 하나의 API에 담겨 있습니다.

• DeepSeek V4 Pro는 출력 비용이 약 7배 정도 훨씬 저렴하고, 이미 오픈 가중치 모델이며, 이제 더 높은 코딩/에이전트 성능 지표를 보유하고 있습니다 — Terminal-Bench 2.1에서 87.9로, Q​wen의 벤더 보고 수치 86.6과 대비됩니다.

• 장황함 비용에 주목하세요: 독립 실행 결과 Qwen3.8 Max는 에이전트 작업당 평균 약 64턴과 약 $1.14를 기록했습니다 — 사양서가 숨기고 있는 실질 비용 문제입니다.

• 솔직한 헤드라인: Qwen3.8 Max는 미국 폐쇄형 모델 가격에 맞먹는 '성능 전쟁' 플래그십이고, DeepSeek V4 Pro는 가성비로 맞서는 반박이다.

하나의 스펙 테이블에 담긴 두 가지 철학

• 총 파라미터 — Qwen3.8 Max 2.4T (희소 MoE, ~95B 활성) vs DeepSeek V4 Pro 1.6T (MoE, ~49B 활성)

• 컨텍스트 / 최대 출력 — 둘 다 1M 컨텍스트; Q​wen은 약 128–131K 출력에서 상한을 두는 반면, D​eepSeek은 384K

• 입력 — Q​wen은 텍스트, 이미지, 비디오를 지원하며, DeepSeek V4 Pro는 텍스트와 이미지를 지원하고 공식 빌드에는 새로운 네이티브 이미지 추론이 포함되어 있습니다.

• 오픈 가중치 — DeepSeek V4 Pro: 출시됨 (MIT); Qwen3.8 Max: 8월 10일 주에 공개 예정, 오픈소스로 공개될 최초의 Max급 Q​wen

• API 추가 기능 — Q​wen은 기본 제공 도구와 구조화된 출력을 기본 제공하며, DeepSeek V4 Pro는 추론 토글, 구조화된 JSON, Responses API, Codex 호환성을 기본 제공합니다.

• 가격 — Qwen3.8 Max: 백만 토큰당 $2.00 / $6.00(캐시 $0.25) vs DeepSeek V4 Pro: 약 $0.42 / $0.87(캐시 $0.0035)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Qwen3.8 Max가 강점을 보이는 분야

일반ist(범용) 축에서 Qwen3.8 Max가 앞서 있으며, 독립 데이터도 이를 뒷받침합니다. Artificial Analysis는 이 모델의 지능 지수(Intelligence Index)를 58, 코딩 지수(Coding Index)를 71.8, 에이전트 지수(Agentic Index)를 58로 평가했습니다 — 이는 중국 연구소가 해당 에이전트 리더보드 최상위에 가장 근접한 기록입니다. SuperCLUE의 7월 중국어 랭킹에서는 71.48점으로 1위를 차지했으며, DeepSeek-V4-Pro는 64.4점으로 5위에 올랐습니다. 알리바바의 출시 데모 — 16일간의 자율 코딩 실행, 원본 논문의 AIME24 결과를 능가한 논문 재현 — 는 이번 릴리스 전체에서 이 모델이 진정으로 유능한 장기 지평(long-horizon) 에이전트라는 가장 강력한 증거입니다.

빌더에게 실질적인 강점은 통합의 형태로 나타납니다: 비디오 입력, 내장형 도구 호출, 별도 설정 없이 가능한 구조화된 출력, 그리고 D​eepSeek이 맞추려 하지 않는 생태계(Model Studio, Q​wen 툴체인)입니다. 워크로드가 문서 중심이거나, 멀티모달이거나, 엔터프라이즈 통합 스토리가 필요하다면, 현재 중국 시장이 기본으로 선택하는 모델은 Qwen3.8 Max입니다.

DeepSeek V4 Pro가 뛰어난 점

코딩과 비용 측면에서, 공식 V4 Pro는 반박이다. D​eepSeek에 따르면 공식 빌드는 Terminal-Bench 2.1에서 87.9(프리뷰의 72.1에서 상승), DeepSWE에서 62.7을 기록했다. 반면 Q​wen은 벤더 보고로 Terminal-Bench 86.6을 기록했다. 프리뷰는 이미 SWE-bench Verified 80.6, GPQA Diamond 90.1, LiveCodeBench 93.5를 보유했으며, 이는 오픈 모델 경쟁 프로그래밍 점수 중 1위였다. 공식 빌드의 변경은 정확히 그러한 수치들이 나오는 에이전트 및 추론 작업에 집중되어 있다.

다음으로 가격이 있습니다. 백만 토큰당 $0.42/$0.87인 DeepSeek V4 Pro는 Qwen3.8 Max의 $2/$6보다 입력이 약 4.8배, 출력이 약 6.9배 더 저렴합니다. D​eepSeek는 또한 8월 6일에 가격 인상이 예정되어 있다고 밝혔으며, 이는 오늘의 요금이 약속이 아니라 기회의 창임을 의미합니다 — 자세한 내용은 아래에서 다루겠습니다.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

실제 에이전트 작업에 대해 계산해 보세요.

독립적인 에이전트 실행에서는 Q​wen의 표시 가격이 실제 가격이 아니게 됩니다. Artificial Analysis의 에이전트 작업에서 Qwen3.8 Max는 작업당 평균 약 64턴을 사용하고 작업당 약 $1.14의 비용이 들었으며, 이전 세대는 약 $0.53였습니다. 즉, 이 모델은 장황하고 계획을 많이 세웁니다. 동일한 작업 형태를 DeepSeek V4 Pro에서 출력 100만 토큰당 $0.87로 실행하면 작업당 비용은 대략 한 자릿수 더 낮아집니다. 제품이 사용자당 하루에 모델을 백 번 호출하는 루프라면, 그 차이가 마진입니다.

양측의 신뢰성 주의사항

여기서 소싱 정직성은 양방향으로 적용됩니다. 독립 테스트에서는 Qwen3.8 Max의 환각률이 23%에서 40%로 상승하고 AA-Omniscience 점수가 10포인트 하락한 것으로 드러났습니다. 이는 같은 릴리스에서 모델이 더 강력해졌지만 신뢰도는 낮아졌다는 뜻입니다. D​eepSeek의 프리뷰는 AA-Omniscience에서 94%의 문서화된 항상-응답률을 보였는데, 이는 답을 아는지 여부와 관계없이 답변을 생성하는 경향을 의미합니다. 두 지표 모두 프로덕션에 중요하지만, 이들 모델이 대상으로 하는 워크로드에 결격 사유가 되지는 않습니다.

오픈 가중치 공개 시점이 가격 계산을 바꾸는 이유

Qwen3.8 Max의 오픈 웨이트 출시가 실제로 이뤄지면, 이 대결 구도의 경제성은 일주일 안에 바뀔 것입니다. 셀프 호스터들은 2.4T 플래그십을 얻게 되고, API 가격 압박은 실질적으로 체감될 것입니다. 바로 이러한 시나리오에서 패스스루 가격 책정 모델이 정직함을 유지하게 해줍니다. OrcaRouter는 제공업체의 공시 가격을 마크업 없이 그대로 전달하므로, Alibaba나 D​eepSeek이 가격을 올리든 내리든 그 변경 사항은 같은 날 하나의 키에 즉시 반영되며, 재협상도 필요 없고 읽어야 할 두 번째 계약서도 없습니다. 현재 평가가 선호하는 Qwen3.8 Max 또는 DeepSeek V4 Pro 중 어느 쪽으로든 라우팅하면, 가격은 공급업체가 실제로 청구하는 그대로 유지됩니다.

API 빌더 결정에는 어느 것이 좋을까요?

작업이 전면적인 처리를 필요로 할 때 — 멀티모달 입력, 구조화된 출력, 내장 도구, 현재 최고 순위의 중국어 품질 — 그리고 비용 모델이 장황한 에이전트 실행을 허용한다면 Qwen3.8 Max를 선택하세요. 추론이나 코딩이 많은 작업, 높은 토큰 볼륨, 규정 준수나 자체 호스팅을 위해 오픈 가중치가 중요한 경우, 또는 예산이 제약 조건이라면 DeepSeek V4 Pro를 선택하세요. 이 대결에 대한 가장 명확한 해석은 두 회사가 직접 시사하는 바입니다: Qwen3.8 Max는 모든 것을 측정하는 플래그십이고, DeepSeek V4 Pro는 벤치마크가 비싸 보이게 만드는 제품입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube