"Qwen 4 Max vs DeepSeek V4 Pro"를 위한 히어로 타이틀 카드로, 부제는 "950억 개의 활성 파라미터 대 490억 개"이며, 세 개의 알약형 배지에는 각각 "$2.00 및 $6.00", "$0.66 및 $1.98", "25분의 1 대 33분의 1"이라고 적혀 있고, 하단 줄에는 "Alibaba는 2026년 9월 22일에 발표했고, DeepSeek는 2026년 4월 24일에 공개했습니다"라고 적혀 있으며, 오른쪽 아래 모서리에는 OrcaRouter 로고가 있습니다.
Engineering & Research

Qwen 4 Max vs DeepSeek V4 Pro: 활성 파라미터 950억 개 대 490억 개

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 22일 윈치 콘퍼런스에서의 Qwen 4 Max 발표는 업계에 이름과 등급 체계만을 줬을 뿐 — 가중치도, 가격도, 컨텍스트 윈도우도, 날짜도 없었다. DeepSeek V4 Pro는 2026년 4월 24일부터 1.6조 파라미터 규모의 전문가 혼합 모델로서, 토큰당 490억 개 파라미터가 활성화되고, 100만 토큰 컨텍스트를 가지며, 오프피크 가격이 입력 토큰 100만 개당 0.66달러, 출력 토큰 100만 개당 1.98달러인 것으로 등재되어 있다. 나란히 놓고 볼 만한 숫자는 총 파라미터 수가 아니라 활성 파라미터 수다: 마지막으로 공개된 Qwen3.8-Max는 토큰당 950억 개 파라미터를 활성화하는데, 이는 DeepSeek V4 Pro가 실행하는 490억 개 활성 파라미터의 약 두 배다. 그리고 그 수치 하나가 벤치마크를 단 하나도 참조하기 전에 두 연구소 간의 세 배 가격 격차 대부분을 설명한다.

희소성에 대한 두 가지 다른 베팅

두 연구소 모두 희소 전문가 혼합(mixture-of-experts) 모델을 만든다. 다만 얼마나 희소해야 하는지를 두고는 날카롭게 의견이 갈린다. Qwen3.8-Max — 현재 출시된 Qwen의 플래그십이자 Qwen 4 Max가 어떤 모습일지 가늠할 수 있는 유일한 구체적 기준점 — 는 토큰당 950억 개의 파라미터를 활성화하는 2.4조 파라미터 모델로, 비율은 대략 25분의 1이다. DeepSeek V4 Pro는 490억 개를 활성화하는 1.6조 파라미터 모델로, 비율은 대략 33분의 1이며, 전문가 가중치를 FP4로 저장하고 어텐션, 라우터, 노름(norm) 계층은 FP8로 남겨두어 토큰당 연산량을 다시 한번 끌어내린다.

그것들은 튜닝 차이가 아니다. 그것들은 같은 질문 — 프런티어 모델이 토큰당 얼마를 지출해야 하는가 — 에 대한 두 가지 서로 다른 답이다:

• 총 파라미터 — Qwen 3.8 플래그십 2.4T 대 DeepSeek V4 Pro 1.6T

• 토큰당 활성 — Qwen 3.8 플래그십 95B 대 DeepSeek V4 Pro 49B

• 활성화 비율 — 대략 25분의 1 대 약 33분의 1

• 입력 가격, 오프피크 — Qwen3.8-Max 100만 토큰당 $2.00 대비 DeepSeek V4 Pro 100만 토큰당 $0.66

• 출력 가격, 오프피크 기준 — Qwen3.8-Max 1M당 $6.00 대비 DeepSeek V4 Pro 1M당 $1.98

• 플래그십 가중치 — 사용자 정의 Qwen 라이선스에 따른 Qwen 3.8 플래그십 대 MIT로 공개된 DeepSeek V4 Pro

• 컨텍스트 — Qwen3.8-Max 1M 토큰 대 DeepSeek V4 Pro 1M 토큰

• 모달리티 — Qwen3.8-Max는 텍스트, 이미지, 비디오 입력을 지원하는 반면, DeepSeek V4 Pro는 자사 목록 기준 텍스트 전용

• 관측된 지연 시간 — 동일한 카탈로그에서 Qwen3.8-Max의 p50 첫 토큰까지 걸리는 시간 3.29초 대 DeepSeek V4 Pro 3.52초

이번에는 희소성 차이와 가격 차이가 같은 방향을 가리키는데, 이는 총 매개변수 수가 시사하는 방향이 아니다. Qwen은 DeepSeek보다 토큰당 약 두 배 많은 매개변수를 활성화하고 가격은 약 세 배를 받으며, 희소성만으로는 그 격차를 좁히지 못한다. 나머지 격차를 좁히는 것은 모달리티다. Qwen의 플래그십은 비전과 비디오 인코더를 탑재하고 있으며, 이미지가 포함되어 있든 아니든 모든 요청에서 그 비용을 지불한다. 그래서 입력 단가가 그 수준에 머문다. DeepSeek V4 Pro는 텍스트를 받아 텍스트를 반환하며, 그 일만 하는 모델처럼 가격이 책정되어 있다.

DeepSeek 열에는 이를 어디에 사용하기 전에 꼭 붙여야 할 단서가 하나 있습니다. DeepSeek는 피크·비피크 요금제로 가격을 책정합니다: $0.66과 $1.98 수치는 비피크 요율이며, 피크 시간대 — 평일 01:00~04:00 및 06:00~10:00 UTC, 중국 공휴일 제외 — 에는 동일 모델이 입력 $1.32, 출력 $3.96으로 청구됩니다. 그 외 모든 경우, 모든 주말과 공휴일을 포함해, 비피크입니다. 따라서 지불하는 요율은 트래픽이 언제 실행되는지에 따라 결정되며, 비피크 수치만으로 구축한 비용 모델은 평일 오전 구성 요소가 있는 모든 워크로드에 대해 틀릴 것입니다.

A two-column scoreboard titled "Qwen 4 Max vs DeepSeek V4 Pro - the scoreboard". Left column Qwen 4 Max: Total parameters 2.4T, Active per token 95B, Input price off-peak $2.00 per 1M tokens, Output price off-peak $6.00 per 1M tokens, Context window 1M tokens, Modality text, image, video in. Right column DeepSeek V4 Pro: Total parameters 1.6T, Active per token 49B, Input price off-peak $0.66 per 1M tokens, Output price off-peak $1.98 per 1M tokens, Context window 1M tokens, Modality text-only. Footer reading "DeepSeek V4 Pro figures from its catalogue listing; Qwen figures from the Qwen3.8-Max model card, September 22 2026.", with the OrcaRouter logo bottom-right.

Qwen 4 Max 열은 비어 있으며, 이는 일시적인 상태가 아닙니다.

Qwen 4 Max가 Qwen 3.8의 수치에 근접하고 그보다 낮은 가격에 출시될 것이라는 가정으로 이 비교를 채워 넣고 싶은 유혹이 든다. 그 유혹을 물리쳐라. Alibaba는 Qwen 4 아키텍처를 새로운 세대라고 설명했고, 훈련 중이라고 밝혔다. 그 아키텍처를 설명하는 유일하게 공개된 결과물은 2026년 8월 말 오픈소스로 공개된 Qwen3.8-Flash-Next이며, 자체 모델 카드에 Qwen 4 설계의 프리뷰라고 표기되어 있다. 이는 1,250억 개 파라미터의 메인 모델로, 510억 개 파라미터의 N-gram 임베딩이 단계당 약 60억 개를 활성화하며, QSA 희소 어텐션, 게이티드 레지듀얼, 100만 토큰까지 확장 가능한 262,000토큰 네이티브 컨텍스트를 갖추고 있다.

그 설계가 Max 티어까지 확장된다면, 활성 파라미터 수는 DeepSeek의 전체 규모를 향해 늘어나기보다 수백억 단위에 머물러야 한다 — 전체 파라미터가 커져도 스텝당 연산량을 대략 일정하게 유지하는 것이 QSA와, 밀집 계산이 아니라 조회되는 N-gram 임베딩의 핵심이다. 그것은 명세가 아니라 방향이며, 명세인 것처럼 인쇄되어서는 안 된다.

지금 알 수 있는 것은 운영상의 비대칭성이다. 존재하는 모델은 당신의 워크로드에서 측정할 수 있지만, 존재하지 않는 모델은 무엇으로도 측정할 수 없다. Qwen 4 Max는 출시되면 공급업체 자체 API와 여러 서드파티 플랫폼을 통해 접근할 수 있다 — 모든 Alibaba 플래그십이 걸어온 것과 같은 경로다. 오늘날 OrcaRouter에는 없다: 카탈로그에 Qwen 4 제품군에 대한 항목이 하나도 없다. DeepSeek V4 Pro는 지금 OrcaRouter에 있고, 그 특정 시점의 스냅샷도 마찬가지다.

재현성은 아무도 하지 않는 주장이다.

DeepSeek는 날짜가 지정된 스냅샷을 제공하고, 이를 계속 참조 가능하게 유지합니다. 카탈로그에는 유동적인 DeepSeek V4 Pro 식별자와 고정된 2026-08-13 변형이 모두 포함되어 있습니다 — 그 날짜는 DeepSeek 자체가 일반 가용성 릴리스로 지정한 빌드입니다. 이는 화려하지 않지만, 평가 하네스나 규정 준수 통제 파이프라인을 운영하는 사람에게는 벤치마크 차이보다 더 중요합니다: 스냅샷을 고정하면, 회귀 스위트는 공급업체의 릴리스 주기가 아니라 여러분의 코드를 측정하게 됩니다.

Qwen 3.8 세대도 같은 일을 했습니다 — 같은 카탈로그에 떠다니는 이름과 나란히 날짜가 박힌 Qwen3.8-Max 스냅샷이 있으며 — 알리바바가 멈출 것이라고 생각할 이유는 없습니다. 하지만 이는 출시된 모델의 속성이며, Qwen 4 Max가 발표되는 날에는 고정할 스냅샷도, 테스트할 안정적인 식별자도, 자체 데이터로 전후 비교를 실행할 방법도 없을 것이라고 분명히 말해 둘 가치가 있습니다. 어떤 비교를 하고 싶든, 그 비교는 나중에 하게 될 것입니다.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, English UI), showing the FLAGSHIP badge, the 1M token context badge, the model ID deepseek/deepseek-v4-pro, a 384K maximum output, text input, the Tools, JSON and Reasoning tags, the listing date 2026-04-24 credited to DeepSeek, a p50 time-to-first-token of 3.52s, the OpenAI-compatible code samples against api.orcarouter.ai/v1, and the opening of the model description describing a 1.6T total / 49B active flagship MoE with 1M context and top-tier reasoning and agentic tool use.

두 스택을 실행하지 않고 둘 다 실행하기

OrcaRouter는 DeepSeek V4 Pro를 deepseek/deepseek-v4-pro로 라우팅합니다 백만 토큰당 입력 $0.66, 출력 $1.98이며, 이는 DeepSeek 자체의 비피크(off-peak) 정가를 0% 마진으로 그대로 전달한 가격입니다. 이 마지막 부분은 이 배치의 다른 어느 곳보다 여기서 더 중요합니다. 출력 $1.98은 이미 최전선급 모델의 하한선에 가깝기 때문에, 플랫폼 마진이 10%만 붙어도 이 모델과 중급 대안 사이의 차액의 5분의 1에 해당하며, 0% 마진에서는 페이지에 보이는 요율이 곧 DeepSeek이 공표한 요율입니다 — 피크와 비피크 구분까지 포함해, 평균을 내어 단일 요율로 만들지 않고 동일한 일정대로 그대로 전달됩니다.

같은 엔드포인트가 Qwen 3.8 패밀리를 제공합니다 — Qwen3.8-Max, Qwen3.8-Flash, Qwen3.8-27B가 DeepSeek V4 Pro와 나란히, 약 200개에 가까운 모델을 갖춘 하나의 OpenAI 호환 API 위에 있습니다. 제공자 경로가 저하될 때 자동 페일오버가 작동하고, 선택을 하드코딩하기보다 명시적으로 지정할 수 있게 해 주는 라우팅 DSL도 함께 제공됩니다. DeepSeek이 요율을 인하하면 그 변경은 같은 날 당신의 키에 반영됩니다. 인하가 걸려 막힐 중간 마진 계층이 없기 때문입니다. Qwen 4 등급이 출시되면, 바로 그 동일한 카탈로그가 그것이 등장할 자리입니다.

이 상황이 당신에게 의미하는 바

DeepSeek V4 Pro는 이 비교에서 부전승으로 이긴다. 그리고 그 이유를 포장하기보다 정확히 짚을 가치가 있다. 그것은 두 축 모두에서 약 3배 더 저렴하고, 토큰당 5배 더 많은 파라미터를 활성화하며, 컨텍스트 윈도도 맞먹고, 고정할 수 있는 날짜가 명시된 스냅샷이 있다. Qwen 4 Max에는 티어 이름과 컨퍼런스 발표 슬롯이 있다.

실제로 현재 진행 중인 비교는 DeepSeek V4 Pro 대 Qwen3.8-Max이며, 이는 일방적인 완패가 아니라 진짜 맞대결이다. DeepSeek은 가격이 약 3분의 1 수준인 텍스트 전용 모델로, MIT 아래 공개된 가중치와 더 간소한 토큰당 활성화 프로필을 갖추고 있고, Qwen의 플래그십은 이미지 및 비디오 입력을 $2.00와 $6.00에 받는다. 파라미터 수가 아니라 모달리티와 완료된 작업당 측정된 비용을 기준으로 선택하고, Alibaba가 모델 카드를 공개하면 비교를 다시 실행하라. 그 시점의 흥미로운 질문은 Qwen 4 Max가 멀티모달 능력에 DeepSeek의 텍스트 요율보다 더 높은 가격을 매기는 폭이 오늘보다 작은지일 것이다.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, and the model description naming Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트