Claude Sonnet 5.5 vs Qwen 4 Max라는 제목과 한 모델에는 카드가 있고 다른 모델에는 이름만 있다는 부제가 달린 히어로 카드를 생성했습니다. 세 장의 카드에는 각각 Claude Sonnet 5.5 2026-09-28 출시, Qwen 4 Max 모델 카드 없이 발표됨, Qwen3.8 Max $2.00 / $6.00에 호출할 수 있는 Qwen이 적혀 있으며, 푸터에는 Qwen 4 Max가 2026-09-22에 발표되었으며 공개된 가격, 컨텍스트 윈도우, 가중치 또는 점수가 없다고 적혀 있습니다.
Guides & Insights

Claude Sonnet 5.5 vs Qwen 4 Max: 한 모델은 카드를 가졌고, 다른 모델은 이름을 가졌다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 제목의 두 절반은 같은 종류의 대상이 아니며, 그것이 독자가 가장 먼저 알아야 할 점이다. Claude Sonnet 5.5은 2026년 9월 28일에 출시되었다. API 식별자, 요금표, 컨텍스트 윈도, 공개된 지원 종료 기준선, 그리고 독립 리더보드상의 한 줄을 갖추고 있다. Q​wen 4 Max는 2026년 9월 22일 항저우에서 열린 윈치(Yunqi) 콘퍼런스에서 발표된 4개 모델 체제의 Q​wen 4 라인 가운데 플래그십으로서 미리 선보였다. 그리고 오늘 현재, 가격도, 컨텍스트 윈도도, 공개된 점수도, 모델 카드도, Artificial Analysis에서 열어볼 페이지도 없다. 그것은 스캔들이 아니다. 그것이 한 티어가 발표되는 방식이다. 하지만 그것은 유용한 비교의 모습을 바꾼다. 해볼 만한 비교는 가장 최근에 출시된 Sonnet과 오늘 실제로 호출할 수 있는 Q​wen 모델, 즉 Qwen3.8 Max 사이의 비교다. 왜냐하면 그쪽에는 요금표가 있고, 그 요금표는 시사하는 바가 있기 때문이다.

알리바바가 실제로 테이블 위에 올린 것

Qwen 4 Max는 제품이 아니라 라인업에 이름으로 등장했다. 컨퍼런스 프리뷰에서 Qwen 4 패밀리의 티어 구조를 소개했지만, 그 이후 그것에 대해 개발자가 계획을 세울 수 있는 사양으로 전환된 것은 아무것도 없다: 백만 토큰당 가격도, 윈도 크기도, 최대 출력도, 벤치마크 표도, Hugging Face 리포지토리도, 공급업체 자체 모델 목록의 항목도 없다. 그것이 폐쇄형 API 티어로 출시되는지, 오픈 웨이트로 출시되는지, 아니면 두 형태 모두로 출시되는지는 공급업체가 공개한 어디에도 명시되지 않았다. 티어가 그렇게 초기 단계라면, 한 기사가 그 사양에 대해 할 수 있는 유일하게 정직한 말은 사양이 없다는 것이다 — 그리고 지금 Qwen 4 Max 사양표를 내세우는 모든 페이지는 추정치를 찍어 내고 있는 것이다.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Qwen 4 Max, the scoreboard, with six matched rows. Claude Sonnet 5.5: released 2026-09-28, $2.00 input, $10.00 output, Intelligence Index 56, 1,000,000-token context window, closed weights. Qwen 4 Max: announced with no model card, input and output price not published, no score published, context window not published, weights not stated. A footer reads Qwen 4 Max was announced 2026-09-22 with no specification published; Claude Sonnet 5.5 figures per Artificial Analysis v4.3.2 and Anthropic.

그 발표가 유용하게 확립하는 단 한 가지는 방향성이다. A​libaba의 가장 최근 출시 플래그십인 Qwen3.8 Max는 벤더 자체의 마이그레이션 가이드에서 GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro에 직접 맞서도록 포지셔닝되어 있으며, 이는 Q​wen 4 Max가 대체하도록 개발 중인 등급이다. 따라서 후속 모델의 목표는 그 수치가 알려지지 않은 경우에도 가늠할 수 있고, 가격으로 이겨야 할 모델은 이미 판매 중인 모델이다.

오늘 호출할 수 있는 Qwen, 새로운 Sonnet에 맞춰 책정된 가격

Qwen3.8 Max는 2026년 8월 3일부터 정식 제공되어 왔습니다. 이는 A​libaba가 지금까지 내놓은 최고 성능 등급입니다: 텍스트, 이미지, 비디오 입력과 텍스트 출력을 갖춘 네이티브 멀티모달, 1,000,000토큰 창, 사고 모드, 함수 호출, 내장 도구, 구조화된 출력을 갖추고 있으며, Open​AI 호환, Anthro​pic 호환 및 네이티브 DashScope 엔드포인트를 통해 제공됩니다. A​libaba는 이 모델을, 해당 공급업체가 Claude Sonnet 5.5를 포지셔닝하는 것과 동일한 까다로운 다단계 분석 및 에이전트 작업용으로 포지셔닝하고 있으며, 두 모델은 거의 정확히 같은 대표 요금에 자리합니다 — 여기서 비교가 흥미로워집니다.

• 입력 가격 — Claude Sonnet 5.5 백만 개당 $2.00 vs Qwen3.8 Max 백만 개당 $2.00, 동일

• 출력 가격 — Claude Sonnet 5.5 백만당 $10.00 vs Qwen3.8 Max 백만당 $6.00

• 캐시 읽기 — Claude Sonnet 5.5 백만당 $0.20 vs Qwen3.8 Max 백만당 $0.25

• 캐시 쓰기 — Sonnet 5.5 백만 토큰당 $2.50 vs Qwen3.8 Max 백만 토큰당 $2.50

• 컨텍스트 — 공급업체 사양표 기준 Claude Sonnet 5.5 1,000,000 토큰 대 Qwen3.8 Max 1,000,000 토큰; Artificial Analysis는 자사가 측정한 스냅샷을 983,616으로 기록

• 최대 출력 — Claude Sonnet 5.5: 동기식 128,000, Batches에서 300,000 vs Qwen3.8 Max: 벤더 미공개

• 입력 방식 — Claude Sonnet 5.5 텍스트, 이미지, 파일 vs Qwen3.8 Max 텍스트, 이미지, 동영상

동일한 입력 요금과 40% 더 저렴한 출력 요금은 정말로 강력한 가격 포지션이며, 이것이 Qwen3.8 Max가 프런티어 모델과의 비교에서 계속 등장하는 이유입니다. 그런데 독립적인 측정치를 들여다보면, 그 이점은 완전히 다른 곳으로 이동합니다.

독립적인 수치가 말해주는 가격 우위

두 모델 모두 동일한 Artificial Analysis Intelligence Index, 리비전 v4.3.2에 기반하며, 두 모델 모두 추정치가 아닌 실측치입니다.

• 인텔리전스 지수 — Max Effort에서 Claude Sonnet 5.5 56 대 Qwen3.8 Max 45 (9월 2일 스냅샷 기준)

• Index 작업당 비용 — Claude Sonnet 5.5 $7.60 vs Qwen3.8 Max $5.41

• 출력 속도 — Claude Sonnet 5.5 138.7 토큰/초 vs Qwen3.8 Max 38.2 토큰/초

• 첫 청크까지 걸리는 시간 — Claude Sonnet 5.5는 Max Effort에서 370.8초, Qwen3.8 Max는 3.0초

• Index 전반에 걸쳐 생성된 출력 토큰 — Claude Sonnet 5.5 410M vs Qwen3.8 Max 190M, 이는 이사회가 중앙값 88M 대비 매우 장황하다고 지적하는 수치

• GPQA Diamond — Claude Sonnet 5.5는 현재 보드에 공개되지 않음 vs Qwen3.8 Max 92.8%

• Humanity's Last Exam — Claude Sonnet 5.5 55.0% vs Qwen3.8 Max 43.1%

• 장문맥 회상 — Claude Sonnet 5.5 82.7% vs Qwen3.8 Max 80.3%

두 가지가 눈에 띄는데, 어느 쪽도 가격은 아니다. 첫째는 출력 단가가 40% 더 저렴해도 토큰 수를 고려하면 작업 비용은 30% 더 저렴해지는 데 그친다는 점이다. Qwen3.8 Max는 인덱스 전체에 걸쳐 1억 9,000만 토큰을 출력하는 반면 Claude Sonnet 5.5는 4억 1,000만 토큰을 출력한다. 이는 더 간결하지만, 전체 단가 격차를 유지할 만큼 간결하지는 않다. 둘째는 속도이며, 여기서 방향은 크게 뒤집힌다. Claude Sonnet 5.5는 Qwen3.8 Max보다 출력을 3.6배 더 빠르게 생성하는데, 초당 138.7토큰 대 38.2토큰이다. 긴 생성 작업에서 이는 1분과 몇 분의 차이이며, 어떤 토큰당 할인으로도 메울 수 없는 차이다.

첫 토큰 수치는 반대 방향으로 작용하며, 그 주의점을 분명히 밝힐 만하다. 370.8초는 Claude Sonnet 5.5가 Max Effort와 기본 폴백으로 실행된 경우인데, 이는 답변 전에 매우 큰 사고 예산을 소비하는 추론 구성이다. 더 낮은 effort로 설정한 호출자는 몇 초 만에 첫 토큰을 얻는다. Qwen3.8 Max의 3.0초는 사고 동작이 다른 모델에서 측정된 값이다. 이 비교는 실제이지만, 이는 구성 간의 비교이지 벤더 간의 비교가 아니다.

Artificial Analysis model page for Qwen3.8 Max (0902), a proprietary model released September 2026, showing an Intelligence Index of 45, an output speed of 38.2 tokens per second, $2.00 per million input tokens and $6.00 per million output tokens, $5.41 per Intelligence Index task, 190M output tokens generated during the Index evaluation described as very verbose, and a 984k-token context window.

누락된 Sonnet 마이그레이션 비용은 어디에 귀착되는가

운영상의 차이 하나는 위의 어느 행에도 나타나지 않으며, 실제로 돌아가는 코드가 있는 사람에게는 가격 차이보다 더 중요합니다. Claude Sonnet 5는 Claude Sonnet 5 대비 여섯 가지 동작을 변경했으며, 그중 다섯 가지는 기존 통합을 깨뜨립니다: 기본값이 아닌 temperature top_p 및 top_k는 이제 400을 반환합니다; thinking: {"type": "disabled"}는 400을 반환하며 between_tools(으)로 바뀌어야 합니다. effort는 low, medium 또는 high로 제한됩니다; 강제 도구 선택: "any" 또는 이름이 지정된 도구는 거부되므로, auto로 전환해야 합니다. 이때 엄격한 도구 사용 또는 구조화된 출력을 사용해야 합니다; 해당 computer_20251124 컴퓨터 사용 도구는 Claude API와 Google Cloud에서 거부됩니다; 그리고 thinking 블록은 이제 이를 생성한 모델과 계정에 묶여 있으므로, 추론은 Sonnet 5에서 이어지지만 다른 패밀리로는 전달되지 않습니다. 여섯 번째 변경은 아무것도 실패시키지 않으므로, 깨진 상태로 출시하기 쉬운 변경입니다: 도구 호출 사이의 텍스트가 이제 thinking 블록 내부에서 반환되므로, 스트리밍 애플리케이션은 표시 값을 설정하거나 사전 thinking을 비활성화할 때까지 호출 사이에 조용해집니다.

Qwen3.8 Max는 Qwen 호출자에게 그런 것을 전혀 요구하지 않는다 — 전체 샘플링 표면과 표준 도구 호출 형태를 갖춘 OpenAI 호환 엔드포인트이며, Anthropic 호환 엔드포인트가 존재하는 이유는 바로 Claude에 맞춰 작성된 코드가 base-URL 변경만으로 그것을 가리킬 수 있게 하기 위해서다. 이미 Sonnet 5를 사용하는 팀에게 Sonnet 5.5로 이동하는 것은 확인할 다섯 가지 항목 목록이 있는 하루 분량의 마이그레이션 작업이고, Qwen3.8 Max로 이동하는 것은 API 형태보다 주로 동작 드리프트와 관련된, 서로 다른 위험 집합을 지닌 구성 변경이다.

도달 가능한 것을 같은 키에 올리기

2026년 9월 말의 현실적인 파이프라인은 이 중 하나를 선택하지 않는다. 에이전트 경로에는 Claude 모델을, 비디오 입력이나 가격이 중요한 곳에는 Qwen 모델을 실행한다. 그리고 그 구성의 비용은 일반적으로 두 개의 계약, 두 개의 키, 두 개의 속도 제한 표면, 그리고 요청이 실패할 수 있는 두 곳이다. OrcaRouter는 이를 200개 이상의 모델에 걸쳐 하나의 OpenAI 호환 엔드포인트로 축소하며, 공급자 정가가 그대로 전달되고 마크업이 추가되지 않는다. 따라서 어느 한쪽의 공급업체 요금 변경이 다음 갱신 때가 아니라 같은 날 여기에서 적용된다. 또한 업스트림 공급자 간의 자동 장애 조치와 여러 모델로 호출을 구성하기 위한 라우팅 DSL을 제공한다.

Qwen3.8 Max는 오늘 이곳에서 qwen/qwen3.8-max로 라우팅할 수 있으며, 1,000,000토큰 전체 윈도우에 걸쳐 Alibaba의 입력 $2.00, 출력 $6.00 요금이 적용됩니다. 그리고 Artificial Analysis가 측정한 9월 2일 스냅샷은 qwen/qwen3.8-max-0902로 접근할 수 있는데, 특정 점수가 산출된 바로 그 리비전이 필요할 때 쓸 수 있습니다. Qwen 4 Max도, 다른 어떤 Qwen 4 티어도 저희 카탈로그에는 없으며, Alibaba가 라우팅할 무언가를 공개하기 전까지는 어떤 Qwen 4 티어도 들어오지 않습니다. Claude Sonnet 5.5 역시 카탈로그에 없습니다 — 출시된 지 하루밖에 되지 않았고, 그 경로는 Anthropic 자체 API입니다. 그동안 Claude Sonnet 5는 여기에서 Anthropic의 $2.00 및 $10.00 요금으로 페일오버 대상으로 사용할 수 있습니다. Qwen3.8 Max는 이 카탈로그를 통해 주당 5,200만 토큰의 트래픽을 처리하고 Claude Sonnet 5는 790만 토큰을 처리하는데, 이것이 위 논거의 실질적인 형태입니다: Qwen 티어는 이름만 폴백이 아닙니다.

OrcaRouter model page for qwen/qwen3.8-max, dated 2026-08-03, showing text, image and video input, a 1M-token context window, $2.00 input and $6.00 output per million tokens, a p50 time to first token of 2.27 s, and 52.0M tokens of recent traffic.

발표된 티어에 대한 규칙

발표된 등급은 조달 옵션이 아니라 일정 계획 입력값으로 취급하십시오. Qwen 4 Max는 추적할 가치가 있습니다. 왜냐하면 Alibaba의 플래그십이 어디로 향하는지 알려주고, 결국 최상위 라인업에서 Qwen3.8 Max를 대체할 것이기 때문입니다. 하지만 이를 기준으로 계획할 가치는 없습니다. 계획할 대상이 아무것도 없기 때문입니다: 식별자도, 가격도, 윈도도, 가중치도, 측정된 점수도 없습니다. 이를 실체로 만들어 줄 증거는 구체적이고 알아보기 쉽습니다 — Alibaba 자체 모델 목록의 항목, 가격 행, 공개된 컨텍스트 윈도, 가중치가 공개된 경우 Hugging Face 저장소, 그리고 Artificial Analysis의 페이지입니다. 아무도 측정하지 않은 모델은 비교할 수 있는 모델이 아니기 때문입니다.

그때까지는 이미 존재하는 두 모델 중에서 결정을 내려야 한다. 당신의 작업이 에이전트형이라면, Index 17포인트와 3.6× 출력 속도가 바로 당신이 사는 것이고, Claude Sonnet 5.5의 더 높은 작업당 비용은 그에 대한 대가다. 당신의 작업이 비디오 입력을 받거나, Qwen 청구서로 네이티브 Anthrop​ic 호환 엔드포인트가 필요하거나, 단순히 $10 출력 요금을 정당화할 수 없다면, Qwen3.8 Max가 지금 같은 입력 가격에 출력은 40% 더 저렴하고 첫 토큰은 몇 초 만에 도착하는 조건으로 할인 중이다 — 그리고 솔직한 단서는 생성이 시작되면 느리게 느껴질 것이라는 점이며, 그것이 더 저렴한 요금이 사는 맞바꿈이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트