Claude Sonnet 5.5 vs Qwen3.8 Max라는 제목의 히어로 카드, 부제는 "6주, 두 등급, 비용에 대한 하나의 결론", 알약 배지는 입력 $2 동일, 출력 $10 vs $6, Index 56 vs 45, 푸터는 Artificial Analysis v4.3.2와 벤더 가격을 인용.
Guides & Insights

Claude Sonnet 5.5 vs Qwen3.8 Max: 6주, 두 개의 티어, 비용에 대한 하나의 판정

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

세 가지 프롬프트로 계산을 돌려보면, 벤치마크에 이르기도 전에 비교가 대부분 판가름 난다. 짧은 지원 응답 호출: 입력 토큰 2,000개, 출력 500개. Qwen3.8 Max에서 입력 백만 개당 $2, 출력 백만 개당 $6이면 0.4센트이고, Claude Sonnet 5.5에서 $2와 $10이면 0.9센트다. 저장소 리팩터링: 입력 400,000개, 출력 30,000개 — 43센트 대 83센트. 예산을 실제로 소진하는 긴 에이전트 세션: 입력 200만 토큰, 출력 200,000개, 즉 수치가 입력 쪽이 지배할 만큼 커지면 $5.20 대 $6.30이다.

출력 가격에서 2.25배 차이로 시작하는 격차는 에이전트 규모에서 대략 1.2배로 좁혀지며, 그런 규모 확장은 단순히 호기심을 끄는 현상이 아니다. Qwen3.8 Max와 Claude Sonnet 5.5는 둘 다 출력 상한이 높은 1M 토큰 모델이고, 둘 다 입력 기준 백만 토큰당 $2로 책정되었으며, 둘 다 서로 8주 이내에 출시되었다 — 해당 벤더의 모델은 2026년 8월 3일, 9월 2일자 리프레시와 함께, Anthropic의 모델은 9월 28일. 둘 사이의 차이는 요금표가 아니다. 각 모델이 작업을 끝내기 위해 지출하는 비용이다.

무엇이 출시되었고, 언제였는가

Qwen3.8 Max는 알리바바가 지금까지 선보인 최고 성능 등급입니다. 알리바바는 자체 마이그레이션 가이드에서 이를 GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro와 직접 경쟁하도록 포지셔닝하며, 사용 가능한 가장 강력한 추론이 필요한 작업이라면 언제든 이 모델을 권장합니다. 1M 토큰 컨텍스트 윈도우를 갖추고 텍스트, 이미지, 비디오 입력을 받아 텍스트를 출력합니다. 여기서 비디오 입력 지원은 Claude Sonnet 5.5에 없는 유일한 기능입니다. 가격은 입력 100만 토큰당 $2, 출력 100만 토큰당 $6이며, 캐시 읽기는 $0.25, 캐시 쓰기는 $2.50입니다. 저희 카탈로그의 8월 3일 항목에는 9월 2일 리프레시가 추가되었으며, 이는 Qwen3.8 Max (0902)로 등록되어 있습니다. 이 버전은 동일한 대표 요금과 131K 출력 상한을 제공합니다.

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5는 Anthropic의 5.5 세대에서 두 번째 모델로, 2026년 9월 28일 Claude Opus 5.5 출시 6일 후에 출시되었습니다. 이는 claude-sonnet-5-5로 Claude API와 Amazon Bedrock, Google Cloud, Microsoft Foundry 전반에서 제공되며, 1M 토큰 창과 Message Batches API에서 300K까지 확장되는 128K 동기 출력 상한을 갖추고 있습니다. 이 상한은 output-300k-2026-03-24 헤더를 사용하는 경우이며, Claude Sonnet 5의 요금은 그대로 유지됩니다: 입력 $2, 출력 $10, 캐시 읽기 $0.20, 캐시 쓰기 $2.50. 출시 시점부터 데이터 보존 제로, 서비스 종료는 2027년 9월 28일보다 이르지 않습니다.

따라서 입력 요금은 동일하고, 컨텍스트 창 크기도 같으며, 두 공급업체는 서로 한 달 이내에 갱신했습니다. 이 둘을 가르는 모든 요소는 청구서의 출력 측에 있거나 벤치마크에 있습니다.

벤치마크: 독립 지수 대비 벤더 표

여기에는 두 종류의 증거가 존재하며, 이들은 서로 호환되지 않는다.

Anthropic의 출시 표는 벤더가 보고한 것으로, 어떤 제3자도 재현하지 않았으며, 여덟 개의 평가를 포함한다. 정말 중요한 행들

• Terminal-Bench 4.0 — Claude Sonnet 5.5 70.6% 대 Claude Sonnet 5의 10.3%

• CursorBench 4.0 — Claude Sonnet 5의 34.1% 대비 55.5%

• GDPval-AA v2.1 — Claude Sonnet 5의 1449 대비 1844, Claude Opus 5.5의 1846, GPT-6 Sol의 1487

• 도구를 사용한 Humanity's Last Exam — 64.5% 대 54.9%; Claude Opus 5.5는 67.7%를 기록

• OSWorld 2.1, 부분적 — 57.0% 대비 80.1%

• 차트 작성, 도구 없이 — 61.6% 대 15.6%

Alibaba는 직접적으로 대응하는 4열 표를 공개하지 않으므로, 동일한 축에 놓을 수 있는 유일한 수치는 독립적인 수치뿐입니다. Artificial Analysis, v4.3.2 개정판

• 종합 지능 지수 — Claude Sonnet 5.5 56, 216개 중 3위; Qwen3.8 Max 45, 27위

• Intelligence Index 작업당 비용 — $7.60 대 $5.41

• 출력 속도 — Anthropic의 모델은 초당 78.7토큰으로 측정된 Claude Sonnet 5 기준선 대비 실행되며, Qwen3.8 Max는 39.1로 측정됩니다

• 장황함 — Index에서 190M 대비 410M 출력 토큰

Qwen3.8 Max의 자체 평가별 점수는 한계선이라기보다 괜찮은 편입니다: GPQA Diamond에서 92.8%, Terminal-Bench 2.1에서 88.8%, 장문맥 회상에서 80.3%, tau-banking에서 47.8%입니다. 종합 지표에서는 밀리는데, 그 이유는 결정적으로 이기는 항목이 하나도 없는 반면 더 새로운 Anthropic 등급은 여러 항목에서 완전히 앞서기 때문입니다. 또한 Qwen3.8 Max의 독립 페이지에는 2026년 9월 2일 출시일과 984K 컨텍스트 수치가 기재되어 있다는 점에 유의하십시오. 이는 8월 빌드가 아니라 (0902) 리프레시를 설명하는 것이며, 둘 사이의 수치를 혼용하는 것은 실수일 것입니다.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

두 칼럼 모두에서 빠져 있는 것은 그 안에 들어 있는 것만큼이나 중요하다. 아무도 Anthropic의 OSWorld나 Terminal-Bench 수치를 독립적으로 재현하지 않았다. 아무도 Qwen3.8 Max에 대한 Chartography나 CursorBench 수치를 발표하지 않았다. 종합 점수는 두 모델 모두에서 같은 방식으로 측정된 유일한 수치이며, 바로 그래서 그 아래의 작업당 비용 수치가 그토록 큰 역할을 한다.

그것을 결정하는 숫자, 그리고 그것은 두 요금표 어디에도 없다.

Artificial Analysis는 두 모델에 같은 방식으로 비용을 청구한다. Index에 있는 열 가지 평가를 실행하고, 토큰을 세고, 정가를 곱한다. Claude Sonnet 5.5는 태스크당 $7.60, Qwen3.8 Max는 $5.41로 나오는데, 더 높은 종합 점수에도 불구하고 Anthropic 모델에 40%의 프리미엄이 붙는 셈이다. 장황함 수치가 그 방향을 설명해 준다 — 410M 토큰 대 190M — 그리고 속도 수치가 나머지를 설명한다. 더 적은 토큰을 내보내면서 토큰당 시간은 더 오래 걸리는 모델이 출력 비용을 두 배 요율로 지불하는 쪽은 아니다.

Anthropic 자체의 효율성 주장은 이를 반박하기보다 같은 이야기에 부합한다. 이 회사는 Claude Sonnet 5.5가 Claude Sonnet 5보다 출력을 30% 이상 더 빠르게 생성하며 동일한 가격에서 "작업당 최대 30% 더 저렴하다"고 말한다 — 이는 요율이 아니라 작업당 토큰에 관한 주장이다. 절반도 안 되는 토큰을 사용하는 모델을 상대로 그것이 성립하는지가 바로 $7.60 수치가 묻는 바이며, 하나의 독립 실행은 하나의 데이터 포인트일 뿐이다.

실질적인 결과: 출력 단가 $6 대 $10은 조달 부서가 주목하게 될 숫자이며, 이 글에서 가장 예측력이 떨어지는 숫자다. 정작 예측력이 있는 숫자는 여러분 자신의 프롬프트에서 측정한 작업당 토큰 수인데, 어느 벤더도 그 숫자를 여러분에게 알려주지 않을 것이다.

입력, 비디오, 그리고 마이그레이션 함정

즉시 드러나는 능력 차이는 모달리티입니다. Qwen3.8 Max는 텍스트와 이미지에 더해 동영상도 받아들이고, Claude Sonnet 5.5는 텍스트와 이미지만 받아들입니다. 화면 녹화 분석, 회의 영상 파이프라인, 또는 동영상을 일급 입력으로 취급하는 모든 작업에서 이것은 벤치마크 격차가 아니라 이분법적인 자격 문제이며, 이 두 모델 중 하나만 통과합니다.

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

일주일 뒤에 드러나는 차이는 행동상의 차이입니다. Claude Sonnet 5.5는 Claude Sonnet 5에서 실행되는 코드에 다섯 가지 브레이킹 체인지를 적용합니다. 기본값이 아닌 temperature, top_p 또는 top_k는 이제 400을 반환합니다. 전송하면 thinking: {"type": "disabled"}는 다음을 가리키는 400을 반환합니다: between_tools, 새로운 최저 thinking 설정이며, low, medium, high effort에서는 허용되고 xhigh 또는 max에서는 거부됩니다. 강제 도구 사용 — tool_choice가 "any" 또는 이름이 지정된 도구 — 400을 즉시 반환합니다. 이전 computer_20251124 컴퓨터 사용 도구는 Claude API와 Google Cloud에서 거부됩니다. 또한 thinking 블록은 이를 생성한 모델과 계정에 묶여 있으므로, 추론은 Claude Sonnet 5에서 이어받을 수 있지만 다른 패밀리로 내보낼 수는 없으며, 편집된 대화 접두사는 재생을 오류로 바꿀 수 있습니다.

Qwen3.8 Max는 그중 어느 것도 요구하지 않습니다. 이는 관례적인 요청 표면을 갖춘 OpenAI 형식 모델이며, 다른 Qwen 티어에서 이 모델로 이동하는 것은 모델 문자열 변경에 불과합니다.

두 가지 비용을 솔직하게 따져 보세요. Qwen 모델을 선택하면 11점 종합 점수 격차와, 어차피 독립적으로 검증할 수 없는 Anthropic 벤더 수치를 잃게 됩니다. Anthropic 모델을 선택하면 비디오 입력을 포기해야 하고, 처음 호출될 때마다 400으로 요란하게 실패할 네 가지 API 변경 체크리스트가 생깁니다. 이는 좋은 종류의 실패지만, 어쨌든 하루치 작업입니다.

OrcaRouter의 위치

선택이 아니라 라우팅을 해야 하는 이유는, 결정적인 수치인 귀하의 트래픽 기준 작업당 비용을 어느 벤더의 문서에서도 계산할 수 없기 때문입니다.

OrcaRouter는 200개 이상의 모델을 아우르는 단일 OpenAI 호환 엔드포인트로, 제공업체의 정가를 마크업 없이 그대로 적용하므로, 어느 쪽에서든 요금 인하나 등급 변경이 발표되는 당일 바로 반영됩니다. 두 가지 Qwen3.8 Max 빌드가 모두 알리바바 자체 가격 $2 / $6로 카탈로그에 있습니다 — 8월 버전과 (0902) 리프레시 — 그리고 대부분의 Claude API 트래픽이 여전히 사용하는 모델인 Claude Sonnet 5와 함께, 6월 30일부터 Anthropic의 $2 / $10로 라우팅할 수 있으며 측정된 초당 150 출력 토큰을 냅니다. Claude Sonnet 5.5 자체는 아직 저희 카탈로그에 없습니다. 그러한 상황에서 그것에 이르는 정직한 경로는 벤더 자체 API와 Anthropic이 나열한 세 개의 클라우드이며, 워크로드를 옮기지 않고 시험해 보는 방법은 자동 장애 조치 뒤에 트래픽의 일부를 두고 Claude Sonnet 5 또는 Qwen3.8 Max로 보내는 것입니다.

어떤 작업에 어느 것

Qwen3.8 Max는 비디오 입력, 출력 속도, 인덱스 작업당 측정된 비용, 통합 노력에서 우위를 점합니다. 이는 12포인트의 복합 격차가 출력 품질에 나타나지 않는, 대량의 잘 명세된 작업에 적합한 기본값입니다.

Claude Sonnet 5.5는 독립적인 종합 평가에서, Anthropic의 자체 수치가 Terminal-Bench 4.0에서 이전 모델 대비 60포인트 상승을 보여준 에이전트형 코딩 평가에서, 300K 배치 출력 상한에서, 그리고 요금표가 내릴 수 없는 업무 형태의 결정에서 우위를 점한다: 작업이 충분히 어려워서 저렴함보다 정확함이 더 중요할 때 선택해야 할 모델이다.

둘 중 어느 쪽이든 답을 바꾸게 할 것은 같은 한 가지이며, 그것은 새로운 벤치마크 발표가 아니다. 그것은 두 모델 모두에 대해, 당신 자신의 프롬프트와 당신이 정한 노력 설정에서의 작업당 토큰 수다. Anthropic의 effort 파라미터와 Qwen의 출력 상한은 모두 그 숫자를 움직이는 지렛대이며, 둘 다 벤더의 가격표가 아니라 당신이 설정한다.

이 비교가 확실히 결론짓는 단 한 가지는, 입력 100만 토큰당 2달러에서는 청구서의 입력 측면이 더 이상 중국의 플래그십과 Anthropic의 중간급을 구분하는 요소가 아니라는 점이다. 그 경쟁은 몇 달 전에 출력 측면과 토큰 수로 옮겨갔다.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트