기사 'Grok 4.7 vs Qwen 3.8 Max — 서류상으로는 동전 던지기'를 위한 생성된 히어로 타이틀 카드. 부제는 '동일한 가격, 지수 1포인트 차이, 정반대의 형태'이고, 스탯 칩은 AA Index 46 vs 45, 양쪽 모두 가격 $2/$6, 컨텍스트 500K vs 984K를 표시합니다.
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max: 같은 가격, 1점 차이, 정반대의 형태

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 개의 비공개 플래그십 모델, 둘 다 백만 입력 토큰당 $2, 백만 출력 토큰당 $6이며, 동일한 독립 벤치마크에서 서로 1점 이내의 점수를 기록했고, 출시 간격은 19일이다. Grok 4.7은 2026년 9월 21일 SpaceXAI에서 등장했다; Qwen 3.8 Max는 2026년 8월 3일 해당 벤더에 의해 출시되었고 2026년 9월 2일 갱신되었다. 현재 Artificial Analysis Intelligence Index 버전 v4.3.2에서 Grok 4.7은 46점, Qwen 3.8 Max는 45점을 기록한다. 가격과 측정된 성능 면에서 이 두 모델은 사실상 같은 선택이다. 그 외의 모든 것 — 컨텍스트, 모달리티, 서빙 속도, 개방성, 그리고 각 벤더가 최적화하기로 선택한 대상 — 에서는 이 둘보다 더 다를 수 없으며, 바로 그 점 때문에 이 비교는 건너뛰지 않고 실행할 가치가 있다.

먼저 타임라인입니다. Qwen 3.8 Max에는 날짜가 두 개 있기 때문이죠.

이 점은 많은 보도에서 혼선을 일으키므로, 맨 앞에서 바로잡을 가치가 있습니다. Qwen 3.8 Max는 2026년 8월 3일 Alibaba의 가장 크고 가장 성능이 뛰어난 모델로 출시되었으며, Qwen 3.5 비전-언어 아키텍처를 바탕으로 총 2조 4천억 개 파라미터와 토큰당 950억 개 활성 파라미터로 보고된 희소 전문가 혼합(MoE) 설계를 기반으로 구축되었습니다. 2026년 9월 2일 Alibaba는 새로 고친 빌드인 0902 리비전을 내놓았는데, 이는 현재 모델 ID를 사용하는 버전이며 Artificial Analysis가 해당 페이지의 날짜로 표기하는 버전입니다. Qwen 3.8 Max에 대해 8월과 9월 날짜를 모두 보았다면, 그 이유가 바로 이것입니다. 하나는 출시이고, 다른 하나는 오늘날 대부분의 사람들이 실제로 부르고 있는 리비전입니다.

Grok 4.7은 더 깔끔한 이력과 그 뒤의 더 지저분한 이력을 함께 갖고 있다. SpaceXAI는 2026년 9월 21일, 거듭 미뤄진 출시 끝에 이를 공개했다. 머스크는 8월 말, 9월 초, 9월 중순의 시점을 내세웠지만 모델은 그제서야 출시되었다. 이번 릴리스 자체는 범위가 좁았다: Grok 4.6보다 더 큰 베이스 모델, 수시간짜리 작업을 겨냥한 더 긴 강화 학습 실행, 그리고 8월 12일부터 Grok 4.6이 적용해 온 $2/$6 요금표에는 변화가 없었다.

각 벤더가 최적화한 대상

두 개의 출시 발표를 한 쌍으로 읽어 보면, 디자인 승부수는 거의 완벽하게 상반됩니다.

SpaceXAI는 에이전트 실행에 최적화했다. Grok 4.7의 벤더 보고 수치는 터미널 및 리포지토리 작업에 집중되어 있다. Terminal-Bench 4.0은 Grok 4.6의 20.3%에 맞서 38.0%, CursorBench 4.0은 46.3%, DeepSWE v1.1은 높은 추론 노력 수준에서 71.0%, EEBench는 64.0%다. 이번 릴리스에 대한 회사 측 설명은 Grok Bot 환경 내 자기 검증과 장문 컨텍스트 처리를 목표로 꼽는다. Grok 4.7은 500,000토큰 윈도우를 제공하고, 텍스트와 이미지를 입력받아 텍스트를 반환하며, 추론 노력 수준을 low부터 xhigh까지 노출한다. 일을 끝내도록 만들어진 모델이다.

알리바바는 도달 범위에 최적화했습니다. Qwen 3.8 Max는 약 984,000개 토큰 — 사실상 100만 개 — 의 컨텍스트 윈도우를 제공하며, 공개된 강점은 한 분야에서의 깊이보다는 넓이입니다: Terminal Bench 2.1 점수 86.6, SWE-bench Pro 67.7, PaperBench 93.0, GPQA Diamond 92.6, MMMU-Pro 82.3, OSWorld-Verified 86.1. 텍스트, 이미지, 비디오 입력을 받아 텍스트를 반환하고, 추론 강도 수준을 지원하며 기본값은 xhigh이고, 공개된 결과 중 약한 부분은 Humanity's Last Exam 43.6입니다. 이 모델은 무엇이든 처리하도록 만들어진 모델입니다.

그 문단의 모든 수치는 공급업체가 보고한 것입니다. 두 세트 모두 독립적으로 재현된 적이 없으며, 애초에 두 세트는 직접 비교할 수 없습니다 — Terminal-Bench 2.1과 Terminal-Bench 4.0은 서로 다른 벤치마크이므로, Qwen의 86.6과 Grok의 38.0을 나란히 놓아서는 절대 안 됩니다.

• 독립적 종합 — AA Intelligence Index v4.3.2에서 Grok 4.7은 46, 동일 버전에서 Qwen 3.8 Max는 45. 통계적 동점.

• 백만 토큰당 가격 — 둘 다 입력 $2.00 / 출력 $6.00. Qwen의 캐시 할인은 88%로 명시되어 백만 토큰당 혼합 요율 $1.18을 제공합니다; Grok 4.7의 캐시 조건은 같은 기준으로 공개되어 있지 않습니다.

• 컨텍스트 윈도우 — Grok 4.7 500,000 토큰 대 Qwen 3.8 Max 약 984,000. Qwen이 거의 두 배로 앞서며, 이는 두 제품 간 사양에서 단일 항목으로 가장 큰 차이다.

• 입력 모달리티 — Grok 4.7은 텍스트와 이미지, Qwen 3.8 Max는 텍스트, 이미지, 동영상.

• 가중치 — 둘 다 독점. 두 모델 모두 다운로드할 수 없기에, 이 비교에서는 흔히 제기되는 오픈 가중치 논쟁이 완전히 사라진다.

• 파라미터 — Grok 4.7은 SpaceXAI의 어떤 사양서에도 공개되지 않았고(약 2.1T라는 수치는 머스크의 주장임), Qwen 3.8 Max는 총 2.4T에 활성 95B로 보고되었지만, 알리바바 역시 사양서에서 이를 확인하지 않았다.

• 서빙 속도 — Qwen 3.8 Max는 Artificial Analysis에 따르면 초당 출력 토큰 38.8개, 첫 토큰까지 3.08초; Grok 4.7은 SpaceXAI가 유사 모델보다 약 두 배 빠르다고 내세운 것으로, 업체 보고 기준이며 아직 독립적인 처리량 수치는 공개되지 않았다.

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

맥락의 차이가 진정한 결정이다

가격과 성능이 동일할 때, 결정은 그 밖에 무엇이 다른지에 달려 있으며, 여기서는 그것이 컨텍스트입니다. 창을 500,000에서 약 984,000 토큰으로 두 배로 늘리는 것은 스펙 시트상의 사소한 장점이 아니라, 저장소를 청크로 나누는 것과 통째로 담아 두는 것의 차이입니다.

Qwen 3.8 Max의 더 긴 윈도에는 구매자에게 중요한, 문서화된 주의 사항이 따릅니다: 알리바바가 2026년 8월 10일이 있는 주에 발표한 오픈 웨이트 버전은 텍스트 전용이었고 100만 토큰 전체 컨텍스트를 포함하지 않았습니다. 이는 이 비교의 대상인 호스팅 엔드포인트에는 영향을 주지 않지만, 오픈 릴리스를 기준으로 계획하고 있었다면 알아 둘 가치가 있습니다.

Grok 쪽에는 두 번째 고려 사항이 있습니다. Grok 라인은 역사적으로 입력 토큰 200,000개에서 가격 절벽을 적용해 왔는데, 이 임계값을 넘는 요청은 전체 요청이 두 배 요율로 재가격됩니다. 즉 입력 $4, 출력 $12입니다. 500,000토큰 창에서는 그 임계값이 모델의 작업 범위 안에 충분히 들어옵니다. 장문 컨텍스트 작업을 Grok 4.7로 라우팅하기 전에, 배포된 모델의 현재 요금표를 확인하세요. 큰 창과 재가격 절벽의 상호작용이 바로 장문 컨텍스트 요금이 잘못 나오는 지점이기 때문입니다.

각각에서 한 달 동안 작업하는 데 드는 비용

대표 요금이 동일하므로 비용 비교는 요금표가 아니라 토큰 동작을 토대로 구성해야 하며, 바로 거기서 두 모델은 측정 가능한 방식으로 갈린다.

Artificial Analysis는 Intelligence Index를 실행하면서 Grok 4.7이 2억 4천만 개의 출력 토큰을 생성한 것을 측정했는데, 이는 보드에 있는 모델들의 중앙값 9,200만 개와 대비됩니다. Grok 4.7은 장황한 추론 모델입니다. Qwen 3.8 Max는 같은 지수에서 1억 9천만 개의 출력 토큰을 생성했으며, 총 평가 비용은 $4,934.79, 측정된 속도는 초당 38.8토큰이었습니다. 둘 다 장황성 중앙값을 크게 웃돌며, Grok 4.7이 둘 중 더 장황합니다.

그래서 백만 출력당 동일한 $6이라면, 작업당 더 많은 토큰을 출력하는 모델이 작업당 더 많은 비용이 든다. 공개된 장황성 수치는 Grok 4.7이 동등한 인덱스 작업에 더 많은 출력 토큰을 소비할 것임을 시사하며, 이는 가격 동점이 사실상 작업당 비용에서 Qwen 3.8 Max의 작은 승리라는 뜻이다 — Grok 4.7이 주장하는 속도 우위로 상쇄되는데, 이는 실제 경과 시간을 단축시켜 따라서 에이전트 실행을 기다리는 인적 비용을 줄인다. 이러한 상쇄 요인 중 어느 것도 요금표에는 보이지 않으며, 둘 다 가정하기보다는 자체 트래픽에서 측정할 가치가 있다.

이견이 없는 단 하나의 비대칭성은 캐싱이다. Qwen 3.8 Max는 7:2:1의 캐시 적중/입력/출력 비율에서 88% 캐시 할인과 $1.18의 혼합 요율을 공개한다. 시스템 프롬프트, 코드베이스 헤더, 문서 세트처럼 크고 안정적인 접두사가 있는 워크로드라면, 실질적인 절감은 바로 그 할인에서 나오며, 대량 사용을 약정하기 전에 Grok 4.7의 캐시 조건이 어떻게 비교되는지 확인해 볼 가치가 있다.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

숫자가 당신 대신 선택해 주지 않을 때, 선택하기

같은 지수에서 46점과 45점, 같은 가격이라면, 이 블로그가 게재할 법한 진정한 동점에 거의 가깝습니다. 즉, 결정은 두 모델이 실제로 차이가 나는 축에서 내려야 하며, 그런 축은 네 가지입니다.

여러분의 작업이 에이전트형 코딩과 터미널 실행이고, 긴 실행에서 실제 경과 시간 기준 속도가 컨텍스트 여유보다 더 중요하며, 가벼운 트래픽을 저렴하게 유지할 수 있는 요청별 추론 다이얼을 원한다면 Grok 4.7을 선택하세요. 일상적으로 50만 토큰이 넘는 입력을 처리하고, 비디오 입력이 로드맵에 있으며, 접두사가 많은 워크로드에 대한 88% 캐시 할인을 원하거나, 단일 영역에 집중된 평가가 아니라 폭넓은 평가 매트릭스를 공개하는 공급업체의 모델을 원한다면 Qwen 3.8 Max를 선택하세요.

정직한 답이 "둘 다 어느 정도"라면, 그것이 정상적인 답이며, 이 조합은 바로 그런 경우를 위해 만들어졌습니다. Qwen 3.8 Max는 OrcaRouter에서 알리바바의 정가로 제공되며, OrcaRouter는 제공업체 정가를 0% 마크업으로 그대로 전달하므로 위의 $2/$6이 실제로 지불하는 금액이고, 공급업체 요금 변경도 갱신 시점이 아니라 같은 날 바로 여기에 반영됩니다. API 키 하나로 Qwen 3.8 Max와 200개 이상의 다른 모델을 사용할 수 있으므로, 컨텍스트 결정은 플랫폼 차원의 확정 사항이 아니라 요청별 라우팅 규칙이 됩니다. 즉, 너무 큰 입력은 984k 윈도로 보내고 나머지는 해당 작업에 가장 빠르고 저렴한 엔드포인트에 유지하며, 제공업체 성능이 저하되면 자동 페일오버가 작동합니다. 어떤 작업이 두 가지 형태를 모두 필요로 할 때 — 긴 컨텍스트 읽기 후 에이전트 실행 패스 — 라우팅 DSL이 여러 모델을 하나의 호출로 구성하므로 한쪽을 선택하도록 강요받지 않습니다.

한 가지 분명히 해둘 점은, 두 모델 모두 오픈 모델이 아니기 때문에 이 비교에는 다운로드 가능한 가중치가 전혀 포함되지 않는다는 것입니다. 둘 다 호스팅된 엔드포인트이며, 어느 쪽도 자체 호스팅은 선택지가 아닙니다.

기억해야 할 단 하나의 수치

46 대 45는 모델을 고를 이유가 되지 않으며, 그래서도 안 된다. 이 비교를 결정하는 것은 컨텍스트 윈도우 — 500,000 토큰 대 약 984,000 토큰 — 그리고 각 벤더가 선택한 형태다: Grok 4.7은 어려운 에이전틱 작업을 빠르게 끝내도록 최적화되었고, Qwen 3.8 Max는 당신이 맡기는 무엇이든 처리하도록 최적화되었다. 같은 가격, 같은 측정 역량, 다른 작업. 그것은 라우팅 결정이며, 조달하는 데 분기를 쓰기보다 테스트하는 데 오후 하나를 쓰는 종류의 결정이다.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트