
GPT-6 vs Qwen 3.8 Max: 하나는 영상을 입력받고, 하나는 더 길게 작성한다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
GPT-6 Sol과 Qwen3.8 Max는 동일한 입력 요율, 즉 백만 토큰당 2.00달러를 부과하며, 그다음 가격표만으로는 드러나지 않는 두 가지 축에서 갈린다. Qwen3.8 Max는 2026년 8월 3일부터 정식 출시(GA) 상태로 서비스되고 있으며, 두 모델 중 유일하게 동영상을 받아들인다. 이 모델의 입력 모달리티는 텍스트, 이미지, 동영상인 반면, GPT-6 Sol은 텍스트, 이미지, 파일을 받는다. GPT-6 Sol은 공급업체가 2026년 9월 22일 출시한 모델로, 둘 중 유일하게 공개된 출력 상한(128,000토큰)을 가지고 있으며, 소비자용 접점을 갖춘 유일한 모델이기도 하다. 즉 10월 7일 ChatGPT 출시를 통해 이 모델은 주간 사용자 12억 명 이상에게 선보여졌다.
그래서 분류 기준은 어느 쪽이 더 강력한지가 아닙니다. 기준은 입력이 영상인지, 그리고 출력이 긴지의 여부입니다.
비디오는 첫 번째 포크입니다
대부분의 모델 비교는 가격과 벤치마크로 귀결되지만, 이번 비교에는 이들을 부차적으로 만드는 확고한 구조적 차이가 있습니다. 여러분의 파이프라인이 영상을 수집한다면 — 감시 영상, 녹화된 회의, 스포츠나 강의 자료, 제품 데모 릴 — Qwen3.8 Max는 요청 안에 클립을 넣을 수 있습니다. 모델 카드에는 영상이 텍스트 및 이미지와 나란히 입력 모달리티로 기재되어 있으며, 최대 백만 토큰 창까지 지원합니다. 이는 영상의 경우 별도의 추출 단계가 아니라 단일 호출로 프레임 샘플링과 트랜스크립트를 처리한다는 뜻입니다. GPT-6 Sol은 그럴 수 없습니다. 이 모델의 모달리티는 텍스트, 이미지, 파일이며, 카드에 영상 입력은 없고, 어떤 프롬프트 엔지니어링으로도 이를 대체할 수 없습니다.
그 단 한 줄이 비디오 파이프라인의 후보 목록을 결정하며, 그것은 요금표에는 보이지 않습니다. 두 모델이 진정으로 상호 교환 가능한 영역은 텍스트와 이미지 작업이며, 아래의 가격 및 벤치마크 비교가 적용되는 곳이 바로 그곳입니다.
비디오 주장에 관한 한 가지 솔직한 참고: 모달리티는 문서화되어 있지만 스키마는 그렇지 않습니다. 어느 벤더의 카탈로그 항목에도 해상도, 프레임 레이트, 클립 길이 제한이 명시되어 있지 않습니다. 따라서 "비디오 지원"은 입력 유형이 존재한다는 뜻이지, 특정 클립이 필요한 품질로 수집된다는 뜻은 아닙니다. 이 위에 구축하기 전에 자체 영상으로 테스트해 보세요.
출력 측은 반대 방향으로 작동한다
요청을 뒤집어 보면 이점은 역전된다. GPT-6 Sol은 응답당 최대 출력으로 128,000토큰을 공개한다. Qwen3.8 Max의 카드는 컨텍스트 윈도는 공개하지만 최대 출력 수치는 공개하지 않으므로, 엄격한 출력 상한에 맞춰 예산을 산정하는 시스템은 공급업체 데이터에서 그 값을 읽어낼 수 없다 — 이는 여러 호스팅 플랫폼 카드에서 나타나는 것과 같은 공백이며, 무제한이 아니라 알 수 없음으로 취급할 가치가 있다.
공개된 것은 출력 측의 가격 비대칭이며, 이는 영상 이야기와는 반대입니다. Qwen3.8 Max는 백만 출력 토큰당 $6.00를 청구하는 반면 GPT-6 Sol은 $10.00를 청구합니다 — 모델이 작성하는 모든 토큰에 40% 할인이 적용되는 셈입니다. 장문 생성이나 대규모 구조화 아티팩트 직렬화처럼 출력이 많은 워크로드는 작업 단위당 Qwen3.8 Max에서 실질적으로 더 저렴하며, 이는 입력 가격이 동일하다는 사실과 무관하게 성립합니다.
Qwen3.8 Max의 모델 카드에는 문서화된 입력 등급 없이 단일 입력 요율만 기재되어 있는 반면, GPT-6 Sol은 입력 토큰이 272,000개를 초과하는 전체 요청을 입력 $4.00, 출력 $15.00로 재가격 책정한다. OpenAI의 모델 페이지는 이 규칙을 명시적으로 밝힌다: 해당 임계값을 초과하는 프롬프트는 입력 및 캐시 요율이 2배로, 전체 요청에 대해서는 1.5배로 청구된다. 272,000개 토큰을 초과하는 프롬프트에서는 GPT-6 Sol의 실효 입력 요율이 $4.00로 두 배가 되는 반면 Qwen3.8 Max의 요율은 $2.00로 유지된다 — 이는 겉보기에 동일했던 입력 요율을 다시 역전시킨다.
독립 이사회가 말하는 것
Artificial Analysis는 두 모델을 모두 다루고 있으며, 종합 지수에서는 GPT-6 Sol이 앞서지만 여러 개별 테스트에서는 결과가 반대로 나온다. 아래의 모든 수치는 벤더가 아닌 평가 기관의 것이다.
• 인텔리전스 지수: GPT-6 Sol 47.6, Qwen3.8 Max 45.4 — GPT-6 Sol이 약 2점 앞섬
• 코딩 지수: Qwen3.8 Max 76.2로 톱10 순위; GPT-6 Sol의 코딩 프로필은 비슷하지만 Qwen 항목이 더 강한 순위를 지님
• GPQA Diamond: Qwen3.8 Max 92.8%, GPT-6 Sol의 수치가 동일 테스트 계열에서 둘 중 더 높음
• Humanity's Last Exam: Qwen3.8 Max 43.1%, GPT-6 Sol 47.9%
• 장문맥 회상: Qwen3.8 Max 80.3%, GPT-6 Sol 83.7%
• SciCode: Qwen3.8 Max 52.1%, GPT-6 Sol 57.6%
• 에이전트형 도구 사용: Qwen3.8 Max는 terminal-bench v2.1에서 88.8%, tau-banking에서 47.8%로 둘 다 강력함
패턴은 GPT-6 Sol이 일반 추론 종합 지표와 과학 및 회상 테스트에서 이기고, Qwen3.8 Max는 코딩과 도구 사용에서 더 예리한 모델이라는 점이다. 두 가지 단서가 적용되며, 이는 형식적인 말이 아니다. 첫째, 이 지수 값들은 서로 다른 날짜에 평가되었으므로, 리비전 간의 2점 차이는 재실행이 만들어내는 변동 폭 안에 있는 것이지 확정된 격차가 아니다. 둘째, Qwen3.8 Max의 공개 수치는 평가자가 Alibaba 엔드포인트에서 서비스되는 모델을 대상으로 실행한 결과이며, 벤더는 2026년 9월 2일 동일한 $2.00 / $6.00 요율로 날짜가 표시된 스냅샷인 Qwen3.8 Max (0902)도 출시했다 — 스냅샷을 고정하려는 경우, 점수를 인용하기 전에 어느 것을 호출하는지 확인하라.

OpenAI의 10월 7일 롤아웃이 추가하는 것
ChatGPT 출시는 역량의 사실이라기보다 배포의 사실이지만, 독자가 "GPT-6"이라고 할 때 의미하는 바를 바꾼다. 2026년 10월 7일 OpenAI는 Intelligent UI 기능 아래에서 GPT-6를 ChatGPT에 순차 적용하기 시작했으며, Chat 탭은 Plus, Pro, Business, Enterprise에 먼저 도달했고 Free와 Go는 10월 8일부터 뒤따랐다. 기업용 가용성은 직장 관리자 설정에 따라 달라진다. Work와 Codex를 구동하는 모델은 변경되지 않았다.
이 비교에서 두 가지 세부 사항이 중요합니다. ChatGPT 경험은 유료 소비자 등급의 경우 GPT-6 Sol로 구동됩니다. 따라서 10억 명이 넘는 사람들이 만나는 GPT-6는 별도의 체크포인트가 아니라 여러분이 API로 호출하는 바로 그 모델입니다. 그리고 GPT-6는 단일 모델이 아니라 하나의 제품군입니다. GPT-6 Astra는 $10.00 / $50.00으로 Sol 위에 있고, GPT-6 Luna는 $0.10 / $0.50으로 그 아래에 있습니다. 어떤 비교에서 어느 등급인지 밝히지 않고 "GPT-6"를 Qwen3.8 Max와 대조한다면, 그것은 보통 기본적으로 Sol과 비교하는 것이고, 가장 강력한 논거를 원할 때는 Astra와 비교합니다. 등급을 밝히는 것이 공정한 비교와 수사적 비교를 가르는 차이입니다.
비율이 아닌 형태를 기준으로 측정한 비용
입력 요금은 동일하고 출력 요금은 서로 다르기 때문에, 승자는 전적으로 입력 토큰 대 출력 토큰의 비율에 따라 결정됩니다. 각 공급업체가 공개한 요금을 기준으로 계산하면(캐싱 제외):
• 비디오 및 트랜스크립트 분석(입력 500K, 출력 6K): Qwen3.8 Max ≈ $1.04, GPT-6 Sol 해당 없음 — 비디오 입력 없음
• 문서 분석(입력 250K, 출력 5K): Qwen3.8 Max ≈ $0.53, GPT-6 Sol은 272K 임계값이 적용되기 전에는 ≈ $0.55이며, 전체 요청이 재가격되면 더 높아짐
• 장문 생성(입력 40K, 출력 80K): Qwen3.8 Max ≈ $0.56, GPT-6 Sol ≈ $0.88
• 균형 잡힌 에이전트 루프(입력 60K, 출력 20K): Qwen3.8 Max ≈ $0.24, GPT-6 Sol ≈ $0.32
결과의 형태는 안정적이다. 동일한 토큰 구성에서는 Qwen3.8 Max가 더 저렴한 모델인데, 입력 요율은 동일하고 출력 요율은 더 낮기 때문이다. GPT-6 Sol의 반론은 전혀 가격이 아니다. 그것은 추론 종합 지표, 소비자 접점 검증, 그리고 예산 책정을 간단하게 만들어 주는 문서화된 출력 상한이다.
모델 카드에는 나와 있지 않기 때문에 언급할 가치가 있는 운영상 주의점이 하나 있습니다. 2026년 10월 첫째 주에 OrcaRouter의 플레이그라운드에서 측정했을 때, Qwen3.8 Max 라우트는 첫 토큰 지연 시간 중앙값이 약 5,809ms였고 초당 출력 토큰은 약 50개였으며 오류율은 낮았습니다. 같은 기간 GPT-6 Sol 라우트는 처리량이 더 빨랐지만 오류율은 상당히 더 높았습니다. 이는 공유 라우트 관측치이며 공급업체 SLA가 아니고 주마다 달라집니다. 그래서 어느 모델의 카드도 믿기보다 직접 트래픽을 측정해야 한다는 근거가 됩니다.
둘 다 하나의 키로 실행
한쪽에는 비디오 작업이 있고 다른 한쪽에는 추론 중심 작업이 있는 팀에게 현실적인 답은 어느 모델도 완전히 승리하지 않으며 둘 다 스택에 속한다는 것입니다. 바로 이런 경우를 위한 것이 게이트웨이입니다. OrcaRouter에서는 qwen/qwen3.8-max와 GPT-6 Sol이 둘 다 하나의 OpenAI 호환 API 뒤에 있는 동일한 카탈로그의 라이브 라우트이며, 제공업체 정가에 0% 마크업으로 제공되므로 Alibaba나 OpenAI의 가격 변동이 다음 청구서 정산 시점이 아니라 같은 날 바로 여러분에게 반영됩니다, 그리고 공급업체별로 별도의 자격 증명 세트나 SDK 경로가 없습니다.
여기서 두 가지 기능이 구체적인 역할을 합니다. 자동 페일오버는 한 공급자의 경로가 저하될 때 파이프라인을 계속 살려 둡니다. 이는 같은 측정 구간에서 그 두 경로가 얼마나 다르게 동작했는지를 고려하면 직접적으로 중요한데요. 그리고 라우팅 DSL은 요청이 스스로 결정하게 합니다: 비디오 입력을 포함한 모든 것은 Qwen3.8 Max로 보내고, 긴 컨텍스트 추론 작업은 GPT-6 Sol로 보내며, 트래픽이 바뀔 때 수동으로 변경해야 하는 하드코딩된 모델 id 대신 입력 모달리티와 요청 크기에 대한 조건자가 선택을 하도록 합니다.

간단히 말하면: 입력에 영상이 포함된다면 Qwen3.8 Max는 둘 중 유일하게 영상을 받을 수 있는 모델이고, 요청을 처리하는 입장에서는 모든 토큰 구성에서 더 저렴한 모델입니다. 길고 범위가 제한된 출력과 검증된 소비자용 기본값이 필요한 텍스트 및 이미지 추론 작업이라면, GPT-6 Sol이 종합 지수에서 더 강한 카드이자 문서화된 소비자용 기본값을 갖춘 쪽입니다. 라우팅이 필요한 경우에는 릴리스 주기가 아니라 요청의 모달리티를 라우팅 키로 삼으세요.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
