'GPT-6.1 Sol vs Qwen3.8-Max'라는 제목의 생성된 히어로 카드로, 두 개의 둥근 패널이 있습니다: 왼쪽 'GPT-6.1 Sol'에는 'OpenAI - 2026년 9월 29일 출시', '1M당 입력 $2.00 / 출력 $10.00', '태스크당 $0.72', 'AA Index 51.8'이 나열됩니다; 오른쪽 'Qwen3.8-Max'에는 'Alibaba - 2026년 8월 3일 출시', '1M당 입력 $2.00 / 출력 $6.00', '태스크당 $5.41', 'AA Index 45.4'가 나열됩니다; 그 아래에는 '동일한 입력 가격. 청구서는 7.5배.'라는 띠가 있습니다; 푸터에는 '수치: Artificial Analysis v4.3.2.'가 있고, 오른쪽 아래에 OrcaRouter 로고가 있습니다.
Guides & Insights

GPT-6.1 Sol vs Qwen3.8-Max: 가격표가 아닌 청구서

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

야간 저장소 유지보수 작업 하나를 골라 한 달 동안 매일 밤 한 번씩 실행하고, GPT-6.1 Sol과 Qwen3.8-Max를 그 작업에 번갈아 투입하라. Artificial Analysis의 v4.3.2 작업별 수치에 따르면, GPT-6.1 Sol은 그 30일 밤 동안 $21.72가 들고 Qwen3.8-Max는 $162.27가 든다 — 토큰당 가격표가 입력 $2.00, 출력 $10.00 대 입력 $2.00, 출력 $6.00인 작업에서 월 $140.55, 연간 약 $1,690의 차이다. 백만 토큰당 요금은 입력에서 서로 반올림 오차 범위 내이고 중국 모델이 출력에서 40% 더 저렴한데도, 청구서는 7.5배 차이가 난다. 공급업체는 2026년 9월 29일 GPT-6.1 Sol을 출시했고, Qwen3.8-Max는 2026년 8월 3일부터 서비스 중이다.

그 격차는 가격 책정의 속임수가 아니며 벤치마크의 인위적 산물도 아니다 — 그것이 이 비교가 말하는 전부이고, 그것은 어떤 요금표에도 표시되지 않는 단 하나의 숫자에서 비롯된다.

각 모델이 무엇인지

GPT-6.1 Sol은 OpenAI의 현재 추론 및 코딩 플래그십으로, 대체하는 GPT-6 Sol이 출시된 지 일주일 후에 출시되었으며, 동일한 정가 $2.00 / $10.00, 캐시 입력 요율 $0.10, 1,050,000토큰 컨텍스트 윈도우를 갖추고 있습니다. 이는 에이전트 작업용으로 판매됩니다: 자체 모델 카드의 최적 용도 태그는 추론, 코딩, 에이전트로 표시되어 있으며, 최상위 등급 품질 점수를 보유합니다.

Qwen3.8-Max는 알리바바의 에이전트형 플래그십 모델로, 텍스트, 이미지, 비디오 입력을 받고 100만 토큰 컨텍스트를 보유하는 폐쇄형 API 전용 모델입니다. 더 작은 Qwen 릴리스들과 달리 이 모델은 공개된 가중치가 없습니다. Artificial Analysis에서 인텔리전스 지수 45.42로 147개 모델 중 17위에 올라 있으며, 코딩 지수 76.2로 해당 분야에서 9위를 차지합니다. 성능이 약한 모델이 아닙니다. 다만 생각하게 두기에는 비용이 많이 드는 모델일 뿐입니다.

요금표에 없는 숫자

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysis는 Qwen3.8-Max의 작업당 출력 토큰을 107,730개로 기록하며, 그중 70,830개가 추론 토큰입니다. GPT-6.1 Sol은 38,128개의 출력 토큰을 생성하며, 그중 25,190개가 추론 토큰입니다. 중국 모델은 같은 질문에 답하기 위해 2.8배 많은 토큰을 작성하며, 토큰당 비용은 40% 더 낮습니다.

• 작업당 출력 토큰 — 38,128 vs 107,730; Qwen이 2.8배 더 많이 생성

• 그중 추론 — 25,190 vs 70,830

• 작업당 비용 — $0.724 vs $5.409; Qwen이 7.5배 더 비쌈

• 작업당 소요 시간 — 640초 대 2,152초; 약 11분 대 약 36

• 첫 답변 토큰까지 걸린 시간 — 332.0초 대 55.1초

• 지능 지수 — 51.83 vs 45.42

컨텍스트 윈도우 — 1,000,000 대 1,000 토큰

• 입력 허용 — 텍스트, 이미지 및 파일 대 텍스트, 이미지 및 동영상

곱셈을 해 보면 할인은 사라진다. 약 3배에 가까운 토큰을 40% 더 낮은 단가로 생성하는 모델은 비용이 더 적게 들지 않는다 — 출력만 따져도 약 1.7배 더 들며, 입력, 캐시된 읽기, 그리고 실질적인 답변의 길이까지 고려하면 측정된 작업당 수치는 실제 배수를 7.5로 제시한다.

네 번째와 다섯 번째 줄에 주목하세요. 두 줄은 서로 반대 방향을 가리키며, 함께 보면 Qwen3.8-Max가 무엇인지 설명해 줍니다. Qwen3.8-Max는 첫 토큰을 55초 만에 반환하는데, GPT-6.1 Sol은 5분 30초가 걸립니다. 그러고 나서 작업을 완료하는 데는 36분을 쓰지만, OpenAI 모델은 11분 만에 끝냅니다. 즉, 곧바로 말을 시작하고 아주 긴 호흡으로 생각하는 모델입니다. 스트리밍 답변을 제공하는 채팅 인터페이스라면 이는 반응성이 좋은 것으로 읽힙니다. 무인 야간 작업에서는 또한 비용을 지불해야 하는 실제 경과 시간입니다.

Qwen3.8-Max가 진정으로 앞서 있는 세 가지 측면

인덱스 격차는 전체 스위트에서 6.4포인트인데, 이는 마치 균일한 것처럼 인용되곤 하는 종류의 수치다. 그러나 그렇지 않으며, 그 불일치는 시사하는 바가 크다:

• GPQA Diamond — Qwen3.8-Max 0.9283 대 GPT-6.1 Sol은 이번 실행에서 공개되지 않음

• GDPval — 1,671.4 대 1,575.09

• Terminal-Bench 2.1 — 0.8876, 이 실행에서는 공개되지 않음

• AutomationBench — 0.5619 vs 0.6487

• SciCode — 이번 실행에서는 공개되지 않음 vs GPT-6.1 Sol의 0.5417

• CritPT — 0.1771 대 0.3171

Qwen3.8-Max는 대학원 수준 과학 질문과 직업 과제 표본에서 승리하는데, 이는 해당 세대 모델로서 실제 성과이며 코딩 지수가 138개 중 9위에 오른 이유입니다. 더 어려운 연구 인접 평가에서는 뒤집니다 — CritPT에서 14점 차로 — 그리고 AutomationBench에서는 8.7점 차로 뒤지는데, 이는 무인 컴퓨터 작업과 가장 유사한 평가입니다. 이 둘 중 어느 것이 당신의 업무량에 더 중요하다고 보느냐가 실제 결정입니다. 6.4점이라는 대표 수치는 불일치에 대한 평균이지 판결이 아닙니다.

추가 토큰이 사는 것과 사지 못하는 것

긴 추론 트레이스는 정의상 낭비가 아니다. 어려운 작업에 70,830토큰의 숙고를 쏟는 모델은 더 짧은 모델이 건너뛰고 있을 수 있는 일을 하는 것이며, Qwen3.8-Max가 앞서는 평가들에서는 그 숙고가 그 이유일 가능성이 크다. 실패 모드는 어려운 작업에서만이 아니라 모든 작업에서 그 비용을 치른다는 점이다. 추론 토큰 수는 질문의 난이도가 아니라 모델의 보정(캘리브레이션)의 속성이며, 한 줄짜리 추출을 과도하게 생각하는 모델은 그 비용을 청구한다.

당신의 작업 중 어느 것이 어느 것인지 알아내는 방법은 모델 선택을 전역으로 취급하지 않는 것입니다. 그러면 구성 변경에 해당하는 부분으로 이어집니다.

GPT-6.1 Sol에 대한 자체 모델 카드에는 대상의 제공 수치가 담겨 있습니다: $2.00 / $10.00 요금, 1,050,000토큰 컨텍스트 윈도우, 첫 토큰까지의 p50 4.54초, 그리고 애플리케이션이 실제로 라우팅 기준으로 삼을 가격과 같은 페이지에 있는 저장된 Artificial Analysis 지수 블록입니다.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

하나의 키, 하나의 미터, 두 가지 모델

두 모델 모두 단일 OrcaRouter 엔드포인트를 통해 접근할 수 있습니다. 200개 이상의 모델을 위한 하나의 API이며, 제공업체 정가가 0% 마크업으로 그대로 전달됩니다. Qwen3.8-Max의 OrcaRouter 카드에는 제공 요율이 1,000,000토큰 컨텍스트 창, 텍스트/이미지/비디오 입력 모달리티, 1억 140만 토큰의 7일 볼륨과 나란히 담겨 있습니다. 이는 애플리케이션이 라우팅 기준으로 삼는 숫자들이며, 기사에서 논쟁하는 숫자들 옆에 놓입니다. 이러한 패스스루는 특히 Qwen3.8-Max에 중요합니다. 경제성이 출력 토큰 볼륨에 좌우되는 모델은 공급업체가 언제든 가격을 다시 책정할 수 있는 모델이며, 패스스루 미터는 그 변경이 리셀러의 일정에 따라가 아니라 Alibaba가 발표하는 날 바로 청구서에 반영된다는 뜻입니다.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

여기서 라우팅 계층을 더 흥미롭게 활용하는 방식은 라우팅 DSL로, 이를 통해 애플리케이션 전체에 하나의 모델을 선택하는 대신 여러 모델을 하나의 호출로 구성할 수 있습니다. 야간 작업을 분할하세요: 저렴한 모델이 분류하고 추출하며, GPT-6.1 Sol은 추론과 검증 단계를 담당하고, Qwen3.8-Max는 긴 숙고와 GPQA급 과학 강점이 실제로 답을 바꾸는 작업을 위해 남겨둡니다. 자동 페일오버가 나머지를 담당합니다 — 실행 중 공급자가 성능 저하되면 요청이 이동할 뿐 배치를 실패시키지는 않습니다.

이 중 어느 것도 모델을 골라야 하는 이유가 아닙니다. 그것들은 한 번 고른 모델을 계속 안고 살아갈 필요가 없는 이유입니다.

부름, 그리고 지켜봐야 할 것

숙고가 그만한 값을 입증하는 경우에만 7.5배를 지불하세요. 범용 야간 작업에서는 작업당 $0.724의 GPT-6.1 Sol이 방어 가능한 기본값이며, 연 $1,690은 실제 비용입니다. 검증 가능한 답이 있는 어려운 과학 또는 직업적 추론 과제에서는 GPQA Diamond에서 Qwen3.8-Max의 0.9283이 토큰을 쓸 가치가 있습니다 — 그것이 이 모델이 더 잘하는 특정한 부분입니다.

주목해야 할 것은 Alibaba가 가격을 다시 매기는지 여부다. $2.00/$6.00에 책정된 2.8× 토큰 모델은 토큰이 희소한 것처럼 가격이 매겨져 있다. 하지만 모델 자체의 동작이 토큰을 풍부하게 만든다. 출력 단가가 크게 움직이면 이 글의 계산도 함께 움직이며, 패스스루 미터가 그 일이 일어나는 바로 그날에 그것을 보여줄 것이다.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트