Qwen 3.8 vs GPT-5.6: 이제 둘 다 가격표가 붙었는데, 어떤 쪽이 이길까?
Guides & Insights

Qwen 3.8 vs GPT-5.6: 이제 둘 다 가격표가 붙었는데, 어떤 쪽이 이길까?

작성자

jinhao song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

알리바바가 미리 공개했을 때Qwen3.8-Max에 대한 커뮤니티의 반응은 2026년 7월 19일 상하이에서 즉각적이었다: 이 2.4조 매개변수 모델은 "GPT-5.6보다 앞서고 Fable 5보다는 약간 뒤처진다"고 알려졌다. OpenAI의 GPT-5.6의 주력Sol 구성은 독립적인 Artificial Analysis Intelligence Index에서 2위를 차지하고 있으며, Fable 5보다 1점 낮다. 따라서 그건 공개된 수치 없이 하기에는 큰 주장이었다.

그 이후로 두 가지가 바뀌었다. Qwen3.8-Max는 2026년 8월 3일에 일반 공개되었으며 실제 요금표와 실제 벤치마크 테이블을 갖추었다. 그리고 7월 31일, OpenAI는 GPT-5.6 제품군의 가격을 인하했다 — Terra는 $2/$12, Luna는 $0.20/$1.20로, Sol은 프리미엄 등급으로 변동이 없다. 따라서 이번 비교는 더 이상 리더보드를 상대로 한 주장이 아니라, 실제로 가격이 책정되고 문서화된 두 모델을 비교하는 것이다.

빌더를 위한 참고 사항 — 이와 같은 주장을 검증하는 가장 빠른 방법은 두 모델을 직접 프롬프트로 실행해 보는 것입니다. OrcaRouter는 하나의 OpenAI 호환 엔드포인트 뒤에 200개 이상의 모델을 연결하므로, 두 개의 SDK를 연동하지 않고도 Qwen 3.8 Max와 GPT-5.6을 같은 작업에서 겨루게 할 수 있습니다.

TL;DR 평결. GA 버전 Qwen3.8-Max는 공격적인 가격으로 책정되었습니다 — 1M 토큰당 $2 / $6, 1M 토큰 전체에 걸쳐 동일 — 이는 GPT-5.6 Terra와 동일한 입력 가격이지만 Terra 출력 비용의 절반이며 Sol보다 훨씬 낮습니다. 자체 보고 수치는 강력합니다(GPQA Diamond 92.6, Terminal-Bench 2.1 86.6). 그러나 GPT-5.6 Sol은 프로덕션 사용을 결정하는 두 가지에서 여전히 승리합니다. 그것은 검증된 2위로 Artificial Analysis Intelligence Index(~59)에 올라 있으며 빠릅니다 — Cerebras 하드웨어에서 최대 750 tokens/sec. Qwen3.8-Max는 여전히 어떤 독립 평가 기관에서도 점수를 받지 못했습니다. 따라서 Qwen은 원샷 품질에서 GPT-5.6과 충분히 맞먹을 수 있고 출력 가격에서 Terra를 분명히 이깁니다. 그러나 GPT-5.6은 심사를 거친 증명과 처리량에서 승리하며, 이것이 종종 승부를 좌우합니다.

주요 시사점

Qwen3.8-Max는 2026년 8월 3일부터 GA입니다. 공개된 가격은 $2 / $6이며, 1M 토큰당 1M 토큰 컨텍스트 전체에 걸쳐 동일합니다.

GPT-5.6 Terra($2 / OpenAI의 7월 31일 인하 후 $12)와 비교하면, Qwen은 입력 요금은 동일하고 출력 요금은 절반입니다. Sol과 비교하면 Qwen은 훨씬 저렴합니다.

GPT-5.6 Sol은 감사 평가에서 #2를 기록했습니다 (AA Intelligence Index ~59 기준). Artificial Analysis는 가장 어려운 STEM 문제에서 선두를 차지한다고 언급합니다. Qwen3.8-Max는 아직 점수가 매겨지지 않았습니다 (AA 및 LMArena 기준).

속도가 가장 극명한 차이를 보여준다. GPT-5.6은 최대 750 tokens/sec를 Cerebras에서 제공한다. Qwen은 프리뷰 직접 테스트에서 가장 느린 모델이었는데, 이는 GA 서비스 이전의 결과이므로 재테스트가 필요하다.

Qwen의 벤더 테이블은 신뢰할 수 있지만 동료 검토를 거치지 않았습니다: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (이전 모델의 40.7에서 상승).

개방성이 그들을 영구히 갈라놓는다: Qwen은 이번 주 안에 오픈 가중치와 약 17GB VRAM이 필요한 Qwen3.8-27B를 약속하는 반면, GPT-5.6은 폐쇄형이며 API 전용입니다.

정확성 참고: 모든 Qwen3.8-Max 품질 수치는 Alibaba가 보고한 것이며 제3자에 의해 검증되지 않았습니다. GPT-5.6 수치는 Artificial Analysis에서 제공한 것이며 OpenAI 자체 보고와 다를 수 있습니다. GPT-5.6 제품군 가격은 OpenAI의 2026년 7월 31일 인하를 반영합니다. Qwen 가격은 GA 요금표를 기준으로 하며 7월의 프리뷰 할인보다 우선합니다.

사양과 가격, 나란히

여기 확실한 데이터가 있습니다. 각 수치에는 출처가 표기되어 있습니다.

• 제조사 / 상태 — Qwen3.8-Max: Alibaba; GA (2026년 8월 3일); GPT-5.6 Sol: OpenAI; 비공개 플래그십 (변형 Sol / Terra / Luna)

• 아키텍처 — Qwen3.8-Max: 총 ~2.4T, 희소 MoE (활성 파라미터 수는 아직 공개되지 않음); GPT-5.6 Sol: 비공개; 아키텍처 미공개

• 컨텍스트 창 — Qwen3.8-Max: 1M 토큰 (추론 시 983,616; 최대 출력 131,072); GPT-5.6 Sol: 롱컨텍스트 플래그십

• AA Intelligence Index — Qwen3.8-Max: 아직 미채점; GPT-5.6 Sol: ~59 — #2 (Artificial Analysis)

• 검증된 강점 — Qwen3.8-Max: 제3자 검증 없음; GPT-5.6 Sol: 가장 어려운 STEM 문제 해결 선도 (Artificial Analysis)

• 공급업체 보고 강점 — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (알리바바 보고); GPT-5.6 Sol: n/a

• 속도 — Qwen3.8-Max: p50 TTFT 1.64초 (OrcaRouter 7일 원격측정); 프리뷰 실사용 테스트에서 가장 느린 모델; GPT-5.6 Sol: Cerebras에서 최대 750 tok/s (Artificial Analysis)

• 가격 (입력/출력) — Qwen3.8-Max: $2.00 / $6.00 1M당, 고정 요금; 캐시 입력 $0.25; GPT-5.6: Terra $2 / $12, Luna $0.20 / $1.20, Sol 프리미엄 (AA당 Fable 비용의 약 1/3)

• 공개 가중치 — Qwen3.8-Max: 이번 주 내 공개 약속됨 (아직 라이선스 없음); GPT-5.6: 없음 — 폐쇄형 / API 전용

이 비교를 규정하는 두 가지가 있는데, 둘 다 7월 이후 새로 생긴 것이다.

첫째, 가격 이야기는 그저 싼 것이 아니라 정말로 흥미로워졌습니다. 7월에 Qwen의 장점은 예산에 맞출 수 없는 할인이었습니다. 이제 비교는 구체적이며 등급별로 나뉩니다. 이에 비해, Terra at $2 / $12의 경우, Qwen은 입력 속도를 정확히 일치시키고 출력 속도를 절반으로 줄입니다 — 출력이 지출을 지배하는 추론 중심 작업에서 진짜 이점입니다. 이에 비해, Luna at $0.20 / $1.20의 경우, Qwen은 10배 더 비싸고, Luna는 대량의 단순 작업에 더 나은 선택입니다. 이에 비해, Sol의 경우, Qwen은 훨씬 쌉니다. 따라서 "어느 것이 더 싼가"는 이제 어떤 GPT-5.6을 말하는지에 따라 세 가지 다른 답이 있습니다 — 그리고 솔직한 평가는 OpenAI의 7월 31일 인하가 격차를 상당히 좁혔다는 것입니다.

둘째로, 속도 부문은 여전히 이 둘이 가장 크게 갈리는 지점이며, 여전히 OpenAI 쪽에 유리합니다. Artificial Analysis는 Cerebras 실리콘에서 GPT-5.6 Sol의 처리 속도를 초당 최대 750토큰으로 측정합니다. 알리바바의 GA 자료 어디에도 Qwen3.8-Max가 그런 처리량을 위해 설계되었다는 암시는 없으며, 프리뷰 시절 그 모델을 자신이 사용해 본 것 중 가장 느리다고 했던 리뷰어가 측정한 것은 정확히 처리량이 누적되는 긴 에이전틱 실행이었습니다. 워크로드가 대화형, 에이전틱, 또는 대용량이라면, 그 격차는 품질이 논의에 오르기도 전에 승부를 결정지을 수 있습니다.

증명: GA 벤치마크 표가 해결하는 것과 해결하지 못하는 것

Alibaba가 GA에서 수치를 공개한 결정은 프리뷰에 비해 확실한 개선이다. 프리뷰에서는 커뮤니티의 'GPT-5.6보다 앞선다'는 주장이 전혀 공개된 근거에 기반하지 않았다. 그 표는 강력하다: GPQA Diamond 92.6 대학원 수준 과학에서, PaperBench 93.0 연구 결과 재현에서, Terminal-Bench 2.1 86.6 실제 셸 운영에서, OSWorld-Verified 86.1 데스크톱 GUI 구동에서. 세대적 코딩 도약이 가장 두드러진다 — FrontierSWE 73.5전작의 40.7에 비해, 그리고 DeepSWE 1.1 56.621.6에 비해.

이 표는 GPT-5.6 비교를 확정하지 않는다. 두 가지 이유가 있다.

첫째는 출처(provenance)입니다. 모든 수치는 알리바바가 자체 테스트 하네스에서 생산한 것입니다. 벤더 표는 선별된 것이지 무작위로 표집된 것이 아닙니다. 연구소는 자사가 좋게 보이는 벤치마크만 발표하고 나머지는 생략합니다. 반면 OpenAI의 Intelligence Index #2 순위는 결과에 이해관계가 없는 평가자가 부여한 것입니다. 특히 Artificial Analysis는 GPT-5.6 Sol이 가장 어려운 STEM 문제에서 선두를 차지했다고 구체적으로 평가하는데, 이는 정확히 Qwen의 GPQA Diamond 92.6이 차지하려는 영역입니다. 그 주장 중 하나는 검증되었습니다.

둘째, 알리바바의 가장 약한 수치가 시사하는 바가 크다. IFBench 82.8 — 제약 조건 하 지시 수행 점수로, 해당 표에서 가장 낮은 점수이며, 프리뷰 기간 동안 가장 일관되게 제기된 비판과 정확히 일치한다. 즉, 모델이 과도하게 응답하고, 범위를 넘어서며, 아무도 요청하지 않은 것을 추가한다는 것이다. 데모에서는 매력적이지만, 출력 비용이 토큰 100만 개당 6달러로 청구되고 정확한 형식이 필요한 상황에서는 비용이 많이 든다. 다운스트림 단계가 출력을 파싱하는 에이전틱 파이프라인의 경우, 지시 수행의 규율이 GPQA 1점보다 더 중요하다.

기준을 삼자면, 이전 모델 Qwen3.7-Max가 기록한 점수는46이며, AA Intelligence Index에서 GPT-5.6 Sol의 ~59점과 견준 것이다. 한 세대 만에 13점 차를 좁히는 것은 놀라운 도약일 것이다. 가능한 일이다 — 알리바바 자체의 FrontierSWE가 거의 두 배가 된 것은 실질적인 진전을 시사한다 — 그러나 공식 검증자가 숫자를 게시하기 전까지는 "GPT-5.6보다 앞선다"는 입증되지 않은 주장일 뿐 결과는 아니다.

실제 비용: 티어별 실전 예제

문서 분석이나 다단계 계획 수립에서 전형적인 형태인, 호출당 100,000개의 컨텍스트 토큰을 전송하고 10,000개의 출력 토큰을 생성하는 추론 에이전트를 생각해 보세요.

Qwen3.8-Max: 0.1M × $2 = $0.20, 더하기 0.01M × $6 = $0.06. ≈ 호출당 $0.26.

GPT-5.6 Terra: 0.1M × $2 = $0.20, 0.01M × $12 = $0.12 추가. ≈ $0.32/호출.

GPT-5.6 Luna: 0.1M × $0.20 = $0.02, 더하기 0.01M × $1.20 = $0.012. ≈ 호출당 $0.03.

• 하루 5,000콜 기준: Qwen ≈ $1,300, Terra ≈ $1,600, Luna ≈ $160.

두 가지 교훈이 도출된다. Terra를 상대로 Qwen의 절감 효과는 실재하지만 미미하다 — 이 형태에서는 약 19% — 그리고 Qwen이 Fable 5나 Sol 같은 프리미엄 모델을 상대로 누리는 자릿수 차이 수준의 우위와는 거리가 멀다. OpenAI가 구조적으로 비싸다고 가정했던 사람이라면 수정해야 한다: 7월 31일 인하가 중간 티어에서 Qwen의 가격 경쟁력을 무력화하는 작업을 대부분 해냈다.

Qwen이 확연히 앞서는 부분은 긴 컨텍스트와 캐싱입니다. $2/$6 요금이 전체 1M 토큰 구간에 걸쳐 균일하기 때문에 900,000토큰 프롬프트는 짧은 프롬프트와 토큰당 비용이 같지만, 많은 경쟁사는 긴 입력에 추가 요금을 부과합니다. 또한 캐시된 입력은 $0.25 per 1M로 반복 컨텍스트 작업에서 입력 비용을 8× 절감합니다. 컨텍스트가 캐시되면 위 호출 비용은 $0.26에서 약 $0.09로 줄어듭니다. 에이전트가 매 턴마다 거의 동일한 컨텍스트를 다시 읽는다면, 지속적인 이점은 헤드라인 요금이 아니라 바로 여기에 있습니다.

개방성과 27B 형제

GPT-5.6은 절대 자체 호스팅이 불가능할 것이다. Qwen3.8-Max는 가능할 수도 있다 — 알리바바는 이번 주 안에 가중치가 공개된다고 밝혔지만 — 플래그십 모델은 현실적인 대상이 아니다: 4비트 기준 약 1.2TB 규모는 H200 하나당 약 141GB와 비교하면 8개 이상의 최상위 가속기가 필요하며, 활성 파라미터 수가 아직 공개되지 않았기 때문에 그 정도 하드웨어로 얻을 수 있는 처리량조차 모델링할 수 없다. 또한 아직 라이선스 텍스트가 없어 상업적 사용 가능성은 공식적으로 미정 상태다.

동시에 발표된 Qwen3.8-27B는 Qwen에 대한 관심이 순수 성능보다는 통제에 있는 사람들에게 더 중요한 출시입니다. 또한 오픈 웨이트(open-weights)로 공개되며, 약 17GB의 VRAM — 단일 하이엔드 소비자용 그래픽 카드 — 에서 실행된다고 합니다. 이는 2.4T 플래그십이 결코 할 수 없는 방식으로 진정한 온프레미스 옵션이 됩니다. 데이터 레지던시 때문에 Qwen과 GPT-5.6을 비교하고 있다면, 27B가 평가할 모델입니다.

자주 묻는 질문

Qwen 3.8이 GPT-5.6보다 더 좋은가요?

존재하는 증거로는 그렇지 않습니다. Alibaba의 GA 테이블은 강력하지만(GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) 전적으로 자체 보고된 수치이며, 독립적인 평가자가 이 모델을 평가한 적이 없습니다. GPT-5.6 Sol은 감사를 받은 #2 Intelligence Index(~59)를 보유하고 있으며, Artificial Analysis 기준 가장 어려운 STEM 문제에서 선두를 달리고 초당 최대 750토큰을 처리합니다. GPT-5.6은 증명과 속도에서 승리합니다.

"Qwen 3.8이 GPT-5.6보다 앞서 있다"는 주장이 사실인가요?

처음에는 커뮤니티의 평가로 시작됐으며 아직 검증되지 않았다. GA는 알리바바 자체 벤치마크 표만 제공했을 뿐 제3자 점수는 없다 — Artificial Analysis와 LMArena는 아직 미평가 상태다. 이전 모델인 Qwen3.7-Max는 Sol의 약 59점에 비해 46점을 기록했으므로, 이 주장이 문자 그대로 성립하려면 한 세대 만에 매우 큰 도약이 필요하다.

어느 것이 더 저렴한가요, Qwen 3.8 아니면 GPT-5.6?

등급에 따라 다릅니다. 그리고 OpenAI가 가격을 인하한 7월 31일에 답이 바뀌었습니다. Qwen3.8-Max는 100만 개당 $2 / $6입니다. GPT-5.6 Terra는 $2 / $12입니다 — 입력은 같고 출력은 두 배이므로, 여기서는 Qwen이 승리합니다. Luna는 $0.20 / $1.20으로, Qwen보다 약 10배 저렴합니다. Sol은 프리미엄이므로, Qwen이 Sol보다 훨씬 저렴합니다.

어느 것이 더 빠릅니까?

GPT-5.6는 처리량(throughput)에서 확실히 우위를 점한다. Artificial Analysis는 Cerebras 하드웨어에서 초당 최대 750토큰을 기록한다고 보고한다. Qwen3.8-Max는 OrcaRouter의 7일 원격 측정(텔레메트리)에서 첫 토큰 도달 시간(time-to-first-token) p50이 1.64초로 나타나지만, 프리뷰 시절 리뷰어들은 긴 에이전틱 빌드에서 매우 느리다고 평가했다. 이 평가는 GA 서빙 이전의 것이므로 재테스트가 필요하다.

Qwen 3.8 Max가 프리뷰를 벗어났나요?

네, 2026년 8월 3일입니다. 이제 게시된 요금표와 OpenAI 및 DashScope 호환 엔드포인트가 있으므로, 90% 할인이 포함된 Qoder 크레딧 캠페인이라는 7월의 설명은 더 이상 판매 방식을 설명하지 않습니다.

Qwen 3.8을 자체 호스팅해서 OpenAI 요금을 피할 수 있나요?

현실적으로는 플래그십이 아닙니다. 가중치는 이번 주 안에 제공될 예정이지만 라이선스는 아직 공개되지 않았으며, 4비트 기준 약 1.2TB라면 H200급 GPU 8개 이상이 필요합니다. 동시에 발표된 Qwen3.8-27B는 VRAM 약 17GB로 알려져 있어 실용적인 선택입니다.

오늘은 어떤 걸 사용해야 할까요?

GPT-5.6 Sol은 지연 시간에 민감하거나, 대화형이거나, 추론이 중요한 작업에 적합하며, 검증된 품질이 중요한 경우에 사용하세요. Luna는 대규모 단순 작업에 적합하며, 비용이 압도적으로 저렴합니다. Qwen3.8-Max는 긴 컨텍스트와 프롬프트 캐싱이 비용의 대부분을 차지하는 경우에 적합합니다 — 100만 토큰당 고정 요금과 $0.25의 캐시된 입력 가격이 이 제품의 가장 큰 강점입니다.

결론

Qwen 3.8 vs GPT-5.6는 7월에 비해 더 공정한 대결이며, 가격 면에서는 Qwen 팬들이 예상했던 것보다 약간 덜 일방적이다. Qwen3.8-Max는 GA 출시와 함께 실제 가격, 신뢰할 수 있는 자체 보고 벤치마크 표, 그리고 1M-토큰 고정 요율과 저렴한 캐싱을 갖추어 장문 컨텍스트 작업에 진정으로 매력적이다. 이는 홍보적 이점이 아니라 구조적 이점이다.

하지만 OpenAI의 7월 31일 가격 인하는 중간 계층에서 비용 논리를 약화시켰습니다. 이제 Terra는 입력(input)에서 Qwen과 동등해졌고, GPT-5.6은 여전히 두 가지 결정적 속성을 지니고 있습니다. 결과에 이해관계가 없는 평가자가 감사한 #2 순위와, Qwen이 접근조차 하지 못한 초당 최대 750토큰의 처리량이 그것입니다. 주목해야 할 두 가지가 있습니다. Qwen3.8-Max의 첫 독립 Intelligence Index 점수와, 라이선스와 함께 공개될 가중치입니다. 그때까지는 형태에 따라 라우팅하세요. 속도와 검증이 중요할 때는 GPT-5.6, 컨텍스트 길이와 캐시 적중이 비용을 좌우할 때는 Qwen을 선택하고, 자신의 프롬프트로 직접 확인하십시오.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube