생성된 히어로 타이틀 카드: 헤드라인 'GPT-6 Luna vs Qwen3.8-Max', 부제 '여기서 가장 저렴한 모델은 영상을 보는 모델이 아니다', 푸터 '가격은 OpenAI 및 Alibaba Cloud 기준, 지수 수치는 Artificial Analysis 기준', 그리고 오른쪽 하단에 합성된 OrcaRouter 로고.
Guides & Insights

GPT-6 Luna vs Qwen3.8-Max: 이 비교에서 가장 저렴한 모델이 동영상을 시청할 수 있는 유일한 모델이기도 하다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 조합에 대한 뻔한 프레이밍은 잘못된 것이다. Qwen3.8-Max의 가격은 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $6.00이며, 캐시 읽기는 $0.25다. GPT-6 Luna의 가격은 입력 토큰당 $0.10, 출력 토큰당 $0.50이며, 캐시 읽기는 1센트다. 입력에서는 20배, 출력에서는 12배, 캐시된 입력에서는 50배 — 비교가 시작되기도 전에 이미 결판난 것처럼 보일 만큼 가격 격차가 크다.

아직 결론이 나지 않았다. 두 모델이 같은 요청을 두고 경쟁하는 것이 아니기 때문이다. Qwen3.8-Max는 텍스트, 이미지, 비디오를 받으며, 131,072토큰 출력 상한은 GPT-6 Luna의 128,000보다 약간 높다. GPT-6 Luna는 텍스트와 이미지만 받는다. 알리바바의 모델은 독립 Intelligence Index에서 58점을 받는다 — 에이전트 보드에서 동급 1위다 — 그리고 GPT-6 Luna는 최대 노력 설정에서 37점, 기본 설정에서 29점을 받는다. 하나는 오픈 웨이트 계보와 비디오 입력 모달리티를 갖춘 플래그십이다. 다른 하나는 속도 지표와 1센트 캐시 요금을 갖춘 볼륨 등급이다. 가격 격차는 같은 것에 대한 할인이 아니라, 서로 다른 두 가지에 대한 설명이다.

이 둘 각각이 무엇인지

Qwen3.8-Max는 3.8 세대의 Alibaba 플래그십으로, Max급 체크포인트이며, 그 기반 모델인 Qwen3.8-2.4T-A95B는 2026년 8월 12일 사용자 지정 라이선스로 공개 출시되어 오픈 웨이트를 갖춘 최초의 Max급 Qwen이 되었습니다. 호스팅 플래그십 자체는 여전히 독립 위원회에 의해 독점 모델로 분류되어 있습니다. 이 모델은 1,000,000토큰 컨텍스트 윈도우, 131,072토큰 출력 상한, 텍스트·이미지·비디오 입력, 그리고 낮음·중간·초고로 선택 가능한 추론 강도를 지원합니다. 고정된 Qwen3.8-Max-0902 리비전을 동일한 가격에 이용할 수 있는데, 이는 실질적인 운영 가치가 있는 작은 디테일입니다.

GPT-6 Luna는 2026년 9월 22일 출시된 OpenAI의 효율성 티어로, $2.00/$10.00의 GPT-6 Sol과 $10.00/$50.00의 플래그십 GPT-6 Astra 아래에 위치합니다. 텍스트와 이미지 입력, 텍스트 출력, 최대 입력 922,000인 1,050,000토큰 윈도우, 128,000토큰 출력 상한을 지원하며, 노력 수준은 none부터 low, medium, high, xhigh, max까지이고 기본값은 medium입니다. 폐쇄형, 단일 식별자, API 키가 있는 사람은 누구나 사용할 수 있습니다.

하나는 동영상을 지원하며 기본 형태로 다운로드할 수 있습니다. 하나는 이미지를 지원하고 빠릅니다. 둘 다 대량으로 사용하도록 가격이 책정되어 있습니다. 그 두 진술 사이의 겹침은 가격 비율이 시사하는 것보다 작습니다.

카드, 줄별로

각 차원당 한 줄, 각 줄에 양쪽 모두:

• 1M당 입력 — GPT-6 Luna $0.10 vs Qwen3.8-Max $2.00

• 출력 100만 토큰당 — GPT-6 Luna $0.50 vs Qwen3.8-Max $6.00

• 1M당 캐시된 입력 — 암시적 캐시 읽기의 경우 GPT-6 Luna $0.01 vs Qwen3.8-Max $0.25, 명시적 캐시 읽기는 $0.17, 명시적 캐시 쓰기는 $2.50

• 롱컨텍스트 조항 — GPT-6 Luna는 입력과 캐시를 두 배로 늘리고 272,000 입력 토큰 초과분에 대해 출력을 1.5배로 높이며, 이는 요청 전체에 적용되는 반면, Qwen3.8-Max는 전체 윈도우에 걸쳐 단일 등급으로 적용된다. 이는 Qwen 카드가 단지 약간 더 저렴한 것이 아니라 구조적으로 더 나은 유일한 지점이다

• 컨텍스트 윈도우 — GPT-6 Luna 1,050,000 토큰 vs Qwen3.8-Max 1,000,000 토큰

• {{1}}최대 출력{{/1}} — GPT-6 Luna 128,000 토큰 대 Qwen3.8-Max 131,072 토큰

• 입력 모달리티 — GPT-6 Luna 텍스트 및 이미지 vs Qwen3.8-Max 텍스트, 이미지 및 동영상

• 추론 강도 — GPT-6 Luna none, low, medium(기본값), high, xhigh, max vs Qwen3.8-Max low, medium 및 extra-high

• 지능 지수, 독립 — 최대 노력 기준 GPT-6 Luna 37 vs Qwen3.8-Max 58

• Agentic Index, 독립 평가 — Qwen3.8-Max 58, 동급 1위; 비교 가능한 GPT-6 Luna 수치는 미공개

• 기본 추론 노력 점수 — 기본 중간 설정의 GPT-6 Luna 29 대 최대 설정으로 측정한 Qwen3.8-Max

• 인덱스 작업당 비용, 독립적 — GPT-6 Luna 약 $0.07 vs Qwen3.8-Max $5.41

• GDPval, 독립 평가 — Qwen3.8-Max는 작업당 64턴에서 Elo 1,739를 기록했으며, 이는 해당 평가에서 완료된 작업당 대략 $1.14에 해당합니다. 이에 필적하는 GPT-6 Luna 실행 결과는 공개되지 않았습니다

• AA-Omniscience의 환각률 — Qwen3.8-Max 40%, 이전 세대의 23%에서 후퇴; GPT-6 Luna 77%, 93%에서 하락

• 날짜 지정 스냅샷 — GPT-6 Luna는 단일 롤링 식별자인 반면, Qwen3.8-Max-0902는 동일 가격에 2026년 9월 2일 리비전으로 고정 제공됩니다

• 가중치 — GPT-6 Luna는 비공개, API 전용인 반면, Qwen3.8-Max의 기반인 Qwen3.8-2.4T-A95B 체크포인트는 2026년 8월 12일부터 커스텀 라이선스로 공개되었고, 호스팅된 플래그십은 독점으로 표시됨

• OrcaRouter에서 — GPT-6 Luna는 저희 카탈로그에 없음 vs Qwen3.8-Max는 Alibaba 정가로 라우팅 가능

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

비디오는 기능 라인이 아니라, 다른 워크로드입니다

모달리티 행은 가격 행보다 더 많은 실제 비교를 좌우하는 행이며, 보통 체크박스로 인식됩니다.

Qwen3.8-Max는 동영상 입력을 지원합니다. GPT-6 Luna는 지원하지 않습니다. 화면 녹화, 제품 데모, 강의 녹화, 보안 카메라 영상 또는 UI 워크스루를 파이프라인에서 추론해야 한다면, 비교는 그 지점에서 끝나며 20배의 가격 차이는 무의미해집니다. 당신은 비싼 선택지와 저렴한 선택지 사이에서 고르는 것이 아니라, 선택지가 있는 것과 없는 것 사이에서 고르는 것입니다. 프레임을 추출해 이미지로 전달하는 것은 우회책일 뿐 동등한 대안이 아니며, 한 번이라도 그런 파이프라인을 구축해 본 사람은 비용과 품질 양쪽에서 그 차이를 압니다.

파이프라인이 텍스트와 이미지로 되어 있다면, 모달리티 라인은 침묵하고 가격 라인은 말을 한다. 그것이 정직한 구분이며, 이 페이지에서 다른 무엇을 읽기 전에 자신이 그 구분의 어느 쪽에 있는지 솔직히 밝힐 가치가 있다.

에이전트 격차는 실재하며, 그것이 바로 가격 차이에서 값비싼 절반을 차지하는 부분이다

Qwen3.8-Max는 독립적인 Intelligence Index에서 58점을 기록합니다. GPT-6 Luna는 최대 노력 설정에서 37점, 기본 중간 설정에서는 29점을 기록합니다. 동일한 설정에서는 21점, 기본값에서는 29점 차이입니다 — 단일 점수가 재실행의 노이즈 범위 안에 들어가는 종합 지표에서, 그 정도의 격차는 노이즈가 아닙니다.

Qwen3.8-Max의 입지는 에이전트 작업에 집중되어 있다. 독립적인 Agentic Index에서 58점을 받아 동급 1위를 차지했고, 태스크당 64턴의 GDPval에서 1,739 Elo를 기록했다. 마지막 수치가 특히 말해 주는 바가 크다. 왜냐하면 그것은 모델이 64개의 연속적인 결정 전반에 걸쳐 하나의 태스크를 유지하는 능력을 측정한 것이며, 여기에는 가격표가 따라붙기 때문이다. 그 평가에서 완료된 태스크당 약 $1.14다. 이를 GPT-6 Luna의 인덱스 태스크당 약 $0.07 비용과 비교해 보면, 솔직한 진술은 Qwen이 비싸다는 것이 아니다. Qwen은 훨씬 더 어려운 일을 요구받고 있고, 그것을 해내고 있다는 것이다.

그 따름정리는 GPT-6 Luna의 21점 부족분이 당신의 워크로드 전반에 걸쳐 고르게 분포되어 있지도 않다는 것이다. 짧고 잘 명세되어 있으며 프로그램이 소비하는 작업 — 이 필드를 추출하고, 이 티켓을 분류하고, 이 요청을 라우팅하는 — 에서는 두 모델 모두 거의 항상 동일하게 쓸 수 있는 답을 내놓을 것이고, 인덱스 격차는 당신의 평가에서 보이지 않을 것이다. 끝에 체크포인트가 있는 64개의 순차적 행동을 요구하는 작업에서는, 그 격차가 끝까지 마치는 것과 조용히 중간에 멈추는 것의 차이이며, 그것이 바로 Qwen3.8-Max가 만들어진 작업이고 GPT-6 Luna는 그렇지 않은 작업이다.

한 숫자는 반대 방향으로 작용하며, 묻히기보다 명시될 가치가 있다. 옴니사이언스 보드에서 Qwen3.8-Max의 환각률은 40%로, 이전 세대의 23%에서 상승했다. 이는 상당한 퇴행이며, 벤치마크 수치가 아니라 실제 서비스에서 자신감 있는 오답으로 나타나는 종류의 퇴행이다. GPT-6 Luna는 93%에서 77%로 하락했다. 두 수치 모두 절대적으로 높고, 더 저렴한 모델이 이 지표에서는 여전히 둘 중 더 나쁘다. 어느 수치도 한 모델을 선호할 이유가 되지 못한다. 둘 다 조작된 사실이 큰 비용을 초래하는 일이라면 인간이나 검증자를 프로세스에 남겨 둘 이유가 된다.

롱컨텍스트 조항은 Qwen이 구조에서 우위를 점하는 유일한 부분이다

GPT-6 Luna에는 Qwen3.8-Max에는 없는 조항이 있습니다. 입력 토큰이 272,000개를 초과하는 요청에는 입력 및 캐시 요율의 두 배, 출력 요율의 1.5배가 청구되며, 이는 기준 초과분이 아니라 전체 요청에 적용됩니다. GPT-6 Luna에서 300,000토큰 호출은 28,000토큰을 초과했기 때문에 300,000토큰 전체에 대해 백만 입력 토큰당 $0.20로 청구됩니다. 같은 문서를 두 번의 호출로 나누면 프롬프트를 바꾸지 않고도 비용이 절반으로 줄어듭니다.

Qwen3.8-Max는 1,000,000토큰 전체 윈도우에 걸쳐 가격이 균일하다. 진정으로 거대한 단일 요청의 경우, 그 덕분에 열두 배에 달하는 출력 가격 격차는 보기보다 작아지고, 심지어 역전될 수도 있다. 입력 토큰이 272,000개를 넘으면 GPT-6 Luna의 실질 입력 요율은 두 배인 $0.20으로, 출력 요율은 $0.75로 오르는 반면, Qwen은 $2.00와 $6.00으로 균일하다. 격차는 입력에서 스무 배에서 열 배로, 출력에서 열두 배에서 여덟 배로 좁혀진다. 여전히 크긴 하지만, 300,000토큰의 작업 컨텍스트를 가질 가능성이 가장 높은 워크로드는 바로 두 벤더 모두가 공략하고 있는 에이전트형 워크로드이며, 이를 운영하는 팀들이야말로 이 차이를 알아챌 팀들이다.

또 하나의 구조적 라인은 고정 리비전이다. Qwen3.8-Max-0902는 롤링 식별자와 같은 가격으로 제공되므로, 모델 업데이트 전반에 걸쳐 재현 가능한 동작이 필요한 팀도 추가 비용 없이 이를 확보할 수 있다. GPT-6 Luna는 이에 상응하는 것을 제공하지 않는다. 그것은 요율표에서는 작은 한 줄이고, 포스트모템에서는 큰 한 줄이다.

그중 하나 또는 둘 다 실행하기

Qwen3.8-Max는 OrcaRouter에서 Alibaba의 정가로 제공되며, 패스스루 가격 책정 방식 아래에서는 공급업체의 요금 변경이 당일 우리 쪽에도 반영됩니다. 이 특정 모델과 관련해 우리 라우팅 계층의 두 가지 측면이 특히 진가를 발휘합니다: 자동 페일오버는 공개된 오픈웨이트 기반을 갖춘 호스팅 플래그십이 폐쇄형 단일 벤더 모델보다 업스트림이 많고 그중 하나가 성능 저하될 여지도 더 많기 때문이며, 고정 리비전 처리는 라우트가 Qwen3.8-Max-0902를 명시적으로 고정할 수 있게 해줍니다. 다음 주에 롤링 식별자가 무엇을 가리키게 되든 그 값을 그대로 물려받는 대신이죠.

이 글을 쓰는 시점에 GPT-6 Luna는 우리 카탈로그에 없고 OpenAI 자체 API를 통해 접근하므로, 둘 다 원하는 팀은 이미 OpenAI에 사용 중인 키와 함께 Qwen3.8-Max용 키 하나를 운영하게 됩니다. 이는 또한 라우팅 DSL이 정적 분할보다 더 가치 있는 조합이기도 합니다. 두 모델 사이의 경계가 선호도가 아니라 모달리티 검사와 길이 검사이기 때문입니다. 동영상이 포함된 요청은 다른 모델이 처리할 수 없으므로 Qwen3.8-Max로 가고, 입력 토큰이 272,000개를 초과하는 요청은 다른 모델의 가격 절벽 때문에 그쪽에서 더 비싸지므로 Qwen3.8-Max로 가며, 나머지는 모두 가격이 20분의 1인 모델로 갑니다. 이것은 규칙이며, 애플리케이션 분기가 아니라 구성에 속합니다.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

어느 것, 그리고 언제

다음 중 하나라도 해당하면 Qwen3.8-Max를 선택하십시오. 파이프라인에 비디오 입력이 필요할 때. 요청이 일상적으로 272,000 입력 토큰을 초과할 때 — 이 경우 Qwen3.8-Max의 플랫 티어가 GPT-6 Luna의 재가격 책정을 앞섭니다. 출력이 128,000 토큰을 초과할 때. 검증 가능한 엔드포인트가 있는 장기 지평의 에이전틱 실행을 수행할 때 — 이 경우 에이전틱 보드에서의 58점과 작업당 64턴에서의 GDPval 1,739 Elo가 중요한 증거입니다. 또는 재현성을 위해 고정된 리비전이 필요하고 그 비용을 기꺼이 지불할 의향이 있을 때 — 이는 롤링 식별자와 같은 가격이라면, 귀하가 그 비용을 지불할 의향이 없다는 뜻입니다.

해당 사항이 하나도 적용되지 않고 워크로드가 대량이며 프로그램이 소비하고 텍스트와 이미지로 구성되며 짧다면 GPT-6 Luna를 선택하세요. 분류, 추출, 라우팅, 대량 요약, 신중한 답보다 빠른 답이 필요한 에이전트의 내부 루프. $0.10/$0.50에 1센트의 캐시 읽기, 완료된 작업당 비용이 Qwen3.8-Max의 약 15분의 1이라면 계산은 비교가 되지 않습니다. effort 매개변수를 명시적으로 설정하세요 — 기본값은 medium이고, 대표 수치인 37은 최대 effort 값입니다 — 그리고 긴 호출은 272,000토큰 경계의 올바른 쪽에 유지하세요.

이 비교가 불러들이는 실수는 20배에 달하는 입력 가격을 하나의 판정으로 읽는 것이다. 그것은 하나의 워크로드 형태에 대한 판정이며, 다른 형태를 결정하는 세 가지 조건에 대해서는 침묵한다: 요청에 비디오가 포함되는지, 272,000토큰을 넘어서는지, 그리고 답변이 64개의 순차 단계를 견뎌야 하는지.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트