
Qwen3.8 Max Prime: Alibaba, 자사 플래그십 옆에 두 번째 요금표를 내놓다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 584 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
2026년 9월 22일, 항저우의 Yunqi Conference에서 Alibaba의 MaaS 사업 부문은 Prime mode — 优速模式 —라고 부르는 서빙 티어를 발표하고, 이를 위한 요금표에 새 모델 ID를 올렸습니다: qwen3.8-max-prime. 그 ID는 새 모델이 아닙니다. 그것은 Qwen3.8-Max, 2.4조 매개변수 희소 전문가 혼합(MoE) 플래그십이며, 일반 제공(GA)에 도달한 날짜는 2026년 8월 3일이며, 더 빠른 경로를 통해 제공됩니다. Qwen3.8 Max Prime은 기본 모델과 동일한 가중치, 동일한 컨텍스트 창, 동일한 도구, 동일한 사용 한도를 갖습니다. 다른 점은 처리량과 가격이며, 가격은 대략 두 배입니다.
이는 7주 만에 두 번째로 Alibaba가 Qwen3.8-Max의 판매 방식을 바꾼 것이지, 제품 자체를 바꾼 것은 아닙니다. 9월 2일 이 회사는 코딩과 에이전트 작업에 중점을 둔 API 전용 포스트 트레이닝 리프레시를 Qwen3.8-Max-0902라는 이름으로 출시했습니다. 9월 22일에는 속도 등급이 추가되었습니다. 둘 다 정식 출시가 아니었으며, 어느 쪽이든 출시로 해석하면 돈을 잃게 됩니다.

Prime mode는 실제로 무엇인가
Alibaba의 자체 문서에서는 Prime 모드를 "출력 속도에 민감한 시나리오"—AI 코딩 어시스턴트, 다단계 에이전트 추론, 실시간 대화—를 위한 채널로 설명하며, 그 이점을 분명히 밝힙니다: TPS는 표준 API의 1.5~2배. 설정할 새 매개변수는 없습니다. 사용자는 model 값을 Prime ID로 전환하면 빠른 차선에 올라타게 됩니다.
문서는 변하지 않는 부분에 대해서도 똑같이 명확히 밝힙니다: "모델이 지원하는 기능과 사용 제한은 원래 모델과 동일합니다." 따라서 더 큰 컨텍스트도, 더 나은 추론 모드도, 추가 도구 표면도 없습니다. 뒤에 더 많은 여유를 갖춘 동일한 서빙 스택일 뿐입니다.
The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.
요금표를 주의 깊게 읽어 보세요.
Alibaba의 국제 가격 페이지에는 두 ID가 나란히 나열되어 있어 비교가 유난히 깔끔합니다. 백만 토큰당:
• 입력 — qwen3.8-max-prime $3.301 vs qwen3.8-max $1.65
• 출력 — qwen3.8-max-prime $9.902 vs qwen3.8-max $4.951
• 캐시 적중 — qwen3.8-max-prime $0.413 vs 같은 페이지에서 할인 항목으로 표기된 표준 ID의 캐시 읽기 요율
• 비율 — 입력과 출력 모두 2.0×, 반올림한 근사치가 아니라 공개된 수치의 문자 그대로의 산술
중국 요금표에서는 위안화로도 동일한 2배가 적용됩니다: Prime ID는 백만당 입력 ¥24, 출력 ¥72이고, 표준 버전은 ¥12와 ¥36이며, 캐시 적중은 ¥3입니다.
널리 인용되는 Qwen3.8-Max의 출시 가격은 백만 토큰당 입력 $2, 출력 $6입니다. 그것은 8월 보도에서 내세운 헤드라인이며, 오늘 국제 요금표에 적힌 숫자는 아닙니다. 지출을 모델링하고 있다면 출시 헤드라인 대신 해당 지역의 요금표를 사용하고, 확정하기 전에 다시 확인하세요 — Alibaba는 9월 2일 이후 이 페이지를 두 번 수정했습니다.

스로틀링 규칙이 진짜 기능이다
대부분의 사람들이 그냥 지나치는 문장이 바로 프로덕션에서 가장 중요한 문장입니다. Alibaba의 Prime 문서에 따르면, 사용량이 요청 제한에 도달했을 때, 플랫폼에 아직 여유 리소스가 있다면 스로틀링되지 않습니다, 따라서 실제로 사용할 수 있는 처리량은 명시된 한도 아래로 떨어지지 않습니다.
이는 하드 플로어를 가진 소프트 상한으로, 표준 티어 한도와는 다른 형태입니다. 즉, 1.5–2×라는 수치는 상한에 대한 제한이 아니라 하한에 대한 약속입니다. 경합 상황에서는 해당 한도를 받고, 유휴 용량에서는 더 많이 받을 수 있습니다. 수십 개의 순차 호출을 실행하는 에이전트 루프에서는 가장 느린 호출의 테일 지연 시간이 워크플로의 완료 여부를 결정하기 때문에, 이러한 비대칭성은 원시 TPS 배수보다 더 가치가 있습니다.
표준 모델의 동적 TPM 한도는 월별 Model Studio 지출에 따라 계층화됩니다 — 동일한 문서군에서는 기본 qwen3.8-max ID가 계층별로 5,000,000, 10,000,000, 20,000,000 TPM으로 표시되며, 매월 갱신됩니다. Prime은 그 구조를 제거하지 않습니다; 그것이 체감되는 방식을 바꿉니다.

아직 아무도 측정하지 못한 것
여기에 솔직한 격차가 있습니다. 1.5–2×라는 수치는 제조사가 밝힌 것입니다. 우리가 찾을 수 있는 독립적인 Prime 모드 처리량 측정치는 없으며, 이는 중요한데, 표준 빌드 자체의 독립적인 수치도 속도 면에서는 호의적이지 않기 때문입니다.
자체 하네스에서 모델을 측정하는 Artificial Analysis는 현재 0902 빌드의 Qwen3.8-Max에 대해 Intelligence Index 45점을 부여하며, GPQA Diamond 92.8%, Terminal-Bench Hard 38.9%, Humanity's Last Exam 43.1%를 기록하고, 작업당 측정 비용을 $5.41로 산정합니다. 이는 표준 SKU에 대한 독립적인 수치이며 2026-09-24에 캡처되었습니다. 또한 이 지수는 8월 출시 보도 이후 개정되었다는 점을 상기시켜 주므로, 더 오래된 지수 값을 현재 값 옆에 놓고 추세라고 부르지 마십시오.
AA에 없는 것은 Prime 행입니다. 누군가 그것을 측정하기 전까지, 속도 주장은 Alibaba만의 것이며, 올바른 태도는 최상위 범위를 가정하기보다 자신의 워크로드에서 테스트하는 것입니다.
이로써 라우팅 결정은 어떻게 되는가
Prime은 Alibaba가 자체 API에서 판매하는 티어이며, 그것을 구할 수 있는 유일한 곳입니다. 우리는 여기서 qwen3.8-max-prime을 호스팅하지 않습니다. OrcaRouter가 라우팅하는 것은 표준 Qwen3.8-Max와 그 날짜 지정 핀 Qwen3.8-Max-0902, 둘 다 나머지 Qwen3.8 패밀리 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — 와 동일한 키에 있으며 200개 이상의 다른 모델과 함께 제공되며, 공급자 정가는 0% 마크업으로 전달됩니다그 마지막 부분이 바로 9월 2일 리프레시와 향후 모든 Max 요금 변경이 Alibaba에 적용되는 같은 날 우리 쪽에도 적용되는 이유입니다.
실용적인 분할은 이렇게 생겼습니다. 기본 트래픽은 standard ID에서 라우터를 통해 실행하세요. 그러면 단일 제공자 경로가 저하될 때 페일오버가 보호해 줍니다. 실제 경과 시간 지연이 곧 제품인 특정 호출 — 대화형 완성, 빡빡한 에이전트 단계 — 은 Prime으로 옮기고, 그 결정은 1.5×가 아니라 2×를 기준으로 가격을 매기세요.
누가 전환해야 하고, 누가 기다려야 하는가
사용자가 토큰을 기다리고 있다면 전환하세요: 자동 완성, 채팅 턴, 사람이 지켜보는 코드 편집 루프 같은 경우입니다. 속도 범위의 최상단에서 Prime은 제거된 지연 시간 1초당 비용 중립적입니다 — 정확히 절반의 시간을 위해 정확히 두 배를 지불합니다. 범위의 하단에서는 1.5×를 위해 2×를 지불하는 셈이며, 이는 절약된 1초당 33%의 프리미엄입니다. 워크로드가 밤새 실행되는 배치 작업이라면, 그 프리미엄은 당신에게 필요했던 것을 아무것도 사주지 않습니다.
잠깐, 비용 모델이 $2/$6 출시 헤드라인을 기준으로 세워졌다면, 또는 요청이 입력 비중이 높다면. 공급업체의 속도 주장은 TPS — 초당 출력 토큰 — 에 관한 것이고, prefill은 다른 파이프라인 단계입니다. 긴 컨텍스트 요청은 출력이 더 빨리 도착하든 아니든 입력 토큰에 두 배를 지불합니다. 마이그레이션하기 전에 그 경우를 측정하세요.
그리고 요금표의 날짜를 확인해 보세요. Qwen3.8-Max는 8월 3일부터 시장에 나와 있었고, 한 번 리프레시되었으며, 한 번 리패키징되었지만, 여전히 고작 7주 된 모델입니다. 뉴스가 되는 건 티어이고, 모델은 아닙니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
