Qwen3.8 Max Prime를 위한 히어로 타이틀 카드, Qwen3.8-Max 플래그십을 위한 알리바바의 1.5-2배 처리량 서빙 티어, 스펙 칩에는 동일한 2.4T 총량 및 ~95B 활성, Prime은 $3.301/$9.902, 스탠더드는 $1.65/$4.951로 표기.
Guides & Insights

Qwen3.8 Max Prime: Alibaba, 자사 플래그십 옆에 두 번째 요금표를 내놓다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 22일, 항저우의 Yunqi Conference에서 Alibaba의 MaaS 사업 부문은 Prime mode — 优速模式 —라고 부르는 서빙 티어를 발표하고, 이를 위한 요금표에 새 모델 ID를 올렸습니다: qwen3.8-max-prime. 그 ID는 새 모델이 아닙니다. 그것은 Qwen3.8-Max, 2.4조 매개변수 희소 전문가 혼합(MoE) 플래그십이며, 일반 제공(GA)에 도달한 날짜는 2026년 8월 3일이며, 더 빠른 경로를 통해 제공됩니다. Qwen3.8 Max Prime은 기본 모델과 동일한 가중치, 동일한 컨텍스트 창, 동일한 도구, 동일한 사용 한도를 갖습니다. 다른 점은 처리량과 가격이며, 가격은 대략 두 배입니다.

이는 7주 만에 두 번째로 Alibaba가 Qwen3.8-Max의 판매 방식을 바꾼 것이지, 제품 자체를 바꾼 것은 아닙니다. 9월 2일 이 회사는 코딩과 에이전트 작업에 중점을 둔 API 전용 포스트 트레이닝 리프레시를 Qwen3.8-Max-0902라는 이름으로 출시했습니다. 9월 22일에는 속도 등급이 추가되었습니다. 둘 다 정식 출시가 아니었으며, 어느 쪽이든 출시로 해석하면 돈을 잃게 됩니다.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

Prime mode는 실제로 무엇인가

Alibaba의 자체 문서에서는 Prime 모드를 "출력 속도에 민감한 시나리오"—AI 코딩 어시스턴트, 다단계 에이전트 추론, 실시간 대화—를 위한 채널로 설명하며, 그 이점을 분명히 밝힙니다: TPS는 표준 API의 1.5~2배. 설정할 새 매개변수는 없습니다. 사용자는 model 값을 Prime ID로 전환하면 빠른 차선에 올라타게 됩니다.

문서는 변하지 않는 부분에 대해서도 똑같이 명확히 밝힙니다: "모델이 지원하는 기능과 사용 제한은 원래 모델과 동일합니다." 따라서 더 큰 컨텍스트도, 더 나은 추론 모드도, 추가 도구 표면도 없습니다. 뒤에 더 많은 여유를 갖춘 동일한 서빙 스택일 뿐입니다.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

요금표를 주의 깊게 읽어 보세요.

Aliba​ba의 국제 가격 페이지에는 두 ID가 나란히 나열되어 있어 비교가 유난히 깔끔합니다. 백만 토큰당:

• 입력 — qwen3.8-max-prime $3.301 vs qwen3.8-max $1.65

• 출력 — qwen3.8-max-prime $9.902 vs qwen3.8-max $4.951

• 캐시 적중 — qwen3.8-max-prime $0.413 vs 같은 페이지에서 할인 항목으로 표기된 표준 ID의 캐시 읽기 요율

• 비율 — 입력과 출력 모두 2.0×, 반올림한 근사치가 아니라 공개된 수치의 문자 그대로의 산술

중국 요금표에서는 위안화로도 동일한 2배가 적용됩니다: Prime ID는 백만당 입력 ¥24, 출력 ¥72이고, 표준 버전은 ¥12와 ¥36이며, 캐시 적중은 ¥3입니다.

널리 인용되는 Qwen3.8-Max의 출시 가격은 백만 토큰당 입력 $2, 출력 $6입니다. 그것은 8월 보도에서 내세운 헤드라인이며, 오늘 국제 요금표에 적힌 숫자는 아닙니다. 지출을 모델링하고 있다면 출시 헤드라인 대신 해당 지역의 요금표를 사용하고, 확정하기 전에 다시 확인하세요 — Aliba​ba는 9월 2일 이후 이 페이지를 두 번 수정했습니다.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

스로틀링 규칙이 진짜 기능이다

대부분의 사람들이 그냥 지나치는 문장이 바로 프로덕션에서 가장 중요한 문장입니다. Aliba​ba의 Prime 문서에 따르면, 사용량이 요청 제한에 도달했을 때, 플랫폼에 아직 여유 리소스가 있다면 스로틀링되지 않습니다, 따라서 실제로 사용할 수 있는 처리량은 명시된 한도 아래로 떨어지지 않습니다.

이는 하드 플로어를 가진 소프트 상한으로, 표준 티어 한도와는 다른 형태입니다. 즉, 1.5–2×라는 수치는 상한에 대한 제한이 아니라 하한에 대한 약속입니다. 경합 상황에서는 해당 한도를 받고, 유휴 용량에서는 더 많이 받을 수 있습니다. 수십 개의 순차 호출을 실행하는 에이전트 루프에서는 가장 느린 호출의 테일 지연 시간이 워크플로의 완료 여부를 결정하기 때문에, 이러한 비대칭성은 원시 TPS 배수보다 더 가치가 있습니다.

표준 모델의 동적 TPM 한도는 월별 Model Studio 지출에 따라 계층화됩니다 — 동일한 문서군에서는 기본 qwen3.8-max ID가 계층별로 5,000,000, 10,000,000, 20,000,000 TPM으로 표시되며, 매월 갱신됩니다. Prime은 그 구조를 제거하지 않습니다; 그것이 체감되는 방식을 바꿉니다.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

아직 아무도 측정하지 못한 것

여기에 솔직한 격차가 있습니다. 1.5–2×라는 수치는 제조사가 밝힌 것입니다. 우리가 찾을 수 있는 독립적인 Prime 모드 처리량 측정치는 없으며, 이는 중요한데, 표준 빌드 자체의 독립적인 수치도 속도 면에서는 호의적이지 않기 때문입니다.

자체 하네스에서 모델을 측정하는 Artificial Analysis는 현재 0902 빌드의 Qwen3.8-Max에 대해 Intelligence Index 45점을 부여하며, GPQA Diamond 92.8%, Terminal-Bench Hard 38.9%, Humanity's Last Exam 43.1%를 기록하고, 작업당 측정 비용을 $5.41로 산정합니다. 이는 표준 SKU에 대한 독립적인 수치이며 2026-09-24에 캡처되었습니다. 또한 이 지수는 8월 출시 보도 이후 개정되었다는 점을 상기시켜 주므로, 더 오래된 지수 값을 현재 값 옆에 놓고 추세라고 부르지 마십시오.

AA에 없는 것은 Prime 행입니다. 누군가 그것을 측정하기 전까지, 속도 주장은 Aliba​ba만의 것이며, 올바른 태도는 최상위 범위를 가정하기보다 자신의 워크로드에서 테스트하는 것입니다.

이로써 라우팅 결정은 어떻게 되는가

Prime은 Aliba​ba가 자체 API에서 판매하는 티어이며, 그것을 구할 수 있는 유일한 곳입니다. 우리는 여기서 qwen3.8-max-prime을 호스팅하지 않습니다. OrcaRouter가 라우팅하는 것은 표준 Qwen3.8-Max와 그 날짜 지정 핀 Qwen3.8-Max-0902, 둘 다 나머지 Qwen3.8 패밀리 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — 와 동일한 키에 있으며 200개 이상의 다른 모델과 함께 제공되며, 공급자 정가는 0% 마크업으로 전달됩니다그 마지막 부분이 바로 9월 2일 리프레시와 향후 모든 Max 요금 변경이 Aliba​ba에 적용되는 같은 날 우리 쪽에도 적용되는 이유입니다.

실용적인 분할은 이렇게 생겼습니다. 기본 트래픽은 standard ID에서 라우터를 통해 실행하세요. 그러면 단일 제공자 경로가 저하될 때 페일오버가 보호해 줍니다. 실제 경과 시간 지연이 곧 제품인 특정 호출 — 대화형 완성, 빡빡한 에이전트 단계 — 은 Prime으로 옮기고, 그 결정은 1.5×가 아니라 2×를 기준으로 가격을 매기세요.

누가 전환해야 하고, 누가 기다려야 하는가

사용자가 토큰을 기다리고 있다면 전환하세요: 자동 완성, 채팅 턴, 사람이 지켜보는 코드 편집 루프 같은 경우입니다. 속도 범위의 최상단에서 Prime은 제거된 지연 시간 1초당 비용 중립적입니다 — 정확히 절반의 시간을 위해 정확히 두 배를 지불합니다. 범위의 하단에서는 1.5×를 위해 2×를 지불하는 셈이며, 이는 절약된 1초당 33%의 프리미엄입니다. 워크로드가 밤새 실행되는 배치 작업이라면, 그 프리미엄은 당신에게 필요했던 것을 아무것도 사주지 않습니다.

잠깐, 비용 모델이 $2/$6 출시 헤드라인을 기준으로 세워졌다면, 또는 요청이 입력 비중이 높다면. 공급업체의 속도 주장은 TPS — 초당 출력 토큰 — 에 관한 것이고, prefill은 다른 파이프라인 단계입니다. 긴 컨텍스트 요청은 출력이 더 빨리 도착하든 아니든 입력 토큰에 두 배를 지불합니다. 마이그레이션하기 전에 그 경우를 측정하세요.

그리고 요금표의 날짜를 확인해 보세요. Qwen3.8-Max는 8월 3일부터 시장에 나와 있었고, 한 번 리프레시되었으며, 한 번 리패키징되었지만, 여전히 고작 7주 된 모델입니다. 뉴스가 되는 건 티어이고, 모델은 아닙니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트