Qwen3.8-27B 대 Qwen 3.8 대결을 위한 히어로 타이틀 카드로, 두 개의 둥근 칩 카드를 보여줍니다 — 262K 컨텍스트와 Apache 2.0 라이선스를 갖춘 27B dense 모델이 커스텀 라이선스를 사용하는 2.4T / 95B 활성 MoE 코어와 맞붙는 모습이며, 오른쪽 아래 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

Qwen3.8-27B vs Qwen 3.8: 같은 세대, GPU 대 랙

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이번 주 AlibabaQwen3.8-27B를 Cerebras의 고속 추론 라인에 올렸다 — dense 27B가 진정으로 빠른 호스팅 옵션을 갖게 된 것은 처음이며 — Artificial Analysis는 마침내 이 맞대결의 양쪽을 인덱싱했다. Qwen3.8-27B는 AA Intelligence Index에서 34점을 기록한다. Qwen 3.8, 즉 접미사 없이 이름을 쓸 때 대부분의 사람들이 뜻하는 오픈 코어는 40점을 기록한다. 이 두 숫자는 8월 출시 보도가 전적으로 벤더의 말에만 의존해 진행해야 했던 비교를 다시 세운다.

독립된 이름으로서의 “Qwen 3.8” 뒤에 있는 모델은 Qwen3.8-2.4T-A95B입니다. Aliba​ba가 맞춤형 라이선스로 공개한 2.4조 매개변수 전문가 혼합(MoE) 가중치입니다. Qwen3.8-27B는 같은 세대의 밀집형 모델로, 약 270억 매개변수, Apache 2.0, 단일 GPU에 맞춘 크기입니다. 두 모델은 제품군 이름, 네이티브 262K 컨텍스트 길이, 출시 시기를 공유합니다. 그 외의 모든 것은 정반대를 보여줍니다. 하나는 소유할 수 있고, 다른 하나는 임대만 할 수 있습니다. 이제 두 모델 모두 독립적인 수치를 갖게 되었으니, 각각이 실제로 무엇을 위한 것인지 살펴보겠습니다.

같은 세대, 반대되는 형태

Qwen3.8-27B는 덴스 모델입니다. 27B 파라미터(비전 인코더를 포함하면 28B), 64개 레이어, 48개의 Gated DeltaNet 선형 어텐션 레이어와 16개의 전체 어텐션 레이어로 구성된 하이브리드 어텐션 스택을 갖추고 있습니다. 바로 이 하이브리드 구조 덕분에 27B 모델이 262,144 토큰의 네이티브 컨텍스트를 담을 수 있습니다. Qwen3.8-2.4T-A95B는 플래그십 아키텍처입니다. 총 2.4T 파라미터, 토큰당 약 95B가 활성화되며, 레이어당 512개의 전문가를 둔 92개 레이어로 이루어져 있고, 그 92개 레이어 중 69개가 선형 어텐션을 사용합니다. 같은 기법, 90배의 규모입니다.

• 아키텍처 — Qwen3.8-27B: 27B 밀집형, 모든 토큰이 전체를 활성화합니다. Qwen3.8-2.4T-A95B: 총 2.4T / 활성 ~95B MoE.

• 컨텍스트 — 둘 다 네이티브 262K, 27B의 1M 확장은 호스티드 전용이며, 2.4T는 측정 기준 약 984K에 도달합니다.

• 입력 — Qwen3.8-27B: 텍스트, 이미지, 동영상. Qwen3.8-2.4T-A95B: 텍스트 전용, 사고 모드 항상 켜짐.

• 라이선스 — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: 사용자 정의 Qwen3.8-Max 라이선스.

• 가중치 — Qwen3.8-27B: BF16 기준 55.6GB이며, 양자화하면 약 16GB Q4 빌드가 됩니다. Qwen3.8-2.4T-A95B: BF16 기준 약 2.4TB로, 데스크톱이 아니라 GPU 랙급입니다.

• 이들을 어디서 만나나 — Qwen3.8-27B: 자체 호스팅 또는 저렴하게 임대. Qwen3.8-2.4T-A95B: 임대, 제정신인 사람은 그 랙을 소유하지 않으니까.

드디어 독립된 숫자들

Qwen3.8-27B에 관한 8월의 모든 비교 기사는 "아직 독립적인 점수가 없다"는 같은 단서를 달고 있었습니다. 이제 그것은 더 이상 사실이 아닙니다. Artificial Analysis가 이번 주 기준으로 두 모델 모두를 측정했으며, 데이터의 형태는 정말 흥미롭습니다.

인텔리전스 인덱스에서 Qwen3.8-2.4T-A95B는 40점을 기록해 동급 113개 중 4위에 올랐다. Qwen3.8-27B는 34점으로, 오픈 웨이트 4~40B 크기 등급의 140개 모델 중 1위다. 덴스 27B 모델로서는 정말 인상적인 성적이다. 독립적인 측정 기준으로 둘 다 느리다. 27B는 초당 출력 토큰 39.0개, 2.4T는 38.1개인 반면 동급 중앙값은 약 90이다. 둘 다 장황해서, 27B는 인덱스 실행 전반에서 약 2억 개의 출력 토큰을 생성한 반면 동급 중앙값은 약 6,800만 개였다. 둘 다 최전선(frontier)의 헤드라인 모델은 아니며, 둘 다 일꾼 모델인데, 인덱스에 따르면 2.4T가 확실한 차이로 더 강한 일꾼이다.

A three-lane infographic titled 'Qwen3.8-27B — three ways to rent it': self-hosted lane on OrcaRouter at $0.33/$2.40 per 1M tokens with 262K context, vendor lane on Qwen Cloud at $0.50/$3.00 with 1M context and a 90% cache discount, and the fast lane on Cerebras PayGo at $0.99/$1.49 with rapid inference, plus the OrcaRouter logo in the bottom-right corner.

독립적인 측면의 가격 책정도 달러로 같은 이야기를 들려준다. Artificial Analysis는 Qwen Cloud의 호스팅 빌드에서 27B를 입력 100만 토큰당 $0.50, 출력 100만 토큰당 $3.00(캐시 90% 할인)으로 책정하고, 2.4T는 $2.00 / $6.00(캐시 88% 할인)으로 책정한다. Intelligence Index 작업당 비용: 27B는 $0.82, 2.4T는 $2.16이다. 더 작은 모델이 지능 단위당 실행 비용이 더 저렴하다 — 그리고 둘 다 출력 토큰을 많이 소모하는 추론 모델이기 때문에 속도 등급에 비해 둘 다 비싸다.

그 밖의 모든 것 — 27B의 SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3; 2.4T의 Terminal-Bench 2.1 86.6과 SWE-bench Pro 67.7 — 은 여전히 벤더가 보고한 수치이며, 재현되지 않았고, 이 글 전반에서 그렇게 표기된다. 위의 AA 지수는 이 모든 것의 밑에 깔린 독립적인 하한선이다.

Cerebras 상장이 바꾸는 것

2026년 9월 12일, Qwen 계정은 Qwen3.8-27B가 이제 Cerebras에서 실행된다고 발표했으며, 카탈로그 항목은 "Qwen 3.8 27B가 이제 Cerebras PayGo에서 사용 가능합니다"라는 배너 아래에 게시되었습니다. Cerebras는 속도로 회사의 명성을 얻은 WSE급 하드웨어에서 입력 백만 개당 $0.99, 출력 백만 개당 $1.49로 가격을 명시했습니다. 이는 27B에게 2.4T core가 한 번도 가져본 적 없는 것을 제공합니다: 빠른 차선.

A comparison scoreboard titled 'Qwen3.8-27B vs Qwen 3.8 — the matchup': the 27B shows 27B dense architecture, 262K native context, text/image/video input, Apache 2.0, AA Intelligence 34, and $0.33/$2.40 per 1M tokens; the 2.4T core shows 2.4T / 95B-active MoE, 984K measured context, text-only input, the Qwen3.8-Max custom license, AA Intelligence 40, and $2.00/$6.00 per 1M tokens, with a footer labeling the 27B price as the OrcaRouter self-hosted rate, the 2.4T price as the Qwen3.8-Max API rate, and the AA figures as of September 2026, plus the OrcaRouter logo in the bottom-right corner.

이것이 중요한 이유는 느리고 장황하다는 점이 처음부터 27B에 대한 유일한 실질적 약점이었기 때문입니다. 독립 하네스에서는 39 t/s를 내지만, 자체 서빙 텔레메트리에서는 초당 약 154개의 출력 토큰을 처리해 왔고 첫 토큰 지연 시간의 p50은 4.48초입니다. 그리고 이제 두 번째 제공업체가 바로 그 축에서 경쟁하고 있습니다. 이와 대조적으로 2.4T에는 빠른 경로가 전혀 없습니다. 38 t/s에서는 중간 수준의 속도를 위해 프런티어급 가격을 지불하는 셈이며, 이를 피할 유일한 방법은 GPU 클러스터를 임대해 오픈 웨이트를 직접 실행하는 것뿐입니다.

27B에는 세 개의 레인, 2.4T에는 하나의 레인

오늘 기준으로 dense 27B는 세 가지 방식으로 임대할 수 있으며, 선택하기 전에 가격 차이를 확인해 볼 가치가 있습니다:

• 셀프 호스팅 레인 — Qwen3.8-27B가 OrcaRouter에서 백만 토큰당 $0.33 / $2.40에 라이브로 제공되며, 자체 인프라에서 실행됩니다. 해당 모델 기준 시장에서 가장 저렴한 입력, 출력 ~154 tok/s, 262K 컨텍스트.

• 벤더 레인 — Qwen Cloud의 호스팅 빌드, 1M 토큰 컨텍스트와 90% 캐시 할인 제공, 백만당 $0.50 / $3.00.

• 패스트 레인 — Cerebras PayGo, 백만 개당 $0.99 / $1.49, 가격보다 속도를 앞세운 포지셔닝.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (captured September 12, 2026) showing the input price of $0.33 per 1M tokens, output price of $2.40 per 1M tokens, a 262K token context window, text/image/video input support, and a p50 first-token latency of 4.48 seconds.

2.4T 오픈 코어에는 이에 상응하는 스프레드가 없다. 같은 아키텍처를 서빙하는 플래그십 API인 Qwen3.8-Max는 백만 토큰당 $2.00 / $6.00이며, 이를 Max라고 부르든 오픈 코어라고 부르든 이 숫자는 그대로 유지된다. 그 대신 가중치를 실행하면 경제성은 하드웨어로 뒤바뀐다. 2.4T에는 약 2.4TB의 BF16 가중치와 멀티 GPU 노드가 필요하며, 이는 누구도 가볍게 내리는 자본 결정이 아니다. 24GB GPU는 27B의 Q4 빌드를 한계 비용이 0으로 반올림될 만큼 저렴하게 실행한다.

대부분의 팀을 결정짓는 실전 예시: 하루 100M 입력과 20M 출력 토큰. 2.4T의 $2/$6 요율로는 하루 약 $320, 연간 약 $117,000입니다. 27B에서는 우리의 $0.33/$2.40 기준으로 하루 약 $81이고, 자체 호스팅 버전에서는 전기 요금이 곧 가격입니다. 2.4T는 AA 40 대 34라는 확실한 품질 우위를 제공합니다. 그 우위가 월 다섯 자릿수 청구서를 감수할 가치가 있는지가 바로 이 조합이 던지는 핵심 질문입니다.

그들이 진정으로 갈라지는 지점

인덱스 외에도, 세 가지 실질적인 차이가 주어진 워크로드에 어느 것이 적합한지를 결정합니다.

멀티모달 입력은 가장 깔끔한 필터입니다. Qwen3.8-27B는 텍스트, 이미지, 영상을 읽습니다 — 스크린샷, 차트, 그림이 들어간 문서, 영상 프레임이 모두 동일한 262K 창에 들어갑니다. Qwen3.8-2.4T-A95B는 철저히 텍스트 전용입니다. 입력에 시각적인 요소가 조금이라도 포함된다면, 2.4T는 지수가 더 높든 말든 자격이 없습니다.

사고 제어는 두 번째입니다. 27B의 추론 모드는 요청별로 끌 수 있는데, 이는 사고의 연쇄가 순전한 오버헤드인 지연 민감 추출에 중요합니다. 또한 reasoning_effort를 노출합니다. 2.4T 코어는 사고를 끌 수 없습니다 — 모든 응답이 think> 블록으로 시작하며, 원하든 원하지 않든 그 토큰에 대한 비용을 지불합니다. 플래그십 API는 이를 해결하지만, 오픈 코어는 그렇지 않습니다.

라이선싱은 세 번째이며, 규모가 커질수록 조용히 중요해진다. 27B의 Apache 2.0은 허용적 표준이다: 수정, 재배포, 상업화, 특허 허여가 포함된다. 2.4T는 맞춤형 Qwen3.8-Max 라이선스로 배포된다 — 취지상 허용적이지만, 이는 커뮤니티 표준이 아니라 Alibaba의 약관이며, 그 위에 제품을 구축하기 전에 해당 파일을 읽어볼 가치가 있다.

결정 라우팅

이 맞대결의 양쪽 모두 하나의 OrcaRouter 키로 접근할 수 있으며, 바로 그 점 덕분에 "어느 쪽을 골라야 하나"라는 질문에 실증적으로 답하는 비용이 저렴해집니다. Qwen3.8-27B는 qwen/qwen3.8-27b로 제공업체 정가에 마크업 없이 라이브 상태이고, 동일한 2.4T 코어로 구축된 플래그십 API는 qwen/qwen3.8-max로 백만 토큰당 $2.00 / $6.00에 라이브 상태입니다 — 알리바바 자체 요율을 그대로 전달하므로, 공급업체 가격이 변경되면 같은 날 여기에 바로 반영됩니다.

동일한 2.4T 아키텍처를 다운로드 가능한 가중치로 제공하는 것은 저희가 서비스하는 대상이 아닙니다 — 오늘 API로 오픈 코어를 원하신다면, 플래그십 라인이 거기에 도달하는 실용적인 방법이며, qwen/qwen3.8은 켜지도록 미리 배선되어 있으며 프로바이더가 오픈 가중치를 서비스하는 순간 켜집니다. 시각 및 지연에 민감한 트래픽을 qwen/qwen3.8-27b로, 어려운 추론 테일을 qwen/qwen3.8-max로 보내는 라우팅 규칙은 설정하는 데 비용이 들지 않고 프로바이더 간에 자동으로 페일오버됩니다. 키 하나, 두 번째 계약은 없으며, 이 분할은 재설계가 아니라 구성 변경입니다 — 2.4T의 추가 6 인덱스 포인트가 백만 출력 토큰당 $5.67의 가치가 있는지 테스트하는 가장 저렴한 방법입니다.

누가 어떤 것을 골라야 하나요

• 입력에 이미지나 동영상이 포함되거나, 끌 수 있는 사고 모드를 원하거나, 24GB GPU를 보유하고 있거나 보유할 계획이거나, 토큰당 지출 규모가 커서 $0.33/$2.40 대 $2.00/$6.00이라는 차이가 결정적 근거가 되는 경우에는 Qwen3.8-27B를 선택하세요.

• 텍스트 전용으로 쓰고, 이 제품군에서 가장 강력한 독립적 추론 수치(AA 40)를 원하며, $2/$6 요금 — 또는 GPU 노드를 운영하는 비용 — 이 예산 안에 여유롭게 들어온다면 Qwen 3.8(2.4T 코어)을 선택하세요.

• 트래픽이 두 프로필에 걸쳐 있다면 둘 다 선택하세요: 게이트웨이를 통해 라우팅하고, 라우터가 모달리티와 난이도에 따라 나누도록 하며, 두 모델 중 어느 쪽이든 다음 체크포인트나 가격이 나오면 마음을 바꾸세요.

평결

Qwen 3.8이라는 이름은 항상 하나의 패밀리인 척하던 두 제품이었고, 이제 둘 다 각자 따져볼 독립적인 숫자를 갖게 되었다. Qwen3.8-2.4T-A95B는 더 강력한 두뇌이며, 텍스트 전용이고, 비싸며, $2/$6에 임대할 수 있다는 점은 부인할 수 없다. Qwen3.8-27B는 배포 가능한 쪽이다 — 멀티모달, Apache 2.0, 자체 호스팅 가능하며, 이번 주부터 마침내 빠른 경로도 생겼다. 지수 격차는 실제다: 40 대 34. 가격 격차도 마찬가지다: 2.4T를 API로 실행할 때 토큰당 비용이 대략 다섯 배다. 대부분의 팀에게 결정은 여섯 지수 포인트에 관한 것이 아니다. 그것은 토큰을 사는지 하드웨어를 사는지에 관한 것이다 — 그리고 27B는 둘 중 하드웨어를 살 수 있게 해주는 유일한 모델이다.