
Qwen3.8-27B: 알리바바 Qwen3.8 라인업의 컴팩트 멀티모달 모델
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 316 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 196 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
Qwen3.8-27B는 Alibaba의 Qwen3.8 세대에서 덴스(dense) 단일 노드 구성원입니다: 270억 파라미터 네이티브 비전-언어 모델로, Hugging Face에 Apache 2.0으로 공개되었으며, 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하고 262,144토큰 컨텍스트 윈도를 갖습니다. 이 문서는 그 모델에 대한 참조 페이지입니다 — 그것이 무엇인지, 호출 비용은 얼마인지, 무엇을 할 수 있는지에 대한 정식 설명 — 그리고 가중치가 지난 7일이 아니라 2026년 8월에 처음 등장한 모델을 위해 왜 페이지가 존재하는지 처음에 밝힐 가치가 있습니다. 우리는 출시를 보도하는 것이 아닙니다. 우리는 상시적인 질문에 답하는 중입니다: 독자들은 한 달에 수천 번 "Qwen3.8-27B"라는 이름으로 우리를 찾으며, 지금까지 우리의 어떤 페이지도 그 답을 차지하지 못했습니다. 이 모델 자체의 릴리스는 Qwen의 카드에 날짜가 적혀 있고 Artificial Analysis가 2026-08-14로 기록했는데, 이 페이지가 모델의 날짜를 밝히는 데 사용하는 사실이며, 이 페이지가 보도하는 사건은 아닙니다.
그것을 예외로 받아들이십시오. 엄격한 7일 기준으로 읽으면, 2026년 8월 중순의 모델은 최신이 아니며, 이 항목은 뉴스로서 건너뛰어질 것입니다. 여기서의 근거는 다릅니다. 이것은 참조 페이지로, 그 수치들은 Qwen의 자체 모델 카드, 저장소의 라이선스 파일, Qwen Cloud 요금표, 그리고 Artificial Analysis를 기준으로 2026-09-28에 검증되었으며, 존재 이유는 같은 날 우리가 자체적으로 측정한 검색 수요입니다. 그것은 두 번째 발표가 아니며, 누구도 그렇게 읽어서는 안 됩니다.
27B가 Qwen3.8 라인업에서 차지하는 위치
Qwen3.8 세대는 하나의 모델이 아니며, 크기 접미사가 바로 그 이름의 핵심입니다. Qwen 자체의 리포지토리 노트는 제품군 전반에 걸쳐 그 구분을 명시적으로 드러냅니다:
• Qwen3.8-27B — 27B dense 파라미터, 네이티브 이미지 및 비디오 입력, Apache 2.0. 배포 친화적인 구성원: 단일 GPU나 소규모 노드에서 실행할 수 있는 크기의 모델이며, 이 페이지의 주제입니다.
• Qwen3.8-2.4T-A95B를 기반으로 구축된 Qwen3.8-Max — 총 2조 4,000억 개의 파라미터에 95B가 활성화된, 알리바바가 이 세대에서 처음으로 공개한 Qwen-Max급 모델입니다. 해당 저장소에는 Apache 2.0이 아닌 맞춤형 qwen3.8-max 라이선스가 적용되어 있습니다.
• Qwen3.8-Flash-Next — Qwen이 Qwen4를 뒷받침할 것이라고 밝힌 실험적 아키텍처 프리뷰로, qwen-community-1.0 라이선스로 공개되었습니다. 호스팅되는 Qwen3.8-Flash는 이를 기반으로 구축되었습니다.
따라서 "27B"는 Max 모델의 트림 레벨이 아니라, 단일 팀이 실제로 서비스할 수 있는 크기 등급입니다. Alibaba가 그것이 계승한다고 주장하는 것은 학습 레시피입니다: 카드에서는 Qwen3.8-27B가 코딩, 전문 업무, 연구 및 장기 호라이즌 에이전트 작업에서 이 세대의 발전을 받아들여 이를 하나의 덴스 체크포인트로 압축한다고 설명합니다.

Qwen이 공개하는 아키텍처
아래의 모든 수치는 공급업체 자체 문서인 Qwen/Qwen3.8-27B의 모델 카드에서 가져온 것입니다:
• 파라미터 — 마케팅상 27B. 리포지토리 자체의 safetensors 메타데이터는 18개 샤드 전반에 걸쳐 BF16으로 총 27,781,427,952개의 파라미터를 집계하므로, 비전 타워까지 포함하면 대략 27.8B입니다. 여기에는 전문가 혼합(mixture-of-experts)이 없습니다: 모든 파라미터가 모든 토큰에서 활성화됩니다.
• 구조 — 64개 레이어, 은닉 차원 5,120, 피드포워드 중간 차원 17,408, 토큰 임베딩 및 LM 출력 248,320(패딩됨).
• 하이브리드 어텐션 — Qwen이 출력하는 레이아웃은 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): 전체 어텐션 블록마다 선형 어텐션 블록이 세 개, 즉 3:1 비율이다. Gated DeltaNet은 V에 48개, QK에 16개의 선형 어텐션 헤드를 헤드 차원 128로 실행한다; Gated Attention은 헤드 차원 256에서 4개의 KV 헤드에 대해 24개의 쿼리 헤드를 실행하며, 로터리 차원은 64이다. 그 비율 덕분에 27B 모델에서 262K 윈도우를 감당할 수 있으며, Qwen3.8-Flash-Next가 희소 어텐션으로 확장하는 동일한 계보이다.
• 멀티 토큰 예측 — 이 카드에 따르면 해당 모델은 여러 단계에 걸쳐 MTP로 학습되었으며, 이는 MTP를 인식하는 서빙 스택에서 생성 속도를 높이는 드래프팅 기법입니다.
• 사고 제어 — 사고 모드는 기본적으로 켜져 있으며 요청별로 끌 수 있습니다. reasoning_effort는 xhigh(기본값), medium 또는 low를 받으며, preserve_thinking은 기본적으로 켜져 있어 추론 트레이스가 다시 생성되지 않고 턴 간에 이어집니다.
컨텍스트 윈도우와 출력 상한
카드에는 262,144 토큰이 기본으로 명시되어 있으며, RoPE 스케일링(YaRN)을 통해 1,000,000까지 확장할 수 있습니다. 그 1M 범위 내에서 긴 에이전트 실행을 위한 Qwen 자체의 서빙 지침은 추론 콘텐츠에 최대 262,144 토큰, 최종 응답에 최대 131,072 토큰을 허용하는 것입니다 — 이 상한은 체크포인트의 고정된 속성이 아니라 서빙 구성입니다.
두 윈도우는 서로 구분해 두는 것이 좋습니다. 혼동하기 쉽기 때문입니다. 오픈 웨이트는 네이티브로 262,144에서 실행됩니다. 호스팅 버전은 Qwen Cloud에 있으며 — 모델 카드가 아직 출시 예정이라고 설명하는("서비스는 곧 제공됩니다") — Qwen Cloud 모델 페이지에는 1M 컨텍스트, 최대 입력 991K, 최대 출력 131K, 최대 추론 예산 262K로 등록되어 있습니다. 호스팅 제품의 사양서는 체크포인트의 사양서가 아닙니다.
모달리티: 무엇이 들어가고 무엇이 나오는가
입력은 텍스트, 이미지, 동영상이고 출력은 텍스트뿐입니다. 카드에서는 Qwen3.8-27B를 "이미지와 동영상을 이해하는 네이티브 비전-언어 모델"이라고 설명하며, 예제 코드는 세 가지 입력 유형을 모두 전달합니다. 오디오 입력, 이미지 생성, 음성 출력은 없습니다. 동일한 체크포인트에 대한 Artificial Analysis의 모델 기록도 그 범위—이미지, 동영상, 텍스트 입력, 텍스트 출력—에 일치하는데, 이는 Alibaba 자체 페이지가 아니기 때문에 유용한 두 번째 해석입니다.
Apache 2.0 릴리스가 실제로 허용하는 것
라이선스는 블로그 게시물의 요약이 아닙니다; 저장소는 Apache License, Version 2.0 텍스트 자체를 포함하고 있으며, 카드의 메타데이터는 다음과 같이 선언합니다: license: apache-2.0. 그것이 부여하는 권한은 라이선스 텍스트에서 읽을 수 있습니다: 저작물과 그 파생물을 복제, 파생 저작물 제작, 공개 전시, 서브라이선스 및 배포할 수 있는 영구적, 전 세계적, 로열티 없는 저작권 라이선스와 기여자로부터의 특허 라이선스 — 상업적 사용이 허용된 목적 중 하나이며, 사용 분야 제한, 사용자 수 임계값, 별도의 상업적 계약이 없습니다. Apache 2.0은 제품 출시에 중요한 의미에서도 허용적입니다: 파생 가중치는 다른 조건으로 재배포될 수 있지만, 라이선스 및 저작자 표시 고지를 유지하고 변경한 내용을 명시해야 합니다 (섹션 4a–4c). 섹션 6은 Qwen 이름이나 상표에 대한 권리를 부여하지 않으므로, Apache-2.0 포크는 자신을 Qwen으로 마케팅할 수 없습니다.
패밀리 내부의 비교는 시사하는 바가 크며, 이는 보도가 아니라 리포지토리에서 드러난다: 2.4T-A95B 체크포인트는 스스로를 기타라고 칭하며, qwen3.8-max 라이선스를 사용하고, Qwen3.8-Flash-Next는 qwen-community-1.0을 사용한다. 27B는 세 가지 중 일반 Apache 2.0으로 제공되는 유일한 모델이다.
독립적인 벤치마크 입장
Artificial Analysis가 이 모델을 실행했으며, 그 기록은 Alibaba 자체 표와 분리해서 볼 가치가 있습니다. 두 가지가 서로 다른 질문에 답하기 때문입니다.xhigh 구성에서 측정한 결과입니다:
• Intelligence Index 33.7 — Artificial Analysis가 저장한 값으로, 해당 모델 페이지에는 34로 반올림되어 표시됩니다. 두 개의 순위가 공개되어 있는데, 이 둘은 서로 다른 모집단을 측정한 것입니다. 그 페이지 자체의 요약 타일에서는 이 모델을 크기 등급 내 142개 모델 중 1위로 표시합니다. 이는 페이지의 툴팁이 설명하는 동일 등급 비교를 따른 것이며, 반면 저희 카탈로그의 Artificial Analysis 출처 행에는 145개 중 45위, 약 67백분위로 기록되어 있습니다. 어느 쪽도 상대와 동일한 대상 집단에 대한 순위가 아니므로, 두 수치를 하나의 숫자를 두 가지 형식으로 표기한 것으로 읽지 마십시오.
• 코딩 지수 68.1 — 우리 카탈로그에 artificialanalysis.ai를 명시된 출처로 하여 실려 있으며, 해당 지수의 풀 138개 중 35위로 랭크되어 있습니다. 이 모델은 일반 지능보다 코딩에서 더 높은 위치에 있는데, 이는 벤더 자체 표의 형태와 일치합니다.
• 에포트 사다리, 동일한 하네스 — 추론 에포트를 낮추면 지수가 크게 이동합니다: 33.7은 xhigh에서, 27.6은 medium에서, 26.2는 low에서, 추론을 완전히 끄면 20.2입니다. 측정된 차이는 13.5포인트이며, 이는 모델이 아니라 워크로드별로 에포트를 튜닝해야 한다는 가장 구체적인 근거입니다.
• 두 출처가 일치하는 부분과 어긋나는 부분 — GPQA Diamond에서 Alibaba의 카드는 89.2를 보고하고 Artificial Analysis는 90.5를 측정한다. Humanity's Last Exam에서는 카드가 30.8을 보고하고 Artificial Analysis는 33.9를 보고한다. 가깝지만 같은 숫자는 아니며, 이는 정상이다: 서로 다른 하네스, 서로 다른 실행. 각주가 아니라 기사에 들어가야 할 주의점이 하나 있다 — 어떤 제3자도 Qwen3.8-27B와 Alibaba의 비교 표에 있는 어떤 모델 사이에서 동일한 하네스에서 동일한 노력 수준으로 실행한 일대일 비교를 발표한 적이 없으므로, 이 페이지의 모든 모델 간 비교는 하나의 결과가 아니라 각각의 측정값을 비교한 것이다.

Qwen이 보고하는 내용과 이를 읽는 방법
모델 카드에는 Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B, Opus4.6 Max에 대한 비교 열과 함께 대략 24개의 점수가 실려 있습니다. 이 모든 것은 벤더가 보고한 것이며 재현되지 않았습니다 — Alibaba 자체 평가를 Alibaba가 인쇄한 것입니다 — 그리고 여러 행은 GPT-5.4 빌드가 판정한 Claude Code 하네스를 사용하며, 이는 카드의 각주에 명시되어 있습니다. 이를 토대로 한 대표 벤더 수치는 다음과 같습니다:
• 에이전틱 터미널 코딩 — Terminal Bench 2.1(Terminus) 73.0, 대체하는 Qwen3.6-27B의 63.4와 비교되며, Opus4.6 Max가 78.2로 이 항목에서 선두를 달리고 있습니다.
• 에이전틱 코딩 — SWE-bench Pro 61.7, QwenSWEBench 79.0, DeepSWE 1.1 42.2, NL2Repo-Bench 42.3, LiveCodeBench v6 90.3.
• 에이전트와 사무 업무 — 점수 기준 CoWorkBench 70.7, JobBench 33.4, Agents' Last Exam 42.9 (Pass@1 20.4).
• 일반 추론 — GPQA Diamond 89.2, HLE 30.8, IFBench 79.5. Opus4.6 Max는 공급업체 자체 표에서 두 추론 행 모두에서 선두를 차지하며, 각각 91.3과 40.0입니다.
• 비전 및 컴퓨터 사용 — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.
그 표에 대한 솔직한 요약은 표가 보이는 것보다 좁다. 직전 모델과 비교하면 개선 폭은 크고 일관적이다 — QwenSWEBench 79.0 대 49.3, DeepSWE 42.2 대 13.3 — 그리고 그것은 한 세대의 레시피 변경에 관한 주장이다. 인접한 열의 최전선 모델들과 비교하면, Alibaba 자체 수치로, Alibaba가 스스로 선택한 하네스로, 어떤 행에서는 이기고 어떤 행에서는 진다.
그것을 실행하기
가중치는 Transformers 형식의 BF16 샤드 18개이며, 카드에는 Hugging Face Transformers, vLLM, SGLang, TokenSpeed가 지원 스택으로 나열되어 있습니다. 로컬 배포와 양자화 경로는 별도로 작성해 두었고, 그 세부 내용은 그쪽에서 다루는 것이 맞습니다: Ollama에서의 Qwen3.8-27B 로컬 데몬을 위한 문서와, Qwen3.6-27B에서 무엇이 바뀌었는지를 포함한 전체 스코어카드를 다루는 벤치마크 워크스루입니다. 이 페이지는 모델 자체에 집중합니다.
우리 카탈로그에 있는 Qwen3.8-27B
오늘 OrcaRouter에는 두 개의 카드가 나란히 라이브로 올라와 있으며, 이 문단을 쓰기 전인 2026-09-28에 두 카드 모두 다시 확인했습니다. qwen/qwen3.8-27b백만 입력 토큰당 $0.33, 백만 출력 토큰당 $2.40에 제공되며, 262,144 토큰의 전체 창, 텍스트·이미지·비디오 입력, 그리고 추론, 도구, 구조화 출력 및 JSON 표면이 파라미터로 노출됩니다. 그 형제 모델인 obsidian/Qwen3.8-27B는 — 동일한 가중치를 block-FP8로 서빙하되 비전 타워는 전체 정밀도로 유지하며, 카드 자체의 표현대로 "다양한 프롬프트 전반에서 직접적이고 완전한 응답을 제공하도록 설계"되었습니다 — 입력 $0.40, 출력 $4.21에 제공됩니다. 둘 다 Chat Completions와 Responses API를 지원하므로, 문서 파싱이나 스크린샷 작업을 하나의 키와 하나의 엔드포인트 아래 어느 모델에든 지정할 수 있으며, 별도의 계약도 코드 변경도 필요 없습니다.
규모를 가늠해 보자면, 저희 자체 플레이그라운드는 지난 7일 동안 qwen/qwen3.8-27b를 통해 1억 510만 개의 토큰을 처리했으며, 같은 기간 첫 바이트까지 걸린 시간의 중앙값은 3.8초, 오류율은 3.3%였습니다. 이는 저희의 서빙 수치일 뿐, 모델에 대한 평가가 아닙니다.

여기로 이어지는 검색어
이 페이지가 겨냥하는 수요는 얇게 흩어져 있고 클릭 바로 바깥에 있습니다. 2026-09-25까지의 28일 동안 우리 속성은 모델 이름의 69가지 서로 다른 정확한 표기 — "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" 및 같은 세 토큰을 표기하는 수십 가지 이상의 방식 — 을 통해 8,931회 노출과 273회 클릭을 기록했습니다. 가장 큰 표기들에서 우리의 최고 순위는 9.0~10.6이었습니다. 이는 다른 페이지들 덕분에 우연히 차지한 순위이며, 이것이 바로 정규 페이지가 해결하는 문제입니다: 9위에서는 페이지에 노출되긴 하지만 아무도 클릭하지 않습니다. 트래픽이 전환되는 유일한 곳은 비영어입니다 — 이름의 러시아어 표기는 우리에게 1.8위에 있고 14.4%로 전환됩니다.
그중 어느 것도 모델에 관한 증거가 아니다. 그것은 사람들이 무엇을 입력하는지에 관한 증거이며, 바로 그것이 이 페이지가 존재하는 이유다.
종합하면: 진정으로 이례적인 어텐션 레이아웃을 갖춘 27B 덴스 체크포인트, 허용형 라이선스, 네이티브 비디오 이해, 파생물을 출시할 수 있게 해주는 Apache-2.0 조건, Artificial Analysis가 측정하는 항목에서 상위 4분의 1에 드는 독립 코딩 순위, 그리고 전작 대비 강세를 보이지만 프런티어 대비로는 엇갈리는 벤더 표다. 미해결 질문은 아직 Alibaba 외부에서는 아무도 답할 수 없는 하나다 — 1M 토큰 호스팅 경로가 프로덕션에서 어떻게 동작하는지, 그리고 Flash-Next 아키텍처가 이 정도 규모의 모델에 적용되는지 여부다.
Qwen3.8-Max를 뒷받침하는 2.4T-A95B 코어가 동일한 카탈로그에 라이브로 제공됩니다: qwen/qwen3.8-max 백만 토큰당 $2.00 / $6.00에, 27B가 필요한 크기가 아니라면.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
