
Qwen3.8-Flash를 만나보세요: Qwen4 아키텍처를 미리 선보이는 오픈 가중치 멀티모달 MoE — QwenCloud에서 1M 토큰당 $0.15/$0.47
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
2026년 8월 26일, Qwen 팀은 Qwen3.8-Flash의 가중치를 오픈소스로 공개했습니다. 이 가중치는 Hugging Face와 ModelScope에 Qwen3.8-Flash-Next라는 이름으로 출시되었으며, QwenCloud API에서는 Qwen3.8-Flash라는 이름을 지닌 프로덕션 모델을 출시하고 다음 날 공식 가격을 확정했습니다. 알리바바가 8월 28일 자체 발표에서 공식 확인한 핵심 수치는 1,250억 파라미터 규모의 멀티모달 전문가 혼합(MoE) 모델로, 토큰당 약 60억 개의 파라미터만 활성화되어 약 95%의 희소성을 보입니다. 이는 알리바바가 명시적으로 Qwen4 세대의 초기 미리보기라고 설명하는 아키텍처를 기반으로 합니다. 프로덕션 API는 QwenCloud에서 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.47, 캐시 적중 시 100만 개당 $0.016에 제공됩니다. 이는 알리바바의 차기 플래그십에서 구조적으로 파생된 모델을 실행하는 가장 저렴한 방법이며, 연구소가 전체 모델 제품군이 존재하기 전에 아키텍처 미리보기를 공개 오픈 가중치로 출시한 첫 사례입니다.
스펙 시트에서 가장 무게가 실리는 숫자는 단 하나, 6B입니다. Qwen3.8-Flash의 성능은 막대한 크기에서 나오지 않습니다. 연산을 어디에 투입하는지에서 나옵니다. 125B MoE 본체, 51B N-gram 임베딩 테이블, 그리고 작은 multi-token-prediction 모듈은 디스크에 약 180B 개의 파라미터를 저장하지만, 각 토큰은 그중 단 6B 개만 통과합니다. 이것이 이번 릴리스 전체가 걸고 있는 승부수이며, 학습 비용이 이토록 낮아진 이유이기도 합니다.
실제로 출시된 것
Qwen3.8-Flash(접미사 없는 버전)는 현재 QwenCloud API와 Alibaba의 Qwen Office 제품에서 운영 중인 프로덕션화된 모델로, 기본 컨텍스트 100만 토큰과 내장 도구를 갖추고 있으며, 백만 토큰당 $0.15/$0.47, 캐시 적중 시 $0.016의 요금이 적용됩니다. 8월 28일에는 제공 목록이 확대되었습니다. Alibaba의 발표에 따르면, Qwen3.8-Flash는 이제 오픈소스 터미널 코딩 에이전트의 정액제 구독인 OpenCode Go를 통해서도 이용할 수 있습니다. OpenCode의 자체 모델 목록에는 동일한 백만 토큰당 $0.15/$0.47 요율로 qwen3.8-flash로 등재되어 있습니다.

공식 Qwen Studio 발표는 오픈 가중치 릴리스를 생태계에 대한 초대로 규정합니다. 즉, 전체 Qwen4 라인업이 구축되기 전에 커뮤니티와 추론 스택이 적응할 수 있도록 구조적 변경을 조기에 내보내는 것입니다. 그 효과를 입증한 첫 번째 신호는 LMSYS가 후원하는 추론 엔진인 SGLang이 같은 날 Qwen3.8-Flash-Next에 대한 Day-0 지원을 게시하고, 해당 모델이 Transformers, vLLM 및 TokenSpeed에도 구성된 점입니다.
건축은 이야기다
이것은 Qwen 3.8세대 모델을 축소한 것이 아니다. Qwen3.8-Flash는 팀이 Qwen4 제품군이 물려받게 될 것이라고 말하는 네 가지 변경 사항을 도입하며, 각각은 서로 다른 병목 현상을 겨냥한다.
• 어텐션 — Gated DeltaNet + Qwen Sparse Attention. GDN(Gated DeltaNet)은 4개 레이어 중 3개에서 히스토리를 고정 크기 상태로 압축하므로, 모델이 매 단계마다 모든 것을 다시 읽지 않습니다. 그런 다음 QSA는 긴 컨텍스트를 검색 문제로 취급합니다. 즉, 경량 인덱서가 시퀀스를 마이크로 블록으로 집계하고, 블록 수준 중요도를 점수화한 뒤, 가장 관련성 높은 영역으로 어텐션을 라우팅합니다. 알리바바의 측정 결과에 따르면, QSA 어텐션 커널은 1M 토큰 컨텍스트에서 프리필(prefill)은 최대 7.6배, 디코드는 최대 4.9배 더 빠릅니다(벤더 제공 수치).
• 잔차 — 게이티드 잔차. 단일 잔차 스트림이 요소별 게이팅을 갖춘 4개의 병렬 분기로 확장되어, 네트워크가 토큰별로 각 분기에서 읽고 쓸 양을 결정할 수 있게 합니다. 하나의 분기는 초기 어텐션 레이어와 심층 레이어를 연결하는 장거리 채널로 자리 잡습니다. 잔차 상태는 메모리 대역폭을 줄이기 위해 FP8로 저장됩니다.
• 임베딩 — N-gram 임베딩. 현재 토큰과 앞선 여러 토큰을 키로 하는 51B 파라미터 룩업 테이블. 이는 토큰당 계산량을 늘리지 않으면서도 용량을 추가하며, 테이블이 호스트 메모리에 저장되고 비동기적으로 프리페치될 수 있으므로 GPU 메모리를 영구적으로 차지하지 않습니다.
• 옵티마이저 — Muon. 대규모 2D 선형 파라미터(어텐션, GDN, MoE 전문가)는 Muon으로 학습하고, 임베딩, 라우터, Gated Residual 저차원 부분은 AdamW를 유지합니다. 팀은 이러한 혼합을 바탕으로 새 아키텍처에 맞게 스케일링 법칙을 재조정했습니다.

개발자에게 이 중 두 가지는 즉시 중요합니다: 어텐션 스택은 1M 토큰 컨텍스트가 확장 목표가 아니라 기본값이 될 수 있는 이유이고, N-gram 테이블은 125B 모델이 여전히 가볍게 서빙될 수 있는 이유입니다. 나머지는 Qwen4를 위한 프리뷰 자료입니다 — 이것이 바로 Alibaba가 이를 포지셔닝하는 방식입니다.
정직하게 표시된 벤치마크 시트
이 섹션의 모든 수치는 알리바바 자체 평가로, 작성 시점 기준 하루 전의 것이며 어떤 독립 연구소에서도 재현되지 않았습니다. 이는 확정된 점수가 아닌 방향성 지표로 받아들이십시오. 알리바바의 평가 스위트에서 Qwen3.8-Flash-Next(6B active)는 SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5, MathVision 95.7을 기록했으며, JobBench 점수는 55.7입니다. 또한 베이스 변형인 Qwen3.8-Flash-Next-Base는 MMLU-Pro, SuperGPQA, BBH, MMMU를 포함한 14개 벤치마크 중 8개에서 일대일 비교 평가 시 최고의 오픈 모델로 보고되었습니다.
알리바바의 패밀리 배치 주장은 그것이 무엇인지 그대로 명명되어야 한다 — 주장일 뿐이다. 회사는 Qwen3.8-Flash가 SWE-bench Pro에서 Claude Opus 4.6을 9.1포인트 차이로 이기고, JobBench에서는 약 20포인트 차이로 이기며, Claude Opus 4.8에 근접한다고 말한다. 모두 벤더가 보고한 수치이며, 어느 것도 재현되지 않았다. 오늘날 독립적으로 확인 가능한 범위는 더 좁다: 가중치가 공개되었고, 추론 스택이 이미 이를 실행하며, SGLang이 같은 날 지원을 출시했다. 벤치마크 시트의 독립적 재현은 몇 주가 아니라 며칠 안에 가능하다.
비용
가격은 검증하기 가장 쉬운 부분이다. 벤치마크가 아니라 공시된 가격이기 때문이다 — 8월 27일 알리바바는 프로덕션 QwenCloud 요금을 공식적으로 확인했다: 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.47, 캐시 적중 시 100만 개당 $0.016이며, 중국 내수 요금은 ¥0.8/¥2.7/¥0.1이다. 캐시 적중 수치는 에이전트 워크로드에 중요한 요소다: 긴 컨텍스트 에이전트가 매 턴마다 대규모 히스토리를 다시 읽으면 반복 읽기에 드는 비용은 페니 수준이며, 이것이 바로 Qwen4-preview 어텐션 스택이 겨냥하는 워크로드다. 중국 언론 보도는 즉시 헤드라인 가격을 경쟁사와 비교했다 — DeepSeek-V4-Flash 요금의 약 1/3 수준이며, 폐쇄형 프론티어 모델과 비교하면 오차 범위 수준이다. 알리바바 자체 회계 기준으로 이번 학습 실행 비용은 Qwen3.7-Plus의 약 1/9였고, 이러한 구조적 레버리지 덕분에 API 가격이 현재 수준을 유지할 수 있는 것이다.
Qwen 3.8 제품군 중 나머지와 비교하면 그 격차는 뚜렷합니다: 플래그십 Qwen3.8-Max는 토큰 100만 개당 $2.00 및 $6.00로 청구되며, 이미 OrcaRouter에서 제공업체 목록 가격 그대로, 마크업 없이 운영 중입니다. 이제 프로덕션 Qwen3.8-Flash API가 공개되었으므로, 동일한 패스스루 방식이 공식 요금인 $0.15/$0.47과 캐시 적중 요금 $0.016에도 적용됩니다. 라우팅 계층은 가격 인하에 대한 기사를 읽는 것과 설정에 실제로 반영하는 것의 차이를 만들어 줍니다. 두 모델 모두 하나의 키 뒤에 있으며, 두 모델 간 장애 조치가 수행되고, 추가 계약은 필요 없습니다.
"Qwen4 미리보기"가 의미하는 것
발표문을 문자 그대로 읽으면 의미가 명확하다. 이는 Qwen 3.8의 새로운 등급이 아니라 Qwen4의 아키텍처를 더 작고 저렴한 모델이라는 우산 브랜드 아래 조기 출시한 것이다. 그렇게 하는 이유는 타당하다. 프레임워크, 양자화, 배포 패턴이 성숙하는 데 시간이 필요하며, 6B-active 모델은 커뮤니티가 Alibaba가 그 위에 값비싼 모델을 구축하기 전에 GDN + QSA를 대규모로 스트레스 테스트할 수 있는 저렴한 방법이기 때문이다. 반면, 프로덕션 Qwen3.8-Flash는 더 넓은 생태계가 여전히 검토 중인 아키텍처 위에 구축된 API다. 초기 채택자들은 구조적으로 테스트 세트인 셈이다.
그것을 시도해 보는 빠른 경로
오늘 당신에게는 네 가지 현실적인 옵션이 있습니다. vLLM, SGLang, Transformers 또는 TokenSpeed를 통해 공개 가중치를 자체 호스팅하세요. FP8 빌드는 전체 노드에 미치지 못하는 모든 환경에서 합리적인 첫 단계입니다. QwenCloud API를 호출하세요. 현재 공식 요금 $0.15/$0.47로 제공되며 캐시 적중 시 $0.016입니다. OpenCode Go 내에서 사용하세요. 이는 오픈소스 터미널 코딩 에이전트의 정액제 구독으로, 이번 주에 Qwen3.8-Flash를 추가했습니다 (8월 28일 Alibaba가 발표했고 OpenCode 자체 모델 목록에서 확인되었습니다). 또는 이미 Qwen3.8-Max를 호출하는 방식으로 라우터를 통해 프로덕션 Flash를 호출하세요. 공식 요금이 마크업 없이 그대로 전달되므로 맞춤형 통합을 유지할 필요가 없습니다.

솔직한 질문은 여전히 열려 있다. 60억 개의 매개변수를 활성화하는 모델이 다양한 워크로드에서 프로덕션 환경을 견딜 수 있을까, 아니면 오늘 갓 나온 것처럼 보이는 벤치마크 시트가 한 달 뒤에도 그렇게 보일까? 그것은 기다릴 이유가 아니라, 전체 스택 앞에 두기보다 장애 조치 뒤에 배치해야 할 이유다. 가중치는 공개되었고, 가격도 확정되었으며, 아키텍처는 알리바바가 선언한 방향이다. 앞으로 몇 주가 6B가 충분했는지를 판가름한다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
