Qwen3.8-Flash-Next 릴리즈 — Alibaba의 Qwen4 아키텍처 프리뷰 내부. 재생성된 일러스트레이션.
Guides & Insights

Qwen3.8-Flash-Next 릴리스: Alibaba Qwen4 아키텍처 프리뷰 내부 살펴보기

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Ali​baba가 2026년 8월 26일에 발표한 가장 유용한 문서는 보도 자료가 아니라 기술 보고서였다. 그날 출시된 오픈 가중치 멀티모달 mixture-of-experts 모델인 Qwen3.8-Flash-Next는 "Qwen3.8-Next 아키텍처 설계: 평가, 효율성, 훈련 안정성"이라는 제목의 논문과 함께 발표되었으며, 그 보고서가 핵심이다. 이 보고서는 벤더의 제품 출시가 거의 하지 않는 일을 한다. 즉, 절제(ablation) 실험, 부정적 결과, 훈련 레시피 실험을 공개하고, 각 발견을 이 모델이 미리 선보이려는 Qwen4 제품군의 아키텍처로 연결한다.

8월 26일에 실제로 출시된 것

그 모델 자체는 Qw​en의 2026년 기준으로 보면 겸손한 수준이며, 이는 의도적이다. Qwen3.8-Flash-Next는 125B의 메인 모델 파라미터와 별도의 51B n-gram 임베딩 테이블을 저장한다 — 4B 멀티-토큰 예측 모듈을 제외하면 약 176B — 그러나 토큰당 6B만 활성화한다. 512-전문가 mixture-of-experts 모델로, top-10 라우팅과 48개 레이어를 갖추고 있으며, 기본적으로 262,144 토큰의 컨텍스트를 가지며 YaRN을 통해 1M까지 확장 가능하다. 텍스트, 이미지, 비디오 입력을 받아 텍스트를 출력한다. 가중치는 qwen-community-1.0 라이선스 하에 Hugging Face와 ModelScope에서 제공되며, Ali​baba 자체 블로그에서는 이를 "Qwen4를 뒷받침할 아키텍처의 실험적 프리뷰"라고 부른다 — Qwen3-Next가 Qw​en3.5 라인에서 수행했던 것과 같은 역할로, 플래그십보다 먼저 나는 카나리아와 같다.

같은 날, Ali​baba는 상업용 대응 버전을 공개했다: QwenCloud API에서 제공되는 Qwen3.8-Flash라는 서비스형 빌드로, 입력 토큰 100만 개당 $0.16, 출력 토큰 100만 개당 $0.47이다. 이 둘은 혼동하기 쉽지만 구분해서 이해할 필요가 있다. Qwen3.8-Flash-Next는 기술 보고서가 분석하는 오픈 가중치 미리보기 버전이고, Qwen3.8-Flash는 가격이 책정된 프로덕션 API 빌드로, 기본 100만 토큰 컨텍스트와 Open​AI- 및 Anthropic-호환 요청 형식을 갖춘다. 가격, 벤치마크, 아키텍처 논쟁은 모두 동일한 엔지니어링에서 비롯된다.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

기술 보고서의 네 가지 아키텍처 결정

이 논문의 뼈대는 장문맥·저비용 최전선 모델이 어떤 모습이어야 하는지에 대한 네 가지 베팅이며, 각각에는 실험적 근거가 뒷받침된다.

• 주의 — GDN + QSA 하이브리드. 4개 레이어 중 3개는 Gated DeltaNet을 사용하는데, 이는 선형 어텐션 레이어로, 시퀀스 길이에 따라 커지는 KV 캐시 대신 히스토리를 고정 크기의 순환 상태로 압축합니다. 나머지 레이어는 Qw​en Sparse Attention으로, 시퀀스를 마이크로 블록으로 집계하고, 저비용으로 점수를 매긴 다음, 중요한 영역에서만 전체 어텐션을 실행합니다. Ali​baba는 1M 컨텍스트에서 최대 7.6배 prefill 및 4.9배 decode 속도 향상을 보고했으며, SGLang 자체의 day-0 벤치마크에서는 더 높은 10.2배 및 6.6배로 측정되었습니다. 90% 프리픽스 캐시 적중률에서 prefill 처리량은 Qwen3.7-Plus의 8.6배에 달합니다. 이는 공급업체 및 파트너가 보고한 수치로, 독립적으로 검증된 것은 아닙니다.

• Residual stream — Gated Residual: 단일 잔차 경로가 요소별 동적 게이팅을 갖춘 네 개의 병렬 분기로 확장되며, 이는 GatedNorm 스타일 제어를 적용한 Hyper-Connection 스타일의 다중 분기 설계입니다. 게이트는 분기별 읽기와 쓰기를 조절하며, 논문에 따르면 활성화 이상치(activation outlier)를 억제하고, 실질적으로 잔차 상태를 FP8로 저장할 수 있게 해줍니다.

• 임베딩 — 510억 n-gram 테이블. 토큰마다 하나의 임베딩을 두는 대신, 모델은 현재 토큰과 이전 토큰들을 키로 하는 조회 테이블을 사용하여 전체 구문과 지역 패턴을 저장합니다. 토큰당 비용이 거의 들지 않으며, 조회 주소를 미리 알 수 있으므로 호스트 메모리에 상주시키고 비동기적으로 프리페치할 수 있어 GPU 메모리에서 완전히 제외할 수 있습니다. 이것이 1760억 규모로 저장된 체크포인트를 75GB급 머신에서 실행할 수 있게 하는 비결이며, 그 기원은 Gemma 3n의 레이어별 임베딩과 Deep​Seek의 Engram에서 찾을 수 있습니다.

• 최적화 — Muon, 튜닝됨. 학습은 직교화 기반 모멘텀 방법인 Muon 옵티마이저를 사용하며, 이를 2차원 선형 맵(어텐션, GDN, MoE 전문가 가중치)에 적용합니다. 반면 AdamW는 임베딩, 라우터, 저랭크 파라미터에 유지됩니다. 논문은 또한 읽을 가치가 있는 부정적 결과를 보고합니다: 배치 크기 워밍업은 아무것도 개선하지 않으면서 옵티마이저 단계를 18.8% 더 소비하는 것으로 드러나 폐기되었습니다.

벤치마크 표를 주의 깊게 읽으십시오.

여기 실린 모든 헤드라인 수치는 Qwen이 모델 카드와 보고서에 직접 게시한 자체 수치로, 그 어느 것도 독립적으로 재현된 적이 없습니다. 모델이 나온 지 하루밖에 안 됐고 아직 어떤 제3자도 검증하지 않았기 때문입니다. 그렇게 감안하고 읽어도 여전히 놀라운 것은, Qwen3.8-Flash-Next가 6B 활성 파라미터로 훨씬 더 크고 기존에 자리 잡은 모델인 DeepSeek-V4-Flash-0731과 대등하게 겨루고 있다는 점입니다.

• DeepSWE 1.1 — 58.7 vs 54.4 (벤더 보고).

• SWE-bench Pro — 62.5 vs 56.0 (벤더 보고).

Toolathlon 검증됨 — 73.5 vs 70.3 (공급업체 보고 기준).

• LiveCodeBench v6 — 91.9 대 90.6 (공급업체 보고).

• GPQA Diamond — 91.7 대 90.8 (공급업체 보고).

• IFBench — 81.3 대 79.2 (공급업체 보고 기준).

그런 다음 보고서가 공개적으로 명시한 격차는 다음과 같습니다: NL2Repo-Bench에서 48.1 대 DeepSeek-V4-Flash-0731의 54.2 — 저장소 수준 코드 생성에서의 실질적인 적자로, 더 작은 모델이 따라가지 못하는 유일한 에이전틱 코딩 차원입니다. Agents' Last Exam은 24.3 대 25.2로 팽팽합니다. 사무 자동화의 경우, Qw​en은 CoWorkBench 73.9를 보고하지만, 이는 사내 벤치마크이며 Ali​baba는 이를 메인 차트에서 제외합니다.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

비전(vision) 측면에서 자체 보고된 표는 AndroidWorld 84.5 대 Claude Opus 4.6 Max의 62.0, RealWorldQA 88.5 대 73.9를 보여줍니다. Humanity's Last Exam은 Qw​en이 Claude Opus 4.6 Max에게 완전히 패배하는 유일한 헤드라인이며, 그 점수의 판정 자체가 GPT-4o에 의해 수행되었기 때문에 그 비교조차도 깨끗하지 않습니다.

가격: 플래그십의 12분의 1

{{1}}그다음 예산에 중요한 숫자가 나옵니다.{{/1}} 서비스되는 {{2}}Qwen3.8-Flash{{/2}} 빌드는 {{3}}QwenCloud{{/3}}에서 입력 토큰 100만 개당 $0.16, 출력 토큰 100만 개당 $0.47입니다. 이는 알리바바 자체 플래그십인 {{4}}Qwen3.8-Max{{/4}}(입력 100만 개당 $2.00, 출력 100만 개당 $6.00) 가격의 약 12분의 1에 해당하며, 보고서에 따르면 이 모델은 {{5}}Qwen3.7-Plus{{/5}}의 약 9분의 1에 해당하는 컴퓨팅으로 훈련되었습니다. 중국 모델 업체들은 여름 내내 플래시 등급 가격을 인하해 왔으며, 이번 출시는 단순한 할인이 아니라 아키텍처 정당성을 덧붙여 도착한 해당 캠페인의 {{6}}Qwen{{/6}} 측면입니다.

카테고리 전반에 걸쳐 비교하는 사람이라면, 모든 제공업체가 동일한 숫자를 표시할 때 계산이 더 쉽습니다. OrcaRouter는 나머지 Qw​en 제품군(Qwen3.8-Max, Qwen3.8-27B, Qwen3.8)을 제공업체의 공식 가격 그대로 0% 마크업으로 라우팅하므로, 공급업체의 가격 인하가 발표된 날 바로 당사 쪽에도 반영됩니다. Qwen3.8-Flash-Next는 아직 당사 카탈로그에 없습니다. 하지만 당사가 라우팅하는 런타임에 도달하면, 추가 계약 없이 동일한 원키(one-key) 정가 설정에 바로 포함됩니다.

오늘 그것으로 할 수 있는 일

출시 당일 서빙 지원 범위가 이례적으로 넓다. SGLang은 쿡북 페이지와 전용 이미지(lmsysorg/sglang:qwen38flashnext)를 제공하고, vLLM은 vllm/vllm-openai:qwen38-flash-next를 제공한다. NVIDIA는 두 가지 모두를 검증했으며, GB300 NVL72 랙에서 TensorRT LLM까지 포함해 GPU당 초당 16,000토큰 이상의 FP8 성능을 확인했고, NeMo는 파인튜닝을 담당한다. 데이터센터 규모 아래에서는 DGX Spark 클러스터와 4×RTX PRO 6000 워크스테이션에서도 모델이 실행되며, 당일 커뮤니티 양자화 작업 — Unsloth의 GGUFs와 75GB RAM에 들어가는 1비트 빌드(전체 정확도의 약 80% 수준) — 덕분에 176B 저장 체크포인트는 소규모 팀이 소유한 하드웨어에서도 실제로 실행 가능하다. 직접 실행하는 대신 API로 호출하고 싶은 팀은 Alibaba 자체 QwenCloud와 여러 서드파티 플랫폼을 통해 Qwen3.8-Flash API를 이용할 수 있지만, 대부분의 얼리 어답터가 가장 먼저 선택하는 것은 역시 오픈 가중치다.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

그 목록 뒤에 숨은 VRAM 계산은 n-gram 테이블이며, 서빙 스택들이 다음으로 수렴하는 지점이기도 하다. 기술 보고서가 GPU 메모리 밖에 두는 레이어별 임베딩은 순수 조회 구조다. 생성된 토큰마다 모델이 3억 2천만 개의 행 중 약 16개만 가져오기 때문에 오프로딩 비용이 저렴하다. vLLM은 아키텍처 지원 풀 리퀘스트가 아직 열려 있는 동안 전용 개발 이미지로 Qwen3.8-Flash-Next를 서빙하고 있다. 그 작업의 가장 최신 조각인 동일한 vLLM 작성자의 초안 PR(vllm-project/vllm#54371, 아직 병합되지 않음)은 테이블을 호스트 메모리에 유지하고 VRAM을 예약하는 대신 CUDA 통합 가상 주소 지정으로 읽어들이는 PLE-Offload 서빙 경로를 추가한다. FP8 기준으로 테이블은 약 173GB 체크포인트 중 대략 48GB를 차지하므로, 이를 오프로딩하는 것이 데이터센터 GPU 하나와 96GB 카드 한 장 — RTX PRO 6000 또는 DGX Spark 하나의 통합 메모리 풀 — 사이의 차이를 만들어낸다. 아직 이른 단계이므로 오늘날 지원되는 옵션이라기보다는 방향성으로 받아들여야 한다. 하지만 이는 기술 보고서가 이미 주장한 바를 런타임이 따라잡는 것이며, VRAM 수치 때문에 망설이고 있었다면 주목할 만한 변화다.

하루 된 프리뷰로 수치가 재현되지 않은 상태라면 프로덕션 경로에 그걸 걸기에는 전형적인 반례입니다. 그리고 바로 그런 상황을 위해 존재하는 것이 장애 조치입니다. 런타임에 Qwen3.8-Flash-Next가 있고, 이미 신뢰하는 모델로의 자동 장애 조치와 함께 하나의 엔드포인트를 그 모델로 지정한다면, 중요하지 않은 트래픽에서는 새 아키텍처의 이점을 얻고, 문제가 생길 때는 깔끔하게 대체 모델로 빠질 수 있습니다. 다시 연결할 필요도 없습니다. 라우팅 규칙일 뿐, 코드 변경이 아니기 때문입니다.

이 미리보기가 Qwen4에 대해 말해주는 것

Ali​baba는 이런 전략을 이미 구사한 적이 있다. Qwen3-Next는 2025년 후반에 Gated DeltaNet을 문서화가 빈약한 상태로 미리 선보였고, 그 아키텍처는 Qw​en3.5 시리즈가 대규모로 채택한 이후에야 완전히 명세화되었다. 그 패턴이 반복되고 있다: Qwen3.8-Flash-Next가 카나리아 역할을 하고 있으며, 이 보고서가 곧 실험을 통한 명세화다. 지켜봐야 할 구체적인 사항은 Qwen4 플래그십이 3:1 GDN-QSA 분할을 채택하는지, n-그램 임베딩이 플래그십 규모의 프로덕션 서빙과의 접촉에서 살아남는지, 그리고 무엇보다 독립적인 평가가 더 큰 모델 대비 6B-활성(active)의 우위를 확인해 주는지 여부다. 효율성 논제가 성립한다면, Qwen4 플래그십은 이전 세대보다 훨씬 더 낮은 서빙 비용으로 출시될 수 있다.

자주 묻는 질문

Qwen3.8-Flash-Next와 Qwen3.8-Flash — 같은 모델인가요?

아니요, 그리고 그 구분은 중요합니다. Qwen3.8-Flash-Next는 기술 보고서가 분석하는 오픈 가중치 아키텍처 프리뷰이고, Qwen3.8-Flash는 Alibaba가 QwenCloud에서 기본 1M 컨텍스트로 백만 토큰당 $0.16/$0.47에 제공하는 프로덕션 API 빌드입니다. 동일한 엔지니어링 계보, 다른 산출물 — 하나는 자체 호스팅과 검사를 위한 것이고, 다른 하나는 유료 관리형 서비스입니다.

프로덕션 워크로드를 오늘 그것으로 이전해야 할까요?

두 번째 의견 없이는 안 됩니다. 모든 벤치마크는 공급업체가 보고한 것이며 재현되지 않았고, 아키텍처가 충분히 새로운 탓에 서빙 스택이 아직 수렴 중입니다 — vLLM 자체 지원도 여전히 오픈 풀 리퀘스트를 통해 반영되고 있습니다 — 그리고 유일한 에이전틱 코딩 격차(NL2Repo)는 정확히 프로덕션 코더들이 부딪히는 작업입니다. 오픈 가중치 덕분에 직접 평가하는 비용이 낮고, 출시 당일 SGLang 및 vLLM 지원 덕분에 이번 주 파일럿이 가능합니다. 그러나 시작은 컷오버가 아니라 페일오버 뒤의 파일럿이 정직한 방법입니다.

실제 Qwen4는 언제 출시되나요?

Ali​baba는 말하지 않았다. 이번 릴리스에서 유일한 타이밍 신호는 역사적이다: 마지막 카나리인 Qwen3-Next는 Qw​en3.5 시리즈가 해당 아키텍처를 채택하기 약 한 시즌 전에 날아갔다. 그 주기로 보면 Qwen4의 플래그십들은 보이는 것보다 더 가까이 있다 — 그러나 이 보고서는 로드맵이 아니라 아키텍처에 관한 것이다.

요점

Qwen3.8-Flash-Next는 논문이 곧 제품인 드문 릴리스입니다. 모델 자체에 대한 정직한 성적표는 다음과 같습니다: 대부분의 공유 벤치마크에서 훨씬 더 큰 모델들과 맞먹는 6B 활성 파라미터, 저장소 수준 코드에서의 명명된 격차 하나, 플래그십의 12분의 1에 불과한 서비스 가격, 그리고 프런티어 모델이 어떻게 저렴해질 수 있는지에 대한 Qw​en의 답인 아키텍처입니다. 기술 보고서는 Qwen3.8-Flash-Next가 무엇을 위한 것인지 말해줍니다 — 그리고 그것은 모델이 아닙니다. 그것은 Qwen4가 될 아키텍처에 대한 증거이며, Qwen4가 출시되기 전에 읽을 가치가 있습니다. 왜냐하면 그것이 바꾸는 결정은 Qwen4가 도착했을 때 당신이 내릴 결정이기 때문입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube