
Qwen3.8-Flash-Next: 알리바바, Qwen4가 존재하기 전에 Qwen4 아키텍처를 선보이다
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
알리바바가 Qwen4 모델을 공개하기 전에 Qwen4 아키텍처를 먼저 발표할 예정이다. Qwen4 제품군을 구동할 차세대 아키텍처를 기반으로 구축된 오픈 웨이트 멀티모달 mixture-of-experts 모델인 Qwen3.8-Flash-Next는 2026년 8월 26일 베이징 시간 23:00에 ModelScope에서 공개될 예정이다. 알리바바는 이번 공개를 기술 프리뷰로 규정하고 있다. 개발자들은 아키텍처를 먼저 접하게 되며, 전체 Qwen4 제품군은 나중에 출시된다. 이 글을 작성하는 시점까지 파라미터 수, 라이선스, 가격은 확인되지 않았으므로, 이 글은 현재까지 알려진 정보를 정리한 것이다 — 아래의 각 세부 사항은 확실성 수준에 따라 표시되어 있다.
이번 달 알리바바의 출시 주기를 따라오지 않았다면, 기준점은 Qwen3.8-Max입니다. 8월 3일에 출시되고 2주도 채 지나지 않아 Qwen3.8-2.4T-A95B로 오픈소스화된 2.4조 파라미터 플래그십 모델이죠. Qwen3.8-Flash-Next는 그로부터 한 달도 채 안 되어 등장합니다. 2.4조 파라미터 오픈가중치 모델을 내놓은 같은 연구소가, 이제 그 다음 세대의 플래그십 이름이 정해지기도 전에 해당 세대의 아키텍처를 공개하고 있습니다.
무엇이 발표되었는가
신호는 평소 채널을 통해 아레나에 도달했다. Qwen3.8-Flash-Next의 ModelScope 티저 페이지가 8월 25일 공개됐다. 페이지에는 '오픈 릴리즈 예정' 배지와 '차세대를 향해 — 번개처럼 빠르게'라는 태그라인, 그리고 2026-08-26 23:00(UTC+08:00)을 가리키는 출시 타이머가 포함되어 있었다. 알리바바의 Qwen 팀은 같은 날 X에 '다음 Qwen 물결이 다가오고 있다'고 게시했다. X의 @kimmonismus가 우리에게 이 기사를 전달한 게시물은 같은 내용을 약간 다른 표현으로 설명했다: 차세대 아키텍처 기반의 오픈 가중치 멀티모달 MoE, 그리고 커뮤니티가 Qwen4 제품군을 준비할 수 있도록 하는 얼리 액세스.

다시 읽을 가치가 있는 부분은 알리바바의 자체적인 프레이밍이다. 이 모델은 "향후 Qwen4 제품군을 구동할" 차세대 아키텍처를 기반으로 구축된 것으로 설명되며 — 명시적으로 Qwen4 자체가 아닌 것으로 설명된다. 알리바바가 밝힌 이유는 아키텍처 변경 사항이 제품군 도래 전에 커뮤니티에 제공되어야, 실제 제품이 출시될 때 런타임, 양자화, 애플리케이션이 준비될 수 있다는 것이다. 이는 마케팅 포지션이면서 동시에 기술적 약속이기도 하다. 즉, 어려운 부분을 먼저 미리 선보이고 커뮤니티를 함께 데려가는 것이다.
오늘 확인된 것과 확인되지 않은 것은 무엇인가:
• 티저와 Qwen 성명에 따라 확인됨: Qwen3.8-Flash-Next는 오픈 가중치(open-weight), 멀티모달, 그리고 Qwen4 아키텍처 기반의 MoE 모델입니다.
• Qwen 성명에 따라 확인됨: GDN 하이브리드 아키텍처와 Qwen Sparse Attention(QSA)이라는 두 가지 주요 아키텍처 변경 사항을 도입합니다.
• 티저에 따라 확인됨: ModelScope에서의 출시 시간은 2026-08-26 23:00 (UTC+08:00)입니다.
• 확인되지 않음: 총 또는 활성 매개변수, 라이선스 조건, 컨텍스트 길이, API 제공 여부 또는 가격, 그리고 모든 벤치마크 점수. 가중치가 아직 공개되지 않았으므로 독립적인 평가는 아직 존재하지 않습니다.

Qwen4 아키텍처가 실제로 무엇인지
두 가지 메커니즘이 이야기를 이끌어 간다. 첫 번째는 알리바바의 선형 어텐션 계층인 GDN(Gated Delta Network)이다. 표준 트랜스포머는 시퀀스 길이에 따라 커지는 키-값 캐시를 유지하는 반면, GDN 계층은 고정 크기의 순환 상태를 유지하고 학습된 게이팅 규칙으로 이를 갱신한다. 그 계보는 DeltaNet과 Mamba-2로 이어진다. 그 성과는 Qwen3-Next 이후로 Qwen 라인을 조용히 뒷받침해 온 바로 그 것이다. 상태가 커지지 않으므로 긴 컨텍스트는 저비용으로 유지되며, 동시에 소수의 전체 어텐션 계층이 선형 어텐션이 약한 정밀 검색을 수행하기 위해 섞여 남아 있다. 현재 세대에서 그 혼합 비율은 전체 어텐션 계층 하나당 대략 GDN 계층 세 개 수준이다. Qwen3.8-2.4T-A95B 체크포인트에 대한 커뮤니티 분석은 23개의 어텐션 계층에 맞서 69개의 GDN 계층을 집계한다. Qwen3.8-Flash-Next는 정확히 그 계보 위에서 "GDN 하이브리드 아키텍처"로 설명된다.
둘째, QSA — Qwen Sparse Attention — 는 진정한 신규 요소이며, 아직 공개된 기술 설명이 없다. 그저 이름과 프리뷰의 두 가지 주요 변경 사항 중 하나로 언급된 것뿐이다. 이렇게 세부 정보가 없는 것 자체가 하나의 패턴이다. Qwen3-Next의 2025년 말 프리뷰는 Gated DeltaNet을 동일하게 문서화가 부족한 상태로 도입했고, 해당 아키텍처는 Qwen3.5 시리즈가 채택한 후에야 완전히 명세화되었다. 독자가 얻을 실질적인 결론은 두 경우 모두 같다. 아키텍처 카나리아가 먼저 등장하고, 문서와 프로덕션 모델은 그 뒤에 따라온다.
이미 한 번 성공했던 플레이북
알리바바는 정확히 이런 전략을 쓴 적이 있고, 그것은 효과가 있었다. 2025년 말, Qwen3-Next는 Gated DeltaNet과 선형 어텐션 및 전체 어텐션의 하이브리드를 미리 공개했다. Qwen3.5 시리즈가 출시되었을 때, 그 설계도를 대규모로 채택했고, 그 하이브리드는 이후 Qwen3.8 세대까지 이어져 2.4T 플래그십을 포함하게 되었다. 이 선례가 여기서 중요한 이유는 그것이 시사하는 시기 때문이다. 전체 Qwen4 제품군은 이 프리뷰의 너머에 기대해야지, 그 안에서 기대할 것이 아니다. 만약 Qwen3-Next의 간격이 기준이 된다면, "이것이 아키텍처다"와 "이것이 제품군이다" 사이의 거리는 몇 개월 단위로 측정된다. 티저에는 이를 확인해 주는 내용이 없다. 그것은 알리바바가 이제 두 번이나 실행한 패턴에서 나온 추론이다.
우리가 아직 모르는 것
미지의 것들이야말로 프리뷰의 핵심이며, 그것들은 실재한다:
• 매개변수. 티저는 아무것도 공개하지 않는다. X와 Reddit의 커뮤니티 추측은(공식적으로 뒷받침되는 바 없음) 약 125B 전체 / 6B 활성 구성에 대규모 n-gram 임베딩 조회 테이블이 포함된 쪽을 가리킨다. 루머로 취급하라.
• "Flash" 등급. Qwen3.5 세대에서 클라우드 전용 Qwen3.5-Flash는 오픈 가중치(open-weight) 모델인 Qwen3.5-35B-A3B의 강화 변형이었습니다. Qwen3.8-Flash-Next가 비슷한 크기의 Qwen3.8 모델의 오픈 가중치 대응 모델인지 여부는 알 수 없으며, 대신 125B-A6B급 모델일 수도 있습니다. 두 해석 모두 추측에 불과합니다.
• 라이선스. 알리바바의 최근 Qwen 릴리스는 Apache-2.0(Qwen3.8-27B)부터 수익 게이트가 적용된 Qwen3.8-Max 라이선스까지 다양합니다. Flash-Next가 어디에 해당하는지에 따라 상업적으로 사용할 수 있는지, 그리고 어떤 용도로 사용할 수 있는지가 결정됩니다.
• 벤치마크. Qwen 성명은 에이전틱 코딩, 장기 지평 과제, 멀티모달 지능을 강조하지만, 수치는 첨부되어 있지 않으며 가중치가 공개될 때까지 독립적인 평가는 없다.
2주 주기로 일하는 가족
주변의 전개 리듬은 그 자체로 하나의 이야기다. Qwen3.8-Max, 2.4조 파라미터의 플래그십 모델이 8월 3일에 출시되었고, 오픈 가중치 모델인 Qwen3.8-2.4T-A95B가 8월 12~13일에 뒤를 이었으며, 무료 Apache-2.0 라이선스의 Qwen3.8-27B가 며칠 후 등장했다. 그리고 이제 그 달이 끝나기도 전에 차세대 아키텍처가 프리뷰로 공개되고 있다. 현재 이 속도로 반복 개발을 수행하는 연구소는 없다. 모델을 선택하는 독자의 입장에서 실질적인 결과는 "최고의 Qwen"이 계속 이동하는 표적이라는 점이며, 세대 간 차이가 주변 생태계가 적응하는 속도보다 빠르게 도래한다는 점이다. 모델이 아니라 결정을 사는 것이 점점 더 방어 가능한 선택지가 되고 있다.
개발자가 지금 해야 할 일
모델만이 아니라 아키텍처를 계획하세요. Qwen3.8-Flash-Next는 출시 첫날에는 검증되지 않은 프리뷰가 될 것입니다. 독립적인 벤치마크도 없고, 런타임 생태계도 아직 따라잡는 중이며, 이를 사용할 워크로드에 중요한 에이전틱 및 장기 지평(long-horizon) 강점에 대해서는 공급업체의 주장만 있을 뿐입니다. 안전한 평가 방법은 프로덕션 경로에 연결하는 것이 아니라, 위험 부담이 낮은 워크로드 사본을 해당 모델로 라우팅하고 출력을 기존 모델과 비교하며, 새로운 오픈웨이트 모델을 서비스하는 공급자가 오작동하는 순간을 자동 장애 조치(failover)가 흡수하도록 하는 것입니다. OrcaRouter에서는 이는 이미 사용 중인 것과 동일한 엔드포인트이자 동일한 키입니다. Qwen3.8-Flash-Next와 현재 모델이 하나의 API 뒤에 있으며, 라우팅 DSL은 어떤 것도 커밋되기 전에 동일한 프롬프트로 프리뷰와 기존 모델을 A/B 테스트할 수 있습니다.
가격이 존재한다면, 같은 방식으로 읽혀야 한다. 알리바바는 Flash-Next의 API 가격을 발표하지 않았으며, 출시되지 않은 가중치는 어디서도 라우팅할 수 없다. 제공자가 이를 공개하는 경우, OrcaRouter는 제공자의 정가를 0% 마크업으로 그대로 통과시킨다. 따라서 알리바바의 가격이 어떻게 정해지든 그날 그대로 표시된다. 오늘 실제로 확인할 수 있는 가장 가까운 기준선은 Qwen3.8-Max(qwen/qwen3.8-max)로, 이 아키텍처가 결국 그 아래에 자리하게 될 플래그십 모델이다. 100만 토큰 컨텍스트 창은 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00이며, 정가로 전달된다. Flash-Next의 가격이 공개될 때 그 숫자를 기억하라. 그것이 차세대가 넘어서야 할 비용이다.

드롭에서 볼 것
릴리스 타이머가 만료되는 순간 중요한 네 가지가 있습니다:
• 매개변수 수와 활성 매개변수 등급 — 이것이 루머에서 말하는 125B-A6B급 모델인지, 아니면 더 작은 규모의 모델인지.
라이선스 — Qwen3.8-27B처럼 허용적이거나, Max 라이선스처럼 제한적입니다.
• 최초의 독립 평가가 벤더의 에이전트 기반 코딩 및 장기적(long-horizon) 주장을 재현하는지 여부 — 신뢰해야 할 것은 마케팅 문구가 아니라 수치입니다.
• Alibaba가 프리뷰 이후 전체 Qwen4 제품군을 내놓을 때까지 얼마나 기다리는지.
그 어떤 것도 여기서는 알 수 없다. 오늘 알 수 있는 것은 알리바바가 내린 결정의 형태다. 즉, 차세대 아키텍처를 플래그십보다 먼저 공개하는 것이 가치 있다는 베팅이다. 그 베팅이 바로 이야기다 — 그리고 가중치는 내일 공개된다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
