기사 'Qwen3.8-Flash-Next — 유출 리포트'의 히어로 타이틀 카드로, '미검증 — QWEN4 아키텍처 프리뷰' 배지와 부제 'Alibaba, 모델보다 먼저 Qwen4 아키텍처를 선보이다'가 있다. 세 개의 칩에는 '출처: @kimmonismus', '2026년 8월 25일', '공개: 2026년 8월 26일 23:00 UTC+08'이 표시된다. 왼쪽 카드에는 '주장: Qwen4 아키텍처를 미리 선보이는 오픈 가중치 멀티모달 MoE', 오른쪽 카드에는 '상태: 가중치 미공개, 공개까지 약 24시간'이라고 적혀 있다. OrcaRouter 로고는 오른쪽 하단 모서리에 합성되어 있다.
Guides & Insights

Qwen3.8-Flash-Next 출시: 알리바바, Qwen4가 존재하기 전에 Qwen4 아키텍처를 선보이다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Qwen3.8-Flash-Next는 마침내 Alibaba가 만들지 않은 숫자를 갖게 되었습니다 — 그리고 그 숫자들은 가장 요란한 버전의 이야기가 말하는 것과 다릅니다. 9월 7일 v4.3으로 재산정된 Artificial Analysis Intelligence Index에서 Alibaba의 오픈 웨이트 프리뷰는 40점을 기록하며 비교 클래스에 속한 113개 모델 중 5위에 올랐습니다. 계속 비교 대상이 되는 모델인 DeepSeek V4 Flash 0731 (Reasoning, Max Effort)은 35점으로 9위입니다. 이는 대등함이 아닙니다. 더 작은 모델이 5점 앞선 것입니다. 또한 이는 이번 달 전까지 공개된 수치라곤 공급업체 자체의 것뿐이었던 한 모델에까지 이른 최초의 폭넓고 독립적인 평가표이기도 합니다. 모델 자체는 새로운 것이 아닙니다. 가중치는 8월 24일 Hugging Face에 공개되었고, 공식 ModelScope 릴리스는 8월 26일에 나왔습니다. 이번 달에 달라진 점은 이제 독자가 그 주장들을 그대로 받아들이는 대신 확인할 수 있게 되었다는 것입니다.

이 글을 다시 살펴보게 된 계기는 X의 @teortaxesTex 님이 던진 질문이었습니다. 이 프리뷰가 조용히 과소평가되고 있는 게 아니냐는 것이었죠. 주장에 따르면 DeepSeek V4 Flash 0731과 같은 Artificial Analysis 등급에 속하면서 "거의 4배 더 작고", "활성 파라미터는 거의 3배 더 적다"고 합니다. 이 세 가지 주장 가운데 두 가지는 공개된 데이터를 들이대는 순간 성립하지 않습니다. 그리고 그 정정은 이 모델에 유리하게 작용합니다. 중요한 수치에서 이 프리뷰는 비교 대상과 대등한 수준이 아니라 앞서 있기 때문입니다.

크기부터 시작하죠. 여기서는 숫자가 명확합니다. Qwen3.8-Flash-Next는 약 180B 파라미터를 저장합니다 — 125B 규모의 전문가 혼합(MoE) 본체, 별도의 51B n-gram 임베딩 테이블, 그리고 약 4B의 다중 토큰 예측 레이어 — 그리고 토큰당 그중 6B를 활성화합니다. DeepSeek V4 Flash 0731은 284B를 저장하고 13B를 활성화합니다. 이는 Qwen의 모델 카드와 DeepSeek의 문서에 나온 수치이며, Artificial Analysis가 두 모델 페이지 모두에 기재하고 있는 수치입니다. 이들이 산출하는 비율은 1.6배(저장된 파라미터 기준)와 2.2배(활성 파라미터 기준)입니다. 이는 진정한 효율성 스토리이며, 이 아키텍처가 중요한 이유입니다 — 하지만 4배도 3배도 아닙니다. 더 큰 배수를 뒷받침하는 공개된 수치를 어디에서도 찾을 수 없었습니다. 의도가 파라미터 수가 아니라 서빙 메모리 풋프린트였다면, 그 수치도 공개되지 않았습니다.

무엇이 발표되었는가

Aliba​ba는 Qwen4 모델을 공개하기 전에 Qwen4 아키텍처를 먼저 공개했다. Qwen4 패밀리를 구동할 차세대 아키텍처를 기반으로 만든 오픈 웨이트 멀티모달 전문가 혼합(MoE) 모델인 Qwen3.8-Flash-Next는 두 단계에 걸쳐 나왔다. 공식 Qw​en/Qwen3.8-Flash-Next 저장소가 8월 24일 Hugging Face에 공개됐는데, 이는 티저 타이머가 가리키던 ModelScope 공개보다 이틀 앞선 것이었다. 정식 ModelScope 공개는 8월 26일 23:00 UTC+08:00에 이루어졌고, 서비스되는 Qwen3.8-Flash 변형 모델의 가격도 같은 시각에 책정됐다. 그 이후로 계속 회자되고 있는 모델 카드의 대표 주장은, 토큰당 6B 파라미터를 활성화하는 모델이 Aliba​ba 자체 표에서 비교 가능한 9개 벤치마크 중 8개에서 Claude Opus 4.6 Max를 능가한다는 것이다. Aliba​ba는 Qwen4 패밀리 전체는 나중에 나온다고 계속 말하고 있다.

이번 달 알리바바의 행보를 따라가지 않고 있었다면, 기준점은 Qwen3.8-Max다 — 8월 3일에 공개된 2.4조 매개변수 플래그십이며, 채 2주도 지나지 않아 Qwen3.8-2.4T-A95B로 오픈소스화되었다. Qwen3.8-Flash-Next의 가중치는 그로부터 한 달도 안 되어 나왔다. 2.4조 매개변수 오픈 가중치 모델을 내놓은 바로 그 연구소가 이제 그다음 세대의 아키텍처를 배포하고 있는데, 그 세대의 플래그십은 이름조차 붙기 전이다.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

다시 읽어볼 만한 부분은 Aliba​ba 자신의 설명 방식이다. 이 모델은 "곧 출시될 Qwen4 패밀리를 구동하게 될" 차세대 아키텍처 위에 구축된 것으로 설명되며, Qwen4 자체는 아니라고 명시된다. Aliba​ba가 밝힌 이유는, 패밀리가 도착하기 전에 아키텍처 변경 사항이 커뮤니티의 손에 들어가 있어야 실제 제품이 출시될 때 런타임, 양자화, 애플리케이션이 준비되어 있게 하기 위해서다. 이는 마케팅상의 입장이지만, 동시에 기술적 약속이기도 하다: 어려운 부분을 먼저 미리 보여주고, 커뮤니티를 함께 데리고 간다는 것.

모델 카드가 정하는 것과 정하지 않는 것:

• 공식 모델 카드에 따라 확인됨: Qwen3.8-Flash-Next는 오픈 가중치(open-weight), 멀티모달(multimodal), Qwen4 아키텍처 기반 mixture-of-experts 모델입니다 — 카드에서는 이를 "Qwen4를 뒷받침할 아키텍처의 실험적 프리뷰"라고 부릅니다.

• 모델 카드 및 구성(config)에 따라 확인됨: 36개의 선형 어텐션 레이어와 12개의 전체 어텐션 레이어로 구성된 48레이어 하이브리드 내부의 두 가지 주요 아키텍처 변경 사항 — Gated Delta Network(GDN) 및 Qw​en Sparse Attention(QSA).

• 저장소에서 확인됨: 총 125B 파라미터에 토큰당 6B가 활성화됨(전문가 512개, 라우팅 10개 + 공유 1개) — 별도의 51B n-gram 임베딩 테이블과 MTP 레이어를 계산에 포함하면 Artificial Analysis는 180B로 표기 — Qw​en Community License 1.0에 따라 1,000,000까지 확장 가능한 262,144토큰 네이티브 컨텍스트를 갖는다.

• 더 이상 미확인 상태가 아니다: 이 모델은 이제 독립적으로 두 차례 평가되었다. Alibaba의 표는 여전히 벤더 자체의 것이고 여전히 재현되지 않았지만, 이제 방 안의 유일한 증거는 아니다.

첫 독립 점수가 나왔습니다 — 그리고 그것은 "동등"이 아니라 "앞서 있다"고 말합니다

Artificial Analysis는 9월 7일 Intelligence Index v4.3을 출시했으며, 이 모든 것이 애초에 비교 가능한 이유는 바로 이 재점수화입니다. v4.3 업데이트는 Terminal-Bench v2.1을 훨씬 더 어려운 Terminal-Bench v4.0으로 대체하고, τ³-Banking을 AutomationBench-AA로 교체했는데, AutomationBench-AA는 Zapier와 함께 657개 작업의 비공개 홀드아웃 테스트 세트로 구축된 에이전트 워크플로 벤치마크입니다. 비공개 홀드아웃 가중치는 45%로 상승했습니다. 명시된 목적은 프론티어가 지수를 게임하는 것을 막는 것이었고, 점수에 미친 영향은 컸습니다. 두 선두 주자인 GPT-6 Astra와 Claude Fable 5.1은 둘 다 기존 척도에서 60점대 점수를 받았음에도 53점을 기록했습니다.

이는 커뮤니티 수치를 읽을 때 중요한 점입니다. 9월 초에 Qwen3.8-Flash-Next와 DeepSeek V4 Flash 0731에 대해 돌았던 "56 대 52" 수치는 v4.3 이전 인덱스에서 계산된 것이었습니다. v4.3 기준으로는 이 쌍이 40과 35에 있습니다. 어느 한쪽 수치를 다른 쪽과 견주어 인용하는 것은 서로 다른 두 시험을 비교하는 셈입니다.

현재 인덱스에서, Artificial Analysis 자체 평가를 기준으로 두 모델이 실제로 어떻게 비교되는지는 다음과 같습니다:

• 인텔리전스 지수 — Qwen3.8-Flash-Next 40 (동급 113개 중 5위) vs DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 35 (113개 중 9위).

• 에이전트형 지식 노동 — AA-Briefcase 1587 vs 1259; GDPval-AA v2 1647 vs 1468; AutomationBench-AA 56% vs 54%.

• 터미널 및 코딩 — Terminal-Bench v4.0 25% 대 12%; SciCode 51% 대 50%.

• 일반 및 과학적 추론 — Humanity's Last Exam 38% 대 39%; CritPt 11% 대 17%; GDP.pdf 16% 대 11%; AA-LCR v1.1 80% 대 80%.

• 사실 회상 대 허구 생성 — AA-Omniscience −10 대 −14, Qwen 프리뷰가 4점 앞섬.

• 가격 — 백만 입력당 $0.15 / 백만 출력당 $0.47 vs $0.44 / $1.32; 백만 토큰당 혼합 $0.0882 vs $0.2298. Intelligence Index 작업당 비용: $0.37 vs $0.22.

• 속도 및 지연 시간 — 초당 출력 토큰 53개 vs 210개; 첫 토큰까지 걸리는 시간 2.80초 vs 0.98초; 종단 간 응답 49.76초 vs 12.88초; 작업당 소요 시간 1,572.60초 vs 221.65초.

• 토큰 사용량 — 작업당 출력 토큰 108k 대 62k, 그중 추론 토큰은 72k 대 45k입니다. Artificial Analysis는 이 프리뷰를 "매우 장황함" 그리고 "평균보다 느림"이라고 평가합니다.

• 컨텍스트 및 크기 — 256k 토큰 vs 1,000k; 총 180B / 활성 6B vs 284B / 13B.

함께 놓고 보면, 이는 "동일 계층"이라는 답보다 더 예리한 답이다. Qwen3.8-Flash-Next는 Artificial Analysis가 측정하는 거의 모든 축에서 정확도와 효율성 논쟁을 이긴다 — 점수가 더 높은 모델이고, 더 작으며, 토큰당 비용이 약 3분의 1에 불과하다. DeepSeek V4 Flash 0731은 생산성 논쟁에서 완전히 승리한다: 처리량이 네 배, 종단 간 지연 시간이 4분의 1, 완료된 작업당 실제 소요 시간이 7분의 1, 그리고 컨텍스트 윈도가 네 배다. 그리고 완료된 작업당비용 — 토큰이 아무리 장황해도 살아남는 수치 — 에서 DeepSeek은 더 높은 정가에도 불구하고 $0.22 대 $0.37로 더 저렴한 모델이다. "과소평가됐다"가 "매개변수당 품질 면에서 평판보다 낫다"는 뜻이라면, 그 꼬리표는 타당하다. "이걸 대신 실행해야 한다"는 뜻이라면, 속도와 지연 시간 항목은 다른 말을 한다.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis 외부에도 독립적인 증거가 있습니다. 제3자 하네스인 smf-bench는 9월 5일에 "Official A" 실행을 공개했습니다: NVIDIA의 NVFP4 양자화로 단일 DGX Spark에서 thinking off 상태로 실행한 Qwen3.8-Flash-Next가 157개 중 137개(87.3%)를 기록했고, 코딩 섹션에서는 30개 중 30개를 완벽하게 통과했습니다. 반면 같은 157개 테스트 하네스에서 두 대의 Spark로 실행한 DeepSeek V4 Flash Vision-Exp는 157개 중 117개를 기록했습니다. 이는 하나의 하네스, 하나의 머신 클래스에 불과하며 광범위한 평가를 대체할 수는 없습니다. 하지만 같은 방향을 가리키는 두 번째 데이터 포인트이며, 어느 벤더에도 이해관계가 없는 사람에게서 나온 것입니다.

Qwen4 아키텍처가 실제로 무엇인지

이 이야기를 떠받치는 두 가지 메커니즘이 있다. 첫 번째는 GDN — Gated Delta Network — 으로, Aliba​ba의 선형 어텐션 레이어다. 표준 트랜스포머가 시퀀스 길이에 따라 커지는 키-값 캐시를 유지하는 반면, GDN 레이어는 고정 크기의 순환 상태를 유지하고 학습된 게이팅 규칙으로 이를 업데이트한다. 그 계보는 DeltaNet과 Mamba-2로 이어진다. 그 이득은 Qwen3-Next 이후 Qw​en 라인을 조용히 떠받쳐 온 바로 그것이다: 상태가 커지지 않기 때문에 긴 컨텍스트는 저렴하게 유지되는 한편, 선형 어텐션이 잘 못하는 정밀 검색을 수행하기 위해 소수의 전체 어텐션 레이어가 조합에 남아 있다. 현재 세대에서 그 조합은 전체 어텐션 레이어 하나당 대략 GDN 레이어 세 개로 구성된다 — Qwen3.8-2.4T-A95B 체크포인트에 대한 커뮤니티 분석은 23개의 어텐션 레이어 대비 69개의 GDN 레이어를 집계한다. Qwen3.8-Flash-Next도 동일한 3대 1 분할을 보여준다: 12개의 전체 어텐션 레이어 대비 36개의 선형 어텐션 레이어.

두 번째인 QSA — Qwen Sparse Attention —는 진정으로 새로운 부분이며, 이에 대한 공개 설명은 아직 빈약합니다: 모델 카드는 그것이 512블록/2048토큰 예산으로 마이크로 블록 수준에서 작동한다고 덧붙이지만, 아직 완전한 기술 문서는 존재하지 않습니다. 이러한 세부 정보의 부족 자체가 이 패턴의 일부입니다. 2025년 말 Qwen3-Next의 프리뷰는 똑같이 빈약한 문서와 함께 Gated DeltaNet을 소개했고, 그 아키텍처는 Qwen3.5 시리즈가 이를 채택한 뒤에야 완전히 명세되었습니다. 독자 입장에서 실질적인 시사점은 두 경우 모두 같습니다: 아키텍처 카나리아가 먼저 나타나고, 문서와 프로덕션 모델은 그 뒤에 나타납니다.

이미 한 번 성공했던 플레이북

Aliba​ba는 이미 이와 똑같은 전략을 써봤고, 그것은 통했다. 2025년 말, Qwen3-Next는 Gated DeltaNet과 선형 및 전체 어텐션의 하이브리드를 미리 선보였다. Qwe​n3.5 시리즈가 출시됐을 때, 그것은 그 청사진을 대규모로 채택했으며, 그 하이브리드는 이후 2.4T 플래그십을 포함해 Qwen3.8 세대까지 이어져 왔다. 이 선례가 여기서 중요한 이유는 그것이 시사하는 타이밍 때문이다. 전체 Qwen4 패밀리는 이 프리뷰의 안이 아니라 그 이후에 있을 것으로 예상해야 한다; Qwen3-Next의 간격이 어떤 지침이 된다면, “여기에 아키텍처가 있다”와 “여기에 패밀리가 있다” 사이의 거리는 몇 달 단위로 측정된다. 모델 카드의 어떤 내용도 그것을 확인해 주지 않는다 — 그것은 Aliba​ba가 이제 두 번 실행한 패턴에서 나온 추론이다.

우리가 아직 모르는 것

미지수는 줄어들었지만, 사라지지는 않았습니다:

• 벤더 벤치마크 표는 여전히 벤더의 것입니다. 이제 Artificial Analysis가 이 모델을 독립적으로 평가했고, 이는 출시 보도에서 가장 큰 공백을 메웠습니다 — 하지만 이 모델이 비교 가능한 9개 벤치마크 중 8개에서 Claude Opus 4.6 Max를 능가한다는 Alibaba의 대표 주장은 Alibaba 자체 내부 평가(CoWorkBench, JobBench, AndroidWorld)와 공개 평가에 함께 근거하고 있으며, 그중 어느 것도 제3자에 의해 재현되지 않았습니다.

• 미리보기가 서빙되는 모델과 동일한 모델인지 여부. 이 카드는 Qwen3.8-Flash-Next를 오픈 웨이트 실험적 미리보기로 포지셔닝하는 반면, 프로덕션 서빙 변형인 Qwen Cloud의 Qwen3.8-Flash는 기본 1,000,000토큰 컨텍스트와 내장 도구를 추가한다. 그 서빙 모델이 더 큰 컨텍스트 윈도우 아래에서 동일한 아키텍처인지는 아직 명시되지 않았으며, 위의 독립 점수는 서빙되는 API 모델이 아니라 오픈 웨이트 미리보기에 대한 것이다.

• 이 라이선스는 알려져 있고 실제 라이선스입니다: Qw​en Community License 1.0은 상업적 사용, 즉 파생 저작물 판매를 허용하지만, Model-as-a-Service 또는 AI 업무 보조 사업을 정의된 매출 및 월간 활성 사용자 임계값 이상으로 운영하는 경우 Aliba​ba와 별도의 상업 계약을 요구합니다. 이는 매출 기준이 적용되는 Qwen3.8-Max 라이선스와 동일하지 않지만, 가중치 위에 구축하기 전에 읽어볼 가치가 있습니다.

• 주목할 만한 현장 보고가 하나 있습니다: 커뮤니티 NVFP4 빌드에 관한 9월 6일 작성 글은 사고와 다중 토큰 예측이 모두 활성화된 상태에서 문법 제약 도구 호출 실패를 기록하며, 이는 xgrammar 제약 디코딩 경로에서 비롯된 것으로 추적됩니다. 이는 모델의 속성이라기보다 양자화된 커뮤니티 빌드의 런타임 버그입니다. 하지만 평가 하네스가 문법 제약 도구 호출에 의존한다면, 이것이 가장 먼저 테스트해야 할 항목입니다.

2주 주기로 일하는 가족

주변의 릴리스 속도 자체가 하나의 이야기다. 2.4조 매개변수 플래그십 Qwen3.8-Max가 8월 3일에 출시됐고, 오픈 웨이트 Qwen3.8-2.4T-A95B가 8월 12–13일에 뒤를 이었으며, 무료 Apache-2.0 Qwen3.8-27B가 며칠 뒤에 등장했다. 그리고 이제 이달이 끝나기 전에 차세대 아키텍처가 예고되고 있으며 — 일주일 뒤에는 독립적으로 벤치마크된다. 현재 다른 어떤 연구소도 이 주기로 반복 개발하고 있지 않다. 모델을 고르는 독자에게 실질적인 결과는 "최고의 Qwen"이 움직이는 표적이라는 점이다 — 그리고 세대 간 차이는 주변 생태계가 보통 적응하는 것보다 더 빠르게 다가오고 있다. 모델을 사기보다 결정을 사는 쪽이 점점 더 방어 가능한 선택이 되고 있다.

개발자가 지금 해야 할 일

효율 수치들은 출시 자체보다 로컬 서빙 셈법을 더 많이 바꾼다. 현재 지수에서 40점을 기록하는 6B 활성 모델은 압축 가능하다: NVIDIA의 공식 NVFP4 양자화는 9월 5일 smf-bench 실행이 사용한 바로 그것이며, 그 외의 커뮤니티 NVFP4 및 FP8 빌드들도 이미 유통되고 있는데, 이것이 바로 180B로 저장된 모델의 단일 GPU급 배포를 애초에 그럴듯하게 만드는 이유다. 주의사항은 그대로다 — 이것은 입증되지 않은 프리뷰이고, 벤더 표는 재현되지 않았으며, 독립 점수의 형태(지식 노동과 터미널 작업에는 강하지만 장기 저장소 생성과 원샷 에이전트 통과율에는 약함)는 모델의 약점이 정확히 프로덕션 코드 변경이 일어나는 곳에서 드러난다는 뜻이다. 중요한 무엇이든 건드리기 전에 실제 워크로드의 위험 부담이 낮은 복사본을 그것을 대상으로 실행하고, 프리뷰가 오작동하는 순간은 자동 페일오버가 흡수하게 하라.

가격 면에서, 출시 당시 불분명했던 그림은 이제 구체화되었다. Artificial Analysis는 해당 프리뷰의 제공 단가를 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.47로 기재하고 있는데, 이는 DeepSeek V4 Flash 0731의 $0.44와 $1.32와 대비된다 — 제공 중인 Qwen3.8-Flash 변형과 같은 자릿수이며, Qwen Cloud는 이를 ¥1과 ¥3(대략 $0.16과 $0.47)으로 표시한다. 오늘 실제로 호출할 수 있는 것은 프로덕션 변형이다: 이는 여기서 qwen/qwen3.8-flash(으)로 라우팅되며, OrcaRouter는 벤더의 정가를 0% 마진으로 그대로 전달하므로, Alibaba가 그 숫자를 바꾸면 엔드포인트도 같은 날 함께 바뀐다. 이 글의 비교 모델도 마찬가지다 — DeepSeek V4 Flash 0731은 deepseek/deepseek-v4-flash-0731로 제공자의 정가로 라우팅되며, 이로써 위 대결의 토큰당 비용 부분은 벤치마크의 토큰 수가 아니라 여러분 자신의 트래픽에 대해 검증할 수 있게 된다. 여기서 라우팅되지 않는 것은 오픈 웨이트 Flash-Next 프리뷰 자체다: 오늘 그것을 사용하려면 가중치를 직접 내려받아 직접 서빙해야 하며, 바로 그렇기 때문에 위의 양자화 이야기가 정가보다 더 중요한 것이다. 이 세대가 넘어야 할 상한은 같은 엔드포인트에서 여전히 보인다: Qwen3.8-Max(qwen/qwen3.8-max)는 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00에 위치하며, 이 역시 벤더의 정가로 그대로 전달된다.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

실제 도입 순서는 크게 달라지지 않았지만, 그 뒤에 있는 확신은 달라졌다. 100GB의 가중치를 당겨오지 않고도 서빙되는 프로덕션 변형을 원한다면, Qwen3.8-Flash는 이미 정가로 호출할 수 있다. 아키텍처 — GDN, QSA, n-gram 테이블, 오프로드 트릭 — 를 원한다면, 가중치는 다운로드할 수 있고 런타임도 준비되어 있다: vLLM은 51B 파라미터 n-gram 임베딩 테이블을 영구 VRAM이 아니라 호스트 메모리에 유지하는 오프로드 경로와 함께 첫날부터 이를 서빙하며, SGLang과 TensorRT-LLM은 NVIDIA의 Day 0 목록에 있고, Ollama 라이브러리에는 Apple Silicon에서 가져올 수 있는 MLX 빌드가 있다. 그만둬야 할 한 가지는 이 모델을 품질 측면에서 미지수로 취급하는 것이다. 이제는 측정되었고, 좋은 결과를 보였다.

다음에 볼 콘텐츠

• 지수가 성숙해짐에 따라 독립적인 수치들이 유지되는지 여부. Qwen3.8-Flash-Next의 40점은 이례적으로 높은 토큰 청구서를 동반한다 — 지수 실행에서 245M 토큰을 태웠으며, 이는 중앙값 140M에 맞선 수치다 — 그리고 Artificial Analysis 자체의 노트는 이를 "매우 장황하다(very verbose)"고 평한다. 더 오래 추론해서 나온 점수도 여전히 점수이긴 하지만, 그것은 평가가 바뀌면 함께 움직이는 종류의 것이다. 다음 지수 개정판이야말로 40이 하나의 수준이었는지, 아니면 국지적 최대값이었는지를 가르는 진짜 시험대다.

• 서빙되는 Qwen3.8-Flash가 별도로 점수를 매겨지는지 여부. 이 글의 모든 독립적인 수치는 오픈 웨이트 프리뷰에 대한 것이다. 1M 컨텍스트와 내장 도구를 갖춘 프로덕션 변형은 자체적인 독립 점수가 없으며, 더 긴 컨텍스트 아래에서 동일한 아키텍처라면, 그것은 누군가 공개해야 할 저비용 평가다.

• day-0 서빙 지원이 실제로 얼마나 잘 버티는지 — 벤더가 밝힌 GB300 처리량 수치는 여전히 벤더 주장에 불과하고, TP4 전문가 병렬 및 KV 오프로드 구성은 아직 취약할 만큼 새롭습니다.

• Alibaba가 전체 Qwen4 패밀리가 프리뷰를 따라오기까지 얼마나 기다리는지.

이 이야기에서 지금까지 우리가 아는 부분은 이제 상당 부분 종결되었다. 스펙 시트는 공개되었고, 가중치는 다운로드할 수 있으며, 아키텍처는 확인되었고, 서빙되는 Qwen3.8-Flash 변형은 정가로 호스팅 API에서 라이브 상태이며, 이 모델은 두 개의 별도 주체에 의해 독립적으로 평가되었다 — 더 작은 모델은 품질 논쟁에서 이겼고, 더 큰 모델은 처리량 논쟁에서 이겼다. 남아 있는 것은 6B-active 프리뷰가 자신이 튜닝된 벤치마크를 넘어 일반화되는지, 그리고 전체 Qwen4 패밀리가 뒤따르기까지 Alibaba가 얼마나 오래 기다릴지다. 그 마지막 질문은 여전히 이번 릴리스가 답을 내놓지 않은 질문이며, 여전히 가장 중요할 질문이다.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트