Qwen3.8-Flash-Next vs Qwen3.8-27B — 오픈 가중치의 주력 모델과 견주는 Qwen4-preview MoE. 재생성된 일러스트레이션.
Guides & Insights

Qwen3.8-Flash-Next vs Qwen3.8-27B: 오픈 웨이트 워크호스에 맞서는 Qwen4-preview MoE

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Qwen3.8-Flash-Next에 대해 놀라운 점은 Alibaba가 토큰당 60억 개의 파라미터만 활성화하는 모델이 대부분의 오픈 모델을 능가한다고 주장하는 것이 아니라, 그 모델을 서빙하는 데 필요한 메모리가 비교 대상인 270억 파라미터의 덴스 모델보다 더 많다는 점입니다. Qwen3.8-Flash-Next는 2026년 8월 26일 Qwen4 아키텍처 프리뷰로 오픈소스 공개되었으며, 510억 파라미터의 N-gram 룩업 테이블을 VRAM 대신 시스템 RAM에 저장합니다. 8월 중순에 출시된 Apache-2.0 멀티모달 덴스 모델이자 현재 Qw​en 3.8 세대의 오픈 가중치 주력 모델인 Qw​en3.8-27B는 4비트로 단일 24GB 그래픽 카드에 맞습니다. Alibaba 자체 벤치마크 시트에서 새로운 MoE는 비교된 22개 벤치마크 중 21개에서 27B를 능가합니다. 독립적인 증거(아레나 순위, 법률 에이전트 연구, 타사 처리량 측정) 측면에서는 두 모델 중 27B만이 해당 증거를 가지고 있습니다. 이 조합이 결정의 전부입니다.

한 줄 요약: 같은 세대의 오픈 웨이트 텍스트+비전 모델 두 개, 동일한 262K 네이티브 컨텍스트, 둘 다 데이터센터 밖에서 실행되도록 설계됨 — 그리고 아키텍처, 라이선스, 가격, 그리고 그들의 이야기가 검증된 정도에 따라 갈린다. Qwen3.8-Flash-Next는 Qwen4가 물려받을 것으로 예상되는 모든 것을 미리 보여주는 스파스 MoE다. Qwen3.8-27B는 알리바바가 2.4T 플래그십을 구축하며 배운 것을 단일 GPU로 실행할 수 있는 무언가로 압축한 덴스 모델이다. 둘 사이의 선택은 능력에 관한 문제라기보다 — 알리바바는 프리뷰가 앞선다고 말한다 — 커뮤니티가 이미 낱낱이 분석한 모델보다 하루 된 벤더 시트를 신뢰할지에 관한 문제다.

점수판

먼저 출처부터 짚자면: 아래의 모든 Qwen3.8-Flash-Next 수치는 알리바바 자체 수치로, 하루 전에 나온 것이며 독립적으로 재현된 바 없습니다. Qw​en3.8-27B의 주요 벤치마크 주장 역시 알리바바가 보고한 것이지만, 27B는 프리뷰가 따라올 수 없는 독립적 결과들—인간 선호도 아레나 순위, 법률 도메인 연구, AMD 처리량 측정—을 갖추고 있습니다.

• 총 파라미터 — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (약 180B 저장), 6B 활성. Qw​en3.8-27B: 약 27B 덴스(비전 인코더 포함 28B), 모두 활성.

• 아키텍처 — Qwen3.8-Flash-Next: Qwen4 프리뷰 — Qwen Sparse Attention과 Gated DeltaNet을 교대로 사용, 게이티드 잔차 연결, N-gram 임베딩, Muon 학습 방식. Qwen3.8-27B: GDN 선형 어텐션 레이어 48개와 전체 어텐션 레이어 16개(3:1), 밀집(dense) 구조.

• 컨텍스트 — 기본 262,144개 토큰, YaRN을 통해 1M까지 확장 가능.

• 모달리티 — 둘 다 텍스트, 이미지, 비디오 입력을 받아들이고 텍스트를 반환합니다.

• 라이선스 — Qwen3.8-Flash-Next: qwen-community-1.0. Qw​en3.8-27B: Apache 2.0.

• 가격 — Qwen3.8-Flash-Next: 1M당 $0.16 / $0.47 (발표됨; 프로덕션 API는 아직 공개되지 않음). Qw​en3.8-27B: 1M당 $0.33 / $2.40, 오늘부터 사용 가능.

• 실행 공간 — Qwen3.8-Flash-Next: 호스트 RAM의 51B 테이블, 시스템 메모리 약 96GB + GPU 메모리 별도; FP8 약 186GB, Q4 GGUF 약 82GB. Qwen3.8-27B: BF16 약 55.6GB, 4비트는 24GB 카드에 맞습니다.

• 독립적 증거 — Qwen3.8-Flash-Next: 아직 없음. Qw​en3.8-27B: Arena.ai Image-to-WebDev에서 오픈 모델 1위, Code Arena WebDev에서 전체 9위, Harvey's Legal Agent 벤치마크에서 오픈 웨이트 1위, AMD가 측정한 처리량.

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

알리바바 자체 수치에 따르면, 프리뷰가 거의 모든 면에서 우세하다.

Alibaba가 공개한 비교에서 Qwen3.8-Flash-Next는 언어 및 비전 벤치마크 22개 중 21개에서 Qw​en3.8-27B와 동일하거나 더 나은 점수를 기록했으며, 이는 표면적인 우위가 아니다. SWE-bench Pro 62.5 대 61.7은 근소한 우위지만, DeepSWE 58.7 대 42.2, JobBench 55.7 대 33.4, CoWorkBench 73.9 대 70.7은 플래시 계층이 겨냥한 에이전트 및 오피스 워크로드에서 실질적인 격차다. 프리뷰의 주요 수치인 LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7은 Alibaba의 표에서 27B의 해당 행도 뛰어넘는다. 이번 릴리스의 핵심 주장을 데이터로 요약하면, 더 큰 Qw​en 3.8 라인의 추론 및 코딩 역량 대부분을 훨씬 적은 활성 컴퓨팅으로 제공한다는 것이다.

그 문장에 라벨을 붙인 상태를 유지하세요. 이것들은 알리바바 자체 평가로, 알리바바 자체 하네스에서 나온 것입니다. 프리뷰의 경우 하루 전의 것이고, 둘 다 재현되지 않았습니다. 이 매치업에 대해 순위를 매기는 KGP Talkie 아키텍처 분해에서도 같은 형태의 결론에 도달하지만, 동일한 공급업체 시트를 기반으로 작업한 것입니다. 공급업체 테이블은 약속일 뿐입니다. 이 단락의 어떤 내용도 독립적으로 확인되지 않았습니다.

27B가 Flash-Next에는 없는 것: 증거

여기서부터는 대결이 더 이상 한쪽으로 치우치지 않습니다. Qw​en3.8-27B는 공개된 지 2주가 되었고, 커뮤니티는 세 가지 독립적인 데이터 포인트를 만들어냈습니다. Arena.ai의 Image-to-WebDev 리더보드에서 — 두 개의 익명화된 출력 중 무엇을 출시할지에 대한 블라인드 인간 투표 — 27B는 오픈 모델 중 1위, 전체 7위이며 보고된 점수는 1,574점입니다. 형제 격인 Code Arena WebDev 보드에서는 전체 9위(1,595점)로, 해당 크기 등급에서 톱 10에 든 유일한 모델입니다. 법률 AI 회사인 Harvey와 Engram은 합성 로펌 연구를 진행했는데, 적응된 27B를 자사의 법률 에이전트 벤치마크 1위에 올렸습니다. 단, 모델이 사전에 테스트 코퍼스를 학습했다는 조건이 붙으며, 이는 기본 가중치에 대한 점수라기보다 파인튜닝 여지의 시연에 해당합니다. AMD는 Day-0 처리량 측정 결과를 발표했습니다: Ryzen AI Max+ 395에서 초당 24.5토큰, Radeon AI PRO R9700에서 초당 51.8토큰입니다. 이 중 어느 것도 범용 품질 점수는 아닙니다. 27B에 대한 Artificial Analysis 지수는 아직 없지만, 각각은 실제로 모델을 실행한 제3자입니다.

Qwen3.8-Flash-Next에는 그런 것이 전혀 없습니다. 벤치마크 시트 전체가 알리바바의 것이며, 이 글을 쓰는 시점 기준으로 불과 몇 시간 전에 나온 것입니다. 독립 연구소는 단 한 줄도 재현하지 못했습니다. 이것은 비난이 아니라 갓 출시된 릴리스의 정의입니다. 그러나 선택을 좌우해야 할 것은 바로 그 비대칭성입니다: 프리뷰는 존재하는 유일한 숫자들에서 앞서 있고, 그 숫자들은 전부 당신이 믿기를 바라는 공급업체가 작성한 것입니다.

배포 포크

이 두 모델의 실질적인 차이는 파라미터가 어디에 존재하는지에 있으며, 이에 따라 필요한 하드웨어가 결정됩니다. Qwen3.8-Flash-Next는 51B N-gram 임베딩 테이블을 의도적으로 호스트 메모리로 오프로드하며, 여기서 비동기적으로 프리페치될 수 있습니다 — 이것이 토큰당 연산을 추가하지 않고도 51B 파라미터 용량을 추가하는 이유입니다. 그 결과, 이 모델은 이전에 로컬 Qw​en이 들어맞던 것처럼 24GB 소비자용 카드에는 들어맞지 않습니다. 커뮤니티 추정에 따르면 Q4 GGUF는 총 약 82GB(메인 가중치 약 58GB + 룩업 테이블 24GB), FP8 빌드는 약 186GB, BF16은 약 360GB입니다. 실제로 작동하는 구성은 시스템 RAM 약 96GB에 활성 6B를 실행하는 GPU를 갖춘 머신입니다. 이에 따른 이점은 토큰당 연산 비용이 저렴하다는 것 — 이 아키텍처의 전부를 건 선택 — 이며, GDN 레이어가 KV 캐시를 늘리는 대신 히스토리를 압축하기 때문에 긴 1M-토큰 컨텍스트도 비용 부담이 적습니다.

Qwen3.8-27B는 반대 방향의 모델입니다. 밀집형(dense)이라 모든 토큰이 27B 파라미터 전부를 실행하지만, 전체가 이미 보유한 하드웨어에 들어맞을 만큼 작습니다. BF16 가중치는 약 55.6GB이며, 4비트에서는 RTX 3090 또는 4090 같은 24GB 카드에서 실행됩니다. AMD의 측정에 따르면 AI Max급 및 Radeon PRO 하드웨어에서 초당 24.5~51.8 토큰을 처리합니다. 제약이 단일 워크스테이션이라면 27B가 실제로 맞는 모델이고, 제약이 규모에서 토큰당 비용이라면 Flash-Next가 서류상 승리합니다.

가격 포크

API 가격도 다른 측면에서 같은 이야기를 들려줍니다. Qw​en3.8-27B는 오늘 OrcaRouter에서 백만 입력 토큰당 $0.33, 백만 출력 토큰당 $2.40로 제공되며, 공급업체 목록 가격이 마크업 없이 그대로 전달됩니다. 자체 호스팅 옵션도 호출 가능하게 되어 GPU를 구매할 필요가 없습니다. Qwen3.8-Flash-Next는 아직 어디에도 라우팅되지 않습니다. 프로덕션 Qwen3.8-Flash가 QwenCloud API에서 발표된 $0.16/$0.47 가격으로 개통될 때까지 오픈 가중치가 유일한 경로입니다. 해당 API가 개통되면 동일한 패스스루 방식으로 $0.16/$0.47 가격이 같은 날 우리 쪽에도 적용되며, 27B와 동일한 키로 두 모델 간 자동 페일오버가 이루어집니다. 따라서 하루 된 아키텍처를 도입하는 방법은 프로덕션을 그것에 거는 것이 아니라, 검증된 모델을 폴백으로 삼아 트래픽의 일부만 그쪽으로 돌리는 것입니다. 라우팅 계층은 직접 서빙하는 모델의 앞단에도 배치할 수 있으며, 이것이 별도의 통합 없이 오늘 당장 Flash-Next의 오픈 가중치를 평가할 수 있는 실용적인 경로입니다.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

어느 것을 실행할까요

지금 Qwen4 방향을 타고 싶다면, 워크로드가 충분히 대규모여서 $0.16/$0.47 대 $0.33/$2.40이 실질적인 숫자라면, 또는 자체 호스팅할 RAM이 있고 벤더 시트에 올라가는 것이 편하다면 Qwen3.8-Flash-Next를 선택하세요. Apache-2.0 조건, 단일 24GB 카드, 지금 바로 호출할 수 있는 모델, 또는 어느 정도의 독립적 증거가 필요하다면 Qw​en3.8-27B를 선택하세요 — 이는 두 모델 중 알리바바 외부에서 실행된 적이 있는 유일한 모델입니다.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

위의 두 캡처는 각 절반의 공개 표면입니다: Qw​en3.8-27B를 현재 $0.33/$2.40에 호출할 수 있는 OrcaRouter 목록과 Hugging Face의 Qwen/Qwen3.8-Flash-Next 모델 카드입니다.

그리고 정직한 마무리는 질문입니다. 증거 기반이 고작 하루밖에 되지 않았기 때문입니다. 60억 개의 파라미터를 활성화하는 모델이 독립적 재현 검증에서 22개 중 21개를 휩쓰는 성과를 유지할 수 있을까요? 아니면 그 모델을 날렵하게 서빙하게 만드는 N-gram 테이블이 실제 워크로드에서는 실패하게 만드는 요인이기도 할까요? 27B는 이미 2주간의 커뮤니티 검증을 견뎌냈습니다. Flash-Next는 27B가 2주 전에 있던 자리에 있습니다. 이것이 둘 중 하나를 고르기보다 나란히 실행해야 하는 가장 좋은 근거입니다.