
Qwen4-Exp QSA가 화웨이의 Ascend에 도입되다: SGLang의 옵트인 CANN 프리필 PR 속을 들여다보기
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 348 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 105 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 987 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
2026-09-30에 한 기여자가 SGLang 풀 리퀘스트 #41855를 열었습니다. 제목은 “[NPU] Qwen4-Exp QSA 프리필을 위한 옵트인 CANN 희소 어텐션 추가”이며, 흥미로운 부분은 연산이 아닙니다. 바로 하드웨어입니다. 이제 Qwen4Exp 아키텍처에는 화웨이의 Ascend 910C 가속기를 위한 손으로 작성된 희소 어텐션 경로가 있습니다. 이는 기본값이 꺼짐인 플래그 뒤에, 아직 병합되지 않은 초안 풀 리퀘스트 안에 들어 있습니다. — 반면 그 아키텍처 이름이 속한 모델인 Qwen4-Exp는 어떤 형태로도 공개된 적이 없습니다. 이 아키텍처를 오픈 가중치로 담고 있는 유일한 체크포인트는 여전히 Qwen3.8-Flash-Next입니다. 이는 해당 벤더가 2026-08-24에 Hugging Face에서 공개한 1,250억 매개변수 규모의 전문가 혼합(MoE) 프리뷰이며, 그 모델 카드가 실제로 자신의 아키텍처를 qwen4_exp로 선언하고 있습니다. Qwen 4 자체는 — 벤더가 2026-09-22에 자사의 Apsara 컨퍼런스에서 이름을 밝힌 Max, Flash, Plus 및 27B 티어 — 여전히 가중치도, 식별자도, 가격도, 날짜도 없습니다. 그래서 이 글은 출시가 아니라 하나의 엔지니어링 산출물에 대해 지금까지 알려진 바를 정리한 글입니다: 또 하나의 벤더 서빙 스택이 아직 공개되지 않은 아키텍처를 일찍 지원할 가치가 있다고 조용히 결정한 것입니다.
풀 리퀘스트가 실제로 추가하는 것
이 변경은 의도적으로 작고 의도적으로 좁다. 파일 다섯 개, 커밋 하나, +355줄이며, 메인 브랜치는 커밋 b87a241이고, SGLang npu 라벨을 달고 있다. 작성자 w1ida는 의도를 처음부터 밝힌다: Qwen4-Exp QSA eager prefill을 위한 옵트인 CANN main-attention 경로로, 다음을 기반으로 구축되었다: torch_npu.npu_sparse_flash_attention — 이때 인덱서, Top-K 선택, 토큰 예산, KV 캐시 내용은 모두 그대로 유지된다.
여기에 도달하기 위해 사용하는 트릭은 한 문단을 할애할 가치가 있습니다. 왜냐하면 이것이 새로운 어텐션 커널이 아니라 레이아웃 어댑터인 이유를 설명해 주기 때문입니다. 이미 회전된 Q와 K에 대해, 이 경로는 캐시를 C = [K, V]로 패킹하고 쿼리를 Q' = [Q, 0]로 패킹합니다. 그러면 Q' @ C.T는 Q @ K.T와 같아지고, 패딩된 쿼리는 아무것도 기여하지 않으므로 softmax(scale * Q' @ C.T) @ C는 [P @ K, P @ V]를 쌓은 형태로 반환합니다. 따라서 V 절반을 잘라낼 수 있습니다. 저자 자신의 표현을 빌리자면, 이것은 “모델의 어텐션을 바꾸거나 저랭크 KV 압축을 하는 것이 아니라, 어텐션 레이아웃 임베딩입니다.” 각 KV 헤드는 네이티브 MLA 레이아웃에서 독립적인 배치가 되고, 원래의 D256 스케일은 유지되며, 보조 RoPE는 0으로 설정됩니다.
운영상의 세부 사항은 수학만큼 중요합니다:
• 활성화 — SGLANG_NPU_QSA_NATIVE_PREFILL=1, 기본값 off. 일반 ForwardMode.EXTEND만 옵트인합니다. decode, speculative 모드, mixed forward 및 graph capture는 모두 기존 경로를 유지하며, graph capture는 어댑터를 완전히 우회합니다.
• 하드웨어 및 dtype — 헤드 차원 256의 BF16, Ascend 910C (Ascend910_93*), CANN 9.0 및 torch-npu 2.10에 대해 테스트되었습니다. 지원되지 않는 dtype 또는 shape는 참조 경로로 조용히 폴백됩니다.
• 헤드 형태 — 지원되는 로컬 (Q 헤드, KV 헤드) 쌍은 (16,2), (24,2), (12,1), (6,1) 및 (3,1). CANN은 쿼리/KV 비율 12를 아예 거부합니다 — 해당 타일러는 2의 거듭제곱만 받아들이기 때문입니다 — 그래서 헤드는 12→16, 6→8 또는 3→4로 패딩되고 추가된 출력은 버려집니다. 이것은 하드웨어가 희소 어텐션 헤드 비율을 염두에 두고 설계되지 않았다는 것을 보여주는 이 PR 전체에서 가장 명확한 신호이며, 모델이 그에 맞춰 형태를 바꾸는 것이 아니라 어댑터가 그 불일치를 흡수하고 있음을 보여줍니다.
• 크기 한계 — 참조된 물리적 캐시 범위만 패킹되며, 262,144 토큰으로 제한됩니다. 작성자는 이를 KV 헤드 2개에서 패킹된 BF16 K/V 텐서에 대해 최대 512 MiB로 계산합니다. 내부 -1 패딩은 감지되어 폴백으로 라우팅됩니다. CANN은 연속적인 유효 슬롯을 요구하기 때문입니다. 완전히 마스킹된 행은 기존의 제로 출력 규칙을 유지합니다.
• prefill만 지원하는 이유 — extent 및 레이아웃 검사는 두 스칼라를 호스트로 복사하며, 임시 복사본과 네이티브 워크스페이스가 메모리 비용을 발생시킵니다. 이러한 동기화 때문에 이 경로는 eager prefill로 제한되고 캡처 중에는 비활성 상태로 유지됩니다.
![A capture of the SGLang GitHub pull request #41855, titled '[NPU] Add opt-in CANN sparse attention for Qwen4-Exp QSA prefill', showing an Open state with no merged marker, the line 'w1ida wants to merge 1 commit into main from npu/qsa-cann-prefill', the npu label, and the start of the Motivation section describing the Q' = [Q, 0] and C = [K, V] packing and stating that the approach avoids modifying the indexer, Top-K selection, or KV-cache layout.](https://cms.orcarouter.ai/api/media/file/2-1459.png)
통과한 테스트 아홉 개, 그리고 이 브랜치에서 나오지 않은 속도 수치
정확성 증거는 구체적이고 재현 가능하며, 이는 대부분의 커널 PR이 제공하는 것보다 더 많은 것입니다. 저자는 CANN 9.0 및 torch-npu 2.10.0을 사용하는 Ascend 910C(Ascend910_9362)에서 40.772초 만에 9개의 테스트가 통과했다고 보고하며, 체크포인트가 필요하지 않습니다: 동일한 BF16 입력으로 계산된 FP32 CPU 참조값에 대한 0이 아닌 랜덤 BF16 Q/K/V, 너비 1/63/64/65/2051에서의 순서 없는 물리적 슬롯, 기본 및 명시적 스케일, 완전히 마스킹된 행, 0인 행, 선택 너비 0, 비연속 텐서, 0부터 3까지의 압축 비율 4 causal 꼬리 나머지, 공유 프리픽스가 있는 두 요청 물리적 매핑, 캐시 내용 재사용, 그리고 1개 및 257개 쿼리 행에서의 Flash-Next 로컬 헤드 형태.
대표 사례는 긴 프리필(long prefill)입니다: 7,810개의 쿼리 토큰이 65,536토큰 캐시에 대해, 쿼리당 2,051개의 선택된 슬롯을 사용하며, 모든 출력이 유한하고, 8개의 샘플링된 행을 FP32 참조와 비교했습니다. 관측된 상대 L2 오류는 작은 헤드 형상 사례에서 0.209%, 샘플링된 긴 프리필 행에서 0.231%에 도달했으며, 테스트 게이트인 atol=0.025, rtol=0.025 및 상대 L2 0.008 미만, 빈 행은 정확히 0이어야 합니다. 해당 실행의 최대 할당 NPU 메모리는 1,042.7 MiB로 제시되며, 저자는 이를 PyTorch 할당자 지표로 표시하고, 보드 HBM도 전체 모델 메모리도 아니라고 밝혔는데, 이는 바로 덧붙여야 할 올바른 주의사항입니다.
그런 다음 인용될 숫자가 있는데, 그렇게 되어서는 안 된다. PR 본문에는 기존 로컬 어텐션 경로가 초당 2,270.79개의 새 토큰이고 네이티브 패킹된 메인 어텐션이 3,890.06개임을 보여주는 속도 표가 있다 — 1.713배 / +71.3% 향상이며, 첫 토큰까지의 평균 시간은 3.109초에서 1.812초로 감소한다. 저자는 이것이 2026-09-29에 적응된 Whittle-Next-26B-A3B 체크포인트에서 수행된 역사적 프로토타입 측정값임을 명시하고 있으며, TP1에서 W8A8 가중치와 BF16 어텐션으로 910C에서 CANN 9.0 하에 실행되었고, 공식 sglang.bench_serving 하네스를 동시성 1로 사용하여 6개의 요청, 각각 하나의 출력 토큰, 그리고 36,096개의 캐시된 프리픽스 토큰은 새 토큰 처리량에서 제외되었다. 이것들은 아닌 PR의 업스트림 브랜치에 대한 벤치마크이며, 원본 서빙 JSON 아티팩트는 체크아웃에 존재하지 않고, 초당 약 5,000개의 토큰에 대한 이후 로컬 결과는 추가 네이티브 인덱서 및 block4 작업을 사용했으며 이는 이 변경에 명시적으로 귀속되지 않는다. 저자는 또한 적응된 체크포인트의 인덱서 가중치가 비활성이고 예산이 원본과 다르므로, 그 중 어느 것도 인덱서 정확성이나 전체 예산 생성 품질에 대한 증거가 아니라고 언급한다.
체크포인트를 검색하는 사람이라면 누구나 헷갈릴 테니, 명명에 관한 한 가지를 분명히 해두겠습니다: 벤치마크 모델은 기여자 본인이 적응시킨 아티팩트입니다. 별개로, “Whittle-Next”는 제3자 Hugging Face 계정이 공개한 Qwen3.8 파생 MoE 파인튜닝의 공개 시리즈 이름이기도 하며, 9월에 업로드된 26B-A3B 변형도 포함합니다. 이들은 이 PR이 대상으로 하는 Qwen4Exp 모델이 아니며, 그 1.713× 수치의 배경이 된 벤치마크 구성으로 해석되어서도 안 됩니다.
추가로 두 가지 주의 사항은 제가 아니라 저자가 제기한 것입니다. 완전한 서빙 통합, 분산 텐서 병렬 처리, 그리고 전체 Qwen3.8-Flash-Next 모델은 이 브랜치에서 검증되지 않았습니다. 기여자는 통합 및 종속성 문제가 논의되는 동안 초안으로 유지하는 것이 의도적이라고 말하며, 심지어 PR 본문에서 어댑터가 SGLang에 속하는지 아니면 별도의 sgl-kernel-npu 저장소에 속하는지 묻습니다. CI도 깨끗하지 않습니다 — PR 본문 상태 블록은 PR Test (Base), PR Test (Extra) 및 AMD ROCm 10 실행에서의 실패를 보여줍니다. 위에 설명된 정확성은 연산자 수준입니다. PR에는 통합 스택에서의 종단 간 정확도나 처리량 결과에 대한 주장이 없습니다.
QSA가 왜 어색한 부분인지, 숫자로 알아보기
Qwen Sparse Attention은 일반적인 어텐션 레이어가 아니며, 공개된 구성은 액셀러레이터 벤더가 왜 이를 위한 맞춤형 경로를 작성해야 하는지 보여줍니다. Qwen3.8-Flash-Next 구성에서: 48개 레이어는 세 개의 Gated DeltaNet 블록 뒤에 하나의 전체 어텐션 블록이 오는 패턴을 열두 번 반복한 형태로 배치되어 있으며, full_attention_interval 4, 히든 크기 2,560, 어텐션 헤드 차원 256, 24개의 쿼리 헤드 대 2개의 KV 헤드, RoPE 차원 64. 어텐션을 희소하게 만드는 인덱서는 4개의 쿼리 헤드가 1개의 키 헤드를 공유하는 멀티 쿼리 구조이며, 헤드 차원 128, 압축 비율 4, 쿼리당 2,048개의 선택된 마이크로 블록 예산을 가집니다.
그 예산은 PR이 고정하는 값이다. 희소 블록 크기는 1로 유지되고, 희소 모드는 0으로 유지되며, 어텐션 모드는 2로 유지되고, selected-token 인터페이스는 손대지 않는다. 네이티브 인덱서와 block4 최적화는 명시적으로 범위 밖이다. 따라서 이것은 기존 선택 메커니즘 아래에 끼워 넣은 어댑터이지, QSA의 재구현이 아니다. 이는 또한 저자가 KV-cache 내용이 변경되지 않았다고 설득력 있게 주장할 수 있는 이유이기도 하다.

모델 카드는 설계 의도를 명확히 설명한다. 개별 토큰을 선택하는 대신, QSA는 긴 컨텍스트 지연 시간을 줄이기 위해 마이크로 블록 수준에서 작동하며, 그 마이크로 블록 단위성과 그에 수반되는 복제된 선택기 상태야말로 두 벤더 어느 쪽의 실리콘에서도 일반적인 paged-attention 커널에 깔끔하게 매핑되지 않는 바로 그 부분이다.
Qwen4Exp 서빙 구축에서 이것이 차지하는 위치
혼자 보면, 한 액셀러레이터에 관한 초안 PR 하나는 호기심거리에 불과하다. 9월의 나머지와 나란히 놓고 보면, 그것은 그것이 섬길 가족이 존재하기도 전에 공개적으로 조립되고 있는 플랫폼의 네 번째 혹은 다섯 번째 판자다:
• 오픈 웨이트의 아키텍처 — Qwen3.8-Flash-Next, 2026-08-24, 6B가 활성화된 125B 파라미터 MoE, 510억 파라미터 n-gram 임베딩 테이블 및 4B MTP 헤드. 다음을 갖습니다: model_type: qwen4_exp 및 아키텍처 Qwen4ExpForConditionalGeneration.
• vLLM 측 — HyperConnection, QSA, PLE 커널을 추가하는 “qwen4 fuse op” PR인 #53909는 2026-08-26 이후 여전히 열려 있으며 병합되지 않았고; 동일한 QSA 경로에 디코드 컨텍스트 병렬성을 추가하는 #59279는 2026-09-29에 열린 초안이며; 9월에 걸쳐 반영된 PLE 오프로드 작업입니다.
• SGLang 측 — DFlash 은닉 상태 캡처를 위한 #38642, Ascend에서의 Qwen4-Exp PLE CPU 오프로드를 위한 #39548, 파일 기반 PLE 테이블을 위한 호스트 스테이징을 추가한 #40235, 그리고 이제 Ascend 어텐션 경로를 위한 #41855.
• NPU 활성화 라인 — sglang #37570은 그래프 리플레이, MTP 및 Triton 커널을 사용해 Qwen3.8-Flash-Next를 NPU의 SGLang에 추가하는 작업이며(2026-09-02에 열림, 아직 열려 있음, 20개 파일에 걸쳐 +2,590줄), 동반 Triton 커널을 위한 sgl-kernel-npu #807도 있습니다(2026-09-17에 열림, +4,643줄). 둘 다 같은 기여자가 제출했습니다. #41855는 그 더 큰 활성화 작업 안에 속하는 어텐션 레이어입니다.
독자가 실제로 활용할 수 있는 두 가지 관찰이 있다. 첫째, Ascend Qwen4Exp 관련 작업 전체가 극소수 기여자에게 의존하고 있다. 활성화 PR들과 커널 저장소는 작성자가 같고, 어텐션 어댑터는 또 다른 한 사람이 맡고 있다. 이러한 집중도는 Ascend Qwen4Exp 서빙이 실험이 아니라 지원되는 제품 경로가 되기까지 얼마나 멀리 있는지를 보여주는 합리적인 척도다. 둘째, 커널 병목은 특정 벤더에 국한된 문제가 아니다. 2026-08-28에 등록된 두 건의 SGLang 이슈는 NVIDIA DGX Spark에서의 Qwen4Exp 디코드를 문서화하는데, 여기서는 QSA, PLE, Gated DeltaNet 커널 시간이 대부분을 차지하며, NVFP4 KV 캐시가 fp8_e4m3 대비 디코드 성능을 약 29% 저하시키는 것으로 측정되었다. 이 아키텍처의 어텐션과 임베딩 레이어는 어디서나 어려운 부분이다.
이것이 의미하지 않는 것
그것은 Qwen 4가 출시되었거나 출시가 임박했다는 뜻이 아니다. Alibaba가 2026-09-22에 이름을 붙인 Qwen 4 패밀리 — Max, Flash, Plus 및 27B 티어 — 는 모델 카드도, 가중치도, API 식별자도, 컨텍스트 윈도우도, 라이선스도, 가격도 없는 로드맵으로 남아 있다. 내부 아키텍처 이름을 대상으로 하는 프레임워크 어댑터는 언젠가 그 패밀리를 잘 서빙하기 위한 한 걸음이지, 그 패밀리가 존재하게 되기 위한 한 걸음은 아니다.
그렇다고 해서 오늘 당장 이걸 실행할 수 있다는 뜻은 아니다. 이 PR은 CI가 실패하는 초안이며, 병합 날짜도 없다. 병합된다 해도 이 경로에는 Ascend 910C, BF16, torch-npu 2.10이 포함된 CANN 9.0, 그리고 다섯 가지 특정 로컬 헤드 셰이프 중 하나가 필요하며, 옵트인 방식이다 — 즉 배포에서 이를 선택해야 한다. 작성자는 서버 수준 검증을 주장하기도 거부했는데, 바로 그 부분이 실제 배칭 환경에서 이것이 버티는지를 알려줄 수 있는 부분이다.
그리고 그것은 Qwen3.8-Flash-Next가 Ascend에서, 또는 출시된 엔진 빌드의 다른 어디에서든 지원되는 제품이라는 뜻이 아닙니다. 두 주요 오픈 런타임의 Qwen4Exp 경로는 병합되지 않은 풀 리퀘스트입니다. 이 아키텍처를 네이티브로 서비스하는, 설치할 수 있는 릴리스된 SGLang 또는 vLLM 버전은 없습니다. 호스팅 엔드포인트의 FastAPI 스타일 편의성은 직접 실행할 수 있는 커널과는 다른 것이며, 그 둘 사이의 간극이 바로 이와 같은 PR이 존재하는 이유입니다.
기다리는 동안 실제로 전화할 수 있는 것
Qwen4Exp에 관심을 두는 이유가 커널 내부가 아니라 아키텍처의 롱컨텍스트 동작을 테스트하고 싶기 때문이라면, 선택해야 할 모델은 알리바바가 실제로 제공하는 티어입니다. Qwen3.8-Flash는 — Qwen3.8-Flash-Next를 기반으로 구축된 프로덕션 라인이며 공식 내장 도구와 1,000,000토큰 컨텍스트를 갖춘 — OrcaRouter에서 qwen/qwen3.8-flash로 라이브 중입니다: 텍스트, 이미지 및 비디오 입력, 최대 131,072토큰 출력, 입력 토큰 백만 개당 $0.15 및 출력 토큰 백만 개당 $0.47, 캐시 읽기는 $0.0184입니다. 이는 제공업체 정가로, 저희 쪽에서는 0% 마크업으로 그대로 전달되므로, 해당 모델의 공급업체 가격이나 한도 변경은 발표되는 당일 여러분에게 반영됩니다. 지난 7일 동안 라이브 카드는 p50 첫 토큰 지연 시간 4,416 ms, 초당 약 106 출력 토큰, 2.68% 오류율을 보여줍니다 — 이는 랩 프리뷰라기보다 대용량 텍스트 티어의 프로필입니다.
두 가지 솔직한 유보 사항이 있으며, 이 아키텍처에 관한 동반 글들도 같은 두 가지를 달고 있습니다. Qwen3.8-Flash-Next 자체 — FP8 프리뷰 체크포인트, 즉 이 커널 측정값 중 무엇이든 로컬에서 재현하려면 필요한 바로 그것 — 은 우리 카탈로그에 없습니다. 서빙되는 Flash 티어는 그것으로부터 빌드된 프로덕션 배포판이지, 원시 프리뷰 아티팩트가 아닙니다. 그리고 위에서 설명한 Ascend 또는 DCP 작업은 당신이 호출할 수 있는 어떤 형태로도 존재하지 않습니다. 어느 것도 병합되지 않았기 때문입니다. 서빙 티어가 제공하는 것은 당신의 워크로드가 이 커널들이 해결하는 문제 — 매우 긴 컨텍스트를 상대로 한, 길고 프리픽스 비중이 높은 에이전틱 프롬프트 — 에 맞게 형성되어 있는지 알아내는 저렴한 방법입니다. 그렇다면 거기서 관찰하는 처리량과 캐시 동작은 Qwen 4 서빙 스택이 보호하도록 튜닝될 동일한 동작입니다.
날짜가 정해지지 않은 패밀리를 기다리지 않을 만한 인프라 차원의 논거도 있다. Qwen 4 라인업에서 어느 티어가 최종적으로 승리하든, 전환 비용은 통합 프로젝트가 아니라 라우팅 문제이며, 200개 이상의 모델을 위한 단일 API는 가중치가 공개될 때 두 번째 계약이나 코드 변경 없이 그 선택지를 열어두는 방법이다. 페일오버가 같은 이유로 여기서 특별한 방식으로 중요한데, 검증되지 않은 티어를 상대로 구축하려는 경우, 베팅한 경로가 잠시 문제를 겪을 때 요청이 실패하는 대신 안정적인 무언가로 넘어가길 원하기 때문이다.

직접 답할 가치가 있는 세 가지 질문
SGLang #41855는 Qwen 4가 출시된 걸 의미하나요, 아니면 미리 볼 수 있다는 건가요?
아니요, 두 가지 모두 아닙니다. 해당 풀 리퀘스트는 Alibaba가 2026-08-24에 출시한 Qwen3.8-Flash-Next에 구현된 Qwen4Exp 아키텍처를 대상으로 합니다. Qwen 4 가중치는 건드리지 않으며, 어떤 Qwen 4 티어에도 건드릴 가중치가 없습니다. 여기서 읽어야 할 신호는 패밀리의 가용성이 아니라, 프리뷰 아키텍처의 서빙 용량에 관한 것입니다.
모델 카드에 qwen4_exp라고 적혀 있다면, 그게 Qwen 4인가요?
아니요 — 그리고 이것이 이 이야기 전체에 걸린 이름 짓기 함정입니다. qwen4_exp는 내부 아키텍처 식별자이며, config.json에서 Qwen3.8-Flash-Next와 그 FP8 형제 모델용으로 찾을 수 있는 것입니다. “실험적 아키텍처”가 핵심 단어입니다. 가중치는 공개되어 있고, 아키텍처는 실재하며, 이 모델은 Qwen 4 제품군이 무엇을 기반으로 구축될 것으로 예상되는지를 보여주는 미리보기입니다. 그 식별자를 검색해서 제목에 Qwen4Exp가 들어간 SGLang이나 vLLM PR을 찾았다고 해도, 그것은 릴리스가 아니라 엔진 작업에 관한 정보를 알려줄 뿐입니다.
이것은 Ascend 대 NVIDIA의 이야기인가요?
꼭 그렇지는 않습니다. 동일한 어텐션 경로는 NVIDIA 쪽에서도 맞춤형 어댑터가 필요했습니다 — vLLM의 QSA를 위한 디코드 컨텍스트 병렬화, 그리고 Hopper를 위한 네이티브 희소 프리필 커널 — 또한 DGX Spark 이슈들은 QSA, PLE, Gated DeltaNet 커널 시간이 그곳의 디코드에서도 지배적이라는 것을 보여줍니다. QSA의 마이크로 블록 인덱서와 복제된 선택기 상태는 일반적인 페이지드 어텐션 커널이 가정하는 것과는 단순히 다릅니다. 이 패턴에 대한 Ascend의 기여는 더 날카로운 제약입니다: 2의 거듭제곱만 허용하는 헤드 비율 타일러이며, 이는 어댑터가 숨겨야 하는 패딩을 강제합니다.
지켜봐야 할 것
이것이 병합되느냐의 문제가 아니다. 그 어댑터는 자신이 어댑터라는 점을 솔직히 밝히고 있고, 정확성 테스트는 체크포인트 없이 재현 가능하며, 작성자는 통합 문제가 해결된 척하지 않고 오히려 그것을 짚어 두었다. 주목할 점은 NPU 활성화 라인과 이 어텐션 경로가 결합된 뒤에 벌어지는 일이다 — 통합된 브랜치가 둘 중 어느 쪽도 해보지 못한 엔드투엔드 실행을, 로컬 헤드 셰이프 텐서가 아니라 전체 모델을 사용한 실제 배칭 위에서, 하게 되는지 여부다. 1.713×라는 수치는 널리 회자될 바로 그 수치이며, 다른 빌드에서, 어댑터가 적용된 체크포인트에서, 비활성 인덱서를 사용해 계산된 수치다. 완성된 스택에서 측정된 숫자라면 과거의 숫자보다 상당히 더 가치 있을 것이다.
그때까지, 정직한 요약은 PR 자체가 고수하는 바로 그 요약이다: 계산은 맞아떨어지고, 플래그는 기본적으로 꺼져 있으며, CI는 빨간불이고, 제목에 있는 모델은 여전히 존재하지 않는다.
