
Qwen3.8-27B 벤치마크: 유의사항이 첨부된 전체 표
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
Qwen3.8-27B는 Terminal-Bench 2.1에서 73.0, SWE-bench Pro에서 61.7, LiveCodeBench v6에서 90.3, OSWorld-Verified에서 84.3을 기록했습니다. 그리고 그 숫자들은 모두 알리바바 자체의 측정값입니다. 270억 파라미터 규모의 오픈 가중치 모델은 2026년 8월 14일 Apache 2.0 라이선스로 Hugging Face에 공개되었으며, 8월 15일 현재 알리바바 외에는 아무도 이 모델의 품질을 독립적으로 평가하지 않았습니다. 이 페이지는 완전하고 출처가 명시된 요약입니다: 모델 카드의 공식 벤치마크 25개 전체, 이전 모델인 Qwen3.6-27B 대비 변경 사항, 독립적인 AMD 처리량 테스트에서 측정된 결과, 그리고 어떤 주장을 잠정적인 것으로 간주해야 하는지가 담겨 있습니다.
숫자들 앞에 나오는 읽는 법 안내: 여기서 "공식"이란 Alibaba가 Qwen/Qwen3.8-27B의 모델 카드에 기재한 평가를 의미합니다. 이는 공급업체가 보고한 것이며 재현되지 않았습니다. "독립"이란 연구소 외부의 누군가가 측정했음을 의미합니다 — 현재로서는 하드웨어 처리량에만 해당하며, 어떤 품질 점수에도 적용되지 않습니다. 하네스 선택이 중요한 벤치마크는 본문에 표시되어 있습니다.
모델, 사양당 한 줄
• 27B 밀집 파라미터 (비전 인코더 포함 시 28B), 64개 레이어, 히든 크기 5120.
• {{1}}하이브리드 어텐션 — Gated DeltaNet 선형 어텐션 레이어 48개와 전체 어텐션 레이어 16개, 3:1 비율{{/1}} — {{2}}이 구조 덕분에 262K 토큰 윈도우를 실행 가능하게 만들 수 있습니다{{/2}}.
262,144 토큰 네이티브 컨텍스트, YaRN 스케일링을 통해 1,000,000까지 확장 가능.
네이티브 이미지 및 비디오 입력(텍스트 출력), Apache 2.0 가중치, BF16 기준 약 55.6GB.
짧게 말하면, 이 모델은 알리바바가 2.4조 파라미터의 Qwen3.8-Max를 구축하면서 배운 것을 단일 GPU에서 실행할 수 있는 무언가로 압축하기 위해 만들어진 모델입니다.
스코어카드: 모델 카드의 모든 벤치마크
아래의 모든 점수는 Alibaba가 8월 14일 모델 카드에서 보고한 것으로, 이 모델이 대체하는 Qwen3.6-27B 점수는 괄호 안에 표시되어 있습니다.
코딩. Terminal-Bench 2.1 (에이전트형 터미널 코딩) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). SWE-bench Pro 및 QwenSWEBench 실행은 모델 카드 각주에 따르면 Claude Code 하네스를 사용했습니다 — 다른 하네스로 평가된 모델과 비교하기 전에 염두에 두어야 할 점입니다.
장기 지평 에이전트와 사무 업무. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / 점수 42.9 (10.6 / 27.3).
추론 및 지식. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench 지시 따르기 79.5 (69.1). HLE는 GPT-4o로 평가되며, 카드 기준입니다.
비전 및 컴퓨터 사용. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6(CI 적용 시) / 90.0(CI 미적용 시) (85.1); BabyVision 85.6(CI 적용 시) / 65.7(CI 미적용 시) (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI"는 알리바바의 추론 시간 강화 기법입니다. CI 적용 여부에 따른 격차는 추가 추론 연산으로 얼마나 많은 점수를 살 수 있는지 보여주는 카드상에서 가장 정보 가치가 높은 수치입니다.

Qwen3.6-27B와 비교했을 때 실제로 무엇이 변경되었나요?
카드의 모든 벤치마크가 상승했지만, 그 변화의 폭은 균일하지 않습니다. 그리고 그 개선의 형태가 핵심입니다. 향상된 부분은 지식 회상이 아니라 에이전트 코딩과 컴퓨터 사용에 집중되어 있습니다:
• DeepSWE 1.1 (에이전트 코딩) 13.3 → 42.2, 대략 3배 점프
• QwenSWEBench 49.3 → 79.0
• Agents' Last Exam 점수 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 그리고 AndroidWorld 70.3 → 81.9
• BabyVision (CI 포함) 28.9 → 85.6 — 카드에서 가장 큰 상대적 증가
한편 GPQA Diamond는 87.8 → 89.2로, RealWorldQA는 84.1 → 85.9로 올랐다: 실질적이지만 작은 변화다. 이는 '모든 면에서 더 똑똑해진' 릴리스가 아니다. 화면을 읽고, 도구를 사용하고, 여러 단계에 걸쳐 코드를 작성하는 에이전트를 정면으로 겨냥한 릴리스다.

정직한 격차: 여전히 부족한 부분과 방법론적 한계
{{1}}최첨단 모델과 견주면 결과는 고무적이지만 일방적이지는 않다.{{/1}} {{2}}Qwen3.8-27B와 Claude Opus 4.6 Max가 겹치는 영역에서 Qwen이 대부분 승리했다 — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, 그리고 비전 부문 전체를 포함해서다.{{/2}} {{3}}자연스러운 로컬급 라이벌인 Meta의 Muse Glimmer-30B를 상대로는 겹치는 8개 벤치마크 전부에서 완승한다.{{/3}} {{4}}하지만 Claude Opus 4.6 Max에게는 여전히 Terminal-Bench 2.1(73.0 대 78.2), GPQA Diamond(89.2 대 91.3), Humanity's Last Exam(30.8 대 40.0), NL2Repo-Bench(42.3 대 47.6)에서 패배한다.{{/4}} {{5}}가장 어려운 최첨단 추론 작업, 즉{{/5}} {{6}}프런티어 수학이나 대규모 다학제적 질문 같은 과제를 다루는 경우라면{{/6}}, {{7}}27B는 아직 그 수준에 도달하지 못했다.{{/7}}
이 중 무엇을 인용하기 전에 세 가지 주의사항이 있습니다. 첫째, 그 어느 것도 독립적으로 검증되지 않았습니다. 8월 15일 현재 27B에 대한 Artificial Analysis 지수도 LMArena 실행도 없으며, 알리바바 자체 하네스는 제3자가 사용할 하네스가 아닙니다. 둘째, 모델 카드는 SWE-bench Pro와 QwenSWEBench에 Claude Code 하네스를 사용하고, Humanity's Last Exam에는 GPT-4o 심사자를 사용합니다. 다른 설정으로 평가된 모델과의 비교는 수치를 변화시킵니다. 셋째, 알리바바의 MathVision 실행은 고정 프롬프트를 사용한 반면, 경쟁 모델들은 두 가지 변형 중 더 높은 점수를 받은 것을 사용했습니다. 이 중 어떤 것도 결과가 틀렸다는 뜻이 아닙니다. 이는 다른 누군가가 모델을 실행할 때까지 결과가 하한선이 아니라 상한선이라는 뜻입니다.
그것을 실행하는 데 필요한 것
Qwen3.8-27B는 로컬 모델로, "성능"의 의미를 바꿉니다. 가격표 대신 자체 하드웨어에서의 처리량이 관건이 되는 것입니다. BF16 가중치는 대략 55.6GB이며, 4비트로 양자화하면 RTX 3090 또는 4090 같은 24GB 카드에도 들어갑니다. AMD는 출시일에 Day-0 지원을 제공했고, 자체 llama.cpp/Vulkan 측정(2026년 8월, 3회 이상 실행 평균)에 따르면 Ryzen AI Max+ 395에서 24.5 tokens/s, 32GB 메모리의 Radeon AI PRO R9700에서 51.8 tokens/s를 기록했습니다. 이는 대략 24GB 이상의 가변 그래픽 메모리 또는 VRAM을 갖춘 시스템 기준입니다. NVIDIA GH200에서 FP8 빌드에 대한 커뮤니티 테스트는 10개의 동시 262K 컨텍스트 요청을 첫 토큰까지 10ms 미만으로 처리했습니다. 여러분의 수치는 다를 수 있습니다 — 그건 다른 사람의 GPU니까요 — 하지만 그 형태는 실제입니다. 이는 리뷰에서만이 아니라 단일 워크스테이션에서 실제로 실행되는 이 클래스의 첫 번째 Qwen 릴리스입니다.
무료 가중치, 아니면 유료 API?
이 모델이 강제하는 결정은 로컬과 호스팅을 가르는 바로 그 결정입니다. 가중치는 비용이 들지 않지만, 여러분의 GPU는 공짜가 아닙니다. 자체 호스팅은 실리콘을 소유하는 것을 의미합니다. 4비트 양자화와 느린 생성 속도를 감수한다면 24GB 카드 하나면 충분하고, 전체 262K 컨텍스트를 최대 품질로 사용하려면 더 큰 장비가 필요합니다. OrcaRouter의 호스팅 대안은 입력 토큰 100만 개당 $0.33, 출력 토큰 100만 개당 $2.40이며, 동일한 262K 컨텍스트와 이미지 및 비디오 입력을 지원합니다. 지난 7일간 측정된 p50 첫 토큰까지의 시간은 225ms입니다. 구매할 GPU도 없고, 돌봐야 할 VRAM도 없습니다. 계산 방식은 오픈 가중치에서 늘 하던 것과 같습니다. 실제로 필요한 토큰 처리량에 토큰당 비용을 곱한 값과, 카드 구매 가격을 비교하는 것입니다. 지속적인 대량 트래픽에서는 자체 호스팅이 승리하지만, 버스트성 또는 소량 트래픽에서는 $0.33/$2.40를 지불하는 것이 대부분 유휴 상태로 두는 실리콘을 사는 것보다 낫습니다.

결론
Qwen3.8-27B는 알리바바가 이 크기 클래스에서 출시한 가장 강력한 오픈 가중치 모델입니다. 알리바바 자체 수치에 따르면 에이전틱 코딩, 컴퓨터 사용, 비전 추론에서 테이블 내 최고 성능을 기록했으며, 262K 컨텍스트 창과 Apache 2.0 가중치를 제공합니다. 스코어카드를 올바르게 해석하는 방법은 조건부입니다. 모든 수치는 벤더가 보고한 것이고, 하네스별로 다르며, 아직 재현되지 않았고, 최첨단 모델이 가장 어려운 추론 벤치마크에서 여전히 우위를 점하고 있습니다. 자체 호스팅할지 또는 API로 호출할지 결정 중이라면, 벤치마크 테이블을 하나의 약속으로 보고 AMD 처리량 수치를 현재 존재하는 유일한 독립적 측정값으로 취급하십시오. 독립 연구소가 점수를 발표하는 날 이 페이지를 업데이트하겠습니다.
