
Qwen3.8-27B 벤치마크: 유의사항이 첨부된 전체 표
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Qwen/Qwen3.8-27B는 Terminal-Bench 2.1에서 73.0, SWE-bench Pro에서 61.7, LiveCodeBench v6에서 90.3, OSWorld-Verified에서 84.3을 기록했습니다. 그리고 이 수치들은 모두 알리바바 자체 측정입니다. 270억 파라미터 규모의 오픈 웨이트 모델은 2026년 8월 14일 Apache 2.0 라이선스로 Hugging Face에 공개되었으며, 첫 2주 안에 세 가지 독립적인 제3자 결과를 확보했습니다: 법률 AI 기업 Harvey와 메모리 기업 Engram이 진행한 연구에서 Harvey의 Legal Agent 벤치마크 오픈 웨이트 부문 1위, 2026년 8월 25일 알리바바 발표에 따르면 Code Arena의 WebDev 리더보드에서 전체 9위(같은 규모 등급에서 톱 10 안에 든 유일한 모델), 그리고 8월 26일 발표된 Arena.ai의 Image-to-WebDev 리더보드 오픈 웨이트 부문 1위(전체 7위, 보고된 점수 1,574)입니다. 이 페이지는 완전하고 출처가 명시된 정리입니다: 모델 카드의 공식 벤치마크 25개 전체, 이전 모델 Qwen3.6-27B 대비 달라진 점, 독립적인 AMD 처리량 테스트가 측정한 내용, 해당 법률 에이전트 및 WebDev 아레나 결과, 그리고 아직 잠정적으로 봐야 할 주장들입니다.
숫자 앞의 읽기 가이드: 여기서 '공식'이란 Qwen/Qwen3.8-27B의 모델 카드에 인쇄된 Alibaba의 평가를 의미합니다. 이는 공급업체가 보고한 것이며 재현되지 않았습니다. '독립적'이란 연구소 외부의 누군가가 측정했음을 의미합니다 — 현재까지 하드웨어 처리량 테스트, 법률 분야 에이전트 연구, 그리고 Arena.ai의 웹 개발 리더보드 두 곳(Code Arena의 WebDev와 Image-to-WebDev 아레나)에서의 순위가 포함됩니다. 하네스가 중요한 벤치마크는 인라인으로 표시됩니다.
모델, 사양당 한 줄
• 27B 밀집 파라미터 (비전 인코더 포함 시 28B), 64개 레이어, 히든 크기 5120.
• {{1}}하이브리드 어텐션 — Gated DeltaNet 선형 어텐션 레이어 48개와 전체 어텐션 레이어 16개, 3:1 비율{{/1}} — {{2}}이 구조 덕분에 262K 토큰 윈도우를 실행 가능하게 만들 수 있습니다{{/2}}.
262,144 토큰 네이티브 컨텍스트, YaRN 스케일링을 통해 1,000,000까지 확장 가능.
네이티브 이미지 및 비디오 입력(텍스트 출력), Apache 2.0 가중치, BF16 기준 약 55.6GB.
짧게 말하면, 이 모델은 알리바바가 2.4조 파라미터의 Qwen3.8-Max를 구축하면서 배운 것을 단일 GPU에서 실행할 수 있는 무언가로 압축하기 위해 만들어진 모델입니다.
스코어카드: 모델 카드의 모든 벤치마크
아래의 모든 점수는 Alibaba가 8월 14일 모델 카드에서 보고한 것으로, 이 모델이 대체하는 Qwen3.6-27B 점수는 괄호 안에 표시되어 있습니다.
코딩. Terminal-Bench 2.1 (에이전트형 터미널 코딩) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). SWE-bench Pro 및 QwenSWEBench 실행은 모델 카드 각주에 따르면 Claude Code 하네스를 사용했습니다 — 다른 하네스로 평가된 모델과 비교하기 전에 염두에 두어야 할 점입니다.
장기 지평 에이전트와 사무 업무. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / 점수 42.9 (10.6 / 27.3).
추론 및 지식. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench 지시 따르기 79.5 (69.1). HLE는 GPT-4o로 평가되며, 카드 기준입니다.
비전 및 컴퓨터 사용. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6(CI 적용 시) / 90.0(CI 미적용 시) (85.1); BabyVision 85.6(CI 적용 시) / 65.7(CI 미적용 시) (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI"는 알리바바의 추론 시간 강화 기법입니다. CI 적용 여부에 따른 격차는 추가 추론 연산으로 얼마나 많은 점수를 살 수 있는지 보여주는 카드상에서 가장 정보 가치가 높은 수치입니다.

Qwen3.6-27B와 비교했을 때 실제로 무엇이 변경되었나요?
카드의 모든 벤치마크가 상승했지만, 그 변화의 폭은 균일하지 않습니다. 그리고 그 개선의 형태가 핵심입니다. 향상된 부분은 지식 회상이 아니라 에이전트 코딩과 컴퓨터 사용에 집중되어 있습니다:
• DeepSWE 1.1 (에이전트 코딩) 13.3 → 42.2, 대략 3배 점프
• QwenSWEBench 49.3 → 79.0
• Agents' Last Exam 점수 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 그리고 AndroidWorld 70.3 → 81.9
• BabyVision (CI 포함) 28.9 → 85.6 — 카드에서 가장 큰 상대적 증가
한편 GPQA Diamond는 87.8 → 89.2로, RealWorldQA는 84.1 → 85.9로 올랐다: 실질적이지만 작은 변화다. 이는 '모든 면에서 더 똑똑해진' 릴리스가 아니다. 화면을 읽고, 도구를 사용하고, 여러 단계에 걸쳐 코드를 작성하는 에이전트를 정면으로 겨냥한 릴리스다.

첫 번째 독립 결과: Harvey의 Legal Agent 벤치마크에서 #1 오픈 웨이트
이 페이지가 올라간 이후로 가장 중요한 발전은 기술적이 아니라 법적입니다. Alibaba는 Qwen3.8-27B가 Harvey의 Legal Agent 벤치마크에서 1위 오픈 웨이트 모델이라고 발표했습니다. 이는 공급업체 자체 계정의 순위 주장이므로 Alibaba가 밝힌 것으로 간주하십시오. 그 뒤에 있는 결과는 Alibaba의 것이 아닌 연구입니다: 법률 AI 회사인 Harvey와 AI 메모리 스타트업인 Engram은 Calderwood & Harkness라는 합성 로펌을 약 10,000개의 문서와 266개의 사안에 걸쳐 1억 개 이상의 토큰으로 구축한 다음, 매개변수 메모리, 압축된 메모, 검색 도구를 사용하여 Qwen3.8-27B를 여기에 적용했습니다.
250개의 법률 과제에서 적응된 27B 모델은 평균 67%를 기록하며, 연구에서 테스트한 모든 모델(Claude Opus 4.8 포함)보다 앞섰습니다. 또한 엄격한 올오어낫싱(전부 아니면 전무) 정확도에서는 Opus 4.8을 30% 대 25%로 이겼으며, 쿼리당 비용은 약 0.13달러로 Opus 4.8의 1.32달러와 대조를 이뤘습니다. 이 수치는 Harvey/Engram이 보고한 것으로, 아직 독립적으로 재현되지 않았습니다. 해당 기업의 자체 문서로 훈련하기 전에 같은 모델은 기업 특정 질문에서 4.7%에 그쳤으나, 문서를 학습한 후에는 72.6%를 기록했습니다.
1위를 읽을 때 큰 주의사항이 하나 있습니다: 벤치마크에서 1위를 차지한 모델은 평가 전에 테스트 코퍼스를 미리 학습했고, 해당 기업의 1억 개 토큰으로 적응(adaptation)된 상태였기 때문입니다. 즉, 이 결과는 27B 모델이 도메인 특화 튜닝을 통해 얼마나 많은 것을 흡수할 수 있는지를 보여주는 데모이지, 중립적인 하네스에서 스톡 Apache-2.0 가중치에 대한 점수가 아닙니다. 게다가 다루는 영역도 일반적인 품질이 아니라 법률이라는 단일 도메인에 국한됩니다. 이 결과가 실제로 뒷받침하는 것은 그 트윗 뒤에 담긴 주장, 즉 로컬 머신에서 실행할 만큼 작은 27B가 올바른 지식을 갖추면 전문가 수준의 작업에 충분히 강력하다는 점입니다.
두 번째 독립적인 결과: Code Arena의 WebDev에서 전체 #9
두 번째 독립적인 결과는 코딩 관련 결과이며, 이것이 바로 이 페이지가 8월 25일에 변경된 이유입니다. Code Arena는 Arena.ai의 웹 개발 리더보드로, 이전에 WebDev Arena로 알려졌던 프로젝트이며 이전에 LMArena로 알려져 있던 사이트에 있습니다. 사용자들은 익명화된 모델 쌍으로 실제 앱을 만들어 어떤 출력을 출시하고 싶은지 투표합니다. 이 공개 리더보드에서 Qwen3.8-27B는 1595점으로 전체 9위를 차지했으며, 같은 크기 등급에서 상위 10위 안에 든 유일한 모델입니다.
그 배치는 독립적인 부분입니다 — 누구나 열어볼 수 있는 제3자 리더보드에 있기 때문입니다. 그 주변의 헤드라인은 알리바바가 밝힌 것입니다. "톱 10 안의 유일한 소형 모델"이라는 프레임과 동반 배치들은 Qwen이 8월 25일 발표한 데서 나온 것입니다. 그 표현을 그 라벨과 함께 반복할 가치가 있습니다. 27B는 훨씬 더 큰 Qwen3.8-Max(발표에서 전체 3위로 배치)보다 여섯 자리 아래에 랭크되며, 비슷한 크기의 Gemma 4-31B(같은 발표에서 80위로 배치)보다 훨씬 앞섭니다. 요점은 27B가 웹 앱 구축에서 최첨단 모델을 이긴다는 것이 아니라, GPU 하나로 실행할 수 있을 만큼 작은 모델이 나머지 참가자들이 훨씬 더 큰 모델들인 블라인드 코딩 아레나의 톱 10 안에 든다는 것입니다.
세 번째 독립 결과: Arena.ai의 Image-to-WebDev에서 #1 오픈 모델
세 번째 독립 결과는 8월 26일에 나왔으며, 이는 이 크기의 모델로서는 지금까지 가장 강력한 것입니다. Image-to-WebDev는 Arena.ai의 Code Arena WebDev의 자매 보드로, 모델이 스크린샷이나 다른 시각적 참조를 받아 작동하는 웹 인터페이스로 변환하고, 블라인드 인간 투표자들이 출시하고 싶은 출력물을 선택하는 아레나입니다. 그 공개 리더보드에서 Qwen3.8-27B는 공개 모델 중 1위, 전체 7위를 기록했으며, 보고된 아레나 점수는 1,574입니다.
순위는 독립적인 부분입니다 — 누구나 열어볼 수 있는 제3자 리더보드에 있는 것이죠. 그 주변의 헤드라인은 알리바바가 내세운 것입니다: Qwen 팀의 8월 26일 발표는 이 테스트에서 27B 모델이 "자기 크기의 100배에 달하는 모델과 대등하다"고 주장하지만, 리더보드는 그러한 비교를 문서화하지 않습니다. 또한 선호도 순위는 코드 품질에 대한 판정이 아닙니다 — Image-to-WebDev 투표는 인간이 어떤 결과물을 더 선호해 출시할지 측정할 뿐, HTML이 안전하고 접근 가능하며 유지보수 가능한지를 측정하지 않습니다. 결과가 확립하는 바는 27B 오픈 가중치 모델이 이제 이미지를 페이지로 바꾸는 기술에서 전체 오픈 분야를 선도한다는 것이며, 이는 성장 중인 "스크린샷에서 사이트로" 제품 카테고리가 기반으로 삼는 기술입니다.
정직한 격차: 여전히 부족한 부분과 방법론적 한계
프런티어와 비교하면 상황은 호의적이지만 일방적이지는 않습니다. Qwen3.8-27B와 Claude Opus 4.6 Max가 겹치는 부분에서 Qwen은 대부분 승리합니다 — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, 그리고 전체 비전 블록. 자연스러운 로컬 클래스 경쟁자인 Meta의 Muse Glimmer-30B와 비교하면, 여덟 개의 겹치는 벤치마크를 모두 압도적으로 이깁니다. 하지만 여전히 Claude Opus 4.6 Max에게 Terminal-Bench 2.1(73.0 대 78.2), GPQA Diamond(89.2 대 91.3), Humanity's Last Exam(30.8 대 40.0), NL2Repo-Bench(42.3 대 47.6)에서 패배합니다. 만약 워크로드가 가장 어려운 프런티어 추론, 즉 프런티어 수학이나 대규모 다학제적 질문이라면, 27B는 아직 그 수준에 도달하지 못했습니다.
이 글을 인용하기 전에 세 가지 주의사항이 있습니다. 첫째, 위의 모델 카드 표는 여전히 전적으로 Alibaba가 보고한 것입니다. 27B에 대한 Artificial Analysis 지수는 아직 없습니다. 이제 독립적인 제3자 결과가 세 개 있지만, 각각 범위가 좁습니다. Code Arena 순위는 텍스트 프롬프트로 웹 앱을 만드는 것을 측정하고, Image-to-WebDev 순위는 스크린샷을 실제 작동하는 페이지로 바꾸는 것을 측정하며, 둘 다 익명화된 출력에 대한 블라인드 투표로 평가됩니다. 또한 Harvey 법률 에이전트 연구는 테스트를 위해 훈련된 모델로 단일 도메인을 다룹니다. 그 어느 것도 일반 목적의 하네스에서 실행된 원본 가중치가 아닙니다. 둘째, 모델 카드는 SWE-bench Pro와 QwenSWEBench에 Claude Code 하네스를 사용하고 Humanity's Last Exam에는 GPT-4o 판정기를 사용합니다. 다른 설정으로 평가된 모델과의 비교는 수치를 바꿀 것입니다. 셋째, Alibaba의 MathVision 실행은 고정된 프롬프트를 사용한 반면, 경쟁자들은 두 변형 중 더 높은 것을 받았습니다. 이것은 결과가 틀렸다는 것을 의미하지 않습니다. 독립 연구소가 중립적인 일반 목적 하네스에서 모델을 실행할 때까지 이것은 바닥이 아니라 천장이라는 것을 의미합니다.
그것을 실행하는 데 필요한 것
Qwen3.8-27B는 로컬 모델로, "성능"의 의미를 바꿉니다: 가격표 대신 자신의 하드웨어에서의 처리량입니다. BF16 가중치는 약 55.6GB이며, 4비트로 양자화하면 RTX 3090 또는 4090과 같은 24GB 카드에 맞습니다. AMD는 출시일에 Day-0 지원을 제공했고, 자체 llama.cpp/Vulkan 측정(2026년 8월, 3회 이상 실행 평균)에 따르면 Ryzen AI Max+ 395에서 24.5 tokens/s, 32GB 메모리의 Radeon AI PRO R9700에서 51.8 tokens/s를 기록했습니다. 이는 대략 24GB 이상의 가변 그래픽 메모리 또는 VRAM을 갖춘 시스템에서의 결과입니다. NVIDIA GH200에서 FP8 빌드에 대한 커뮤니티 테스트는 10개의 동시 262K 컨텍스트 요청을 처리했으며, 첫 토큰까지의 시간(time-to-first-token)은 10ms 미만이었습니다. 자신의 수치는 다를 수 있습니다 — 그건 다른 사람의 GPU니까요 — 하지만 그 형태는 실제입니다: 이는 이 클래스의 Qwen 릴리스 중 리뷰에서만이 아니라 단일 워크스테이션에서 실행되는 최초의 제품입니다.
무료 가중치, 아니면 유료 API?
이 모델이 강제하는 결정은 로컬과 호스팅을 가르는 바로 그 결정입니다. 가중치는 비용이 들지 않지만, 여러분의 GPU는 공짜가 아닙니다. 자체 호스팅은 실리콘을 소유하는 것을 의미합니다. 4비트 양자화와 느린 생성 속도를 감수한다면 24GB 카드 하나면 충분하고, 전체 262K 컨텍스트를 최대 품질로 사용하려면 더 큰 장비가 필요합니다. OrcaRouter의 호스팅 대안은 입력 토큰 100만 개당 $0.33, 출력 토큰 100만 개당 $2.40이며, 동일한 262K 컨텍스트와 이미지 및 비디오 입력을 지원합니다. 지난 7일간 측정된 p50 첫 토큰까지의 시간은 225ms입니다. 구매할 GPU도 없고, 돌봐야 할 VRAM도 없습니다. 계산 방식은 오픈 가중치에서 늘 하던 것과 같습니다. 실제로 필요한 토큰 처리량에 토큰당 비용을 곱한 값과, 카드 구매 가격을 비교하는 것입니다. 지속적인 대량 트래픽에서는 자체 호스팅이 승리하지만, 버스트성 또는 소량 트래픽에서는 $0.33/$2.40를 지불하는 것이 대부분 유휴 상태로 두는 실리콘을 사는 것보다 낫습니다.

결론
알리바바의 자체 수치에 따르면, Qwen3.8-27B는 알리바바가 이 크기 등급에서 출시한 오픈 가중치 모델 중 가장 강력합니다. 에이전트 코딩, 컴퓨터 사용, 비전 추론에서 테이블 최고 성능을 보이며, 262K 컨텍스트 창과 Apache 2.0 가중치를 제공합니다. 스코어카드의 올바른 해석은 조건부입니다. 모든 모델 카드 수치는 공급업체가 보고했고, 하네스 특정적이며, 아직 재현되지 않았고, 최첨단 모델은 여전히 가장 어려운 추론 벤치마크에서 우위를 점합니다. 셀프 호스팅할지 아니면 API로 호출할지 결정하는 경우, 벤치마크 표를 약속으로, AMD 처리량 수치를 최초의 독립 하드웨어 측정으로, Harvey 법률 에이전트 결과를 모델의 능력이 알리바바 자체 하네스 외부에서도 유지된다는 최초의 독립적 신호로, 그리고 두 개의 웹개발 아레나 배치 — Code Arena의 WebDev에서 전체 9위, Arena.ai의 Image-to-WebDev에서 1위 오픈 모델 — 를 해당 능력에 대한 최초의 독립적 코딩 리더보드 확인으로 간주하십시오. 더 많은 독립 연구소가 점수를 발표하면 이 페이지를 업데이트하겠습니다.
