Qwen3.8-27B 리뷰를 위한 히어로 타이틀 카드로, 제목은 'Qwen3.8-27B Review'이고 부제는 '집에서 Opus 역할을 하는 오픈 가중치 27B — 과대광고에 맞서 테스트됨'이다. 오픈 가중치 배지, Apache 2.0 배지, GPU 및 서버 아이콘 세트가 부드러운 파란색 그라데이션 포인트가 있는 깔끔한 흰색 배경 위에 표시된다.
Guides & Insights

Qwen3.8-27B 리뷰: '집에 있는 Opus'로 불리는 오픈 웨이트 27B — 과대광고를 직접 검증했다

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Qwen3.8 27B는 현재 자체 호스팅할 수 있는 최고의 오픈 웨이트 27B이며, 그 격차는 상당히 큽니다. 가중치는 2026년 8월 14일 Apache 2.0 라이선스로 공개되었습니다: 262K 네이티브 컨텍스트, 네이티브 이미지 및 비디오 입력, 그리고 Cla​ude Opus 4.6 Max와 동급 이상의 벤더 보고 에이전틱 코딩 점수를 갖춘 덴스 27B(비전 인코더 포함 시 28B)입니다 — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. 가장 중요한 가격은 0입니다: 55.6 GB를 다운로드하고 실행하면 됩니다. 주의할 점도 확실히 존재합니다. 독립적인 테스트에서는 이전 모델보다 약 3배 느리고 토큰을 훨씬 많이 소비하는 것으로 나타났으며, 카드에 기재된 모든 벤치마크는 여전히 Ali​baba가 보고한 것이고, 1M 컨텍스트는 호스팅 전용 기능입니다. 결론: 24 GB 이상의 GPU를 보유하고 있고 계량 요금 없이 프런티어에 근접한 성능을 원한다면 셀프 호스팅하세요. 다만 수치가 어디서 취약한지 정확히 알고 시작해야 합니다.

결론부터: Qwen3.8 27B를 사용해야 할까요?

짧은 답변 — 로컬 및 프라이빗 워크로드에는 예, 조달 결정 전에 타사 수치를 기다리십시오. Qwen3.8 27B는 오픈 가중치가 제품이고 API가 편의성인 드문 모델입니다. 라이선스가 Apache 2.0이므로 하드웨어만 갖추면 토큰당 가격은 영구적으로 0이며, 그 위에 구축한 어떤 것도 소급하여 재라이선스하거나 청구할 수 없습니다. 포기하는 것은 속도, 검증, 편의성입니다.

이미 Qwen3.6-27B를 실행 중이고 만족하고 있다면, 업그레이드의 효과는 실재하지만 실제 소요 시간(wall-clock) 기준으로는 공짜가 아닙니다. Qwen3.8-Max 출시 소식에서 이곳에 오셨다면, 이것은 같은 세대의 더 작고 자체 호스팅이 가능한 구성원입니다 — 다른 작업을 위한 다른 도구입니다.

빠른 사실들, 2026년 8월 15일 확인됨

출시됨 — 가중치는 2026년 8월 14일에 Qwen/Qwen3.8-27B로 Hugging Face에 공개되었고, ModelScope에도 미러링되었습니다. 시간대에 따라서는 8월 13일로 보도되기도 하며, 이번 출시는 Qwen3.8 세대가 발표된 지 약 일주일 만에 이루어졌습니다.

라이선스 — Apache 2.0: 다운로드, 수정, 재배포, 상업적 사용, 명시적 특허 허여 포함. 영구적.

파라미터 — 27B dense(비전 인코더 포함 시 28B), 레이어 64개, 히든 크기 5,120, 어휘 248,320.

아키텍처 — 하이브리드 어텐션: 48개의 Gated DeltaNet 선형 어텐션 레이어와 16개의 전체 Gated Attention 레이어(3:1 비율)로 구성됩니다. 이것이 27B 밀집 모델이 262K 토큰의 기본 컨텍스트를 처리할 수 있는 이유입니다.

컨텍스트 — 기본적으로 262,144개의 토큰을 지원하며, 호스팅 버전에서는 YaRN을 통해 1,000,000개까지 확장할 수 있습니다.

입력 — 텍스트와 함께 이미지와 비디오를 기본 지원하며 텍스트를 반환합니다. 비전 인코더가 있어서 매개변수 수가 28B로 표시됩니다.

Thinking — 추론 모드는 기본적으로 활성화되며 요청별로 비활성화할 수 있습니다. reasoning_effort (낮음/중간/높음) 및 preserve_thinking은 장기 에이전트 실행을 위한 것입니다.

가중치 — 18개 샤드에 저장된 55.6GB 용량의 BF16 safetensors이며, FP8 및 커뮤니티 GGUFs도 함께 제공됩니다.

위 사양은 오늘 읽은 Hugging Face 모델 카드 및 구성에서 가져온 것으로, Qwen3.8 27B에 대한 것입니다. 벤치마크 주장은 Ali​baba가 보고한 것이며, 현재까지 독립 연구소에서 재현하지 못했습니다.

Qwen3.8 27B가 진정으로 잘하는 것

가장 유력한 사례는 에이전트형(agentic) 소프트웨어 엔지니어링입니다. Ali​baba는 DeepSWE 1.1에서 이전 27B 대비 3배 향상(42.2 대 13.3)을 보고했으며, SWE-bench Pro에서는 Cla​ude Opus 4.6 Max보다 높은 점수(61.7 대 53.4)를 기록했습니다. 바로 그 수치 덕분에 'Opus at home'이라는 별명을 얻은 것입니다. 개인이 실제로 소유할 수 있는 하드웨어에서 프런티어에 근접한 코딩 작업을 수행하는 밀집형 27B 모델이라는 뜻입니다.

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

원시 숫자 외에 세 가지가 이 매수를 정당화한다:

네이티브 멀티모달. 이미지와 비디오 입력, 텍스트 출력 — 다이어그램이 포함된 문서나 비디오 워크스루는 별도의 모델이 아닙니다. 시각적 추론 점수(체인 오브 소트 기능을 활성화한 경우 85.6, 시각 수학 94.6, 둘 다 공급업체 보고 기준)는 비전 인코더의 진가가 드러나는 부분입니다.

262K 네이티브 컨텍스트.장기적인 에이전트 작업, 대규모 코드베이스, 수 시간 분량의 대화 기록이 하나의 컨텍스트 창에 모두 들어갑니다. 하이브리드 선형 어텐션 설계는 동일한 크기의 순수 풀 어텐션 모델보다 해당 컨텍스트의 KV 비용을 더 낮게 유지합니다.

무료이고 영구적인 가중치. 이것이 이 카테고리의 핵심입니다: 폐쇄형 API 모델은 대여되지만, Qwen3.8 27B는 소유입니다. 4-bit에서는 24GB 카드(RTX 3090/4090급)에서 실행되며, AMD는 Day-0 지원을 제공했습니다(AMD 자체 블로그 기준, Ryzen AI Max+ 395에서 최대 24.5 tokens/s, Radeon AI PRO R9700에서 51.8 tokens/s).

리뷰가 지저분해지는 지점: 속도, 토큰, 그리고 검증

지금까지의 독립 테스트는 한 명의 테스터가 만든 테스트 하네스일 뿐 실험실은 아니지만, 우리가 가진 최고의 신호입니다. 실행을 해보면, Qwen3.8 27BQwen3.6-27B를 10가지 실제 작업(llmcompare 하네스를 통해 GPT-5.5가 평가)에서 비교했을 때, 3.8은 10개 중 9개를 이기고 평균 8.838 대 6.862를 기록했습니다. — 테스터가 본 "가장 인상적인 지능 향상 중 하나"였습니다. 또한 거의 3배의 토큰을 사용했고 상당히 느렸습니다. 한 작업은 약 600% 더 오래 걸렸습니다. 따라서 품질 향상은 실제이며, 벽시계 시간의 비용도 실제입니다.

그것을 탓할 네 가지가 더 있습니다:

아직 제3자 벤치마크가 없습니다. 이 기사의 모든 주요 수치는 8월 15일 기준 Ali​baba가 보고한 것입니다. 공급업체 카드는 상세하지만, 독립 연구소에 의한 재현은 이루어지지 않았습니다. 결정이 검증된 수치에 의존한다면 그 수치를 기다리세요 — 가중치는 그대로 있을 테니까요.

VRAM 최소 요구량은 실재합니다. BF16은 80GB급 GPU가 필요합니다. 24GB 카드에 맞추려면 4비트로 실행해야 하며, 커뮤니티 보고(출시 며칠 후 dev.to 댓글 스레드)에 따르면 양자화된 빌드는 '긴 컨텍스트 후에 초점을 잃는다'고 합니다. VRAM이 충분하다면 공식 가중치를, 그렇지 않다면 양자화된 버전을 사용하세요.

1M 컨텍스트는 호스팅 전용입니다. 오픈 가중치는 262K로 제한됩니다. 1M까지 확장 가능하다는 수치는 Qwen Cloud 호스팅 기능으로, 로컬 복사본이 기본적으로 제공하는 기능이 아닙니다.

"Beats Opus"에는 수식어가 필요합니다.에이전틱 벤치마크는 하네스에 특화된 동작에 보상을 부여하며, dev.to 런칭 게시물의 최상위 댓글은 이렇게 직설적으로 말했습니다: "실제 사용에서는 Opus를 이기지 못합니다." 점수판은 좋은 날의 상한선으로 간주하되, 약속으로 여기지 마세요.

Qwe​n 3.8 제품군에서의 위치

Qwen3.6-27B 대비 — 동일한 하드웨어 등급과 262K 컨텍스트를 갖추고 있지만, 속도와 토큰 효율성을 희생하는 대신 상당한 성능 도약을 제공합니다. 이미 3.6을 실행 중이고 처리량에 제약이 있다면, 유지하는 것이 타당합니다.

Qwen3-Coder-30B-A3B 대비 — Coder는 약 33억 개의 활성 파라미터를 가진 MoE로, 훨씬 빠른 속도(~90–110 tokens/s)로 동작한다. dense 27B는 토큰당 속도는 더 느리지만, 이번 세대의 에이전틱(agentic) 이점을 물려받는다. 27B의 소프트웨어 엔지니어링 점수가 독립적인 테스트에서도 유지된다면, Coder-30B의 역할은 줄어든다.

vs Qwen3.8-Max — 2.4T MoE 플래그십은 데이터센터 모델(API 전용, 공개된 보도 기준 토큰 100만 개당 약 $2/$6)이며 1M 컨텍스트와 비디오를 지원합니다. 27B는 배포 가능한 모델입니다. 둘은 서로 다른 질문에 답합니다.

비용: 로컬 대 API 문제, 해결됨

폐쇄형 모델의 경우 토큰당 가격을 비교합니다. 그리고 Qwen3.8 27B의 경우 자체 하드웨어에서 추가 토큰 비용은 없습니다 — 실제 비용은 초기 GPU와 시간입니다. 4비트에서는 24GB 카드이고, BF16에서는 80GB급 머신입니다. 모델을 평가하기만 하면 되거나 하드웨어가 없다면 호스팅 경로가 있습니다: OrcaRouter는 현재 다음을 나열합니다: Qwen3.8 27B와 함께 무료이며 요청이 제한된 티어가 제공됩니다. 이 티어는 $0를 청구하고 한도를 초과하면 HTTP 429를 반환합니다. 또한 유료 티어는 입력 100만 토큰당 $0.33, 출력 100만 토큰당 $2.40입니다(8월 15일 확인). Qwe​n Cloud의 호스팅 버전은 1M 컨텍스트를 지원하며 "곧 출시 예정"으로 표시되어 있습니다.

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

솔직한 관점에서 보면, 오픈 가중치 모델에서 제공자는 편의일 뿐 의존성이 아닙니다. 무료 티어는 55.6GB 다운로드가 가치 있는지 판단할 수 있는 가장 저렴한 방법입니다. 하지만 일단 결정을 내리면, 핵심은 가중치이며 — 그것은 무료입니다.

실제로 시도하는 방법

가장 빠른 평가 — 요청이 제한된 무료 호스팅 티어를 사용해 보세요. 원하는 답을 얻을 수 있다면 그걸로 끝이며 비용은 들지 않습니다.

하드웨어에서 실제 테스트 — 커뮤니티 GGUF를 다운로드하고 (Q4_K_M 빌드는 약 17GB이며 24GB 카드에 맞습니다) llama.cpp 또는 Ollama에서 실행하세요. Jinja 채팅 템플릿을 전달하거나 모델이 thought 태그로 답변합니다. GGUF에서 비전을 사용하려면 별도의 mmproj 파일도 필요합니다. 저희 런북은 Qwen3.8 27B를 로컬에서 실행하는 방법을 안내합니다.

완전 정밀도 — 80 GB급 GPU에 huggingface-cli download Qwen/Qwen3.8-27B를 실행합니다.

다운로드한 항목을 검증하세요 — 게시자가 Qwe​n org인지 확인하고 crc32.txt와 대조하여 샤드를 검증하세요. 출시 전에 유사한 저장소가 나타났습니다.

이 리뷰가 틀린 경우 (그리고 Qwen3.8 27B를 건너뛰어야 하는 사람)

GPU가 없고 임대할 생각도 없습니다.무료 티어는 속도 제한이 있고 유료 티어는 백만 개당 $0.33/$2.40입니다. 소규모 API 모델이 더 저렴하고 안정적으로 서비스를 제공할 수 있습니다. 이 모델은 추론을 직접 소유하려는 사람들을 위한 것입니다.

SLA가 필요합니다. 호스팅 티어는 출시된 지 며칠밖에 안 됐습니다. 오늘 확인한 OrcaRouter 모델 페이지에는 지난 7일간 오류율 33.3%, p50 첫 토큰 지연 시간 225ms로 나와 있습니다. 이는 초기 부하를 겪는 새로운 모델이지 프로덕션 계약이 아닙니다. 자체 호스팅 사용자는 다운로드 커밋을 고정하고 폴백을 유지해야 합니다.

구매 결정에는 검증된 벤치마크가 필요합니다. 벤더가 보고한 수치는 방향성 참고만 될 뿐, 구매 결정의 근거로는 부족합니다. 독립적인 재현을 기다리십시오.

262K 오픈 가중치 컨텍스트로는 충분하지 않습니다. 1M 확장은 오늘은 호스팅 전용입니다.

처리량이 병목입니다. 대량 요약이나 대규모 배치는 성능에 악영향을 미칩니다: 이 모델은 dense 27B로 이전 모델보다 약 3배의 토큰을 소모합니다. 저비용 대량 처리에는 더 작거나 빠른 모델이 더 적합합니다.

12 GB 카드를 사용 중입니다. 2-bit GGUF는 품질 저하가 눈에 띄는 수준으로 간신히 들어가며, 이 모델은 적합하지 않습니다.

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

요점

Qwen3.8 27B는 오늘날 사용 가능한 가장 강력한 오픈 웨이트 27B 모델이며, Apache 2.0 하에서 영원히 무료입니다. 24GB 이상의 GPU를 보유하고 있고 에이전틱 코딩, 262K 컨텍스트, 그리고 종량제 청구 없이 기본 이미지/비디오 입력을 원한다면, 이것이 구매할 가치가 있습니다. 보류해야 할 이유도 마찬가지로 구체적입니다: 독립적인 벤치마크 확인, SLA, 262K를 초과하는 오픈 웨이트 컨텍스트, 또는 dense 27B가 제공하는 것보다 더 높은 처리량이 필요하다면 말이죠. 모델은 출시되었고, 가중치는 실제이며, 수치는 좋습니다 — 단, 그 수치가 누구의 것인지 기억하세요.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube