
Hugging Face의 Qwen3.8-27B: 공식 저장소, 내부 구성, 다운로드 방법
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 100만 토큰당 · 22 tok/s
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1349 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 284 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
Qwen3.8 27B는 Hugging Face의 Qwen/Qwen3.8-27B에 있으며, Qwen 조직이 2026년 8월 14일에 Apache 2.0 라이선스로 게시했습니다. 저장소에는 18개의 샤드에 걸쳐 55.6GB의 BF16 safetensors가 있으며, 그와 함께 제공되는 토크나이저, 채팅 템플릿, 설정도 포함되어 있습니다. 무료로 다운로드할 수 있고 상업적으로도 무료로 사용할 수 있으며 토큰당 요금도 없습니다. 사람들이 흔히 혼동하는 두 가지가 있습니다. 공식 저장소에는 safetensors만 포함되어 있고, 소비자용 GPU에서 실행하는 GGUF 양자화 파일은 별도의 커뮤니티 저장소에 있습니다. 또한 출시 전에 유사한 저장소가 나타났으므로 Qwen 조직의 복사본만 진짜입니다. 이 글은 다운로드 안내입니다. 저장소에 무엇이 있는지, 다운로드하는 세 가지 방법, 그리고 진짜 가중치를 받았는지 확인하는 방법을 다룹니다.
빠른 사실들, 2026년 8월 15일 확인됨
• 저장소 — Qwen/Qwen3.8-27B는 Hugging Face에 있으며, Qwen 조직이 게시했고, 미러링: Qwen/Qwen3.8-27B ModelScope에서.
• 출시됨 — 가중치는 2026년 8월 14일에 공개되었으며, 시간대에 따라 8월 13일로 표기된 보도도 있다. 직전 주의 사전 공개 기사에서는 출시 대기 중인 것으로 보도되었다.
• 라이선스 — Apache 2.0: 다운로드, 수정, 재배포가 가능하며 상업적 사용도 포함됩니다.
• 크기 — 18개 샤드에 걸친 safetensors 총 55.57 GB(샤드당 2.1~3.99 GB)이며, 저장소 페이지에서는 총합을 55.6 GB로 반올림해 표시합니다.
• 모델 — 27B 밀집 매개변수 (비전 인코더를 포함하면 28B), 64개 레이어, 은닉 크기 5,120, 어휘 248,320.
• 어텐션 — 하이브리드: 16개의 전체 게이트 어텐션 레이어에 맞서 48개의 게이트 델타넷(선형 어텐션) 레이어로 구성되며, 멀티 토큰 예측으로 학습되었습니다. 3:1 비율 덕분에 262,144개의 네이티브 컨텍스트 토큰이 27B에서 실행됩니다.
• 컨텍스트 — 기본적으로 262,144개의 토큰, YaRN RoPE 스케일링을 통해 1,000,000개까지 확장 가능.
• 입력 — 텍스트와 함께 네이티브 이미지 및 비디오를 지원하며, 텍스트를 반환합니다.
• Signal — 모델 카드의 최근 30일 다운로드 카운터 기준 91,917회 (2026년 8월 15일 확인).
위의 모든 수치는 Hugging Face 모델 페이지, 저장소 트리, 및 Qwen3.8 27B의 구성에서 가져온 것으로, 2026년 8월 15일에 읽었습니다. 카드에 있는 벤치마크 주장(SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3)은 Alibaba가 보고한 것이며, 현재까지 독립적인 연구소에서 재현하지 못했습니다.
다운로드해야 하는 이유: 로컬 대 API 문제
오픈 가중치는 토큰 하나를 실행하는 데 드는 한계 비용이 전기 요금뿐인 유일한 모델 범주입니다. 라이선스 비용도, 토큰당 가격도, 속도 제한도 없으며, 어떤 것도 사용자의 머신 밖으로 나가지 않습니다. Qwen3.8 27B는 Apache 2.0이므로, 이러한 자유는 영구적입니다: Alibaba는 가중치를 회수하거나, 라이선스를 변경하거나, 비용을 청구할 수 없습니다.
그 대가는 하드웨어와 설정입니다. 전체 BF16 가중치는 기본 정밀도에서 80GB급 GPU를 요구하며, 55.6GB는 상당한 다운로드입니다. 그렇게 하기 전에 모델을 평가하고 싶다면, API 경로가 더 빠릅니다: Qwen3.8 27B는 OrcaRouter에서 제공되며, Qwen의 입력 100만 토큰당 $0.33, 출력 100만 토큰당 $2.40 요금이 마크업 없이 그대로 적용됩니다. — 또한 OrcaRouter는 같은 모델에 대해 속도가 제한된 무료 티어도 제공하므로, 비용 없이 간단히 테스트하려면 다운로드가 전혀 필요 없습니다. 하지만 API는 편의일 뿐 의존성이 아닙니다. 가중치가 제품이며, 그것들은 무료입니다.
저장소에 실제로 무엇이 있나요?
이 리포지토리는 단순한 가중치가 아닙니다. Transformers, vLLM, SGLang이 필요로 하는 메타데이터 파일과 18개의 샤드를 포함한 완전히 실행 가능한 패키지입니다. 위에서 아래로 살펴보면:
• model-00001-of-00018.safetensors … model-00018-of-00018.safetensors — 가중치, 샤드당 2.1–3.99 GB, 총 55.57 GB.
• model.safetensors.index.json — 모든 텐서를 해당 샤드에 매핑하며, 로더가 가장 먼저 읽는 파일입니다.
• config.json — 아키텍처: 64개 레이어, hidden size 5,120, vocabulary 248,320, Gated DeltaNet / Gated Attention 레이아웃.
• tokenizer.json (12.8 MB), tokenizer_config.json, vocab.json (6.72 MB), merges.txt (3.35 MB) — 토크나이저.
• chat_template.jinja — 생각 블록을 포함한 채팅 템플릿입니다. llama.cpp는 이를 jinja 템플릿으로 전달해야 합니다. 그렇지 않으면 모델이 생각 태그로 답변합니다.
• preprocessor_config.json 및 video_preprocessor_config.json — 이미지 및 비디오 전처리.
• crc32.txt — 샤드별 체크섬; 이를 통해 다운로드를 검증하면 손상된 전송이 더 이상 미스터리가 아닙니다.
• README.md (65 kB 모델 카드), LICENSE (Apache 2.0), generation_config.json, .gitattributes (가중치 파일을 Git LFS로 표시).

이 레이아웃의 한 가지 결과는 아래의 가짜 리포지토리 문제와 관련이 있습니다. 이 리포지토리의 진짜 사본은 무겁고 완전합니다. 이름에 "Qwen3.8"이 들어 있고 README만 있는 자리 표시자 리포지토리는 실패한 다운로드가 아니라, 다른 빈 리포지토리입니다.
다운로드하는 방법 — 세 가지
방법 1, huggingface-cli, 가장 깔끔한 방법입니다. 모델이 공개되어 있어 로그인이 필요 없습니다. 이 명령은 18개의 샤드와 메타데이터를 폴더로 가져옵니다:
huggingface-cli를 사용하여 Qwen/Qwen3.8-27B를 --local-dir Qwen3.8-27B로 다운로드하세요.
55.6 GB 전송의 경우, hf_transfer 백엔드를 설치할 가치가 있습니다 — 다운로드를 병렬화하여 시간을 대폭 줄여줍니다:
pip install hf_transfer
HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B
두 번째 방법은 git clone으로, 저장소를 히스토리가 포함된 작업 복사본으로 가져옵니다. Git LFS가 필요합니다:
git lfs install
git clone https://huggingface.co/Qwen/Qwen3.8-27B
방법 3, 브라우저 — Files 탭을 열고 샤드를 개별적으로 다운로드하세요. 파일 하나만 필요할 때만 합리적입니다(예를 들어 아키텍처를 확인하기 위해 config.json만 필요한 경우). 전체 저장소의 경우 수동 다운로드 18회와 체크섬 확인까지 필요하므로 CLI를 사용하세요.

실제로 다운로드해야 하는 파일
공식 저장소는 BF16 safetensors입니다 — 전체 정밀도, 55.6 GB — 80GB급 GPU를 보유했거나 나중에 직접 양자화를 원한다면 적합한 아티팩트입니다. 공식 GGUF는 없습니다. 소비자용 카드에서 실제로 실행되는 GGUF 빌드는 커뮤니티 릴리스입니다. Hugging Face에는 이 베이스에서 빌드된 303개의 양자화 모델이 나열되어 있으며(2026년 8월 15일 기준), 런북이 가리키는 빌드는 unsloth 및 lmstudio-community 빌드입니다. 대략적인 단계는 다음과 같습니다:
• BF16 safetensors — 55.6GB, 네이티브 정밀도 기준 80GB급 GPU가 필요합니다.
• GGUF Q8_0 — 약 29GB, 48GB 카드에 들어갑니다.
• GGUF Q4_K_M — 약 17GB, 24GB 카드의 표준 선택.
• GGUF 2-bit — 약 9GB로, 12GB 카드에 간신히 들어가지만 품질 저하가 눈에 띕니다.
GGUF 빌드에서 비전을 사용하려면 각 커뮤니티 카드에 문서화된 비전 인코더용 별도 mmproj 파일도 필요합니다. 전체 양자화 및 런타임 분석—llama.cpp 채팅 템플릿 주의사항 포함—에 대한 자세한 내용은 Qwen3.8 27B를 로컬에서 실행하는 런북에서 확인할 수 있습니다.
진짜 레포와 가짜를 구별하는 방법
가중치가 공개되기 전, Hugging Face 검색에는 가중치 파일이 없는 "Qwen3.8" 저장소가 가득했습니다. 일찍 검색하는 사람들을 잡기 위해 세워둔 플레이스홀더 카드와 포크들이었죠. 일부는 아직도 남아 있습니다. 검증 체크리스트:
• 이름이 아니라 게시자를 확인하세요. 진짜 저장소는 Qwen 조직 아래에 있습니다: Qwen/Qwen3.8-27B. 다른 계정에 있는 Qwen3.8 27B라는 이름의 저장소는 아무리 전문적으로 보여도 공식 릴리스가 아닙니다.
• 공식 컬렉션을 사용하세요. Qwen은 huggingface.co/collections/Qwen/qwen38을 관리하며, 그 안의 모든 저장소는 Qwen의 것입니다.
• 라이선스 필드를 확인하세요. 실제 카드에는 Apache 2.0이라고 표시되어 있습니다.
• 크기와 모양을 확인하세요. 실제 리포지토리에는 총 약 55.6GB에 달하는 18개의 safetensors 샤드, crc32.txt 체크섬 파일, 그리고 65kB README가 있습니다. 가중치 파일이 0개라는 것은 리포지토리가 비어 있다는 뜻이지, 다운로드가 실패한 것이 아닙니다.
• 다운로드 횟수를 증거가 아닌 신호로 취급하세요. 진짜 저장소는 하루 만에 91,000회 다운로드를 돌파했는데, 이는 다른 모든 사람들이 어디를 가리키는지 알려줍니다. 하지만 가짜도 다운로드될 수 있습니다. 게시자가 보증입니다.
다운로드 후 무결성을 검증하세요: 각 샤드의 CRC32를 crc32.txt와 대조하거나, Transformers로 모델을 로드하여 state dict가 경고 없이 로드되는지 확인하세요. 그러면 손상된 전송과 잘못된 모델로 재포장된 경우를 모두 잡아낼 수 있습니다.
다운로드가 잘못된 선택일 때
55.6GB를 다운로드하는 것이 모든 사람에게 올바른 선택은 아니며, 이 기사의 솔직한 버전은 그 점을 분명히 밝히고 있다.
모델을 평가하고 싶을 뿐입니다. API 라우트가 더 빠릅니다. 구조화된 테스트는 몇 센트밖에 안 들고 몇 분밖에 걸리지 않지만, 다운로드와 설정은 오후 내내 걸립니다.
80GB에 가까운 GPU가 없습니다. BF16 다운로드는 당신에게 맞는 파일이 아닙니다. GGUF 양자화 버전이나 API를 선택하세요.
검증된 벤치마크가 필요합니다.모든 주요 수치는 Qwen3.8 27B에 대한 것으로, 2026년 8월 15일 기준 Alibaba가 보고한 것입니다. 만약 여러분의 결정이 독립 연구소가 재현한 수치에 의존한다면, 그 수치가 나올 때까지 기다리세요 — 가중치는 여전히 여기에 있을 것입니다.
며칠 전에 나온 모델을 기반으로 작업하고 있습니다. 가중치는 8월 14일에 배포되었습니다. 오늘 기준으로 OrcaRouter의 모델 페이지를 보면 지난 7일간 오류율이 33.3%이고, p50 첫 토큰 지연 시간은 225ms입니다. 초기 부하를 받고 있는 신생 모델이므로 초기 텔레메트리는 잠정적인 수치로 간주하세요. 자체 호스팅 사용자는 다운로드한 커밋을 고정하고 폴백을 유지해야 하며, API 사용자도 동일한 보험 차원에서 페일오버 규칙을 유지해야 합니다.

지원 계약이 필요합니다. Apache 2.0은 관대한 라이선스이지만, 라이선스는 SLA가 아닙니다. 워크로드에 벤더 지원이 필요하다면 호스팅 API 방식이 더 안전한 선택입니다.
요점
진짜 Qwen3.8 27B는 Hugging Face의 Qwen/Qwen3.8-27B에 있으며, Apache 2.0, 2026년 8월 14일 출시, 18개 샤드로 분할된 55.6GB BF16 safetensors입니다. huggingface-cli 또는 git clone으로 다운로드하고, 게시자가 Qwen 조직인지 확인하면 아무도 빼앗거나 청구할 수 없는 최첨단 오픈 가중치 27B 모델을 갖게 됩니다. 그것이 사용 사례에 필요한 것보다 더 큰 노력이라면, 같은 모델을 API를 통해 몇 센트만 내면 이용할 수 있습니다. 하지만 핵심은 가중치입니다. 그리고 그것들은 무료입니다.
