
Qwen3.8-27B GGUF: GPU에 어떤 Quant를 다운로드할까요?
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
unsloth/Qwen3.8-27B-GGUF 팩을 다운로드하고, 실제로 보유한 그래픽 카드에 맞는 파일을 선택하세요. 그것이 답의 전부입니다. 24GB GPU(RTX 4090 또는 3090)는 17.1GB의 Q4_K_M을 선택해야 하고, 16GB GPU는 15.7GB의 IQ4_XS를 선택해야 합니다(컨텍스트 여유를 원한다면 13.8GB의 Q3_K_M도 가능). 12GB GPU는 2비트 파일로 제한되어 9.0GB의 UD-IQ2_XXS를 선택해야 하는데, 이는 충분히 인지하고 감수해야 할 절충입니다. Qwen3.8 27B — Alibaba의 270억 파라미터 밀집 모델, 2026년 8월 13~14일에 공개된 Apache 2.0 가중치 — 하이브리드 어텐션이 64개 레이어 중 16개만 캐시하기 때문에 로컬에서 이례적으로 저렴하게 실행됩니다. 따라서 24GB GPU의 4비트 양자화는 32K~64K 토큰의 컨텍스트를 무리 없이 처리합니다. 그리고 GGUF는 한계 비용이 0인 유일한 경로입니다. API 키가 필요 없고, 토큰당 비용이 없으며, 데이터가 기기를 떠나지 않습니다.
출처 관련: 아키텍처, 컨텍스트 윈도우, 라이선스는 Hugging Face의 Qwen3.8 27B 모델 카드에 기재된 공식 정보로, 2026년 8월 15일에 확인했습니다. GGUF 크기는 같은 날짜의 unsloth 및 ggml-org GGUF 저장소에서 가져온 것입니다. GPU당 VRAM 안내는 unsloth의 공식 권장 사항입니다. KV-캐시 바이트 추정치와 초당 토큰 수치는 출시 후 첫 며칠간 커뮤니티에서 측정한 값이며, 공급업체 사양이 아닙니다. 아래에 언급된 모든 벤치마크는 Alibaba가 보고한 것으로, 재현된 바 없습니다.
파일 선택기, 퀀트당 한 줄
• UD-IQ2_XXS — 9.0GB — 12GB 카드에 딱 맞는 유일한 용량이며, 눈에 띄는 품질 저하가 예상됩니다.
• UD-Q2_K_XL — 10.7GB — 12GB 카드, 남는 컨텍스트가 거의 없음.
• Q3_K_M — 13.8GB — 컨텍스트 여유 공간을 원하는 16GB 카드용.
• IQ4_XS — 15.7GB — 16GB 카드에 온전히 들어맞는 가장 큰 양자화입니다.
• Q4_K_M — 17.1GB — 24GB 카드에 최적이며, 이 문서가 추천하는 파일입니다.
• Q5_K_M — 19.8GB — 24GB, 컨텍스트 여유 공간을 희생하는 대신 약간의 품질 향상을 얻습니다.
• Q6_K — 22.9GB — 조이면 24GB에 맞음; 거의 무손실.
• Q8_0 — 29.0GB — 32GB, 2-카드 분할 또는 CPU 오프로드.
• BF16 — 54.7GB — 서버 카드 및 RAM 집약적 CPU 설정; 참조 정밀도.
두 가지 팩, 두 가지 Q4_K_M 크기: unsloth의 것은 17.1GB, ggml-org의 것은 19.0GB입니다. unsloth 팩은 UD-* 파일에 Dynamic V3.0(프리뷰) 양자화를 사용하며 대부분의 로컬 앱이 기본으로 선택하는 버전입니다. ggml-org 팩은 표준 K-퀀트와 함께 추측 디코딩에 사용되는 별도의 다중 토큰 예측 헤드를 포함합니다. 어느 Q4_K_M을 사용해도 작동합니다. 차이는 수백 메가바이트와 MTP 파일뿐입니다.

왜 이 27B는 대부분보다 작은 카드에 들어맞나
Qwen3.8 27B는 64개의 레이어를 가지고 있지만, 오직 16개만 전체 어텐션(full attention)을 사용합니다. 나머지 48개는 Gated DeltaNet 선형 어텐션을 사용하며, 이는 계속 증가하는 키-값 캐시 대신 고정 크기의 순환 상태(recurrent state)를 유지합니다. 모델 카드의 블록 배치는 (Gated Attention → FFN) 1개당 (Gated DeltaNet → FFN) 3개, 즉 3:1 하이브리드 비율입니다. 실제 효과: KV 캐시는 동일한 컨텍스트에서 기존 27B 밀집(dense) 모델이 필요로 하는 용량의 약 4분의 1에 불과합니다. 이번 주 커뮤니티 측정 결과에 따르면 캐시는 8K 컨텍스트에서 약 0.5GB, 32K에서 2.0GB, 전체 262K 네이티브 윈도우에서 16.4GB입니다. 이는 일반적인 조언을 뒤집습니다. VRAM 예산의 대부분은 컨텍스트가 아닌 가중치(weights)에 사용되며, 24GB 카드는 64K–96K 컨텍스트에서 Q4_K_M을 부담 없이 실행할 수 있습니다. llama.cpp의 --cache-type-k 플래그를 사용하면 캐시 자체를 양자화하여 캐시를 더욱 줄일 수 있습니다.

첫날 발목을 잡을 세 가지 함정
• 이전 llama.cpp 빌드는 파일을 거부합니다.GGUF는 새로운 qwen35 아키텍처를 등록하므로 최신 빌드가 필요합니다. 출시 주 이전의 모든 빌드는 아키텍처 오류와 함께 이를 로드하지 않습니다. 다운로드하기 전에 먼저 llama.cpp를 업데이트하세요.
• 템플릿 함정.공식 Jinja 채팅 템플릿은 추론 트레이스가 비어 있어도 모든 어시스턴트 턴을 think 블록으로 감싸므로, 다중 턴 채팅에서 중첩된 블록과 잘린 기록이 생성됩니다. 마치 모델이 당신이 말한 내용을 잊은 것처럼 보입니다. llama.cpp를 --jinja와 함께 실행하고, 수정된 chat_template.jinja를 제공하는 팩을 선호하세요.
• Vision은 별도의 파일이 필요합니다. 텍스트는 기본적으로 동작합니다. 이미지와 비디오는 mmproj 프로젝터(약 0.9GB)도 로드하지 않으면 조용히 아무것도 하지 않습니다. 이 프로젝터는 unsloth의 GGUF 저장소 페이지에 나열되어 있지 않습니다. 기본 저장소나 ggml-org 팩에서 가져오세요. 문서나 스크린샷을 입력하려면 서버 명령에 --mmproj를 추가하세요.
명령어를 실행하세요.
llama.cpp, 최신 빌드가 있으면:
llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0
...그리고 비전이 필요하면 --mmproj Qwen3.8-27B-mmproj-bf16.gguf를 추가하세요.
Ollama, 라이브러리 항목을 원한다면: ollama pull qwen3.8:27b, 그 다음에 ollama run qwen3.8:27b. LM Studio와 Unsloth Desktop은 채팅 템플릿과 RAM 오프로딩을 자동으로 인식합니다 — 처음 실행할 때 가장 번거로움이 적은 경로입니다.
로컬 vs API: 정직한 경제학
GGUF는 무료 경로입니다: 한계 비용이 0이고, 속도 제한이 없으며, 어떤 것도 기기를 떠나지 않습니다. 절대적 비용 측면에서는 저렴한 경로가 아닙니다 — 24GB GPU(중고 RTX 3090 또는 새 RTX 4090, 그리고 전기 요금)를 직접 준비해야 하며, 12GB 카드에서의 2비트 파일은 타협된 경험에 불과합니다.
API 라우트가 존재하는 이유는 가중치가 Apache 2.0 라이선스이기 때문이며, 서빙의 한계 비용이 거의 0에 가까워 누구나 호스팅할 수 있습니다. Qwen3.8 27B는 오늘부터 OrcaRouter에서 입력 토큰 100만 개당 $0.33, 출력 토큰 100만 개당 $2.40으로 제공됩니다. 이는 공급업체 목록 가격을 마크업 없이 그대로 적용한 가격이며, 가중치가 공개되어 있기 때문에 요청당 $0를 청구하고 한도 초과 시 HTTP 429를 반환하는 속도 제한 무료 티어도 있습니다. 입력 비중 70%로 월 1,000만 토큰을 사용하는 대표적인 경우, 유료 티어 기준 약 $9.51이 청구됩니다. 이미 GPU를 보유하고 있다면 로컬 실행이 비용 면에서 유리하며, GPU가 없다면 사이드 프로젝트를 위해 그래픽 카드를 구매하는 것보다 토큰을 임대하는 편이 낫습니다.

이 추천이 잘못된 경우
24GB에서의 Q4_K_M은 기본값이지 보편적인 답은 아닙니다. 다른 것을 선택해야 할 때:
• 서버나 워크스테이션에서 최고 품질이 필요합니다 — Q8_0(29GB) 또는 BF16(54.7GB)을 CPU 및 RAM 오프로드와 함께 사용하세요. 4비트 파일이 아닙니다.
• Blackwell RTX 50 시리즈 카드를 사용 중입니다 — NVFP4 변형은 동일한 24GB VRAM에서 약 1.5배 더 빠르며 더 긴 컨텍스트를 위해 FP8 KV 캐시를 사용합니다. 5090에서 NVFP4는 이 모델의 어떤 GGUF보다도 뛰어납니다.
• 전체 262K 컨텍스트가 필요합니다 — 가중치에 더해 약 16GB 캐시를 예산으로 잡아야 하며, 이는 24GB 카드를 Q3_K_M으로 낮추거나 KV 양자화를 강제합니다.
• 추측 디코딩에 의존한다면 — ggml-org 팩을 선택하세요. 이 팩은 다중 토큰 예측 헤드를 유지하며, 일부 양자화 팩은 약 0.5GB를 절약하기 위해 이를 제거합니다.
• 12GB뿐입니다 — 솔직한 답변: 2비트 27B는 제대로 서빙되는 같은 모델보다 눈에 띄게 나쁩니다. 로컬 2비트 설정을 시작하기 전에 무료 API 티어를 먼저 사용해 보세요. 충분하다면 하드웨어가 따라올 때까지 GGUF는 기다려도 됩니다.
결론
Qwen3.8 27B는 24GB 카드에 타협 없이 들어맞는 보기 드문 27B 모델입니다: 17.1GB Q4_K_M 다운로드, 최신 llama.cpp 빌드, 그리고 긴 컨텍스트 비용이 거의 들지 않을 만큼 저렴한 KV 캐시를 갖추고 있습니다. 하드웨어를 소유하고 있다면 그 파일을 다운로드하세요. 비전 기능에는 별도의 mmproj가 필요하다는 점을 기억하고, 멀티턴 대화가 기억을 잃은 것처럼 보이는 첫 순간에 템플릿 함정을 예상하세요. 하드웨어를 소유하지 않았다면, 동일한 모델은 무료 속도 제한 티어가 포함된 $0.33/$2.40 API로 제공되므로, 만족스럽지 않은 2비트 파일을 실행할 이유가 없습니다. GGUF는 무료 경로입니다. 다만 더 이상 유일한 경로는 아닐 뿐입니다.
