Qwen3.8-27B와 Unsloth가 표시된 히어로 타이틀 카드, '로컬에서 실행, 양자화 또는 파인튜닝'이라는 부제, 터미널 창 아이콘, 그리고 'UD-Q4_K_XL 17.9GB' 및 'Studio no-config'라고 적힌 칩들.
Guides & Insights

Qwen3.8-27B with Unsloth: 로컬에서 실행, 양자화 또는 미세 조정하기

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

네 — Unsloth는 Qwen3.8 27B를 실행하며, Alibaba의 새로운 Apache-2.0 모델을 여러분의 GPU에 올리는 가장 빠른 방법입니다. 한 줄로 요약하자면: Unsloth Studio를 열고 "Qwen3.8 27B"를 검색한 다음, 다음을 선택하세요: UD-Q4_K_XL (17.9GB) — 24GB 카드에서 바로 실행할 수 있고, 1분 안에 채팅을 시작할 수 있습니다. 이 클릭 한 번 뒤에는 Unsloth가 모델 가중치가 공개된 바로 그 주(2026년 8월 13~14일)에 세 가지를 출시했습니다: 바로 unsloth/Qwen3.8-27B-GGUF팩(Unsloth Dynamic V3.0(프리뷰) 양자화 기반), Unsloth Studio 및 Desktop에서의 완전 지원, 그리고 v0.1.800-beta 출시입니다. 이 출시에는 GGUF 내보내기, imatrix 감지, VRAM 적합성 개선이 포함되어 있습니다. 또한 이 모델을 파인튜닝할 수도 있습니다. Unsloth는 훈련 속도가 2배 빠르고 VRAM 사용량이 70% 적다고 주장합니다. Qwen3.8 27B는 270억 개의 파라미터를 가진 덴스(dense) 구조의 비전-언어 모델로, 하이브리드 어텐션 덕분에 64개 레이어 중 16개만 풀 어텐션을 사용합니다. 그래서 대부분의 27B 모델이 실행되지 못하는 카드에서도 4비트 파일은 실행됩니다.

출처 관련: 모델 정보는 공식 자료로, Hugging Face의 Qwen3.8 27B 모델 카드에서 확인했으며 2026년 8월 15일에 검증했습니다. Unsloth 지원, 양자화 크기, VRAM 요구 사항 및 설치 명령은 같은 날짜의 Unsloth 릴리스 노트와 문서에서 가져왔습니다. API 가격은 같은 날짜의 OrcaRouter 카탈로그에서 실시간으로 확인했습니다. Unsloth의 "2배 빠른, VRAM 70% 절감" 및 "해당 크기 중 단연 가장 강력한 모델"이라는 문구는 공급업체의 주장이며, 독립적으로 재현된 결과가 아닙니다.

"Qwen3.8 + Unsloth"가 의미하는 것: 네 가지 서로 다른 것들

Unsloth는 서로 다른 네 가지 것들로, 키워드 검색 결과가 그것들을 혼동합니다. 어떤 것이 필요한지 아는 것이 설정의 절반입니다:

unsloth/Qwen3.8-27B-GGUF — Hugging Face의 양자화 가중치 파일들로, 21종의 퀀트와 비전 프로젝터를 포함합니다. Dynamic V3.0(프리뷰)로 빌드되었으며, 더 오래된 Dynamic 2.0(2025년 4월 24일 발표, 이 모델보다 이전 버전)이 아닙니다. 이것은 '파일 다운로드' 방식으로, 모든 llama.cpp 빌드에서 사용할 수 있습니다.

Unsloth Studio — Hugging Face Space에서 설치하거나 실행하는 브라우저 앱입니다. 모델 허브를 검색하고, 양자화 모델을 클릭하고, 도구와 대화하세요. 수동 템플릿이나 추론 매개변수 구성이 필요 없습니다.

Unsloth Desktop — macOS, Windows, Linux용 로컬 GUI 앱으로, Studio와 트레이닝을 포함합니다. 바로 이곳에서 "2× 더 빠르고 VRAM 70% 절감" 파인튜닝이 이루어집니다.

unsloth Python 라이브러리 — from unsloth import FastLanguageModel, 노트북과 스크립트에서 사용되는 QLoRA 파인튜닝 API입니다.

Unsloth의 v0.1.800-beta 릴리스 노트(제목: "Release Qwen3.8 27B")에 따르면 Qwen3.8 27B와 2.4T 파라미터 규모의 Qwen3.8-2.4T-A95B는 "이제 Unsloth에서 로컬로 실행할 수 있으며", 27B는 "Unsloth Dynamic GGUFs를 통해 17GB RAM에서 실행"되고, "Unsloth에서 Qwen3.8 27B를 파인튜닝할 수도 있다"고 설명합니다. 이번 릴리스에는 NVFP4 양자화 추가, GGUF 내보내기 전 디스크 공간 확인, Studio에서 실제 GGUF imatrix 지원 감지, 조정 가능한 VRAM 제한으로 GGUF 추론 속도를 최대 10% 향상시키는 기능도 포함되어 있습니다.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

퀀트는 감이 아니라 VRAM에 따라 선택하세요

Unsloth의 메모리 표는 총 RAM + VRAM(또는 통합 메모리)을 기준으로 하며, 이는 공식 지침입니다. 4비트 Qwen3.8 27B는 17–19GB가 필요하며, 24GB RTX 4090, RTX 5080 또는 24GB 통합 메모리 Mac이 편안한 4비트 구성을 위한 현실적인 최소 사양입니다. 거의 모든 사용자를 포괄하는 세 가지 선택은 다음과 같습니다:

12GB → UD-IQ2_XXS at 9.0GB — 전체가 들어맞는 유일한 파일입니다. 눈에 띄는 화질 손실이 예상되니, 이 선택을 인지하고 결정하십시오.

16GB → UD-Q3_K_XL at 13.4GB — Unsloth의 자체 선택기에 따르면 최고의 3비트 파일입니다.

24GB → 17.9GB의 UD-Q4_K_XL — 이 글에서 권장하는 4비트 파일이자 기본 답변입니다.

48–64GB → UD-Q8_K_XL (31.5GB) — 워크스테이션 또는 듀얼 GPU 구성에서 거의 무손실.

unsloth/Qwen3.8-27B-GGUF 파일 목록과 Unsloth 문서(둘 다 2026년 8월 15일 검증)에서 확인한 전체 래더: UD-Q8_K_XL 31.5GB, UD-Q6_K_XL 25.9GB, UD-Q5_K_XL 20.2GB, UD-Q4_K_XL 17.9GB, UD-Q3_K_XL 13.4GB, UD-Q2_K_XL 10.7GB, UD-IQ3_XXS 11.9GB, UD-IQ2_M 10.3GB, UD-IQ2_XXS 9.0GB. 표준 K-quants(Q4_K_M 17.1GB, Q8_0 29.0GB)도 포함되어 있으며, 팩에는 비전 프로젝터(mmproj-BF16, 931MB)가 포함되어 있어 로드만 하면 이미지와 동영상도 작동합니다. Unsloth는 전체 래더를 'Dynamic V3.0 (preview)'라고 부릅니다. 이는 이전 글들에서 볼 수 있는 Dynamic 2.0보다 최신 버전이며, Dynamic 2.0은 1년 이상 전에 출시된 모델을 위해 만들어진 것입니다.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

3분 만에 Unsloth로 실행하세요

원클릭 방법은 다음과 같습니다: macOS 또는 Linux에서는 curl -fsSL https://unsloth.ai/install.sh | sh를 실행한 다음, unsloth studio -p 8888을 실행하고 http://127.0.0.1:8888을 여세요. Windows에서는 irm https://unsloth.ai/install.ps1 | iex를 실행하세요. 완전히 설치 없이 사용하려면, Unsloth의 Studio가 Hugging Face Space로도 게시되어 있습니다. 브라우저에서 열고, "Qwen3.8 27B"를 검색한 다음, 보유한 메모리에 맞는 quant를 선택하세요. Studio는 샘플링 파라미터와 채팅 템플릿을 자동 조정하고, VRAM이 부족하면 RAM으로 오프로드하며, 멀티 GPU 구성을 감지합니다. 'no-config' 부분은 실제이며, 이번 주의 모델을 실행하는 가장 빠른 방법입니다.

파일 우선 경로는, 이미 llama.cpp를 사용 중이라면: quant 파일 하나를 다운로드하여 바로 실행하세요. 이것은 Unsloth 자체 명령어로, 해당 문서에서 검증되었습니다:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

그 샘플링 값들은 모델 카드가 권장하는 thinking-mode 설정입니다. 16GB 카드에서는 --include 글로브를 *UD-Q3_K_XL*로 교체하고, 비전이 필요하면 패키지의 mmproj-BF16.gguf를 가리키는 --mmproj를 추가하세요. 한 가지 주의할 점: llama.cpp는 최신 빌드여야 합니다. 그 파일은 새로운 qwen35 아키텍처를 등록하며, 출시 주 이전의 빌드는 이를 로드를 거부합니다.

Unsloth로 파인튜닝하세요.

파인튜닝은 Unsloth가 명성을 쌓는 분야입니다. 이 라이브러리는 기본 Transformers + PEFT 대비 2× 더 빠른 학습과 70% 더 적은 VRAM 사용을 주장하며, 이 덕분에 소비자용 그래픽 카드 한 장으로 27B 모델에 QLoRA를 적용할 수 있습니다. 파인튜닝의 진입점은 일반 unsloth/Qwen3.8-27B저장소(safetensors, 28B 파일 페이지)이며, GGUF 팩이 아닙니다. 이 모델에 적용된 표준 Unsloth QLoRA 패턴은 다음과 같습니다.

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

그런 다음 데이터셋에서 표준 trl.SFTTrainer 루프를 실행합니다. 해당 스니펫은 Unsloth 문서의 기본 QLoRA 패턴입니다. 학습 벤치마크 수치는 Unsloth 자체의 것이며 제가 재현한 결과가 아닙니다. 그리고 두 가지 주의사항이 적용됩니다. Unsloth의 커널은 텍스트 트랜스포머 레이어를 패치하므로 비전 인코더는 별도로 처리할 계획을 세워야 하며, 이 아키텍처는 나온 지 며칠 안 되었으므로 unsloth 패키지를 현재 릴리스로 유지해야 합니다. 버전이 일치하지 않으면 크게 실패합니다.

Unsloth Studio가 당신을 위해 처리해 주는 것

GGUF를 수동으로 실행한다는 것은 컨텍스트 크기, RAM 오프로드, 도구 호출 사이에서 줄타기를 하는 일입니다. Studio는 이를 기본값으로 단순화합니다: {{1}}실제로 사용 가능한 메모리를 기준으로 컨텍스트 크기를 정하고{{/1}}, {{2}}유휴 비전 모델을 언로드하여 채팅이나 학습을 위한 VRAM을 확보하며{{/2}}, {{3}}멀티 GPU 구성을 감지하고{{/3}}, {{4}}웹 검색, 코드 실행, 에이전트 연동(Claude Code, Codex, MCP)을 추가 설정 없이 구축해 줍니다{{/4}}. v0.1.800-beta 릴리스는 실제로 불편했던 부분도 개선했습니다: {{5}}GGUF 내보내기는 이제 긴 병합을 시작하기 전에 디스크 공간을 확인하여 중간에 실패하지 않습니다{{/5}}, {{6}}Studio는 내보내는 GGUF가 실제로 imatrix를 지원하는지 감지합니다(실행을 낭비하지 않도록){{/6}}, {{7}}메모리 가드는 더 이상 GPU 메모리를 과도하게 예약하지 않습니다{{/7}}. 사흘 된 모델에게 '설정 없음(no-config)'은 실질적인 역할을 하고 있습니다.

로컬 무료 vs API 유료: 솔직한 경제학

Unsloth와 API의 핵심 차이는 품질이 아니라 하드웨어를 누가 소유하느냐입니다. Unsloth는 무료 경로입니다: 토큰당 한계 비용이 0이고, 아무것도 기기를 떠나지 않으며, 속도 제한이 없고, 가중치를 완전히 제어할 수 있습니다. 절대적으로 무료인 것은 아닙니다: GPU와 전기를 직접 공급해야 하며, 12GB 카드의 2비트 파일은 타협된 경험입니다. Qwen3.8 27B는 밀집 모델이자 비전 기능을 갖추고 있어, 4비트는 컨텍스트 전에 가중치 17.9GB입니다. 그 머신이 입장료인 셈이죠.

API 경로가 존재하는 이유는 가중치가 Apache-2.0이기 때문이며, 따라서 누구나 거의 제로에 가까운 한계 비용으로 이를 호스팅할 수 있다. Qwen3.8 27B는 오늘 OrcaRouter의 카탈로그에 있으며, 다음과 같은 가격으로 입력 토큰 100만 개당 $0.33, 출력 토큰 100만 개당 $2.40, 자체 인프라에서 셀프 호스팅되는 모델로 제공된다 — 전가할 공급업체 가격이 없음 — 262K-토큰 컨텍스트 창과 텍스트, 이미지, 비디오 입력을 지원한다. 가중치가 개방되어 있으므로 요청당 $0를 청구하는 속도 제한 무료 티어도 있다. 70% 입력 비중의 대표적인 월 1,000만 토큰 사용량은 유료 티어에서 약 $9.51이다. 이미 24GB 카드를 보유하고 있다면 로컬 실행이 비용 면에서 유리하다. 그렇지 않다면 그 요율로 토큰을 임대하는 것이 사이드 프로젝트용 카드를 구매하는 것보다 낫고, 무료 티어는 하드웨어를 구매하기 전에 모델을 테스트할 수 있는 정직한 방법이다.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Unsloth가 정답이 아닐 때

Unsloth Studio와 GGUF 팩은 단일 머신에 적합한 선택입니다. 그러나 다음과 같은 경우에는 잘못된 선택입니다:

당신은 Blackwell RTX 50 시리즈 카드를 보유하고 있습니다. unsloth/Qwen3.8-27B-NVFP4 양자화 모델은 동일한 VRAM에서 BF16보다 약 1.5배 빠르며, 더 긴 컨텍스트를 위해 FP8 KV 캐시를 사용합니다. 이 경로는 vLLM 또는 SGLang을 통해 실행되며, GGUF도 아니고 Studio도 아닙니다.

프로덕션 환경에서는 전체 262K 네이티브 윈도우 또는 1M YaRN 확장이 필요합니다.긴 컨텍스트에서의 덴스 비전 모델은 무겁습니다. Unsloth의 컨텍스트 크기 조정은 더 짧은 컨텍스트로도 잘 실행해 주지만, 적절한 KV 관리를 갖춘 서빙 스택이 로컬 앱보다 우수합니다.

많은 사용자에게 서비스를 제공하고 있습니다. Unsloth는 로컬 앱이자 파인튜닝 라이브러리로, 멀티 테넌트 서버가 아닙니다. 동시성, 자동 확장, 업타임 보장이 필요하다면 호스팅된 엔드포인트를 사용하는 것이 좋습니다.

GPU가 전혀 없습니다. 솔직한 답변: 12GB 카드에서 2비트 27B 모델은 제대로 서빙된 같은 모델보다 눈에 띄게 나쁩니다. 먼저 무료 API 티어를 사용해 보세요. 그것으로 충분하다면, 사용 사례가 입증되었을 때 하드웨어를 구매하세요.

비전 쪽을 미세 조정하고 싶으시군요. Unsloth의 속도 향상은 텍스트 트랜스포머 레이어를 대상으로 하며, 전체 멀티모달 미세 조정에는 다른 스택이 필요합니다.

결론

Qwen3.8 27B와 Unsloth는 이번 주부터 해결된 문제입니다. Studio를 설치하고, 24GB 카드에는 UD-Q4_K_XL(16GB에는 UD-Q3_K_XL, 12GB에는 UD-IQ2_XXS)을 선택하면 구성 설정 없이, 토큰당 과금 없이 모델이 실행됩니다. 파인튜닝 경로는 실제로 가능하며, Unsloth의 속도 주장 덕분에 27B QLoRA를 단일 카드에서 실용적으로 사용할 수 있습니다. 양자화 계층이 예전 기사들이 설명하는 Dynamic 2.0이 아니라 Dynamic V3.0(프리뷰)임을 알아두세요. llama.cpp를 최신 상태로 유지하고, 하드웨어를 소유하지 않은 경우 동일한 가중치가 무료 사용량 제한 티어가 있는 $0.33/$2.40 API로 제공되므로, 마음에 들지 않는 2비트 파일을 실행할 이유가 없습니다. 로컬 실행은 무료 경로이며, 이 가중치 등급에서 처음으로 쉬운 경로이기도 합니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube