Ollama의 Qwen3.8-27B 기사용 타이틀 카드로, 'ollama run qwen3.8:27b' 명령어와 깜빡이는 커서가 있는 미니멀한 터미널 창, '18 GB 다운로드', 'Q4_K_M 기본값', '262K 컨텍스트'라고 쓰인 세 개의 배지, 그리고 '무료 실행, 당신의 하드웨어'라는 캡션이 표시되어 있다.
Guides & Insights

Qwen3.8-27B on Ollama: 명령 하나, 네 가지 Quants, 그리고 "무료"의 실제 비용

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

한 가지 명령으로 실행하세요: ollama run qwen3.8:27b. 이 페이지가 다루는 질문에 대한 답은 이것이 전부입니다. Qwen3.8 27B — Ali​baba의 270억 파라미터 밀집 모델(가중치는 2026년 8월 14일 Apache 2.0 라이선스로 공개됨) — 이번 주 Ollama 라이브러리에 등록되었으며, 기본 빌드는 이미 합리적인 18GB Q4_K_M 양자화 버전(가중치 17GB + 비전 인코더 931MB)입니다. 일반적인 컨텍스트 길이에서 24GB GPU로 완전히 실행되며, 카드가 더 작으면 CPU로 분할되고, 토큰당 비용은 없습니다.

여기의 모든 정보는 2026년 8월 15일 기준입니다. {{1}}사양은 Qwen3.8 27B 모델 카드에서 가져왔으며{{/1}}; {{2}}다운로드 크기, 태그 및 다운로드 횟수는 라이브 Ollama 라이브러리 페이지에서 가져왔습니다{{/2}}; {{3}}벤치마크 수치는 Ali​baba가 보고한 것으로 아직 독립적인 재현 결과가 없습니다{{/3}}. {{4}}모델은 며칠 전에 출시되었으므로{{/4}}, 변경될 수 있는 모든 사항은 잠정적인 것으로 간주하세요.

실제로 작동하는 원라이너

이미 Ollama를 설치했다면, 두 단어만 입력하면 됩니다:

ollama run qwen3.8:27b

Ollama 지원이 v0.32.12에서 추가되었습니다. 릴리스 노트에는 "이번 릴리스는 Qwe​n 3.8 27B의 지원을 추가합니다."라고 간단히 적혀 있습니다. 첫 실행 시 기본 빌드(약 18GB, Q4_K_M)를 다운로드한 다음, thinking 모드가 기본으로 켜진 채 채팅 REPL로 안내합니다. 라이브러리 페이지에는 해당 빌드가 "vision tools thinking 27b"라는 기능 태그와 함께 표시되는데, 이를 통해 비전 및 도구 호출 경로가 동일한 다운로드에 연결되어 있음을 알 수 있습니다. 이 글을 작성하는 시점 기준으로 페이지에는 40,000회 이상의 다운로드와 이미 11개 변형에 이르는 태그 목록이 표시됩니다.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

실제로 손이 가게 될 두 가지 변형:

• ollama run qwen3.8:27b-mlx — Apple Silicon용 빌드로, 동일한 18GB 용량이지만 Metal용으로 컴파일되었습니다. Ollama의 릴리스 노트에서 '반복 작업과 코딩 에이전트에 적합한 최대 성능과 출력 품질'을 위해 특별히 최적화한 버전입니다.

• ollama run qwen3.8:27b-q8_0 — VRAM이 충분하고 가중치를 full precision에 더 가깝게 유지하고 싶을 때 사용하는 30GB 8-bit 양자화 버전입니다.

당신이 실제로 다운로드하고 있는 것

이름은 27B라고 되어 있지만, 전체 파라미터 수는 28B입니다: 27.3B 밀집 언어 모델에 461M 비전 인코더가 더해져 기본적으로 이미지와 비디오 입력을 지원합니다. 나머지 주요 사양은 모델 카드에서 그대로 가져온 것입니다:

• 64개 레이어, 히든 크기 5,120, 어휘 크기 248,320.

하이브리드 어텐션: 전체 Gated Attention 레이어 16개와 선형 Gated DeltaNet 레이어 48개 — 3:1의 린-선형 혼합 구조로, 27B 모델이 KV 캐시가 데이터센터 전체를 소비하지 않으면서 262,144토큰의 네이티브 컨텍스트(1M까지 확장 가능)를 유지할 수 있는 이유입니다.

• 네이티브 이미지 및 비디오 이해 — "STEM 다이어그램과 문서부터 시간 단위의 비디오까지"는 Ali​baba의 표현입니다.

• Apache 2.0. 다운로드하고, 수정하고, 이를 기반으로 제품을 판매하세요. 그 라이선스는 이 글의 나머지 경제적 논리가 의존하는 법적 사실입니다.

완전 정밀도 기준은 BF16이며, 이것이 56 GB 태그가 존재하는 이유입니다. 더 작은 태그는 모두 정밀도를 희생하고 용량을 줄이는 트레이드오프이며, 모델 카드의 자체 벤치마크가 바로 여러분이 그 대가로 맞바꾸는 대상입니다.

퀀트를 먼저 고르고, 그다음에 VRAM을 확인하세요. 그 반대가 아닙니다.

Ollama는 11개의 태그를 제공하지만, 결정은 세 가지 크기로 귀결됩니다.

18 GB — Q4_K_M (기본값).일반 컨텍스트에서는 24GB 카드(RTX 4090 / 5090급)에 완전히 들어가며, 16GB 카드에서는 부분적인 CPU 오프로드로 실행 가능합니다 — 더 느리지만 작동합니다. 이것이 '그냥 실행'을 위한 빌드입니다.

30 GB — Q8_0. 가중치는 거의 완전한 정밀도에 가까우며, 전적으로 GPU에 유지하려면 약 40GB의 VRAM이 필요합니다. 27B 모델에서는 추가 정밀도에 비용을 지불하기 전에 그 이유를 이미 알고 계실 것입니다.

56 GB — BF16. 레퍼런스 빌드입니다. H100급 또는 96GB 하드웨어가 필요합니다. 소비자용 GPU에서 실행하는 사람은 아무도 없으며, 그건 괜찮습니다.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

사람들이 헷갈리는 숫자는 KV 캐시입니다. 18GB 다운로드가 262K 컨텍스트 세션에 18GB VRAM으로 충분하다는 뜻은 아닙니다. 긴 컨텍스트에서는 캐시가 가중치 위에 수 기가바이트를 추가로 차지하므로, 24GB 카드는 8K~32K 컨텍스트에서는 이 모델을 무리 없이 실행할 수 있지만 262K에서는 그렇지 않습니다. 용량이 빠듯한 카드에서는 양자화를 낮추지 말고 컨텍스트를 낮추세요.

Apple Silicon은 여기서 일급 대상입니다.

Ollama의 v0.32.12 릴리스 노트는 특히 macOS를 겨냥하고 있습니다. 구체적으로, `ollama run qwen3.8:27b-mlx`는 약 18GB의 통합 메모리가 필요하므로, 24GB 이상의 Mac은 GPU에서 컨텍스트 여유 공간까지 확보한 채 완전히 실행할 수 있습니다. 64~128GB 머신을 위한 32GB mxfp8 MLX 태그와 56GB mlx-bf16 태그도 있습니다. M-시리즈 Mac을 사용하면서 데스크톱 모델 소식을 지켜봐 왔다면, 이번 빌드가 바로 당신이 기다려 온 것입니다.

스펙 시트에는 262K, 운전석에서는 그보다 덜.

모델 카드에는 네이티브 토큰 262,144개가 나열되어 있고 1M까지 확장할 수 있으며, Ollama 라이브러리 페이지에서는 동일한 컨텍스트 창을 256K로 보고합니다. 둘 다 사실입니다. 262,144는 256K × 1024니까요. 하지만 어느 쪽도 24GB 카드에서 --num-ctx에 그 숫자를 입력하라는 뜻은 아닙니다. KV 캐시는 컨텍스트에 따라 대략 선형적으로 증가하므로, 일반 소비자 하드웨어에서는 262K가 아니라 16K~64K 범위에서 운용하게 됩니다. Ollama 기본값으로 시작하고, 작업에 실제로 필요할 때만 --num-ctx를 높이세요. 그리고 1M 수치는 확장 메커니즘과 이를 뒷받침할 VRAM이 필요하다는 점도 기억하세요.

여전히 불안정한 것 — 베팅하기 전에 읽어보세요

아직 독립적인 벤치마크 결과는 없습니다. 모델 카드의 모든 수치는 8월 15일 기준 알리바바의 주장입니다. Qwen3.6-27B 대비 주장된 성능 향상은 상당합니다 — SWE-bench Pro 61.7 vs 53.5, Terminal Bench 2.1 73.0 vs 63.4, LiveCodeBench v6 90.3 vs 83.9, GPQA Diamond 89.2 vs 87.8 — 그리고 이 수치들은 모두 그럴듯해 보이지만, 그중 어떤 것도 외부 하네스에 의해 재현된 적이 없습니다. 이 수치만으로 프로덕션 결정을 내리지 마십시오.

비전 스택은 며칠 전에 나온 것입니다. 초기 버그 보고(ollama 이슈 #17753)에 따르면 Q4 빌드가 비전 입력을 Qwen3.5 파서로 라우팅하면서 이미지 처리에 실패했습니다. 이는 PR #17755에서 며칠 내에 수정되었지만, 일주일 된 모델의 멀티모달 경로는 의존하기 전에 반드시 테스트해야 할 부분입니다.

기본 빌드에는 MTP가 포함됩니다. q4_K_M 태그는 또한 multi-token-prediction 빌드입니다 — 더 빠른 디코딩을 제공하며, "18 GB"와 "27B"가 모순 없이 공존할 수 있는 이유입니다.

Apple에서는 양자화 라벨이 오해를 유발할 수 있습니다. 18GB "mlx"와 "nvfp4" 태그는 양자화 방식이 다릅니다. NVFP4는 NVIDIA FP4 형식이므로, Mac에서는 특별히 Blackwell GPU용 FP8/FP4 변형이 필요하지 않은 한 일반 -mlx 빌드를 권장합니다.

그 헤드라인에서 '무료'라는 단어가 많은 역할을 하고 있다

27B를 자체 호스팅하는 것은 토큰당 무료이지만, 무료는 아닙니다. 솔직한 표현은 서로 다른 통화로 비용이 드는 세 가지 옵션이 있다는 것입니다.

직접 실행하세요 (Ollama). 토큰당 $0, 오프라인, 무제한, 프라이빗 — 그리고 하드웨어는 당신 소유입니다. 24GB GPU나 18GB 이상 Mac은 실제 비용이 들며, 전기 요금과 설정 시간도 마찬가지입니다. Qwen3.8 27B를 매일 사용하게 된다면 이는 올바른 선택입니다.

$0 속도 제한 API를 호출하세요. OrcaRouter는 자체 인프라에서 Qwen3.8 27B를 무료로 제공합니다 (모델 ID qwen/qwen3.8-27b-free, 요청당 $0, 속도 제한). 가중치가 공개되어 있으므로 전가할 토큰별 벤더 비용이 없습니다. 일주일 전 릴리스를 테스트하기 위해 하드웨어를 구매하지 않고 모델을 사용해 보려는 경우, 이 선택이 적절합니다.

무제한 API를 호출하세요.OrcaRouter에서 속도 제한이 없는 동일한 모델은 입력 토큰 100만 개당 $0.33, 출력 토큰 100만 개당 $2.40입니다 (qwen/qwen3.8-27b, 262K 컨텍스트, 텍스트, 이미지 및 비디오 입력). 프로덕션 규모가 필요하고 GPU를 직접 관리하고 싶지 않다면 이것이 올바른 선택입니다.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

그들 사이를 결정하는 계산: 가끔 사용하는 경우에는 GPU 가격을 지불하는 것보다 0달러 또는 0.33달러/2.40달러가 더 비용 효율적입니다. 매일 대화형으로 사용하는 경우에는 로컬이 더 저렴합니다. 지속적인 프로덕션 처리량은 유지할 필요가 없는 API가 가장 저렴합니다. 프라이버시와 오프라인 요구 사항은 계산 결과와 관계없이 첫 번째 열로 이동하게 합니다.

이 추천이 잘못된 경우

정말로 100K+ 컨텍스트가 필요합니다. 모델은 처리할 수 있지만, 24 GB 카드로는 불가능합니다. 실제 긴 컨텍스트에서는 40 GB+ GPU나 더 긴 컨텍스트 API는 사치가 아닙니다.

오늘 프로덕션에서 비디오가 필요합니다. 비전 경로의 파서 버그가 방금 수정되었습니다. 일주일 된 멀티모달 모델에서 프로덕션 비디오를 실행하는 것은 폴백 없이는 걸지 말아야 할 도박입니다.

동시성이 필요합니다. 소비자용 GPU 하나는 한 번에 한두 세대를 스트리밍합니다. 27B는 서빙 박스가 아닙니다.

현재 CPU 전용 하드웨어를 사용 중입니다. CPU에서 4비트 27B는 느린 데모일 뿐 도구가 아닙니다. GPU를 갖출 때까지 API가 정직한 선택입니다.

요점

Ollama에서 Qwen3.8 27B를 실행하는 것은 지금까지 누구나 출시한 현재 세대 27B를 실행하는 가장 쉬운 방법입니다: 명령 하나, 24GB 카드에 맞는 18GB 기본값, 일급 Apple Silicon 빌드, 그리고 Apache 2.0의 자유. 선택해야 할 양자화(quant)는 거의 항상 기본값인 Q4_K_M입니다 — 차이를 측정할 수 있을 때만 q8_0으로 이동하세요. 그리고 "무료"는 조건부입니다: 모델을 가끔 사용한다면, $0 속도 제한 API가 하드웨어를 구매하는 것보다 더 자유롭습니다; 매일 사용하게 된다면, 로컬 복사본이 당신이 소유한 것 중 가장 저렴합니다. 그 숫자에 기반해 구축하기 전에 숫자를 검증하세요 — 이 기사의 모든 내용은 2026년 8월 15일 기준으로 사실이었으며, 이 모델은 하루가 다르게 변하고 있습니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube