
Apple Silicon에서 MLX를 사용한 Qwen3.8-27B: 네, 실행됩니다 — 정말 필요한 것
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 217 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Qwen3.8 27B는 현재 MLX를 통해 Apple Silicon에서 실행됩니다. 태그는 qwen3.8:27b-mlx이며, Ollama에 있고 Ollama v0.32.12에서 추가되었습니다. 4비트 빌드는 약 18GB를 다운로드하고 약 16–19GB의 통합 메모리가 필요하므로, 24GB 이상의 Mac이 현실적인 최소 사양이고 16GB Mac은 부적합합니다. 가중치는 Apache 2.0으로, 소유한 하드웨어에서 사용 시 무료이며, 그것이 바로 이 모델의 존재 이유입니다. Alibaba의 릴리스는 이틀 전(2026년 8월 13~14일)에 나온 것이므로, 아래 모든 수치에는 출처가 명시되어 있습니다: Alibaba의 모델 카드에서 나온 것, 오늘 Ollama 페이지에서 확인한 것, 그리고 제3자 추정 또는 측정값입니다.
30초 팩트시트
Qwen3.8 27B는 270억 개의 파라미터를 가진 Alibaba의 밀집(dense) 모델로, 2026년 8월 13~14일에 Apache 2.0 라이선스로 공개되었습니다. 가중치는 13일에 Hugging Face와 ModelScope에 업로드되었고, LICENSE 파일은 다음 날 아침에 나타났습니다. 이 모델은 2.4T 파라미터의 Qwen3.8-Max의 배포 가능한 밀집형 자매 모델입니다. 모델 카드에 따르면, 모든 수치는 Alibaba가 보고한 것이며 아직 독립적으로 재현되지 않았습니다:
• 크기 — 27B dense, 비전 인코더를 포함한 총 27.78B 파라미터.
• 아키텍처 — 64개 레이어, 은닉 크기 5,120, 어휘 248,320.
• 하이브리드 어텐션 — 풀 어텐션 레이어 16개와 Gated DeltaNet 선형 레이어 48개로, 3:1 비율입니다.
• 컨텍스트 — 기본 262,144개 토큰, YaRN을 통해 1M까지 확장 가능 (Ollama는 해당 태그를 256K로 명시).
• 입력 — 문서부터 시간 단위의 비디오까지, 텍스트에 더해 이미지와 영상을 기본적으로 이해합니다.
• 가중치 — BF16 기준 55.6 GB, MTP 추측 디코딩 헤드 포함.

MLX 쪽에서는 오늘 확인된 사항: Ollama가 qwen3.8:27b-mlx를 제공합니다 — Apple Silicon용 MLX 네이티브 빌드로 약 18GB 4비트 다운로드이며, v0.32.12 릴리스 노트에서 Apple Silicon 최적화를 명시하고 있습니다. mlx-lm — Apple의 Python 도구 체인 — 생성 및 변환을 위한 아키텍처를 지원하며, MLX 양자화(3/5/6비트, MXFP4 및 NVFP4)는 가중치 공개 후 몇 시간 안에 등장했습니다. 이 기사의 나머지 부분에서는 24GB 이상의 통합 메모리를 갖춘 M 시리즈 Mac을 가정합니다.
MLX가 메모리에 대해 바꾸는 점
Apple Silicon에는 별도의 VRAM이 없습니다. MLX는 M-시리즈 통합 메모리 풀에서 실행되므로, 중요한 숫자는 Mac의 총 RAM에서 macOS와 기타 모든 것이 차지하는 메모리를 뺀 값입니다. "17GB에 맞는" 모델이라도 그보다 여유 있게 큰 메모리를 갖춘 머신이 필요합니다.
좋은 소식은 Qwen3.8 27B가 파라미터 수치가 시사하는 것보다 보유 비용이 저렴하다는 점입니다. 오직 16개의 전체 어텐션 레이어만 KV 캐시를 유지하고 48개의 선형 레이어는 그렇지 않기 때문에, 캐시 비용은 토큰당 약 64KB로, 기존 64층 밀집 모델이 지불하는 비용의 약 1/4입니다. 극단적으로는 전체 262K 윈도우가 가중치 위에 약 16.4GB의 캐시를 필요로 하며, 이는 노트북 예산이 아니라 서버 예산입니다.
Mac용 현실적인 사다리, 파일 크기와 캐시 여유 공간:
• 4비트 MLX — 총 ~16–19GB. 24GB Mac에 맞으며 대략 64K–96K 컨텍스트 창을 제공합니다. 합리적인 기본값입니다.
• 6-bit MLX — 약 21–22 GB. 32GB 머신의 경우 4-bit 대비 품질 향상은 미미합니다.
• 8-bit MLX — ~27–30 GB. 48 GB 이상 기기, 거의 무손실.
• BF16 — ~55.6GB. 최상위 M-series Max 및 Ultra 스튜디오 기기에서만 지원됩니다.

출처: 4비트 수치는 측정된 GGUF Q4_K_M(17.1GB, unsloth, 8월 14일) 및 18GB Ollama 다운로드를 추적하며, 8비트 및 BF16 수치는 Alibaba 자체 BF16 카드와 Qwen3.6-27B 계열을 추적합니다. 토큰당 64KB 캐시 수치는 아키텍처에서 파생된 것이지 사양서에 명시된 것이 아니며, MLX처럼 선형 계층에서 KV 캐시를 건너뛰는 런타임에만 적용됩니다.
실행하는 세 가지 방법, 가장 간단한 것부터 가장 많은 제어까지
경로 A — Ollama, 가장 간단한 방법
Ollama 0.32.12 이상으로 업그레이드한 후:
• ollama pull qwen3.8:27b-mlx — 약 18GB MLX 빌드를 다운로드합니다.
• ollama run qwen3.8:27b-mlx — thinking 템플릿이 연결된 대화형 채팅.
• ollama serveOpenAI 호환 API를 localhost:11434에서 앱에 노출합니다.

알려진 문제점 하나로, 작성 시점의 GitHub 이슈에 따르면: qwen3.8:27b-mlx는 /v1/responses 엔드포인트에서 'developer' 역할을 거부하며, 이로 인해 ollama launch codex가 이 모델에서 깨집니다. 반면 직접 ollama run은(는) 정상 작동합니다. MLX 빌드에서 Codex 스타일 에이전트 루프를 구축할 계획이라면, 루프를 실제로 적용하기 전에 사용할 정확한 엔드포인트를 테스트하세요.
경로 B — mlx-lm, 가장 많은 제어
Apple의 자체 툴킷입니다. pip install mlx-lm으로 설치한 다음, 사전 양자화된 MLX 체크포인트를 가져오거나 공식 BF16 가중치를 직접 변환하세요:
• mlx_lm.generate --model <checkpoint> — 체크포인트를 직접 실행할 수 있습니다. 27B의 커뮤니티 4비트 및 8비트 양자화 버전은 출시 후 며칠 내에 mlx-community에 계속 업로드되고 있었습니다.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — 한 번만 변환하면 되며, 다운로드 한 번 분량의 비용이 듭니다.
• mlx_lm.server --model <checkpoint> — 사용자를 대신해 thinking-block 채팅 템플릿을 적용하는 OpenAI 호환 서버.
아직 원하는 정확한 양자화 버전이 올라오지 않았다면, 공식 가중치에서 변환하는 작업은 M-시리즈 Mac에서 금방 끝나며, 제3자가 배송한 파일에 대한 의문도 완전히 없앨 수 있습니다.
경로 C — LM Studio, 원클릭
LM Studio는 Apple Silicon에서 MLX 백엔드를 사용하며, 출시와 동시에 Qwen3.8 27B를 지원했습니다. 모델을 검색하고 RAM에 맞는 퀀트(quant)를 선택하면 다운로드되어 바로 실행됩니다. GUI를 선호한다면 이 방법이 가장 친숙하며, 함께 제공되는 안내서가 처음부터 끝까지 다룹니다 — 아래 관련 읽을거리에서 "Qwen3.8 27B를 로컬에서 실행하는 방법"을 참조하세요.
템플릿 함정
Qwen3.8 27B는 기본적으로 사고(think)를 수행하며, think 블록은 모델 코어가 아니라 채팅 템플릿이 렌더링합니다. 출시 후 첫 48시간 동안의 타사 테스트에 따르면, 공식 템플릿은 모든 어시스턴트 턴을 think 블록으로 감쌉니다. 빈 턴조차도 말이죠. 또한 다중 턴 에이전트 루프에서는 블록이 중첩되고 히스토리가 잘려나가 기억상실처럼 보입니다. 이는 양자화 문제가 아닙니다. 런타임이 수정된 템플릿을 제공한다면 그것을 사용하세요. 에이전트 루프를 구축 중이고 추론이 필요 없다면 요청별로 thinking을 비활성화하세요. 채팅 템플릿은 enable_thinking 플래그를 노출하며, 모델은 reasoning_effort를 xhigh, medium 또는 low로 받습니다.
실제로 어떤 느낌인지
32GB 통합 메모리를 갖춘 Mac mini M4에서 MLX 4비트 빌드를 실행한 독립적 테스트에서는 약 5~6 tokens/s의 생성 속도를 측정했습니다. 이 수치가 기대치를 설정해야 합니다. 대화형 초안 작성, 장문 추론, 가끔의 에이전트 호출에는 적합하지만, 긴 에이전트 루프와 배치 작업에는 힘듭니다. 같은 테스터의 일화, 즉 몇 분에 걸친 사고 후에 제대로 보이지만 실제로는 합산되지 않는 작은 애플리케이션을 만들어낸 사례는, 노트북에서 실행되는 27B 모델이 유능하지만 절대 무오류는 아닌 어시스턴트임을 상기시켜 줍니다.
속도는 칩 등급에 따라 달라진다. 메모리 대역폭과 코어가 더 많은 M 시리즈 Max는 미니의 기본 M4보다 실질적으로 더 빠르다. 하지만 엔트리 포인트에서 5–6 tok/s가 정직한 기준이며, "Apple Silicon에서 실행된다"는 헤드라인은 그 기준에 비추어 판단해야 한다.
262K 컨텍스트는 서버 기능입니다.
Qwen3.8 27B의 기본 262K 윈도우는 실질적으로 유용합니다. 하지만 Mac에서는 모델이 아니라 메모리가 병목입니다. 토큰당 64KB의 KV 캐시 기준으로, 8K 윈도우는 약 0.5GB, 32K는 약 2GB, 128K는 약 8GB, 그리고 전체 262K는 가중치 위에 약 16.4GB가 추가로 필요합니다. 24GB 머신에서 4비트로 실행하면 현실적인 상한은 대략 64K~96K 토큰입니다. 128K 이상을 쓰려면 32GB 이상의 머신이 필요하고, 전체 윈도우를 쓰려면 통합 메모리의 대부분이 캐시로 채워진 머신이 필요합니다. 실제로 필요한 컨텍스트를 계획하고 런타임 설정에서 상한을 지정하세요. 모델도 만족하고 스왑 파일도 조용히 유지됩니다.
애플 실리콘이 잘못된 답일 때
이 중 하나라도 당신의 워크로드라면 다른 길을 택하세요:
• 8GB 또는 16GB Mac을 사용 중입니다. 4비트 빌드는 이미 약 17GB의 통합 메모리가 필요합니다. 그보다 적으면 스와핑이 발생해 모델을 사용할 수 없게 됩니다. 이것은 가장 흔한 실수이며, 어떤 양자화 트릭으로도 해결되지 않습니다.
전체 262K 윈도우 또는 1M YaRN 확장이 필요합니다. 그 KV 예산은 서버 예산이지 노트북 예산이 아닙니다.
당신은 다른 사람들에게 서비스를 제공하고 있습니다. 랩톱은 하나의 좌석입니다; 다중 사용자 처리량에는 GPU 박스 또는 호스팅 API가 필요합니다.
• 긴 에이전트 루프에서는 빠르게 처리해야 합니다. 5–6 tok/s는 사람이 따라 읽기에는 충분하지만, 하위 에이전트에게는 느립니다.
솔직한 프레임: Qwen3.8 27B가 내세우는 점은 소유한 하드웨어에서 사용 시 무료라는 것입니다 — 토큰당 요금을 부과하는 API 모델과는 정반대죠. 그것이 바로 OrcaRouter 카탈로그에 없는 이유입니다 (카탈로그는 이전 Qwen3.6/3.5-27B 세대와 호스팅형 Qwen API 라인을 라우팅합니다). 우리는 무료-로컬 스토리에 맞는 도구가 아니며, 바로 그 점이 핵심입니다: 워크로드가 Mac을 넘어서면 대안은 GPU 박스, 임대 GPU, 또는 호스팅형 Qwen API입니다 — 이 특정 27B를 취급하는 라우터가 아니라요.
결론
{{1}}Apple Silicon에서의 Qwen3.8 27B는 실제로 존재하며, 훌륭하고, 용도가 명확히 한정되어 있습니다.{{/1}} {{2}}4비트 MLX 빌드는 24GB 이상의 Mac에 맞고, Ollama에서 qwen3.8:27b-mlx로 다운로드되며, 토큰당 비용이 없고, 노트북에 들어맞는 최초의 실질적으로 사용 가능한 에이전트급 오픈 모델입니다.{{/2}} {{3}}절충점은 속도(M4 mini에서 5–6 tok/s)와 컨텍스트(RAM이 충분하지 않다면 262K보다 훨씬 아래로 제한)입니다.{{/3}} {{4}}24GB 이상의 Mac과 27B가 처리할 수 있는 워크로드가 있다면, 이것이 이번 주에 사용 가능한 최고의 무료 로컬 모델입니다.{{/4}} {{5}}16GB Mac을 보유했거나 프로덕션 처리량이 필요하다면, 이 모델은 적합하지 않습니다. 대안은 유료 경로이며, 이는 완전히 다른 결정입니다.{{/5}}
