การ์ดไตเติลสำหรับ Qwen3.8-27B พร้อม MLX บน Apple Silicon แสดงไอคอนแล็ปท็อปแบบมินิมอลพร้อมป้ายเครื่องยนต์ MLX และป้ายราคาที่ระบุว่าฟรี บน Mac ของคุณ
Guides & Insights

Qwen3.8-27B บน Apple Silicon ด้วย MLX: ใช่ มันรันได้ — นี่คือสิ่งที่คุณต้องรู้จริงๆ

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Qwen3.8 27B ทำงานบน Apple Silicon ได้แล้ววันนี้ผ่าน MLX แท็กคือ qwen3.8:27b-mlx ใน Ollama ซึ่งเพิ่มใน Ollama v0.32.12 และบิลด์ 4-bit มีขนาดดาวน์โหลดประมาณ 18 GB และต้องใช้หน่วยความจำรวมประมาณ 16–19 GB ซึ่งทำให้ Mac 24 GB+ เป็นเกณฑ์ขั้นต่ำที่สมจริง และ Mac 16 GB ไม่สามารถใช้งานได้ น้ำหนักโมเดลอยู่ภายใต้ Apache 2.0 ใช้ได้ฟรีบนฮาร์ดแวร์ที่คุณเป็นเจ้าของ ซึ่งเป็นจุดประสงค์ทั้งหมดของโมเดลนี้ การเปิดตัวของ Ali​baba เพิ่งเกิดขึ้นเมื่อสองวันก่อน (13–14 สิงหาคม 2026) ดังนั้นตัวเลขทุกตัวด้านล่างจึงมีการระบุที่มา: สิ่งที่มาจาก model card ของ Ali​baba สิ่งที่เราตรวจสอบบนหน้า Ollama วันนี้ และสิ่งที่เป็นการคาดการณ์หรือการวัดจากบุคคลที่สาม

เอกสารข้อมูล 30 วินาที

Qwen3.8 27B เป็นโมเดลแบบ dense ขนาด 27 พันล้านพารามิเตอร์ของ Ali​baba เผยแพร่เมื่อวันที่ 13–14 สิงหาคม 2026 ภายใต้สัญญาอนุญาต Apache 2.0 — น้ำหนักโมเดลถูกอัปโหลดบน Hugging Face และ ModelScope ในวันที่ 13 โดยไฟล์ LICENSE ปรากฏในเช้าวันถัดมา มันเป็นโมเดล dense ที่สามารถนำไปใช้งานได้ ซึ่งเป็นรุ่นน้องของ Qwen3.8-Max ขนาด 2.4T พารามิเตอร์ จากโมเดลการ์ด ข้อมูลทั้งหมดเป็นข้อมูลที่รายงานโดย Ali​baba และยังไม่มีการตรวจสอบซ้ำอย่างอิสระ:

ขนาด — 27B แบบ dense, พารามิเตอร์รวม 27.78B เมื่อนับรวม vision encoder

สถาปัตยกรรม — 64 ชั้น, ขนาดชั้นซ่อน 5,120, คำศัพท์ 248,320.

แอตเทนชันแบบไฮบริด — เลเยอร์แอตเทนชันเต็มรูปแบบ 16 เลเยอร์ รวมกับเลเยอร์เชิงเส้น Gated DeltaNet 48 เลเยอร์ คิดเป็นอัตราส่วน 3:1

บริบท — 262,144 โทเคนในตัว รองรับการขยายได้ถึง 1M ผ่าน YaRN (Ollama ระบุแท็กไว้ที่ 256K)

อินพุต — ความสามารถในการเข้าใจรูปภาพและวิดีโอแบบเนทีฟ นอกเหนือจากข้อความ ตั้งแต่เอกสารไปจนถึงวิดีโอความยาวเป็นชั่วโมง

น้ำหนัก — 55.6 GB ในรูปแบบ BF16 รวมถึงหัว MTP สำหรับการถอดรหัสแบบคาดการณ์ล่วงหน้า

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

ในด้าน MLX ที่ยืนยันแล้ววันนี้: Ollama มาพร้อมกับ qwen3.8:27b-mlx — บิลด์เนทีฟ MLX สำหรับ Apple Silicon ซึ่งเป็นไฟล์ดาวน์โหลดขนาด ~18 GB แบบ 4-bit — และบันทึกประจำรุ่น v0.32.12 กล่าวถึงการปรับแต่งสำหรับ Apple Silicon mlx-lm ซึ่งเป็นชุดเครื่องมือ Python ของ Apple รองรับสถาปัตยกรรมนี้สำหรับการสร้างและการแปลง และการควอนไทซ์ MLX (3/5/6 บิต รวมถึง MXFP4 และ NVFP4) ปรากฏขึ้นภายในไม่กี่ชั่วโมงหลังจากการเผยแพร่น้ำหนักโมเดล บทความที่เหลือนี้ถือว่าผู้อ่านใช้ Mac ตระกูล M ที่มีหน่วยความจำรวม 24 GB ขึ้นไป

สิ่งที่ MLX เปลี่ยนแปลงเกี่ยวกับหน่วยความจำ

บน Apple Silicon ไม่มี VRAM แยกต่างหาก MLX ทำงานบนพูลหน่วยความจำแบบรวม (unified memory) ของซีรีส์ M ดังนั้นตัวเลขที่สำคัญคือ RAM ทั้งหมดใน Mac ของคุณลบด้วยสิ่งที่ macOS และอย่างอื่นครอบครองอยู่ โมเดลที่ "พอดีใน 17 GB" จำเป็นต้องใช้เครื่องที่มีมากกว่านั้นอย่างสบาย ๆ

ข่าวดีก็คือ Qwen3.8 27B มีต้นทุนการจัดเก็บต่ำกว่าที่จำนวนพารามิเตอร์บอกไว้ เพราะมีเพียง 16 เลเยอร์แบบ full-attention เท่านั้นที่เก็บ KV cache — ส่วน 48 เลเยอร์แบบ linear ไม่เก็บ — ดังนั้นแคชจึงมีต้นทุนประมาณ 64 KB ต่อโทเคน ซึ่งคิดเป็นประมาณหนึ่งในสี่ของที่โมเดลหนาแน่น 64 เลเยอร์ทั่วไปจ่าย และในกรณีสูงสุด หน้าต่าง 262K เต็มรูปแบบต้องใช้แคชประมาณ 16.4 GB เพิ่มจากน้ำหนักของโมเดล ซึ่งเป็นงบประมาณระดับเซิร์ฟเวอร์ ไม่ใช่ระดับแล็ปท็อป

ระดับขั้นที่ใช้ได้จริงสำหรับ Mac: ขนาดไฟล์บวกพื้นที่สำรองแคช

4-bit MLX — ~16–19 GB total. Fits a 24 GB Mac with roughly a 64K–96K window; the sensible default.

MLX 6 บิต — ประมาณ 21–22 GB สำหรับเครื่อง 32 GB คุณภาพที่เพิ่มขึ้นเมื่อเทียบกับ 4 บิตนั้นไม่มากนัก

8-bit MLXประมาณ 27–30 GB สำหรับเครื่องที่มี RAM 48 GB ขึ้นไป คุณภาพแทบไม่สูญเสีย

BF16 — ~55.6 GB. เฉพาะเครื่อง Mac Studio ระดับท็อปของตระกูล M-series Max และ Ultra เท่านั้น

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

ที่มา: ตัวเลข 4 บิตติดตามค่า GGUF Q4_K_M ที่วัดได้จริง (17.1 GB, unsloth, 14 สิงหาคม) และการดาวน์โหลด Ollama ขนาด 18 GB; ตัวเลข 8 บิตและ BF16 ติดตามการ์ด BF16 ของ Alibaba เองและสายพันธุ์ Qwen3.6-27B ตัวเลขแคช 64 KB ต่อโทเคนได้มาจากสถาปัตยกรรม ไม่ได้พิมพ์อยู่ในสเปกชีต และใช้ได้เฉพาะกับรันไทม์ที่ข้าม KV cache บนเลเยอร์เชิงเส้นแบบที่ MLX ทำเท่านั้น

สามวิธีในการรัน ตั้งแต่วิธีที่ง่ายที่สุดไปจนถึงวิธีที่ควบคุมได้มากที่สุด

เส้นทาง A — Ollama ที่ง่ายที่สุด

อัปเกรดเป็น Ollama 0.32.12 หรือใหม่กว่า จากนั้น:

ollama pull qwen3.8:27b-mlx — ดาวน์โหลดบิลด์ MLX ขนาดประมาณ 18 GB

ollama run qwen3.8:27b-mlx — แชทแบบโต้ตอบพร้อมเทมเพลตการคิดที่เชื่อมต่อแล้ว

ollama serve — เปิดให้บริการ API ที่เข้ากันได้กับ OpenAI บน localhost:11434 สำหรับแอปของคุณ

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

จุดบกพร่องที่รู้จักกันดีจุดหนึ่ง จาก GitHub issue ที่ยังเปิดอยู่ ณ เวลาที่เขียนบทความนี้: qwen3.8:27b-mlx ปฏิเสธบทบาท "developer" บน /v1/responses endpoint ซึ่งทำให้ ollama launch codex สำหรับโมเดลนี้ใช้ไม่ได้ — ในขณะที่การเรียก ollama run โดยตรงยังทำงานได้ปกติ หากคุณกำลังสร้าง agent loop แบบ Codex บนบิลด์ MLX ให้ทดสอบ endpoint ที่คุณวางแผนจะใช้โดยเฉพาะก่อนที่จะวางเดิมพันกับลูปนั้น

เส้นทาง B — mlx-lm การควบคุมสูงสุด

เครื่องมือของ Apple เอง. ติดตั้งด้วย pip install mlx-lm จากนั้นเลือกดึง checkpoint MLX ที่ควอนไทซ์ไว้ล่วงหน้า หรือแปลงน้ำหนัก BF16 อย่างเป็นทางการด้วยตัวเอง:

mlx_lm.generate --model <checkpoint> — รัน checkpoint ได้โดยตรง; ควอนต์ 4-bit และ 8-bit ของโมเดล 27B จากชุมชน ยังคงถูกปล่อยลงใน mlx-community ภายในไม่กี่วันหลังเปิดตัว

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — แปลงเพียงครั้งเดียว เสียค่าดาวน์โหลดประมาณหนึ่งครั้ง

mlx_lm.server --model <checkpoint> — เซิร์ฟเวอร์ที่เข้ากันได้กับ OpenAI ซึ่งใช้เทมเพลตแชทแบบ thinking-block ให้คุณ

หาก quant เวอร์ชันที่ต้องการยังไม่ออกมา การแปลงจาก official weights เป็นงานที่ใช้เวลาไม่นานบน Mac รุ่น M-series และช่วยขจัดข้อกังขาเกี่ยวกับสิ่งที่ third party ส่งมาให้

เส้นทาง C — {{1}}LM Studio{{/1}} คลิกเดียว

LM Studio ใช้แบ็กเอนด์ MLX บน Apple Silicon และรองรับ Qwen3.8 27B ตั้งแต่เปิดตัว: ค้นหาโมเดล เลือกควอนไทซ์ที่พอดีกับ RAM ของคุณ แล้วมันจะดาวน์โหลดและรันให้ ถ้าคุณชอบ GUI นี่เป็นเส้นทางที่ง่ายที่สุด และวอล์กทรูคู่หูของเราครอบคลุมตั้งแต่ต้นจนจบ — ดู "How to Run Qwen3.8 27B Locally" ในรายการอ่านที่เกี่ยวข้องด้านล่าง

กับดักเทมเพลต

Qwen3.8 27B คิดโดยค่าเริ่มต้น และ think blocks ถูกเรนเดอร์โดย chat template ไม่ใช่โดยแกนของโมเดล การทดสอบจากบุคคลที่สามในช่วง 48 ชั่วโมงแรกชี้ว่าเทมเพลตอย่างเป็นทางการครอบเทิร์นของผู้ช่วยทุกเทิร์นด้วย think block — แม้แต่เทิร์นที่ว่างเปล่า — และในลูปเอเจนต์แบบหลายเทิร์น บล็อกจะซ้อนกันและประวัติถูกตัดทอน ซึ่งดูเหมือนความจำเสื่อม ไม่ใช่ปัญหาเรื่อง quantization หากรันไทม์มาพร้อมเทมเพลตที่แก้ไขแล้ว ให้ใช้มัน เมื่อคุณกำลังสร้างลูปเอเจนต์และไม่ต้องการการให้เหตุผล ให้ปิดการคิดในแต่ละคำขอ — chat template มีแฟล็ก enable_thinking และโมเดลรับค่า reasoning_effort เป็น xhigh, medium หรือ low

จริงๆ แล้วมันรู้สึกอย่างไร

การทดสอบอิสระบน Mac mini M4 พร้อมหน่วยความจำรวม 32 GB ซึ่งรันด้วยบิลด์ MLX 4-bit วัดความเร็วการสร้างข้อความได้ประมาณ 5–6 โทเคนต่อวินาที นี่คือตัวเลขที่ควรใช้ตั้งความคาดหวังไว้: เหมาะสำหรับการร่างเนื้อหาแบบโต้ตอบ การใช้เหตุผลแบบยาว และการเรียกใช้เอเจนต์เป็นครั้งคราว แต่ไม่เหมาะสำหรับลูปเอเจนต์ที่ยาวนานและงานแบบแบตช์ เกร็ดเล่าจากผู้ทดสอบคนเดียวกัน — การคิดนานหลายนาทีตามด้วยแอปเล็กๆ ที่ดูเหมือนถูกต้องแต่ตัวเลขกลับไม่ลงตัว — เป็นเครื่องเตือนใจที่ดีว่าโมเดล 27B บนแล็ปท็อปเป็นผู้ช่วยที่เก่ง แต่ก็ไม่ได้ไร้ข้อผิดพลาด

ความเร็วจะแปรผันตามซีรีส์ชิป: M-series Max ที่มีแบนด์วิดท์หน่วยความจำและคอร์มากกว่าจะทำงานได้เร็วกว่า M4 รุ่นพื้นฐานใน mini อย่างเห็นได้ชัด แต่ 5–6 tok/s บนรุ่นเริ่มต้นคือเกณฑ์พื้นฐานที่ซื่อสัตย์ และคุณควรตัดสินพาดหัวข่าวใดๆ ที่ว่า "รันบน Apple Silicon" ด้วยตัวเลขนี้

คอนเท็กซ์ 262K เป็นฟีเจอร์ของเซิร์ฟเวอร์

หน้าต่างบริบท 262K ดั้งเดิมของ Qwen3.8 27B มีประโยชน์จริง — แต่บน Mac มันถูกจำกัดด้วยหน่วยความจำ ไม่ใช่ด้วยตัวโมเดล ด้วย KV cache 64 KB ต่อโทเคน หน้าต่าง 8K มีค่าใช้จ่ายประมาณ 0.5 GB, 32K ประมาณ 2 GB, 128K ประมาณ 8 GB และเต็ม 262K ประมาณ 16.4 GB เพิ่มจากน้ำหนักของโมเดล บนเครื่อง 24 GB ที่รันแบบ 4-bit เพดานที่ทำได้จริงอยู่ที่ประมาณ 64K–96K โทเคน การจะไปถึง 128K+ ต้องใช้เครื่อง 32 GB+ และหน้าต่างเต็มต้องใช้เครื่องที่หน่วยความจำรวมส่วนใหญ่เป็นแคช วางแผนบริบทที่คุณจำเป็นจริงๆ และตั้งค่าสูงสุดในการกำหนดค่ารันไทม์ — โมเดลก็พอใจ และไฟล์สว็อปของคุณก็เงียบ

เมื่อ Apple Silicon คือคำตอบที่ผิด

เลือกใช้เส้นทางอื่น หากสิ่งใดสิ่งหนึ่งต่อไปนี้เป็นภาระงานของคุณ:

คุณมี Mac ขนาด 8 GB หรือ 16 GB บิลด์แบบ 4-bit ต้องการหน่วยความจำรวม ~17 GB อยู่แล้ว หากน้อยกว่านั้นระบบจะสวอปและโมเดลใช้งานไม่ได้ นี่คือจุดพลาดที่พบบ่อยที่สุด และไม่ว่าจะใช้เทคนิค quantization แบบไหนก็แก้ไม่ได้

• คุณต้องใช้หน้าต่าง 262K เต็มรูปแบบ หรือส่วนขยาย YaRN ขนาด 1M งบประมาณ KV นั้นเป็นงบประมาณสำหรับเซิร์ฟเวอร์ ไม่ใช่สำหรับแล็ปท็อป

• คุณกำลังให้บริการผู้อื่น แล็ปท็อปหนึ่งเครื่องคือหนึ่งที่นั่ง; ปริมาณงานสำหรับผู้ใช้หลายคนต้องใช้กล่อง GPU หรือ hosted API

• คุณต้องทำงานให้เร็วในลูป agentic ที่ยาว 5–6 tok/s ก็เพียงพอสำหรับมนุษย์ที่อ่านตาม แต่ถือว่าช้าสำหรับ sub-agent

การวางกรอบอย่างตรงไปตรงมาคือ: จุดขายของ Qwen3.8 27B คือมันใช้งานได้ฟรี ณ จุดที่ใช้บนฮาร์ดแวร์ที่คุณเป็นเจ้าของ — ตรงข้ามกับโมเดล API ที่คิดเงินต่อโทเคน นั่นคือเหตุผลที่มันไม่ถูกจัดอยู่ในแคตตาล็อกของ OrcaRouter (แคตตาล็อกนั้นจัดการกับเจนเนอเรชัน Qwen3.6/3.5-27B รุ่นก่อนหน้า และสาย Qwen API ที่โฮสต์ไว้) เราเป็นเครื่องมือที่ไม่เหมาะกับเรื่องราวแบบฟรีบนเครื่องของตัวเอง และนั่นคือประเด็น: เมื่อปริมาณงานเกินขีดจำกัดของ Mac ทางเลือกคือกล่อง GPU, เช่า GPU, หรือ Qwen API ที่โฮสต์ไว้ — ไม่ใช่เราเตอร์ที่บังเอิญมีขนาด 27B รุ่นนี้จำหน่าย

บรรทัดล่าง

Qwen3.8 27B บน Apple Silicon มีจริง ใช้งานได้ดี และมีขอบเขตจำกัดอย่างแคบ บิลด์ MLX แบบ 4-bit เหมาะกับ Mac ที่มี RAM 24 GB ขึ้นไป ดาวน์โหลดในชื่อ qwen3.8:27b-mlx ใน Ollama ไม่เสียค่าใช้จ่ายต่อโทเคน และเป็นโอเพนโมเดลระดับเอเจนต์ที่ใช้งานได้จริงรุ่นแรกที่พอดีกับแล็ปท็อป ข้อแลกเปลี่ยนคือความเร็ว (5–6 tok/s บน M4 mini) และบริบท (จำกัดให้ต่ำกว่า 262K มาก ๆ เว้นแต่คุณมี RAM พอ) ถ้าคุณมี Mac ที่ RAM 24 GB ขึ้นไป และมีงานที่ 27B รับได้ นี่คือโมเดลท้องถิ่นฟรีที่ดีที่สุดที่มีในสัปดาห์นี้ ถ้าคุณมี Mac 16 GB หรือต้องการปริมาณงานระดับโปรดักชัน มันไม่ใช่ตัวเลือก — และทางเลือกอื่นคือเส้นทางที่ต้องจ่ายเงิน ซึ่งเป็นการตัดสินใจที่แตกต่างไปโดยสิ้นเชิง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube