
Qwen3.8-27B บน Apple Silicon ด้วย MLX: ใช่ มันรันได้ — นี่คือสิ่งที่คุณต้องรู้จริงๆ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 217 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Qwen3.8 27B ทำงานบน Apple Silicon ได้แล้ววันนี้ผ่าน MLX แท็กคือ qwen3.8:27b-mlx ใน Ollama ซึ่งเพิ่มใน Ollama v0.32.12 และบิลด์ 4-bit มีขนาดดาวน์โหลดประมาณ 18 GB และต้องใช้หน่วยความจำรวมประมาณ 16–19 GB ซึ่งทำให้ Mac 24 GB+ เป็นเกณฑ์ขั้นต่ำที่สมจริง และ Mac 16 GB ไม่สามารถใช้งานได้ น้ำหนักโมเดลอยู่ภายใต้ Apache 2.0 ใช้ได้ฟรีบนฮาร์ดแวร์ที่คุณเป็นเจ้าของ ซึ่งเป็นจุดประสงค์ทั้งหมดของโมเดลนี้ การเปิดตัวของ Alibaba เพิ่งเกิดขึ้นเมื่อสองวันก่อน (13–14 สิงหาคม 2026) ดังนั้นตัวเลขทุกตัวด้านล่างจึงมีการระบุที่มา: สิ่งที่มาจาก model card ของ Alibaba สิ่งที่เราตรวจสอบบนหน้า Ollama วันนี้ และสิ่งที่เป็นการคาดการณ์หรือการวัดจากบุคคลที่สาม
เอกสารข้อมูล 30 วินาที
Qwen3.8 27B เป็นโมเดลแบบ dense ขนาด 27 พันล้านพารามิเตอร์ของ Alibaba เผยแพร่เมื่อวันที่ 13–14 สิงหาคม 2026 ภายใต้สัญญาอนุญาต Apache 2.0 — น้ำหนักโมเดลถูกอัปโหลดบน Hugging Face และ ModelScope ในวันที่ 13 โดยไฟล์ LICENSE ปรากฏในเช้าวันถัดมา มันเป็นโมเดล dense ที่สามารถนำไปใช้งานได้ ซึ่งเป็นรุ่นน้องของ Qwen3.8-Max ขนาด 2.4T พารามิเตอร์ จากโมเดลการ์ด ข้อมูลทั้งหมดเป็นข้อมูลที่รายงานโดย Alibaba และยังไม่มีการตรวจสอบซ้ำอย่างอิสระ:
• ขนาด — 27B แบบ dense, พารามิเตอร์รวม 27.78B เมื่อนับรวม vision encoder
• สถาปัตยกรรม — 64 ชั้น, ขนาดชั้นซ่อน 5,120, คำศัพท์ 248,320.
• แอตเทนชันแบบไฮบริด — เลเยอร์แอตเทนชันเต็มรูปแบบ 16 เลเยอร์ รวมกับเลเยอร์เชิงเส้น Gated DeltaNet 48 เลเยอร์ คิดเป็นอัตราส่วน 3:1
• บริบท — 262,144 โทเคนในตัว รองรับการขยายได้ถึง 1M ผ่าน YaRN (Ollama ระบุแท็กไว้ที่ 256K)
• อินพุต — ความสามารถในการเข้าใจรูปภาพและวิดีโอแบบเนทีฟ นอกเหนือจากข้อความ ตั้งแต่เอกสารไปจนถึงวิดีโอความยาวเป็นชั่วโมง
• น้ำหนัก — 55.6 GB ในรูปแบบ BF16 รวมถึงหัว MTP สำหรับการถอดรหัสแบบคาดการณ์ล่วงหน้า

ในด้าน MLX ที่ยืนยันแล้ววันนี้: Ollama มาพร้อมกับ qwen3.8:27b-mlx — บิลด์เนทีฟ MLX สำหรับ Apple Silicon ซึ่งเป็นไฟล์ดาวน์โหลดขนาด ~18 GB แบบ 4-bit — และบันทึกประจำรุ่น v0.32.12 กล่าวถึงการปรับแต่งสำหรับ Apple Silicon mlx-lm ซึ่งเป็นชุดเครื่องมือ Python ของ Apple รองรับสถาปัตยกรรมนี้สำหรับการสร้างและการแปลง และการควอนไทซ์ MLX (3/5/6 บิต รวมถึง MXFP4 และ NVFP4) ปรากฏขึ้นภายในไม่กี่ชั่วโมงหลังจากการเผยแพร่น้ำหนักโมเดล บทความที่เหลือนี้ถือว่าผู้อ่านใช้ Mac ตระกูล M ที่มีหน่วยความจำรวม 24 GB ขึ้นไป
สิ่งที่ MLX เปลี่ยนแปลงเกี่ยวกับหน่วยความจำ
บน Apple Silicon ไม่มี VRAM แยกต่างหาก MLX ทำงานบนพูลหน่วยความจำแบบรวม (unified memory) ของซีรีส์ M ดังนั้นตัวเลขที่สำคัญคือ RAM ทั้งหมดใน Mac ของคุณลบด้วยสิ่งที่ macOS และอย่างอื่นครอบครองอยู่ โมเดลที่ "พอดีใน 17 GB" จำเป็นต้องใช้เครื่องที่มีมากกว่านั้นอย่างสบาย ๆ
ข่าวดีก็คือ Qwen3.8 27B มีต้นทุนการจัดเก็บต่ำกว่าที่จำนวนพารามิเตอร์บอกไว้ เพราะมีเพียง 16 เลเยอร์แบบ full-attention เท่านั้นที่เก็บ KV cache — ส่วน 48 เลเยอร์แบบ linear ไม่เก็บ — ดังนั้นแคชจึงมีต้นทุนประมาณ 64 KB ต่อโทเคน ซึ่งคิดเป็นประมาณหนึ่งในสี่ของที่โมเดลหนาแน่น 64 เลเยอร์ทั่วไปจ่าย และในกรณีสูงสุด หน้าต่าง 262K เต็มรูปแบบต้องใช้แคชประมาณ 16.4 GB เพิ่มจากน้ำหนักของโมเดล ซึ่งเป็นงบประมาณระดับเซิร์ฟเวอร์ ไม่ใช่ระดับแล็ปท็อป
ระดับขั้นที่ใช้ได้จริงสำหรับ Mac: ขนาดไฟล์บวกพื้นที่สำรองแคช
• MLX 4 บิต — รวมประมาณ 16–19 GB พอดีกับ Mac 24 GB โดยมีหน้าต่างบริบทประมาณ 64K–96K ซึ่งเป็นค่าเริ่มต้นที่สมเหตุสมผล.
• MLX 6 บิต — ประมาณ 21–22 GB สำหรับเครื่อง 32 GB คุณภาพที่เพิ่มขึ้นเมื่อเทียบกับ 4 บิตนั้นไม่มากนัก
• 8-bit MLXประมาณ 27–30 GB สำหรับเครื่องที่มี RAM 48 GB ขึ้นไป คุณภาพแทบไม่สูญเสีย
• BF16 — ~55.6 GB. เฉพาะเครื่อง Mac Studio ระดับท็อปของตระกูล M-series Max และ Ultra เท่านั้น

ที่มา: ตัวเลข 4 บิตติดตามค่า GGUF Q4_K_M ที่วัดได้จริง (17.1 GB, unsloth, 14 สิงหาคม) และการดาวน์โหลด Ollama ขนาด 18 GB; ตัวเลข 8 บิตและ BF16 ติดตามการ์ด BF16 ของ Alibaba เองและสายพันธุ์ Qwen3.6-27B ตัวเลขแคช 64 KB ต่อโทเคนได้มาจากสถาปัตยกรรม ไม่ได้พิมพ์อยู่ในสเปกชีต และใช้ได้เฉพาะกับรันไทม์ที่ข้าม KV cache บนเลเยอร์เชิงเส้นแบบที่ MLX ทำเท่านั้น
สามวิธีในการรัน ตั้งแต่วิธีที่ง่ายที่สุดไปจนถึงวิธีที่ควบคุมได้มากที่สุด
เส้นทาง A — Ollama ที่ง่ายที่สุด
อัปเกรดเป็น Ollama 0.32.12 หรือใหม่กว่า จากนั้น:
• ollama pull qwen3.8:27b-mlx — ดาวน์โหลดบิลด์ MLX ขนาดประมาณ 18 GB
• ollama run qwen3.8:27b-mlx — แชทแบบโต้ตอบพร้อมเทมเพลตการคิดที่เชื่อมต่อแล้ว
• ollama serve — เปิดให้บริการ API ที่เข้ากันได้กับ OpenAI บน localhost:11434 สำหรับแอปของคุณ

จุดบกพร่องที่รู้จักกันดีจุดหนึ่ง จาก GitHub issue ที่ยังเปิดอยู่ ณ เวลาที่เขียนบทความนี้: qwen3.8:27b-mlx ปฏิเสธบทบาท "developer" บน /v1/responses endpoint ซึ่งทำให้ ollama launch codex สำหรับโมเดลนี้ใช้ไม่ได้ — ในขณะที่การเรียก ollama run โดยตรงยังทำงานได้ปกติ หากคุณกำลังสร้าง agent loop แบบ Codex บนบิลด์ MLX ให้ทดสอบ endpoint ที่คุณวางแผนจะใช้โดยเฉพาะก่อนที่จะวางเดิมพันกับลูปนั้น
เส้นทาง B — mlx-lm การควบคุมสูงสุด
เครื่องมือของ Apple เอง. ติดตั้งด้วย pip install mlx-lm จากนั้นเลือกดึง checkpoint MLX ที่ควอนไทซ์ไว้ล่วงหน้า หรือแปลงน้ำหนัก BF16 อย่างเป็นทางการด้วยตัวเอง:
• mlx_lm.generate --model <checkpoint> — รัน checkpoint ได้โดยตรง; ควอนต์ 4-bit และ 8-bit ของโมเดล 27B จากชุมชน ยังคงถูกปล่อยลงใน mlx-community ภายในไม่กี่วันหลังเปิดตัว
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — แปลงเพียงครั้งเดียว เสียค่าดาวน์โหลดประมาณหนึ่งครั้ง
• mlx_lm.server --model <checkpoint> — เซิร์ฟเวอร์ที่เข้ากันได้กับ OpenAI ซึ่งใช้เทมเพลตแชทแบบ thinking-block ให้คุณ
หาก quant เวอร์ชันที่ต้องการยังไม่ออกมา การแปลงจาก official weights เป็นงานที่ใช้เวลาไม่นานบน Mac รุ่น M-series และช่วยขจัดข้อกังขาเกี่ยวกับสิ่งที่ third party ส่งมาให้
เส้นทาง C — {{1}}LM Studio{{/1}} คลิกเดียว
LM Studio ใช้แบ็กเอนด์ MLX บน Apple Silicon และรองรับ Qwen3.8 27B ตั้งแต่เปิดตัว: ค้นหาโมเดล เลือกควอนไทซ์ที่พอดีกับ RAM ของคุณ แล้วมันจะดาวน์โหลดและรันให้ ถ้าคุณชอบ GUI นี่เป็นเส้นทางที่ง่ายที่สุด และวอล์กทรูคู่หูของเราครอบคลุมตั้งแต่ต้นจนจบ — ดู "How to Run Qwen3.8 27B Locally" ในรายการอ่านที่เกี่ยวข้องด้านล่าง
กับดักเทมเพลต
Qwen3.8 27B คิดโดยค่าเริ่มต้น และ think blocks ถูกเรนเดอร์โดย chat template ไม่ใช่โดยแกนของโมเดล การทดสอบจากบุคคลที่สามในช่วง 48 ชั่วโมงแรกชี้ว่าเทมเพลตอย่างเป็นทางการครอบเทิร์นของผู้ช่วยทุกเทิร์นด้วย think block — แม้แต่เทิร์นที่ว่างเปล่า — และในลูปเอเจนต์แบบหลายเทิร์น บล็อกจะซ้อนกันและประวัติถูกตัดทอน ซึ่งดูเหมือนความจำเสื่อม ไม่ใช่ปัญหาเรื่อง quantization หากรันไทม์มาพร้อมเทมเพลตที่แก้ไขแล้ว ให้ใช้มัน เมื่อคุณกำลังสร้างลูปเอเจนต์และไม่ต้องการการให้เหตุผล ให้ปิดการคิดในแต่ละคำขอ — chat template มีแฟล็ก enable_thinking และโมเดลรับค่า reasoning_effort เป็น xhigh, medium หรือ low
จริงๆ แล้วมันรู้สึกอย่างไร
การทดสอบอิสระบน Mac mini M4 พร้อมหน่วยความจำรวม 32 GB ซึ่งรันด้วยบิลด์ MLX 4-bit วัดความเร็วการสร้างข้อความได้ประมาณ 5–6 โทเคนต่อวินาที นี่คือตัวเลขที่ควรใช้ตั้งความคาดหวังไว้: เหมาะสำหรับการร่างเนื้อหาแบบโต้ตอบ การใช้เหตุผลแบบยาว และการเรียกใช้เอเจนต์เป็นครั้งคราว แต่ไม่เหมาะสำหรับลูปเอเจนต์ที่ยาวนานและงานแบบแบตช์ เกร็ดเล่าจากผู้ทดสอบคนเดียวกัน — การคิดนานหลายนาทีตามด้วยแอปเล็กๆ ที่ดูเหมือนถูกต้องแต่ตัวเลขกลับไม่ลงตัว — เป็นเครื่องเตือนใจที่ดีว่าโมเดล 27B บนแล็ปท็อปเป็นผู้ช่วยที่เก่ง แต่ก็ไม่ได้ไร้ข้อผิดพลาด
ความเร็วจะแปรผันตามซีรีส์ชิป: M-series Max ที่มีแบนด์วิดท์หน่วยความจำและคอร์มากกว่าจะทำงานได้เร็วกว่า M4 รุ่นพื้นฐานใน mini อย่างเห็นได้ชัด แต่ 5–6 tok/s บนรุ่นเริ่มต้นคือเกณฑ์พื้นฐานที่ซื่อสัตย์ และคุณควรตัดสินพาดหัวข่าวใดๆ ที่ว่า "รันบน Apple Silicon" ด้วยตัวเลขนี้
คอนเท็กซ์ 262K เป็นฟีเจอร์ของเซิร์ฟเวอร์
หน้าต่างบริบท 262K ดั้งเดิมของ Qwen3.8 27B มีประโยชน์จริง — แต่บน Mac มันถูกจำกัดด้วยหน่วยความจำ ไม่ใช่ด้วยตัวโมเดล ด้วย KV cache 64 KB ต่อโทเคน หน้าต่าง 8K มีค่าใช้จ่ายประมาณ 0.5 GB, 32K ประมาณ 2 GB, 128K ประมาณ 8 GB และเต็ม 262K ประมาณ 16.4 GB เพิ่มจากน้ำหนักของโมเดล บนเครื่อง 24 GB ที่รันแบบ 4-bit เพดานที่ทำได้จริงอยู่ที่ประมาณ 64K–96K โทเคน การจะไปถึง 128K+ ต้องใช้เครื่อง 32 GB+ และหน้าต่างเต็มต้องใช้เครื่องที่หน่วยความจำรวมส่วนใหญ่เป็นแคช วางแผนบริบทที่คุณจำเป็นจริงๆ และตั้งค่าสูงสุดในการกำหนดค่ารันไทม์ — โมเดลก็พอใจ และไฟล์สว็อปของคุณก็เงียบ
เมื่อ Apple Silicon คือคำตอบที่ผิด
เลือกใช้เส้นทางอื่น หากสิ่งใดสิ่งหนึ่งต่อไปนี้เป็นภาระงานของคุณ:
คุณมี Mac ขนาด 8 GB หรือ 16 GB บิลด์แบบ 4-bit ต้องการหน่วยความจำรวม ~17 GB อยู่แล้ว หากน้อยกว่านั้นระบบจะสวอปและโมเดลใช้งานไม่ได้ นี่คือจุดพลาดที่พบบ่อยที่สุด และไม่ว่าจะใช้เทคนิค quantization แบบไหนก็แก้ไม่ได้
• คุณต้องใช้หน้าต่าง 262K เต็มรูปแบบ หรือส่วนขยาย YaRN ขนาด 1M งบประมาณ KV นั้นเป็นงบประมาณสำหรับเซิร์ฟเวอร์ ไม่ใช่สำหรับแล็ปท็อป
• คุณกำลังให้บริการผู้อื่น แล็ปท็อปหนึ่งเครื่องคือหนึ่งที่นั่ง; ปริมาณงานสำหรับผู้ใช้หลายคนต้องใช้กล่อง GPU หรือ hosted API
• คุณต้องทำงานให้เร็วในลูป agentic ที่ยาว 5–6 tok/s ก็เพียงพอสำหรับมนุษย์ที่อ่านตาม แต่ถือว่าช้าสำหรับ sub-agent
การวางกรอบอย่างตรงไปตรงมาคือ: จุดขายของ Qwen3.8 27B คือมันใช้งานได้ฟรี ณ จุดที่ใช้บนฮาร์ดแวร์ที่คุณเป็นเจ้าของ — ตรงข้ามกับโมเดล API ที่คิดเงินต่อโทเคน นั่นคือเหตุผลที่มันไม่ถูกจัดอยู่ในแคตตาล็อกของ OrcaRouter (แคตตาล็อกนั้นจัดการกับเจนเนอเรชัน Qwen3.6/3.5-27B รุ่นก่อนหน้า และสาย Qwen API ที่โฮสต์ไว้) เราเป็นเครื่องมือที่ไม่เหมาะกับเรื่องราวแบบฟรีบนเครื่องของตัวเอง และนั่นคือประเด็น: เมื่อปริมาณงานเกินขีดจำกัดของ Mac ทางเลือกคือกล่อง GPU, เช่า GPU, หรือ Qwen API ที่โฮสต์ไว้ — ไม่ใช่เราเตอร์ที่บังเอิญมีขนาด 27B รุ่นนี้จำหน่าย
ประเด็นสำคัญ
Qwen3.8 27B บน Apple Silicon มีจริง ใช้งานได้ดี และมีขอบเขตจำกัดอย่างแคบ บิลด์ MLX แบบ 4-bit เหมาะกับ Mac ที่มี RAM 24 GB ขึ้นไป ดาวน์โหลดในชื่อ qwen3.8:27b-mlx ใน Ollama ไม่เสียค่าใช้จ่ายต่อโทเคน และเป็นโอเพนโมเดลระดับเอเจนต์ที่ใช้งานได้จริงรุ่นแรกที่พอดีกับแล็ปท็อป ข้อแลกเปลี่ยนคือความเร็ว (5–6 tok/s บน M4 mini) และบริบท (จำกัดให้ต่ำกว่า 262K มาก ๆ เว้นแต่คุณมี RAM พอ) ถ้าคุณมี Mac ที่ RAM 24 GB ขึ้นไป และมีงานที่ 27B รับได้ นี่คือโมเดลท้องถิ่นฟรีที่ดีที่สุดที่มีในสัปดาห์นี้ ถ้าคุณมี Mac 16 GB หรือต้องการปริมาณงานระดับโปรดักชัน มันไม่ใช่ตัวเลือก — และทางเลือกอื่นคือเส้นทางที่ต้องจ่ายเงิน ซึ่งเป็นการตัดสินใจที่แตกต่างไปโดยสิ้นเชิง
