
Qwen3.8-27B บน Apple Silicon ด้วย MLX: ใช่ มันรันได้ — นี่คือสิ่งที่คุณต้องรู้จริงๆ
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 ต่อ 1 ล้านโทเค็น · 22 tok/s
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
Qwen3.8 27B ทำงานบน Apple Silicon ได้แล้ววันนี้ผ่าน MLX แท็กคือ qwen3.8:27b-mlx ใน Ollama ซึ่งเพิ่มใน Ollama v0.32.12 และบิลด์ 4-bit มีขนาดดาวน์โหลดประมาณ 18 GB และต้องใช้หน่วยความจำรวมประมาณ 16–19 GB ซึ่งทำให้ Mac 24 GB+ เป็นเกณฑ์ขั้นต่ำที่สมจริง และ Mac 16 GB ไม่สามารถใช้งานได้ น้ำหนักโมเดลอยู่ภายใต้ Apache 2.0 ใช้ได้ฟรีบนฮาร์ดแวร์ที่คุณเป็นเจ้าของ ซึ่งเป็นจุดประสงค์ทั้งหมดของโมเดลนี้ การเปิดตัวของ Alibaba เพิ่งเกิดขึ้นเมื่อสองวันก่อน (13–14 สิงหาคม 2026) ดังนั้นตัวเลขทุกตัวด้านล่างจึงมีการระบุที่มา: สิ่งที่มาจาก model card ของ Alibaba สิ่งที่เราตรวจสอบบนหน้า Ollama วันนี้ และสิ่งที่เป็นการคาดการณ์หรือการวัดจากบุคคลที่สาม
เอกสารข้อมูล 30 วินาที
Qwen3.8 27B เป็นโมเดลแบบ dense ขนาด 27 พันล้านพารามิเตอร์ของ Alibaba เผยแพร่เมื่อวันที่ 13–14 สิงหาคม 2026 ภายใต้สัญญาอนุญาต Apache 2.0 — น้ำหนักโมเดลถูกอัปโหลดบน Hugging Face และ ModelScope ในวันที่ 13 โดยไฟล์ LICENSE ปรากฏในเช้าวันถัดมา มันเป็นโมเดล dense ที่สามารถนำไปใช้งานได้ ซึ่งเป็นรุ่นน้องของ Qwen3.8-Max ขนาด 2.4T พารามิเตอร์ จากโมเดลการ์ด ข้อมูลทั้งหมดเป็นข้อมูลที่รายงานโดย Alibaba และยังไม่มีการตรวจสอบซ้ำอย่างอิสระ:
• ขนาด — 27B แบบ dense, พารามิเตอร์รวม 27.78B เมื่อนับรวม vision encoder
• สถาปัตยกรรม — 64 ชั้น, ขนาดชั้นซ่อน 5,120, คำศัพท์ 248,320.
• แอตเทนชันแบบไฮบริด — เลเยอร์แอตเทนชันเต็มรูปแบบ 16 เลเยอร์ รวมกับเลเยอร์เชิงเส้น Gated DeltaNet 48 เลเยอร์ คิดเป็นอัตราส่วน 3:1
• บริบท — 262,144 โทเคนในตัว รองรับการขยายได้ถึง 1M ผ่าน YaRN (Ollama ระบุแท็กไว้ที่ 256K)
• อินพุต — ความสามารถในการเข้าใจรูปภาพและวิดีโอแบบเนทีฟ นอกเหนือจากข้อความ ตั้งแต่เอกสารไปจนถึงวิดีโอความยาวเป็นชั่วโมง
• น้ำหนัก — 55.6 GB ในรูปแบบ BF16 รวมถึงหัว MTP สำหรับการถอดรหัสแบบคาดการณ์ล่วงหน้า

ในด้าน MLX ที่ยืนยันแล้ววันนี้: Ollama มาพร้อมกับ qwen3.8:27b-mlx — บิลด์เนทีฟ MLX สำหรับ Apple Silicon ซึ่งเป็นไฟล์ดาวน์โหลดขนาด ~18 GB แบบ 4-bit — และบันทึกประจำรุ่น v0.32.12 กล่าวถึงการปรับแต่งสำหรับ Apple Silicon mlx-lm ซึ่งเป็นชุดเครื่องมือ Python ของ Apple รองรับสถาปัตยกรรมนี้สำหรับการสร้างและการแปลง และการควอนไทซ์ MLX (3/5/6 บิต รวมถึง MXFP4 และ NVFP4) ปรากฏขึ้นภายในไม่กี่ชั่วโมงหลังจากการเผยแพร่น้ำหนักโมเดล บทความที่เหลือนี้ถือว่าผู้อ่านใช้ Mac ตระกูล M ที่มีหน่วยความจำรวม 24 GB ขึ้นไป
สิ่งที่ MLX เปลี่ยนแปลงเกี่ยวกับหน่วยความจำ
บน Apple Silicon ไม่มี VRAM แยกต่างหาก MLX ทำงานบนพูลหน่วยความจำแบบรวม (unified memory) ของซีรีส์ M ดังนั้นตัวเลขที่สำคัญคือ RAM ทั้งหมดใน Mac ของคุณลบด้วยสิ่งที่ macOS และอย่างอื่นครอบครองอยู่ โมเดลที่ "พอดีใน 17 GB" จำเป็นต้องใช้เครื่องที่มีมากกว่านั้นอย่างสบาย ๆ
ข่าวดีก็คือ Qwen3.8 27B มีต้นทุนการจัดเก็บต่ำกว่าที่จำนวนพารามิเตอร์บอกไว้ เพราะมีเพียง 16 เลเยอร์แบบ full-attention เท่านั้นที่เก็บ KV cache — ส่วน 48 เลเยอร์แบบ linear ไม่เก็บ — ดังนั้นแคชจึงมีต้นทุนประมาณ 64 KB ต่อโทเคน ซึ่งคิดเป็นประมาณหนึ่งในสี่ของที่โมเดลหนาแน่น 64 เลเยอร์ทั่วไปจ่าย และในกรณีสูงสุด หน้าต่าง 262K เต็มรูปแบบต้องใช้แคชประมาณ 16.4 GB เพิ่มจากน้ำหนักของโมเดล ซึ่งเป็นงบประมาณระดับเซิร์ฟเวอร์ ไม่ใช่ระดับแล็ปท็อป
ระดับขั้นที่ใช้ได้จริงสำหรับ Mac: ขนาดไฟล์บวกพื้นที่สำรองแคช
• 4-bit MLX — ~16–19 GB total. Fits a 24 GB Mac with roughly a 64K–96K window; the sensible default.
• MLX 6 บิต — ประมาณ 21–22 GB สำหรับเครื่อง 32 GB คุณภาพที่เพิ่มขึ้นเมื่อเทียบกับ 4 บิตนั้นไม่มากนัก
• 8-bit MLXประมาณ 27–30 GB สำหรับเครื่องที่มี RAM 48 GB ขึ้นไป คุณภาพแทบไม่สูญเสีย
• BF16 — ~55.6 GB. เฉพาะเครื่อง Mac Studio ระดับท็อปของตระกูล M-series Max และ Ultra เท่านั้น

ที่มา: ตัวเลข 4 บิตติดตามค่า GGUF Q4_K_M ที่วัดได้จริง (17.1 GB, unsloth, 14 สิงหาคม) และการดาวน์โหลด Ollama ขนาด 18 GB; ตัวเลข 8 บิตและ BF16 ติดตามการ์ด BF16 ของ Alibaba เองและสายพันธุ์ Qwen3.6-27B ตัวเลขแคช 64 KB ต่อโทเคนได้มาจากสถาปัตยกรรม ไม่ได้พิมพ์อยู่ในสเปกชีต และใช้ได้เฉพาะกับรันไทม์ที่ข้าม KV cache บนเลเยอร์เชิงเส้นแบบที่ MLX ทำเท่านั้น
สามวิธีในการรัน ตั้งแต่วิธีที่ง่ายที่สุดไปจนถึงวิธีที่ควบคุมได้มากที่สุด
เส้นทาง A — Ollama ที่ง่ายที่สุด
อัปเกรดเป็น Ollama 0.32.12 หรือใหม่กว่า จากนั้น:
• ollama pull qwen3.8:27b-mlx — ดาวน์โหลดบิลด์ MLX ขนาดประมาณ 18 GB
• ollama run qwen3.8:27b-mlx — แชทแบบโต้ตอบพร้อมเทมเพลตการคิดที่เชื่อมต่อแล้ว
• ollama serve — เปิดให้บริการ API ที่เข้ากันได้กับ OpenAI บน localhost:11434 สำหรับแอปของคุณ

จุดบกพร่องที่รู้จักกันดีจุดหนึ่ง จาก GitHub issue ที่ยังเปิดอยู่ ณ เวลาที่เขียนบทความนี้: qwen3.8:27b-mlx ปฏิเสธบทบาท "developer" บน /v1/responses endpoint ซึ่งทำให้ ollama launch codex สำหรับโมเดลนี้ใช้ไม่ได้ — ในขณะที่การเรียก ollama run โดยตรงยังทำงานได้ปกติ หากคุณกำลังสร้าง agent loop แบบ Codex บนบิลด์ MLX ให้ทดสอบ endpoint ที่คุณวางแผนจะใช้โดยเฉพาะก่อนที่จะวางเดิมพันกับลูปนั้น
เส้นทาง B — mlx-lm การควบคุมสูงสุด
เครื่องมือของ Apple เอง. ติดตั้งด้วย pip install mlx-lm จากนั้นเลือกดึง checkpoint MLX ที่ควอนไทซ์ไว้ล่วงหน้า หรือแปลงน้ำหนัก BF16 อย่างเป็นทางการด้วยตัวเอง:
• mlx_lm.generate --model <checkpoint> — รัน checkpoint ได้โดยตรง; ควอนต์ 4-bit และ 8-bit ของโมเดล 27B จากชุมชน ยังคงถูกปล่อยลงใน mlx-community ภายในไม่กี่วันหลังเปิดตัว
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — แปลงเพียงครั้งเดียว เสียค่าดาวน์โหลดประมาณหนึ่งครั้ง
• mlx_lm.server --model <checkpoint> — เซิร์ฟเวอร์ที่เข้ากันได้กับ OpenAI ซึ่งใช้เทมเพลตแชทแบบ thinking-block ให้คุณ
หาก quant เวอร์ชันที่ต้องการยังไม่ออกมา การแปลงจาก official weights เป็นงานที่ใช้เวลาไม่นานบน Mac รุ่น M-series และช่วยขจัดข้อกังขาเกี่ยวกับสิ่งที่ third party ส่งมาให้
เส้นทาง C — {{1}}LM Studio{{/1}} คลิกเดียว
LM Studio ใช้แบ็กเอนด์ MLX บน Apple Silicon และรองรับ Qwen3.8 27B ตั้งแต่เปิดตัว: ค้นหาโมเดล เลือกควอนไทซ์ที่พอดีกับ RAM ของคุณ แล้วมันจะดาวน์โหลดและรันให้ ถ้าคุณชอบ GUI นี่เป็นเส้นทางที่ง่ายที่สุด และวอล์กทรูคู่หูของเราครอบคลุมตั้งแต่ต้นจนจบ — ดู "How to Run Qwen3.8 27B Locally" ในรายการอ่านที่เกี่ยวข้องด้านล่าง
กับดักเทมเพลต
Qwen3.8 27B คิดโดยค่าเริ่มต้น และ think blocks ถูกเรนเดอร์โดย chat template ไม่ใช่โดยแกนของโมเดล การทดสอบจากบุคคลที่สามในช่วง 48 ชั่วโมงแรกชี้ว่าเทมเพลตอย่างเป็นทางการครอบเทิร์นของผู้ช่วยทุกเทิร์นด้วย think block — แม้แต่เทิร์นที่ว่างเปล่า — และในลูปเอเจนต์แบบหลายเทิร์น บล็อกจะซ้อนกันและประวัติถูกตัดทอน ซึ่งดูเหมือนความจำเสื่อม ไม่ใช่ปัญหาเรื่อง quantization หากรันไทม์มาพร้อมเทมเพลตที่แก้ไขแล้ว ให้ใช้มัน เมื่อคุณกำลังสร้างลูปเอเจนต์และไม่ต้องการการให้เหตุผล ให้ปิดการคิดในแต่ละคำขอ — chat template มีแฟล็ก enable_thinking และโมเดลรับค่า reasoning_effort เป็น xhigh, medium หรือ low
จริงๆ แล้วมันรู้สึกอย่างไร
การทดสอบอิสระบน Mac mini M4 พร้อมหน่วยความจำรวม 32 GB ซึ่งรันด้วยบิลด์ MLX 4-bit วัดความเร็วการสร้างข้อความได้ประมาณ 5–6 โทเคนต่อวินาที นี่คือตัวเลขที่ควรใช้ตั้งความคาดหวังไว้: เหมาะสำหรับการร่างเนื้อหาแบบโต้ตอบ การใช้เหตุผลแบบยาว และการเรียกใช้เอเจนต์เป็นครั้งคราว แต่ไม่เหมาะสำหรับลูปเอเจนต์ที่ยาวนานและงานแบบแบตช์ เกร็ดเล่าจากผู้ทดสอบคนเดียวกัน — การคิดนานหลายนาทีตามด้วยแอปเล็กๆ ที่ดูเหมือนถูกต้องแต่ตัวเลขกลับไม่ลงตัว — เป็นเครื่องเตือนใจที่ดีว่าโมเดล 27B บนแล็ปท็อปเป็นผู้ช่วยที่เก่ง แต่ก็ไม่ได้ไร้ข้อผิดพลาด
ความเร็วจะแปรผันตามซีรีส์ชิป: M-series Max ที่มีแบนด์วิดท์หน่วยความจำและคอร์มากกว่าจะทำงานได้เร็วกว่า M4 รุ่นพื้นฐานใน mini อย่างเห็นได้ชัด แต่ 5–6 tok/s บนรุ่นเริ่มต้นคือเกณฑ์พื้นฐานที่ซื่อสัตย์ และคุณควรตัดสินพาดหัวข่าวใดๆ ที่ว่า "รันบน Apple Silicon" ด้วยตัวเลขนี้
คอนเท็กซ์ 262K เป็นฟีเจอร์ของเซิร์ฟเวอร์
หน้าต่างบริบท 262K ดั้งเดิมของ Qwen3.8 27B มีประโยชน์จริง — แต่บน Mac มันถูกจำกัดด้วยหน่วยความจำ ไม่ใช่ด้วยตัวโมเดล ด้วย KV cache 64 KB ต่อโทเคน หน้าต่าง 8K มีค่าใช้จ่ายประมาณ 0.5 GB, 32K ประมาณ 2 GB, 128K ประมาณ 8 GB และเต็ม 262K ประมาณ 16.4 GB เพิ่มจากน้ำหนักของโมเดล บนเครื่อง 24 GB ที่รันแบบ 4-bit เพดานที่ทำได้จริงอยู่ที่ประมาณ 64K–96K โทเคน การจะไปถึง 128K+ ต้องใช้เครื่อง 32 GB+ และหน้าต่างเต็มต้องใช้เครื่องที่หน่วยความจำรวมส่วนใหญ่เป็นแคช วางแผนบริบทที่คุณจำเป็นจริงๆ และตั้งค่าสูงสุดในการกำหนดค่ารันไทม์ — โมเดลก็พอใจ และไฟล์สว็อปของคุณก็เงียบ
เมื่อ Apple Silicon คือคำตอบที่ผิด
เลือกใช้เส้นทางอื่น หากสิ่งใดสิ่งหนึ่งต่อไปนี้เป็นภาระงานของคุณ:
คุณมี Mac ขนาด 8 GB หรือ 16 GB บิลด์แบบ 4-bit ต้องการหน่วยความจำรวม ~17 GB อยู่แล้ว หากน้อยกว่านั้นระบบจะสวอปและโมเดลใช้งานไม่ได้ นี่คือจุดพลาดที่พบบ่อยที่สุด และไม่ว่าจะใช้เทคนิค quantization แบบไหนก็แก้ไม่ได้
• คุณต้องใช้หน้าต่าง 262K เต็มรูปแบบ หรือส่วนขยาย YaRN ขนาด 1M งบประมาณ KV นั้นเป็นงบประมาณสำหรับเซิร์ฟเวอร์ ไม่ใช่สำหรับแล็ปท็อป
• คุณกำลังให้บริการผู้อื่น แล็ปท็อปหนึ่งเครื่องคือหนึ่งที่นั่ง; ปริมาณงานสำหรับผู้ใช้หลายคนต้องใช้กล่อง GPU หรือ hosted API
• คุณต้องทำงานให้เร็วในลูป agentic ที่ยาว 5–6 tok/s ก็เพียงพอสำหรับมนุษย์ที่อ่านตาม แต่ถือว่าช้าสำหรับ sub-agent
การวางกรอบอย่างตรงไปตรงมาคือ: จุดขายของ Qwen3.8 27B คือมันใช้งานได้ฟรี ณ จุดที่ใช้บนฮาร์ดแวร์ที่คุณเป็นเจ้าของ — ตรงข้ามกับโมเดล API ที่คิดเงินต่อโทเคน นั่นคือเหตุผลที่มันไม่ถูกจัดอยู่ในแคตตาล็อกของ OrcaRouter (แคตตาล็อกนั้นจัดการกับเจนเนอเรชัน Qwen3.6/3.5-27B รุ่นก่อนหน้า และสาย Qwen API ที่โฮสต์ไว้) เราเป็นเครื่องมือที่ไม่เหมาะกับเรื่องราวแบบฟรีบนเครื่องของตัวเอง และนั่นคือประเด็น: เมื่อปริมาณงานเกินขีดจำกัดของ Mac ทางเลือกคือกล่อง GPU, เช่า GPU, หรือ Qwen API ที่โฮสต์ไว้ — ไม่ใช่เราเตอร์ที่บังเอิญมีขนาด 27B รุ่นนี้จำหน่าย
บรรทัดล่าง
Qwen3.8 27B บน Apple Silicon มีจริง ใช้งานได้ดี และมีขอบเขตจำกัดอย่างแคบ บิลด์ MLX แบบ 4-bit เหมาะกับ Mac ที่มี RAM 24 GB ขึ้นไป ดาวน์โหลดในชื่อ qwen3.8:27b-mlx ใน Ollama ไม่เสียค่าใช้จ่ายต่อโทเคน และเป็นโอเพนโมเดลระดับเอเจนต์ที่ใช้งานได้จริงรุ่นแรกที่พอดีกับแล็ปท็อป ข้อแลกเปลี่ยนคือความเร็ว (5–6 tok/s บน M4 mini) และบริบท (จำกัดให้ต่ำกว่า 262K มาก ๆ เว้นแต่คุณมี RAM พอ) ถ้าคุณมี Mac ที่ RAM 24 GB ขึ้นไป และมีงานที่ 27B รับได้ นี่คือโมเดลท้องถิ่นฟรีที่ดีที่สุดที่มีในสัปดาห์นี้ ถ้าคุณมี Mac 16 GB หรือต้องการปริมาณงานระดับโปรดักชัน มันไม่ใช่ตัวเลือก — และทางเลือกอื่นคือเส้นทางที่ต้องจ่ายเงิน ซึ่งเป็นการตัดสินใจที่แตกต่างไปโดยสิ้นเชิง
