
Qwen3.8-27B บน Ollama: คำสั่งเดียว ควอนต์สี่แบบ และต้นทุนที่แท้จริงของ "ฟรี"
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 ต่อ 1 ล้านโทเค็น · 18 tok/s
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
รันด้วยคำสั่งเดียว: ollama run qwen3.8:27b นั่นคือคำตอบทั้งหมดสำหรับคำถามที่หน้านี้กล่าวถึง Qwen3.8 27B — โมเดล dense ที่มีพารามิเตอร์ 27 พันล้านของ Alibaba ปล่อยน้ำหนักเมื่อวันที่ 14 สิงหาคม 2026 ภายใต้ Apache 2.0 — ถูกเพิ่มในคลังของ Ollama เมื่อสัปดาห์นี้ และบิลด์เริ่มต้นก็คือควอนไทซ์ Q4_K_M ขนาด 18 GB ที่สมเหตุสมผล (น้ำหนัก 17 GB รวมตัวเข้ารหัสภาพ 931 MB) มันรันเต็มรูปแบบบน GPU 24 GB ที่ความยาวบริบทปกติ และแบ่งไปใช้ CPU เมื่อการ์ดของคุณเล็กกว่า และไม่เสียค่าใช้จ่ายต่อโทเคน
ทุกอย่างที่นี่ระบุวันที่ 15 สิงหาคม 2026 สเปกอ้างอิงจากโมเดลการ์ดของ Qwen3.8 27B; ขนาดดาวน์โหลด แท็ก และจำนวนดาวน์โหลดอ้างอิงจากหน้าไลบรารี Ollama แบบสด; ตัวเลข benchmark เป็นข้อมูลที่ Alibaba รายงานและยังไม่มีการตรวจสอบซ้ำโดยอิสระ โมเดลเพิ่งเปิดตัวเมื่อไม่กี่วันก่อน ดังนั้นโปรดถือว่าสิ่งใดก็ตามที่อาจเปลี่ยนแปลงได้เป็นข้อมูลเบื้องต้น
หนึ่งบรรทัดที่ใช้ได้จริง
หากคุณได้ติดตั้ง Ollama ไว้แล้ว คุณก็แค่ต้องพิมพ์อีกสองคำ:
ollama run qwen3.8:27b
การรองรับ Ollama มาถึงใน v0.32.12 — บันทึกรุ่นระบุไว้อย่างตรงไปตรงมาว่า "รุ่นนี้เพิ่มการรองรับ Qwen 3.8 27B" การรันครั้งแรกจะดาวน์โหลดบิลด์เริ่มต้น (ประมาณ 18 GB, Q4_K_M) จากนั้นจะพาคุณเข้าสู่ REPL แชทโดยเปิดโหมดคิด (thinking mode) ไว้เป็นค่าเริ่มต้น หน้าไลบรารีแสดงบิลด์พร้อมแท็กความสามารถ "vision tools thinking 27b" ซึ่งเป็นวิธีที่คุณรู้ว่าพาธสำหรับวิชันและการเรียกใช้เครื่องมือถูกเชื่อมไว้ในการดาวน์โหลดเดียวกัน ในขณะที่เขียนนี้ หน้าแสดงการดาวน์โหลดมากกว่า 40,000 ครั้ง และรายการแท็กที่ครอบคลุมถึงสิบเอ็ดรูปแบบแล้ว

สองเวอร์ชันที่คุณจะหยิบใช้จริงๆ:
• ollama run qwen3.8:27b-mlx — บิลด์สำหรับ Apple Silicon ใช้พื้นที่เท่าเดิม 18 GB แต่คอมไพล์สำหรับ Metal; เป็นเวอร์ชันที่รีลีสโน้ตของ Ollama ระบุว่าปรับแต่งเป็นพิเศษ "เพื่อประสิทธิภาพสูงสุดและคุณภาพผลลัพธ์ที่เหมาะสำหรับงานที่ทำซ้ำและเอเจนต์เขียนโค้ด"
• ollama run qwen3.8:27b-q8_0 — ควอนไทซ์ 8 บิตขนาด 30 GB สำหรับเมื่อคุณมี VRAM และต้องการน้ำหนักที่ใกล้เคียงความแม่นยำเต็ม
สิ่งที่คุณกำลังดาวน์โหลดจริงๆ
ชื่อบอกว่า 27B แต่จำนวนพารามิเตอร์จริงทั้งหมดคือ 28B: โมเดลภาษาแบบ dense ขนาด 27.3B บวกกับ vision encoder ขนาด 461M ซึ่งทำให้รองรับอินพุตรูปภาพและวิดีโอได้โดยตรง สเปกที่เหลือจากหัวข้อข่าว ตรงจาก model card:
• 64 เลเยอร์, ขนาดฮิดเดน 5,120, คำศัพท์ 248,320.
ไฮบริดแอตเทนชัน: เลเยอร์ Gated Attention เต็มรูปแบบ 16 เลเยอร์ และเลเยอร์ Gated DeltaNet แบบเชิงเส้น 48 เลเยอร์ — อัตราส่วนลีน-เชิงเส้น 3:1 และเป็นเหตุผลที่โมเดล 27B สามารถรักษาบริบทเนทีฟ 262,144 โทเคน (ขยายได้ถึง 1M) ได้โดยไม่ต้องให้แคช KV กินทรัพยากรทั้งดาตาเซ็นเตอร์
• ความเข้าใจภาพและวิดีโอโดยกำเนิด — "ตั้งแต่ไดอะแกรมและเอกสาร STEM ไปจนถึงวิดีโอความยาวเป็นชั่วโมง" เป็นถ้อยคำของ Alibaba
• Apache 2.0. ดาวน์โหลดได้ แก้ไขได้ ขายผลิตภัณฑ์จากมันได้ ใบอนุญาตนั้นคือข้อเท็จจริงทางกฎหมายที่เศรษฐศาสตร์ส่วนที่เหลือของบทความนี้ต้องพึ่งพา
การอ้างอิงแบบความแม่นยำเต็มคือ BF16 ซึ่งเป็นเหตุผลว่าทำไมแท็ก 56 GB จึงมีอยู่; แท็กที่เล็กกว่าทุกแท็กคือการแลกเปลี่ยนความแม่นยำกับขนาดพื้นที่จัดเก็บ และเกณฑ์วัดประสิทธิภาพของโมเดลการ์ดเองคือสิ่งที่คุณกำลังแลกด้วย
เลือก quant ก่อน แล้วค่อยตรวจ VRAM ของคุณ ไม่ใช่ในทางกลับกัน
Ollama ให้แท็กถึงสิบเอ็ดแท็ก แต่การตัดสินใจกลับลดลงเหลือเพียงสามขนาด
• 18 GB — Q4_K_M (ค่าเริ่มต้น). ใส่ได้เต็มในการ์ด 24 GB (ระดับ RTX 4090 / 5090) ที่บริบทปกติ และบนการ์ด 16 GB ด้วยการ offload CPU บางส่วน — ช้าลง แต่ก็ใช้งานได้ นี่คือบิลด์สำหรับ "แค่รันมัน"
• 30 GB — Q8_0. น้ำหนักใกล้เคียงความแม่นยำเต็มรูปแบบ ต้องใช้ VRAM ประมาณ 40 GB เพื่อให้อยู่ใน GPU ได้ทั้งหมด สำหรับรุ่น 27B คุณน่าจะรู้อยู่แล้วว่าทำไมถึงต้องการความเที่ยงตรงที่เพิ่มขึ้นก่อนจะจ่ายเงินเพื่อมัน
• 56 GB — BF16.บิลด์อ้างอิง. ต้องใช้ฮาร์ดแวร์ระดับ H100 หรือ 96 GB. ไม่มีใครรันสิ่งนี้บน GPU ระดับผู้บริโภค และนั่นก็ไม่เป็นไร.

ตัวเลขที่ทำให้หลายคนพลาดคือ KV cache การดาวน์โหลด 18 GB ไม่ได้หมายความว่า VRAM 18 GB จะเพียงพอสำหรับเซสชันที่มีบริบท 262K — ในบริบทยาว แคชจะเพิ่มอีกหลายกิกะไบต์บนน้ำหนักของโมเดล ซึ่งเป็นเหตุผลที่การ์ด 24 GB จะรองรับโมเดลนี้ได้อย่างสบายๆ ที่บริบท 8K–32K แต่ไม่ใช่ที่ 262K สำหรับการ์ดที่ใกล้จะเต็ม ให้ลดบริบท อย่าลด quant
Apple Silicon เป็นเป้าหมายระดับแรกที่นี่
บันทึกประจำรุ่น v0.32.12 ของ Ollama กล่าวถึง macOS โดยเฉพาะ กล่าวคือ คำสั่ง {{1}}ollama run qwen3.8:27b-mlx{{/1}} ต้องการหน่วยความจำรวมประมาณ 18 GB ดังนั้น Mac ที่มี 24 GB ขึ้นไปจึงสามารถรันได้เต็มรูปแบบบน GPU โดยมีพื้นที่เหลือสำหรับ context นอกจากนี้ยังมีแท็ก {{2}}32 GB mxfp8 MLX{{/2}} และแท็ก {{3}}56 GB mlx-bf16{{/3}} สำหรับเครื่องที่มี 64–128 GB หาก Mac ตระกูล M-series ของคุณกำลังรอคอยข่าวของรุ่นเดสก์ท็อป นี่คือบิลด์ที่คุณรอคอยอยู่
262K บนสเปกชีต แต่น้อยกว่าในที่นั่งจริง
โมเดลการ์ดระบุโทเค็นเนทีฟ 262,144 ตัว ขยายได้ถึง 1M; หน้าห้องสมุดของ Ollama รายงานหน้าต่างเดียวกันเป็น 256K ทั้งสองเป็นจริง — 262,144 คือ 256K คูณ 1024 — และทั้งสองไม่ได้หมายความว่าคุณควรพิมพ์ตัวเลขนั้นลงใน --num-ctx บนการ์ด 24 GB แคช KV เติบโตโดยประมาณเชิงเส้นตามบริบท ดังนั้นบนฮาร์ดแวร์สำหรับผู้บริโภค คุณจะใช้งานที่ 16K–64K ไม่ใช่ 262K เริ่มต้นด้วยค่าเริ่มต้นของ Ollama เพิ่ม --num-ctx เฉพาะเมื่องานต้องการจริง ๆ และจำไว้ว่าตัวเลข 1M ต้องใช้กลไกการขยายและ VRAM เพื่อรองรับมัน
อะไรที่ยังไม่แน่นอน — อ่านอันนี้ก่อนที่คุณจะเดิมพันกับมัน
• ยังไม่มีผลการทดสอบมาตรฐานอิสระ ตัวเลขทั้งหมดบนการ์ดโมเดลเป็นเพียงคำกล่าวของ Alibaba ณ วันที่ 15 สิงหาคม ผลลัพธ์ที่อ้างว่าดีกว่า Qwen3.6-27B นั้นมีความต่างมาก — SWE-bench Pro 61.7 vs 53.5, Terminal Bench 2.1 73.0 vs 63.4, LiveCodeBench v6 90.3 vs 83.9, GPQA Diamond 89.2 vs 87.8 — ซึ่งทั้งหมดดูเป็นไปได้ และยังไม่มีผลลัพธ์ใดที่ถูกทำซ้ำโดยเครื่องมือทดสอบภายนอก อย่าตัดสินใจเรื่องการใช้งานจริงโดยอิงจากตัวเลขเหล่านี้เพียงอย่างเดียว
• สแตกวิทัศน์เพิ่งถูกพัฒนามาได้ไม่กี่วัน รายงานบั๊กในระยะแรก (ollama issue #17753) แสดงให้เห็นว่าบิลด์ Q4 ส่งอินพุตภาพผ่านพาร์เซอร์ Qwen3.5 และไม่สามารถประมวลผลรูปภาพได้; โดยได้รับการแก้ไขภายในไม่กี่วันใน PR #17755 แต่เส้นทาง multimodal บนโมเดลที่เพิ่งออกมาได้สัปดาห์เดียวคือจุดที่คุณควรทดสอบก่อนจะวางใจใช้งาน
• บิลด์เริ่มต้นมาพร้อม MTP แท็ก q4_K_M ยังเป็นบิลด์ multi-token-prediction — ถอดรหัสเร็วกว่า และเป็นเหตุผลที่ "18 GB" และ "27B" อยู่ร่วมกันได้โดยไม่ขัดแย้ง
• ป้ายกำกับ Quant อาจทำให้เข้าใจผิดบน Apple ได้ แท็ก "mlx" และ "nvfp4" ขนาด 18 GB ต่างกันที่การควอนไทซ์ — NVFP4 เป็นรูปแบบ FP4 ของ NVIDIA — ดังนั้นบน Mac ควรเลือกบิลด์ -mlx ทั่วไป เว้นแต่คุณจำเป็นต้องใช้เวอร์ชัน FP8/FP4 สำหรับ GPU Blackwell โดยเฉพาะ
"ฟรี" กำลังทำงานหนักมากในพาดหัวนั้น
การโฮสต์โมเดล 27B ด้วยตัวเองนั้นฟรีต่อโทเค็น แต่มันไม่ได้ฟรีจริง ๆ กรอบที่ตรงไปตรงมาคือสามทางเลือกที่ใช้สกุลเงินที่แตกต่างกัน:
• รันด้วยตัวเอง (Ollama). $0 ต่อโทเคน ออฟไลน์ ไม่จำกัด ส่วนตัว — และฮาร์ดแวร์เป็นของคุณ การซื้อ GPU 24 GB หรือ Mac 18 GB+ ถือเป็นการลงทุนจริง เช่นเดียวกับค่าไฟฟ้าและเวลาที่ใช้ในการตั้งค่า นี่คือทางเลือกที่ถูกต้องเมื่อ Qwen3.8 27B กลายเป็นตัวขับเคลื่อนประจำวัน
• เรียกใช้ API แบบจำกัดอัตราที่ราคา $0OrcaRouter ให้บริการ Qwen3.8 27B บนโครงสร้างพื้นฐานของตัวเองโดยไม่มีค่าใช้จ่าย (รหัสโมเดล qwen/qwen3.8-27b-free, $0 ต่อคำขอ, มีการจำกัดอัตรา) — เนื่องจากน้ำหนักของโมเดลเป็นแบบเปิด จึงไม่มีต้นทุนต่อโทเค็นจากผู้ให้บริการที่ต้องส่งผ่าน นี่คือการตัดสินใจที่ถูกต้องเมื่อคุณต้องการลองใช้โมเดลโดยไม่ต้องซื้อฮาร์ดแวร์เพื่อทดสอบรีลีสที่ออกมาได้หนึ่งสัปดาห์
• เรียกใช้ API แบบไม่จำกัดโมเดลเดียวกันแบบไม่มีขีดจำกัดอัตราการเรียกใช้มีราคา $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านโทเคนเอาต์พุตบน OrcaRouter (qwen/qwen3.8-27b, บริบท 262K, อินพุตข้อความ รูปภาพ และวิดีโอ) นี่คือตัวเลือกที่เหมาะสมเมื่อคุณต้องการขนาดการใช้งานระดับโปรดักชันและไม่อยากเฝ้าดูแล GPU

คณิตศาสตร์ที่ใช้ตัดสินใจระหว่างตัวเลือกเหล่านี้: การใช้งานเป็นครั้งคราวคุ้มค่าในราคา $0 หรือ $0.33/$2.40 มากกว่าราคาของ GPU; การใช้งานแบบโต้ตอบทุกวันถูกกว่าเมื่อใช้เครื่องของตัวเอง; ปริมาณงานผลิตที่ต่อเนื่องถูกที่สุดในรูปแบบ API ที่คุณไม่ต้องคอยดูแลให้ทำงานอยู่ ข้อกำหนดด้านความเป็นส่วนตัวและการใช้งานแบบออฟไลน์ผลักดันให้คุณเลือกคอลัมน์แรกไม่ว่าคณิตศาสตร์จะคำนวณออกมาอย่างไรก็ตาม
เมื่อคำแนะนำนี้ไม่ถูกต้อง
• คุณต้องการบริบท 100K+ จริงๆ โมเดลทำได้ แต่การ์ด 24 GB ของคุณทำไม่ได้ ในการใช้งานบริบทยาวจริงๆ GPU 40 GB+ หรือ API ที่รองรับบริบทยาวกว่านั้นไม่ใช่เรื่องฟุ่มเฟือย
• คุณต้องการวิดีโอในโปรดักชันวันนี้ เส้นทางวิทัศน์เพิ่งได้รับการแก้ไขบั๊กของพาร์เซอร์; วิดีโอโปรดักชันบนโมเดลมัลติโมดัลอายุหนึ่งสัปดาห์คือการเดิมพันที่คุณไม่ควรวางโดยไม่มีแผนสำรอง
• คุณต้องการการทำงานแบบพร้อมกัน GPU ระดับผู้บริโภคหนึ่งตัวสตรีมผลลัพธ์ได้เพียงหนึ่งหรือสองเจนเนอเรชันต่อครั้ง 27B ไม่ใช่เครื่องให้บริการ
• คุณใช้ฮาร์ดแวร์ที่มีเฉพาะ CPU โมเดล 27B ที่ 4-bit บน CPU เป็นการสาธิตที่ช้า ไม่ใช่เครื่องมือใช้งานจริง การใช้ API เป็นทางเลือกที่ตรงไปตรงมาจนกว่าคุณจะมี GPU
สรุป
Qwen3.8 27B บน Ollama คือวิธีที่ง่ายที่สุดในการรันโมเดลรุ่นปัจจุบันขนาด 27B ที่ใครก็ตามเคยปล่อยออกมา: คำสั่งเดียว, ค่าเริ่มต้น 18 GB ที่พอดีกับการ์ด 24 GB, บิลด์สำหรับ Apple Silicon ที่เป็นพลเมืองชั้นหนึ่ง, และอิสรภาพแบบ Apache 2.0 ควอนต์ที่คุณควรเลือกแทบจะalwaysเป็นค่าเริ่มต้น Q4_K_M — เลื่อนไป q8_0 เฉพาะเมื่อคุณวัดความแตกต่างได้ และ "ฟรี" นั้นมีเงื่อนไข: ถ้าคุณจะแตะโมเดลเป็นครั้งคราว API แบบจำกัดอัตราที่ราคา $0 ก็ฟรีกว่าการซื้อฮาร์ดแวร์; ถ้ามันกลายเป็นตัวขับเคลื่อนประจำวันของคุณ สำเนาในเครื่องคือสิ่งที่ถูกที่สุดที่คุณมี ตรวจสอบตัวเลขก่อนที่คุณจะสร้างอะไรบนนั้น — ทุกอย่างในบทความนี้เป็นจริงเมื่อวันที่ 15 สิงหาคม 2026 และโมเดลนี้เปลี่ยนไปทุกวัน
