
Qwen3.8-27B-Uncensored-MLX บน Apple Silicon: วิธีเลือกบิลด์ของคุณ โหลดใน LM Studio หรือ mlx-vlm และจัดการคอนเท็กซ์ 262K
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
สิ่งที่มีประโยชน์ที่สุดที่ควรรู้เกี่ยวกับ orcarouter/Qwen3.8-27B-Uncensored-MLX ก็คือคุณไม่จำเป็นต้องเลือกโฟลเดอร์ย่อยเพื่อเรียกใช้งานมัน บิลด์ abliterated สำหรับ Apple Silicon ของ OrcaRouter จาก Qwen/Qwen3.8-27B — เผยแพร่บน Hugging Face เมื่อวันที่ 17 สิงหาคม 2026 ดังนั้นจึงไม่ใช่เรื่องใหม่ แค่มีเอกสารประกอบน้อย — ได้เก็บสำเนาบิลด์แบบ 4-bit ไว้ที่ root ของ repo โดยเฉพาะเพื่อให้เครื่องมือที่มองแต่ละ repo เป็นหนึ่งโมเดล ซึ่งที่สำคัญที่สุดคือ LM Studio สามารถโหลดมันได้โดยไม่ต้องตั้งค่าอะไรเลย การตัดสินใจเพียงข้อเดียวนี้เองที่ทำให้การ์ดนี้มียอดดาวน์โหลดประมาณ 83,000 ครั้งในเดือนที่ผ่านมา ในขณะที่โมเดล MLX ที่เทียบเท่ากันได้สัดส่วนเพียงเล็กน้อยเท่านั้น อย่างอื่นทั้งหมดเกี่ยวกับมันคือทางเลือกที่แท้จริง: ว่าความแม่นยำแบบใดในสี่แบบที่เหมาะกับหน่วยความจำรวมของ Mac ของคุณ คุณจะใช้รันเนอร์ตัวไหน ความสามารถด้านวิทัศน์และการเรียกใช้เครื่องมือจะยังทำงานได้หรือไม่ที่บิตเวดท์ของคุณ และหน้าต่างบริบท 262,144 โทเคนนั้นคุ้มกับสิ่งที่มันแลกมาบนฮาร์ดแวร์ของคุณหรือไม่ รันบุ๊คนี้จะพาคุณผ่านการตัดสินใจเหล่านี้ตามลำดับ มันเป็นเอกสารจากผู้ผลิตโดยตรง — ขนาด ความแม่นยำ และตัวเลขความเที่ยงตรงด้านล่างเป็นของ OrcaRouter เอง วัดจากบิลด์นี้โดยเฉพาะ และตัวเลขจากชุมชนทุกตัวจะถูกติดป้ายกำกับไว้อย่างชัดเจน

ในรีโพนี้มีอะไรอยู่บ้าง
นี่คือบิลด์แบบ abliterated ของ Qwen/Qwen3.8-27B — โมเดลแบบ dense ขนาด 27B ที่ใช้ hybrid-attention (linear attention แบบ Gated DeltaNet รวมกับ full attention), รองรับ vision-language โดยกำเนิด, มีการควบคุมการคิด, การเรียกใช้เครื่องมือ, หัว multi-token-prediction (MTP), และหน้าต่างบริบทขนาด 262,144 โทเคน Abliteration จะลบพฤติกรรมการปฏิเสธของโมเดลโดยการ orthogonalize ทิศทางของการปฏิเสธออกจาก residual stream; หากคุณยังไม่คุ้นเคยกับเทคนิคนี้ เอกสารแนะนำเกี่ยวกับเทคนิคของเราเป็นจุดเริ่มต้นที่ดีกว่าหน้านี้ ซึ่งเกี่ยวกับการรันบิลด์ ไม่ใช่ตัววิธีการ น้ำหนักของโมเดลเป็น Apache-2.0 ซึ่งสืบทอดมาจากโมเดลฐาน
อย่าสับสนระหว่าง repo นี้กับ qwen-3-8-27b-mlx ซึ่งเป็นโมเดลพื้นฐานตัวเดียวกันในรูปแบบ MLX โดยไม่มี การทำ abliteration ผู้อ่านมักจะโหลดตัวหนึ่งไปทั้งที่ตั้งใจจะได้อีกตัวหนึ่ง: ตัวนี้เป็นบิลด์สำหรับงานวิจัยที่เอาความสามารถในการปฏิเสธออกแล้ว ส่วนตัวนั้นเป็น Qwen/Qwen3.8-27B ทั่วไปบน Apple Silicon ตรวจสอบชื่อ repo ให้ดีก่อนจะเสียเวลาโหลด
รายละเอียดเชิงโครงสร้างอย่างหนึ่งสำคัญกว่าที่เห็น: vision tower, นอร์มทั้งหมด และ linear-attention conv1d ยังคงอยู่ใน BF16 และมีเพียงเลเยอร์เชิงเส้นของโมเดลภาษาเท่านั้น — รวมถึง embed_tokens และ lm_head — ที่ถูก quantize นี่คือเหตุผลที่ความเข้าใจภาพยังอยู่รอดหลังการ quantize และยังเป็นเหตุผลที่ขนาดบนดิสก์ด้านล่างใหญ่กว่าค่าประมาณแบบง่าย ๆ ของ "27B ที่ N บิต" เล็กน้อย: โมเดลบางส่วนไม่ถูกบีบอัดเลย
การตัดสินใจ: บิลด์ไหนเหมาะกับ Mac รุ่นไหน

ความแม่นยำสี่แบบมาในโฟลเดอร์ย่อย — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — ทั้งหมดเป็นการควอนไทซ์แบบ affine ของ MLX ที่ group size 64 บิลด์ 4-bit ยังถูกมิเรอร์เพิ่มเติมที่ root ของ repo เลือกตามหน่วยความจำ unified ของ Mac ก่อน แล้วค่อยพิจารณาคุณภาพ:
• 8-bit — ประมาณ 27.5 GB บนดิสก์ ต้องใช้ Mac 64 GB (เครื่อง 32 GB โหลดได้แต่แทบไม่เหลือพื้นที่สำหรับอย่างอื่น) วัดความเที่ยงตรงแบบโคไซน์เทียบกับต้นฉบับ BF16 ได้ 0.9997 ซึ่งถือว่าแทบไม่สูญเสียข้อมูล เลือกใช้เมื่อคุณภาพสำคัญที่สุดและมีหน่วยความจำเพียงพอ
• 6-bit — ประมาณ 22 GB เหมาะกับ Mac 24–32 GB Fidelity 0.9996 ดีเยี่ยม เป็นความสมดุลระหว่างคุณภาพต่อจิกะไบต์ที่ดีที่สุดสำหรับผู้ใช้เครื่อง 48 GB ส่วนใหญ่
• 4-bit — ประมาณ 15 GB ทำงานได้อย่างสบายบน Mac 24 GB ค่า Fidelity 0.996 ดีมาก นี่คือค่าเริ่มต้นที่เราแนะนำ และเป็นไฟล์ที่ root ของ repo ด้วยเหตุผลดังกล่าว
• 2 บิต — ประมาณ 8.7 GB ใส่ใน Mac 16 GB ได้. ความเที่ยงตรง 0.92 และที่ 27B เสื่อมสภาพอย่างรุนแรง: วนซ้ำ, ข้อความเพี้ยน, โค้ดและภาษาจีน, การมองเห็นบางส่วน. การ์ดระบุชัดเจน — ใช้เก็บถาวรเท่านั้น ไม่เหมาะกับงานจริง. Mac 16 GB โหลดได้ในทางเทคนิค แต่นั่นไม่ได้ทำให้มันใช้งานได้.
ขนาดบนดิสก์ไม่ใช่ตัวเลขที่ใช้วัดหน่วยความจำ ค่าน้ำหนักต้องพอดีกับหน่วยความจำแบบรวม (unified memory) ควบคู่ไปกับ macOS, KV cache และบัฟเฟอร์ชั่วคราวของ Metal ดังนั้นควรเผื่อพื้นที่ไว้ การทดสอบโดยชุมชนสำหรับบิลด์ 4-bit บน Mac M1 Pro 32 GB วัดค่าน้ำหนักบนดิสก์ได้ประมาณ 16 GB แต่จุดสูงสุดระหว่างการทำ inference อยู่ที่ 18.5–21.7 GB ส่วนการทดสอบของชุมชนสำหรับบิลด์ MLX 8-bit รายงานจุดสูงสุดประมาณ 34–36 GB แม้ว่าน้ำหนักจะอยู่ที่ประมาณ 29.5 GB แนวทางปฏิบัติจากการทดสอบโดยชุมชนเดียวกันคือ: 16 GB ไม่ใช่ตัวเลือกที่ใช้งานได้จริงสำหรับโมเดล 27B, 24 GB พอจะลองใช้ 4-bit กับบริบทสั้น ๆ ได้ และ 32 GB คือจุดเริ่มต้นที่สบาย ๆ บทความการวางแผน VRAM ของเราใช้การคำนวณแบบเดียวกันสำหรับโมเดลทั้งตระกูล
เนื่องจากรายการในรีโพทั้งหมดมีขนาดรวมประมาณ 94 GB ในทุกความแม่นยำ ให้ดาวน์โหลดเฉพาะโฟลเดอร์ย่อยที่คุณต้องการด้วย hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — โดยแทนที่ความแม่นยำที่คุณเลือก สำเนา 4-bit ที่ระดับรากเป็นสำเนาที่ซ้ำกับโฟลเดอร์ย่อย 4-bit ดังนั้นคุณจึงไม่จำเป็นต้องดาวน์โหลดทั้งสอง
เส้นทางแรก — LM Studio ไม่ต้องตั้งค่าใดๆ
สำเนา 4-bit หลักมีอยู่เพื่อให้ LM Studio สามารถจัดการทั้ง repo เป็นโมเดลเดียว ค้นหารหัสโมเดล เลือกความแม่นยำที่ต้องการ (สำเนาหลักคือ 4-bit) และแอปจะจัดการส่วนที่เหลือ ข้อควรระวังสามข้อ ทั้งหมดจาก card ของเรา และสิ่งเหล่านี้คือความแตกต่างทั้งหมดระหว่างการทำงานนี้กับความล้มเหลว:

• Repo นี้มีการจำกัดการเข้าถึงการดาวน์โหลดโดยไม่ระบุตัวตนจะได้รับ HTTP 401 ยอมรับข้อกำหนดบนหน้าโมเดล จากนั้นวาง read token ของ Hugging Face ลงใน LM Studio ที่ Settings → Integrations → Hugging Face หากข้ามขั้นตอนนี้ การโหลดก็จะล้มเหลว
• ปิดใช้งานการ quantization ของ KV cache. โมเดล vision ของ MLX ไม่รองรับคุณสมบัตินี้บนสถาปัตยกรรมนี้ และการโหลดจะล้มเหลวระหว่างการเริ่มต้นระบบหากเปิดใช้งาน (ติดตามเป็น mlx-engine#286). ซึ่งตรงกันข้ามกับคำแนะนำสำหรับบิลด์ GGUF โดยที่การ quantize แคช K/V เป็นการประหยัด VRAM ที่ใช้ได้จริง — ทั้งสองรูปแบบไม่สามารถใช้แทนกันได้ในกรณีนี้.
• อัปเดตรันไทม์. qwen3_5 ได้รับการรองรับสถาปัตยกรรมใน mlx-vlm 0.6.x; รันไทม์ที่มาพร้อมกับแอปรุ่นเก่าไม่สามารถโหลดน้ำหนักเหล่านี้ได้เลย. ป้าย 'อาจใหญ่เกินไป' ของ LM Studio ในทางตรงกันข้าม เป็นเพียงคำเตือนเรื่อง RAM ไม่ใช่ข้อผิดพลาด — ไม่ต้องสนใจมัน หากหน่วยความจำรวมของคุณตรงตามข้อกำหนดข้างต้น.
ความแม่นยำระดับไหนใน LM Studio: 8-bit ใช้พื้นที่ดิสก์ประมาณ 29.5 GB และต้องการ Mac 64 GB; 6-bit ประมาณ 22 GB เหมาะกับเครื่อง 48 GB; 4-bit ที่ประมาณ 16 GB เป็นตัวเลือกที่เหมาะสมสำหรับ Mac 32 GB หากคุณต้องการใช้เส้นทาง llama.cpp / Ollama บนฮาร์ดแวร์อื่น คู่มือการรันในเครื่องสำหรับโมเดล uncensored ของเราจะครอบคลุมเส้นทางนั้นแยกต่างหาก
เส้นทางที่สอง — mlx-vlm และ mlx-lm จากโฟลเดอร์ย่อย
เส้นทางแบบ command-line ให้ความแม่นยำโดยตรง และมีเซิร์ฟเวอร์ที่เข้ากันได้กับ OpenAI สำหรับเครื่องมือเอเจนต์ ข้อกำหนด: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 และ mlx ≥ 0.32; แบ็กเอนด์ Metal ถูกเลือกโดยอัตโนมัติบน Apple Silicon) หลังจากดาวน์โหลดโฟลเดอร์ย่อยด้านบนแล้ว:
python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "อธิบายการพัวพันเชิงควอนตัมในหนึ่งประโยค" --max-tokens 256
เพิ่ม --image path/to/image.png สำหรับอินพุตรูปภาพ หรือเสิร์ฟภาพนั้น:
python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080
For agent frameworks that speak OpenAI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.
วิสัยทัศน์รอดพ้นจากการควอนไทเซชัน
เนื่องจาก vision tower และ conv1d ยังคงอยู่ใน BF16 ความสามารถในการเข้าใจภาพจึงยังคงไว้ที่ 4/6/8-bit ในการทดสอบภาพของเรา — รูปทรง สี ตำแหน่ง พื้นหลัง และข้อความภายในภาพ — บิลด์แบบ 4/6/8-bit อธิบายทุกอย่างได้อย่างถูกต้อง ส่วนแบบ 2-bit ทำได้เพียงบางส่วนเท่านั้น หากคุณกำลังเลือกบิลด์และให้ความสำคัญกับเรื่องภาพ 4-bit คือระดับต่ำสุดที่คุณควรใช้ เรายังไม่ได้เผยแพร่ตัวเลขปริมาณงาน (throughput) ด้านการประมวลผลภาพเฉพาะสำหรับ Apple Silicon สำหรับบิลด์นี้ ดังนั้นอย่าเชื่อถือค่า tok/s สำหรับบิลด์นี้ เว้นแต่จะมาจากการรันที่มีชื่อระบุชัดเจนบนชิปรุ่นเดียวกันกับที่คุณใช้
หอคอยการมองเห็นที่ถูกเก็บรักษาไว้ก็เป็นส่วนหนึ่งของพื้นผิวความเสี่ยงเช่นกัน และควรกล่าวให้ตรงไปตรงมาว่า โมเดลที่ถูก abliterated แล้วซึ่งยังสามารถอ่านภาพได้นั้น ไม่ใช่ปัญหาด้านความปลอดภัยที่จำกัดเฉพาะข้อความเท่านั้น
การเรียกใช้เครื่องมือและการใช้งานเอเจนต์
การเรียกใช้เครื่องมือเป็นความสามารถระดับโมเดลพื้นฐาน และมันยังคงอยู่แม้ผ่านการ abliteration ซึ่งทำให้บิลด์นี้มีประโยชน์อย่างแท้จริงสำหรับการเรดทีมระบบเอเจนต์ — และอันตรายอย่างแท้จริงหากนำไปชี้เป้าที่บริการจริง การตั้งค่ามาตรฐานคือ mlx_lm.server เอนด์พอยต์ด้านบน ซึ่งเอเจนต์ที่เข้ากันได้กับ OpenAI ทุกตัวสามารถเรียกใช้ได้ หากคุณเรียกใช้เป็นเอเจนต์ จงเข้าใจว่าคุณเปิดใช้งานอะไร: โมเดลที่ไม่มีการปฏิเสธพร้อมการเรียกใช้ฟังก์ชันและบริบท 262K เป็นท่าทีด้านความปลอดภัยที่แตกต่างจากโมเดลแชท และกรอบเพื่อการวิจัยเท่านั้นของการ์ดมีอยู่เพื่อเหตุผลนั้น
บริบท 262K และต้นทุนที่แท้จริง
สถาปัตยกรรมนี้ทำให้โมเดลนี้มีต้นทุนการประมวลผลบริบทยาวที่ถูกอย่างผิดปกติ แอตเทนชันแบบไฮบริดในที่นี้หมายถึงเลเยอร์ Gated DeltaNet (แอตเทนชันเชิงเส้น) 48 เลเยอร์สลับกับเลเยอร์แอตเทนชันเต็มรูปแบบ 16 เลเยอร์ และมีเพียง 16 เลเยอร์แอตเทนชันเต็มรูปแบบเท่านั้นที่ใช้ KV cache แบบคลาสสิก — ส่วนเลเยอร์เชิงเส้นจะเก็บสถานะรีเคอร์เรนต์แบบกะทัดรัดแทน ดังนั้น 262,144 โทเคนจึงมีต้นทุนต่ำกว่าการใช้โมเดล 27B ที่เป็นแอตเทนชันเต็มรูปแบบอย่างมีนัยสำคัญ นั่นคือข้อเท็จจริงเชิงโครงสร้างของโมเดลพื้นฐาน ไม่ใช่คำสัญญาเกี่ยวกับ Mac ของคุณ
ในทางปฏิบัติ หน้าต่างบริบทคือความสามารถ ไม่ใช่ระดับฟรี การทดสอบบริบทยาวในชุมชนบน M4 Max วัดได้ประมาณ 63 tok/s ที่บริบทสั้น ลดลงเหลือประมาณ 11 tok/s ที่ 31K โทเคน — การดีโค้ดเสื่อมลงอย่างรวดเร็วเมื่อแคชเต็ม และความหน่วงของโทเคนแรกบนพรอมป์ที่ยาวมากมักเป็นกำแพงที่ใหญ่กว่าปริมาณงานดิบ การพรีฟิลแบบ Speculative และแบบใช้ ANE ช่วยปรับปรุงการป้อนข้อมูล ไม่ใช่การดีโค้ด ตัวเลขต้นทุน KV-cache บน Apple Silicon ของเราเองสำหรับบิลด์นี้ยังไม่ได้เผยแพร่ หากคุณต้องการตัวเลขที่ชัดเจนสำหรับฮาร์ดแวร์ของคุณ การรันจากชุมชนคือแหล่งข้อมูลที่ตรงไปตรงมา และฉันทามติของชุมชนคือให้ถือว่า 262K เต็มเป็นสิ่งที่คุณเลือกใช้อย่างจงใจ ไม่ใช่ค่าเริ่มต้นที่ปล่อยไว้ตลอด
ความเร็ว — สิ่งที่วัดได้จริง
เราตีพิมพ์ตัวเลขความเร็วเพียงหนึ่งเดียวสำหรับ build นี้ และมันไม่ใช่ Apple Silicon: ~32–37 tok/s ในสภาวะคงที่บน H200 ตัวเดียวผ่าน backend MLX CUDA ซึ่งยืนยันว่าน้ำหนัก (weights) ยังทำงานนอก macOS ได้เช่นกัน บน Mac การ์ดของเราไม่ตีพิมพ์ tok/s โดยตั้งใจ เพราะมันขึ้นอยู่กับชิป ความแม่นยำ และ runner ตัวเลขสำหรับนักปฏิบัติที่ควรรู้ทั้งหมดถูกระบุเช่นนั้น:
• บิลด์นี้โดยเฉพาะ, 4-bit, M1 Pro 32 GB: ~8.7 tok/s สำหรับการสร้าง (generation) และ ~41.7 tok/s สำหรับ prefill ในการรันสั้นๆ (การทดสอบจากชุมชน, สิงหาคม 2026) เป็นชิปรุ่นเก่า แต่เป็นค่าต่ำสุดที่สมจริง
• oMLX พร้อม MTP ดั้งเดิมบน M4 Max, checkpoint แบบไม่ผ่านการ abliterate: 53.3 tok/s สำหรับร้อยแก้ว และ 72.1 tok/s สำหรับโค้ด โดยมี ~273.7 tok/s prefill ที่ 4K; การ decode แบบดิบโดยไม่มี MTP ~24.6 tok/s วัดโดยผู้ปฏิบัติจริงบน checkpoint และ runtime ที่แตกต่างกัน ดังนั้นควรถือว่าเป็นขอบเขตบนที่ weights ที่ผ่านการ abliterate อาจเข้าใกล้ มากกว่าจะเป็นคำรับประกัน
• oMLX dual-ANE prefill บน M3 Ultra, oQ4e-MTP แบบ abliterated: prefill เร็วขึ้นประมาณ 17.7% ที่ 16K และประมาณ 18.9% ที่ 32K และ decode ผ่าน Lightning MTP ได้สูงสุดประมาณ 75 tok/s ที่ 16K ข้อควรระวังมีอยู่จริง: มันใช้อินเทอร์เฟซรันไทม์ส่วนตัวของ Apple และน้ำหนัก INT8 โดยประมาณ เพิ่มหน่วยความจำสูงสุดประมาณ 4 GB และเพิ่มเวลาโหลดโมเดลจากประมาณ 3.4 วินาทีเป็นประมาณ 28 วินาที นั่นคือการปรับปรุงการป้อน prompt ไม่ใช่ตัวเร่งการสร้าง
หัว MTP — การเร่งความเร็วฟรี หากรันเนอร์ของคุณรองรับ
บิลด์นี้มาพร้อมกับเดรฟเตอร์แบบ multi-token-prediction ของโมเดลพื้นฐานใน mtp/ โฟลเดอร์ย่อย (สถาปัตยกรรม qwen3_5_mtp), และทำงานได้กับความแม่นยำหลักทุกรูปแบบ การยอมรับนั้นไม่สูญเสียข้อมูล — เมื่อใช้ greedy decoding ผลลัพธ์จะเหมือนกับการรันโดยไม่มีเดรฟเตอร์ — ดังนั้นมันจึงเป็นความเร็วที่แท้จริงโดยไม่มีต้นทุนด้านคุณภาพเมื่อมันทำงาน หมายเหตุการตั้งค่าสองข้อจากการ์ดของเรา: ต้องใช้บิลด์ mlx-vlm ที่รวมเดรฟเตอร์ qwen3_5_mtp เดรฟเตอร์ (ที่ชื่อว่า main บรานช์), และคุณต้องส่งทั้ง --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp และ --draft-kind mtp. การตั้งค่า mtp_enabled เพียงอย่างเดียวไม่มีผล หาก runner ของคุณไม่รองรับเดรฟเตอร์ มันจะถูกมองข้ามและโมเดลทำงานตามปกติ — ไม่มีอะไรเสียหาย
ความปลอดภัย — อ่านก่อนที่จะรันมัน ไม่ใช่หลังจากนั้น
คำปฏิเสธความรับผิดชอบของการ์ดโมเดลเองนั้นตรงไปตรงมาอย่างผิดปกติ และหน้านี้จะไม่ทำให้มันดูอ่อนลง การจัดแนวความปลอดภัยของบิลด์นี้ถูกถอดออกเป็นส่วนใหญ่ มันจะปฏิบัติตามคำขอที่เป็นอันตราย ผิดจริยธรรม ไม่เหมาะสม หรือผิดกฎหมาย ซึ่งโมเดลพื้นฐาน Qwen/Qwen3.8-27B จะปฏิเสธ และมันไม่มีมาตรการป้องกันในตัวที่มีนัยสำคัญใดๆ มันถูกเผยแพร่อย่างเคร่งครัดเพื่อการวิจัยที่ชอบด้วยกฎหมาย — การตีความได้ การศึกษาความปลอดภัยของ AI และกลไกการปฏิเสธ การทดสอบเชิงรุก (red-teaming) การประเมินความทนทาน และการทดลองที่มีการควบคุม หากนั่นไม่ใช่สิ่งที่คุณกำลังทำ แสดงว่านี่คือโมเดลที่ผิด
คำเตือนสองข้อจากการ์ดสมควรได้รับการเน้นย้ำ ประการแรก การเจลเบรกและการทดสอบความปลอดภัย "ประสบความสำเร็จ" อย่างง่ายดายบนโมเดลที่ถูก abliterate และนั่นไม่ใช่การประเมินความปลอดภัยที่ผ่าน — มันคือพฤติกรรมที่คาดหวังของโมเดลที่ถูกถอดทิศทางการปฏิเสธออกไป การไม่มีการปฏิเสธไม่ใช่หลักฐานของความปลอดภัย ประการที่สอง วิสัยทัศน์ การเรียกใช้เครื่องมือ และบริบท 262K ที่ยังคงอยู่ ขยายพื้นที่การโจมตีไปสู่การเข้าใจภาพและการใช้งานแบบ agentic: โมเดลที่ไม่ได้เซ็นเซอร์ซึ่งสามารถอ่านสกรีนช็อตและเรียกใช้เครื่องมือได้นั้นมีความเสี่ยงกว้างกว่าเวอร์ชันที่ถอดการปฏิเสธออกแต่ใช้แชทเท่านั้น การควอนไทซ์แบบ low-bit เพิ่มความไม่เสถียรเป็นชั้นที่สามเพิ่มเติม — ที่ 2 บิต ผลลัพธ์ที่เพี้ยนอาจถูกเข้าใจผิดว่าเป็นการปฏิเสธ ซึ่งเป็นความล้มเหลวที่สร้างความสับสนอีกแบบหนึ่ง
คุณต้องรับผิดชอบและรับภาระความรับผิดชอบแต่เพียงผู้เดียวต่อการใช้งานและผลลัพธ์ที่เกิดขึ้น ใบอนุญาต Apache-2.0 สืบทอดมาจากโมเดลฐาน และไม่ได้เปลี่ยนแปลงข้อเท็จจริงนั้น กล่าวคือ อนุญาตให้ใช้งานได้ แต่ไม่ได้ทำให้การปรับใช้งานของคุณปลอดภัย ผู้ที่นำสิ่งนี้ไปปรับใช้กับผู้ใช้ปลายทาง ผู้เยาว์ หรือสภาพแวดล้อมการผลิตใด ๆ ต้องเพิ่มชั้นการกลั่นกรอง ความปลอดภัย และการป้องกันการใช้งานในทางที่ผิดของตนเองก่อน และต้องปฏิบัติตามกฎหมายที่เกี่ยวข้อง สำหรับนักวิจัยที่นำไปรันจริง มาตรการป้องกันเชิงปฏิบัติ ได้แก่ สภาพแวดล้อมที่แยกเป็นสัดส่วน โดยควรเป็นแบบออฟไลน์ เครื่องมือเอเจนต์ต้องไม่ชี้ไปยังบริการจริง ไม่เปิดให้ผู้ใช้ปลายทางเข้าถึง และต้องตรวจสอบผลลัพธ์ก่อนที่จะถูกเผยแพร่ไปยังที่ใด
เมื่อท้องถิ่นไม่ใช่คำตอบ
Local คือหัวใจของ build นี้ — น้ำหนักโมเดลอยู่บนดิสก์ของคุณ ไม่มีค่าใช้จ่ายต่อ token และไม่มีอะไรออกจากเครื่อง แต่ local ก็เป็นเพดานด้วย: ใช้ได้เฉพาะ Apple-Silicon คุณต้องยอมรับคุณภาพของ quant และไม่มีการสำรองหากเครื่องไม่ว่าง หากคุณต้องการโมเดลระดับ 27B ที่ไม่ผ่านการ abliterate ผ่าน API สำหรับเวิร์กโหลดจริง หรือต้องการ A/B ทดสอบ build แบบ local นี้กับโมเดลที่โฮสต์ด้วยพรอมพ์เดียวกัน นั่นคือช่องว่างที่ routing layer มีไว้เติมเต็ม OrcaRouter วางโมเดล 200+ รายการไว้เบื้องหลังคีย์ API เดียวในราคารายการของผู้ให้บริการ พร้อม failover อัตโนมัติและ routing DSL — การลดราคาของผู้ให้บริการจะมีผลฝั่งเราในวันเดียวกับที่ประกาศ เพราะเราส่งต่อราคารายการโดยตรง API เดียว การผสานรวมเดียว และคุณสามารถเปรียบเทียบการตั้งค่า local ที่ยังไม่ผ่านการพิสูจน์กับโมเดลที่โฮสต์ได้โดยไม่ต้องสร้างบัญชีที่สอง เราไม่ได้โฮสต์ MLX build นี้ — มันเป็นน้ำหนักแบบ local โดยการออกแบบ — ดังนั้น API จึงเป็นเส้นทางเสริม ไม่ใช่สิ่งทดแทน
คู่มือการตัดสินใจอย่างรวดเร็ว
• 16 GB Mac — พูดตรงๆ ไม่ใช่รุ่นนี้ 2-bit ลงได้พอดีและใช้เก็บถาวรเท่านั้น คุณจะต้องสู้กับหน่วยความจำอยู่ดี ลองดูโมเดล uncensored ที่เล็กกว่า หรือโมเดลแปลง 3/6-bit แบบผสมจากชุมชนที่สร้างมาสำหรับเครื่อง 18–24 GB
• Mac 24 GB — 4-bit และรักษาบริบทให้สั้น อย่ารัน vision และบริบทยาวพร้อมกัน
• Mac 32 GB — 4-bit คือจุดที่เหมาะสมที่สุด; 6-bit หากคุณรักษาบริบทให้กระชับ
• Mac 48 GB — 6 บิตแบบมีระยะเผื่อ; 8 บิตหากคุณไม่ดันหน้าต่าง
• 64 GB ขึ้นไป — รองรับ 8-bit, แบบแทบไม่สูญเสียข้อมูล และคอนเท็กซ์ 262K ได้ ภายใต้ข้อควรระวังข้างต้น
นั่นคือรันบุ๊กทั้งหมด โมเดลนี้มาจากวันที่ 17 สิงหาคม 2026 ไม่ใช่ข่าวการเปิดตัว และไม่จำเป็นต้องเป็น: การดาวน์โหลด 83,000 ครั้งเกิดขึ้นเพราะผู้คนต้องการวิธีใช้งาน และหน้านี้คือวิธีใช้งานนั้น เริ่มจากรากของรีโพสิทอรี โหลด 4-bit ใน LM Studio และออกจากการตั้งค่าเริ่มต้นเมื่อคุณรู้ว่ากำลังแลกกับคุณภาพอะไร หากคุณมาจากฝั่ง GGUF หรือ FP8 คู่มือที่เกี่ยวข้องครอบคลุมเส้นทางเหล่านั้น — กรอบการตัดสินใจที่นี่เหมือนกัน แต่คณิตศาสตร์การควอนไทซ์ไม่เหมือนกัน
ไม่ใช่ build อื่นของโมเดลนี้ — Qwen3.8-Flash-Next-Uncensored เป็นเวอร์ชันเผยแพร่แยกต่างหาก: abliterated จาก Qwen3.8-Flash-Next ซึ่งเป็นตัวอย่าง mixture-of-experts ของสถาปัตยกรรม Qwen4 ที่จัดเก็บ 176B / ใช้งานจริง 6B เทคนิค abliteration เดียวกัน น้ำหนักต่างกัน มีคอลเลกชันของตัวเอง
บิลด์ 27B ทั้งหกแบบ — BF16, GGUF, MLX, FP8, INT8 และ NVFP4 — ถูกรวบรวมไว้ในคอลเลกชัน Qwen3.8-27B-Uncensoredบน Hugging Face.
ค่าน้ำหนักเหล่านี้ถูกออกแบบให้ใช้งานในเครื่องเท่านั้นโดยเจตนา เพื่อให้มี baseline ที่โฮสต์ไว้ใช้เทียบวัดกับ build ที่ผ่านการ abliterated แล้ว Qwen3.8-27B จึงให้บริการบน OrcaRouter ในราคารายการของผู้ให้บริการ โดยมี markup 0% — เป็นโมเดลมาตรฐานที่ยังคงการ alignment ด้านความปลอดภัยไว้ครบถ้วน
