การ์ดชื่อเรื่องหลักสำหรับบทความ 'Qwen3.8-27B-Uncensored-MLX on Apple Silicon' ที่แสดงพาดหัว 'Qwen3.8-27B-Uncensored-MLX', คำบรรยายใต้ 'The Apple Silicon Runbook', แถวชิปควอนต์ที่ติดป้าย 2-bit, 4-bit, 6-bit และ 8-bit โดยที่ 4-bit ถูกไฮไลต์, หน้าต่าง LM Studio ที่ออกแบบอย่างมีสไตล์ซึ่งแสดง '4-bit build at repo root', และลวดลายบริบท 262K โดยมีโลโก้ OrcaRouter ประกอบอยู่ที่มุม
Guides & Insights

Qwen3.8-27B-Uncensored-MLX บน Apple Silicon: วิธีเลือกบิลด์ของคุณ โหลดใน LM Studio หรือ mlx-vlm และจัดการคอนเท็กซ์ 262K

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สิ่งที่มีประโยชน์ที่สุดที่ควรรู้เกี่ยวกับ orcarouter/Qwen3.8-27B-Uncensored-MLX ก็คือคุณไม่จำเป็นต้องเลือกโฟลเดอร์ย่อยเพื่อเรียกใช้งานมัน บิลด์ abliterated สำหรับ Apple Silicon ของ OrcaRouter จาก Qw​en/Qwen3.8-27B — เผยแพร่บน Hugging Face เมื่อวันที่ 17 สิงหาคม 2026 ดังนั้นจึงไม่ใช่เรื่องใหม่ แค่มีเอกสารประกอบน้อย — ได้เก็บสำเนาบิลด์แบบ 4-bit ไว้ที่ root ของ repo โดยเฉพาะเพื่อให้เครื่องมือที่มองแต่ละ repo เป็นหนึ่งโมเดล ซึ่งที่สำคัญที่สุดคือ LM Studio สามารถโหลดมันได้โดยไม่ต้องตั้งค่าอะไรเลย การตัดสินใจเพียงข้อเดียวนี้เองที่ทำให้การ์ดนี้มียอดดาวน์โหลดประมาณ 83,000 ครั้งในเดือนที่ผ่านมา ในขณะที่โมเดล MLX ที่เทียบเท่ากันได้สัดส่วนเพียงเล็กน้อยเท่านั้น อย่างอื่นทั้งหมดเกี่ยวกับมันคือทางเลือกที่แท้จริง: ว่าความแม่นยำแบบใดในสี่แบบที่เหมาะกับหน่วยความจำรวมของ Mac ของคุณ คุณจะใช้รันเนอร์ตัวไหน ความสามารถด้านวิทัศน์และการเรียกใช้เครื่องมือจะยังทำงานได้หรือไม่ที่บิตเวดท์ของคุณ และหน้าต่างบริบท 262,144 โทเคนนั้นคุ้มกับสิ่งที่มันแลกมาบนฮาร์ดแวร์ของคุณหรือไม่ รันบุ๊คนี้จะพาคุณผ่านการตัดสินใจเหล่านี้ตามลำดับ มันเป็นเอกสารจากผู้ผลิตโดยตรง — ขนาด ความแม่นยำ และตัวเลขความเที่ยงตรงด้านล่างเป็นของ OrcaRouter เอง วัดจากบิลด์นี้โดยเฉพาะ และตัวเลขจากชุมชนทุกตัวจะถูกติดป้ายกำกับไว้อย่างชัดเจน

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

ในรีโพนี้มีอะไรอยู่บ้าง

นี่คือบิลด์แบบ abliterated ของ Qw​en/Qwen3.8-27B — โมเดลแบบ dense ขนาด 27B ที่ใช้ hybrid-attention (linear attention แบบ Gated DeltaNet รวมกับ full attention), รองรับ vision-language โดยกำเนิด, มีการควบคุมการคิด, การเรียกใช้เครื่องมือ, หัว multi-token-prediction (MTP), และหน้าต่างบริบทขนาด 262,144 โทเคน Abliteration จะลบพฤติกรรมการปฏิเสธของโมเดลโดยการ orthogonalize ทิศทางของการปฏิเสธออกจาก residual stream; หากคุณยังไม่คุ้นเคยกับเทคนิคนี้ เอกสารแนะนำเกี่ยวกับเทคนิคของเราเป็นจุดเริ่มต้นที่ดีกว่าหน้านี้ ซึ่งเกี่ยวกับการรันบิลด์ ไม่ใช่ตัววิธีการ น้ำหนักของโมเดลเป็น Apache-2.0 ซึ่งสืบทอดมาจากโมเดลฐาน

อย่าสับสนระหว่าง repo นี้กับ qwen-3-8-27b-mlx ซึ่งเป็นโมเดลพื้นฐานตัวเดียวกันในรูปแบบ MLX โดยไม่มี การทำ abliteration ผู้อ่านมักจะโหลดตัวหนึ่งไปทั้งที่ตั้งใจจะได้อีกตัวหนึ่ง: ตัวนี้เป็นบิลด์สำหรับงานวิจัยที่เอาความสามารถในการปฏิเสธออกแล้ว ส่วนตัวนั้นเป็น Qw​en/Qwen3.8-27B ทั่วไปบน Apple Silicon ตรวจสอบชื่อ repo ให้ดีก่อนจะเสียเวลาโหลด

รายละเอียดเชิงโครงสร้างอย่างหนึ่งสำคัญกว่าที่เห็น: vision tower, นอร์มทั้งหมด และ linear-attention conv1d ยังคงอยู่ใน BF16 และมีเพียงเลเยอร์เชิงเส้นของโมเดลภาษาเท่านั้น — รวมถึง embed_tokens และ lm_head — ที่ถูก quantize นี่คือเหตุผลที่ความเข้าใจภาพยังอยู่รอดหลังการ quantize และยังเป็นเหตุผลที่ขนาดบนดิสก์ด้านล่างใหญ่กว่าค่าประมาณแบบง่าย ๆ ของ "27B ที่ N บิต" เล็กน้อย: โมเดลบางส่วนไม่ถูกบีบอัดเลย

การตัดสินใจ: บิลด์ไหนเหมาะกับ Mac รุ่นไหน

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

ความแม่นยำสี่แบบมาในโฟลเดอร์ย่อย — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — ทั้งหมดเป็นการควอนไทซ์แบบ affine ของ MLX ที่ group size 64 บิลด์ 4-bit ยังถูกมิเรอร์เพิ่มเติมที่ root ของ repo เลือกตามหน่วยความจำ unified ของ Mac ก่อน แล้วค่อยพิจารณาคุณภาพ:

8-bit — ประมาณ 27.5 GB บนดิสก์ ต้องใช้ Mac 64 GB (เครื่อง 32 GB โหลดได้แต่แทบไม่เหลือพื้นที่สำหรับอย่างอื่น) วัดความเที่ยงตรงแบบโคไซน์เทียบกับต้นฉบับ BF16 ได้ 0.9997 ซึ่งถือว่าแทบไม่สูญเสียข้อมูล เลือกใช้เมื่อคุณภาพสำคัญที่สุดและมีหน่วยความจำเพียงพอ

6-bit — ประมาณ 22 GB เหมาะกับ Mac 24–32 GB Fidelity 0.9996 ดีเยี่ยม เป็นความสมดุลระหว่างคุณภาพต่อจิกะไบต์ที่ดีที่สุดสำหรับผู้ใช้เครื่อง 48 GB ส่วนใหญ่

4-bit — ประมาณ 15 GB ทำงานได้อย่างสบายบน Mac 24 GB ค่า Fidelity 0.996 ดีมาก นี่คือค่าเริ่มต้นที่เราแนะนำ และเป็นไฟล์ที่ root ของ repo ด้วยเหตุผลดังกล่าว

2 บิต — ประมาณ 8.7 GB ใส่ใน Mac 16 GB ได้. ความเที่ยงตรง 0.92 และที่ 27B เสื่อมสภาพอย่างรุนแรง: วนซ้ำ, ข้อความเพี้ยน, โค้ดและภาษาจีน, การมองเห็นบางส่วน. การ์ดระบุชัดเจน — ใช้เก็บถาวรเท่านั้น ไม่เหมาะกับงานจริง. Mac 16 GB โหลดได้ในทางเทคนิค แต่นั่นไม่ได้ทำให้มันใช้งานได้.

ขนาดบนดิสก์ไม่ใช่ตัวเลขที่ใช้วัดหน่วยความจำ ค่าน้ำหนักต้องพอดีกับหน่วยความจำแบบรวม (unified memory) ควบคู่ไปกับ macOS, KV cache และบัฟเฟอร์ชั่วคราวของ Metal ดังนั้นควรเผื่อพื้นที่ไว้ การทดสอบโดยชุมชนสำหรับบิลด์ 4-bit บน Mac M1 Pro 32 GB วัดค่าน้ำหนักบนดิสก์ได้ประมาณ 16 GB แต่จุดสูงสุดระหว่างการทำ inference อยู่ที่ 18.5–21.7 GB ส่วนการทดสอบของชุมชนสำหรับบิลด์ MLX 8-bit รายงานจุดสูงสุดประมาณ 34–36 GB แม้ว่าน้ำหนักจะอยู่ที่ประมาณ 29.5 GB แนวทางปฏิบัติจากการทดสอบโดยชุมชนเดียวกันคือ: 16 GB ไม่ใช่ตัวเลือกที่ใช้งานได้จริงสำหรับโมเดล 27B, 24 GB พอจะลองใช้ 4-bit กับบริบทสั้น ๆ ได้ และ 32 GB คือจุดเริ่มต้นที่สบาย ๆ บทความการวางแผน VRAM ของเราใช้การคำนวณแบบเดียวกันสำหรับโมเดลทั้งตระกูล

เนื่องจากรายการในรีโพทั้งหมดมีขนาดรวมประมาณ 94 GB ในทุกความแม่นยำ ให้ดาวน์โหลดเฉพาะโฟลเดอร์ย่อยที่คุณต้องการด้วย hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — โดยแทนที่ความแม่นยำที่คุณเลือก สำเนา 4-bit ที่ระดับรากเป็นสำเนาที่ซ้ำกับโฟลเดอร์ย่อย 4-bit ดังนั้นคุณจึงไม่จำเป็นต้องดาวน์โหลดทั้งสอง

เส้นทางแรก — LM Studio ไม่ต้องตั้งค่าใดๆ

สำเนา 4-bit หลักมีอยู่เพื่อให้ LM Studio สามารถจัดการทั้ง repo เป็นโมเดลเดียว ค้นหารหัสโมเดล เลือกความแม่นยำที่ต้องการ (สำเนาหลักคือ 4-bit) และแอปจะจัดการส่วนที่เหลือ ข้อควรระวังสามข้อ ทั้งหมดจาก card ของเรา และสิ่งเหล่านี้คือความแตกต่างทั้งหมดระหว่างการทำงานนี้กับความล้มเหลว:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

Repo นี้มีการจำกัดการเข้าถึงการดาวน์โหลดโดยไม่ระบุตัวตนจะได้รับ HTTP 401 ยอมรับข้อกำหนดบนหน้าโมเดล จากนั้นวาง read token ของ Hugging Face ลงใน LM Studio ที่ Settings → Integrations → Hugging Face หากข้ามขั้นตอนนี้ การโหลดก็จะล้มเหลว

ปิดใช้งานการ quantization ของ KV cache. โมเดล vision ของ MLX ไม่รองรับคุณสมบัตินี้บนสถาปัตยกรรมนี้ และการโหลดจะล้มเหลวระหว่างการเริ่มต้นระบบหากเปิดใช้งาน (ติดตามเป็น mlx-engine#286). ซึ่งตรงกันข้ามกับคำแนะนำสำหรับบิลด์ GGUF โดยที่การ quantize แคช K/V เป็นการประหยัด VRAM ที่ใช้ได้จริง — ทั้งสองรูปแบบไม่สามารถใช้แทนกันได้ในกรณีนี้.

อัปเดตรันไทม์. qwen3_5 ได้รับการรองรับสถาปัตยกรรมใน mlx-vlm 0.6.x; รันไทม์ที่มาพร้อมกับแอปรุ่นเก่าไม่สามารถโหลดน้ำหนักเหล่านี้ได้เลย. ป้าย 'อาจใหญ่เกินไป' ของ LM Studio ในทางตรงกันข้าม เป็นเพียงคำเตือนเรื่อง RAM ไม่ใช่ข้อผิดพลาด — ไม่ต้องสนใจมัน หากหน่วยความจำรวมของคุณตรงตามข้อกำหนดข้างต้น.

ความแม่นยำระดับไหนใน LM Studio: 8-bit ใช้พื้นที่ดิสก์ประมาณ 29.5 GB และต้องการ Mac 64 GB; 6-bit ประมาณ 22 GB เหมาะกับเครื่อง 48 GB; 4-bit ที่ประมาณ 16 GB เป็นตัวเลือกที่เหมาะสมสำหรับ Mac 32 GB หากคุณต้องการใช้เส้นทาง llama.cpp / Ollama บนฮาร์ดแวร์อื่น คู่มือการรันในเครื่องสำหรับโมเดล uncensored ของเราจะครอบคลุมเส้นทางนั้นแยกต่างหาก

เส้นทางที่สอง — mlx-vlm และ mlx-lm จากโฟลเดอร์ย่อย

เส้นทางแบบ command-line ให้ความแม่นยำโดยตรง และมีเซิร์ฟเวอร์ที่เข้ากันได้กับ Open​AI สำหรับเครื่องมือเอเจนต์ ข้อกำหนด: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 และ mlx ≥ 0.32; แบ็กเอนด์ Metal ถูกเลือกโดยอัตโนมัติบน Apple Silicon) หลังจากดาวน์โหลดโฟลเดอร์ย่อยด้านบนแล้ว:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "อธิบายการพัวพันเชิงควอนตัมในหนึ่งประโยค" --max-tokens 256

เพิ่ม --image path/to/image.png สำหรับอินพุตรูปภาพ หรือเสิร์ฟภาพนั้น:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

วิสัยทัศน์รอดพ้นจากการควอนไทเซชัน

เนื่องจาก vision tower และ conv1d ยังคงอยู่ใน BF16 ความสามารถในการเข้าใจภาพจึงยังคงไว้ที่ 4/6/8-bit ในการทดสอบภาพของเรา — รูปทรง สี ตำแหน่ง พื้นหลัง และข้อความภายในภาพ — บิลด์แบบ 4/6/8-bit อธิบายทุกอย่างได้อย่างถูกต้อง ส่วนแบบ 2-bit ทำได้เพียงบางส่วนเท่านั้น หากคุณกำลังเลือกบิลด์และให้ความสำคัญกับเรื่องภาพ 4-bit คือระดับต่ำสุดที่คุณควรใช้ เรายังไม่ได้เผยแพร่ตัวเลขปริมาณงาน (throughput) ด้านการประมวลผลภาพเฉพาะสำหรับ Apple Silicon สำหรับบิลด์นี้ ดังนั้นอย่าเชื่อถือค่า tok/s สำหรับบิลด์นี้ เว้นแต่จะมาจากการรันที่มีชื่อระบุชัดเจนบนชิปรุ่นเดียวกันกับที่คุณใช้

หอคอยการมองเห็นที่ถูกเก็บรักษาไว้ก็เป็นส่วนหนึ่งของพื้นผิวความเสี่ยงเช่นกัน และควรกล่าวให้ตรงไปตรงมาว่า โมเดลที่ถูก abliterated แล้วซึ่งยังสามารถอ่านภาพได้นั้น ไม่ใช่ปัญหาด้านความปลอดภัยที่จำกัดเฉพาะข้อความเท่านั้น

การเรียกใช้เครื่องมือและการใช้งานเอเจนต์

การเรียกใช้เครื่องมือเป็นความสามารถระดับโมเดลพื้นฐาน และมันยังคงอยู่แม้ผ่านการ abliteration ซึ่งทำให้บิลด์นี้มีประโยชน์อย่างแท้จริงสำหรับการเรดทีมระบบเอเจนต์ — และอันตรายอย่างแท้จริงหากนำไปชี้เป้าที่บริการจริง การตั้งค่ามาตรฐานคือ mlx_lm.server เอนด์พอยต์ด้านบน ซึ่งเอเจนต์ที่เข้ากันได้กับ OpenAI ทุกตัวสามารถเรียกใช้ได้ หากคุณเรียกใช้เป็นเอเจนต์ จงเข้าใจว่าคุณเปิดใช้งานอะไร: โมเดลที่ไม่มีการปฏิเสธพร้อมการเรียกใช้ฟังก์ชันและบริบท 262K เป็นท่าทีด้านความปลอดภัยที่แตกต่างจากโมเดลแชท และกรอบเพื่อการวิจัยเท่านั้นของการ์ดมีอยู่เพื่อเหตุผลนั้น

บริบท 262K และต้นทุนที่แท้จริง

สถาปัตยกรรมนี้ทำให้โมเดลนี้มีต้นทุนการประมวลผลบริบทยาวที่ถูกอย่างผิดปกติ แอตเทนชันแบบไฮบริดในที่นี้หมายถึงเลเยอร์ Gated DeltaNet (แอตเทนชันเชิงเส้น) 48 เลเยอร์สลับกับเลเยอร์แอตเทนชันเต็มรูปแบบ 16 เลเยอร์ และมีเพียง 16 เลเยอร์แอตเทนชันเต็มรูปแบบเท่านั้นที่ใช้ KV cache แบบคลาสสิก — ส่วนเลเยอร์เชิงเส้นจะเก็บสถานะรีเคอร์เรนต์แบบกะทัดรัดแทน ดังนั้น 262,144 โทเคนจึงมีต้นทุนต่ำกว่าการใช้โมเดล 27B ที่เป็นแอตเทนชันเต็มรูปแบบอย่างมีนัยสำคัญ นั่นคือข้อเท็จจริงเชิงโครงสร้างของโมเดลพื้นฐาน ไม่ใช่คำสัญญาเกี่ยวกับ Mac ของคุณ

ในทางปฏิบัติ หน้าต่างบริบทคือความสามารถ ไม่ใช่ระดับฟรี การทดสอบบริบทยาวในชุมชนบน M4 Max วัดได้ประมาณ 63 tok/s ที่บริบทสั้น ลดลงเหลือประมาณ 11 tok/s ที่ 31K โทเคน — การดีโค้ดเสื่อมลงอย่างรวดเร็วเมื่อแคชเต็ม และความหน่วงของโทเคนแรกบนพรอมป์ที่ยาวมากมักเป็นกำแพงที่ใหญ่กว่าปริมาณงานดิบ การพรีฟิลแบบ Speculative และแบบใช้ ANE ช่วยปรับปรุงการป้อนข้อมูล ไม่ใช่การดีโค้ด ตัวเลขต้นทุน KV-cache บน Apple Silicon ของเราเองสำหรับบิลด์นี้ยังไม่ได้เผยแพร่ หากคุณต้องการตัวเลขที่ชัดเจนสำหรับฮาร์ดแวร์ของคุณ การรันจากชุมชนคือแหล่งข้อมูลที่ตรงไปตรงมา และฉันทามติของชุมชนคือให้ถือว่า 262K เต็มเป็นสิ่งที่คุณเลือกใช้อย่างจงใจ ไม่ใช่ค่าเริ่มต้นที่ปล่อยไว้ตลอด

ความเร็ว — สิ่งที่วัดได้จริง

เราตีพิมพ์ตัวเลขความเร็วเพียงหนึ่งเดียวสำหรับ build นี้ และมันไม่ใช่ Apple Silicon: ~32–37 tok/s ในสภาวะคงที่บน H200 ตัวเดียวผ่าน backend MLX CUDA ซึ่งยืนยันว่าน้ำหนัก (weights) ยังทำงานนอก macOS ได้เช่นกัน บน Mac การ์ดของเราไม่ตีพิมพ์ tok/s โดยตั้งใจ เพราะมันขึ้นอยู่กับชิป ความแม่นยำ และ runner ตัวเลขสำหรับนักปฏิบัติที่ควรรู้ทั้งหมดถูกระบุเช่นนั้น:

• บิลด์นี้โดยเฉพาะ, 4-bit, M1 Pro 32 GB: ~8.7 tok/s สำหรับการสร้าง (generation) และ ~41.7 tok/s สำหรับ prefill ในการรันสั้นๆ (การทดสอบจากชุมชน, สิงหาคม 2026) เป็นชิปรุ่นเก่า แต่เป็นค่าต่ำสุดที่สมจริง

• oMLX พร้อม MTP ดั้งเดิมบน M4 Max, checkpoint แบบไม่ผ่านการ abliterate: 53.3 tok/s สำหรับร้อยแก้ว และ 72.1 tok/s สำหรับโค้ด โดยมี ~273.7 tok/s prefill ที่ 4K; การ decode แบบดิบโดยไม่มี MTP ~24.6 tok/s วัดโดยผู้ปฏิบัติจริงบน checkpoint และ runtime ที่แตกต่างกัน ดังนั้นควรถือว่าเป็นขอบเขตบนที่ weights ที่ผ่านการ abliterate อาจเข้าใกล้ มากกว่าจะเป็นคำรับประกัน

• oMLX dual-ANE prefill บน M3 Ultra, oQ4e-MTP แบบ abliterated: prefill เร็วขึ้นประมาณ 17.7% ที่ 16K และประมาณ 18.9% ที่ 32K และ decode ผ่าน Lightning MTP ได้สูงสุดประมาณ 75 tok/s ที่ 16K ข้อควรระวังมีอยู่จริง: มันใช้อินเทอร์เฟซรันไทม์ส่วนตัวของ Apple และน้ำหนัก INT8 โดยประมาณ เพิ่มหน่วยความจำสูงสุดประมาณ 4 GB และเพิ่มเวลาโหลดโมเดลจากประมาณ 3.4 วินาทีเป็นประมาณ 28 วินาที นั่นคือการปรับปรุงการป้อน prompt ไม่ใช่ตัวเร่งการสร้าง

หัว MTP — การเร่งความเร็วฟรี หากรันเนอร์ของคุณรองรับ

บิลด์นี้มาพร้อมกับเดรฟเตอร์แบบ multi-token-prediction ของโมเดลพื้นฐานใน mtp/ โฟลเดอร์ย่อย (สถาปัตยกรรม qwen3_5_mtp), และทำงานได้กับความแม่นยำหลักทุกรูปแบบ การยอมรับนั้นไม่สูญเสียข้อมูล — เมื่อใช้ greedy decoding ผลลัพธ์จะเหมือนกับการรันโดยไม่มีเดรฟเตอร์ — ดังนั้นมันจึงเป็นความเร็วที่แท้จริงโดยไม่มีต้นทุนด้านคุณภาพเมื่อมันทำงาน หมายเหตุการตั้งค่าสองข้อจากการ์ดของเรา: ต้องใช้บิลด์ mlx-vlm ที่รวมเดรฟเตอร์ qwen3_5_mtp เดรฟเตอร์ (ที่ชื่อว่า main บรานช์), และคุณต้องส่งทั้ง --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp และ --draft-kind mtp. การตั้งค่า mtp_enabled เพียงอย่างเดียวไม่มีผล หาก runner ของคุณไม่รองรับเดรฟเตอร์ มันจะถูกมองข้ามและโมเดลทำงานตามปกติ — ไม่มีอะไรเสียหาย

ความปลอดภัย — อ่านก่อนที่จะรันมัน ไม่ใช่หลังจากนั้น

คำปฏิเสธความรับผิดชอบของการ์ดโมเดลเองนั้นตรงไปตรงมาอย่างผิดปกติ และหน้านี้จะไม่ทำให้มันดูอ่อนลง การจัดแนวความปลอดภัยของบิลด์นี้ถูกถอดออกเป็นส่วนใหญ่ มันจะปฏิบัติตามคำขอที่เป็นอันตราย ผิดจริยธรรม ไม่เหมาะสม หรือผิดกฎหมาย ซึ่งโมเดลพื้นฐาน Qw​en/Qwen3.8-27B จะปฏิเสธ และมันไม่มีมาตรการป้องกันในตัวที่มีนัยสำคัญใดๆ มันถูกเผยแพร่อย่างเคร่งครัดเพื่อการวิจัยที่ชอบด้วยกฎหมาย — การตีความได้ การศึกษาความปลอดภัยของ AI และกลไกการปฏิเสธ การทดสอบเชิงรุก (red-teaming) การประเมินความทนทาน และการทดลองที่มีการควบคุม หากนั่นไม่ใช่สิ่งที่คุณกำลังทำ แสดงว่านี่คือโมเดลที่ผิด

คำเตือนสองข้อจากการ์ดสมควรได้รับการเน้นย้ำ ประการแรก การเจลเบรกและการทดสอบความปลอดภัย "ประสบความสำเร็จ" อย่างง่ายดายบนโมเดลที่ถูก abliterate และนั่นไม่ใช่การประเมินความปลอดภัยที่ผ่าน — มันคือพฤติกรรมที่คาดหวังของโมเดลที่ถูกถอดทิศทางการปฏิเสธออกไป การไม่มีการปฏิเสธไม่ใช่หลักฐานของความปลอดภัย ประการที่สอง วิสัยทัศน์ การเรียกใช้เครื่องมือ และบริบท 262K ที่ยังคงอยู่ ขยายพื้นที่การโจมตีไปสู่การเข้าใจภาพและการใช้งานแบบ agentic: โมเดลที่ไม่ได้เซ็นเซอร์ซึ่งสามารถอ่านสกรีนช็อตและเรียกใช้เครื่องมือได้นั้นมีความเสี่ยงกว้างกว่าเวอร์ชันที่ถอดการปฏิเสธออกแต่ใช้แชทเท่านั้น การควอนไทซ์แบบ low-bit เพิ่มความไม่เสถียรเป็นชั้นที่สามเพิ่มเติม — ที่ 2 บิต ผลลัพธ์ที่เพี้ยนอาจถูกเข้าใจผิดว่าเป็นการปฏิเสธ ซึ่งเป็นความล้มเหลวที่สร้างความสับสนอีกแบบหนึ่ง

คุณต้องรับผิดชอบและรับภาระความรับผิดชอบแต่เพียงผู้เดียวต่อการใช้งานและผลลัพธ์ที่เกิดขึ้น ใบอนุญาต Apache-2.0 สืบทอดมาจากโมเดลฐาน และไม่ได้เปลี่ยนแปลงข้อเท็จจริงนั้น กล่าวคือ อนุญาตให้ใช้งานได้ แต่ไม่ได้ทำให้การปรับใช้งานของคุณปลอดภัย ผู้ที่นำสิ่งนี้ไปปรับใช้กับผู้ใช้ปลายทาง ผู้เยาว์ หรือสภาพแวดล้อมการผลิตใด ๆ ต้องเพิ่มชั้นการกลั่นกรอง ความปลอดภัย และการป้องกันการใช้งานในทางที่ผิดของตนเองก่อน และต้องปฏิบัติตามกฎหมายที่เกี่ยวข้อง สำหรับนักวิจัยที่นำไปรันจริง มาตรการป้องกันเชิงปฏิบัติ ได้แก่ สภาพแวดล้อมที่แยกเป็นสัดส่วน โดยควรเป็นแบบออฟไลน์ เครื่องมือเอเจนต์ต้องไม่ชี้ไปยังบริการจริง ไม่เปิดให้ผู้ใช้ปลายทางเข้าถึง และต้องตรวจสอบผลลัพธ์ก่อนที่จะถูกเผยแพร่ไปยังที่ใด

เมื่อท้องถิ่นไม่ใช่คำตอบ

Local คือหัวใจของ build นี้ — น้ำหนักโมเดลอยู่บนดิสก์ของคุณ ไม่มีค่าใช้จ่ายต่อ token และไม่มีอะไรออกจากเครื่อง แต่ local ก็เป็นเพดานด้วย: ใช้ได้เฉพาะ Apple-Silicon คุณต้องยอมรับคุณภาพของ quant และไม่มีการสำรองหากเครื่องไม่ว่าง หากคุณต้องการโมเดลระดับ 27B ที่ไม่ผ่านการ abliterate ผ่าน API สำหรับเวิร์กโหลดจริง หรือต้องการ A/B ทดสอบ build แบบ local นี้กับโมเดลที่โฮสต์ด้วยพรอมพ์เดียวกัน นั่นคือช่องว่างที่ routing layer มีไว้เติมเต็ม OrcaRouter วางโมเดล 200+ รายการไว้เบื้องหลังคีย์ API เดียวในราคารายการของผู้ให้บริการ พร้อม failover อัตโนมัติและ routing DSL — การลดราคาของผู้ให้บริการจะมีผลฝั่งเราในวันเดียวกับที่ประกาศ เพราะเราส่งต่อราคารายการโดยตรง API เดียว การผสานรวมเดียว และคุณสามารถเปรียบเทียบการตั้งค่า local ที่ยังไม่ผ่านการพิสูจน์กับโมเดลที่โฮสต์ได้โดยไม่ต้องสร้างบัญชีที่สอง เราไม่ได้โฮสต์ MLX build นี้ — มันเป็นน้ำหนักแบบ local โดยการออกแบบ — ดังนั้น API จึงเป็นเส้นทางเสริม ไม่ใช่สิ่งทดแทน

คู่มือการตัดสินใจอย่างรวดเร็ว

• 16 GB Mac — พูดตรงๆ ไม่ใช่รุ่นนี้ 2-bit ลงได้พอดีและใช้เก็บถาวรเท่านั้น คุณจะต้องสู้กับหน่วยความจำอยู่ดี ลองดูโมเดล uncensored ที่เล็กกว่า หรือโมเดลแปลง 3/6-bit แบบผสมจากชุมชนที่สร้างมาสำหรับเครื่อง 18–24 GB

• Mac 24 GB — 4-bit และรักษาบริบทให้สั้น อย่ารัน vision และบริบทยาวพร้อมกัน

• Mac 32 GB — 4-bit คือจุดที่เหมาะสมที่สุด; 6-bit หากคุณรักษาบริบทให้กระชับ

• Mac 48 GB — 6 บิตแบบมีระยะเผื่อ; 8 บิตหากคุณไม่ดันหน้าต่าง

• 64 GB ขึ้นไป — รองรับ 8-bit, แบบแทบไม่สูญเสียข้อมูล และคอนเท็กซ์ 262K ได้ ภายใต้ข้อควรระวังข้างต้น

นั่นคือรันบุ๊กทั้งหมด โมเดลนี้มาจากวันที่ 17 สิงหาคม 2026 ไม่ใช่ข่าวการเปิดตัว และไม่จำเป็นต้องเป็น: การดาวน์โหลด 83,000 ครั้งเกิดขึ้นเพราะผู้คนต้องการวิธีใช้งาน และหน้านี้คือวิธีใช้งานนั้น เริ่มจากรากของรีโพสิทอรี โหลด 4-bit ใน LM Studio และออกจากการตั้งค่าเริ่มต้นเมื่อคุณรู้ว่ากำลังแลกกับคุณภาพอะไร หากคุณมาจากฝั่ง GGUF หรือ FP8 คู่มือที่เกี่ยวข้องครอบคลุมเส้นทางเหล่านั้น — กรอบการตัดสินใจที่นี่เหมือนกัน แต่คณิตศาสตร์การควอนไทซ์ไม่เหมือนกัน

ไม่ใช่ build อื่นของโมเดลนี้ — Qwen3.8-Flash-Next-Uncensored เป็นเวอร์ชันเผยแพร่แยกต่างหาก: abliterated จาก Qwen3.8-Flash-Next ซึ่งเป็นตัวอย่าง mixture-of-experts ของสถาปัตยกรรม Qwen4 ที่จัดเก็บ 176B / ใช้งานจริง 6B เทคนิค abliteration เดียวกัน น้ำหนักต่างกัน มีคอลเลกชันของตัวเอง

บิลด์ 27B ทั้งหกแบบ — BF16, GGUF, MLX, FP8, INT8 และ NVFP4 — ถูกรวบรวมไว้ในคอลเลกชัน Qwen3.8-27B-Uncensoredบน Hugging Face.

ค่าน้ำหนักเหล่านี้ถูกออกแบบให้ใช้งานในเครื่องเท่านั้นโดยเจตนา เพื่อให้มี baseline ที่โฮสต์ไว้ใช้เทียบวัดกับ build ที่ผ่านการ abliterated แล้ว Qwen3.8-27B จึงให้บริการบน OrcaRouter ในราคารายการของผู้ให้บริการ โดยมี markup 0% — เป็นโมเดลมาตรฐานที่ยังคงการ alignment ด้านความปลอดภัยไว้ครบถ้วน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube