
Qwen3.8-Flash-Next-Uncensored: รัน Abliterated MoE บน llama.cpp และ Apple Silicon
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
ก่อนที่คุณจะดาวน์โหลดอะไร: Qwen3.8-Flash-Next-Uncensored ไม่ใช่ Qwen3.8-27B-Uncensored. พวกมันมีชื่อตระกูลเดียวกันและเทคนิค abliteration ร่วมกัน แต่เป็นโมเดลคนละตัวจากน้ำหนักที่ปล่อยออกมาต่างชุดกัน และทุกโพสต์ก่อนหน้านี้ในบล็อกนี้ที่พูดถึง "Qwen uncensored" ล้วนเกี่ยวกับตัว 27B ทั้งสิ้น หัวข้อที่นี่คือคู่โมเดลที่ OrcaRouter เผยแพร่บน Hugging Face เมื่อวันที่ 26 สิงหาคม 2026 — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF และ orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — บิลด์ที่ผ่าน abliteration ของ Qwen3.8-Flash-Next, โมเดลแบบ routed mixture-of-experts ของ Alibaba ที่เก็บพารามิเตอร์ 176B ตัวแต่ใช้ทำงานจริง 6B ตัว ซึ่งแสดงตัวอย่างสถาปัตยกรรม Qwen4 เราประกาศการปล่อยครั้งนี้ในชื่อ "GGUF + native MLX, รองรับบริบทสูงสุด 262K" โดยตั้งเป้าไปที่นักวิจัยด้านความมั่นคงปลอดภัย ทีมแดง (red teams) และทีมน้ำเงิน (blue teams) รันบุ๊กนี้เขียนขึ้นจากการ์ดโมเดลของเราเอง: ว่าการลบกลไกการปฏิเสธ (refusal removal) ทำอะไรภายใน MoE แบบ routed, การอ้างเรื่องบริบท 262K นั้นกินหน่วยความจำจริงเท่าใด, วิธีเสิร์ฟทั้งสองไลน์ไฟล์, และแนวงานวิจัยนี้ตั้งอยู่ตรงไหน ถ้าคุณมาที่นี่เพราะต้องการบทแนะนำ abliteration หรือคณิตศาสตร์ควอนไทซ์ของโมเดล 27B โพสต์ก่อนหน้านี้ในซีรีส์นี้ครอบคลุมเรื่องเหล่านั้นแล้ว

ประการแรก, ประตู
ทั้งสอง repo ถูกจำกัดการเข้าถึงบน Hugging Face (gated: auto) จะไม่มีไฟล์ใดถูกดาวน์โหลดจนกว่าคุณจะเข้าสู่ระบบและยอมรับข้อกำหนดของแต่ละ repo — repo GGUF และ MLX ต่างก็มีการจำกัดการเข้าถึงของตัวเอง นี่คือความแตกต่างที่ปฏิบัติได้จริงที่สุดจากไลน์ GGUF ที่ไม่มีการจำกัด: คำสั่ง one-liner แบบง่าย ๆ อย่าง "just hf download" จะล้มเหลวด้วยข้อผิดพลาดการตรวจสอบสิทธิ์ก่อนที่จะดึงข้อมูลแม้แต่ไบต์เดียว ขั้นตอนคือ:
• ลงชื่อเข้าใช้ Hugging Face (หรือสมัครสมาชิก) และติดตั้ง huggingface_hub จากนั้นรัน hf auth login หนึ่งครั้งเพื่อให้โทเคนของคุณถูกเก็บไว้ในดิสก์
• เปิด orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF ในเบราว์เซอร์ ยอมรับข้อกำหนด จากนั้นทำซ้ำสำหรับ orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX
• จากนั้นเป็นต้นมา การดาวน์โหลด hf ด้วยโทเค็นยืนยันตัวตนของคุณก็ทำงานเหมือนกับ repo อื่น ๆ ทุกควอนต์ที่คุณดึงมาและน้ำหนัก MLX ล้วนเป็นสิ่งประดิษฐ์เพื่อการวิจัยภายใต้ Apache-2.0 — ซึ่งเป็นสัญญาอนุญาตเดียวกันกับโมเดลฐาน — และการคัดกรองนี้เป็นส่วนหนึ่งของข้อตกลง: การอ่านข้อกำหนดคือขั้นตอนแรกของการใช้โมเดล

abliteration ทำอะไรกับ MoE แบบมีการจัดเส้นทาง
เทคนิคนี้คือการปรับค่าน้ำหนักแบบ Arditi ที่เราเคยกล่าวถึงในบล็อกนี้ที่อื่น สิ่งที่น่าสนใจคือผลที่มันมีต่อสถาปัตยกรรมนี้โดยเฉพาะ บน dense 27B มี residual matrices 131 เมทริกซ์ บน Qwen3.8-Flash-Next-Uncensored บัตรข้อมูลโมเดล MLX ระบุว่าใช้ abliteration กับ residual-writer tensors 149 ตัว และคอมโพเนนต์ที่ทำให้โมเดลนี้เป็นตัวของมันเอง — MoE router, ตารางการฝัง n-gram ขนาด 51B, และ vision tower — ไม่ถูกแตะต้องเลยอย่างชัดเจน
"ไม่เคยถูกแตะต้อง" นั้นคือเรื่องราวทั้งหมดสำหรับโมเดลแบบ routed ทุกโทเค็นจะ激活ผู้เชี่ยวชาญ 10 จาก 512 คน ไม่มีผู้เชี่ยวชาญคนใดเป็นเจ้าของการปฏิเสธเพียงลำพัง พฤติกรรมการปฏิเสธอาศัยอยู่ใน residual stream ที่ประกอบเป็นเอาต์พุตสุดท้าย ซึ่งเป็นทิศทางที่ orthogonalization ดึงออกพอดี ดังนั้น router ก็ยังคงส่งงานไปยังผู้เชี่ยวชาญกลุ่มเดิม ตาราง n-gram ก็ยังคงสร้างเอ็มเบดดิ้งชุดเดิม และสิ่งที่เปลี่ยนไปคือสิ่งที่โมเดลพูดเมื่อโปรเจกชันเอาต์พุตทำงาน การตรวจสอบที่เผยแพร่ในการ์ดโมเดล GGUF ระบุรูปร่างของการเปลี่ยนแปลงนั้นว่า การปฏิเสธต่อพรอมป์ที่เป็นอันตรายลดลงจาก 64–100% ในโมเดลฐานเหลือประมาณ 0–3.3% ในบิลด์นี้ การปฏิเสธเกินจำเป็นต่อพรอมป์ปกติอยู่ใกล้ 0% และความสามารถอยู่ภายใน ±2 จุดของโมเดลฐานในการทดสอบแบบ MMLU-Pro / GSM8K / CMMLU ตัวเลขเหล่านี้เป็นตัวเลขของการ์ดเอง รายงานตนเอง而非ถูกจำลองการทดสอบโดยอิสระ
หัว MTP: มีอยู่ใน MLX, ถูกละเว้นใน GGUF
Qwen3.8-Flash-Next มาพร้อมหัว speculative แบบ multi-token-prediction ขนาด ~4B และบิลด์ทั้งสองมีความเห็นไม่ตรงกันในส่วนนี้ พื้นที่เก็บ GGUF ไม่รวมมัน — การ์ดระบุชัดเจนว่าไฟล์เหล่านี้ไม่รวม mtp speculative-draft head — เนื่องจากการรองรับ qwen4exp ของ llama.cpp ยังไม่ implement MTP ดังนั้น head ดังกล่าวจะกลายเป็นน้ำหนักที่ไร้ประโยชน์ในไฟล์ บิลด์ MLX เก็บมันไว้ ดังนั้นบน Apple Silicon คุณยังคงได้ speculative decoding ผลที่เกิดขึ้นจริง ซึ่งได้รับการยืนยันจากผู้ปฏิบัติที่รันโมเดลฐาน: เส้นทาง GGUF ของ llama.cpp ตอนนี้รันโดยไม่มี speculative decoding ในขณะที่การตั้งค่า SGLang ที่เปิดใช้ MTP ทำให้ decode เร็วขึ้นมากกว่าสองเท่าบนฮาร์ดแวร์ระดับเดียวกัน หาก llama.cpp ลง MTP สำหรับ qwen4exp เมื่อใด เส้นทาง GGUF จะได้ความเร็วเพิ่มขึ้นฟรี ๆ — แต่อย่าซื้อฮาร์ดแวร์โดยคาดหวังในสัปดาห์นี้
ข้อกล่าวอ้างเรื่องบริบท 262K และต้นทุนของ KV cache
บริบทดั้งเดิมคือ 262,144 โทเคน (สามารถขยายได้ถึง 1M ด้วย YaRN) และข้อจำกัดที่ส่งผลจริงๆ คือหน่วยความจำ ข่าวดีคือสถาปัตยกรรมนี้ช่วยให้ KV cache มีขนาดเล็ก: จาก 48 เลเยอร์ มี 36 เลเยอร์ที่ใช้ Gated DeltaNet linear attention ซึ่งบีบอัดประวัติลงในสถานะแบบ recurrent ที่มีขนาดคงที่ และมีเพียง 12 เลเยอร์แบบ full-attention เท่านั้นที่ใช้ KV cache แบบทั่วไปซึ่งจะขยายใหญ่ขึ้นตามความยาวของลำดับ
จุดข้อมูลที่วัดโดยชุมชนสองจุด ซึ่งทั้งคู่บนโมเดลฐาน ถ่ายโอนโดยตรง การใช้งาน GGUF บน RTX 3090 จำนวน 4 ใบรายงานว่าขยายคอนเทกซ์จาก 65K เป็น 131K โดยใช้ KV เพิ่มเติมเพียง ~0.78 GB ต่อการ์ด และ DGX Spark เครื่องเดียวก็รันคอนเทกซ์เต็ม 262K ด้วยไฟล์คลาส Q4 โดยคงโมเดลไว้ในหน่วยความจำที่ ~76.9 GB จากพูล 128 GB ด้วยการปักตาราง n-gram ไว้ที่ CPU และ mmap จาก NVMe บรรทัดงบประมาณของการ์ดโมเดล GGUF คือ ยอดรวม = ขนาดไฟล์ + แคช KV + mmproj ~0.9 GB ผลสรุปสำหรับการเลือกควอนไตซ์: ที่ 262K แคช KV เป็นรายการที่ต้องคิดจริง ๆ แต่น้ำหนัก (weights) ยังเป็นตัวหลักที่ครองบัญชี ดังนั้นตรรกะ VRAM-first เดียวกันจากคู่มือ GGUF ขนาด 27B จึงใช้ได้ — ข้อต่างในที่นี้คือขนาดไฟล์เอง ซึ่งมีตั้งแต่ IQ2_XXS ที่ประมาณ 52 GB ไปจนถึง Q5_K_M ที่ประมาณ 125 GB
ไลน์ GGUF: 13 quants, ไฟล์แยกส่วน, mmproj และบิลด์ llama.cpp
GGUF repo มีระดับควอนต์ 13 ระดับ — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — โดย IQ quant สร้างจาก importance matrix บนข้อความสอบเทียบภาษาอังกฤษ จีน และโค้ด ทุก quant เป็นแบบหลายส่วน แยกด้วย llama-gguf-split ดังนั้นดาวน์โหลดทั้งชุดสำหรับ quant นั้น แล้วชี้ loader ไปที่ส่วน ...-00001-of-000NN.gguf ไม่มีระดับ Q6_K, Q8_0 หรือ F16 และเหตุผลเป็นเชิงโครงสร้างไม่ใช่เชิงเศรษฐกิจ: ตาราง embedding แบบ n-gram (PLE) มีเทนเซอร์หนึ่งตัวใหญ่เกินกว่าจะเป็นไปตามขีดจำกัด 50 GB ต่อไฟล์ของ Hugging Face ที่ 6 บิตขึ้นไป และเทนเซอร์ GGUF ตัวเดียวไม่สามารถแยกข้ามไฟล์ได้ — ดังนั้นไลน์จึงจบที่ Q5_K_M
ไฟล์อีกไฟล์หนึ่งที่คุณต้องไม่ข้ามคือ mmproj-...-F16.gguf ซึ่งมีขนาดประมาณ 0.9 GB: นี่คือโมเดลวิทัศน์-ภาษา (vision-language model) และ llama.cpp ต้องการโปรเจกเตอร์ (projector) สำหรับการป้อนข้อมูลรูปภาพใดๆ Qwen3.8-Flash-Next เป็นแบบมัลติโมดัล และบิลด์นี้ก็เช่นกัน — การทำ abliteration ไม่แตะต้องวิทัศน์ทาวเวอร์ (vision tower)
การสนับสนุน llama.cpp ยังไม่อยู่ใน mainline ในขณะนี้ ไอดีสถาปัตยกรรมคือ qwen4exp และบิลด์มาตรฐานจะล้มเหลวด้วย "unknown architecture 'qwen4_exp'"; คุณต้องใช้บิลด์จาก PR #27742 (branch qwen4exp/qwen3.8-flash-next) ที่คอมไพล์ด้วย target llama-cli, llama-mtmd-cli, llama-server และ llama-gguf-split จากนั้นรูปแบบการให้บริการก็คือเซิร์ฟเวอร์ llama.cpp ปกติพร้อมแฟล็กเฉพาะของ Qwen โดยใช้ชื่อ quant จากไฟล์ส่วนต่างๆ:
llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
ตั้งค่า -c เป็นขนาดบริบทที่คุณพอจะใส่ได้ ตัวอย่างของการ์ดเริ่มต้นที่ 8192 Reasoning เปิดใช้งานตามค่าเริ่มต้นและถูกส่งกลับใน reasoning_content และการเรียกใช้เครื่องมือทำงานผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ค่า sampling ข้างต้นเป็นคำแนะนำของการ์ดโมเดล ผู้ใช้งานบนโมเดลฐานใช้ temp 0.7 / top-p 0.80 / top-k 20 โดยมี presence penalty 1.5 ในโหมด instruct แบบ non-thinking และปรับความลึกของการให้เหตุผลด้วย --chat-template-kwargs {"reasoning_effort":"medium"}
บิลด์ MLX บน Apple Silicon
Repo ของ MLX คือเส้นทางเนทีฟสำหรับ Apple Silicon: น้ำหนักเท่ากัน ลบการปฏิเสธเหมือนเดิม รันไทม์เนทีฟที่ใช้ Metal มาพร้อมรุ่น 4 บิตเป็นค่าเริ่มต้น (~163 GB), รุ่น 6 บิตที่ประกาศไว้ (~192 GB) และรุ่น 8 บิต (~221 GB) และเนื่องจากผู้เชี่ยวชาญแบบ fused-3D และตาราง n-gram ถูกเก็บไว้ที่ความแม่นยำสูงกว่าระดับที่ระบุ ความแม่นยำที่ใช้งานจริงจึงสูงกว่ารุ่น 4 บิตแบบสม่ำเสมออย่างเห็นได้ชัด — การ์ดระบุบิตประสิทธิผลประมาณ 7.85 บิตต่อน้ำหนักสำหรับแท็ก "4 บิต" นี่คือเหตุผลที่ขนาด repo ดูใหญ่: ตาราง n-gram ไม่ถูกบีบอัดแบบที่ควอนต์จากชุมชนบีบอัด

ฮาร์ดแวร์เป็นข้อจำกัดหลัก MLX ทำงานได้เฉพาะบน Apple Silicon (Metal) และคุณต้องมีหน่วยความจำแบบรวม (unified memory) สำหรับน้ำหนักของโมเดล — บรรทัดบนโมเดลการ์ดระบุว่า "a Mac with enough unified memory for the 163 GB weights (e.g. M-series Ultra)" ให้ถือว่าเทียร์ 4-bit เป็นเครื่องระดับคลาส 192 GB และบิลด์ 6-bit เป็นเครื่องระดับคลาส 256 GB แท็กบนการ์ดบันทึกชุดฟีเจอร์ทั้งหมดไว้ — qwen4_exp, MoE, MTP, function calling, vision-language — และถูกขับเคลื่อนผ่าน mlx-vlm สำหรับอินพุตรูปภาพ หัว speculative ของ MTP ถูกรวมไว้ที่นี่ ซึ่งเป็นข้อได้เปรียบที่เงียบๆ ของบิลด์ MLX เหนือสาย GGUF
เส้นทางแห่งวิสัยทัศน์ สำหรับผู้ที่ใช้งาน
เนื่องจากนี่คือโมเดลวิทัศน์-ภาษา เส้นทางมัลติโมดัลจึงเป็นส่วนหนึ่งของ runbook มากกว่าจะเป็นส่วนเสริม บน llama.cpp อินพุตรูปภาพต้องใช้ทั้ง mmproj projector และบิลด์ที่รวม llama-mtmd-cli / llama-server บน MLX คุณขับเคลื่อนด้วย mlx-vlm แทนไดรเวอร์ mlx-lm ที่รองรับเฉพาะข้อความ สำหรับทีมเรด เส้นทางวิทัศน์คือที่ที่งานประเมินผลที่น่าสนใจอาศัยอยู่: การ์ดเรลมัลติโมดัล พรอมต์อินเจกชันที่ฝังในภาพ OCR กับสกรีนช็อตของระบบของคุณเอง และภาพ adversarial ที่มุ่งเป้าไปที่ทั้งไปป์ไลน์ เนื่องจาก abliteration ครอบคลุมทั้งโมเดลและไม่แตะต้อง vision tower ภาพที่เคยทำให้ text head ปฏิเสธจึงไปตกบนโมเดลที่ไม่มีพฤติกรรมการปฏิเสธให้โจมตี การ์ด GGUF ระบุว่าวิทัศน์และการเรียกใช้เครื่องมือแบบหลายเทิร์นผ่านการตรวจสอบบนบิลด์นี้ ไม่มีการเผยแพร่ชุดประเมินผลวิทัศน์แยกต่างหาก
สิ่งนี้มีไว้เพื่ออะไร และเส้นแบ่งอยู่ตรงไหน
บิลด์นี้มีไว้สำหรับงานประเภทหนึ่ง: การประเมินสิ่งที่โมเดลที่ถอดการปฏิเสธออกแล้วสามารถทำได้ เพื่อการทำความเข้าใจและปกป้องระบบ สำหรับทีมแดง นั่นหมายถึงการทดสอบการ์ดป้องกันของคุณเองกับโมเดลที่จะไม่ปฏิเสธอย่างสุภาพ — ความต้านทานต่อ prompt injection, สถานการณ์การขโมยข้อมูล, การใช้เครื่องมือในทางที่ผิด และช่องว่างระหว่าง "โมเดลฐานปฏิเสธ" กับ "โมเดลไม่สามารถทำสิ่งนี้ได้จริง" ช่องว่างนั้นคือคุณค่าทางวิจัยทั้งหมดของบิลด์แบบ abliterated: มันบอกคุณว่าชั้นการปฏิเสธซ่อนอะไรอยู่ ซึ่งคือความแตกต่างระหว่างความปลอดภัยโดยนโยบายกับความปลอดภัยโดยความสามารถ สำหรับทีมน้ำเงิน น้ำหนักเดียวกันคือค่าพื้นฐานที่เป็นไปได้ของฝ่ายตรงข้าม: หากผู้ไม่ประสงค์ดีสามารถดาวน์โหลดและรันสิ่งนี้ได้ การป้องกันของคุณต้องยืนหยัดต่อโมเดลที่ตอบแทนที่จะเอ่ยปากปฏิเสธ การประเมินที่สร้างจากสิ่งนี้คือขอบเขตล่างของสิ่งที่โมเดลที่กำหนดเองซึ่งไม่เคยถูก align จะทำได้ — จงมองมันแบบนั้น ไม่ใช่เป็นเพดาน
จงชัดเจนว่าการลบการปฏิเสธเปลี่ยนแปลงอะไรและไม่เปลี่ยนแปลงอะไร มันเปลี่ยนพฤติกรรมของเอาต์พุต — โมเดลไม่ปฏิเสธอีกต่อไป — และมันไม่ได้เปลี่ยนขีดความสามารถ ไม่มีความรู้ใหม่ ไม่มีทักษะใหม่ ไม่มีการคำนวณใหม่ การฝึกฝนแบบเดิม ข้อจำกัดเดิมเกี่ยวกับสิ่งที่โมเดลสามารถผลิตได้จริง โมเดลที่ผ่านการ abliterate ไม่สามารถสร้างมัลแวร์ที่มันไม่สามารถทำได้มาก่อน มันเพียงตอบแทนที่จะหลบเลี่ยง และเอาต์พุตของมันก็ไม่ได้จริงใจมากขึ้นเพราะยอมให้มากขึ้น แถบความสามารถ ±2 จุดของการ์ดและการล่มสลายของจำนวนการปฏิเสธเป็นข้อเท็จจริงเดียวกันที่มองจากสองมุม
เส้นแบ่งอยู่ที่ข้อตกลงของคลังที่ถูกจำกัดการเข้าถึง และไม่ใช่ข้อความมาตรฐานทางกฎหมายทั่วไป การใช้งานที่ถูกต้อง: การประเมินระบบของตนเอง การวิจัยช่องโหว่สาธารณะบนโมเดล การสร้างการทดสอบการตรวจจับและการป้องกันเชิงรับ การศึกษากลไกการปฏิเสธ การใช้งานที่ไม่ถูกต้อง: การนำไปใช้เป็นผู้ช่วยที่ผู้ใช้เข้าถึงได้ การสร้างมัลแวร์หรือเอ็กซ์พลอยต์ที่ใช้งานได้จริงเพื่อโจมตีระบบที่คุณไม่ได้เป็นเจ้าของหรือไม่มีสิทธิ์ทดสอบ การฉ้อโกง วัสดุเกี่ยวกับอาวุธ สัญญาอนุญาต Apache-2.0 และกฎหมายที่เกี่ยวข้องเป็นเกณฑ์ขั้นต่ำ ส่วนการจำกัดการเข้าถึงคือข้อตกลงวัตถุประสงค์การวิจัยที่ชัดเจนซึ่งอยู่เหนือกว่านั้น หากกรณีการใช้งานของคุณคือ "ส่งแชทบอตให้ผู้ใช้" โมเดลนี้ไม่ใช่สำหรับคุณ — และนั่นคือโดยการออกแบบ ไม่ใช่ความผิดพลาด
วิธีรับ baseline ที่ให้บริการ
น้ำหนักโมเดลเหล่านี้ถูกจำกัดให้ใช้ในเครื่องเท่านั้นโดยตั้งใจ: เพย์โหลดการตรวจสอบของทีมแดงไม่ควรส่งผ่าน API ของบุคคลที่สาม และการโฮสต์ด้วยตัวเองคือจุดประสงค์ เมื่อคุณต้องการ baseline ที่ถูกเซ็นเซอร์และมีให้บริการเพื่อการเปรียบเทียบ — Qwen3.8-Flash ของ Alibaba ที่ราคา $0.16 ต่อล้านโทเค็นสำหรับ input และ $0.47 ต่อล้านโทเค็นสำหรับ output — OrcaRouter จัดเส้นทางให้ในราคารายการของผู้ให้บริการโดยไม่มีมาร์กอัป (0%) และมีระบบ failover อัตโนมัติ ดังนั้นชุดประเมินผลจึงสามารถย้ายระหว่างฐานที่โฮสต์และ build ที่ไม่ถูกเซ็นเซอร์ในเครื่องของคุณได้ด้วยคีย์เดียวและไม่ต้องมีสัญญาฉบับที่สอง น้ำหนักโมเดล Qwen3.8-Flash-Next แบบเปิดยังไม่อยู่ในแคตตาล็อกของเรา เมื่อ runtime ที่เราจัดเส้นทางให้รองรับน้ำหนักเหล่านั้น น้ำหนักเหล่านั้นก็จะเข้าสู่ระบบคีย์เดียวและราคารายการเดียวกัน
เริ่มที่นี่
ตัดสินใจว่าไลน์ใดตรงกับฮาร์ดแวร์ของคุณ จากนั้นอ่านด่านที่เกี่ยวข้อง บน Mac ที่มีหน่วยความจำรวม 128 GB ขึ้นไป บิลด์ MLX ให้ทั้ง MTP และวิชันในที่เดียว — ยอมรับข้อกำหนดของรีโพ MLX ดึงน้ำหนักแบบ 4-bit หรือ 6-bit แล้วขับเคลื่อนด้วย mlx-vlm บนเครื่องที่ใช้ NVIDIA, AMD หรือ CPU ให้บิลด์ llama.cpp จาก PR #27742 ยอมรับข้อกำหนดของรีโพ GGUF ดึงควอนต์ที่พอดี และอย่าลืมไฟล์ mmproj ในทั้งสองกรณี ตัวเลขการปฏิเสธและช่วงความสามารถเป็นของรีโพเอง ถูกเผยแพร่บนการ์ด และยังไม่ได้รับการทำซ้ำ ณ เวลาที่เขียนนี้ — วิธีอ่านที่ซื่อตรงคือมองว่าเป็นการวัดของผู้พัฒนาต่อการปรับแต่งของตนเอง ไม่ใช่การตรวจสอบโดยอิสระ ด่าน ใบอนุญาต และขอบเขตความปลอดภัยข้างต้นเป็นข้อความเดียวกันจากสามมุมมอง: นี่คือเครื่องมือวิจัย และถูกเผยแพร่ภายใต้เงื่อนไขนั้น
Flash-Next ทั้งห้าบิลด์ — BF16, GGUF, MLX, FP8 และ NVFP4 — ถูกรวบรวมไว้ในคอลเลกชัน Qwen3.8-Flash-Next-Uncensoredบน Hugging Face
อย่าสับสนกับตระกูล 27B: Qwen3.8-27B-Uncensoredเป็นโมเดลที่แตกต่างซึ่งถูก abliterated จากเบสคนละตัว โดยมีคอลเลกชันและ runbooks ของตัวเอง เทคนิคเดียวกัน น้ำหนักต่างกัน
น้ำหนักโมเดลเหล่านี้ออกแบบมาให้ใช้งานเฉพาะในเครื่องเท่านั้น สำหรับเบสไลน์ที่โฮสต์ไว้เพื่อใช้วัดผลบิลด์ที่ผ่านการ abliterate นั้น Qwen3.8-Flash ให้บริการบน OrcaRouter ในราคารายการของผู้ให้บริการโดยไม่มีการบวกเพิ่ม 0% — เป็นโมเดลมาตรฐานที่ยังคงการปรับความปลอดภัยไว้ครบถ้วน
