
วิธีเรียกใช้ Qwen3.8-27B-Uncensored ในเครื่อง: GGUF Quants, llama.cpp และ Ollama
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
หากต้องการรัน Qwen3.8-27B-Uncensored ในเครื่อง ให้ดึงรีโพ GGUF แบบ gated ที่ชื่อ orcarouter/Qwen3.8-27B-Uncensored-GGUF จาก Hugging Face เลือก quant ตาม VRAM ของคุณ — Q4_K_M (16.8 GB) สำหรับ GPU 24 GB, IQ4_XS (15.3 GB) สำหรับ GPU 16 GB, Q3_K_M (13.5 GB) เมื่อต้องการพื้นที่ context มากขึ้น — และ serve ด้วยบิลด์ llama.cpp ปัจจุบันโดยใช้แฟล็ก --jinja และเพิ่ม --mmproj หากต้องการ visionไฟล์เดียวกันนี้ import เข้า Ollama ได้ในสามคำสั่ง นี่คือเวอร์ชัน GGUF ของบิลด์ Qwen3.8 27B แบบ abliterated ที่เผยแพร่เมื่อวันที่ 16 สิงหาคม 2026 โดยคง context ดั้งเดิม 262K, vision projector และ MTP speculative-decoding head ไว้ในทุก quant มันเป็นเครื่องมือวิจัย ไม่ใช่ผู้ช่วย: พฤติกรรมการปฏิเสธถูกเอาออกไปแล้ว ไม่มีตัวป้องกันในตัว และใบอนุญาตคือ Apache 2.0 โปรดอ่านขอบเขตด้านความปลอดภัยที่ด้านล่างของหน้านี้ก่อนดาวน์โหลด — นั่นคือจุดประสงค์ของรีโพแบบ gated
ดาวน์โหลด GGUF ตัวไหนตาม VRAM
ที่เก็บ (repo) นี้มาพร้อมไฟล์ full-precision หนึ่งคู่และไฟล์ quantized อีกสิบสองไฟล์ ดังนั้นการตัดสินใจดาวน์โหลดจึงขึ้นอยู่กับ VRAM เป็นหลัก ตัวเลขด้านล่างคือขนาดไฟล์ที่อ่านจากที่เก็บ Hugging Face เมื่อวันที่ 2026-08-16

จริงๆ แล้วมีอะไรอยู่ใน repo
orcarouter/Qwen3.8-27B-Uncensored-GGUF เก็บไฟล์โมเดลสิบห้าไฟล์: น้ำหนัก F16 ที่แบ่งออกเป็นสองส่วน, GGUF ที่ถูกควอนไทซ์สิบสองตัว — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M และ IQ4_XS — และตัวโปรเจคเตอร์วิทัศน์ mmproj มันคือการส่งออก GGUF ของบิลด์ abliterated เดียวกันกับ Qwen3.8-27B-Uncensored-FP8 ซึ่งถูกบรรจุใหม่สำหรับรันไทม์ท้องถิ่นระดับ llama.cpp และมันสืบทอดใบอนุญาต Apache 2.0 ของโมเดลฐานและบริบทดั้งเดิม 262,144 โทเคน
คุณสมบัติสามประการนี้เหมือนกันในทุกควอนต์ สถาปัตยกรรมคือ qwen35 — แอตเทนชันแบบไฮบริดที่มี Gated DeltaNet linear layers 48 ชั้น และ full-attention layers 16 ชั้น — ซึ่งเป็นเหตุผลที่ repo ไม่ยอมโหลดใน llama.cpp เวอร์ชันเก่า และเป็นเหตุผลที่ KV cache ยังเล็กอยู่ ส่วน หัว MTP (nextn) สำหรับ speculative decoding ถูกเก็บรักษาไว้ในทุกควอนต์ ทั้ง K-quant และ IQ เช่นกัน และ chat template คือ Qwen Jinja template ซึ่งคุณต้องเปิดใช้งานอย่างชัดเจน (ดูด้านล่าง) มิฉะนั้นการสนทนาหลายรอบจะใช้งานไม่ได้
ทำไม KV cache จึงยังคงเล็กพอที่จะมีความสำคัญ
นี่คือรายละเอียดที่ทำให้เรื่องการใช้งานบนเครื่องเป็นจริง จากทั้งหมด 64 เลเยอร์ มีเพียง 16 เลเยอร์ที่ใช้แอตเทนชันแบบเต็ม ส่วนอีก 48 เลเยอร์ใช้แอตเทนชันเชิงเส้นแบบ Gated DeltaNet ซึ่งไม่เก็บแคช KV แบบเดิม ผลในทางปฏิบัติที่วัดจากรันบุ๊กดั้งเดิมของสถาปัตยกรรมนี้คือแคช KV ประมาณ 2 GB ที่คอนเทกซ์ 32K — ประมาณหนึ่งในสี่ของที่โมเดล 27B ทั่วไปต้องใช้ นั่นคือเหตุผลที่ไฟล์ Q4_K_M ขนาด 16.8 GB ยังพอดีกับการ์ด 24 GB พร้อมหน้าต่างคอนเทกซ์ยาว และเหตุผลที่ไลน์ GGUF แบบไม่มีเซ็นเซอร์ยังรันได้บนฮาร์ดแวร์ที่ไม่สามารถโฮสต์เช็คพอยต์ BF16 ขนาด 55.6 GB ได้เลย
รันมันด้วย llama.cpp
llama.cpp คือเส้นทางที่ต้องการ คุณต้องใช้บิลด์ปัจจุบัน: ทรังก์รองรับสถาปัตยกรรม qwen35 และบิลด์เก่าจะปฏิเสธไฟล์โดยสิ้นเชิง รูปแบบคำสั่ง จากหมายเหตุการใช้งานในการ์ดโมเดลและคู่มือการใช้งานของสถาปัตยกรรมนี้ คือ:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
นั่นจะให้ endpoint ที่เข้ากันได้กับ OpenAI ที่ localhost:8080 สำหรับอินพุตรูปภาพ ให้เพิ่ม --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf แล้วเปลี่ยน Q4_K_M เป็น quant ที่ตรงกับ VRAM ของคุณ โดย flags ยังคงเหมือนเดิม
รันมันด้วย Ollama
Ollama เรียกใช้ไฟล์เดียวกันโดยการนำเข้าจาก Modelfile ซึ่งเป็นวิธีที่รองรับในการเพิ่ม GGUF ที่ไม่ได้อยู่ในไลบรารี ในไดเรกทอรีที่เก็บ quant ที่คุณดาวน์โหลด:
./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
บันทึกบรรทัดนั้นเป็น Modelfile จากนั้นollama create qwen3.8-27b-uncensored -f Modelfile และollama run qwen3.8-27b-uncensored. สำหรับโหมด vision ให้เพิ่มบรรทัด mmproj ลงในไฟล์ Modelfile (FROM ... Q4_K_M.gguf พร้อมพาธของ mmproj) แล้ว Ollama จะเชื่อมต่อโปรเจกเตอร์ให้ ข้อควรระวังเรื่อง --ctx และเทมเพลตก็ยังเหมือนเดิม: กำหนดขนาด context ที่คุณสามารถรองรับได้จริง และอย่าลืมว่าโมเดลที่ลบการปฏิเสธออกจะตอบโดยไม่มี guardrail คอยกั้นระหว่างคุณกับผลลัพธ์
การลบการปฏิเสธจริง ๆ แล้วเปลี่ยนแปลงอะไร
การ์ดโมเดลเผยแพร่ชุดการประเมินความปลอดภัยสำหรับบิลด์นี้ เมื่อปิดโหมดคิด อัตราการปฏิเสธในเกณฑ์วัดมาตรฐานสำหรับพรอมป์ที่เป็นอันตรายลดลงจาก 64–99% บนโมเดลฐานเป็น 0–6% บนน้ำหนักแบบ abliterated; เมื่อเปิดโหมดคิด มันแทบจะไม่ปฏิเสธเลย — 1.7% หรือน้อยกว่า เกณฑ์วัดความสามารถยังคงอยู่ภายใน ±1.3 จุดของโมเดลฐาน นี่คือรูปแบบของทุกรุ่นที่ปล่อยแบบ abliterated ในสายนี้: การปฏิเสธถูกลบออก ความสามารถยังคงครบถ้วน และข้อควรระวังว่าคำตอบจำนวนไม่น้อยยังคงเพิ่มข้อความปฏิเสธความรับผิดชอบสั้นๆ ก่อนตอบ — ซึ่งเป็นผลพลอยได้จากการฝึก ไม่ใช่การปฏิเสธ
อีกด้านหนึ่งคือประเด็นทั้งหมดของขอบเขตความปลอดภัยด้านล่าง: โมเดลที่ไม่เคยปฏิเสธไม่ใช่ผู้ช่วยที่ดีกว่า แต่มันคือวัตถุชนิดที่แตกต่างออกไป มันคือเครื่องมือทดสอบสำหรับวัดกลไกการปฏิเสธและสำหรับการค้นหาว่ามาตรการป้องกันของคุณเองทำงานหรือไม่
ควรนำไปใช้ทำอะไรจริง ๆ ในการวิจัย
โครงการที่ถูกต้องตามกฎหมายสามโครงการที่เป็นการใช้แบบจำลองที่ถูกลบการปฏิเสธออกโดยได้รับอนุญาต:
เมื่อบิลด์นี้เป็นคำตอบที่ผิด
หากคุณต้องการผู้ช่วยทั่วไป หรืออะไรก็ตามที่คุณจะนำไปให้ผู้ใช้ปลายทางใช้ นี่คือโมเดลที่ผิด — มันไม่มีระบบป้องกันในตัวที่มีความหมาย มันจะปฏิบัติตามคำขอที่โมเดลฐานปฏิเสธ และ Apache 2.0 ไม่ได้โอนความรับผิดชอบของคุณออกไป ใช้ Qwen3.8-27B เวอร์ชันดั้งเดิมที่ปรับอไลน์เมนต์แล้วสำหรับกรณีนั้น หากคุณต้องการเบี่ยงเบนการปฏิเสธบนแชทบอท ชุดพรอมต์ระบบให้ผลลัพธ์มากกว่าและมีความเสี่ยงน้อยกว่าการแก้ไขน้ำหนัก และหากคุณไม่มี GPU เลยแต่ยังต้องการศึกษาโมเดล การ์ดที่โฮสต์ไว้ obsidian/Qwen3.8-27B บน OrcaRouter ให้บริการไลน์ไม่เซ็นเซอร์แบบเดียวกันในราคา $0.40 ต่อล้านโทเคนอินพุต และ $4.21 ต่อล้านโทเคนเอาต์พุต พร้อมบริบท 262K เท่ากัน มันถูกจำกัดการเข้าถึงเฉพาะนักวิจัยด้านความมั่นคงและความปลอดภัย AI ในลักษณะเดียวกับที่รีโพสิทอรีถูกจำกัด และการตัดสินใจเรื่องการกลั่นกรองยังคงอยู่ที่ฝั่งคุณ ส่วนการ์ดโมเดลมีรายละเอียดราคาและเกณฑ์ชี้วัด
ขอบเขตด้านความปลอดภัย — โปรดอ่านก่อนดาวน์โหลด

โมเดลนี้ได้ถูกถอดการปรับแนวทางด้านความปลอดภัย (safety alignment) ออกไปอย่างมีนัยสำคัญ มันจะปฏิบัติตามคำขอที่เป็นอันตราย ผิดจริยธรรม ไม่เหมาะสม หรือผิดกฎหมาย ซึ่ง Qwen3.8-27B ดั้งเดิมจะปฏิเสธ และมันไม่มีกลไกป้องกันในตัวที่มีความหมายใดๆ มันถูกเผยแพร่เพื่อการวิจัยที่ชอบด้วยกฎหมายอย่างเคร่งครัดเท่านั้น — การศึกษาความสามารถในการตีความ (interpretability) ความปลอดภัยของ AI และกลไกการปฏิเสธ การทดสอบเชิงรุก (red-teaming) การประเมินความทนทาน (robustness) และการทดลองที่มีการควบคุม คุณต้องรับผิดชอบและรับภาระทางกฎหมายอย่างเต็มที่ต่อวิธีการที่คุณใช้มันและทุกสิ่งที่มันสร้างขึ้น และคุณต้องไม่นำไปใช้กับผู้ใช้ปลายทางหรือนำไปใช้ในการผลิตจริง โดยไม่เพิ่มชั้นความปลอดภัย การกลั่นกรอง และการป้องกันการใช้งานในทางที่ผิดของคุณเอง ผู้เขียนไม่รับผิดชอบใดๆ ต่อการใช้งานในทางที่ผิด การดาวน์โหลดที่เก็บโค้ด (repository) หมายความว่าคุณยอมรับเงื่อนไขเหล่านี้; สัญญาอนุญาตคือ Apache 2.0
บทความนี้จงใจไม่มีพรอมต์ที่ก่อให้เกิดอันตราย ตัวเลขการปฏิเสธด้านบนมาจากชุดประเมินความปลอดภัยของโมเดลการ์ดเอง ซึ่งเป็นวิธีที่ถูกต้องในการวัดโมเดลระดับนี้: รันเกณฑ์วัดการปฏิเสธมาตรฐาน อ่านตัวเลข และออกแบบงานวิจัยของคุณตามสิ่งที่ตัวเลขแสดง
แหล่งที่มาและวันที่
ข้อเท็จจริงทั้งหมดข้างต้นได้รับการตรวจสอบเมื่อวันที่ 2026-08-16 รายการไฟล์และขนาดอ่านจากที่เก็บ Hugging Face ชื่อ orcarouter/Qwen3.8-27B-Uncensored-GGUF (สร้างเมื่อวันที่ 16 สิงหาคม 2026; สถาปัตยกรรม qwen35; สัญญาอนุญาต Apache 2.0; ถูกจำกัดการเข้าถึง) ตัวเลขการปฏิเสธและความสามารถมาจากชุดการประเมินความปลอดภัยของการ์ดโมเดล การวัด KV-cache (~2 GB ที่บริบท 32K) มาจากคู่มือการใช้งาน OrcaRouter สำหรับสถาปัตยกรรมนี้ ชื่อ How to Run Qwen 3.8 27B Locally ราคาโฮสต์และการจำกัดการเข้าถึงมาจากหน้าของโมเดล obsidian/Qwen3.8-27B ซึ่งตรวจสอบในวันเดียวกัน ขนาดไฟล์แบบควอนไทซ์เป็นหน่วยกิกะไบต์ฐานสิบตามที่เก็บไว้บน Hugging Face
สำหรับการวิจัยที่ถูกต้องตามกฎหมาย น้ำหนักโมเดลอยู่บน Hugging Face: ดาวน์โหลดจาก Hugging Face — ไม่ต้องใช้บัตรเครดิต ใช้งานได้ภายใน 60 วินาที
