ภาพประกอบเวกเตอร์แบนสไตล์บรรณาธิการสำหรับฮีโร่บล็อกเทคโนโลยีเกี่ยวกับการรันโมเดลภาษาขนาดใหญ่ที่ไม่ได้ถูกเซ็นเซอร์และผ่านการกำจัดความสามารถ (abliterated) ในเครื่องของคุณเอง: ชิปโมเดลทรงกลมขนาดใหญ่สีน้ำเงินเข้มพร้อมแสงสีฟ้าเขียวอ่อนนวลลอยอยู่กลางซ้าย วงจรภายในของมันเปลี่ยนจากรูปกุญแจล็อกที่ปิดสนิทเป็นรูปที่เปิดออก ทางด้านขวา มีการ์ด GPU ขนาดกะทัดรัดบนโต๊ะทำงาน และหน้าต่างเทอร์มินัลแบบบางพร้อมแถบคำสั่งแนวนอนแบบนามธรรมและเงาลามะตัวเล็กอยู่ข้าง ๆ ที่มุมบนมีไอคอนกล้องจุลทรรศน์ขนาดเล็กและโล่ทรงโค้งพร้อมสามเหลี่ยมเตือนภัย บ่งบอกถึงการใช้งานเพื่อการวิจัยและขอบเขตด้านความปลอดภัย พื้นหลังสีฟ้าอ่อนและสีขาวนวล มีพื้นที่ว่างกว้างขวางตลอดส่วนล่างหนึ่งในสาม ไม่มีข้อความที่อ่านได้
Guides & Insights

วิธีเรียกใช้ Qwen3.8-27B-Uncensored ในเครื่อง: GGUF Quants, llama.cpp และ Ollama

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

หากต้องการรัน Qwen3.8-27B-Uncensored ในเครื่อง ให้ดึงรีโพ GGUF แบบ gated ที่ชื่อ orcarouter/Qwen3.8-27B-Uncensored-GGUF จาก Hugging Face เลือก quant ตาม VRAM ของคุณ — Q4_K_M (16.8 GB) สำหรับ GPU 24 GB, IQ4_XS (15.3 GB) สำหรับ GPU 16 GB, Q3_K_M (13.5 GB) เมื่อต้องการพื้นที่ context มากขึ้น — และ serve ด้วยบิลด์ llama.cpp ปัจจุบันโดยใช้แฟล็ก --jinja และเพิ่ม --mmproj หากต้องการ visionไฟล์เดียวกันนี้ import เข้า Ollama ได้ในสามคำสั่ง นี่คือเวอร์ชัน GGUF ของบิลด์ Qwen3.8 27B แบบ abliterated ที่เผยแพร่เมื่อวันที่ 16 สิงหาคม 2026 โดยคง context ดั้งเดิม 262K, vision projector และ MTP speculative-decoding head ไว้ในทุก quant มันเป็นเครื่องมือวิจัย ไม่ใช่ผู้ช่วย: พฤติกรรมการปฏิเสธถูกเอาออกไปแล้ว ไม่มีตัวป้องกันในตัว และใบอนุญาตคือ Apache 2.0 โปรดอ่านขอบเขตด้านความปลอดภัยที่ด้านล่างของหน้านี้ก่อนดาวน์โหลด — นั่นคือจุดประสงค์ของรีโพแบบ gated

ดาวน์โหลด GGUF ตัวไหนตาม VRAM

ที่เก็บ (repo) นี้มาพร้อมไฟล์ full-precision หนึ่งคู่และไฟล์ quantized อีกสิบสองไฟล์ ดังนั้นการตัดสินใจดาวน์โหลดจึงขึ้นอยู่กับ VRAM เป็นหลัก ตัวเลขด้านล่างคือขนาดไฟล์ที่อ่านจากที่เก็บ Hugging Face เมื่อวันที่ 2026-08-16

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

จริงๆ แล้วมีอะไรอยู่ใน repo

orcarouter/Qwen3.8-27B-Uncensored-GGUF เก็บไฟล์โมเดลสิบห้าไฟล์: น้ำหนัก F16 ที่แบ่งออกเป็นสองส่วน, GGUF ที่ถูกควอนไทซ์สิบสองตัว — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M และ IQ4_XS — และตัวโปรเจคเตอร์วิทัศน์ mmproj มันคือการส่งออก GGUF ของบิลด์ abliterated เดียวกันกับ Qwen3.8-27B-Uncensored-FP8 ซึ่งถูกบรรจุใหม่สำหรับรันไทม์ท้องถิ่นระดับ llama.cpp และมันสืบทอดใบอนุญาต Apache 2.0 ของโมเดลฐานและบริบทดั้งเดิม 262,144 โทเคน

คุณสมบัติสามประการนี้เหมือนกันในทุกควอนต์ สถาปัตยกรรมคือ qwen35 — แอตเทนชันแบบไฮบริดที่มี Gated DeltaNet linear layers 48 ชั้น และ full-attention layers 16 ชั้น — ซึ่งเป็นเหตุผลที่ repo ไม่ยอมโหลดใน llama.cpp เวอร์ชันเก่า และเป็นเหตุผลที่ KV cache ยังเล็กอยู่ ส่วน หัว MTP (nextn) สำหรับ speculative decoding ถูกเก็บรักษาไว้ในทุกควอนต์ ทั้ง K-quant และ IQ เช่นกัน และ chat template คือ Qwen Jinja template ซึ่งคุณต้องเปิดใช้งานอย่างชัดเจน (ดูด้านล่าง) มิฉะนั้นการสนทนาหลายรอบจะใช้งานไม่ได้

ทำไม KV cache จึงยังคงเล็กพอที่จะมีความสำคัญ

นี่คือรายละเอียดที่ทำให้เรื่องการใช้งานบนเครื่องเป็นจริง จากทั้งหมด 64 เลเยอร์ มีเพียง 16 เลเยอร์ที่ใช้แอตเทนชันแบบเต็ม ส่วนอีก 48 เลเยอร์ใช้แอตเทนชันเชิงเส้นแบบ Gated DeltaNet ซึ่งไม่เก็บแคช KV แบบเดิม ผลในทางปฏิบัติที่วัดจากรันบุ๊กดั้งเดิมของสถาปัตยกรรมนี้คือแคช KV ประมาณ 2 GB ที่คอนเทกซ์ 32K — ประมาณหนึ่งในสี่ของที่โมเดล 27B ทั่วไปต้องใช้ นั่นคือเหตุผลที่ไฟล์ Q4_K_M ขนาด 16.8 GB ยังพอดีกับการ์ด 24 GB พร้อมหน้าต่างคอนเทกซ์ยาว และเหตุผลที่ไลน์ GGUF แบบไม่มีเซ็นเซอร์ยังรันได้บนฮาร์ดแวร์ที่ไม่สามารถโฮสต์เช็คพอยต์ BF16 ขนาด 55.6 GB ได้เลย

รันมันด้วย llama.cpp

llama.cpp คือเส้นทางที่ต้องการ คุณต้องใช้บิลด์ปัจจุบัน: ทรังก์รองรับสถาปัตยกรรม qwen35 และบิลด์เก่าจะปฏิเสธไฟล์โดยสิ้นเชิง รูปแบบคำสั่ง จากหมายเหตุการใช้งานในการ์ดโมเดลและคู่มือการใช้งานของสถาปัตยกรรมนี้ คือ:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

นั่นจะให้ endpoint ที่เข้ากันได้กับ OpenAI ที่ localhost:8080 สำหรับอินพุตรูปภาพ ให้เพิ่ม --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf แล้วเปลี่ยน Q4_K_M เป็น quant ที่ตรงกับ VRAM ของคุณ โดย flags ยังคงเหมือนเดิม

รันมันด้วย Ollama

Ollama เรียกใช้ไฟล์เดียวกันโดยการนำเข้าจาก Modelfile ซึ่งเป็นวิธีที่รองรับในการเพิ่ม GGUF ที่ไม่ได้อยู่ในไลบรารี ในไดเรกทอรีที่เก็บ quant ที่คุณดาวน์โหลด:

./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

บันทึกบรรทัดนั้นเป็น Modelfile จากนั้นollama create qwen3.8-27b-uncensored -f Modelfile และollama run qwen3.8-27b-uncensored. สำหรับโหมด vision ให้เพิ่มบรรทัด mmproj ลงในไฟล์ Modelfile (FROM ... Q4_K_M.gguf พร้อมพาธของ mmproj) แล้ว Ollama จะเชื่อมต่อโปรเจกเตอร์ให้ ข้อควรระวังเรื่อง --ctx และเทมเพลตก็ยังเหมือนเดิม: กำหนดขนาด context ที่คุณสามารถรองรับได้จริง และอย่าลืมว่าโมเดลที่ลบการปฏิเสธออกจะตอบโดยไม่มี guardrail คอยกั้นระหว่างคุณกับผลลัพธ์

การลบการปฏิเสธจริง ๆ แล้วเปลี่ยนแปลงอะไร

การ์ดโมเดลเผยแพร่ชุดการประเมินความปลอดภัยสำหรับบิลด์นี้ เมื่อปิดโหมดคิด อัตราการปฏิเสธในเกณฑ์วัดมาตรฐานสำหรับพรอมป์ที่เป็นอันตรายลดลงจาก 64–99% บนโมเดลฐานเป็น 0–6% บนน้ำหนักแบบ abliterated; เมื่อเปิดโหมดคิด มันแทบจะไม่ปฏิเสธเลย — 1.7% หรือน้อยกว่า เกณฑ์วัดความสามารถยังคงอยู่ภายใน ±1.3 จุดของโมเดลฐาน นี่คือรูปแบบของทุกรุ่นที่ปล่อยแบบ abliterated ในสายนี้: การปฏิเสธถูกลบออก ความสามารถยังคงครบถ้วน และข้อควรระวังว่าคำตอบจำนวนไม่น้อยยังคงเพิ่มข้อความปฏิเสธความรับผิดชอบสั้นๆ ก่อนตอบ — ซึ่งเป็นผลพลอยได้จากการฝึก ไม่ใช่การปฏิเสธ

อีกด้านหนึ่งคือประเด็นทั้งหมดของขอบเขตความปลอดภัยด้านล่าง: โมเดลที่ไม่เคยปฏิเสธไม่ใช่ผู้ช่วยที่ดีกว่า แต่มันคือวัตถุชนิดที่แตกต่างออกไป มันคือเครื่องมือทดสอบสำหรับวัดกลไกการปฏิเสธและสำหรับการค้นหาว่ามาตรการป้องกันของคุณเองทำงานหรือไม่

ควรนำไปใช้ทำอะไรจริง ๆ ในการวิจัย

โครงการที่ถูกต้องตามกฎหมายสามโครงการที่เป็นการใช้แบบจำลองที่ถูกลบการปฏิเสธออกโดยได้รับอนุญาต:

เมื่อบิลด์นี้เป็นคำตอบที่ผิด

หากคุณต้องการผู้ช่วยทั่วไป หรืออะไรก็ตามที่คุณจะนำไปให้ผู้ใช้ปลายทางใช้ นี่คือโมเดลที่ผิด — มันไม่มีระบบป้องกันในตัวที่มีความหมาย มันจะปฏิบัติตามคำขอที่โมเดลฐานปฏิเสธ และ Apache 2.0 ไม่ได้โอนความรับผิดชอบของคุณออกไป ใช้ Qwen3.8-27B เวอร์ชันดั้งเดิมที่ปรับอไลน์เมนต์แล้วสำหรับกรณีนั้น หากคุณต้องการเบี่ยงเบนการปฏิเสธบนแชทบอท ชุดพรอมต์ระบบให้ผลลัพธ์มากกว่าและมีความเสี่ยงน้อยกว่าการแก้ไขน้ำหนัก และหากคุณไม่มี GPU เลยแต่ยังต้องการศึกษาโมเดล การ์ดที่โฮสต์ไว้ obsidian/Qwen3.8-27B บน OrcaRouter ให้บริการไลน์ไม่เซ็นเซอร์แบบเดียวกันในราคา $0.40 ต่อล้านโทเคนอินพุต และ $4.21 ต่อล้านโทเคนเอาต์พุต พร้อมบริบท 262K เท่ากัน มันถูกจำกัดการเข้าถึงเฉพาะนักวิจัยด้านความมั่นคงและความปลอดภัย AI ในลักษณะเดียวกับที่รีโพสิทอรีถูกจำกัด และการตัดสินใจเรื่องการกลั่นกรองยังคงอยู่ที่ฝั่งคุณ ส่วนการ์ดโมเดลมีรายละเอียดราคาและเกณฑ์ชี้วัด

ขอบเขตด้านความปลอดภัย — โปรดอ่านก่อนดาวน์โหลด

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

โมเดลนี้ได้ถูกถอดการปรับแนวทางด้านความปลอดภัย (safety alignment) ออกไปอย่างมีนัยสำคัญ มันจะปฏิบัติตามคำขอที่เป็นอันตราย ผิดจริยธรรม ไม่เหมาะสม หรือผิดกฎหมาย ซึ่ง Qwen3.8-27B ดั้งเดิมจะปฏิเสธ และมันไม่มีกลไกป้องกันในตัวที่มีความหมายใดๆ มันถูกเผยแพร่เพื่อการวิจัยที่ชอบด้วยกฎหมายอย่างเคร่งครัดเท่านั้น — การศึกษาความสามารถในการตีความ (interpretability) ความปลอดภัยของ AI และกลไกการปฏิเสธ การทดสอบเชิงรุก (red-teaming) การประเมินความทนทาน (robustness) และการทดลองที่มีการควบคุม คุณต้องรับผิดชอบและรับภาระทางกฎหมายอย่างเต็มที่ต่อวิธีการที่คุณใช้มันและทุกสิ่งที่มันสร้างขึ้น และคุณต้องไม่นำไปใช้กับผู้ใช้ปลายทางหรือนำไปใช้ในการผลิตจริง โดยไม่เพิ่มชั้นความปลอดภัย การกลั่นกรอง และการป้องกันการใช้งานในทางที่ผิดของคุณเอง ผู้เขียนไม่รับผิดชอบใดๆ ต่อการใช้งานในทางที่ผิด การดาวน์โหลดที่เก็บโค้ด (repository) หมายความว่าคุณยอมรับเงื่อนไขเหล่านี้; สัญญาอนุญาตคือ Apache 2.0

บทความนี้จงใจไม่มีพรอมต์ที่ก่อให้เกิดอันตราย ตัวเลขการปฏิเสธด้านบนมาจากชุดประเมินความปลอดภัยของโมเดลการ์ดเอง ซึ่งเป็นวิธีที่ถูกต้องในการวัดโมเดลระดับนี้: รันเกณฑ์วัดการปฏิเสธมาตรฐาน อ่านตัวเลข และออกแบบงานวิจัยของคุณตามสิ่งที่ตัวเลขแสดง

แหล่งที่มาและวันที่

ข้อเท็จจริงทั้งหมดข้างต้นได้รับการตรวจสอบเมื่อวันที่ 2026-08-16 รายการไฟล์และขนาดอ่านจากที่เก็บ Hugging Face ชื่อ orcarouter/Qwen3.8-27B-Uncensored-GGUF (สร้างเมื่อวันที่ 16 สิงหาคม 2026; สถาปัตยกรรม qwen35; สัญญาอนุญาต Apache 2.0; ถูกจำกัดการเข้าถึง) ตัวเลขการปฏิเสธและความสามารถมาจากชุดการประเมินความปลอดภัยของการ์ดโมเดล การวัด KV-cache (~2 GB ที่บริบท 32K) มาจากคู่มือการใช้งาน OrcaRouter สำหรับสถาปัตยกรรมนี้ ชื่อ How to Run Qwen 3.8 27B Locally ราคาโฮสต์และการจำกัดการเข้าถึงมาจากหน้าของโมเดล obsidian/Qwen3.8-27B ซึ่งตรวจสอบในวันเดียวกัน ขนาดไฟล์แบบควอนไทซ์เป็นหน่วยกิกะไบต์ฐานสิบตามที่เก็บไว้บน Hugging Face

สำหรับการวิจัยที่ถูกต้องตามกฎหมาย น้ำหนักโมเดลอยู่บน Hugging Face: ดาวน์โหลดจาก Hugging Face — ไม่ต้องใช้บัตรเครดิต ใช้งานได้ภายใน 60 วินาที

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube