การ์ดหัวเรื่องหลักสำหรับบทความ 'Qwen 3.8 27B Uncensored GGUF': การ์ดงานวิจัยมุมโค้งพร้อมชื่อเรื่อง 'Qwen3.8-27B Uncensored GGUF' คำบรรยาย 'Abliterated local build for llama.cpp' ชิปอ่านว่า '12 QUANT TIERS' '262K CONTEXT' 'VISION + MTP' และไอคอนโล่พร้อมป้าย RESEARCH-ONLY โลโก้ OrcaRouter ประกอบมุมขวาล่าง
Guides & Insights

Qwen 3.8 27B Uncensored GGUF: บิลด์ Abliterated สำหรับใช้งานในเครื่อง, 12 Quants, และขอบเขตสำหรับการวิจัยเท่านั้น

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Qwen 3.8 27B uncensored GGUF เป็นไฟล์ดาวน์โหลดจริง และบิลด์ที่ควรเริ่มต้นด้วยคือ Qwen3.8-27B-Uncensored-GGUF — เผยแพร่บน Hugging Face เมื่อวันที่ 16 สิงหาคม 2026 ในฐานะรุ่นพี่น้องของเวอร์ชัน FP8 ที่ผ่านการ abliterated ของเรา ซึ่งเป็นเนทีฟสำหรับ llama.cpp มันคือน้ำหนักพารามิเตอร์ 27 พันล้านที่ถูกเอาความสามารถในการปฏิเสธออก ซึ่งเหมือนกับ Qwen3.8-27B-Uncensored-FP8 ที่แปลงเป็น GGUF เพื่อการอินเฟอเรนซ์ในเครื่อง: F16 พร้อมกับระดับควอนไทเซชัน 12 ระดับตั้งแต่ Q2_K ถึง Q8_0 (รวมถึง imatrix quants IQ3_M และ IQ4_XS), หน้าต่างบริบท 262K, โปรเจกเตอร์วิทัศน์แยกต่างหาก และหัวถอดรหัสเชิงคาดเดา MTP ที่ยังคงอยู่ครบ "Uncensored" หมายถึง abliterated — ทิศทางการปฏิเสธถูก orthogonalize ออกจากน้ำหนัก — ดังนั้นมันจะตอบในที่ที่โมเดลฐานที่ align แล้วปฏิเสธ และนั่นคือเหตุผลที่มันใช้เพื่อการวิจัยเท่านั้น นี่คือสิ่งที่รีโพซิทอรีมีอยู่จริง ควอนต์แบบไหนเหมาะกับ GPU ของคุณ วิธีรันใน llama.cpp และขอบเขตด้านความปลอดภัยที่คุณยอมรับเมื่อดาวน์โหลดมัน.

เวอร์ชัน 30 วินาที: F16 บวก 12 quants, Q4_K_M ที่ 16.8 GB คือตัวเลือกเริ่มต้น, คุณต้องใช้ build ของ llama.cpp ตั้งแต่เดือนพฤษภาคม 2026 หรือใหม่กว่า, และนี่คือเครื่องมือวิจัยที่ไม่มีขอบเขตป้องกัน — ไม่ใช่สิ่งที่นำไปใช้งานกับผู้ใช้ปลายทาง

ความหมายที่แท้จริงของ "uncensored GGUF" — และ build นี้แตกต่างจากเวอร์ชัน FP8 อย่างไร

GGUF คือรูปแบบโมเดลแบบไฟล์เดียวที่ llama.cpp ใช้ ส่วน FP8 คือรูปแบบการควอนไทซ์ที่ทำงานบนเซิร์ฟเวอร์ GPU ของ vLLM รุ่น uncensored สองรุ่นของเราเป็นน้ำหนัก abliterated ชุดเดียวกันในสองรันไทม์ {{1}}Qwen3.8-27B-Uncensored-FP8 (15 สิงหาคม 2026) ออกแบบมาสำหรับ vLLM บนเซิร์ฟเวอร์ ถูกควอนไทซ์ใหม่ตามรูปแบบ Qwen3.8-27B-FP8 อย่างเป็นทางการ จึงทำงานบนเส้นทางเคอร์เนลเดียวกัน{{/1}} {{2}}Qwen3.8-27B-Uncensored-GGUF (16 สิงหาคม 2026) ออกแบบมาสำหรับ llama.cpp บนเครื่องในพื้นที่ — GPU เดสก์ท็อปหรือเวิร์กสเตชันที่คุณควบคุม{{/2}} น้ำหนักชุดเดียวกัน รูปแบบการปรับใช้ต่างกัน: คลาวด์ API เทียบกับโปรเซสในเครื่อง

Abliteration คือการแทรกแซงในระดับน้ำหนัก (weight-level) ไม่ใช่การ fine-tune ทิศทางการปฏิเสธคือเวกเตอร์ใน residual stream ของโมเดล ซึ่งเมื่อถูกกระตุ้นจะทำให้เกิดคำตอบว่า "ฉันช่วยเรื่องนั้นไม่ได้" ขั้นตอนการ build นี้จะค้นหาทิศทางดังกล่าวและทำการ orthogonalize ทิศทางนั้นออกจากเวต ตามแนวทางของ Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction") โดยไม่มีการฝึกเวตใหม่แต่อย่างใด โมเดลฐานคือ Qwen/Qwen3.8-27B — โมเดลแบบ dense ขนาด 27B ที่มีสถาปัตยกรรมแบบไฮบริด (เลเยอร์ linear-attention แบบ Gated DeltaNet จำนวน 48 เลเยอร์ และเลเยอร์ full-attention จำนวน 16 เลเยอร์) รองรับความสามารถด้านภาพในตัว และมีคอนเทกซ์ขนาด 262,144 โทเคน สัญญาอนุญาตคือ Apache 2.0 ซึ่งสืบทอดมาจากโมเดลฐาน โปรดสังเกตว่า repo อย่างเป็นทางการของ Qwen เผยแพร่เฉพาะ safetensors แบบ BF16 เท่านั้น — ไม่มี GGUF อย่างเป็นทางการของ Qwen — ดังนั้น GGUF แบบ uncensored ใดๆ ของโมเดลนี้ รวมถึงตัวนี้ ก็คือการแปลงมาจาก open weights ทั้งสิ้น

บันไดควอนต์ — F16 บวก 12 ระดับ

คลังนี้มาพร้อมไฟล์ F16 (54.6 GB กระจายในสองไฟล์) และระดับ quantization 12 ระดับ ขนาดที่ระบุด้านล่างเป็นขนาดไฟล์ของคลังเอง อ่านเมื่อวันที่ 16 สิงหาคม 2026; ขนาดไฟล์ GGUF อาจต่างกันเล็กน้อยในแต่ละบิลด์

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54.6 GB (2 ไฟล์) — ความแม่นยำอ้างอิง

Q8_0 — 29.0 GB — แทบไม่สูญเสียข้อมูล สำหรับ GPU ระดับสูง

Q6_K — 22.4 GB — จุดที่คุ้มค่าที่สุดของคุณภาพต่อกิกะไบต์

Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — คุณภาพสูงบนการ์ดที่มีความจุมากขึ้น

Q4_K_M — 16.8 GB — ค่าเริ่มต้นที่แนะนำ

Q4_K_S — 15.8 GB

IQ4_XS — 15.3 GB — ตัวเลือก low-bit ที่ดีที่สุด (ปรับเทียบด้วย imatrix)

Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — สำหรับการ์ด 16 GB

IQ3_M — 12.8 GB — ขนาดเล็ก (ปรับเทียบด้วย imatrix)

Q3_K_S — 12.3 GB

Q2_K — 10.9 GB — K-quant ที่เล็กที่สุด แลกมาด้วยคุณภาพที่ลดลงอย่างเห็นได้ชัด

คำแนะนำฮาร์ดแวร์: ใช้ Q4_K_M บนการ์ด 24 GB (RTX 4090 หรือ RTX 3090); ใช้ IQ4_XS หรือ Q3_K_M หากคุณมี 16 GB; ใช้ Q2_K เฉพาะเมื่อคุณจำกัดเหลือ 12 GB เนื่องจากโมเดลพื้นฐานใช้ระบบ attention แบบ hybrid Gated DeltaNet แคช KV จึงมีขนาดเล็ก — ประมาณ 0.5 GB ที่บริบท 8K — ดังนั้นคุณสามารถขยายหน้าต่างบริบทได้สูงกว่ามากเมื่อเทียบกับโมเดล dense ขนาด 27B ทั่วไป ส่วนวิทัศน์เพิ่มไฟล์แยกหนึ่งไฟล์: ตัวโปรเจกเตอร์ F16 มีขนาด 931 MB นอกจากนี้ยังมีซีรีส์ abliterated จากชุมชน 9-quant สำหรับโมเดลพื้นฐานเดียวกัน; ของเราเป็นการแปลงจาก FP8 abliteration ที่บันทึกไว้ โดยมี imatrix quants และตัวเลข refusal-delta จากหน้าการ์ดโมเดลรวมอยู่ด้วย

วิธีรันใน llama.cpp

สามขั้นตอน ข้อกำหนดหนึ่งข้อที่ไม่ชัดเจน: สถาปัตยกรรม qwen35 และการรองรับ MTP ถูกเพิ่มเข้ามาใน llama.cpp ในเดือนพฤษภาคม 2026 ดังนั้น อัปเดตเป็นบิลด์จาก 2026-05 หรือใหม่กว่า — บิลด์เก่าจะไม่สามารถโหลดไฟล์เหล่านี้ได้ (ตาม README ของ repo)

1. ดาวน์โหลดควอนต์ที่คุณเลือกไว้ พร้อมกับวิชันโปรเจกเตอร์ รีโพนี้มีการจำกัดการเข้าถึง ดังนั้นคุณต้องเข้าสู่ระบบ Hugging Face และยอมรับเงื่อนไขก่อน — การอ่าน README เป็นส่วนหนึ่งของการยอมรับว่าโมเดลนี้คืออะไร

huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. เริ่ม llama-server. ซึ่งให้บริการ endpoint ที่เข้ากันได้กับ OpenAI; -ngl 99/ โหลดทุกเลเยอร์ไปยัง GPU.

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3. (ไม่บังคับ) เปิดใช้งานเฮด MTP สำหรับการถอดรหัสแบบคาดเดา. เพิ่ม --spec-type draft-mtp/ — เฮด nextn ถูกฝังอยู่ในทุก quant แล้ว ดังนั้นจึงไม่จำเป็นต้องมีโมเดลร่างแยกต่างหาก.

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

การรันงานวิจัยแบบข้อความล้วนสามารถละเว้นได้ --mmproj/; การนำเข้ารูปภาพจำเป็นต้องใช้มัน เพราะโมเดลนี้เป็นโมเดลวิทัศน์-ภาษาโดยกำเนิด endpoint คือ http://localhost:8080/v1/chat/completions ดังนั้นโค้ด OpenAI SDK ที่มีอยู่จึงทำงานได้ด้วยการสลับ base-URL

ไม่มี GPU? ไลน์ที่ไม่มีการเซ็นเซอร์แบบเดียวกันถูกโฮสต์ไว้

GGUF ในเครื่อง{{1}}ไม่เสียค่าใช้จ่ายต่อโทเค็น{{/1}} แต่ต้องใช้ VRAM ประมาณ 17 GB สำหรับระดับ {{2}}Q4_K_M{{/2}} หากคุณไม่มีฮาร์ดแวร์ดังกล่าว การ์ดแบบโฮสต์ {{3}}obsidian/Qwen3.8-27B{{/3}} บน {{4}}OrcaRouter{{/4}} จะให้บริการโมเดล{{5}}สาย 27B แบบไม่เซ็นเซอร์เดียวกัน{{/5}} — {{6}}วิทัศน์ การใช้เหตุผล บริบท 262K{{/6}} — ในราคา {{7}}$0.40 ต่อล้านโทเค็นอินพุต{{/7}} และ {{8}}$4.21 ต่อล้านโทเค็นเอาต์พุต{{/8}} โดยการเข้าถึงจำกัดเฉพาะ{{9}}นักวิจัยด้านความปลอดภัย ทีมเรดทีม และนักวิจัยด้านความปลอดภัย AI{{/9}} ตระกูลน้ำหนักเดียวกัน สองรันไทม์: {{10}}GGUF ในเครื่อง{{/10}}, {{11}}FP8 ในคลาวด์{{/11}} {{12}}การตัดสินใจเรื่องการกลั่นกรองยังคงอยู่ฝั่งคุณไม่ว่ากรณีใด{{/12}}

ขอบเขตด้านความปลอดภัย — โปรดอ่านก่อนดาวน์โหลด

โมเดลนี้ได้ถูกลบการปรับแนวด้านความปลอดภัยออกไปอย่างมีนัยสำคัญ มันจะปฏิบัติตามคำขอที่เป็นอันตราย ผิดจริยธรรม ไม่เหมาะสม หรือผิดกฎหมาย ซึ่งโมเดลพื้นฐาน Qwen3.8-27B จะปฏิเสธ และมันไม่มีระบบป้องกันในตัวที่แท้จริงใดๆ มันถูกเผยแพร่เพื่อการวิจัยที่ถูกต้องตามกฎหมายเท่านั้น — การตีความได้ การศึกษากลไกการปฏิเสธ การทดสอบฝ่ายแดง (red-teaming) การประเมินความทนทาน และการทดสอบระบบป้องกัน คุณต้องรับผิดชอบและรับภาระผูกพันทั้งหมดต่อวิธีการที่คุณใช้มันและต่อทุกสิ่งที่มันสร้างขึ้น และคุณต้องไม่นำไปใช้งานกับผู้ใช้ปลายทางหรือนำไปใช้ในการผลิตโดยไม่เพิ่มชั้นความปลอดภัย การกลั่นกรอง และการป้องกันการใช้งานในทางที่ผิดของคุณเอง ผู้เขียนไม่รับผิดชอบใดๆ สัญญาอนุญาตคือ Apache 2.0

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

พฤติกรรมที่วัดได้บอกให้รู้ว่าการเป็น "{{1}}ไร้การเซ็นเซอร์{{/1}}" ต้องแลกมาด้วยอะไร จากชุดการประเมินความปลอดภัยของโมเดลการ์ด — ซึ่งรันบนบิลด์ FP8 และลงวันที่ 15 สิงหาคม 2026 ซึ่งก็คือเวตที่ GGUF นี้แปลงมาจาก: {{2}}การปฏิเสธพรอมป์อันตรายลดลงจาก 64–99% บนเวตฐาน เหลือ 0–6% บนเวตแบบ abliterated{{/2}}, {{3}}การปฏิเสธเกินจำเป็นต่อพรอมป์ปกติลดลงจาก 5.6% เหลือ 0.4%{{/3}}, และ {{4}}คะแนนความสามารถยังคงห่างจากโมเดลฐานไม่เกิน ±1.3 จุด{{/4}} ตัวเลขเหล่านี้คือเหตุผลว่าทำไมโมเดลประเภทนี้จึงเป็นวัตถุวิจัยที่ชอบด้วยเหตุผล — และมันคือคำเตือนเช่นเดียวกัน

บทความนี้จงใจไม่มีพรอมต์ที่เป็นอันตราย หากคุณกำลังประเมินตัวโมเดล ให้รันเกณฑ์มาตรฐานการปฏิเสธ — AdvBench, HarmBench, StrongREJECT, XSTest-safe — แล้วอ่านตัวเลขด้วยตนเอง นี่คือวิถีที่ได้รับการรับรองสำหรับการศึกษาโมเดลที่ถอดการปฏิเสธออก

เมื่อบิลด์นี้เป็นคำตอบที่ผิด

1. คุณต้องการผู้ช่วยปกติ โมเดลผิด มันไม่มีการ์ดป้องกัน และจะปฏิบัติตามคำขอที่เป็นอันตราย ใช้ Qwen3.8-27B ที่ปรับ alignment แล้วแทน.

2. สิ่งใดก็ตามที่คุณจะนำเสนอต่อผู้ใช้ปลายทางโมเดลที่ผิดไม่ว่าจะมีเจตนาใดก็ตาม Apache 2.0 ไม่ได้โอนความรับผิดชอบของคุณ และการส่งมอบโมเดลที่ไม่มีเกราะป้องกันให้ผู้ใช้ไม่ใช่กลยุทธ์การปรับใช้

3. คุณใช้ Apple Silicon อยู่ GGUF จะทำงานได้ แต่การแปลง MLX ของโมเดลฐานจะเข้ากันได้ดีกว่า — ดูคู่มือ MLX แยกต่างหากของเรา

4. คุณไม่ต้องการรันมันเลย. ใช้การ์ดแบบโฮสต์ — น้ำหนักเท่ากัน ไม่ต้องใช้ VRAM 17 GB และยังจำกัดเฉพาะงานวิจัยเหมือนเดิม.

บรรทัดล่าง

"Qwen 3.8 27B uncensored GGUF" มีคำตอบ และมันคือไฟล์ดาวน์โหลดที่เป็นรูปธรรม: Qwen3.8-27B-Uncensored-GGUF — F16 บวกกับการปรับคุณภาพ 12 ระดับสำหรับ llama.cpp, น้ำหนักที่ผ่านการกำจัดระบบปฏิเสธ (abliterated weights) จากบิลด์ FP8 ของเรา, คอนเทกซ์ 262K, วิทัศน์ (vision), และ MTP, ภายใต้สัญญาอนุญาต Apache 2.0 และสงวนไว้เพื่อการวิจัยเท่านั้น เลือก Q4_K_M สำหรับการ์ดขนาด 24 GB, อัปเดต llama.cpp หลังเดือนพฤษภาคม 2026, และรันเป็นเซิร์ฟเวอร์ท้องถิ่นที่เข้ากันได้กับ OpenAI เป็นเครื่องมือวิจัยสำหรับศึกษาการปฏิเสธของโมเดลและการทดสอบการ์ดป้องกัน (guardrails) — ไม่ใช่แชตบอต และไม่ใช่สิ่งที่จะนำไปเผยแพร่ น้ำหนักโมเดลให้ใช้ฟรี แต่ความรับผิดชอบต่อสิ่งที่คุณทำกับมันเป็นของคุณทั้งหมด

สำหรับการวิจัยที่ถูกต้องตามกฎหมาย โมเดล F16 และระดับ quant ทั้ง 12 ระดับมีอยู่บน Hugging Face: ดาวน์โหลด GGUF จาก Hugging Face

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube