
Qwen 3.8 27B Uncensored GGUF: Bản dựng cục bộ Abliterated, 12 Quants và Ranh giới chỉ dành cho nghiên cứu
- obsidianMỚIQwen3.8 27B Uncensored (Aggressive)2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-1358 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
Qwen 3.8 27B uncensored GGUF là một bản tải xuống thực sự, và bản dựng nên bắt đầu là Qwen3.8-27B-Uncensored-GGUF — được xuất bản trên Hugging Face vào ngày 16 tháng 8 năm 2026 với vai trò là phiên bản llama.cpp gốc của bản phát hành FP8 đã abliterated của chúng tôi. Nó có cùng các trọng số 27 tỷ tham số đã loại bỏ từ chối như Qwen3.8-27B-Uncensored-FP8, được chuyển đổi sang GGUF để suy luận cục bộ: F16 cùng 12 mức lượng tử từ Q2_K đến Q8_0 (bao gồm các lượng tử imatrix IQ3_M và IQ4_XS), cửa sổ ngữ cảnh 262K, một bộ chiếu thị giác riêng biệt, và phần đầu giải mã suy đoán MTP còn nguyên vẹn. "Uncensored" nghĩa là abliterated — hướng từ chối đã được trực giao hóa ra khỏi trọng số — vì vậy nó sẽ trả lời ở những nơi mà mô hình nền đã căn chỉnh từ chối, và đó chính xác là lý do nó chỉ dành cho nghiên cứu. Đây là những gì kho lưu trữ thực sự chứa, mức lượng tử nào phù hợp với GPU của bạn, cách chạy nó trong llama.cpp, và ranh giới an toàn bạn chấp nhận khi tải nó về.
Bản tóm tắt 30 giây: F16 cùng 12 quants, Q4_K_M ở 16.8 GB là lựa chọn mặc định, bạn cần bản dựng llama.cpp từ tháng 5/2026 trở lên, và đây là công cụ nghiên cứu không có rào chắn an toàn — không phải thứ để triển khai cho người dùng cuối.
"GGUF không kiểm duyệt" thực sự có nghĩa là gì — và bản dựng này khác biệt thế nào so với phiên bản FP8
GGUF là định dạng mô hình tệp đơn mà llama.cpp sử dụng; FP8 là một sơ đồ lượng tử hóa chạy trên máy chủ GPU vLLM. Hai bản phát hành không kiểm duyệt của chúng tôi là cùng một bộ trọng số đã được abliterated trong hai môi trường chạy. Qwen3.8-27B-Uncensored-FP8 (15 tháng 8, 2026) nhắm đến vLLM trên máy chủ, được lượng tử hóa lại theo sơ đồ Qwen3.8-27B-FP8 chính thức để phục vụ trên cùng một đường dẫn kernel. Qwen3.8-27B-Uncensored-GGUF (16 tháng 8, 2026) nhắm đến llama.cpp trên máy cục bộ — GPU máy bàn hoặc trạm làm việc bạn kiểm soát. Cùng trọng số, mô hình triển khai khác nhau: API đám mây so với tiến trình cục bộ.
Abliteration là một can thiệp ở mức trọng số, không phải là tinh chỉnh. Hướng từ chối là một vector trong luồng dư (residual stream) của mô hình; khi được kích hoạt, nó tạo ra phản hồi "Tôi không thể giúp được việc đó"; quá trình xây dựng tìm ra hướng đó và trực giao hóa nó khỏi các trọng số, theo cách tiếp cận của Arditi và cộng sự (2024) ("Refusal in Language Models Is Mediated by a Single Direction"). Không có trọng số mới nào được huấn luyện. Mô hình cơ sở là Qwen/Qwen3.8-27B — một mô hình dense 27B với kiến trúc lai (48 lớp chú ý tuyến tính Gated DeltaNet và 16 lớp chú ý đầy đủ), khả năng thị giác tích hợp sẵn và ngữ cảnh 262.144 token. Giấy phép là Apache 2.0, kế thừa từ mô hình cơ sở. Lưu ý rằng kho chính thức của Qwen chỉ cung cấp safetensors BF16 — không có GGUF Qwen chính thức — vì vậy bất kỳ GGUF không kiểm duyệt nào của mô hình này, kể cả bản này, đều là bản chuyển đổi từ trọng số mở.
Thang định lượng — F16 cộng 12 cấp
Repo cung cấp F16 (54.6 GB trong hai tệp) và 12 mức lượng tử hóa. Các kích thước dưới đây là kích thước tệp của chính repo, được ghi nhận vào ngày 16 tháng 8 năm 2026; kích thước tệp GGUF có thể thay đổi đôi chút giữa các bản build.

• F16 — 54.6 GB (2 tệp) — độ chính xác tham chiếu
• Q8_0 — 29.0 GB — gần như không mất chất lượng, dành cho GPU cao cấp
• Q6_K — 22.4 GB — điểm tối ưu về chất lượng trên mỗi gigabyte
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — chất lượng cao trên các card lớn
• Q4_K_M — 16.8 GB — mặc định được khuyến nghị
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — lựa chọn low-bit tốt nhất (được hiệu chuẩn bằng imatrix)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — dành cho thẻ 16 GB
• IQ3_M — 12.8 GB — kích thước nhỏ gọn (được hiệu chuẩn bằng imatrix)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — K-quant nhỏ nhất, đánh đổi chất lượng rõ rệt
Hướng dẫn phần cứng: Q4_K_M trên card 24 GB (RTX 4090 hoặc RTX 3090); IQ4_XS hoặc Q3_K_M nếu bạn dùng 16 GB; Q2_K chỉ khi bạn bị giới hạn ở 12 GB. Vì mô hình cơ sở sử dụng attention Gated DeltaNet lai, KV cache rất nhỏ — khoảng 0,5 GB ở ngữ cảnh 8K — nên bạn có thể đẩy cửa sổ ngữ cảnh cao hơn nhiều so với mô hình dense 27B thông thường. Vision thêm một tệp riêng: bộ chiếu F16 có dung lượng 931 MB. Một bộ abliterated cộng đồng với 9 mức lượng tử cho cùng mô hình cơ sở cũng tồn tại; bản của chúng tôi là chuyển đổi từ bản abliteration FP8 đã được tài liệu hóa, với các mức lượng tử imatrix và các số refusal-delta trong thẻ mô hình được giữ nguyên.
Cách chạy nó trong llama.cpp
Ba bước. Một yêu cầu không dễ thấy: kiến trúc qwen35 và hỗ trợ MTP đã được thêm vào llama.cpp vào tháng 5 năm 2026, vì vậy hãy cập nhật lên bản build từ 2026-05 trở lên — các bản build cũ hơn sẽ không tải được các tệp này (theo README của repo).
1. Tải xuống bản quant bạn đã chọn cùng với vision projector.Kho lưu trữ bị giới hạn truy cập, vì vậy bạn cần đăng nhập vào Hugging Face và chấp nhận các điều kiện trước — việc đọc README là một phần của việc chấp nhận bản chất của mô hình này.
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. Khởi động llama-server. Dịch vụ này cung cấp một endpoint tương thích OpenAI; -ngl 99/ chuyển tất cả các lớp sang GPU.
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3. (Tùy chọn) bật head giải mã dự đoán MTP. Thêm --spec-type draft-mtp/ — head nextn được tích hợp trong mọi quant, nên không cần mô hình draft riêng.

Các lần chạy nghiên cứu chỉ dùng văn bản có thể bỏ --mmproj/; đầu vào hình ảnh cần nó vì đây là mô hình ngôn ngữ-thị giác nguyên bản. Điểm cuối là http://localhost:8080/v1/chat/completions, vì vậy mã OpenAI SDK hiện có hoạt động chỉ với việc hoán đổi URL gốc.
Không có GPU? Cùng dòng không kiểm duyệt đó cũng được lưu trữ
GGUF cục bộ không tốn phí mỗi token nhưng cần khoảng 17 GB VRAM cho mức Q4_K_M. Nếu bạn không sở hữu phần cứng này, mô hình lưu trữ obsidian/Qwen3.8-27B trên OrcaRouter phục vụ cùng dòng 27B không kiểm duyệt — thị giác, lập luận, ngữ cảnh 262K — với giá $0,40 mỗi triệu token đầu vào và $4,21 mỗi triệu token đầu ra, quyền truy cập được giới hạn cho các nhà nghiên cứu bảo mật, đội red team và các nhà nghiên cứu an toàn AI. Cùng một họ trọng số, hai môi trường chạy: GGUF cục bộ, FP8 trên đám mây. Quyết định kiểm duyệt vẫn nằm ở phía bạn trong cả hai trường hợp.
Ranh giới an toàn — hãy đọc trước khi bạn tải xuống
Mô hình này đã bị loại bỏ phần lớn cơ chế căn chỉnh an toàn. Nó sẽ tuân thủ các yêu cầu có hại, phi đạo đức, xúc phạm hoặc bất hợp pháp mà mô hình cơ sở Qwen3.8-27B sẽ từ chối, và nó không có rào chắn tích hợp đáng kể nào. Mô hình được phát hành hoàn toàn cho mục đích nghiên cứu hợp pháp — khả năng diễn giải, nghiên cứu cơ chế từ chối, red-teaming, đánh giá độ bền vững và thử nghiệm rào chắn an toàn. Bạn chịu toàn bộ trách nhiệm và nghĩa vụ pháp lý về cách bạn sử dụng nó cũng như mọi nội dung nó tạo ra, và bạn không được triển khai nó cho người dùng cuối hoặc đưa vào môi trường sản xuất nếu chưa bổ sung các lớp an toàn, kiểm duyệt và ngăn chặn lạm dụng của riêng bạn. Các tác giả không chịu bất kỳ trách nhiệm pháp lý nào. Giấy phép là Apache 2.0.

Hành vi đo được cho bạn biết cái giá của việc "không kiểm duyệt" là gì. Từ bộ đánh giá an toàn của thẻ mô hình — chạy trên bản FP8 và ghi ngày 15 tháng 8 năm 2026, đây là trọng số mà file GGUF này chuyển đổi: tỷ lệ từ chối prompt độc hại giảm từ 64–99% trên mô hình gốc xuống còn 0–6% trên trọng số đã abliterated, tỷ lệ từ chối quá mức với nội dung lành tính giảm từ 5,6% xuống 0,4%, và điểm năng lực vẫn nằm trong khoảng ±1,3 điểm so với mô hình gốc. Những con số đó là lý do vì sao lớp mô hình này là một đối tượng nghiên cứu hợp pháp — và chúng cũng chính là lời cảnh báo.
Bài viết này cố ý không chứa các lời nhắc có hại. Nếu bạn đang đánh giá mô hình, hãy chạy các bài kiểm tra từ chối chuẩn — AdvBench, HarmBench, StrongREJECT, XSTest-safe — và tự đọc các con số. Đó là cách được công nhận để nghiên cứu một mô hình đã được loại bỏ khả năng từ chối.
Khi bản dựng này là câu trả lời sai
1. Bạn muốn một trợ lý bình thường. Nhầm model rồi. Nó không có guardrails và sẽ tuân theo các yêu cầu có hại. Thay vào đó, hãy dùng Qwen3.8-27B đã được căn chỉnh.
2. Bất cứ điều gì bạn đưa ra trước người dùng cuối.Mô hình sai bất kể ý định. Apache 2.0 không chuyển giao trách nhiệm pháp lý của bạn, và việc phát hành một mô hình không có rào chắn bảo vệ cho người dùng không phải là một chiến lược triển khai.
3. Bạn đang sử dụng Apple Silicon. GGUF vẫn chạy được, nhưng bản chuyển đổi MLX của mô hình gốc là lựa chọn phù hợp hơn — hãy xem hướng dẫn MLX riêng của chúng tôi.
4. Bạn không muốn chạy nó chút nào. Hãy dùng thẻ lưu trữ — cùng trọng số, không cần 17 GB VRAM, và cùng cổng chỉ dành cho nghiên cứu.
Kết luận
"Qwen 3.8 27B uncensored GGUF" có câu trả lời, và đó là một bản tải xuống cụ thể: Qwen3.8-27B-Uncensored-GGUF — F16 cùng 12 mức lượng tử hóa cho llama.cpp, các trọng số abliterated từ bản dựng FP8 của chúng tôi, ngữ cảnh 262K, thị giác và MTP, theo Apache 2.0 và chỉ dành cho nghiên cứu. Chọn Q4_K_M trên card 24 GB, cập nhật llama.cpp sau tháng 5 năm 2026 và chạy nó như một máy chủ tương thích OpenAI cục bộ. Đây là một công cụ nghiên cứu để tìm hiểu hành vi từ chối và thử nghiệm các biện pháp bảo vệ — không phải là chatbot, và không phải thứ để phát hành. Các trọng số là miễn phí; trách nhiệm với những gì bạn làm với chúng hoàn toàn thuộc về bạn.
Vì mục đích nghiên cứu hợp pháp, F16 và tất cả 12 mức lượng tử hóa đều có trên Hugging Face: Tải xuống GGUF từ Hugging Face
