
Qwen Không Kiểm Duyệt, Giải Thích: Cách Chạy Qwen3.8-27B-FP8 Đã Abliterated
- obsidianMỚIQwen3.8 27B Uncensored (Aggressive)2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-1361 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
Qwen không kiểm duyệt trên Hugging Face gần như luôn có nghĩa là abliteration — hướng từ chối của mô hình bị loại bỏ khỏi luồng dư của nó — và bản dựng nên bắt đầu là Qwen3.8-27B-Uncensored-FP8, được phát hành trên Hugging Face vào ngày 15 tháng 8 năm 2026. Đây là một bản dựng block-FP8 abliterated của Qwen3.8-27B, hoạt động trên cùng một đường dẫn kernel vLLM với bản phát hành FP8 chính thức, với ngữ cảnh 262K, tháp thị giác và đầu giải mã suy đoán MTP nguyên vẹn — và nó đã nhận được 257 lượt thích và 4.285 lượt tải về ngay trong ngày đầu tiên. Đây là một công cụ nghiên cứu, không phải chatbot: không có rào chắn tích hợp, giấy phép Apache 2.0, và nó sẽ đáp ứng các yêu cầu mà mô hình gốc từ chối. Hướng dẫn này đề cập đến việc abliteration thực sự đã thay đổi điều gì, cách tải 30,9 GB trọng số từ Hugging Face, cách phục vụ mô hình bằng vLLM, SGLang hoặc Transformers, và những gì nên chạy trên nó cho mục đích nghiên cứu hợp pháp.
"qwen uncensored" thực sự có nghĩa là gì?
Abliteration là một biện pháp can thiệp ở cấp độ trọng số, không phải là tinh chỉnh. Hướng từ chối là một vectơ trong luồng dư (residual stream) của mô hình; khi được kích hoạt, nó tạo ra câu trả lời "Tôi không thể giúp việc đó". Abliteration tìm ra hướng đó và trực giao hóa nó ra khỏi các trọng số. Trong bản dựng này, việc loại bỏ được áp dụng cho 131 ma trận ghi phần dư (theo phương pháp của Arditi et al. 2024, "Refusal in Language Models Is Mediated by a Single Direction"), và kết quả được lượng tử hóa lại để khớp từng byte với lược đồ FP8 chính thức của Qwen3.8-27B, nhờ đó vLLM phục vụ mô hình trên cùng một đường dẫn kernel FP8. Không có trọng số mới nào được huấn luyện.
Sự khác biệt đó quan trọng vì các kết quả hàng đầu cho "qwen uncensored" pha trộn ba thứ khác nhau: các chỉnh sửa trọng số kiểu abliterated như cái này, các "gói không kiểm duyệt" dùng system prompt chỉ che giấu sự từ chối ở mức prompt, và các bản tinh chỉnh LoRA được huấn luyện mà không có dữ liệu an toàn. Chúng không tương đương nhau, và hầu hết các trang xếp hạng cho truy vấn này đều không cho bạn biết chúng đang mô tả nhánh nào. Nếu bạn muốn nghiên cứu cơ chế từ chối thực sự, chỉ có can thiệp ở mức trọng số mới là thứ đích thực.
Việc loại bỏ sự từ chối thực sự đã làm gì — những con số
Thẻ thông tin mô hình công bố một bộ đánh giá an toàn, được chạy trên mô hình do vLLM phục vụ và có ngày 15 tháng 8 năm 2026. Khi tắt chế độ suy luận, tỷ lệ từ chối trên bảy bộ benchmark dùng prompt độc hại giảm mạnh từ 64–99% ở mô hình gốc xuống còn 0–6% ở bản build này: AdvBench từ 99,0% xuống 0,0%, JailbreakBench từ 94,0% xuống 0,0%, StrongREJECT từ 97,3% xuống 2,0%, HarmBench từ 98,7% xuống 2,7%, MaliciousInstruct từ 99,0% xuống 0,0%, SimpleSafetyTests từ 64,0% xuống 6,0%, ForbiddenQuestions từ 73,3% xuống 4,7%. Khi bật chế độ suy luận, mô hình gần như không bao giờ từ chối — 1,7% hoặc thấp hơn. Một con số riêng biệt đáng chú ý là tỷ lệ có kèm lời cảnh báo: 30–50% số câu trả lời "không kiểm duyệt" vẫn thêm một đoạn tuyên bố miễn trừ ngắn trước khi trả lời; đó là một sản phẩm phụ của quá trình huấn luyện, không phải là hành vi từ chối.
Mặt trái là những gì không thay đổi. Tình trạng từ chối thái quá đối với các lời nhắc vô hại giảm từ 5.6% xuống 0.4% trên XSTest-safe, và mọi điểm chuẩn năng lực đều nằm trong khoảng ±1.3 điểm so với mô hình cơ sở: MMLU từ 84.3% lên 84.7%, GSM8K từ 90.0% xuống 88.7%, MMLU-Pro từ 77.6% xuống 76.8%, CMMLU từ 81.4% xuống 80.8%. Độ perplexity của WikiText-2 là 6.96. Nói cách khác, biện pháp can thiệp đã loại bỏ hành vi từ chối mà không làm suy giảm đáng kể mô hình.

Cách tải nó từ Hugging Face
Kho lưu trữ là orcarouter/Qwen3.8-27B-Uncensored-FP8 và nó được kiểm soát truy cập: bạn đăng nhập bằng tài khoản Hugging Face và chấp nhận các điều khoản trước khi tải tệp xuống — việc kiểm soát truy cập này chính là tuyên bố miễn trừ trách nhiệm, vì đọc README là một phần của việc chấp nhận mô hình này là gì. Thứ bạn đang tải xuống là 30,9 GB trải trên bảy phân đoạn safetensors (1.606 tensor) ở dạng block-FP8 (E4M3, khối 128×128, kích hoạt động), với tháp thị giác, các lớp chuẩn hóa, embedding và lm_head được giữ ở BF16. Giấy phép là Apache 2.0, được kế thừa từ Qwen/Qwen3.8-27B gốc. Không có Hugging Face Inference Provider nào lưu trữ nó — bạn tự chạy nó, hoặc dùng một card được lưu trữ.
Cách chạy nó
Các trọng số nặng khoảng 31 GB — khoảng một nửa checkpoint BF16 ~56 GB — và thẻ khuyến nghị một H100 80GB hoặc H200 143GB đơn lẻ, với ~40 GB VRAM là mức tối thiểu thực tế cho trọng số cộng với một bộ đệm KV nhỏ. Ngữ cảnh đầy đủ 262K cần nhiều hơn, nhưng bộ đệm KV FP8 giảm con số đó đi một nửa. Thiết lập mà thẻ đã xác minh là một H200 với --max-num-seqs 96, bộ đệm KV FP8 và MTP được bật.
vLLM là đường dẫn dự kiến, và nó chỉ là một lệnh, vì lược đồ FP8 khớp chính xác với bản build chính thức:
Chạy lệnh `vllm serve` với mô hình `orcarouter/Qwen3.8-27B-Uncensored-FP8`
Điều đó cung cấp cho bạn một endpoint tương thích OpenAI tại localhost:8000/v1/chat/completions. Tương đương với Docker là docker model run hf.co/orcarouter/Qwen3.8-27B-Uncensored-FP8. Để thiết lập đầy đủ, model card gợi ý: --language-model-only để phục vụ chỉ văn bản, --speculative-config '{"method":"mtp","num_speculative_tokens":3}' để bật đầu giải mã suy đoán MTP, --kv-cache-dtype fp8, --max-model-len 262144, --reasoning-parser qwen3, và --enable-auto-tool-choice --tool-call-parser qwen3_coder để gọi công cụ. Đừng truyền --quantization fp8 — cơ chế được đọc từ config.json. Bỏ --kv-cache-dtype fp8 nếu bạn muốn KV cache BF16, và bỏ --language-model-only nếu bạn cần tháp thị giác.
Đối với SGLang: python3 -m sglang.launch_server --model-path "orcarouter/Qwen3.8-27B-Uncensored-FP8" --host 0.0.0.0 --port 30000. Đối với Transformers, thẻ mô hình mô tả cả pipeline API — pipeline("image-text-to-text", model="orcarouter/Qwen3.8-27B-Uncensored-FP8") — lẫn AutoProcessor.from_pretrained(...) cùng AutoModelForMultimodalLM.from_pretrained(..., device_map="auto").

Thực sự nên làm gì với nó trong nghiên cứu
Mục đích của một mô hình đã gỡ bỏ cơ chế từ chối là trở thành đối tượng nghiên cứu, và bản build này đặc biệt dễ nghiên cứu vì sự can thiệp của nó được ghi chép đầy đủ. Ba dự án nghiên cứu cụ thể và hợp pháp:
• Tái tạo mức chênh lệch từ chối. Chạy AdvBench, HarmBench, StrongREJECT hoặc XSTest-safe trên cả bản build abliterated lẫn FP8 gốc, và xác nhận các con số trên thẻ: 64–99% xuống 0–6% đối với các prompt độc hại, 5.6% xuống 0.4% từ chối thái quá đối với các prompt vô hại. Cặp trước/sau đó chính xác là phép đo mà một nhóm an toàn cần để biết liệu một phương pháp loại bỏ từ chối có hiệu quả hay không và nó phải trả giá gì.
• Nghiên cứu nơi hành vi từ chối cư trú. Vì bản build ghi lại 131 ma trận đã được trực giao hóa, bạn có thể so sánh các hướng của luồng phần dư với bản gốc và xem can thiệp đã di chuyển điều gì. Kết quả khi bật suy luận rất đáng chú ý ở đây: tỷ lệ từ chối giảm xuống còn 1,7% hoặc thấp hơn khi suy luận được bật, đây là bằng chứng cho thấy chuỗi lý luận chính là nơi hướng tác động có ý nghĩa nhất.
• Đánh giá guardrail của chính bạn. Một đường cơ sở không có guardrail là đối chứng chính xác để kiểm thử một lớp kiểm duyệt. Chạy bộ lọc của bạn trên các đầu ra của mô hình này và đo lường những gì nó chặn được — đó là cách bạn định lượng lớp an toàn mà bạn thêm vào bên trên.
Khi mô hình này là câu trả lời sai
Nếu bạn muốn một trợ lý thông thường, hoặc bất cứ thứ gì bạn đặt trước người dùng cuối, thì đây là mô hình sai — nó không có rào chắn tích hợp có ý nghĩa nào, nó sẽ tuân thủ các yêu cầu mà mô hình gốc từ chối, và Apache 2.0 không chuyển đi trách nhiệm pháp lý của bạn. Hãy dùng bản Qwen3.8-27B aligned gốc thay vào đó. Nếu bạn muốn làm giảm các lời từ chối trên một chatbot, một gói system prompt đạt được nhiều hơn với rủi ro thấp hơn so với chỉnh sửa trọng số. Và nếu bạn không có card ~40 GB nhưng vẫn muốn nghiên cứu mô hình, thẻ lưu trữ obsidian/Qwen3.8-27B trên OrcaRouter phục vụ cùng dòng 27B không kiểm duyệt với giá $0.40 mỗi triệu token đầu vào và $4.21 mỗi triệu token đầu ra, cùng ngữ cảnh 262K — nó bị giới hạn cho các nhà nghiên cứu an ninh và an toàn AI, và quyết định kiểm duyệt vẫn nằm về phía bạn.

Ranh giới an toàn — hãy đọc trước khi bạn tải xuống
Mô hình này đã bị loại bỏ phần lớn khả năng căn chỉnh an toàn. Nó sẽ tuân thủ các yêu cầu có hại, phi đạo đức, xúc phạm hoặc bất hợp pháp mà bản gốc Qwen3.8-27B sẽ từ chối, và nó không có bất kỳ rào chắn bảo vệ tích hợp nào đáng kể. Nó được phát hành hoàn toàn vì mục đích nghiên cứu hợp pháp — nghiên cứu khả năng diễn giải, an toàn AI và cơ chế từ chối, red-teaming, đánh giá độ bền vững và các thử nghiệm có kiểm soát. Bạn chịu toàn bộ trách nhiệm và trách nhiệm pháp lý về cách bạn sử dụng nó và mọi thứ nó tạo ra, đồng thời bạn không được triển khai nó cho người dùng cuối hoặc đưa vào sản xuất nếu chưa bổ sung các lớp an toàn, kiểm duyệt và ngăn chặn lạm dụng của riêng bạn. Các tác giả không chịu trách nhiệm pháp lý cho việc sử dụng sai. Tải xuống kho lưu trữ nghĩa là bạn chấp nhận các điều kiện này; giấy phép là Apache 2.0.
Bài viết này cố ý không chứa các lời nhắc có hại. Các số liệu từ chối ở trên đến từ bộ công cụ đánh giá an toàn của chính thẻ mô hình, đây là cách chính xác để đo lường một mô hình thuộc lớp này: chạy các bài kiểm tra chuẩn về từ chối, đọc các con số và thiết kế nghiên cứu của bạn dựa trên những gì chúng cho thấy.
Kết luận
"Qwen uncensored" là cụm từ tìm kiếm dành cho một kỹ thuật, và phiên bản nên thử đầu tiên là Qwen3.8-27B-Uncensored-FP8: bản build Qwen3.8 duy nhất đã loại bỏ cơ chế từ chối, chạy trên đường ống kernel FP8 vLLM chính thức với ngữ cảnh 262K, giữ nguyên khả năng thị giác và MTP, kèm theo đánh giá trước/sau đã được công bố. Tải bản 30,9 GB có kiểm soát (gated) từ Hugging Face, phục vụ bằng vLLM trên một GPU H100 hoặc H200 duy nhất, và dùng nó đúng mục đích — đo lường mức độ từ chối, nghiên cứu cơ chế từ chối, và kiểm thử các biện pháp bảo vệ (guardrails). Không dùng nó như chatbot, và không cung cấp cho người dùng cuối. Trọng số (weights) là miễn phí; trách nhiệm về những gì bạn làm với chúng hoàn toàn thuộc về bạn.
Đối với nghiên cứu chính đáng, các trọng số có trên Hugging Face: Tải xuống từ Hugging Face
