
Cách chạy Qwen3.8-27B-Uncensored cục bộ: GGUF Quants, llama.cpp và Ollama
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
Để chạy Qwen3.8-27B-Uncensored cục bộ, hãy tải kho GGUF gated orcarouter/Qwen3.8-27B-Uncensored-GGUF từ Hugging Face, chọn bản lượng tử hóa theo VRAM của bạn — Q4_K_M (16,8 GB) cho GPU 24 GB, IQ4_XS (15,3 GB) cho GPU 16 GB, Q3_K_M (13,5 GB) khi bạn cần thêm không gian cho ngữ cảnh — và phục vụ nó bằng bản dựng llama.cpp hiện tại với cờ --jinja, thêm --mmproj nếu bạn cần thị giác. Chính tệp này có thể nhập vào Ollama chỉ với ba lệnh. Đây là phiên bản GGUF của bản dựng Qwen3.8 27B abliterated, phát hành ngày 16 tháng 8 năm 2026, với ngữ cảnh gốc 262K, bộ chiếu thị giác và đầu suy đoán MTP được giữ nguyên trong mọi bản lượng tử hóa. Đây là công cụ nghiên cứu, không phải trợ lý: hành vi từ chối đã bị loại bỏ, nó không có sẵn các rào chắn an toàn, và giấy phép là Apache 2.0. Hãy đọc ranh giới an toàn ở cuối trang này trước khi tải xuống — đó chính là mục đích của kho gated.
Tải GGUF nào, theo VRAM
Repo cung cấp một cặp full-precision và mười hai tệp lượng tử hóa, vì vậy quyết định tải xuống thực chất là quyết định về VRAM. Các con số dưới đây là kích thước tệp được đọc từ kho lưu trữ Hugging Face vào ngày 2026-08-16.

Thực sự có gì trong repo
orcarouter/Qwen3.8-27B-Uncensored-GGUF chứa mười lăm tệp mô hình: các trọng số F16 được tách thành hai phần, mười hai GGUF lượng tử hóa — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M và IQ4_XS — và bộ chiếu thị giác mmproj. Đây là bản xuất GGUF của cùng bản build abliterated như Qwen3.8-27B-Uncensored-FP8, được đóng gói lại cho các môi trường chạy cục bộ thuộc lớp llama.cpp, và nó kế thừa giấy phép Apache 2.0 của mô hình cơ sở cùng ngữ cảnh 262.144 token vốn có.
Ba thuộc tính này đều được duy trì ở mọi quant. Kiến trúc là qwen35 — chú ý lai gồm 48 lớp tuyến tính Gated DeltaNet và 16 lớp full-attention — lý do khiến repo không tải được trong các bản build llama.cpp cũ và KV cache luôn nhỏ. đầu giải mã suy đoán MTP (nextn) được giữ nguyên ở mọi quant, cả K-quant lẫn IQ. Ngoài ra, chat template là Qwen Jinja template mà bạn phải bật một cách tường minh (xem bên dưới), nếu không các cuộc trò chuyện nhiều lượt sẽ bị hỏng.
Tại sao KV cache vẫn đủ nhỏ để đáng chú ý
Đây là chi tiết giúp câu chuyện chạy local trở nên khả thi. Trong 64 lớp, chỉ có 16 lớp sử dụng full attention; 48 lớp còn lại sử dụng Gated DeltaNet linear attention, loại không giữ KV cache thông thường. Hiệu quả thực tế, theo runbook gốc của kiến trúc này, là một KV cache khoảng 2 GB ở ngữ cảnh 32K — khoảng một phần tư so với những gì một mô hình 27B thông thường cần. Đó là lý do tại sao tệp Q4_K_M 16.8 GB vẫn nằm gọn trong một card 24 GB có cửa sổ ngữ cảnh dài, và tại sao dòng GGUF không kiểm duyệt lại có thể chạy được trên phần cứng vốn không thể chứa nổi checkpoint BF16 55.6 GB.
Chạy nó với llama.cpp
llama.cpp là con đường dự kiến. Bạn cần một bản dựng hiện tại: nhánh chính đăng ký kiến trúc qwen35, và các bản dựng cũ sẽ từ chối thẳng thừng tệp tin. Dạng lệnh, từ các ghi chú sử dụng trong thẻ mô hình và sổ tay vận hành của kiến trúc này, là:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
Điều đó mang lại cho bạn một endpoint tương thích OpenAI tại localhost:8080. Để có đầu vào hình ảnh, hãy thêm --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Hãy thay Q4_K_M bằng quant phù hợp với VRAM của bạn; các cờ (flags) đều giống nhau.
**Chạy nó với Ollama**
Ollama chạy cùng tệp đó bằng cách nhập nó từ Modelfile, đây là cách được hỗ trợ để thêm một GGUF không có trong thư viện. Trong thư mục chứa bản quant bạn đã tải xuống:
FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
Lưu dòng đó thành Modelfile, sau đó ollama create qwen3.8-27b-uncensored -f Modelfile và ollama run qwen3.8-27b-uncensored. Đối với vision, hãy thêm dòng mmproj vào Modelfile (FROM ... Q4_K_M.gguf kèm đường dẫn mmproj) và Ollama sẽ kết nối projector cho bạn. Các lưu ý về --ctx và template vẫn áp dụng: hãy đặt kích thước context mà bạn thực sự có thể chứa được, và nhớ rằng một mô hình đã loại bỏ cơ chế từ chối sẽ trả lời không có rào chắn nào giữa bạn và đầu ra.
Việc gỡ bỏ từ chối thực sự đã thay đổi điều gì
Thẻ mô hình công bố một bộ đánh giá an toàn cho bản dựng này. Khi tắt suy luận, tỷ lệ từ chối trên các chuẩn đánh giá prompt độc hại tiêu chuẩn giảm từ 64–99% trên mô hình gốc xuống còn 0–6% trên các trọng số abliterated; khi bật suy luận, nó gần như không bao giờ từ chối — 1,7% hoặc ít hơn. Các chuẩn đánh giá năng lực vẫn nằm trong phạm vi ±1,3 điểm so với mô hình gốc. Đó là khuôn mẫu của mọi bản phát hành abliterated trong dòng này: loại bỏ từ chối, giữ nguyên năng lực, cùng với lưu ý rằng một phần không nhỏ câu trả lời vẫn thêm một tuyên bố miễn trừ ngắn trước khi phản hồi — một sản phẩm phụ của huấn luyện, không phải là từ chối.
Mặt trái là {{1}}toàn bộ ý nghĩa của ranh giới an toàn dưới đây: một mô hình không bao giờ từ chối không phải là một trợ lý tốt hơn, mà là một loại đối tượng khác.{{/1}} {{2}}Nó là một công cụ thử nghiệm để đo lường các cơ chế từ chối và để tìm hiểu xem biện pháp bảo vệ của chính bạn có hoạt động hay không.{{/2}}
Thực sự nên làm gì với nó trong nghiên cứu
Ba dự án hợp pháp là các trường hợp sử dụng được cho phép của một mô hình đã gỡ bỏ cơ chế từ chối:
Khi bản dựng này là câu trả lời sai
Nếu bạn muốn một trợ lý thông thường, hoặc bất cứ thứ gì bạn muốn đặt trước người dùng cuối, thì đây là mô hình sai — nó không có biện pháp bảo vệ tích hợp đáng kể, nó sẽ tuân thủ các yêu cầu mà mô hình gốc từ chối, và Apache 2.0 không chuyển trách nhiệm pháp lý của bạn đi. Hãy dùng bản Qwen3.8-27B gốc đã căn chỉnh cho việc đó. Nếu bạn muốn giảm bớt các lời từ chối trên chatbot, một gói system-prompt đạt được nhiều hơn với rủi ro thấp hơn so với việc sửa trọng số. Và nếu bạn không có GPU nào nhưng vẫn muốn nghiên cứu mô hình, phiên bản hosted obsidian/Qwen3.8-27B trên OrcaRouter phục vụ cùng dòng không kiểm duyệt với giá $0.40 mỗi triệu token đầu vào và $4.21 mỗi triệu token đầu ra, với cùng ngữ cảnh 262K; nó được giới hạn cho các nhà nghiên cứu bảo mật và an toàn AI giống như repo, và quyết định kiểm duyệt vẫn nằm ở phía bạn. Thẻ mô hình có chi tiết giá cả và điểm chuẩn.
Ranh giới an toàn — hãy đọc trước khi bạn tải xuống

Mô hình này đã bị loại bỏ phần lớn khả năng căn chỉnh an toàn. Nó sẽ tuân thủ các yêu cầu có hại, phi đạo đức, xúc phạm hoặc bất hợp pháp mà bản gốc Qwen3.8-27B sẽ từ chối, và nó không có bất kỳ rào chắn bảo vệ tích hợp nào đáng kể. Nó được phát hành hoàn toàn vì mục đích nghiên cứu hợp pháp — nghiên cứu khả năng diễn giải, an toàn AI và cơ chế từ chối, red-teaming, đánh giá độ bền vững và các thử nghiệm có kiểm soát. Bạn chịu toàn bộ trách nhiệm và trách nhiệm pháp lý về cách bạn sử dụng nó và mọi thứ nó tạo ra, đồng thời bạn không được triển khai nó cho người dùng cuối hoặc đưa vào sản xuất nếu chưa bổ sung các lớp an toàn, kiểm duyệt và ngăn chặn lạm dụng của riêng bạn. Các tác giả không chịu trách nhiệm pháp lý cho việc sử dụng sai. Tải xuống kho lưu trữ nghĩa là bạn chấp nhận các điều kiện này; giấy phép là Apache 2.0.
Bài viết này cố ý không chứa các lời nhắc có hại. Các số liệu từ chối ở trên đến từ bộ công cụ đánh giá an toàn của chính thẻ mô hình, đây là cách chính xác để đo lường một mô hình thuộc lớp này: chạy các bài kiểm tra chuẩn về từ chối, đọc các con số và thiết kế nghiên cứu của bạn dựa trên những gì chúng cho thấy.
Nguồn và ngày tháng
Tất cả các dữ kiện trên đều được xác minh vào ngày 2026-08-16. Danh sách tệp và kích thước được lấy từ kho lưu trữ Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (tạo ngày 16 tháng 8 năm 2026; kiến trúc qwen35; Apache 2.0; có kiểm soát truy cập). Các số liệu về từ chối và năng lực được lấy từ bộ đánh giá an toàn của thẻ mô hình. Phép đo bộ nhớ đệm KV (~2 GB ở ngữ cảnh 32K) được lấy từ sổ tay vận hành OrcaRouter cho kiến trúc này, How to Run Qwen 3.8 27B Locally. Giá lưu trữ và kiểm soát truy cập được lấy từ trang mô hình obsidian/Qwen3.8-27B, được kiểm tra cùng ngày. Kích thước tệp lượng tử hóa được tính bằng GB thập phân như được lưu trữ trên Hugging Face.
Đối với nghiên cứu hợp pháp, các trọng số đều có trên Hugging Face: Tải xuống từ Hugging Face — không cần thẻ tín dụng, chạy trong 60 giây.
