Minh họa vector phẳng theo phong cách biên tập cho phần hero của blog công nghệ, mô tả việc chạy cục bộ một mô hình ngôn ngữ lớn không kiểm duyệt, đã được abliterated (loại bỏ cơ chế từ chối) ngay trên phần cứng của chính bạn: một chip mô hình lớn bo tròn màu xanh dương đậm với ánh sáng cyan dịu lơ lửng phía trung tâm bên trái, mạch điện bên trong của nó tan biến từ hình ổ khóa đóng thành hình ổ khóa mở. Bên phải là một card GPU nhỏ gọn trên bàn làm việc cùng một cửa sổ terminal thanh mảnh với các thanh lệnh ngang trừu tượng và một hình bóng con llama nhỏ bên cạnh. Ở góc trên có một biểu tượng kính hiển vi nhỏ và một chiếc khiên bo tròn kèm hình tam giác cảnh báo, gợi ý về mục đích nghiên cứu và ranh giới an toàn. Nền xanh dương nhạt và trắng dịu, khoảng trống rộng rãi trải dài khắp một phần ba phía dưới. Không có văn bản đọc được.
Guides & Insights

Cách chạy Qwen3.8-27B-Uncensored cục bộ: GGUF Quants, llama.cpp và Ollama

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Để chạy Qwen3.8-27B-Uncensored cục bộ, hãy tải kho GGUF gated orcarouter/Qwen3.8-27B-Uncensored-GGUF từ Hugging Face, chọn bản lượng tử hóa theo VRAM của bạn — Q4_K_M (16,8 GB) cho GPU 24 GB, IQ4_XS (15,3 GB) cho GPU 16 GB, Q3_K_M (13,5 GB) khi bạn cần thêm không gian cho ngữ cảnh — và phục vụ nó bằng bản dựng llama.cpp hiện tại với cờ --jinja, thêm --mmproj nếu bạn cần thị giác. Chính tệp này có thể nhập vào Ollama chỉ với ba lệnh. Đây là phiên bản GGUF của bản dựng Qwen3.8 27B abliterated, phát hành ngày 16 tháng 8 năm 2026, với ngữ cảnh gốc 262K, bộ chiếu thị giác và đầu suy đoán MTP được giữ nguyên trong mọi bản lượng tử hóa. Đây là công cụ nghiên cứu, không phải trợ lý: hành vi từ chối đã bị loại bỏ, nó không có sẵn các rào chắn an toàn, và giấy phép là Apache 2.0. Hãy đọc ranh giới an toàn ở cuối trang này trước khi tải xuống — đó chính là mục đích của kho gated.

Tải GGUF nào, theo VRAM

Repo cung cấp một cặp full-precision và mười hai tệp lượng tử hóa, vì vậy quyết định tải xuống thực chất là quyết định về VRAM. Các con số dưới đây là kích thước tệp được đọc từ kho lưu trữ Hugging Face vào ngày 2026-08-16.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

Thực sự có gì trong repo

orcarouter/Qwen3.8-27B-Uncensored-GGUF chứa mười lăm tệp mô hình: các trọng số F16 được tách thành hai phần, mười hai GGUF lượng tử hóa — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M và IQ4_XS — và bộ chiếu thị giác mmproj. Đây là bản xuất GGUF của cùng bản build abliterated như Qwen3.8-27B-Uncensored-FP8, được đóng gói lại cho các môi trường chạy cục bộ thuộc lớp llama.cpp, và nó kế thừa giấy phép Apache 2.0 của mô hình cơ sở cùng ngữ cảnh 262.144 token vốn có.

Ba thuộc tính này đều được duy trì ở mọi quant. Kiến trúc là qwen35 — chú ý lai gồm 48 lớp tuyến tính Gated DeltaNet và 16 lớp full-attention — lý do khiến repo không tải được trong các bản build llama.cpp cũ và KV cache luôn nhỏ. đầu giải mã suy đoán MTP (nextn) được giữ nguyên ở mọi quant, cả K-quant lẫn IQ. Ngoài ra, chat template là Qwen Jinja template mà bạn phải bật một cách tường minh (xem bên dưới), nếu không các cuộc trò chuyện nhiều lượt sẽ bị hỏng.

Tại sao KV cache vẫn đủ nhỏ để đáng chú ý

Đây là chi tiết giúp câu chuyện chạy local trở nên khả thi. Trong 64 lớp, chỉ có 16 lớp sử dụng full attention; 48 lớp còn lại sử dụng Gated DeltaNet linear attention, loại không giữ KV cache thông thường. Hiệu quả thực tế, theo runbook gốc của kiến trúc này, là một KV cache khoảng 2 GB ở ngữ cảnh 32K — khoảng một phần tư so với những gì một mô hình 27B thông thường cần. Đó là lý do tại sao tệp Q4_K_M 16.8 GB vẫn nằm gọn trong một card 24 GB có cửa sổ ngữ cảnh dài, và tại sao dòng GGUF không kiểm duyệt lại có thể chạy được trên phần cứng vốn không thể chứa nổi checkpoint BF16 55.6 GB.

Chạy nó với llama.cpp

llama.cpp là con đường dự kiến. Bạn cần một bản dựng hiện tại: nhánh chính đăng ký kiến trúc qwen35, và các bản dựng cũ sẽ từ chối thẳng thừng tệp tin. Dạng lệnh, từ các ghi chú sử dụng trong thẻ mô hình và sổ tay vận hành của kiến trúc này, là:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

Điều đó mang lại cho bạn một endpoint tương thích OpenAI tại localhost:8080. Để có đầu vào hình ảnh, hãy thêm --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Hãy thay Q4_K_M bằng quant phù hợp với VRAM của bạn; các cờ (flags) đều giống nhau.

**Chạy nó với Ollama**

Ollama chạy cùng tệp đó bằng cách nhập nó từ Modelfile, đây là cách được hỗ trợ để thêm một GGUF không có trong thư viện. Trong thư mục chứa bản quant bạn đã tải xuống:

FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

Lưu dòng đó thành Modelfile, sau đó ollama create qwen3.8-27b-uncensored -f Modelfileollama run qwen3.8-27b-uncensored. Đối với vision, hãy thêm dòng mmproj vào Modelfile (FROM ... Q4_K_M.gguf kèm đường dẫn mmproj) và Ollama sẽ kết nối projector cho bạn. Các lưu ý về --ctx và template vẫn áp dụng: hãy đặt kích thước context mà bạn thực sự có thể chứa được, và nhớ rằng một mô hình đã loại bỏ cơ chế từ chối sẽ trả lời không có rào chắn nào giữa bạn và đầu ra.

Việc gỡ bỏ từ chối thực sự đã thay đổi điều gì

Thẻ mô hình công bố một bộ đánh giá an toàn cho bản dựng này. Khi tắt suy luận, tỷ lệ từ chối trên các chuẩn đánh giá prompt độc hại tiêu chuẩn giảm từ 64–99% trên mô hình gốc xuống còn 0–6% trên các trọng số abliterated; khi bật suy luận, nó gần như không bao giờ từ chối — 1,7% hoặc ít hơn. Các chuẩn đánh giá năng lực vẫn nằm trong phạm vi ±1,3 điểm so với mô hình gốc. Đó là khuôn mẫu của mọi bản phát hành abliterated trong dòng này: loại bỏ từ chối, giữ nguyên năng lực, cùng với lưu ý rằng một phần không nhỏ câu trả lời vẫn thêm một tuyên bố miễn trừ ngắn trước khi phản hồi — một sản phẩm phụ của huấn luyện, không phải là từ chối.

Mặt trái là {{1}}toàn bộ ý nghĩa của ranh giới an toàn dưới đây: một mô hình không bao giờ từ chối không phải là một trợ lý tốt hơn, mà là một loại đối tượng khác.{{/1}} {{2}}Nó là một công cụ thử nghiệm để đo lường các cơ chế từ chối và để tìm hiểu xem biện pháp bảo vệ của chính bạn có hoạt động hay không.{{/2}}

Thực sự nên làm gì với nó trong nghiên cứu

Ba dự án hợp pháp là các trường hợp sử dụng được cho phép của một mô hình đã gỡ bỏ cơ chế từ chối:

Khi bản dựng này là câu trả lời sai

Nếu bạn muốn một trợ lý thông thường, hoặc bất cứ thứ gì bạn muốn đặt trước người dùng cuối, thì đây là mô hình sai — nó không có biện pháp bảo vệ tích hợp đáng kể, nó sẽ tuân thủ các yêu cầu mà mô hình gốc từ chối, và Apache 2.0 không chuyển trách nhiệm pháp lý của bạn đi. Hãy dùng bản Qwen3.8-27B gốc đã căn chỉnh cho việc đó. Nếu bạn muốn giảm bớt các lời từ chối trên chatbot, một gói system-prompt đạt được nhiều hơn với rủi ro thấp hơn so với việc sửa trọng số. Và nếu bạn không có GPU nào nhưng vẫn muốn nghiên cứu mô hình, phiên bản hosted obsidian/Qwen3.8-27B trên OrcaRouter phục vụ cùng dòng không kiểm duyệt với giá $0.40 mỗi triệu token đầu vào và $4.21 mỗi triệu token đầu ra, với cùng ngữ cảnh 262K; nó được giới hạn cho các nhà nghiên cứu bảo mật và an toàn AI giống như repo, và quyết định kiểm duyệt vẫn nằm ở phía bạn. Thẻ mô hình có chi tiết giá cả và điểm chuẩn.

Ranh giới an toàn — hãy đọc trước khi bạn tải xuống

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

Mô hình này đã bị loại bỏ phần lớn khả năng căn chỉnh an toàn. Nó sẽ tuân thủ các yêu cầu có hại, phi đạo đức, xúc phạm hoặc bất hợp pháp mà bản gốc Qwen3.8-27B sẽ từ chối, và nó không có bất kỳ rào chắn bảo vệ tích hợp nào đáng kể. Nó được phát hành hoàn toàn vì mục đích nghiên cứu hợp pháp — nghiên cứu khả năng diễn giải, an toàn AI và cơ chế từ chối, red-teaming, đánh giá độ bền vững và các thử nghiệm có kiểm soát. Bạn chịu toàn bộ trách nhiệm và trách nhiệm pháp lý về cách bạn sử dụng nó và mọi thứ nó tạo ra, đồng thời bạn không được triển khai nó cho người dùng cuối hoặc đưa vào sản xuất nếu chưa bổ sung các lớp an toàn, kiểm duyệt và ngăn chặn lạm dụng của riêng bạn. Các tác giả không chịu trách nhiệm pháp lý cho việc sử dụng sai. Tải xuống kho lưu trữ nghĩa là bạn chấp nhận các điều kiện này; giấy phép là Apache 2.0.

Bài viết này cố ý không chứa các lời nhắc có hại. Các số liệu từ chối ở trên đến từ bộ công cụ đánh giá an toàn của chính thẻ mô hình, đây là cách chính xác để đo lường một mô hình thuộc lớp này: chạy các bài kiểm tra chuẩn về từ chối, đọc các con số và thiết kế nghiên cứu của bạn dựa trên những gì chúng cho thấy.

Nguồn và ngày tháng

Tất cả các dữ kiện trên đều được xác minh vào ngày 2026-08-16. Danh sách tệp và kích thước được lấy từ kho lưu trữ Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (tạo ngày 16 tháng 8 năm 2026; kiến trúc qwen35; Apache 2.0; có kiểm soát truy cập). Các số liệu về từ chối và năng lực được lấy từ bộ đánh giá an toàn của thẻ mô hình. Phép đo bộ nhớ đệm KV (~2 GB ở ngữ cảnh 32K) được lấy từ sổ tay vận hành OrcaRouter cho kiến trúc này, How to Run Qwen 3.8 27B Locally. Giá lưu trữ và kiểm soát truy cập được lấy từ trang mô hình obsidian/Qwen3.8-27B, được kiểm tra cùng ngày. Kích thước tệp lượng tử hóa được tính bằng GB thập phân như được lưu trữ trên Hugging Face.

Đối với nghiên cứu hợp pháp, các trọng số đều có trên Hugging Face: Tải xuống từ Hugging Face — không cần thẻ tín dụng, chạy trong 60 giây.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube