Thẻ tiêu đề cho video giải thích về LLM không kiểm duyệt, hiển thị sơ đồ của một mô hình với một hướng duy nhất được làm nổi bật đang được tách khỏi luồng nội bộ của nó và bị gạch chéo, kèm các chip ghi REFUSAL REMOVED, RESEARCH-ONLY và APACHE 2.0, cùng các biểu tượng cho khả năng diễn giải, red-teaming và đánh giá hàng rào bảo vệ.
Guides & Insights

LLM Không Kiểm Duyệt, Được Giải Thích: Kỹ thuật Abliteration, Ứng Dụng Nghiên Cứu, và Ranh Giới Bạn Không Được Vượt Qua

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mô hình LLM không kiểm duyệt là một mô hình ngôn ngữ có hành vi từ chối — phần của mô hình thay vì trả lời yêu cầu thì lại từ chối — đã bị loại bỏ có chủ đích. Hầu hết được tạo ra bằng phương pháp abliteration: nhà nghiên cứu tìm ra một hướng nội bộ duy nhất điều khiển sự từ chối và xóa nó khỏi trọng số, giữ nguyên phần còn lại của mô hình. Kết quả là một mô hình trả lời ở những nơi mà mô hình thường sẽ nói không, đó chính là lý do nó được nghiên cứu và cũng chính là lý do nó không dành cho sản xuất. Chúng tôi đã phát hành một bản dựng như vậy, Qwen3.8-27B-Uncensored-FP8, một phiên bản đã được abliteration và lượng tử hóa FP8 của Qwen3.8 27B, lên Hugging Face theo giấy phép Apache 2.0 như một tạo phẩm chỉ dùng cho nghiên cứu. Trang này là phần giải thích về danh mục: các mô hình này là gì, nghiên cứu nào biện minh cho chúng, cách làm việc với chúng an toàn, và ranh giới nằm ở đâu.

Một cách đóng khung giữ cho toàn bộ danh mục này được trung thực, nên để tôi nói thẳng ra: một mô hình không kiểm duyệt không thông minh hơn, trung thực hơn, hay có năng lực hơn mô hình gốc của nó. Nó vẫn là cùng một bộ trọng số với một hành vi bị loại bỏ. Mọi thứ nó vẫn biết, nó luôn biết — điều thay đổi là nó không còn từ chối nữa. Điều đó khiến nó trở thành một đối tượng thực sự hữu ích cho nghiên cứu an toàn, và một thứ thực sự không an toàn để triển khai. Cả hai nửa của câu đó đều chịu lực, và phần còn lại của trang này giải thích cả hai.

"Uncensored" thực sự có nghĩa là gì

• Hoặc truy cập qua thẻ mô hình của chúng tôi, trong đó có chi tiết về giá cả và điểm chuẩn.

Kỹ thuật này xuất phát từ một phát hiện về khả năng diễn giải (interpretability) vào năm 2024. Trong bài báo "Refusal in Language Models Is Mediated by a Single Direction" (Arditi và cộng sự, arXiv:2406.11717, NeurIPS 2024), các tác giả đã chỉ ra rằng trên 13 mô hình chat mã nguồn mở có quy mô từ 1,8B đến 72B tham số, hành vi từ chối được chi phối bởi một không gian con gần như một chiều của luồng dư (residual stream) — trạng thái nội bộ mang thông tin giữa các tầng. Loại bỏ hướng đó, mô hình ngừng từ chối; thêm nó trở lại, mô hình sẽ từ chối cả những yêu cầu vô hại.

Abliteration hiện thực hóa phát hiện đó: ước lượng hướng, rồi trực giao hóa nó ra khỏi các ma trận trọng số ghi vào luồng phần dư. Trên bản dựng của chúng tôi, Qwen3.8-27B-Uncensored-FP8, hướng từ chối được ước lượng tại một lớp duy nhất và bị loại bỏ khỏi 131 ma trận ghi phần dư, trong khi tháp thị giác không bị đụng tới. Thứ còn lại là cùng kiến thức, cùng khả năng suy luận, và cùng ngữ cảnh 262.144 token — với phần từ chối đã bị gỡ bỏ. Và để nói chính xác về nhãn: "uncensored" không có nghĩa là được căn chỉnh hay an toàn. Nó có nghĩa là rào chắn đã tắt. Chúng ta sẽ quay lại những gì điều đó đòi hỏi ở bạn.

Nghiên cứu đã tạo ra chúng

Kết quả về hướng từ chối đã làm được hai việc cùng lúc. Về mặt khoa học, nó giải thích một cách cơ chế hành vi an toàn: có một mạch thực sự, có thể tìm ra, khiến mô hình nói không. Về mặt thực tiễn, nó cho thấy sự căn chỉnh có thể mong manh đến mức nào — chỉ một chỉnh sửa hạng nhất duy nhất lên trọng số có thể tắt hành vi này mà không cần tinh chỉnh. Đó không phải là lỗi của mô hình từ một phòng thí nghiệm duy nhất; các tác giả đã tái tạo được hiện tượng này trên hơn một chục mô hình trò chuyện.

Đến năm 2026, kỹ thuật này đã trở thành một quy trình chỉ với một lệnh — một thực tế có hai mặt. Heretic, một thư viện mã nguồn mở, ước tính các hướng từ chối theo từng lớp và trực giao hóa chúng khỏi các phép chiếu attention và MLP; một báo cáo tháng 5/2026 cho thấy việc gỡ bỏ rào chắn an toàn cho Llama 3.3 của Meta mất khoảng 10 phút và Gemma 4 của Google mất khoảng 90 phút, với hơn 3.500 mô hình phái sinh và hơn 13 triệu lượt tải tích lũy. Abliterix (Wu Wangzhang) đi theo hướng thận trọng hơn: trích xuất hướng từ chối từ 800 prompt độc hại và 800 prompt lành tính, áp dụng phép chiếu trực giao, đóng gói bản chỉnh sửa dưới dạng các bộ điều hợp LoRA hạng 1 để trọng số gốc không bị thay đổi, đồng thời báo cáo tỷ lệ từ chối và phân kỳ KL để chi phí năng lực luôn hiện rõ. Trên mô hình Qwen3.5 0.8B, kết quả báo cáo là 0/200 prompt độc hại bị từ chối.

Hãy đọc đoạn văn đó theo cách một nhà nghiên cứu an toàn sẽ đọc. Mục đích của việc xây dựng những công cụ này không phải để ai đó gỡ bỏ lớp bảo vệ (guardrails) của mô hình cho vui. Mà là việc gỡ bỏ vốn dĩ dễ dàng và công khai — nên đo lường nó, nghiên cứu cách nó hoạt động, và xây dựng những guardrail sống sót được trước việc gỡ bỏ đó tự nó là một chương trình nghiên cứu. Đó là red-teaming theo nghĩa white-box: bạn không thể bảo vệ một hệ thống cho đến khi bạn biết nó dễ bị phá vỡ đến mức nào.

Vì sao các mô hình không kiểm duyệt lại trở nên hot trong năm 2026

Ba lực lượng đã hội tụ. Thứ nhất, làn sóng trọng số mở: Qwen3.8 27B và các mô hình tương tự được phát hành dưới giấy phép cho phép, và abliteration không cần chạy huấn luyện — bạn chỉnh sửa trọng số rồi tái lượng tử hóa. Thứ hai, công cụ đã trưởng thành từ mã nghiên cứu thành các thư viện một lệnh, nên một kỹ sư có năng lực có thể tạo ra một bản build chỉ trong một buổi chiều. Thứ ba, Hugging Face trở thành kênh phân phối, nghĩa là mức độ tiếp nhận có thể đo lường được.

Điểm dữ liệu của chính chúng tôi: Qwen3.8-27B-Uncensored-FP8, phát hành ngày 15 tháng 8 năm 2026, đã đạt 257 lượt thích và 4.285 lượt tải xuống chỉ trong khoảng một ngày (đã xác minh ngày 16 tháng 8). Không phải là hàng chục nghìn người muốn triển khai một mô hình không kiểm soát. Mà là rất nhiều nhà nghiên cứu và kỹ sư muốn nghiên cứu một mô hình như vậy — và số lượt tải xuống chính là đường cầu cho sự tò mò đó.

Nó dùng để làm gì: các mục đích sử dụng hợp pháp trong nghiên cứu

Đây là danh sách có thể bảo vệ được, và đó là toàn bộ danh sách. Nếu một cách sử dụng không nằm trong đó, hãy coi rằng nó không hợp lệ:

Khả năng diễn giải — nghiên cứu mạch từ chối thực sự là gì, nó nằm ở đâu, và tại sao loại bỏ một hướng lại thay đổi hành vi.

• Đánh giá red-teaming và guardrail — xây dựng một lớp kiểm duyệt và kiểm tra xem nó có phát hiện được những gì mà một mô hình đã bị loại bỏ khả năng từ chối tạo ra hay không.

• Đo lường tình trạng an toàn thái quá — định lượng mức độ thường xuyên các mô hình nền từ chối các yêu cầu vô hại, đồng thời tách bạch điều đó khỏi an toàn thực sự.

Nghiên cứu về độ bền vững — đo lường mức độ dễ dàng mà sự liên kết có thể bị loại bỏ, một thông tin thiết yếu cho bất kỳ ai thiết kế quy trình tinh chỉnh an toàn.

{{1}}Các thí nghiệm an toàn có kiểm soát{{/1}} — {{2}}các bộ benchmark{{/2}} {{3}}chẳng hạn như{{/3}} {{4}}AdvBench{{/4}} {{5}}và{{/5}} {{6}}JailbreakBench{{/6}} {{7}}tồn tại chính xác là để{{/7}} {{8}}hành vi từ chối{{/8}} {{9}}có thể được đo lường{{/9}} {{10}}một cách chuẩn hóa và tái lập được.{{/10}}

A card titled The research that justifies them, showing three flat icons with short labels: a magnifier over a model layer labeled interpretability, a shield with a crosshair labeled red-teaming, and a checklist over a moderation layer labeled guardrail evaluation.

Tất cả những điều này có chung một đặc điểm: mô hình là đối tượng nghiên cứu, không phải là sản phẩm bàn giao. Đầu ra của nghiên cứu này là một bài báo, một kết quả benchmark, hoặc một rào chắn an toàn tốt hơn — không bao giờ là một dịch vụ.

Làm thế nào để thực hiện một cách có trách nhiệm (nếu bạn thực sự làm nghiên cứu)

Nếu bạn có lý do chính đáng để làm việc với một mô hình abliterated, các quy tắc vận hành rất đơn giản:

• Chạy cục bộ, trong môi trường sandbox, và lý tưởng nhất là cách ly hoàn toàn khỏi mạng. Không có điểm cuối công khai, không có dịch vụ trò chuyện, không có máy chủ dùng chung.

• Phục vụ nó bằng công cụ tiêu chuẩn — vLLM hoặc llama.cpp — giống như cách bạn làm với bất kỳ mô hình open-weights nào. Bản dựng của chúng tôi là lượng tử hóa block-FP8 chạy trên đường dẫn kernel FP8 tiêu chuẩn của vLLM với ngữ cảnh 262K, tính năng bật/tắt suy luận và gọi công cụ được giữ nguyên vẹn.

Đo lường, đừng chỉ trò chuyện. Định lượng mức độ từ chối trên bộ tiêu chuẩn đánh giá prompt độc hại và so sánh với mô hình gốc; định lượng mức độ từ chối quá mức trên các prompt vô hại; báo cáo phân kỳ KL để thấy rõ sự thay đổi năng lực. Đó là sự khác biệt giữa một thí nghiệm và một giai thoại.

A scoreboard card for Qwen3.8-27B-Uncensored-FP8, listing harmful-prompt refusal 0-6% with thinking off versus a 64-99% base, at most 1.7% with thinking on, benign over-refusal 0.4% versus a 5.6% base, MMLU 84.7 versus 84.3, GSM8K 88.7 versus 90.0, and 262,144-token context, with a footer reading orcarouter build card, Hugging Face, Aug 16 2026.

• Giữ các đầu ra trong môi trường có kiểm soát. Ghi nhật ký, xem xét và hủy thay vì phát tán.

Nếu bạn đang đánh giá các hàng rào bảo vệ của chính mình, hãy đặt lớp kiểm duyệt phía trước mô hình và kiểm tra nó — đó chính là toàn bộ mục đích của bài tập này.

• Để xem đầy đủ bảng thông số kỹ thuật, bảng điểm chuẩn và chi tiết lưu trữ, hãy mở thẻ mô hình của chúng tôi — đó là tài liệu tham khảo chính thức cho bản dựng này.

Ranh giới an toàn: "chỉ dành cho nghiên cứu" nghĩa là gì

Đây là điều không thể nhắc lại quá nhiều lần. Một mô hình abliterated không có rào chắn tích hợp thực sự có ý nghĩa. Nó sẽ đáp ứng những yêu cầu mà mô hình bình thường từ chối. Đó là tính năng, và cũng là rủi ro — chính vì thế, mọi bản phát hành nghiêm túc của loại mô hình này, bao gồm cả của chúng tôi, đều kèm theo những cảnh báo tương tự.

• Không có rào chắn tích hợp sẵn. Hành vi từ chối đã biến mất; đừng hành xử như thể nó vẫn còn.

• Không dành cho người dùng cuối, không dành cho môi trường sản xuất. Một sản phẩm, một chatbot, một API phục vụ công chúng, một công cụ nội bộ mà đồng nghiệp của bạn tin dùng — không nơi nào trong số này là chốn thích hợp cho một mô hình không kiểm duyệt.

Trách nhiệm thuộc về bạn. Chúng tôi phân phối Qwen3.8-27B-Uncensored-FP8 theo giấy phép Apache 2.0, vốn cho phép phân phối lại một cách tự do. Giấy phép không phải là chứng chỉ an toàn: mã nguồn cho phép không làm thay đổi những gì mô hình sẽ làm, và nó không chuyển giao trách nhiệm chăm sóc.

• Nếu bạn sử dụng nó, bạn sở hữu các kết quả đầu ra. Môi trường được kiểm soát là trách nhiệm của bạn; cũng như việc quyết định bạn sẽ cung cấp gì và không cung cấp gì cho nó, và bạn làm gì với những gì được tạo ra.

A two-column boundary card titled The line you don't cross. The research side lists interpretability of refusal circuits, red-teaming and guardrail evaluation, oversafety measurement, robustness research and controlled safety experiments. The deployment side lists end-user chatbots, production APIs, unmoderated public service, internal tools for your team and anything with users on the other end, each marked with a cross. A footer reads No built-in guardrails, research only, and Apache 2.0 is not a safety certificate.

Khi một mô hình không kiểm duyệt là câu trả lời sai

Cách nói rõ ràng nhất: nếu có một con người ở đầu bên kia của mô hình, thì mô hình không kiểm duyệt là câu trả lời sai. Bất kỳ sản phẩm nào cần sự đáng tin cậy, bất kỳ trợ lý nào có phán đoán quan trọng, bất cứ thứ gì mà việc từ chối là hành vi đúng đắn — hãy dùng mô hình gốc thay vào đó. Lý do Qwen3.8 27B tồn tại ở dạng thông thường chính là vì việc từ chối là một tính năng, không phải lỗi, đối với hầu hết mọi ứng dụng thực tế. Phiên bản abliterated chỉ tồn tại cho các trường hợp nghiên cứu hẹp nêu trên và không gì khác.

Điểm mấu chốt. Một LLM không kiểm duyệt không phải là một loại sản phẩm và cũng không phải là một mẹo hack. Nó là một sản phẩm nghiên cứu với một dòng dõi khoa học thực sự — từ phát hiện về hướng từ chối đến các công cụ tự động của năm 2026 — và một ranh giới triển khai cứng nhắc. Các mô hình là có thật, nhu cầu là đo lường được, và các ứng dụng hợp pháp cũng có thật: khả năng diễn giải, red-teaming, đánh giá guardrail, và các thí nghiệm an toàn có kiểm soát. Ranh giới giữa việc nghiên cứu cơ chế bảo vệ và việc tắt cơ chế bảo vệ cho người khác chính là toàn bộ ý nghĩa của trang này, và nó không thay đổi.

Bản build chính xác này được công khai theo Apache 2.0 — chỉ dành cho nghiên cứu. Bạn có thể tải trọng số trên Hugging Face

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube