Thẻ hero cho bài viết có tựa đề Abliteration, Explained, thể hiện việc loại bỏ hành vi từ chối như một chỉnh sửa ở cấp độ trọng số mà không cần huấn luyện.
Guides & Insights

Abliteration, Giải thích: Cách loại bỏ sự từ chối hoạt động mà không cần bất kỳ huấn luyện nào

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Abliteration loại bỏ hành vi từ chối của LLM — phản xạ "Tôi không thể hỗ trợ việc đó" — bằng cách chỉnh sửa trọng số và không cần chạy huấn luyện. Nó hoạt động vì sự từ chối được trung gian bởi một hướng duy nhất trong luồng dư của mô hình: hãy tìm hướng đó, trừ nó khỏi các ma trận ghi vào luồng, và mô hình sẽ ngừng từ chối trong khi vẫn giữ nguyên khả năng. Ví dụ công khai rõ ràng nhất là Qwen3.8 27B Uncensored (Aggressive), mà bảng thông số của nó cho thấy tỷ lệ từ chối các prompt độc hại giảm từ 99.0% xuống 0.0% trên AdvBench trong khi MMLU thực tế tăng thêm một phần mười điểm. Đây là cách cơ chế hoạt động, các con số đo được nói lên điều gì, và ranh giới nằm ở đâu.

Đây không phải là fine-tuning, không phải RLHF, và cũng không phải một prompt jailbreak. Abliteration là một kết quả diễ giải được chuyển thành đại số tuyến tính: một bài báo năm 2024 đã chỉ ra rằng một hướng trong biểu diễn nội bộ kiểm soát một hành vi mà quá trình huấn luyện an toàn đã tốn rất nhiều công sức để xây dựng, và bạn có thể tắt nó đi bằng cách chỉnh sửa trực tiếp các trọng số. Vì phép chỉnh sửa này là một phép chiếu, nó rẻ, có thể tái lập trên một GPU duy nhất, và để lại một checkpoint thông thường, có thể chia sẻ — đó là lý do vì sao các bản build abliterated của các mô hình mã nguồn mở, bao gồm cả dòng Qwen3.8-27B, đã trở thành cách tiêu chuẩn để tạo ra các checkpoint nghiên cứu "không kiểm duyệt".

Hướng từ chối: một vector trong dòng chảy hàng nghìn chiều

Bên trong một transformer, mọi token đều đi qua một luồng dư — biểu diễn đang chạy mà các lớp đọc và ghi vào. Các khối attention và MLP của mỗi lớp nhận luồng này làm đầu vào và cộng đầu ra của chúng trở lại vào luồng. Luồng này thực chất là bộ nhớ làm việc của mô hình: một vector cho mỗi vị trí token, với chiều bằng chiều rộng của mô hình.

Bài báo năm 2024 đã khởi xướng tất cả những điều này — Andy Arditi và các đồng nghiệp, "Sự từ chối trong các mô hình ngôn ngữ được trung gian bởi một hướng duy nhất" (arXiv:2406.11717, NeurIPS 2024) — đã đo lường xem các vector dòng chảy đó trông như thế nào khi một mô hình chat sắp từ chối so với khi nó tuân thủ. Trên 13 mô hình chat open-weight có tham số từ 1.8B đến 72B, câu trả lời nhất quán một cách ấn tượng: sự khác biệt về cơ bản là một hướng duy nhất. Tại token cuối cùng, dòng chảy dư có một thành phần lớn dọc theo một hướng từ chối duy nhất khi mô hình đang từ chối, và gần như không có khi nó tuân thủ. Hình học được căn chỉnh trên các danh mục tác hại, đó là lý do tại sao phép chiếu tập trung vào vector kỳ dị thứ nhất thay vì lan tỏa trên toàn bộ không gian con.

Để tìm hướng đó, bạn thu thập các kích hoạt trên hai tập prompt — có hại và vô hại — và lấy trung bình của các phần dư token cuối cho mỗi tập. Hướng từ chối xấp xỉ bằng mean(harmful) − mean(harmless), được chuẩn hóa về độ dài đơn vị. Bài báo gốc trình bày điều này bằng linear probing; các bản triển khai sản xuất như Qwen3.8-27B-Uncensored-FP8 ước lượng một hướng duy nhất (k=1) dưới dạng hiệu trung bình có mặt nạ kích hoạt lớn của các phần dư token cuối có hại và vô hại. Không cần nhãn nào ngoài việc phân chia có hại/vô hại, không gradient, không huấn luyện.

Chỉnh sửa: trừ hướng khỏi mọi ma trận ghi vào luồng.

Khi bạn đã có hướng từ chối r — một vector đơn vị trong luồng dư — sự can thiệp là một phép chiếu hạng 1. Mọi ma trận trọng số có đầu ra được cộng vào luồng dư đều có thể được "làm sạch" khỏi r:

W' = W − r(rᵀW)

Nói cách khác: tính thành phần đầu ra của mỗi ma trận hướng theo r, rồi loại bỏ nó. Các ma trận ghi vào luồng là các phép chiếu đầu ra — phép chiếu đầu ra của cơ chế attention (o_proj), phép chiếu xuống của MLP (down_proj), và không gian hàng của embedding token. Thao tác chỉnh sửa chạy ở float32, mất vài phút trên một GPU, và không cần optimizer cũng như không cần dữ liệu huấn luyện nào ngoài các cặp activation bạn đã thu thập.

Có hai cách để loại bỏ một hướng, và chúng đáng được giữ riêng biệt:

• Cắt bỏ kích hoạt — can thiệp vào forward pass và trừ thành phần r khỏi các kích hoạt đang hoạt động. Có thể đảo ngược, không đụng tới trọng số; lý tưởng cho các thí nghiệm so sánh hành vi từ chối và tuân thủ trên cùng một checkpoint.

• Trực giao hóa trọng số — áp dụng phép chiếu lên chính các trọng số, tạo ra một checkpoint vĩnh viễn, có thể chia sẻ. Đây chính là điều mà "abliteration" đề cập đến, và đây là thứ được phân phối trong các repo mô hình không kiểm duyệt.

Diagram of the abliteration edit: the refusal direction r is orthogonalized out of the residual-writing weight matrices, W prime equals W minus r times r-transpose W, leaving the residual stream without the refusal component and no training.

Phép trực giao hóa được thực hiện một cách cố tình thô bạo. Nó chỉ loại bỏ thành phần từ chối khỏi trọng số và không làm gì hơn. Nó không thể thêm kiến thức, cải thiện khả năng suy luận, hay khiến mô hình trung thực hơn — đó là lý do vì sao một mô hình đã bị abliterate hoạt động giống như phiên bản gốc của nó, chỉ thiếu đi phản xạ từ chối.

Các ma trận 131 trông như thế nào trên một bản build thực tế: {{KEEP}}Qwen3.8-27B-Uncensored-FP8{{/KEEP}}

Để cụ thể hóa điều này: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, xuất bản ngày 2026-08-15, Apache 2.0) là một bản dựng abliterated của Qwen3.8-27B. Qwen3.8-27B là một mô hình chú ý lai — 16 lớp chú ý đầy đủ cộng 48 lớp tuyến tính Gated DeltaNet, tổng cộng 64 lớp, cùng với đầu dự đoán đa token (MTP). Bản dựng này đã trực giao hóa hướng từ chối ra khỏi 131 ma trận ghi phần dư:

• self_attn.o_proj — 17 ma trận (16 lớp full-attention + MTP)

linear_attn.out_proj — 48 ma trận (các lớp Gated DeltaNet)

mlp.down_proj — 65 ma trận (64 lớp + MTP)

• embed_tokens (không gian hàng) — 1 ma trận

Hướng từ chối được ước tính tại lớp 38 — round(0.6 × 64), lớp nơi hướng này tập trung nhất — và độ rò rỉ dư tối đa sau khi chỉnh sửa là 1.8e-2. Tháp thị giác được giữ nguyên, và đầu MTP được abliterate đồng nhất với phần thân để giải mã suy đoán không tái đưa hành vi từ chối vào quá trình phía sau. Phép chỉnh sửa được tính bằng float32, sau đó tái lượng tử hóa sang block-FP8 theo cùng sơ đồ với checkpoint chính thức Qwen3.8-27B-FP8; bản build báo cáo 99.9% mã FP8 giống hệt checkpoint chính thức, đó là cách bạn biết rằng quá trình tái lượng tử hóa không làm xáo trộn phép chỉnh sửa.

Đo lường: sự từ chối sụp đổ, năng lực vẫn được duy trì

Tất cả các con số dưới đây đều lấy từ model card của Qwen3.8-27B-Uncensored-FP8, xuất bản ngày 2026-08-15 và được đánh giá bằng vLLM. Chúng do nhà cung cấp báo cáo — không được xác minh độc lập — và là bộ so sánh trước/sau công khai đầy đủ nhất hiện có về một lần chỉnh sửa abliteration.

Tỷ lệ từ chối trên các benchmark có prompt độc hại, tắt suy luận (tỷ lệ từ chối; thấp hơn nghĩa là ít kiểm duyệt hơn):

• AdvBench (n=100): 99.0% → 0.0%

• StrongREJECT (n=150): 97.3% → 2.0%

• HarmBench tiêu chuẩn (n=150): 98.7% → 2.7%

• MaliciousInstruct (n=100): 99.0% → 0.0%

• JailbreakBench có hại (n=100): 94.0% → 0.0%

• SimpleSafetyTests (n=50): 64.0% → 6.0%

Trên toàn bộ bộ đánh giá, tỷ lệ từ chối đối với các prompt độc hại giảm từ 64–99% ở mô hình gốc xuống còn 0–6% sau khi chỉnh sửa. Với chế độ suy luận được bật (enable_thinking=true), tỷ lệ từ chối còn lại thậm chí còn thấp hơn — ≤1.7% ở mọi nơi, với hầu hết các điểm chuẩn ở mức chính xác 0%. Sự bất đối xứng này cho ta biết nhiều điều: hướng từ chối chủ yếu nằm ở đường dẫn nhanh, không suy luận, vì vậy một khi nó được loại bỏ khỏi đầu ra, sẽ còn rất ít thứ để chuỗi suy luận vấp phải.

Từ chối quá mức — những lời nhắc vô hại mà mô hình cơ sở từ chối một cách sai lầm — cũng giảm: XSTest-safe (n=250) chuyển từ 5,6% xuống 0,4%. Việc loại bỏ hướng này không chỉ ngăn chặn các hành vi từ chối có hại; nó còn giúp mô hình không từ chối những yêu cầu vô hại mà chỉ trông có vẻ rủi ro. Con số đó là một minh chứng thầm lặng rằng một phần "an toàn" của mô hình cơ sở là cái giá phải trả cho cảnh báo giả.

Khả năng, tất cả đều trong khoảng ±1.3 điểm so với mức cơ sở:

• MMLU (chữ cái 0-shot): 84,3% → 84,7% (+0,4)

• GSM8K (CoT): 90.0% → 88.7% (−1.3)

• MMLU-Pro (CoT): 77,6% → 76,8% (−0,8)

• CMMLU (0-shot): 81.4% → 80.8% (−0.6)

WikiText-2 perplexity là 6,96. Nói cách khác, chỉnh sửa này được nhắm mục tiêu một cách chính xác như phẫu thuật: nó loại bỏ một hành vi được cài đặt trên nền tảng kiến thức và để lại kiến thức — được đo lường, ít nhất, trên các bài đánh giá này — về cơ bản vẫn nguyên vẹn.

Scoreboard for Qwen3.8-27B-Uncensored-FP8: harmful-prompt refusal collapses (AdvBench 99.0% to 0.0%, StrongREJECT 97.3% to 2.0%, HarmBench 98.7% to 2.7%), over-refusal drops on XSTest-safe from 5.6% to 0.4%, and capabilities hold within plus or minus 1.3 points (MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%).

Những lời cảnh báo trung thực

Ba điều mà các con số trong tiêu đề không cho bạn biết. Thứ nhất, abliteration không phải là một công tắc bật/tắt rõ ràng. Khoảng 30–50% câu trả lời cho các lời nhắc có hại vẫn mở đầu bằng một câu tuyên bố miễn trừ trách nhiệm an toàn ngắn — mô hình tuân thủ, nhưng một câu cảnh báo vẫn tồn tại như một di vật của quá trình huấn luyện. Việc chỉnh sửa một chiều không thể tẩy sạch mọi dấu vết của hành vi trong quá trình huấn luyện.

Thứ hai, sự từ chối được mã hóa dư thừa. Một hướng loại bỏ hầu hết nó, nhưng một số loại được nhúng sâu hơn những loại khác, và việc cắt bỏ quá mạnh có thể khiến mô hình rơi vào trạng thái vô nghĩa — over-abliteration là một dạng lỗi thực tế, không phải lý thuyết. Bạn đang vặn một núm chỉnh, và núm chỉnh đó có một mức sàn.

Thứ ba, chi phí năng lực phụ thuộc vào hướng và tầng. Bản dựng này đạt trong khoảng ±1.3 điểm vì hướng được ước lượng ở đúng tầng và phép chiếu được áp dụng nhất quán. Nếu chuyển ước lượng sang tầng sai, hoặc đẩy phép chiếu mạnh hơn, cùng một phương pháp có thể làm suy giảm khả năng suy luận một cách đáng kể. Kết quả không được đảm bảo bởi phương pháp — mà nó đạt được nhờ bản dựng.

Khi abliteration không phải là công cụ phù hợp

Nếu bạn muốn một trợ lý tuân thủ, đừng abliterate — bạn cần checkpoint cơ sở đã được căn chỉnh, chứ không phải bản dựng đã gỡ bỏ cơ chế từ chối. Nếu bạn muốn đánh giá một Qwen3.8-27B đã gỡ bỏ cơ chế từ chối mà không cần tải 30GB trọng số, dòng model này được phục vụ trên OrcaRouter (obsidian/Qwen3.8-27B, $0.40 đầu vào / $4.21 đầu ra trên 1M token, ngữ cảnh 262K, được niêm yết ngày 2026-08-15), với biến thể mở khóa hoàn toàn được kiểm soát truy cập dành cho các nhà nghiên cứu bảo mật và đội red team.

Nếu bạn muốn từ chối có chọn lọc — từ chối vũ khí, trả lời mọi thứ khác — một bản fine-tune LoRA hoặc DPO, hoặc một guardrail trong system prompt, cho bạn một bề mặt kiểm soát. Abliteration là một thao tác chỉnh sửa thô, toàn cục; nó không thể tách riêng một danh mục.

Nếu bạn muốn thử nghiệm một cách có thể đảo ngược, hãy bắt đầu với việc loại bỏ kích hoạt (activation ablation) tại thời điểm suy luận thay vì chỉnh sửa trọng số. Bạn có thể so sánh hành vi từ chối và tuân thủ trên cùng một checkpoint, sau đó chỉ áp dụng chỉnh sửa trọng số nếu hành vi đó đúng như bạn mong muốn.

Ranh giới an toàn — hãy đọc kỹ trước khi sử dụng

Một mô hình abliterated không có rào chắn tích hợp sẵn. Đối với một mô hình đã được căn chỉnh, cơ chế từ chối chính là rào chắn; loại bỏ nó khiến các trọng số thô phải trả lời mọi thứ mà mô hình nền biết cách trả lời. Không có gì trong phép chiếu bổ sung tính an toàn, và không có gì phía sau chặn lại đầu ra.

Các mục đích sử dụng hợp pháp là những mục đích nghiên cứu: khả năng diễn giải (nghiên cứu nơi từ chối nằm trong các trọng số và hướng đó còn kiểm soát điều gì khác), kiểm thử đỏ và đánh giá rào chắn an toàn (kiểm tra các lớp an toàn của chính bạn trước một mô hình không tự kiểm duyệt), và đo lường an toàn quá mức (mức giảm từ 5.6% xuống 0.4% trong XSTest định lượng tần suất các mô hình được căn chỉnh từ chối các đầu vào vô hại). Trong mọi trường hợp, mô hình là đối tượng nghiên cứu, không phải là sản phẩm bàn giao.

Ranh giới không phải để trang trí:

• Chỉ dành cho nghiên cứu — không dành cho sản xuất, sản phẩm người dùng cuối, hoặc công cụ nội bộ.

• Không có rào cản — đầu ra không được lọc; bạn chịu trách nhiệm về chúng và hậu quả.

• Giấy phép không phải là chứng chỉ an toàn — Apache 2.0 cho phép sử dụng; nó không bảo chứng tính an toàn.

Cả hai kho lưu trữ Hugging Face — Qwen3.8-27B-Uncensored-FP8 và bản đóng gói lại GGUF Qwen3.8-27B-Uncensored-GGUF (xuất bản ngày 2026-08-16) — đều bị giới hạn: bạn xác nhận phạm vi chỉ dành cho nghiên cứu trước khi quá trình tải xuống bắt đầu.

The Hugging Face repository page for orcarouter/Qwen3.8-27B-Uncensored-FP8, an Apache 2.0 abliterated build gated for research use.

Điểm mấu chốt

Abliteration là một trong những kết quả gọn gàng nhất trong lĩnh vực diễn giải LLM: một hướng tuyến tính duy nhất trong luồng phần dư (residual stream) chi phối một hành vi mà quá trình huấn luyện an toàn đã tiêu tốn rất nhiều tài nguyên tính toán để cài đặt, và một phép chiếu trọng số hạng 1 có thể loại bỏ nó mà không cần một lần huấn luyện nào. Trường hợp được đo — Qwen3.8-27B-Uncensored-FP8 — cho thấy sự chỉnh sửa mang tính phẫu thuật: tỷ lệ từ chối giảm mạnh từ 64–99% xuống 0–6%, từ chối quá mức giảm xuống chỉ còn một phần nhỏ (5,6% → 0,4%), và năng lực được giữ vững trong khoảng ±1,3 điểm. Điều này cũng cho thấy chính xác vì sao đây là một công cụ nghiên cứu chứ không phải một sản phẩm: không có rào chắn bảo vệ, các tuyên bố miễn trừ còn sót lại, và một ranh giới đặt trách nhiệm lên bạn. Hãy dùng nó để hiểu cơ chế từ chối, kiểm tra các rào chắn của bạn, và đo lường mức an toàn thái quá — chứ không phải để đưa ra trước người dùng.

Qwen3.8-27B-Uncensored-FP8 là một sản phẩm nghiên cứu theo giấy phép Apache 2.0 — có kiểm soát truy cập, không phải dịch vụ lưu trữ tại đây.Tải trọng số trên Hugging Face