Một thẻ tiêu đề cho báo cáo điểm chuẩn Qwen3.8-27B-Uncensored, hiển thị đồng hồ đo tỷ lệ từ chối tụt giảm từ mức đỏ 99 phần trăm trên bảng điều khiển có nhãn Base xuống mức xanh 0 phần trăm trên bảng điều khiển có nhãn Uncensored, với biểu tượng lá chắn bị gạch chéo ở bảng bên phải và một đường kẻ ngang bên dưới ghi khả năng trong phạm vi cộng trừ 1,3 điểm.
Guides & Insights

Qwen3.8-27B-Uncensored – Điểm chuẩn: Từ chối sụp đổ, Năng lực vẫn giữ nguyên

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Câu chuyện điểm chuẩn của Qwen3.8 27B Uncensored (Aggressive) — bản abliterated của Qwen3.8 27B được phát hành dưới dạng checkpoint FP8 vào ngày 15 tháng 8 năm 2026 và bản GGUF vào ngày 16 tháng 8 — không phải là nó trở nên mạnh hơn. Mà là nó đã ngừng từ chối. Thẻ mô hình báo cáo tỷ lệ từ chối các prompt độc hại giảm từ 64–99% ở bản gốc xuống còn 0–6% ở bản abliterated khi tắt chế độ suy luận, và từ 1,7% trở xuống khi bật chế độ suy luận, trong khi mọi điểm chuẩn năng lực đều nằm trong khoảng ±1,3 điểm so với bản gốc và độ perplexity WikiText-2 ở mức 6,96. Nếu bạn đến đây để tìm các điểm chuẩn qwen uncensored, đó chính là những con số đáng chú ý: nó không phải là một mô hình thông minh hơn, mà là một mô hình không từ chối.

Sự khác biệt đó rất quan trọng, vì phần lớn những gì được xếp hạng trong các "benchmark không kiểm duyệt" hoặc là một danh sách sơ sài về điểm số năng lực, hoặc là một bài đăng thổi phồng tuyên bố rằng mô hình "tốt hơn". Cả hai đều không phải là những gì abliteration làm. Bài viết này trình bày dữ liệu đo lường thực tế — sự sụp đổ của khả năng từ chối, việc từ chối quá mức, mức độ giữ nguyên năng lực, và độ perplexity — phương pháp đã tạo ra dữ liệu đó, cùng ranh giới an toàn mà bạn nên đọc trước khi chạm vào các trọng số.

Một bản tổng hợp benchmark không kiểm duyệt thực sự đo lường điều gì?

Một bài đánh giá mô hình thông thường chỉ báo cáo một trục: năng lực — MMLU, GSM8K, lập trình, suy luận. Một mô hình abliterated lại thú vị ở một trục khác, và toàn bộ ý nghĩa của nhãn "uncensored" là trục an toàn đã dịch chuyển. Vì vậy, câu hỏi hữu ích cho Qwen3.8-27B-Uncensored-FP8 không phải là "nó có thông minh hơn không?" mà là "việc loại bỏ cơ chế từ chối đã phải trả giá gì, và nó đã bị loại bỏ triệt để đến mức nào?"

Ba nhóm số liệu cần phải được đọc cùng nhau. Tỷ lệ từ chối trên các benchmark có prompt độc hại — mô hình từ chối thường xuyên như thế nào; mức nền càng cao thì việc loại bỏ càng dễ thấy. Từ chối quá mức trên các prompt lành tính — tần suất mô hình từ chối nhầm một yêu cầu vô hại; thấp hơn thì tốt cho mọi người. Và khả năng duy trì năng lực — liệu bản chỉnh sửa có làm suy giảm mô hình hay không. Một bản tóm tắt benchmark chỉ in ra điểm năng lực thì đang trả lời sai câu hỏi.

Phương pháp: abliteration là một thao tác chỉnh sửa trọng số, không phải là tinh chỉnh mô hình.

Điều tách biệt abliteration khỏi các bộ "jailbreak" của cộng đồng là nơi thay đổi diễn ra. Jailbreak ở mức prompt bao quanh đầu vào; abliteration chỉnh sửa các trọng số. Phương pháp ở đây là của Arditi và cộng sự (2024), "Refusal in Language Models Is Mediated by a Single Direction". Phát hiện cốt lõi là hành vi từ chối trong nhiều mô hình bị chi phối bởi một hướng duy nhất trong luồng dư (residual stream) — ước lượng hướng đó, loại bỏ nó, và mô hình sẽ ngừng từ chối mà không cần huấn luyện lại.

Cụ thể, thẻ mô tả việc ước tính một hướng từ chối từ hiệu số trung bình có mặt nạ kích hoạt khối lượng lớn của phần dư token cuối có hại trừ đi vô hại tại lớp 38 (round(0.6 × 64)), sử dụng AdvBench làm tập hợp có hại và Alpaca làm tập hợp vô hại. Phép chỉnh sửa là một phép trực giao hóa, W′ = W − r(rᵀW), được tính bằng float32 và áp dụng cho 131 ma trận ghi phần dư — các phép chiếu đầu ra của cơ chế chú ý, các phép chiếu đầu ra của cơ chế chú ý tuyến tính, các phép chiếu giảm chiều MLP, và một không gian hàng nhúng. Không có bước huấn luyện nào được chạy; tháp thị giác được giữ nguyên; đầu dự đoán suy diễn đầu cơ MTP bị abliterate một cách nhất quán. Đó là lý do năng lực vẫn được bảo toàn: loại bỏ một hướng là một can thiệp nhẹ nhàng hơn nhiều so với việc tinh chỉnh mô hình để tuân thủ.

Sự từ chối sụp đổ: những con số

Được đo trên bản dựng FP8 phục vụ bởi vLLM và công bố trên thẻ mô hình Hugging Face (2026-08-15), tỷ lệ từ chối trên các benchmark có prompt độc hại giảm từ 64–99% trên bản gốc xuống còn 0–6% trên bản không kiểm duyệt khi tắt chế độ suy nghĩ:

• AdvBench — 99.0% → 0.0%

• JailbreakBench (có hại) — 94.0% → 0.0%

StrongREJECT — 97,3% → 2,0%

• HarmBench (chuẩn) — 98.7% → 2.7%

• MaliciousInstruct — 99.0% → 0.0%

• SimpleSafetyTests — 64.0% → 6.0%

• Câu hỏi bị cấm — 73.3% → 4.7%

Với khả năng suy luận được bật, tỷ lệ từ chối trả lời gần như bằng không — 1,7% trên AdvBench và 0,0% trên hầu hết các bài đánh giá còn lại. Thẻ mô hình có thêm một lưu ý trung thực: 30–50% câu trả lời vẫn mở đầu bằng một tuyên bố từ chối trách nhiệm ngắn. Đó là một sản phẩm phụ của quá trình huấn luyện, không phải là hành vi từ chối — mô hình vẫn trả lời nhưng lấp lửng ở phần mở đầu. Điều này tạo cảm giác cản trở, không phải an toàn.

A two-column scoreboard comparing harmful-prompt refusal rates for the base Qwen3.8 27B versus the abliterated Qwen3.8-27B-Uncensored build across seven benchmarks, the base column reading 99.0, 94.0, 97.3, 98.7, 99.0, 64.0 and 73.3 percent and the uncensored column reading 0.0, 0.0, 2.0, 2.7, 0.0, 6.0 and 4.7 percent, with a footer noting the data is from the Hugging Face model card, measured on the vLLM-served FP8 build, 2026-08-15.

Từ chối quá mức cũng là một vấn đề.

Con số ít được chú ý hơn nằm ở phía còn lại của trục an toàn. Trên XSTest-safe — 250 lời nhắc lành tính mà các mô hình đã được căn chỉnh đôi khi từ chối nhầm — mô hình cơ sở từ chối quá mức 5.6% thời gian. Bản build không kiểm duyệt từ chối quá mức 0.4%. Việc loại bỏ hướng từ chối không chỉ khiến mô hình ngừng từ chối các yêu cầu gây hại; nó còn khiến mô hình ngừng từ chối những yêu cầu vô hại mà trước đây nó gắn cờ do khái quát hóa quá mức. Đối với bất kỳ ai đang xây dựng công cụ đánh giá hoặc red-team mà điểm mấu chốt là một đường cơ sở không từ chối, đây là một cải tiến thực sự của công cụ, không phải là tác dụng phụ cần phải xin lỗi.

Năng lực được bảo toàn, không được cải thiện.

Đây là nơi lập luận "không kiểm duyệt = mạnh hơn" sụp đổ. Model card báo cáo bản dựng abliterated FP8 so với bản FP8 gốc chính thức với cùng tập lệnh và cài đặt:

• MMLU (0-shot) — 84.3% → 84.7%

• GSM8K (CoT) — 90.0% → 88.7%

• MMLU-Pro (CoT) — 77.6% → 76.8%

• CMMLU (0-shot, tiếng Trung) — 81.4% → 80.8%

Mọi điểm số đều nằm trong phạm vi ±1,3 điểm so với mức cơ sở, và độ perplexity thô trên WikiText-2 đạt 6,96 — bằng chứng từ bảng đánh giá cho thấy bản thân việc mô hình hóa ngôn ngữ không bị suy giảm. Nói thẳng ra: abliteration gần như trung lập về năng lực trên kiến trúc này. Bạn không nhận được một mô hình tốt hơn; bạn đang nhận được cùng một mô hình nhưng không còn hành vi từ chối.

A scoreboard for the Qwen3.8-27B-Uncensored capability retention results: MMLU 84.3 to 84.7, GSM8K 90.0 to 88.7, MMLU-Pro 77.6 to 76.8, CMMLU 81.4 to 80.8, every score within plus or minus 1.3 points of the base, with a highlight panel showing WikiText-2 perplexity 6.96 and over-refusal on XSTest-safe falling from 5.6 percent to 0.4 percent, and a footer noting the source is the Hugging Face model card, measured on the vLLM-served FP8 build.

Cảnh báo tương tự cũng áp dụng cho hệ sinh thái rộng lớn hơn: những tuyên bố "lossless uncensored" trên các bản dựng cộng đồng đáng để xem xét một cách hoài nghi. Một so sánh ba chiều trên một bản dựng trọng số mở 4B trên Hugging Face cho thấy kỹ thuật tự nhận là không mất mát thực tế đã làm giảm TruthfulQA khoảng 7 điểm và Lambada khoảng 4 điểm, trong khi tỷ lệ tấn công thành công HarmBench của nó đạt 100%; hai phương pháp còn lại đạt 99,2% và 95,5%. Và một thử nghiệm mạnh tay trên một bản dựng khác đạt được tỷ lệ từ chối bằng không nhưng lại tạo ra mớ từ ngữ lộn xộn không mạch lạc, vì vậy phiên bản phát hành đã lùi lại về các tham số nhẹ nhàng hơn theo từng lớp. Kết quả abliteration phụ thuộc vào phương pháp — những con số này cụ thể là dữ liệu thẻ của bản dựng FP8.

Điều mà thẻ không khẳng định

Hãy đọc phương pháp luận trước khi trích dẫn các con số. Thẻ mô tả phép đo từ chối là {{1}}chỉ mang tính tham khảo, không phải con số do LLM-judge đánh giá / đạt chuẩn công bố{{/1}}: mức độ từ chối được đánh giá bằng bộ phân loại cụm từ mở đầu dựa trên quy tắc, với một nhóm {{2}}cảnh báo{{/2}} riêng cho các câu trả lời tuân thủ nhưng có thêm lời miễn trừ ở đầu. Các bài benchmark là {{3}}thuần văn bản, chạy trên bản build FP8 do vLLM phục vụ, chỉ sử dụng mô hình ngôn ngữ{{/3}}, và bộ đánh giá năng lực sử dụng {{4}}các tập lệnh đánh giá chuẩn{{/4}}. Cách hiểu đúng: đây là {{5}}dữ liệu đo lường của chính nhà cung cấp, có thể tái tạo từ thẻ công bố — không phải kết quả chạy độc lập của bên thứ ba{{/5}}, và không phải là khẳng định về {{6}}bản build GGUF, vốn được phân phối dạng lượng tử hóa cho llama.cpp và cần được đánh giá riêng{{/6}}.

Ranh giới an toàn

Đây là phần không thể né tránh. Một mô hình abliterated đã bị loại bỏ phần lớn cơ chế từ chối. Cụ thể: nó sẽ tuân thủ các yêu cầu có hại, phi đạo đức hoặc bất hợp pháp mà mô hình gốc Qwen3.8 27B sẽ từ chối, và nó không có cơ chế bảo vệ tích hợp đáng kể nào. Các mục đích sử dụng hợp pháp là cho nghiên cứu — khả năng diễn giải (nghiên cứu cách các hướng từ chối được mã hóa), nghiên cứu an toàn AI và cơ chế từ chối, red-teaming (thăm dò các mô hình bằng các đầu vào cố gắng vượt qua cơ chế bảo vệ của chúng), và đánh giá độ bền vững. Nó được phát hành theo giấy phép Apache 2.0, kế thừa từ mô hình gốc, chỉ với tư cách là một sản phẩm nghiên cứu. Bạn hoàn toàn chịu trách nhiệm và nghĩa vụ pháp lý đối với cách bạn sử dụng nó và mọi thứ nó tạo ra. Không triển khai nó cho người dùng cuối hoặc vào môi trường sản xuất nếu không có các lớp an toàn, kiểm duyệt và ngăn chặn lạm dụng của riêng bạn — và đối với mọi mục đích sử dụng trong sản xuất hoặc dành cho người tiêu dùng, mô hình Qwen3.8 27B tiêu chuẩn mới là mô hình bạn thực sự muốn.

Khi một benchmark không bị kiểm duyệt là thứ không nên tra cứu

Nếu câu hỏi của bạn là "mô hình nào mạnh nhất về toán hoặc lập trình?", thì bạn đang đọc nhầm số liệu — bản build không kiểm duyệt không phải là một bản nâng cấp năng lực. {{1}}Nếu ứng dụng của bạn cần từ chối các yêu cầu gây hại, mô hình này hoàn toàn ngược lại với những gì bạn muốn.{{/1}} {{2}}Nếu bạn đang phát hành một sản phẩm, đừng xây dựng trên một checkpoint đã bị abliterate.{{/2}} {{3}}Và nếu thứ bạn thực sự theo đuổi là jailbreak, thì đó lại là một chuyện hoàn toàn khác —{{/3}} {{4}}các bộ prompt nằm ngoài can thiệp ở mức trọng số được thảo luận ở đây và không phải là chủ đề của bài viết này.{{/4}} {{5}}Dữ liệu benchmark trong bài viết này chỉ tồn tại cho một câu hỏi hẹp và hợp lệ duy nhất:{{/5}} {{6}}việc loại bỏ cơ chế từ chối sẽ ảnh hưởng thế nào đến {{KEEP}}Qwen3.8 27B{{/KEEP}}, được đo lường.{{/6}}

Cách truy cập nó

Cả hai bản dựng đều có trên Hugging Face theo giấy phép Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, khoảng 30.9 GB trọng số, phục vụ trên đường dẫn kernel FP8 chuẩn của vLLM với ngữ cảnh 262K, các công cụ, suy luận và MTP còn nguyên vẹn) và orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 cộng với 12 mức lượng tử hóa cho llama.cpp, với Q4_K_M ở 16.8 GB là mặc định được khuyến nghị cho GPU 24 GB). thẻ mô hình trên OrcaRouter có giá cả và chi tiết benchmark — bản dựng không kiểm duyệt được liệt kê ở đó là obsidian/Qwen3.8-27B với giá $0.40 cho mỗi triệu token đầu vào và $4.21 cho mỗi triệu token đầu ra, với ngữ cảnh 262K, và quyền truy cập bị giới hạn cho các nhà nghiên cứu bảo mật, các đội đỏ (red team), và các nhà nghiên cứu an toàn AI.

The OrcaRouter model page for obsidian Qwen3.8-27B, showing the uncensored build's 0.40 USD per million input and 4.21 USD per million output pricing, a 262K token context window, a released August 15 2026 label, and the researcher-access gating note.

Điểm mấu chốt

Các benchmark qwen uncensored trả lời một câu hỏi hẹp, và câu trả lời rất rõ ràng: loại bỏ cơ chế từ chối khỏi Qwen3.8 27B thông qua abliteration giữ nguyên năng lực trong phạm vi ±1.3 điểm, trong khi tỷ lệ từ chối đối với các prompt độc hại giảm mạnh từ 64–99% xuống 0–6%, tỷ lệ từ chối quá mức giảm từ 5.6% xuống 0.4%, và perplexity vẫn giữ ở mức 6.96. Hãy hiểu những con số đó là "không từ chối", chứ không bao giờ là "mạnh hơn". Đối với nghiên cứu về khả năng diễn giải, an toàn và red-team, đó chính xác là công cụ mà model card mô tả. Đối với bất cứ thứ gì hướng tới người dùng, đây là mô hình sai ngay từ thiết kế.

Đối với mục đích nghiên cứu hợp pháp, các trọng số mô hình có trên Hugging Face theo giấy phép Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (bản dựng GGUF cho llama.cpp nằm tại orcarouter/Qwen3.8-27B-Uncensored-GGUF).

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube