Thẻ tiêu đề hero cho Qwen3.8-27B-Uncensored-NVFP4, bản dựng NVFP4 phục vụ Blackwell của Qwen3.8-27B đã được abliterate, hiển thị tiêu đề 'Qwen3.8-27B-Uncensored-NVFP4' và phụ đề 'Sổ tay vận hành cho GPU Blackwell' bên cạnh biểu tượng chip GPU gắn nhãn FP4, biểu tượng tia sét vLLM, đồng hồ đo cửa sổ ngữ cảnh 262K và biểu tượng ổ khóa hạn chế truy cập, với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Qwen3.8-27B-Uncensored-NVFP4: Sổ tay vận hành phục vụ cho GPU Blackwell

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Qwen3.8-27B-Uncensored-NVFP4 đã có mặt trên Hugging Face từ ngày 19 tháng 8 năm 2026, và trong mười ngày kể từ đó, nó đã được tải về khoảng 32.700 lần. Đây không phải bài đưa tin ra mắt — các trọng số đã mười ngày tuổi, không có thông báo nào để đưa tin, và các bản dựng anh em Qwen3.8-27B-Uncensored-FP8Qwen3.8-27B-Uncensored-GGUF đã được ghi lại trên blog này. Đây là một runbook cho một bản dựng mà mọi người đang tích cực tải về ngay bây giờ: NVFP4 thực sự là gì, tại sao bản dựng cụ thể này kết hợp nó với FP8, GPU nào được hưởng lợi và GPU nào không, cách phục vụ nó, và ai nên chọn nó thay vì các bản dựng FP8 hoặc GGUF — và ai không nên.

Một điều cần nói trước, vì nó khiến mọi người tải lần đầu đều vấp phải: kho lưu trữ (repo) bị giới hạn truy cập. Lệnh một dòng đơn giản hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4 sẽ thất bại với lỗi xác thực cho đến khi bạn đăng nhập vào Hugging Face và chấp nhận các điều khoản truy cập của repo trên trang model. Mọi thứ bên dưới đều giả định bạn đã làm cả hai.

Cũng nói rõ ngay từ đầu: model card của repo này nằm sau cùng một cổng truy cập đó, nên không có gì ở đây diễn giải lại nó. Những gì tiếp sau đây dựa trên danh sách tệp công khai và siêu dữ liệu repo, dựa trên tài liệu NVFP4 công khai của NVIDIA, và dựa trên các báo cáo thực tế từ những người đang phục vụ bản dựng Qwen3.8-27B NVFP4 trên Blackwell. Ở đâu có một con số đến từ người làm thực tiễn thay vì nhà cung cấp, văn bản sẽ nói rõ điều đó.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-27B-Uncensored-NVFP4 repo (captured August 29 2026), showing the access gate 'You need to agree to share your contact information to access this model', total downloads of 32,764, the apache-2.0 license, the BF16 / F8_E4M3 / U8 tensor types, and the abliterated, nvfp4, fp4, fp8, vllm and mixed-precision tags.

Bản dựng này là gì

Qwen3.8-27B-Uncensored-NVFP4 là bản lượng tử hóa NVFP4 của Qwen3.8-27B-Uncensored, phiên bản abliterated của Ali​baba Qw​en/Qwen3.8-27B mà tổ chức orcarouter đã xuất bản vào ngày 2026-08-18. Abliteration loại bỏ hướng từ chối của mô hình khỏi luồng dư; kỹ thuật đó được giải thích trong bài giải thích về mô hình không kiểm duyệt của chúng tôi và sẽ không được giải thích lại ở đây. Mô hình gốc là bản 27B dense với attention lai — 48 lớp attention tuyến tính cộng 16 lớp attention đầy đủ — khả năng hiểu hình ảnh và video nguyên bản, ngữ cảnh 262,144 token, và một đầu giải mã dự đoán MTP tích hợp sẵn. Apache 2.0 từ đầu đến cuối.

Điều làm cho bản build này thú vị không phải là abliteration mà là cách bố trí lượng tử hóa, bởi vì nó cố tình là một bản build lượng tử hóa — nếu bạn tìm kiếm NVFP4, thì định dạng chính là điểm mấu chốt.{{2}} Theo metadata công khai và cấu hình lượng tử hóa của repo, đây là một bản build compressed-tensors độ chính xác hỗn hợp: các phép chiếu attention là FP8 (E4M3), các MLP là NVFP4 (4-bit, đóng gói), còn vision encoder, MTP head, lm_head cùng các norm và bias của linear-attention được giữ ở BF16.{{/2}}{{3}} Metadata safetensors trong danh sách tệp công khai khớp với sơ đồ đó: khoảng 3,5 tỷ tham số ở BF16, 9,4 tỷ ở FP8-E4M3, và 15 tỷ trong các tensor 4-bit đóng gói, chiếm khoảng 24,7 GB trên ổ đĩa trải khắp năm shard cùng với một shard model-extra riêng biệt.{{/3}}{{4}} Không điều nào trong số đó là khẳng định về cách nó phục vụ — VRAM lúc chạy và thông lượng cho chính xác repo này không được công bố ở bất kỳ đâu mà tôi có thể trích dẫn hôm nay. Kích thước trên đĩa đến từ danh sách tệp, định dạng đến từ cấu hình, và hành vi phục vụ bên dưới được cộng đồng xác minh trên các bản build NVFP4 có liên quan chặt chẽ.{{/4}}

NVFP4 là gì, và nó khác với FP8 và INT8/AWQ như thế nào

NVFP4 là định dạng dấu phẩy động 4-bit của NVIDIA, được giới thiệu cho tensor core thế hệ thứ năm trên Blackwell, và blog kỹ thuật của chính NVIDIA là nguồn chính thống phù hợp để tìm hiểu về nó. Định dạng này lưu trữ trọng số dưới dạng E2M1 — một bit dấu, hai bit số mũ, một bit định trị — và chia tỷ lệ chúng theo khối: cứ mỗi 16 giá trị dùng chung một hệ số tỷ lệ E4M3 FP8, còn toàn bộ tensor nhận một giá trị vô hướng FP32 cho riêng từng tensor. Chính cơ chế hai cấp này là điểm mấu chốt của định dạng: nó khôi phục dải động mà một số float 4-bit đơn giản sẽ đánh mất, đổi lại là vài bit chi phí phụ trội cho mỗi khối. Các khác biệt thực tế, tóm gọn trong một dòng:

NVFP4 so với FP8— cả hai đều là số chấm động, nhưng FP8 (E4M3, 8-bit) chạy trên Hopper và Blackwell, trong khi NVFP4 là 4-bit và chỉ được tăng tốc nguyên bản trên Blackwell. NVIDIA cho biết trọng số nhỏ hơn khoảng 3,5× so với FP16 và nhỏ hơn khoảng 1,8× so với FP8, và trên Blackwell, phép nhân ma trận chạy trực tiếp trên các lõi tensor FP4.

NVFP4 so với INT8/AWQ — INT8 (W8A8) và AWQ (W4A16) là các định dạng số nguyên hoạt động từ thế hệ Ampere trở đi; AWQ là 4-bit nhưng dạng số nguyên, và trên hầu hết phần cứng, các trọng số được giải lượng tử hóa thành kiểu rộng hơn cho phép nhân ma trận. NVFP4 là số thực dấu phẩy động 4-bit có chia tỷ lệ theo khối, do đó nó giữ được độ chính xác cao hơn ở các bit thấp, và nó có đường GEMM FP4 gốc mà các định dạng số nguyên không có.

NVFP4 vs MXFP4Hai định dạng này thường xuyên bị nhầm lẫn với nhau. MXFP4 sử dụng khối 32 phần tử và thang E8M0 (lũy thừa của 2); NVFP4 sử dụng khối 16 phần tử và thang E4M3. Các khối mịn hơn giúp NVFP4 cô lập ngoại lệ tốt hơn, đó là lý do định dạng này trở thành chuẩn 4-bit thực tế trên các stack serving Blackwell.

A two-column scoreboard titled 'NVFP4 vs FP8 — the format scoreboard', comparing NVFP4 (4-bit float E2M1, native FP4 GEMM on Blackwell, not accelerated on Hopper, this uncensored build ~24.7 GB on disk, ~3.5x smaller than FP16, best pick on Blackwell for the smallest footprint) against FP8 (8-bit float E4M3, native FP8 GEMM, full Hopper support, this uncensored build ~30.9 GB on disk, ~1.8x smaller than FP16, best pick on Hopper for max fidelity), with a footer line 'Format facts per NVIDIA; build sizes from public file listings.' and the OrcaRouter logo bottom-right.

Phần cứng nào được hưởng lợi — và phần cứng nào không

Sự thật quan trọng nhất về bản build này: NVFP4 là một định dạng của Blackwell. Nó chỉ phát huy được giá trị trên những GPU có tensor core hỗ trợ FP4 GEMM nguyên bản, còn trên bất cứ thứ gì khác thì nó là công cụ sai lầm dù cho máy có nhanh đến đâu trên lý thuyết.

Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — đây là trường hợp mà NVFP4 là lựa chọn đúng đắn: nhân tensor FP4 gốc, diện tích chiếm dụng server-grade nhỏ nhất trong dòng uncensored, và định dạng mà bản build được thiết kế để hỗ trợ.

Hopper — H100/H200 — không có GEMM FP4 nguyên bản. NVFP4 thoái hóa thành một luồng dequant chỉ dành cho trọng số, vừa chậm hơn vừa chẳng mang lại lợi ích gì. Hãy dùng Qwen3.8-27B-Uncensored-FP8 ở đây; bản build đó đã được xác minh chạy trên đúng phần cứng này.

Ampere/Ada — RTX 3090/4090 — NVFP4 cũng không tăng tốc trên các dòng này. Bản dựng GGUF, với mức Q4_K_M dung lượng 16.8 GB, là công cụ phù hợp cho card 24 GB.

Apple Silicon — NVFP4 không liên quan trên Mac. Bản dựng MLX (hoặc GGUF) mới là bản chạy được.

Một điểm cần nói thẳng: các fork cộng đồng có chạy NVFP4 dạng chỉ-trọng-số trên phần cứng trước thế hệ Blackwell. Một bản dựng NVFP4 từ cộng đồng của cùng mô hình abliterated đó được thiết lập riêng cho các card lớp V100 thông qua một fork vLLM đã vá lỗi, còn các công thức DGX Spark gần đây quanh Qwen3.8-27B lại là chuyện riêng của chúng. Những hướng đó là các đường dẫn chuyên biệt với các lưu ý riêng, không phải thứ bản dựng này nhắm tới. Nếu bạn đang trên Blackwell, tất cả điều đó đều không quan trọng; còn nếu bạn không trên Blackwell, bản dựng FP8 hoặc GGUF là lựa chọn tải xuống tốt hơn.

Cách phục vụ

Repo được gắn tag cho vLLM, và định dạng compressed-tensors được đọc tự động từ config.json — bạn không cần tự chọn thủ công phương thức lượng tử hóa. Bộ công nghệ mà các kỹ sư thống nhất chọn cho các bản build Qwen3.8-27B NVFP4 là vLLM bản mới chạy trên card Blackwell, bộ đệm KV FP8, và đầu MTP của chính mô hình dùng cho giải mã suy đoán (speculative decoding). Hướng dẫn NVFP4 của Unsloth, tài liệu cộng đồng được trích dẫn rộng rãi nhất, khuyến nghị vLLM 0.25.0 trở lên kèm FlashInfer và dependency kernel CUTLASS-DSL cho đường dẫn FP4 tốc độ cao.

Điểm khởi đầu khả dụng, được kết hợp từ các cờ đã kiểm chứng của bản dựng FP8 và các công thức NVFP4 từ cộng đồng, tất cả trên một dòng:

vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'

FP8 KV cache — cách tương thích rộng rãi nhất để giảm một nửa bộ nhớ cache; các nhà thực hành cho biết nó gần như tăng gấp đôi ngữ cảnh bạn có thể lưu giữ. Hỗ trợ NVFP4 KV-cache có tồn tại nhưng bị giới hạn ở một số backend attention, vì vậy FP8 KV là lựa chọn mặc định an toàn hơn.

Giải mã dự đoán MTP — mô hình đi kèm với đầu dự thảo MTP, và phiên bản lượng tử hóa giữ nó ở định dạng BF16. Các nhà thực hành báo cáo rằng hai đến ba token dự thảo hoạt động tốt với trọng số NVFP4 trên Blackwell, với lợi ích lớn nhất đối với đầu ra có cấu trúc như JSON và lệnh gọi công cụ.

Vision — bộ mã hóa hình ảnh được giữ ở định dạng BF16 trong bản build này. Thêm --language-model-only để chỉ phục vụ văn bản; bỏ nó nếu bạn cần đầu vào hình ảnh hoặc video.

Trên DGX Spark — một vài lưu ý từ thực tế: giữ --gpu-memory-utilization ở mức 0.90 hoặc thấp hơn (các giá trị cao hơn đã làm treo máy trong quá trình nạp trọng số), và thêm --safetensors-load-strategy lazy nếu bộ nhớ hạn chế. Bạn cũng cần một bản build GB10 của vLLM cho các kernel sm_121a.

Hiệu năng trung thực: không có số liệu thông lượng độc lập nào được công bố cho chính repository này. Các phép đo hiện có là dành cho các bản build NVFP4 có liên quan chặt chẽ. Unsloth báo cáo {{1}}1,41–1,49× tokens-per-second so với BF16 trên B200{{/1}} cho bản build Qwen3.8-27B-NVFP4 của riêng họ ({{2}}89,8 đến 133,7 tok/s ở batch 1, 3.048 đến 4.407 ở batch 64{{/2}}), và một người dùng DGX Spark trên diễn đàn NVIDIA báo cáo khoảng {{3}}20–32 tok/s với trọng số NVFP4, bộ đệm KV FP8 và độ sâu MTP 3{{/3}}. {{4}}Cả hai đều đáng trích dẫn; không phép đo nào trong số đó là benchmark của repository này.{{/4}}

Các mẫu sử dụng thực sự hiệu quả

Các học viên chạy các mô hình thuộc họ Qwen3.8-27B trên Blackwell hội tụ về một số cài đặt nhất định. Hãy coi những điều này như là báo cáo thực địa, không phải hướng dẫn của nhà cung cấp — Qw​en không ghi chép hầu hết những điều này, và model card của repo này cũng bị hạn chế truy cập.

reasoning_effort là tham số quan trọng nhất. Giá trị xhigh mặc định khiến mô hình suy nghĩ rất lâu cho mỗi yêu cầu. Những người chạy vòng lặp agent thường đặt medium làm mặc định và hạ xuống low — hoặc tắt hoàn toàn việc suy nghĩ bằng enable_thinking: false — dành cho các lời gọi đơn lẻ nhạy cảm về độ trễ. Trên một GPU Blackwell, suy luận xhigh cho một tác vụ thông thường chính là cách bạn có một mô hình nhanh nhưng câu trả lời chậm.

Các bộ lấy mẫu được ghép cặp với chế độ suy nghĩ, không độc lập. Đồng thuận cộng đồng: bật chế độ suy nghĩ chạy ở temperature 1.0 / top_p 0.95; tắt chế độ suy nghĩ chạy ở temperature 0.7 / top_p 0.80 với presence_penalty 1.5. Hoán đổi hai bộ cấu hình này làm giảm chất lượng đầu ra.

Hãy sử dụng một template chat hiện hành. Template qwen3_5 bọc mỗi lượt trả lời của trợ lý trong một khối think, và nhiều người dùng báo cáo rằng họ gặp tình trạng lặp vòng hoặc câu trả lời bị cắt cụt khi dùng các template cũ. Các biến thể Qwen-Fixed-Chat-Templates và Qwen-Sharp do cộng đồng sửa lỗi bật preserve_thinking và ngăn chặn các vòng lặp. Nếu output mà bạn serve lan man vượt qua stop token, thì đây là điều đầu tiên cần kiểm tra.

Dự trù ngân sách cho các chuỗi suy luận dài trong công việc của agent. Các nhà thực hành báo cáo rằng mô hình thế hệ 3.8 tạo ra khoảng gấp đôi số token cho mỗi tác vụ so với bản tiền nhiệm 3.6 — bước nhảy chất lượng một phần đến từ việc suy nghĩ lâu hơn. Với các câu trả lời xhigh dài, hãy stream đầu ra suy luận, nếu không bạn sẽ gặp lỗi gateway timeout.

Khả năng gọi công cụ vẫn nguyên vẹn sau khi lượng tử hóa.Đường dẫn gọi hàm vẫn tồn tại sau cả quá trình abliteration và chuyển đổi 4-bit; kích hoạt nó bằng trình phân tích cú pháp lời gọi công cụ qwen3_coder và mô hình sẽ chọn công cụ giống như mô hình gốc.

A screenshot of the Artificial Analysis page for Qwen3.8 27B (medium) (captured August 29 2026), showing an Intelligence score of 44, a speed of 52.3 tokens per second, the comparison summary paragraph, $0.50 per 1M input and $3.00 per 1M output token pricing, and a 256k-token context window.

Ai nên chọn build này — và ai không nên

Quyết định trung thực, mà không lặp lại phép toán chọn lượng tử mà các bài viết FP8 và GGUF của chúng tôi đã trình bày chi tiết:

Chọn NVFP4 nếu bạn đang triển khai trên Blackwell và muốn có footprint cấp máy chủ nhỏ nhất trong dòng không kiểm duyệt với tốc độ FP4-tensor-core — và bạn đang thực hiện công việc nghiên cứu, red-team hoặc interpretability mà thực sự cần một mô hình abliterated.

Chọn Qwen3.8-27B-Uncensored-FP8 nếubạn đang dùng Hopper, hoặc bạn muốn đường dẫn vLLM được xác minh rộng rãi nhất — đây là cùng một bộ trọng số ở mức 8-bit, đã được xác minh trên H200, với mức tối thiểu khoảng 40 GB VRAM.

Chọn Qwen3.8-27B-Uncensored-GGUF nếu bạn đang dùng GPU tiêu dùng hoặc máy Mac, hoặc bạn muốn dùng llama.cpp thay vì vLLM — bản Q4_K_M là lựa chọn tối ưu cho máy cục bộ.

Đừng chọn cả hai nếu bạn muốn độ trung thực tối đa, bạn đang xây dựng bất cứ thứ gì hướng đến người dùng (xem ranh giới an toàn bên dưới), hoặc bạn không muốn tự lưu trữ chút nào — cùng một dòng không kiểm duyệt được phục vụ qua OrcaRouter giới hạn cho các nhà nghiên cứu, vì vậy không cần GPU.

Ranh giới an toàn — chỉ dùng cho nghiên cứu

Đây là một mô hình abliterated, và bản lượng tử hóa không khôi phục các rào chắn an toàn. Hướng từ chối đã bị loại bỏ khỏi luồng dư của Qw​en/Qwen3.8-27B, và NVFP4 chỉ là một thay đổi về độ chính xác chứ không phải là biện pháp can thiệp an toàn — mô hình sẽ tuân thủ các yêu cầu mà mô hình gốc từ chối, và bản dựng này không có cơ chế kiểm duyệt tích hợp sẵn. Nó được phát hành cho mục đích nghiên cứu khả năng diễn giải, an toàn AI và red-team theo giấy phép Apache 2.0, và trách nhiệm thuộc về bạn.

Hai lưu ý đánh giá hiếm khi được nhắc tới trong không gian mô hình không kiểm duyệt. Thứ nhất, một bài kiểm tra jailbreak đơn lẻ vượt qua một cách tầm thường không phải là một bài đánh giá an toàn đạt yêu cầu — các mô hình abliterated cố tình trượt những bài kiểm tra đó. Hãy đo lường thứ bạn thực sự quan tâm bằng các bộ công cụ phù hợp (AdvBench, HarmBench và StrongREJECT cho mức độ độc hại; XSTest-safe cho tình trạng từ chối quá mức) và so sánh tỷ lệ từ chối trước và sau khi can thiệp. Thứ hai, hãy đánh giá phiên bản lượng tử hóa, không chỉ bản gốc: một bản dựng 4-bit có thể thay đổi hành vi trong các trường hợp biên ngay cả khi điểm tổng hợp trông vẫn ổn. Không triển khai mô hình này cho người dùng cuối nếu chưa có các lớp kiểm duyệt và ngăn chặn lạm dụng của riêng bạn.

OrcaRouter phù hợp ở đâu

Một bản build lượng tử hóa mười ngày tuổi là ví dụ kinh điển cho việc định tuyến thay vì nối cứng. Bạn có thể dựng một route trỏ tới bản NVFP4 mà bạn tự chạy và chuyển sang một mô hình lưu trữ nếu bản build hoạt động không tốt dưới tải — một giao diện, không cần đấu nối lại giữa các nhà cung cấp khi bạn chuyển đổi. OrcaRouter chuyển giá niêm yết của nhà cung cấp qua với mức chênh lệch 0%, vì vậy nếu giá của mô hình cơ bản thay đổi, endpoint của bạn phản ánh điều đó ngay trong ngày thay vì theo chu kỳ thanh toán.

Và nếu toàn bộ mục đích là để tránh chạy GPU hoàn toàn: dòng sản phẩm không kiểm duyệt tương tự cũng có sẵn qua OrcaRouter, giới hạn cho các nhà nghiên cứu bảo mật và nhóm red team, với khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp. Dù bạn tự lưu trữ bản dựng NVFP4 này hay gọi đến dịch vụ lưu trữ, thì cũng chỉ cần một khóa API trong cả hai trường hợp.

Điểm mấu chốt

Qwen3.8-27B-Uncensored-NVFP4 là bản tải phù hợp nếu bạn đang phục vụ mô hình abliterated trên Blackwell và muốn có dung lượng tối thiểu với tốc độ FP4 tensor-core. Đây là bản tải không phù hợp trên Hopper (hãy dùng bản FP8), trên GPU tiêu dùng hoặc GPU Apple (hãy dùng bản GGUF hoặc MLX), hoặc nếu bạn cần độ trung thực tối đa. Bản này không mới — nó đã có thể tải về từ ngày 19 tháng 8 năm 2026 — nhưng nó đang được tải về với số lượng lớn, và giờ bạn đã biết mình sẽ gặp phải điều gì trước khi chấp nhận cổng.

Không phải một bản build khác của mô hình này — Qwen3.8-Flash-Next-Uncensored là một bản phát hành riêng biệt: được abliterate từ Qwen3.8-Flash-Next, một bản preview mixture-of-experts với 176B tham số được lưu trữ / 6B tham số được kích hoạt của kiến trúc Qwen4. Cùng kỹ thuật abliteration, trọng số khác, bộ sưu tập riêng.

Tất cả sáu bản build 27B — BF16, GGUF, MLX, FP8, INT8 và NVFP4 — đều được tập hợp trong bộ sưu tập Qwen3.8-27B-Uncensored trên Hugging Face.

Các trọng số này chỉ dùng cục bộ theo thiết kế. Để có một mốc chuẩn lưu trữ nhằm đo lường bản build đã abliterate, Qwen3.8-27B được phục vụ trên OrcaRouter với giá niêm yết của nhà cung cấp, không cộng thêm phí — mô hình gốc, còn nguyên cơ chế an toàn.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube