Thẻ tiêu đề hero cho bài viết 'Qwen3.8-27B-Uncensored-MLX on Apple Silicon' hiển thị tiêu đề 'Qwen3.8-27B-Uncensored-MLX', phụ đề 'The Apple Silicon Runbook', một hàng chip định lượng được gắn nhãn 2-bit, 4-bit, 6-bit và 8-bit với 4-bit được tô sáng, một cửa sổ LM Studio cách điệu hiển thị '4-bit build at repo root', và mô-típ ngữ cảnh 262K, với logo OrcaRouter được ghép ở góc.
Guides & Insights

Qwen3.8-27B-Uncensored-MLX trên Apple Silicon: Cách chọn bản dựng của bạn, tải nó trong LM Studio hoặc mlx-vlm, và làm chủ ngữ cảnh 262K

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điều hữu ích nhất cần biết về orcarouter/Qwen3.8-27B-Uncensored-MLX là bạn không cần phải chọn một thư mục con để chạy nó. Bản dựng abliterated cho Apple Silicon của OrcaRouter từ Qw​en/Qwen3.8-27B — được xuất bản lên Hugging Face vào ngày 17 tháng 8 năm 2026, nên không phải là mới, chỉ là thiếu tài liệu — giữ một bản sao của bản dựng 4-bit tại thư mục gốc của repo, cụ thể để các công cụ coi một repo như một mô hình, quan trọng nhất là LM Studio, tải nó mà không cần cấu hình gì. Chính quyết định đó là lý do tại sao thẻ này đã đạt khoảng 83.000 lượt tải xuống trong tháng qua trong khi các bản chuyển đổi MLX tương tự chỉ nhận được một phần nhỏ trong số đó. Mọi thứ khác về nó là một lựa chọn thực sự: chọn độ chính xác nào trong bốn mức phù hợp với bộ nhớ hợp nhất của Mac, dùng trình chạy nào, liệu khả năng thị giác và gọi công cụ có tồn tại ở độ rộng bit của bạn hay không, và liệu cửa sổ ngữ cảnh 262.144 token có đáng với chi phí trên phần cứng của bạn hay không. Cuốn sổ vận hành này sẽ đi qua các quyết định đó theo thứ tự. Đây là tài liệu từ chính nhà phát hành — các con số về kích thước, độ chính xác và độ trung thực dưới đây là của riêng OrcaRouter, được đo trên chính bản dựng này, và mọi con số của cộng đồng đều được ghi chú rõ ràng.

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

Chính xác thì có gì trong repo này?

Đây là bản dựng đã abliterate của Qwen/Qwen3.8-27B — một mô hình mật độ 27B, kiến trúc lai chú ý (linear attention Gated DeltaNet cộng với full attention), vốn có khả năng ngôn ngữ-thị giác, có điều khiển suy luận, gọi công cụ, đầu dự đoán đa token (MTP) và cửa sổ ngữ cảnh 262.144 token. Abliteration loại bỏ hành vi từ chối của mô hình bằng cách trực giao hóa hướng từ chối ra khỏi luồng dư; nếu bạn chưa quen với kỹ thuật này, bài viết giới thiệu của chúng tôi là nơi tốt hơn để bắt đầu so với trang này, vốn tập trung vào việc chạy bản dựng, không phải phương pháp. Trọng số được cấp phép Apache-2.0, kế thừa từ mô hình gốc.

Đừng nhầm lẫn repo này với qwen-3-8-27b-mlx, vốn là cùng một mô hình cơ sở ở định dạng MLX nhưng không có abliteration. Người đọc thường tải nhầm cái này khi họ muốn cái kia: bản này là bản nghiên cứu đã loại bỏ cơ chế từ chối; còn bản kia là Qwen/Qwen3.8-27B thuần túy chạy trên Apple Silicon. Hãy kiểm tra tên repo trước khi bạn tốn thời gian tải về.

Một chi tiết cấu trúc quan trọng hơn nhiều so với vẻ bề ngoài của nó: tháp thị giác, tất cả các lớp chuẩn hóa và conv1d của linear-attention vẫn được giữ ở BF16, và chỉ các lớp tuyến tính của mô hình ngôn ngữ — bao gồm embed_tokenslm_head — mới được lượng tử hóa. Đó là lý do khả năng hiểu hình ảnh vẫn nguyên vẹn sau khi lượng tử hóa, và cũng là lý do kích thước lưu trữ trên đĩa dưới đây lớn hơn một chút so với ước tính ngây thơ "27B ở N bit": một phần mô hình không bao giờ được nén.

Quyết định: bản build nào phù hợp với Mac nào

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

Bốn độ chính xác được phân phối dưới dạng thư mục con — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — tất cả đều là lượng tử hóa affine MLX với kích thước nhóm 64. Bản dựng 4-bit còn được nhân bản thêm tại thư mục gốc của kho lưu trữ. Hãy ưu tiên chọn theo bộ nhớ thống nhất của Mac trước, chất lượng sau:

8-bit — chiếm ~27,5 GB trên đĩa, cần một chiếc Mac 64 GB (máy 32 GB vẫn tải được nhưng sẽ còn rất ít chỗ trống cho việc khác). Độ trung thực cosin đo được so với nguồn BF16: 0,9997, thực tế gần như không mất mát. Hãy chọn nó khi chất lượng là điều quan trọng nhất và bộ nhớ dồi dào.

6-bit — ~22 GB, phù hợp với Mac 24–32 GB. Độ trung thực 0.9996, tuyệt vời. Mức cân bằng chất lượng/GB tốt nhất cho hầu hết người dùng máy 48 GB.

4-bit — ~15 GB, thoải mái trên Mac 24 GB. Độ trung thực 0.996, rất tốt. Đây là mặc định được khuyến nghị của chúng tôi và đây là bản sao tại thư mục gốc của repo vì lý do đó.

2-bit — ~8.7 GB, vừa với Mac 16 GB. Độ trung thực 0.92 và, ở mức 27B, suy giảm nghiêm trọng: lặp vòng, văn bản lộn xộn, mã và tiếng Trung, thị giác một phần. Thẻ ghi rõ ràng — chỉ để lưu trữ, không dùng cho công việc thực tế. Mac 16 GB về mặt kỹ thuật có thể nạp được nó; điều đó không khiến nó hữu dụng.

Dung lượng trên đĩa không phải là con số bộ nhớ. Trọng số phải vừa trong bộ nhớ hợp nhất cùng với macOS, bộ đệm KV và các vùng đệm tạm của Metal, vì vậy hãy chừa khoảng trống. Một lần chạy cộng đồng của bản build 4-bit trên Mac M1 Pro 32 GB đo được ~16 GB trọng số trên đĩa nhưng đỉnh suy luận là 18,5–21,7 GB; các lần chạy cộng đồng của bản build MLX 8-bit báo cáo đỉnh khoảng 34–36 GB ngay cả khi trọng số chỉ ~29,5 GB. Hướng dẫn thực tế từ chính bài kiểm tra cộng đồng đó là: {{1}}16 GB không phải là lựa chọn khả thi thực sự cho mô hình 27B, 24 GB có thể thử bản 4-bit với ngữ cảnh ngắn, và 32 GB là điểm khởi đầu thoải mái{{/1}}. Bài viết về quy hoạch VRAM của chúng tôi phân tích cùng một phép toán cho toàn bộ dòng sản phẩm.

Vì danh sách toàn bộ kho lưu trữ có tổng dung lượng khoảng 94 GB ở mọi độ chính xác, hãy chỉ tải về thư mục con bạn cần bằng hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — thay bằng độ chính xác bạn đã chọn. Bản 4-bit ở thư mục gốc là bản trùng lặp của thư mục con 4-bit, vì vậy bạn không cần tải cả hai.

Cách một — LM Studio, không cần cấu hình

Bản sao 4-bit gốc tồn tại nhằm để LM Studio có thể xem toàn bộ kho lưu trữ như một mô hình duy nhất. Tìm kiếm ID mô hình, chọn độ chính xác bạn muốn (bản sao gốc là 4-bit), và ứng dụng sẽ lo phần còn lại. Có ba cạm bẫy, tất cả đều từ thẻ của chúng tôi, và chúng là toàn bộ sự khác biệt giữa việc hoạt động và thất bại:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

Kho lưu trữ này bị giới hạn.Tải xuống ẩn danh sẽ nhận mã HTTP 401. Hãy chấp nhận điều khoản trên trang mô hình, sau đó dán token đọc của Hugging Face vào Cài đặt → Tích hợp → Hugging Face của LM Studio. Bỏ qua bước này và tải sẽ thất bại.

Tắt lượng tử hóa KV cache. Các mô hình thị giác MLX không hỗ trợ tính năng này trên kiến trúc này; nếu được bật, việc tải sẽ thất bại khi khởi tạo (được theo dõi tại mlx-engine#286). Điều này trái ngược với lời khuyên dành cho các bản dựng GGUF, trong đó việc lượng tử hóa K/V cache là một khoản tiết kiệm VRAM thực sự — hai định dạng này không thể hoán đổi cho nhau ở đây.

Cập nhật runtime. qwen3_5: hỗ trợ kiến trúc đã có trong mlx-vlm 0.6.x; runtime đi kèm cũ hơn hoàn toàn không thể tải các trọng số này. Ngược lại, nhãn "Likely too large" của LM Studio chỉ là cảnh báo RAM, không phải lỗi — hãy bỏ qua nó nếu bộ nhớ thống nhất của bạn đáp ứng các hướng dẫn ở trên.

Độ chính xác nào trong LM Studio: 8-bit chiếm khoảng 29.5 GB trên đĩa và cần Mac 64 GB; 6-bit ~22 GB phù hợp với máy 48 GB; 4-bit ở ~16 GB là lựa chọn đúng cho Mac 32 GB. Nếu bạn muốn dùng đường llama.cpp / Ollama trên phần cứng khác, hướng dẫn chạy cục bộ của chúng tôi cho mô hình chưa kiểm duyệt sẽ đề cập riêng đến con đường đó.

Đường dẫn thứ hai — mlx-vlm và mlx-lm từ một thư mục con

Phương pháp dòng lệnh cung cấp cho bạn độ chính xác trực tiếp và một máy chủ tương thích Open​AI cho các công cụ tác tử. Yêu cầu: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 và mlx ≥ 0.32; backend Metal được chọn tự động trên Apple Silicon). Sau khi tải thư mục con ở trên:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Giải thích sự vướng víu lượng tử trong một câu." --max-tokens 256

Thêm --image path/to/image.png để nhập hình ảnh, hoặc phục vụ nó:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

Thị giác sống sót qua quá trình lượng tử hóa

Vì tháp thị giác và conv1d vẫn ở BF16, khả năng hiểu hình ảnh được bảo toàn ở mức 4/6/8-bit. Trên ảnh thử nghiệm của chúng tôi — hình dạng, màu sắc, vị trí, nền và văn bản trong ảnh — các bản dựng 4/6/8-bit đã mô tả mọi thứ chính xác; 2-bit chỉ đúng một phần. Nếu bạn đang chọn bản dựng và thị giác quan trọng, 4-bit là mức thấp nhất bạn nên dùng. Chúng tôi chưa công bố thông lượng thị giác dành riêng cho Apple Silicon cho bản dựng này, vì vậy đừng tin con số tok/s cho nó trừ khi nó đến từ một lần chạy cụ thể trên chính loại chip của bạn.

Tháp thị giác được giữ lại cũng là một phần của bề mặt rủi ro, và cần phải nói thẳng: một mô hình abliterated vẫn đọc được hình ảnh không phải là vấn đề an toàn chỉ giới hạn ở văn bản.

Gọi công cụ và sử dụng tác nhân

Gọi công cụ là một khả năng của mô hình cơ sở và nó vẫn tồn tại sau abliteration, điều này khiến bản dựng này thực sự hữu ích để red-team các hệ thống tác tử — và thực sự nguy hiểm nếu hướng vào các dịch vụ thực tế. Thiết lập tiêu chuẩn là mlx_lm.server endpoint ở trên, mà bất kỳ tác tử tương thích Open​AI nào cũng có thể truy cập. Nếu bạn thực sự chạy nó như một tác tử, hãy hiểu bạn đã kích hoạt điều gì: một mô hình không từ chối với khả năng gọi hàm và ngữ cảnh 262K là một tư thế an toàn khác với mô hình trò chuyện, và khung chỉ dành cho nghiên cứu của thẻ tồn tại vì lý do đó.

Context 262K và chi phí thực sự của nó

Kiến trúc này mang lại cho mô hình khả năng ngữ cảnh dài với chi phí rẻ một cách bất thường. Attention lai ở đây có nghĩa là 48 lớp linear-attention (Gated DeltaNet) xen kẽ với 16 lớp full-attention, và chỉ 16 lớp full-attention mới mang bộ đệm KV cổ điển — các lớp linear giữ một trạng thái hồi quy nhỏ gọn thay vào đó. Vì vậy, 262.144 token có chi phí thấp hơn đáng kể so với một mô hình full-attention 27B. Đó là một sự thật về mặt cấu trúc của mô hình cơ sở, không phải là một lời hứa về chiếc Mac của bạn.

Trong thực tế, window là một khả năng, không phải một gói miễn phí. Một bài kiểm tra ngữ cảnh dài của cộng đồng trên M4 Max đo được khoảng 63 tok/s ở ngữ cảnh ngắn, giảm xuống còn khoảng 11 tok/s ở 31K token — decode suy giảm mạnh khi bộ đệm đầy dần, và độ trễ token đầu tiên trên các prompt rất dài thường là rào cản lớn hơn thông lượng thô. Prefill dựa trên speculative và ANE cải thiện khả năng nạp dữ liệu, không phải decode. Số liệu chi phí KV-cache Apple Silicon của riêng chúng tôi cho bản build này chưa được công bố; nếu bạn cần số liệu cụ thể cho phần cứng của mình, các bài chạy của cộng đồng là nguồn trung thực, và sự đồng thuận của cộng đồng là coi toàn bộ 262K như một thứ bạn chủ động sử dụng khi cần, không phải mặc định luôn bật.

Tốc độ — điều gì thực sự được đo lường

Chúng tôi công bố đúng một con số tốc độ cho bản dựng này và nó không phải Apple Silicon: ~32–37 tok/s ở trạng thái ổn định trên một H200 qua backend MLX CUDA, điều này xác nhận rằng các trọng số cũng chạy được ngoài macOS. Trên Mac, thẻ thông số của chúng tôi cố tình không công bố tok/s, vì nó phụ thuộc vào chip, độ chính xác và trình chạy. Những con số thực tế đáng biết, tất cả đều được gắn nhãn như vậy:

• Bản dựng chính xác này, 4-bit, M1 Pro 32 GB: ~8.7 tok/s sinh và ~41.7 tok/s prefill trong một lần chạy ngắn (thử nghiệm cộng đồng, tháng 8 năm 2026). Một con chip cũ hơn, nhưng là mức sàn thực tế.

• oMLX với MTP gốc trên M4 Max, checkpoint chuẩn chưa abliterated: 53.3 tok/s cho văn xuôi và 72.1 tok/s cho mã, với ~273.7 tok/s prefill ở 4K; decode thô không có MTP ~24.6 tok/s. Được practitioner đo trên checkpoint và runtime khác, vì vậy hãy coi đây là giới hạn trên mà các trọng số đã abliterated có thể tiệm cận, chứ không phải là lời cam kết.

• Prefill dual-ANE của oMLX trên M3 Ultra, với oQ4e-MTP đã abliterated: prefill tăng tới ~17.7% ở 16K và ~18.9% ở 32K, và giải mã qua Lightning MTP đạt tới ~75 tok/s ở 16K. Các hạn chế là có thật: nó sử dụng các giao diện runtime riêng của Apple và trọng số INT8 gần đúng, thêm khoảng 4 GB bộ nhớ đỉnh, và đẩy thời gian tải mô hình từ ~3.4 s lên ~28 s. Đó là một tối ưu hóa tiếp nhận prompt, không phải là một bộ tăng tốc sinh.

Đầu MTP — một sự tăng tốc miễn phí nếu runner của bạn hỗ trợ nó

Bản dựng này đi kèm bộ nháp dự đoán đa token (multi-token-prediction) của mô hình cơ sở trong thư mục con mtp/ (kiến trúc qwen3_5_mtp), và nó hoạt động với mọi độ chính xác chính (main precision). Quá trình chấp nhận là không mất mát — với giải mã tham lam, đầu ra giống hệt như khi chạy mà không có bộ nháp — vì vậy đây là một sự tăng tốc thực sự, không làm giảm chất lượng khi nó được kích hoạt. Hai lưu ý thiết lập từ model card của chúng tôi: nó yêu cầu một bản dựng mlx-vlm bao gồm qwen3_5_mtpbộ nháp (nhánh main), và bạn phải truyền cả --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp--draft-kind mtp. Việc chỉ đặt mtp_enabled một mình sẽ không có tác dụng gì. Nếu trình chạy (runner) của bạn không hỗ trợ bộ nháp, nó sẽ bị bỏ qua và mô hình vẫn chạy bình thường — không có gì bị hỏng.

An toàn — hãy đọc phần này trước khi chạy, không phải sau đó.

Lời tuyên bố miễn trừ trách nhiệm của chính model card vốn thẳng thắn một cách bất thường, và trang này sẽ không làm dịu nó đi. Việc căn chỉnh an toàn của bản dựng này đã bị loại bỏ phần lớn. Nó sẽ tuân thủ các yêu cầu gây hại, phi đạo đức, xúc phạm hoặc bất hợp pháp mà mô hình Qwen/Qwen3.8-27B gốc sẽ từ chối, và nó không có hàng rào bảo vệ tích hợp đáng kể nào. Nó được phát hành nghiêm ngặt cho nghiên cứu hợp pháp — nghiên cứu khả năng diễn giải, an toàn AI và cơ chế từ chối, red-teaming, đánh giá độ bền vững và các thử nghiệm có kiểm soát. Nếu đó không phải là việc bạn đang làm, thì đây là mô hình sai.

Cảnh báo từ thẻ mô hình đáng được nhấn mạnh. Thứ nhất, jailbreak và các phép thử an toàn "thành công" một cách tầm thường trên một mô hình abliterated, và đó không phải là một đánh giá an toàn đạt yêu cầu — đó là hành vi mong đợi của một mô hình đã bị loại bỏ hướng từ chối. Sự vắng mặt của cơ chế từ chối không phải là bằng chứng về sự an toàn. Thứ hai, khả năng thị giác, gọi công cụ và ngữ cảnh 262K được giữ lại sẽ mở rộng bề mặt tấn công vào việc hiểu hình ảnh và sử dụng tác nhân: một mô hình không kiểm duyệt có thể đọc ảnh chụp màn hình và gọi công cụ mang lại rủi ro rộng hơn một phiên bản chỉ trò chuyện đã loại bỏ cơ chế từ chối. Lượng tử hóa bit thấp thêm lớp mất ổn định thứ ba lên trên — ở mức 2-bit, đầu ra nhiễu loạn thậm chí có thể bị nhầm thành sự từ chối, đây là một kiểu thất bại gây nhầm lẫn riêng.

Bạn chịu toàn bộ trách nhiệm và nghĩa vụ pháp lý đối với việc sử dụng và các đầu ra. Giấy phép Apache-2.0 được kế thừa từ mô hình cơ sở và không làm thay đổi điều đó: nó cho phép sử dụng; nó không làm cho việc triển khai của bạn an toàn. Bất kỳ ai triển khai mô hình này cho người dùng cuối, trẻ vị thành niên, hoặc bất kỳ môi trường sản xuất nào phải tự thêm các lớp kiểm duyệt, an toàn và ngăn chặn lạm dụng của riêng họ trước tiên, đồng thời tuân thủ luật pháp hiện hành. Đối với các nhà nghiên cứu thực sự vận hành mô hình này, các biện pháp bảo vệ thực tế là: môi trường cách ly, lý tưởng nhất là ngoại tuyến; các công cụ tác nhân không trỏ đến các dịch vụ thực; không tiếp xúc với người dùng cuối; và xem xét các đầu ra trước khi chúng được đưa ra ngoài.

Khi địa phương không phải là câu trả lời

Local chính là điểm mấu chốt của bản build này — các trọng số nằm trên đĩa của bạn, không có chi phí theo token, và không có gì rời khỏi máy. Nhưng local cũng là một giới hạn: nó chỉ dành riêng cho Apple Silicon, bạn phải chấp nhận chất lượng quant, và không có sự dự phòng nếu máy đang bận. Nếu bạn cần một mô hình non-abliterated lớp 27B qua API cho một khối lượng công việc thực tế, hoặc bạn muốn chạy A/B bản build local này với một mô hình hosted bằng cùng các prompt, thì đó chính là khoảng trống mà một tầng định tuyến tồn tại để lấp. OrcaRouter gom hơn 200 mô hình sau một API key với giá niêm yết của nhà cung cấp, kèm failover tự động và một DSL định tuyến — khi nhà cung cấp hạ giá, phía chúng tôi áp dụng ngay trong ngày công bố, vì chúng tôi truyền thẳng giá niêm yết. Một API, một lần tích hợp, và bạn có thể so sánh một thiết lập local chưa được kiểm chứng với một mô hình hosted mà không cần tạo thêm tài khoản thứ hai. Chúng tôi không host bản MLX này — bản chất của nó là trọng số local theo thiết kế — vì vậy API là con đường bổ trợ, không phải sự thay thế cho nó.

Hướng dẫn quyết định nhanh

• Mac 16 GB — thật sự, không phải mẫu này. 2-bit phù hợp và chỉ để lưu trữ; dù thế nào bạn cũng sẽ phải vật lộn với bộ nhớ. Hãy xem một mô hình không kiểm duyệt nhỏ hơn, hoặc bản chuyển đổi 3/6-bit hỗn hợp từ cộng đồng được xây dựng cho máy 18–24 GB.

• Mac 24 GB — 4-bit, và giữ ngữ cảnh ngắn; không chạy vision và ngữ cảnh dài cùng lúc.

• Mac 32 GB — 4-bit là điểm tối ưu; 6-bit nếu bạn giữ ngữ cảnh gọn.

• Mac 48 GB — 6-bit với khoảng dự phòng; 8-bit nếu bạn không đẩy cửa sổ.

• 64 GB trở lên — 8-bit, gần như không mất dữ liệu, và ngữ cảnh 262K trong tầm tay với những lưu ý nêu trên.

Đó là toàn bộ runbook. Mô hình có từ ngày 17 tháng 8 năm 2026, đây không phải tin ra mắt, và cũng không cần phải là: 83.000 lượt tải xuống xảy ra vì mọi người muốn một bài hướng dẫn, và trang này chính là bài hướng dẫn đó. Bắt đầu từ thư mục gốc của repo, tải bản 4-bit trong LM Studio, và chỉ rời khỏi bản build mặc định khi bạn biết mình đang đánh đổi điều gì để lấy chất lượng. Nếu bạn đến từ phía GGUF hoặc FP8, các hướng dẫn liên quan sẽ đề cập đến những lộ trình đó — khung quyết định ở đây là giống nhau, nhưng phép toán lượng tử hóa thì không.

Không phải một bản build khác của mô hình này — Qwen3.8-Flash-Next-Uncensored là một bản phát hành riêng biệt: được abliterate từ Qwen3.8-Flash-Next, một bản preview mixture-of-experts với 176B tham số được lưu trữ / 6B tham số được kích hoạt của kiến trúc Qwen4. Cùng kỹ thuật abliteration, trọng số khác, bộ sưu tập riêng.

Tất cả sáu bản build 27B — BF16, GGUF, MLX, FP8, INT8 và NVFP4 — đều được tập hợp trong bộ sưu tập Qwen3.8-27B-Uncensored trên Hugging Face.

Các trọng số này chỉ dùng cục bộ theo thiết kế. Để có một mốc chuẩn lưu trữ nhằm đo lường bản build đã abliterate, Qwen3.8-27B được phục vụ trên OrcaRouter với giá niêm yết của nhà cung cấp, không cộng thêm phí — mô hình gốc, còn nguyên cơ chế an toàn.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube