Một thẻ tiêu đề chính hiển thị Qwen3.8-27B GGUF với phụ đề 'bản lượng tử phù hợp cho GPU của bạn', cùng biểu tượng tải xuống và các chip tệp cho Q4_K_M 17.1GB và UD-IQ2 9.0GB.
Guides & Insights

Qwen3.8-27B GGUF: Nên tải bản Quant nào cho GPU của bạn?

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tải bộ unsloth/Qwen3.8-27B-GGUF và khớp tệp với card bạn thực sự sở hữu. Đó chính là toàn bộ câu trả lời: một GPU 24GB (RTX 4090 hoặc 3090) nên tải bản Q4_K_M 17.1GB; một GPU 16GB nên tải bản IQ4_XS 15.7GB (hoặc bản Q3_K_M 13.8GB nếu bạn muốn có thêm không gian context); một GPU 12GB bị giới hạn ở các tệp 2-bit, bản UD-IQ2_XXS 9.0GB, và đó là một sự đánh đổi có ý thức. Qwen3.8 27B — mô hình dense 27 tỷ tham số của Ali​baba, trọng số Apache 2.0 được phát hành ngày 13–14 tháng 8 năm 2026 — chạy rẻ đến bất ngờ trên máy local vì cơ chế hybrid attention của nó chỉ lưu cache 16 trên 64 lớp, nên một bản lượng tử 4-bit trên GPU 24GB có thể thoải mái xử lý ngữ cảnh 32K–64K token. Và GGUF là con đường duy nhất có chi phí biên bằng không: không cần API key, không phí theo token, không có dữ liệu rời khỏi máy của bạn.

Về nguồn thông tin: kiến trúc, cửa sổ ngữ cảnh và giấy phép là chính thức, từ thẻ mô hình Qwen3.8 27B trên Hugging Face, đã xác minh vào ngày 15 tháng 8 năm 2026. Các kích thước GGUF được lấy từ kho lưu trữ GGUF của unsloth và ggml-org, cùng ngày. Hướng dẫn về dung lượng VRAM trên mỗi GPU là khuyến nghị chính thức của unsloth. Các ước tính byte về bộ đệm KV và các con số token mỗi giây do cộng đồng đo lường trong những ngày đầu sau khi phát hành, không phải thông số của nhà cung cấp. Mọi điểm chuẩn được nêu dưới đây đều do Ali​baba công bố và chưa được tái lập.

Trình chọn tệp, mỗi dòng một quant

UD-IQ2_XXS — 9.0GB — lựa chọn duy nhất phù hợp thoải mái cho thẻ 12GB; dự kiến sẽ thấy giảm chất lượng rõ rệt.

UD-Q2_K_XL — 10.7GB — thẻ 12GB, gần như không còn ngữ cảnh nào để dư.

Q3_K_M — 13.8GB — dành cho card 16GB muốn có thêm khoảng trống context.

IQ4_XS — 15.7GB — card 16GB: lượng tử hóa lớn nhất có thể nằm gọn.

Q4_K_M — 17.1GB — các card 24GB: lựa chọn tối ưu, và là tệp mà bài viết này hướng bạn đến.

Q5_K_M — 19.8GB — 24GB, đánh đổi không gian ngữ cảnh để có được chất lượng tốt hơn một chút.

Q6_K — 22.9GB — nằm gọn trong 24GB nếu nén; gần như không mất dữ liệu.

Q8_0 — 29.0GB — 32GB, chia trên hai card, hoặc giảm tải CPU.

BF16 — 54.7GB — dành cho card máy chủ và cấu hình CPU có RAM lớn; độ chính xác tham chiếu.

Hai gói, hai kích thước Q4_K_M: bản của unsloth là 17,1GB; bản của ggml-org là 19,0GB. Gói unsloth sử dụng phương pháp lượng tử hóa Dynamic V3.0 (bản xem trước) cho các tệp UD-* và là gói được hầu hết các ứng dụng cục bộ chọn mặc định; gói ggml-org cung cấp các K-quants tiêu chuẩn cùng với đầu dự đoán đa token riêng biệt dùng cho giải mã suy đoán. Cả hai Q4_K_M đều hoạt động — khác biệt chỉ là vài trăm megabyte và tệp MTP.

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

Tại sao 27B này lại vừa trên các card nhỏ hơn hầu hết

Qwen3.8 27B có 64 lớp, nhưng chỉ 16 lớp sử dụng full attention. 48 lớp còn lại sử dụng Gated DeltaNet linear attention, vốn duy trì một recurrent state có kích thước cố định thay vì một key-value cache ngày càng tăng. Bố cục khối trong model card là 3×(Gated DeltaNet → FFN) cho mỗi 1×(Gated Attention → FFN) — tỷ lệ hybrid 3:1. Hiệu quả thực tế: KV cache chỉ bằng khoảng một phần tư so với những gì một mô hình dense 27B thông thường cần cho cùng độ dài ngữ cảnh. Các phép đo từ cộng đồng trong tuần này cho thấy cache ở mức khoảng 0,5GB với ngữ cảnh 8K, 2,0GB ở 32K và 16,4GB ở cửa sổ native đầy đủ 262K. Điều này đảo ngược lời khuyên thông thường — phần lớn ngân sách VRAM dành cho trọng số, không phải ngữ cảnh, và một card 24GB có thể chạy Q4_K_M với ngữ cảnh 64K–96K mà không phải lo lắng. Bạn có thể thu nhỏ cache hơn nữa bằng cờ --cache-type-k của llama.cpp, vốn lượng tử hóa chính cache.

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

Ba cạm bẫy sẽ khiến bạn vấp ngã ngay trong ngày đầu tiên

Các bản dựng llama.cpp cũ từ chối tệp này. GGUF đăng ký kiến trúc qwen35 mới, vì vậy bạn cần bản dựng hiện tại — bất kỳ bản nào trước tuần phát hành đều từ chối tải tệp với lỗi kiến trúc. Hãy cập nhật llama.cpp trước tiên, trước khi bạn tải xuống.

Bẫy template.Chat template Jinja chính thức bọc mỗi lượt phản hồi của trợ lý trong một khối think ngay cả khi dấu vết suy luận trống, gây ra các khối lồng nhau và lịch sử bị cắt cụt trong các cuộc trò chuyện nhiều lượt — trông như thể mô hình đã quên mất những gì bạn nói. Hãy chạy llama.cpp với cờ --jinja và ưu tiên một pack đi kèm chat_template.jinja đã được sửa.

Thị giác cần một tệp riêng. Văn bản hoạt động ngay; hình ảnh và video sẽ âm thầm không hoạt động trừ khi bạn cũng tải projector mmproj, khoảng 0,9GB. Nó không được liệt kê trên trang kho GGUF của unsloth — hãy lấy từ kho lưu trữ cơ sở hoặc gói ggml-org. Nếu bạn định đưa tài liệu hoặc ảnh chụp màn hình, hãy thêm --mmproj vào lệnh máy chủ.

Chạy nó: các lệnh

llama.cpp, khi bạn đã có bản dựng hiện tại:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...và thêm --mmproj Qwen3.8-27B-mmproj-bf16.gguf nếu bạn cần hỗ trợ vision.

Ollama, nếu bạn muốn mục thư viện: ollama pull qwen3.8:27b, sau đó ollama run qwen3.8:27b. LM Studio và Unsloth Desktop tự động nhận mẫu trò chuyện và giảm tải RAM — chúng là con đường ít rắc rối nhất cho lần chạy đầu tiên.

Local vs API: bài toán kinh tế thật sự

GGUF là con đường miễn phí: chi phí biên bằng không, không giới hạn tần suất, không có gì rời khỏi máy của bạn. Xét về chi phí tuyệt đối thì đây không phải là con đường rẻ — bạn phải tự trang bị GPU 24GB (RTX 3090 đã qua sử dụng hoặc RTX 4090 mới, cộng thêm tiền điện), và một tệp 2-bit trên card 12GB là một trải nghiệm bị suy giảm.

Đường dẫn API tồn tại vì các trọng số được cấp phép Apache 2.0, nên chi phí biên phục vụ gần như bằng không và bất kỳ ai cũng có thể tự lưu trữ. Qwen3.8 27B đã hoạt động trên OrcaRouter hôm nay với giá $0.33 cho mỗi triệu token đầu vào và $2.40 cho mỗi triệu token đầu ra — giá niêm yết của nhà cung cấp được chuyển thẳng, không tăng phí — và vì trọng số mở, cũng có một gói miễn phí giới hạn tốc độ, tính $0 cho mỗi yêu cầu và trả về HTTP 429 khi bạn vượt quá hạn mức. Một tháng điển hình 10 triệu token, với 70% là đầu vào, tốn khoảng $9.51 ở gói trả phí. Nếu bạn đã sở hữu GPU, chạy cục bộ rẻ hơn về chi phí; nếu chưa, thuê token vẫn tốt hơn mua card cho một dự án phụ.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

Khi khuyến nghị này sai

Q4_K_M trên 24GB là lựa chọn mặc định, không phải là câu trả lời vạn năng. Hãy chọn thứ khác khi:

Bạn cần chất lượng tối đa trên máy chủ hoặc máy trạm — Q8_0 ở 29GB hoặc BF16 ở 54.7GB với CPU và RAM offload, không phải tệp 4-bit.

Bạn đang dùng card Blackwell RTX 50-series — biến thể NVFP4 nhanh hơn khoảng 1,5 lần trong cùng 24GB VRAM và sử dụng bộ đệm KV FP8 để xử lý ngữ cảnh dài hơn. Trên card 5090, NVFP4 đánh bại mọi GGUF trên model này.

Bạn cần toàn bộ ngữ cảnh 262K — hãy dự trù một bộ đệm khoảng 16GB bên cạnh trọng số; điều đó khiến một card 24GB phải giảm xuống Q3_K_M, hoặc buộc phải lượng tử hóa KV.

Bạn dựa vào giải mã suy đoán — hãy chọn gói ggml-org, vì nó giữ lại phần đầu dự đoán đa token; một số bản quantized sẽ loại bỏ nó để tiết kiệm khoảng 0,5GB.

Bạn chỉ có 12GB — một câu trả lời thẳng thắn: mô hình 2-bit 27B sẽ tệ hơn đáng kể so với cùng mô hình đó khi được chạy đúng cách. Hãy thử gói API miễn phí trước khi bạn quyết định dùng bản 2-bit cục bộ; nếu nó đủ tốt, GGUF có thể chờ cho đến khi phần cứng bắt kịp.

Kết luận

Qwen3.8 27B là phiên bản 27B hiếm hoi chạy vừa card 24GB mà không phải đánh đổi gì: bản tải Q4_K_M chỉ 17.1GB, bản build llama.cpp mới nhất, và KV cache rẻ đến mức ngữ cảnh dài gần như không tốn thêm chi phí. Hãy tải file đó nếu bạn sở hữu phần cứng phù hợp, nhớ rằng tính năng vision cần file mmproj riêng, và hãy đề phòng cái bẫy template ngay lần đầu một cuộc hội thoại nhiều lượt trông có vẻ mất trí nhớ. Nếu bạn không sở hữu phần cứng đó, mô hình tương tự có sẵn qua API với giá $0.33/$2.40, kèm một gói miễn phí giới hạn lượt gọi, nên chẳng có lý do gì để chạy một file 2-bit mà bạn không hài lòng. GGUF là con đường miễn phí; chỉ là không còn là con đường duy nhất nữa.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube