
Qwen3.8-27B GGUF: Nên tải bản Quant nào cho GPU của bạn?
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 143 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 293 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Tải bộ unsloth/Qwen3.8-27B-GGUF và khớp tệp với card bạn thực sự sở hữu. Đó chính là toàn bộ câu trả lời: một GPU 24GB (RTX 4090 hoặc 3090) nên tải bản Q4_K_M 17.1GB; một GPU 16GB nên tải bản IQ4_XS 15.7GB (hoặc bản Q3_K_M 13.8GB nếu bạn muốn có thêm không gian context); một GPU 12GB bị giới hạn ở các tệp 2-bit, bản UD-IQ2_XXS 9.0GB, và đó là một sự đánh đổi có ý thức. Qwen3.8 27B — mô hình dense 27 tỷ tham số của Alibaba, trọng số Apache 2.0 được phát hành ngày 13–14 tháng 8 năm 2026 — chạy rẻ đến bất ngờ trên máy local vì cơ chế hybrid attention của nó chỉ lưu cache 16 trên 64 lớp, nên một bản lượng tử 4-bit trên GPU 24GB có thể thoải mái xử lý ngữ cảnh 32K–64K token. Và GGUF là con đường duy nhất có chi phí biên bằng không: không cần API key, không phí theo token, không có dữ liệu rời khỏi máy của bạn.
Về nguồn thông tin: kiến trúc, cửa sổ ngữ cảnh và giấy phép là chính thức, từ thẻ mô hình Qwen3.8 27B trên Hugging Face, đã xác minh vào ngày 15 tháng 8 năm 2026. Các kích thước GGUF được lấy từ kho lưu trữ GGUF của unsloth và ggml-org, cùng ngày. Hướng dẫn về dung lượng VRAM trên mỗi GPU là khuyến nghị chính thức của unsloth. Các ước tính byte về bộ đệm KV và các con số token mỗi giây do cộng đồng đo lường trong những ngày đầu sau khi phát hành, không phải thông số của nhà cung cấp. Mọi điểm chuẩn được nêu dưới đây đều do Alibaba công bố và chưa được tái lập.
Trình chọn tệp, mỗi dòng một quant
• UD-IQ2_XXS — 9.0GB — lựa chọn duy nhất phù hợp thoải mái cho thẻ 12GB; dự kiến sẽ thấy giảm chất lượng rõ rệt.
• UD-Q2_K_XL — 10.7GB — thẻ 12GB, gần như không còn ngữ cảnh nào để dư.
• Q3_K_M — 13.8GB — dành cho card 16GB muốn có thêm khoảng trống context.
• IQ4_XS — 15.7GB — card 16GB: lượng tử hóa lớn nhất có thể nằm gọn.
• Q4_K_M — 17.1GB — các card 24GB: lựa chọn tối ưu, và là tệp mà bài viết này hướng bạn đến.
• Q5_K_M — 19.8GB — 24GB, đánh đổi không gian ngữ cảnh để có được chất lượng tốt hơn một chút.
• Q6_K — 22.9GB — nằm gọn trong 24GB nếu nén; gần như không mất dữ liệu.
• Q8_0 — 29.0GB — 32GB, chia trên hai card, hoặc giảm tải CPU.
• BF16 — 54.7GB — dành cho card máy chủ và cấu hình CPU có RAM lớn; độ chính xác tham chiếu.
Hai gói, hai kích thước Q4_K_M: bản của unsloth là 17,1GB; bản của ggml-org là 19,0GB. Gói unsloth sử dụng phương pháp lượng tử hóa Dynamic V3.0 (bản xem trước) cho các tệp UD-* và là gói được hầu hết các ứng dụng cục bộ chọn mặc định; gói ggml-org cung cấp các K-quants tiêu chuẩn cùng với đầu dự đoán đa token riêng biệt dùng cho giải mã suy đoán. Cả hai Q4_K_M đều hoạt động — khác biệt chỉ là vài trăm megabyte và tệp MTP.

Tại sao 27B này lại vừa trên các card nhỏ hơn hầu hết
Qwen3.8 27B có 64 lớp, nhưng chỉ 16 lớp sử dụng full attention. 48 lớp còn lại sử dụng Gated DeltaNet linear attention, vốn duy trì một recurrent state có kích thước cố định thay vì một key-value cache ngày càng tăng. Bố cục khối trong model card là 3×(Gated DeltaNet → FFN) cho mỗi 1×(Gated Attention → FFN) — tỷ lệ hybrid 3:1. Hiệu quả thực tế: KV cache chỉ bằng khoảng một phần tư so với những gì một mô hình dense 27B thông thường cần cho cùng độ dài ngữ cảnh. Các phép đo từ cộng đồng trong tuần này cho thấy cache ở mức khoảng 0,5GB với ngữ cảnh 8K, 2,0GB ở 32K và 16,4GB ở cửa sổ native đầy đủ 262K. Điều này đảo ngược lời khuyên thông thường — phần lớn ngân sách VRAM dành cho trọng số, không phải ngữ cảnh, và một card 24GB có thể chạy Q4_K_M với ngữ cảnh 64K–96K mà không phải lo lắng. Bạn có thể thu nhỏ cache hơn nữa bằng cờ --cache-type-k của llama.cpp, vốn lượng tử hóa chính cache.

Ba cạm bẫy sẽ khiến bạn vấp ngã ngay trong ngày đầu tiên
• Các bản dựng llama.cpp cũ từ chối tệp này. GGUF đăng ký kiến trúc qwen35 mới, vì vậy bạn cần bản dựng hiện tại — bất kỳ bản nào trước tuần phát hành đều từ chối tải tệp với lỗi kiến trúc. Hãy cập nhật llama.cpp trước tiên, trước khi bạn tải xuống.
• Bẫy template.Chat template Jinja chính thức bọc mỗi lượt phản hồi của trợ lý trong một khối think ngay cả khi dấu vết suy luận trống, gây ra các khối lồng nhau và lịch sử bị cắt cụt trong các cuộc trò chuyện nhiều lượt — trông như thể mô hình đã quên mất những gì bạn nói. Hãy chạy llama.cpp với cờ --jinja và ưu tiên một pack đi kèm chat_template.jinja đã được sửa.
• Thị giác cần một tệp riêng. Văn bản hoạt động ngay; hình ảnh và video sẽ âm thầm không hoạt động trừ khi bạn cũng tải projector mmproj, khoảng 0,9GB. Nó không được liệt kê trên trang kho GGUF của unsloth — hãy lấy từ kho lưu trữ cơ sở hoặc gói ggml-org. Nếu bạn định đưa tài liệu hoặc ảnh chụp màn hình, hãy thêm --mmproj vào lệnh máy chủ.
Chạy nó: các lệnh
llama.cpp, khi bạn đã có bản dựng hiện tại:
llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0
...và thêm --mmproj Qwen3.8-27B-mmproj-bf16.gguf nếu bạn cần hỗ trợ vision.
Ollama, nếu bạn muốn mục thư viện: ollama pull qwen3.8:27b, sau đó ollama run qwen3.8:27b. LM Studio và Unsloth Desktop tự động nhận mẫu trò chuyện và giảm tải RAM — chúng là con đường ít rắc rối nhất cho lần chạy đầu tiên.
Local vs API: bài toán kinh tế thật sự
GGUF là con đường miễn phí: chi phí biên bằng không, không giới hạn tần suất, không có gì rời khỏi máy của bạn. Xét về chi phí tuyệt đối thì đây không phải là con đường rẻ — bạn phải tự trang bị GPU 24GB (RTX 3090 đã qua sử dụng hoặc RTX 4090 mới, cộng thêm tiền điện), và một tệp 2-bit trên card 12GB là một trải nghiệm bị suy giảm.
Đường dẫn API tồn tại vì các trọng số được cấp phép Apache 2.0, nên chi phí biên phục vụ gần như bằng không và bất kỳ ai cũng có thể tự lưu trữ. Qwen3.8 27B đã hoạt động trên OrcaRouter hôm nay với giá $0.33 cho mỗi triệu token đầu vào và $2.40 cho mỗi triệu token đầu ra — giá niêm yết của nhà cung cấp được chuyển thẳng, không tăng phí — và vì trọng số mở, cũng có một gói miễn phí giới hạn tốc độ, tính $0 cho mỗi yêu cầu và trả về HTTP 429 khi bạn vượt quá hạn mức. Một tháng điển hình 10 triệu token, với 70% là đầu vào, tốn khoảng $9.51 ở gói trả phí. Nếu bạn đã sở hữu GPU, chạy cục bộ rẻ hơn về chi phí; nếu chưa, thuê token vẫn tốt hơn mua card cho một dự án phụ.

Khi khuyến nghị này sai
Q4_K_M trên 24GB là lựa chọn mặc định, không phải là câu trả lời vạn năng. Hãy chọn thứ khác khi:
• Bạn cần chất lượng tối đa trên máy chủ hoặc máy trạm — Q8_0 ở 29GB hoặc BF16 ở 54.7GB với CPU và RAM offload, không phải tệp 4-bit.
• Bạn đang dùng card Blackwell RTX 50-series — biến thể NVFP4 nhanh hơn khoảng 1,5 lần trong cùng 24GB VRAM và sử dụng bộ đệm KV FP8 để xử lý ngữ cảnh dài hơn. Trên card 5090, NVFP4 đánh bại mọi GGUF trên model này.
• Bạn cần toàn bộ ngữ cảnh 262K — hãy dự trù một bộ đệm khoảng 16GB bên cạnh trọng số; điều đó khiến một card 24GB phải giảm xuống Q3_K_M, hoặc buộc phải lượng tử hóa KV.
• Bạn dựa vào giải mã suy đoán — hãy chọn gói ggml-org, vì nó giữ lại phần đầu dự đoán đa token; một số bản quantized sẽ loại bỏ nó để tiết kiệm khoảng 0,5GB.
• Bạn chỉ có 12GB — một câu trả lời thẳng thắn: mô hình 2-bit 27B sẽ tệ hơn đáng kể so với cùng mô hình đó khi được chạy đúng cách. Hãy thử gói API miễn phí trước khi bạn quyết định dùng bản 2-bit cục bộ; nếu nó đủ tốt, GGUF có thể chờ cho đến khi phần cứng bắt kịp.
Điểm mấu chốt
Qwen3.8 27B là phiên bản 27B hiếm hoi chạy vừa card 24GB mà không phải đánh đổi gì: bản tải Q4_K_M chỉ 17.1GB, bản build llama.cpp mới nhất, và KV cache rẻ đến mức ngữ cảnh dài gần như không tốn thêm chi phí. Hãy tải file đó nếu bạn sở hữu phần cứng phù hợp, nhớ rằng tính năng vision cần file mmproj riêng, và hãy đề phòng cái bẫy template ngay lần đầu một cuộc hội thoại nhiều lượt trông có vẻ mất trí nhớ. Nếu bạn không sở hữu phần cứng đó, mô hình tương tự có sẵn qua API với giá $0.33/$2.40, kèm một gói miễn phí giới hạn lượt gọi, nên chẳng có lý do gì để chạy một file 2-bit mà bạn không hài lòng. GGUF là con đường miễn phí; chỉ là không còn là con đường duy nhất nữa.
