Một thẻ tiêu đề chính hiển thị Qwen3.8-27B với Unsloth, với phụ đề 'chạy, lượng tử hóa hoặc tinh chỉnh cục bộ', một biểu tượng cửa sổ terminal, và các chip hiển thị 'UD-Q4_K_XL 17.9GB' và 'Studio no-config'.
Guides & Insights

Qwen3.8-27B với Unsloth: Chạy, Lượng tử hóa hoặc Tinh chỉnh Cục bộ

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Có — Unsloth chạy được Qwen3.8 27B và đây là cách nhanh nhất để đưa mô hình Apache-2.0 mới của Ali​baba lên GPU của chính bạn. Toàn bộ câu trả lời gói gọn trong một dòng: mở Unsloth Studio, tìm kiếm "Qwen3.8 27B", chọn UD-Q4_K_XL (17.9GB) trên card 24GB, và trò chuyện trong chưa đầy một phút. Đằng sau cú nhấp chuột đó, Unsloth đã phát hành ba thứ trong cùng tuần khi các trọng số được tung ra (13–14 tháng 8, 2026): gói unsloth/Qwen3.8-27B-GGUF được xây dựng dựa trên kỹ thuật lượng tử hóa Unsloth Dynamic V3.0 (bản xem trước), hỗ trợ đầy đủ trong Unsloth Studio và Desktop, cùng với bản phát hành v0.1.800-beta có tính năng xuất GGUF, phát hiện imatrix và cải tiến khả năng khớp VRAM. Nó cũng tinh chỉnh mô hình — Unsloth tuyên bố huấn luyện nhanh gấp 2 lần với lượng VRAM ít hơn 70%. Qwen3.8 27B là mô hình thị giác-ngôn ngữ dense 27 tỷ tham số, có cơ chế chú ý lai chỉ giữ 16 trong số 64 lớp ở chế độ chú ý đầy đủ — đó là lý do vì sao tệp 4-bit có thể vừa trên các card mà hầu hết các mô hình 27B không thể.

Về nguồn thông tin: các thông số của mô hình là chính thức, từ thẻ mô hình Qwen3.8 27B trên Hugging Face, đã xác minh vào ngày 15 tháng 8 năm 2026. Hỗ trợ của Unsloth, kích thước lượng tử hóa, yêu cầu VRAM và các lệnh cài đặt được lấy từ ghi chú phát hành và tài liệu của Unsloth, cùng ngày. Giá API được lấy trực tiếp từ danh mục của OrcaRouter, cùng ngày. Các tuyên bố "nhanh hơn 2 lần, giảm 70% VRAM" và "mô hình mạnh nhất hiện nay so với kích thước của nó" của Unsloth là tuyên bố từ nhà cung cấp, chưa được xác minh độc lập.

'Qwen3.8 + Unsloth' có nghĩa là gì: bốn điều khác nhau

Unsloth là bốn thứ riêng biệt, và kết quả tìm kiếm theo từ khóa đã trộn lẫn chúng với nhau. Biết được bạn cần cái nào chính là một nửa của việc thiết lập:

unsloth/Qwen3.8-27B-GGUF — các tệp trọng số đã lượng tử hóa trên Hugging Face, 21 biến thể lượng tử cùng với một bộ chiếu thị giác. Được xây dựng bằng Dynamic V3.0 (bản xem trước), không phải Dynamic 2.0 cũ hơn (được công bố vào ngày 24 tháng 4 năm 2025 và có trước mô hình này). Đây là cách "tải xuống một tệp", có thể sử dụng với bất kỳ bản dựng llama.cpp nào.

Unsloth Studio — ứng dụng trình duyệt bạn cài đặt hoặc chạy từ một Hugging Face Space. Tìm kiếm model hub, nhấp vào một quant, trò chuyện với các công cụ. Không cần cấu hình thủ công template hoặc tham số suy luận.

Unsloth Desktop — ứng dụng GUI cục bộ dành cho macOS, Windows và Linux, gói gọn Studio và tính năng huấn luyện. Đây là nơi diễn ra quá trình tinh chỉnh "nhanh gấp 2 lần, tiết kiệm 70% VRAM".

Thư viện Python unsloth — from unsloth import FastLanguageModel, API tinh chỉnh QLoRA được sử dụng trong notebook và script.

Ghi chú phát hành của Unsloth cho v0.1.800-beta, có tựa đề "Release Qwen3.8 27B", cho biết Qwen3.8 27B và Qwen3.8-2.4T-A95B với 2,4 nghìn tỷ tham số "hiện có thể chạy cục bộ trong Unsloth", rằng bản 27B "chạy trên 17GB RAM nhờ Unsloth Dynamic GGUFs", và "bạn cũng có thể tinh chỉnh Qwen3.8 27B trong Unsloth". Cùng bản phát hành này bổ sung các phiên bản lượng tử hóa NVFP4, kiểm tra dung lượng ổ đĩa trước khi xuất GGUF, phát hiện hỗ trợ imatrix GGUF thực sự trong Studio, và giúp suy luận nhanh hơn tới 10% trên GGUF với giới hạn VRAM có thể tùy chỉnh.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

Chọn quant theo VRAM, đừng chọn theo cảm tính.

Bảng bộ nhớ của Unsloth tính theo tổng RAM cộng VRAM (hoặc bộ nhớ hợp nhất), và đây là hướng dẫn chính thức. Mô hình Qwen3.8 27B 4-bit cần 17–19GB; một chiếc RTX 4090 24GB, RTX 5080, hoặc Mac có bộ nhớ hợp nhất 24GB là mức tối thiểu thực tế cho thiết lập 4-bit thoải mái. Ba lựa chọn phù hợp với gần như tất cả mọi người:

12GB → UD-IQ2_XXS ở 9.0GB — tệp duy nhất vừa khớp toàn bộ; chất lượng sẽ giảm rõ rệt. Hãy lựa chọn điều này với sự hiểu biết đầy đủ.

16GB → UD-Q3_K_XL ở mức 13.4GB — tệp 3-bit tốt nhất, theo chính bộ chọn của Unsloth.

24GB → UD-Q4_K_XL ở mức 17.9GB — tệp 4-bit được khuyến nghị và câu trả lời mặc định của bài viết này.

48–64GB → UD-Q8_K_XL (31.5GB) — gần như không mất chất lượng trên trạm làm việc hoặc hệ thống hai GPU.

Toàn bộ chuỗi, từ danh sách tệp unsloth/Qwen3.8-27B-GGUF và tài liệu của Unsloth, cả hai đều được xác minh vào ngày 15 tháng 8 năm 2026: UD-Q8_K_XL 31.5GB, UD-Q6_K_XL 25.9GB, UD-Q5_K_XL 20.2GB, UD-Q4_K_XL 17.9GB, UD-Q3_K_XL 13.4GB, UD-Q2_K_XL 10.7GB, UD-IQ3_XXS 11.9GB, UD-IQ2_M 10.3GB, UD-IQ2_XXS 9.0GB. Các K-quant tiêu chuẩn (Q4_K_M 17.1GB, Q8_0 29.0GB) cũng có ở đó, và gói này đi kèm bộ chiếu thị giác (mmproj-BF16, 931MB) để hình ảnh và video hoạt động nếu bạn tải nó. Unsloth gọi toàn bộ chuỗi này là "Dynamic V3.0 (preview)" — mới hơn Dynamic 2.0 mà bạn sẽ thấy trong các bài viết cũ hơn, vốn được xây dựng cho các mô hình phát hành hơn một năm trước đó.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

Chạy nó với Unsloth trong ba phút

Cách một cú nhấp chuột: trên macOS hoặc Linux, chạy `curl -fsSL https://unsloth.ai/install.sh | sh`, rồi chạy `unsloth studio -p 8888` và mở `http://127.0.0.1:8888`. Trên Windows, chạy `irm https://unsloth.ai/install.ps1 | iex`. Nếu bạn muốn không cần cài đặt gì cả, Unsloth's Studio cũng được phát hành dưới dạng một Hugging Face Space — mở nó trong trình duyệt, tìm "Qwen3.8 27B", và chọn một bản quant theo bộ nhớ bạn có. Studio tự động tinh chỉnh các tham số lấy mẫu và mẫu chat, giảm tải sang RAM khi VRAM không đủ, và phát hiện các cấu hình đa GPU — phần "no-config" là có thật, và đây là cách nhanh nhất để chạy mô hình của tuần này.

Đường dẫn ưu tiên tệp, nếu bạn đã sử dụng llama.cpp: hãy tải một bản quant và chạy trực tiếp. Đây là các lệnh của riêng Unsloth, đã được xác minh theo tài liệu của họ:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Các giá trị sampling đó là cài đặt chế độ thinking được khuyến nghị trên model card. Trên card 16GB, hãy đổi glob --include thành *UD-Q3_K_XL*, và thêm --mmproj trỏ đến tệp mmproj-BF16.gguf của bộ pack nếu bạn cần vision. Một điểm cần lưu ý: llama.cpp phải là bản build mới nhất — tệp này đăng ký kiến trúc qwen35 mới, và mọi phiên bản từ trước tuần phát hành sẽ từ chối tải nó.

Tinh chỉnh nó bằng Unsloth

Tinh chỉnh chính là nơi Unsloth tạo dựng danh tiếng: thư viện này tuyên bố huấn luyện nhanh gấp 2 lần và giảm 70% VRAM so với Transformers + PEFT tiêu chuẩn, điều này khiến QLoRA trên mô hình 27B khả thi trên một card đồ họa tiêu dùng. Điểm vào tinh chỉnh là repository thông thường unsloth/Qwen3.8-27B (trang file safetensors, 28B) thay vì bộ GGUF. Mẫu QLoRA chuẩn của Unsloth, áp dụng cho mô hình này:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

sau đó là một vòng lặp trl.SFTTrainer tiêu chuẩn trên tập dữ liệu của bạn. Đoạn mã đó là mẫu QLoRA tiêu chuẩn từ tài liệu của Unsloth — các tuyên bố về benchmark huấn luyện là của riêng Unsloth, không phải thứ tôi tái tạo — và có hai lưu ý áp dụng: kernel của Unsloth vá các lớp transformer văn bản, vì vậy hãy lên kế hoạch xử lý bộ mã hóa thị giác riêng biệt, và giữ gói unsloth ở bản phát hành hiện tại vì kiến trúc này mới chỉ ra đời vài ngày, việc lệch phiên bản sẽ gây lỗi rõ ràng.

Những gì Unsloth Studio xử lý thay bạn

{{1}}Tự tay chạy một GGUF đòi hỏi phải khéo léo cân bằng giữa kích thước ngữ cảnh, giảm tải RAM và gọi công cụ.{{/1}} {{2}}Studio rút gọn tất cả điều đó thành các cài đặt mặc định:{{/2}} {{3}}nó điều chỉnh kích thước ngữ cảnh theo bộ nhớ thực sự còn trống,{{/3}} {{4}}dỡ các mô hình thị giác nhàn rỗi để dành VRAM cho trò chuyện hoặc huấn luyện,{{/4}} {{5}}tự nhận diện các cấu hình nhiều GPU,{{/5}} {{6}}và thiết lập sẵn tính năng tìm kiếm web, thực thi mã và kết nối agent (Claude Code, Codex, MCP).{{/6}} {{7}}Bản phát hành v0.1.800-beta cũng siết chặt những phần gây khó chịu trong thực tế: xuất GGUF hiện kiểm tra dung lượng đĩa trước khi bắt đầu một thao tác merge lâu thay vì thất bại giữa chừng; Studio xác định xem GGUF mà nó xuất ra có thực sự hỗ trợ imatrix hay không (để bạn không lãng phí một lần chạy); và các cơ chế bảo vệ bộ nhớ không còn dự trữ quá mức bộ nhớ GPU.{{/7}} {{8}}Với một mô hình mới chỉ ra đời ba ngày, "no-config" đang thực sự phát huy tác dụng.{{/8}}

Miễn phí cục bộ so với trả phí API: nền kinh tế thực tế

Sự khác biệt cốt lõi giữa Unsloth và một API không phải là chất lượng — mà là ai sở hữu phần cứng. Unsloth là con đường miễn phí: chi phí biên bằng 0 cho mỗi token, không có gì rời khỏi máy của bạn, không giới hạn tốc độ, và toàn quyền kiểm soát trọng số. Nó không miễn phí theo nghĩa tuyệt đối: bạn phải cung cấp GPU và điện năng, và một tệp 2-bit trên thẻ 12GB là một trải nghiệm bị xâm phạm. Qwen3.8 27B là mô hình dày đặc và có khả năng xử lý thị giác, vì vậy ở mức 4-bit là 17,9GB trọng số trước khi tính context; chiếc máy chính là cái giá để bước vào.

API route tồn tại vì trọng số được cấp phép Apache-2.0, nên bất kỳ ai cũng có thể lưu trữ chúng với chi phí biên gần bằng không. Qwen3.8 27B có mặt trong danh mục của OrcaRouter hôm nay với mức $0.33 cho mỗi triệu token đầu vào và $2.40 cho mỗi triệu token đầu ra, mô hình tự lưu trữ trên cơ sở hạ tầng của chúng tôi — không có giá nhà cung cấp phải chuyển qua — với ngữ cảnh 262K token và đầu vào văn bản, hình ảnh, và video. Vì trọng số mở, cũng có một tầng miễn phí giới hạn tốc độ tính $0 mỗi yêu cầu. Một tháng 10 triệu token điển hình với 70% token đầu vào có chi phí khoảng $9.51 ở gói trả phí. Nếu bạn đã có card 24GB, chạy cục bộ thắng về chi phí; nếu không, thuê token với mức giá đó tốt hơn mua card cho một dự án phụ, và tầng miễn phí là cách trung thực để thử nghiệm mô hình trước khi bạn đầu tư vào phần cứng.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Khi Unsloth là câu trả lời sai

Unsloth Studio và bộ GGUF là lựa chọn đúng cho một máy duy nhất. Chúng là lựa chọn sai khi:

Bạn sở hữu một card dòng Blackwell RTX 50-series. Các phiên bản lượng tử hóa unsloth/Qwen3.8-27B-NVFP4 nhanh hơn khoảng 1,5 lần so với BF16 trong cùng VRAM và sử dụng bộ đệm KV FP8 để có ngữ cảnh dài hơn. Cách đó chạy qua vLLM hoặc SGLang, không phải GGUF và cũng không phải Studio.

Bạn cần cửa sổ native đầy đủ 262K hoặc bản mở rộng YaRN 1M trong môi trường sản xuất. Mô hình thị giác dày đặc với ngữ cảnh dài rất nặng; Unsloth có thể điều chỉnh kích thước ngữ cảnh để chạy ngắn hơn cho bạn, nhưng một hệ thống phục vụ có quản lý KV đúng cách sẽ tốt hơn ứng dụng cục bộ.

Bạn đang phục vụ nhiều người dùng. Unsloth là một ứng dụng cục bộ và thư viện tinh chỉnh, không phải máy chủ đa người thuê. Để có khả năng đồng thời, tự động mở rộng và đảm bảo thời gian hoạt động, bạn muốn một endpoint được lưu trữ.

Bạn hoàn toàn không có GPU. Thành thật mà nói: mô hình 27B chạy 2-bit trên card 12GB sẽ tệ hơn đáng kể so với cùng mô hình đó được phục vụ đúng cách. Hãy dùng gói API miễn phí trước; nếu đủ tốt, hãy mua phần cứng khi nhu cầu sử dụng đã được xác nhận.

Bạn muốn tinh chỉnh phần thị giác. Khả năng tăng tốc của Unsloth nhắm vào các lớp transformer văn bản; việc tinh chỉnh đa phương thức đầy đủ cần một stack khác.

Kết luận

Qwen3.8 27B với Unsloth là một bài toán đã được giải quyết trong tuần này: cài đặt Studio, chọn UD-Q4_K_XL cho card 24GB (UD-Q3_K_XL cho 16GB, UD-IQ2_XXS cho 12GB), và mô hình chạy mà không cần cấu hình và không tính phí theo token. Con đường tinh chỉnh là có thật và tuyên bố tốc độ của Unsloth là lý do khiến QLoRA 27B khả thi trên một card. Hãy biết rằng thang lượng tử là Dynamic V3.0 (bản xem trước), không phải Dynamic 2.0 mà các bài viết cũ mô tả; giữ llama.cpp mới nhất; và nếu bạn không sở hữu phần cứng, các trọng số tương tự có sẵn qua API với giá $0.33/$2.40 kèm bậc miễn phí giới hạn tốc độ — vì vậy không có lý do gì để chạy một file 2-bit mà bạn không hài lòng. Chạy cục bộ là con đường miễn phí, và lần đầu tiên ở phân khúc trọng lượng này, nó cũng là con đường dễ dàng.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube