Thẻ tiêu đề cho bài viết 'Yêu cầu VRAM của Qwen3.8-27B' hiển thị chip GPU với nhãn bộ nhớ ~17 GB và huy hiệu lượng tử hóa cho Q4_K_M, Q6_K và Q8_0.
Guides & Insights

Qwen3.8-27B Yêu cầu VRAM: Bạn thực sự cần bao nhiêu phần cứng

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Khoảng 17 GB VRAM là con số đang được nhắc đến cho Qwen3.8-27B — Daniel Han của Unsloth cho biết mô hình này "dự kiến sẽ khớp trong khoảng 17GB VRAM khi ra mắt" — và cần phải chính xác về điều đó là gì và không phải là gì. Đây là một dự đoán dựa trên phiên bản tiền nhiệm của 27B, không phải thông số kỹ thuật từ Alibaba, vì mô hình vẫn chưa được phát hành; kho lưu trữ chính thức được hứa hẹn sẽ ra mắt trong tuần ngày 10 tháng 8 năm 2026 và đã không xuất hiện tại thời điểm viết bài. Bài viết này phân loại câu hỏi về VRAM thành những gì bạn có thể lên kế hoạch, những gì thực sự không chắc chắn, và con số đó thay đổi như thế nào theo lượng tử hóa, cửa sổ ngữ cảnh và thời gian chạy của bạn.

Câu trả lời trung thực trước tiên

{{1}}Hiện chưa có thông số kỹ thuật phần cứng chính thức nào cho Qwen3.8-27B{{/1}}. Mọi thứ dưới đây được {{2}}suy ra từ Qwen3.6-27B{{/2}}, mô hình mà bản 27B kế thừa — {{3}}cùng số tham số, cùng kiến trúc lai khả dĩ, và là thứ gần nhất hiện có để tham chiếu kích thước{{/3}}. Hãy coi các con số này là {{4}}một khung hoạch định, không phải bảng yêu cầu{{/4}}. Các phép đo thực tế đầu tiên sẽ đến từ các nhà phát triển công cụ lượng tử hóa và khung suy luận {{5}}trong vòng vài ngày sau khi bộ trọng số được phát hành{{/5}}, và {{6}}đó chính là những con số để bạn chốt quyết định mua hàng{{/6}}.

Thang định lượng

Dung lượng VRAM bạn cần gần như hoàn toàn phụ thuộc vào kiểu quantization bạn chạy. Bắt đầu tính từ bảng Qwen3.6-27B do cộng đồng đo được:

• Q4_K_M — khoảng 16 GB VRAM. Điểm tối ưu cho card 24 GB, và có khả năng là nguồn gốc của con số "17 GB" đó. Mặc định của hầu hết các nhóm.

• {{1}}Q3_K_M / IQ3{{/1}} — {{2}}khoảng 13 GB VRAM. Phù hợp với card 16 GB và cả card 12 GB, kèm theo mức giảm chất lượng rõ rệt.{{/2}}

• Q6_K — khoảng 21 GB VRAM. Gần như không mất dữ liệu, và vừa khít nhưng thực sự phù hợp trên card 24 GB.

• Q8_0 — khoảng 27–30 GB VRAM. Dành cho card 48 GB khi bạn muốn tận dụng tối đa chất lượng.

• Phục vụ FP8 — khoảng 27 GB VRAM cho trọng số, đó là lý do vì sao một L40S duy nhất là lựa chọn GPU suy luận phổ biến.

• Độ chính xác đầy đủ (BF16) — khoảng 54 GB VRAM. Thực tế là một card thuộc phân khúc H100, và là mức mà người ta không còn gọi nó là "local" nữa.

Tóm lại: GPU 24 GB là lựa chọn an toàn cho mô hình này, card 16 GB chỉ chạy được nếu bạn chấp nhận các mức lượng tử hóa thấp, và mọi thứ từ 8 GB trở xuống đều không dùng được trừ khi mô hình này hóa ra gọn nhẹ hơn đáng kể so với phiên bản tiền nhiệm.

An infographic titled 'Qwen3.8-27B - the quant ladder' listing six quantization tiers with VRAM figures: Q3_K_M ~13 GB, Q4_K_M ~16 GB, Q6_K ~21 GB, Q8_0 ~27-30 GB, FP8 serving ~27 GB, BF16 full ~54 GB, with the Q4_K_M row highlighted as the sweet spot for 24 GB cards.

Biến mà không ai trích dẫn: độ dài ngữ cảnh

Mọi con số nêu trên đều dành cho một {{1}}ngữ cảnh khiêm tốn{{/1}}. VRAM tăng theo ngữ cảnh vì {{2}}KV cache{{/2}} phải nằm cùng với các trọng số. Trên {{3}}Qwen3.6-27B{{/3}}, một ngữ cảnh 2K tốn khoảng {{4}}11 GB{{/4}}, một ngữ cảnh {{5}}32K{{/5}} đẩy cùng quant đó vượt mức {{6}}14 GB{{/6}}, và {{7}}128K{{/7}} khiến mức chiếm dụng cache tăng hơn gấp đôi. Nếu {{8}}Qwen3.8-27B{{/8}} duy trì một cửa sổ ngữ cảnh native lớn — và thế hệ {{9}}Qwe​n{{/9}} đang có xu hướng như vậy — hãy dự trù thêm vài GB dung lượng dự phòng ngoài kích thước quant, hoặc giới hạn ngữ cảnh trong cấu hình runtime của bạn. Việc chọn một độ dài ngữ cảnh mà bạn không thực sự dùng đến là cách phổ biến nhất khiến các đội cuối cùng phải mua một {{10}}card lớn hơn mức cần thiết{{/10}}.

Ký tự đại diện kiến trúc lai

Qwen3.6-27B là một mô hình lai: chỉ 16 trong số 65 lớp của nó sử dụng bộ đệm KV truyền thống, trong khi 48 lớp sử dụng trạng thái hồi quy cố định. Kết quả là bộ nhớ KV giảm khoảng bốn lần so với mô hình đặc có cùng kích thước — đây là lý do chính khiến một mô hình 27B có thể chạy trên card 24 GB thay vì 48 GB. Nếu Qwen3.8-27B giữ thiết kế lai (có khả năng, nhưng chưa được xác nhận), phép tính độ dài ngữ cảnh ở trên sẽ trở nên dễ chịu hơn so với vẻ bề ngoài. Điểm hạn chế là hỗ trợ thời gian chạy: một bản dựng llama.cpp hoặc vLLM không triển khai các lớp hồi quy sẽ báo cáo mức sử dụng bộ nhớ cao hơn nhiều. Hãy kiểm tra thời gian chạy nào đã hợp nhất hỗ trợ trước khi giả định rằng các dự đoán đó vẫn đúng.

GPU nào thực sự hoạt động

Cụ thể, đối với các lá bài thông thường:

• RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M thoải mái, Q6_K nếu bạn sẵn sàng ép thêm. Đây chính là đối tượng mà dòng sản phẩm này hướng tới.

RTX 3060 / 4060 Ti 16 GB — chỉ dùng lượng tử hóa IQ4 hoặc nhóm Q3, với ngữ cảnh hạn chế. Dùng được, nhưng không dễ chịu.

• Card 12 GB — Q3_K_M với chất lượng giảm. Tốt cho thử nghiệm, không phải để phục vụ.

• Apple Silicon — một chiếc Mac 24 GB chạy được cùng các tệp Q4 qua MLX hoặc llama.cpp; các mô hình cơ bản 16 GB bị hoán đổi liên tục và gần như không dùng được, giống như trường hợp của Qwen3.6-27B.

• 48 GB trở lên (A6000, L40S, cấu hình hai card) — phục vụ Q8_0 hoặc FP8 với dư địa thực sự.

An infographic titled 'Context vs VRAM' comparing the same Q4 quant at 2K context (~11 GB) versus 32K context (~14 GB+), with a tip box advising to cap context at what you actually use.

Hoặc bỏ qua GPU hoàn toàn

Nếu bài toán phần cứng không khả thi với bạn, thì mô hình cũng không nhất thiết phải như vậy. OrcaRouter là một API duy nhất cho phép truy cập hơn 200 mô hình — bao gồm cả gia đình Qwe​n — và nó chuyển tiếp giá niêm yết của nhà cung cấp mà không cộng thêm bất kỳ khoản phụ phí nào, vì vậy Qwen3.8-Max hiện có giá $2.00 cho mỗi triệu token đầu vào và $6.00 cho mỗi triệu token đầu ra, giống hệt như trên trang giá của chính nhà cung cấp. Bản thân mô hình 27B sẽ là một mô hình cục bộ, nhưng khi trọng số của nó được phát hành và tạo được sự tin tưởng, cùng một khóa API sẽ định tuyến đến bất kỳ nhà cung cấp nào lưu trữ nó — bạn có thể xây dựng ứng dụng dựa trên thế hệ này ngay bây giờ mà không bao giờ phải động đến thị trường bán lại GPU.

OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the NEW FEATURED badge, Vision and Tools capabilities, $2.00 per million input tokens and $6.00 per million output tokens, a p50 time-to-first-token of 4.84 seconds, a 1M-token context window, and OpenAI-compatible API code samples.

Kết luận cho câu hỏi về phần cứng: hãy tính 16 GB để chạy 4-bit một cách thoải mái, 24 GB để an toàn và có dư địa cho ngữ cảnh cũng như các mức quant cao hơn, đồng thời coi mọi con số ở đây chỉ là tạm thời cho đến khi repository được công bố và những phép đo thực tế đầu tiên xuất hiện. Con số dự kiến "17 GB" là một con số hợp lý để lên kế hoạch — chỉ là nó chưa phải là sự thật.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube