
Qwen3.8-27B Yêu cầu VRAM: Bạn thực sự cần bao nhiêu phần cứng
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 2382 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
Khoảng 17 GB VRAM là con số đang được nhắc đến cho Qwen3.8-27B — Daniel Han của Unsloth cho biết mô hình này "dự kiến sẽ khớp trong khoảng 17GB VRAM khi ra mắt" — và cần phải chính xác về điều đó là gì và không phải là gì. Đây là một dự đoán dựa trên phiên bản tiền nhiệm của 27B, không phải thông số kỹ thuật từ Alibaba, vì mô hình vẫn chưa được phát hành; kho lưu trữ chính thức được hứa hẹn sẽ ra mắt trong tuần ngày 10 tháng 8 năm 2026 và đã không xuất hiện tại thời điểm viết bài. Bài viết này phân loại câu hỏi về VRAM thành những gì bạn có thể lên kế hoạch, những gì thực sự không chắc chắn, và con số đó thay đổi như thế nào theo lượng tử hóa, cửa sổ ngữ cảnh và thời gian chạy của bạn.
Câu trả lời trung thực trước tiên
{{1}}Hiện chưa có thông số kỹ thuật phần cứng chính thức nào cho Qwen3.8-27B{{/1}}. Mọi thứ dưới đây được {{2}}suy ra từ Qwen3.6-27B{{/2}}, mô hình mà bản 27B kế thừa — {{3}}cùng số tham số, cùng kiến trúc lai khả dĩ, và là thứ gần nhất hiện có để tham chiếu kích thước{{/3}}. Hãy coi các con số này là {{4}}một khung hoạch định, không phải bảng yêu cầu{{/4}}. Các phép đo thực tế đầu tiên sẽ đến từ các nhà phát triển công cụ lượng tử hóa và khung suy luận {{5}}trong vòng vài ngày sau khi bộ trọng số được phát hành{{/5}}, và {{6}}đó chính là những con số để bạn chốt quyết định mua hàng{{/6}}.
Thang định lượng
Dung lượng VRAM bạn cần gần như hoàn toàn phụ thuộc vào kiểu quantization bạn chạy. Bắt đầu tính từ bảng Qwen3.6-27B do cộng đồng đo được:
• Q4_K_M — khoảng 16 GB VRAM. Điểm tối ưu cho card 24 GB, và có khả năng là nguồn gốc của con số "17 GB" đó. Mặc định của hầu hết các nhóm.
• {{1}}Q3_K_M / IQ3{{/1}} — {{2}}khoảng 13 GB VRAM. Phù hợp với card 16 GB và cả card 12 GB, kèm theo mức giảm chất lượng rõ rệt.{{/2}}
• Q6_K — khoảng 21 GB VRAM. Gần như không mất dữ liệu, và vừa khít nhưng thực sự phù hợp trên card 24 GB.
• Q8_0 — khoảng 27–30 GB VRAM. Dành cho card 48 GB khi bạn muốn tận dụng tối đa chất lượng.
• Phục vụ FP8 — khoảng 27 GB VRAM cho trọng số, đó là lý do vì sao một L40S duy nhất là lựa chọn GPU suy luận phổ biến.
• Độ chính xác đầy đủ (BF16) — khoảng 54 GB VRAM. Thực tế là một card thuộc phân khúc H100, và là mức mà người ta không còn gọi nó là "local" nữa.
Tóm lại: GPU 24 GB là lựa chọn an toàn cho mô hình này, card 16 GB chỉ chạy được nếu bạn chấp nhận các mức lượng tử hóa thấp, và mọi thứ từ 8 GB trở xuống đều không dùng được trừ khi mô hình này hóa ra gọn nhẹ hơn đáng kể so với phiên bản tiền nhiệm.

Biến mà không ai trích dẫn: độ dài ngữ cảnh
Mọi con số nêu trên đều dành cho một {{1}}ngữ cảnh khiêm tốn{{/1}}. VRAM tăng theo ngữ cảnh vì {{2}}KV cache{{/2}} phải nằm cùng với các trọng số. Trên {{3}}Qwen3.6-27B{{/3}}, một ngữ cảnh 2K tốn khoảng {{4}}11 GB{{/4}}, một ngữ cảnh {{5}}32K{{/5}} đẩy cùng quant đó vượt mức {{6}}14 GB{{/6}}, và {{7}}128K{{/7}} khiến mức chiếm dụng cache tăng hơn gấp đôi. Nếu {{8}}Qwen3.8-27B{{/8}} duy trì một cửa sổ ngữ cảnh native lớn — và thế hệ {{9}}Qwen{{/9}} đang có xu hướng như vậy — hãy dự trù thêm vài GB dung lượng dự phòng ngoài kích thước quant, hoặc giới hạn ngữ cảnh trong cấu hình runtime của bạn. Việc chọn một độ dài ngữ cảnh mà bạn không thực sự dùng đến là cách phổ biến nhất khiến các đội cuối cùng phải mua một {{10}}card lớn hơn mức cần thiết{{/10}}.
Ký tự đại diện kiến trúc lai
Qwen3.6-27B là một mô hình lai: chỉ 16 trong số 65 lớp của nó sử dụng bộ đệm KV truyền thống, trong khi 48 lớp sử dụng trạng thái hồi quy cố định. Kết quả là bộ nhớ KV giảm khoảng bốn lần so với mô hình đặc có cùng kích thước — đây là lý do chính khiến một mô hình 27B có thể chạy trên card 24 GB thay vì 48 GB. Nếu Qwen3.8-27B giữ thiết kế lai (có khả năng, nhưng chưa được xác nhận), phép tính độ dài ngữ cảnh ở trên sẽ trở nên dễ chịu hơn so với vẻ bề ngoài. Điểm hạn chế là hỗ trợ thời gian chạy: một bản dựng llama.cpp hoặc vLLM không triển khai các lớp hồi quy sẽ báo cáo mức sử dụng bộ nhớ cao hơn nhiều. Hãy kiểm tra thời gian chạy nào đã hợp nhất hỗ trợ trước khi giả định rằng các dự đoán đó vẫn đúng.
GPU nào thực sự hoạt động
Cụ thể, đối với các lá bài thông thường:
• RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M thoải mái, Q6_K nếu bạn sẵn sàng ép thêm. Đây chính là đối tượng mà dòng sản phẩm này hướng tới.
RTX 3060 / 4060 Ti 16 GB — chỉ dùng lượng tử hóa IQ4 hoặc nhóm Q3, với ngữ cảnh hạn chế. Dùng được, nhưng không dễ chịu.
• Card 12 GB — Q3_K_M với chất lượng giảm. Tốt cho thử nghiệm, không phải để phục vụ.
• Apple Silicon — một chiếc Mac 24 GB chạy được cùng các tệp Q4 qua MLX hoặc llama.cpp; các mô hình cơ bản 16 GB bị hoán đổi liên tục và gần như không dùng được, giống như trường hợp của Qwen3.6-27B.
• 48 GB trở lên (A6000, L40S, cấu hình hai card) — phục vụ Q8_0 hoặc FP8 với dư địa thực sự.

Hoặc bỏ qua GPU hoàn toàn
Nếu bài toán phần cứng không khả thi với bạn, thì mô hình cũng không nhất thiết phải như vậy. OrcaRouter là một API duy nhất cho phép truy cập hơn 200 mô hình — bao gồm cả gia đình Qwen — và nó chuyển tiếp giá niêm yết của nhà cung cấp mà không cộng thêm bất kỳ khoản phụ phí nào, vì vậy Qwen3.8-Max hiện có giá $2.00 cho mỗi triệu token đầu vào và $6.00 cho mỗi triệu token đầu ra, giống hệt như trên trang giá của chính nhà cung cấp. Bản thân mô hình 27B sẽ là một mô hình cục bộ, nhưng khi trọng số của nó được phát hành và tạo được sự tin tưởng, cùng một khóa API sẽ định tuyến đến bất kỳ nhà cung cấp nào lưu trữ nó — bạn có thể xây dựng ứng dụng dựa trên thế hệ này ngay bây giờ mà không bao giờ phải động đến thị trường bán lại GPU.

Kết luận cho câu hỏi về phần cứng: hãy tính 16 GB để chạy 4-bit một cách thoải mái, 24 GB để an toàn và có dư địa cho ngữ cảnh cũng như các mức quant cao hơn, đồng thời coi mọi con số ở đây chỉ là tạm thời cho đến khi repository được công bố và những phép đo thực tế đầu tiên xuất hiện. Con số dự kiến "17 GB" là một con số hợp lý để lên kế hoạch — chỉ là nó chưa phải là sự thật.
