Một thẻ tiêu đề cho bài viết Qwen3.8-27B trên Ollama, hiển thị cửa sổ terminal tối giản với lệnh 'ollama run qwen3.8:27b' và con trỏ nhấp nháy, ba huy hiệu ghi 'tải xuống 18 GB', 'Q4_K_M mặc định' và 'ngữ cảnh 262K', cùng chú thích 'chạy miễn phí, phần cứng của bạn'.
Guides & Insights

Qwen3.8-27B trên Ollama: Một lệnh, bốn mức lượng tử hóa, và cái giá thực sự của 'miễn phí'

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Chạy nó bằng một lệnh: ollama run qwen3.8:27b. Đó là toàn bộ câu trả lời cho câu hỏi mà trang này đề cập. Qwen3.8 27B — Mô hình dense 27 tỷ tham số của Ali​baba, trọng số được phát hành vào ngày 14 tháng 8 năm 2026 theo Apache 2.0 — đã có mặt trên thư viện Ollama trong tuần này, và bản dựng mặc định đã là một bản lượng tử hóa Q4_K_M 18 GB hợp lý (17 GB trọng số cộng với bộ mã hóa thị giác 931 MB). Nó chạy hoàn toàn trên GPU 24 GB ở độ dài ngữ cảnh bình thường, phân tách sang CPU khi card của bạn nhỏ hơn, và không tốn phí mỗi token.

Mọi thứ ở đây đều ghi ngày 15 tháng 8 năm 2026. Thông số kỹ thuật lấy từ thẻ mô hình Qwen3.8 27B; kích thước tải xuống, thẻ gắn và số lượt tải xuống lấy từ trang thư viện Ollama trực tuyến; các con số điểm chuẩn do Ali​baba công bố và chưa có sự sao chép độc lập nào. Mô hình mới được phát hành vài ngày trước, vì vậy hãy coi mọi thứ có thể thay đổi là tạm thời.

Câu lệnh một dòng thực sự hoạt động

Nếu bạn đã cài đặt Ollama, bạn chỉ còn cách hai từ:

chạy qwen3.8:27b bằng ollama

Hỗ trợ Ollama đã xuất hiện trong v0.32.12 — ghi chú phát hành nói một cách đơn giản: "Bản phát hành này bổ sung hỗ trợ cho Qwen 3.8 27B." Lần chạy đầu tiên sẽ tải xuống bản build mặc định (khoảng 18 GB, Q4_K_M), sau đó đưa bạn vào một REPL trò chuyện với chế độ suy luận được bật theo mặc định. Trang thư viện liệt kê bản build với các thẻ khả năng "vision tools thinking 27b", từ đó bạn biết rằng các luồng thị giác và gọi công cụ được tích hợp vào cùng một bản tải xuống. Tính đến thời điểm viết bài này, trang này hiển thị hơn 40.000 lượt tải xuống và danh sách thẻ đã bao gồm mười một biến thể.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

Hai biến thể bạn sẽ thực sự dùng đến:

• ollama run qwen3.8:27b-mlx — bản dành cho Apple Silicon, cùng dung lượng 18 GB nhưng được biên dịch cho Metal; đây là bản mà ghi chú phát hành của Ollama tối ưu hóa cụ thể "cho hiệu suất tối đa và chất lượng đầu ra phù hợp với các tác vụ lặp lại và tác nhân lập trình."

ollama run qwen3.8:27b-q8_0 — bản lượng tử hóa 8-bit 30 GB, dành cho khi bạn có VRAM và muốn trọng số gần với độ chính xác đầy đủ hơn.

Những gì bạn thực sự đang tải xuống

Tên gọi là 27B, nhưng tổng số tham số là 28B: một mô hình ngôn ngữ dense 27,3B cộng với bộ mã hóa thị giác 461M cho phép nhận đầu vào hình ảnh và video nguyên bản. Phần còn lại của thông số chính, trích trực tiếp từ thẻ mô hình:

• 64 tầng, kích thước ẩn 5.120, từ vựng 248.320.

• Chú ý lai: 16 lớp Gated Attention đầy đủ và 48 lớp Gated DeltaNet tuyến tính — tỷ lệ 3:1 nghiêng về tuyến tính, và đây là lý do một mô hình 27B có thể giữ ngữ cảnh gốc 262.144 token (có thể mở rộng lên 1M) mà không cần bộ đệm KV tiêu tốn cả một trung tâm dữ liệu.

Hiểu hình ảnh và video một cách tự nhiên — "{{1}}từ sơ đồ và tài liệu STEM đến video dài hàng giờ{{/1}}" là cách diễn đạt của {{2}}Ali​baba{{/2}}.

• Apache 2.0. Tải về, sửa đổi, bán sản phẩm dựa trên nó. Giấy phép đó là nền tảng pháp lý mà toàn bộ nội dung kinh tế còn lại của bài viết này dựa vào.

Tham chiếu chính xác đầy đủ là BF16, đó là lý do tồn tại các thẻ 56 GB; mỗi thẻ nhỏ hơn là sự đánh đổi độ chính xác để lấy kích thước, và các điểm chuẩn của chính model card là những gì bạn đang đem ra đánh đổi.

Chọn mức lượng tử hóa trước, rồi mới kiểm tra VRAM của bạn, chứ không phải ngược lại.

Ollama cung cấp cho bạn mười một thẻ, nhưng quyết định thu gọn còn ba kích cỡ.

18 GB — Q4_K_M (mặc định). Vừa vặn hoàn toàn trên card 24 GB (dòng RTX 4090 / 5090) ở ngữ cảnh thông thường, và trên card 16 GB khi giảm tải một phần sang CPU — chậm hơn, nhưng vẫn chạy được. Đây là bản dành cho việc "chỉ cần chạy là được."

30 GB — Q8_0. Trọng số gần đạt độ chính xác đầy đủ, cần khoảng 40 GB VRAM để chạy hoàn toàn trên GPU. Với mô hình 27B, bạn hẳn đã biết vì sao mình cần độ trung thực cao hơn trước khi trả tiền cho nó.

56 GB — BF16. Bản build tham chiếu. Yêu cầu phần cứng cấp H100 hoặc 96 GB. Không ai chạy bản này trên GPU tiêu dùng, và điều đó hoàn toàn ổn.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

Thứ khiến nhiều người vấp phải chính là KV cache. Bản tải về 18 GB không có nghĩa là 18 GB VRAM đủ cho phiên làm việc với ngữ cảnh 262K — ở ngữ cảnh dài, bộ đệm sẽ bổ sung thêm vài GB chồng lên trọng số, đó là lý do vì sao một card 24 GB có thể chạy mô hình này thoải mái ở ngữ cảnh 8K–32K nhưng không phải ở 262K. Với một card ở mức ranh giới, hãy giảm ngữ cảnh xuống, đừng giảm lượng tử hóa (quant).

Apple Silicon là một mục tiêu hạng nhất tại đây.

Bản ghi chú phát hành v0.32.12 của Ollama đề cập cụ thể đến macOS. Cụ thể, lệnh `ollama run qwen3.8:27b-mlx` cần khoảng 18 GB bộ nhớ hợp nhất, nên Mac từ 24 GB trở lên có thể chạy hoàn toàn trên GPU với khoảng trống cho ngữ cảnh. Ngoài ra còn có tag MLX mxfp8 32 GB và tag mlx-bf16 56 GB dành cho các máy 64–128 GB. Nếu chiếc Mac dòng M của bạn đã theo dõi tin tức về các mẫu máy tính để bàn, thì đây chính là bản build bạn đang chờ đợi.

262K trên bảng thông số, nhưng ngồi vào ghế thì kém hơn

Thẻ mô hình liệt kê 262.144 token gốc, có thể mở rộng lên 1M; trang thư viện của Ollama báo cáo cùng cửa sổ ngữ cảnh là 256K. Cả hai đều đúng — 262.144 là 256K nhân 1024 — và cả hai đều không có nghĩa là bạn nên nhập con số đó vào --num-ctx trên card 24 GB. Bộ nhớ đệm KV tăng gần như tuyến tính theo ngữ cảnh, vì vậy trên phần cứng tiêu dùng, bạn sẽ hoạt động ở mức 16K–64K, không phải 262K. Bắt đầu với mặc định của Ollama, chỉ tăng --num-ctx khi tác vụ thực sự cần, và hãy nhớ rằng con số 1M đòi hỏi cơ chế mở rộng cùng với VRAM để nuôi nó.

Điều gì vẫn còn bấp bênh — hãy đọc bài này trước khi đặt cược vào nó

Vẫn chưa có benchmark độc lập nào.Mọi con số trên model card đều do Ali​baba công bố tính đến ngày 15 tháng 8. Những mức cải thiện được tuyên bố so với Qwen3.6-27B là rất lớn — SWE-bench Pro 61.7 vs 53.5, Terminal Bench 2.1 73.0 vs 63.4, LiveCodeBench v6 90.3 vs 83.9, GPQA Diamond 89.2 vs 87.8 — và tất cả đều có vẻ hợp lý, nhưng chưa con số nào trong số đó được tái lập bởi một bộ đánh giá độc lập bên ngoài. Đừng chỉ dựa vào chúng để đưa ra quyết định sản xuất.

Bộ phận thị giác mới chỉ có vài ngày tuổi. Một báo cáo lỗi ban đầu (ollama issue #17753) cho thấy bản dựng Q4 định tuyến đầu vào thị giác qua trình phân tích cú pháp Qwen3.5 và gặp lỗi với hình ảnh; nó đã được sửa trong vài ngày trong PR #17755, nhưng đường dẫn đa phương thức trên một mô hình mới chỉ một tuần tuổi chính là nơi bạn nên kiểm tra trước khi tin cậy vào nó.

Bản dựng mặc định bao gồm MTP. Nhãn q4_K_M cũng là bản dựng dự đoán đa token — giải mã nhanh hơn, và là lý do "18 GB" và "27B" có thể cùng tồn tại mà không mâu thuẫn.

Nhãn lượng tử hóa có thể gây hiểu lầm trên Apple.Các thẻ "mlx" và "nvfp4" 18 GB khác nhau về lượng tử hóa — NVFP4 là một định dạng FP4 của NVIDIA — vì vậy trên Mac, hãy ưu tiên bản dựng -mlx thông thường trừ khi bạn đặc biệt cần một biến thể FP8/FP4 cho GPU Blackwell.

Từ "Free" đang gánh vác rất nhiều trong tiêu đề đó

Self-hosting một mô hình 27B thì miễn phí mỗi token, nhưng không hề miễn phí. Cách nói thẳng thắn là có ba lựa chọn, mỗi lựa chọn tốn một loại "tiền tệ" khác nhau:

Tự chạy (Ollama). $0 mỗi token, ngoại tuyến, không giới hạn, riêng tư — và phần cứng là của bạn. Một GPU 24 GB hoặc Mac 18 GB+ là một khoản mua sắm thực sự, cũng như tiền điện và thời gian thiết lập. Đây là lựa chọn đúng đắn khi Qwen3.8 27B trở thành công cụ sử dụng hằng ngày.

Gọi một API giới hạn tốc độ với chi phí $0.OrcaRouter phục vụ Qwen3.8 27B trên hạ tầng của riêng mình với chi phí bằng không (model ID qwen/qwen3.8-27b-free, $0 mỗi yêu cầu, có giới hạn tốc độ) — vì trọng số là mã nguồn mở, không có chi phí nhà cung cấp theo token nào để chuyển tiếp. Đây là lựa chọn đúng đắn khi bạn muốn dùng thử mô hình mà không cần mua phần cứng để kiểm tra bản phát hành cách đây một tuần.

Gọi một API không giới hạn. Cùng một mô hình đó nhưng không giới hạn tốc độ có giá $0.33 mỗi triệu token đầu vào và $2.40 mỗi triệu token đầu ra trên OrcaRouter (qwen/qwen3.8-27b, ngữ cảnh 262K, đầu vào văn bản, hình ảnh và video). Đây là lựa chọn đúng đắn khi bạn cần quy mô sản xuất và không muốn phải trông chừng một GPU.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

Phép tính quyết định giữa chúng: sử dụng không thường xuyên sẽ đáng giá hơn ở mức $0 hoặc $0.33/$2.40 so với giá của một GPU; sử dụng tương tác hàng ngày rẻ hơn khi chạy cục bộ; thông lượng sản xuất liên tục rẻ nhất khi dùng API mà bạn không phải duy trì. Các yêu cầu về quyền riêng tư và ngoại tuyến sẽ đưa bạn đến cột đầu tiên, bất kể phép tính nói gì.

Khi khuyến nghị này sai

Bạn thực sự cần ngữ cảnh 100K+. Mô hình có thể làm được; card 24 GB của bạn thì không. Ở ngữ cảnh dài thực sự, một GPU 40 GB+ hoặc một API ngữ cảnh dài hơn không phải là thứ xa xỉ.

Bạn cần video trong sản xuất hôm nay. Đường dẫn thị giác vừa được sửa lỗi parser; video sản xuất trên mô hình đa phương thức chỉ mới một tuần là một canh bạc bạn không nên đặt cược nếu không có phương án dự phòng.

Bạn muốn xử lý đồng thời. Một GPU tiêu dùng chỉ có thể stream một hoặc hai lần tạo sinh tại một thời điểm. Mô hình 27B không phải là một cỗ máy phục vụ.

Bạn đang sử dụng phần cứng chỉ có CPU. Một mô hình 27B ở mức 4-bit trên CPU là một bản demo chậm, không phải công cụ. Sử dụng API là lựa chọn trung thực cho đến khi bạn có GPU.

Điểm mấu chốt

Qwen3.8 27B trên Ollama là cách dễ nhất để chạy một mô hình 27B thế hệ hiện tại mà bất kỳ ai đã phát hành: một lệnh, bản mặc định 18 GB vừa với card 24 GB, bản dựng Apple Silicon hạng nhất, và tự do Apache 2.0. Lượng tử bạn nên chọn gần như luôn là mặc định Q4_K_M — chỉ chuyển sang q8_0 khi bạn có thể đo được sự khác biệt. Và "miễn phí" là có điều kiện: nếu bạn thỉnh thoảng chạm vào mô hình, API giới hạn tốc độ $0 rẻ hơn việc mua phần cứng; nếu nó trở thành công cụ hằng ngày của bạn, bản sao cục bộ là thứ rẻ nhất bạn sở hữu. Hãy xác minh các con số trước khi xây dựng dựa trên chúng — mọi thứ trong bài viết này đều đúng vào ngày 15 tháng 8 năm 2026, và mô hình này thay đổi từng ngày.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube