Một chiếc đồng hồ cát trên bệ trưng bày mô hình trống — các trọng số Qwen3.8-27B chưa được phát hành, vì vậy không thể có API miễn phí nào tồn tại.
Guides & Insights

API Qwen 3.8 27B miễn phí: Chưa có — Nên chạy gì thay thế

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Không — tính đến ngày 12 tháng 8 năm 2026, không có API Qwen3.8-27B miễn phí, và cũng không có bản trả phí nào. Mô hình được công bố vào ngày 3 tháng 8 với trọng số mở được hứa hẹn sẽ đăng lên Hugging Face và ModelScope "trong tuần ngày 10 tháng 8," nhưng tổ chức Qwe​n chính thức vẫn chưa có kho lưu trữ Qwen3.8. Cho đến khi trọng số được phát hành, không ai có thể lưu trữ Qwen3.8-27B, nên "miễn phí" là điều vô nghĩa. Dưới đây là ba con đường để dùng miễn phí khi trọng số được phát hành (và chi phí thực sự của từng con đường), cùng với các mô hình bạn có thể chạy miễn phí cục bộ ngay hôm nay.

Chưa có API miễn phí — trọng số mới là cổng truy cập

Alibaba đã công bố dòng Qwen3.8 vào ngày 3 tháng 8 năm 2026: Qwen3.8-Max với 2,4 nghìn tỷ tham số (khoảng 95 tỷ tham số hoạt động, ngữ cảnh 1 triệu token, có giá 2 USD cho mỗi triệu token đầu vào và 6 USD cho mỗi triệu token đầu ra trên Alibaba Cloud Model Studio) và Qwen3.8-27B dạng dense, chạy trên một máy duy nhất. Cả hai đều được cam kết phát hành dưới dạng trọng số mở trên Hugging Face và ModelScope ngay trong tuần đó.

Lời hứa đó giờ đã quá hạn hai ngày. Tôi đã kiểm tra trực tiếp Hugging Face vào ngày 12 tháng 8: tổ chức Qwe​n chính thức không có bất kỳ kho lưu trữ Qwen3.8 nào. Các kho lưu trữ Qwen3.8-27B-GGUF, -FP8, -NVFP4A16 và -NInfer xuất hiện trong tìm kiếm mô hình chỉ là các thẻ giữ chỗ — không có tệp trọng số nào, số lượt tải chỉ ở mức một chữ số, thẻ mô hình ghi nguyên văn "được dành riêng trước khi phát hành Qwe​n/Qwen3.8-27B." Đừng coi đó là bằng chứng mô hình tồn tại; hãy coi chúng như những người đang giữ chỗ đậu xe.

Có hai điều bạn không thể giả định. Thứ nhất, giấy phép: chưa có giấy phép nào được công bố cho Qwen3.8-27B. Các bộ trọng số mở gần đây của Qwen được phát hành theo giấy phép Tongyi Qianwen, với điều khoản 100 triệu người dùng hoạt động hằng tháng sẽ kích hoạt các cuộc thương thảo về giấy phép thương mại khi sử dụng ở quy mô lớn — Apache 2.0 không phải là lựa chọn mặc định an toàn. Thứ hai, thông số kỹ thuật: Alibaba chưa công bố bảng benchmark, cửa sổ ngữ cảnh hay yêu cầu phần cứng đã được xác nhận cho bản 27B. Mọi thứ đang được nhắc lại về nó hôm nay đều chỉ là phỏng đoán.

Chúng ta đã đề cập đến danh sách kiểm tra trước khi phát hành — những gì đã xác nhận, những gì chỉ là tin đồn, những gì cần kiểm tra trước khi tải xuống — trong bài viết Qwen3.8-27B Open Weights: What We Know Before the Drop. Bài viết này là phần mà bài trước chưa đề cập: "miễn phí" thực sự sẽ hoạt động như thế nào khi mô hình được phát hành.

Sau khi cân nặng giảm: ba con đường đến tự do, và cái giá thực sự của mỗi con đường

"Free" không bao giờ là miễn phí. Cả ba con đường để có Qwen3.8-27B miễn phí đều chuyển chi phí sang một nơi nào đó; sự khác biệt là nơi nó rơi vào. 27B là một mô hình dense — mỗi một trong số khoảng 27 tỷ tham số của nó đều hoạt động trên mọi token — vì vậy các chi phí dưới đây nói về phần cứng thực tế, không phải tiếp thị.

Three routes to a free Qwen3.8-27B API after the weights drop: run it yourself, a hosted free tier, or OrcaRouter's planned free tier — and the real cost of each.

Phương án 1: Tự vận hành — miễn phí tiền mặt, nhưng phải tốn phần cứng

Con đường duy nhất mà "miễn phí" trở nên đúng theo nghĩa đen sau khi đã mua phần cứng. Đồng sáng lập Unsloth, Daniel Han, kỳ vọng mô hình 27B sẽ chạy trong khoảng 17GB VRAM khi ra mắt — đó là mục tiêu, không phải thông số chính thức. Sử dụng thang lượng tử hóa đã đo của Qwen3.6-27B làm tham chiếu: Q4_K_M vào khoảng 16GB, Q6_K khoảng 21GB, FP8 khoảng 27GB, và BF16 đầy đủ khoảng 54–56GB. Mức tối thiểu thực tế hiện nay là card 24GB — RTX 3090, RTX 4090, hoặc loại A6000 — ở Q4.

Thời điểm quan trọng: trọng số chính thức với vLLM hoặc SGLang thường hoạt động chỉ vài ngày sau khi ra mắt, nhưng các bản lượng tử hóa GGUF và AWQ từ cộng đồng thường chậm hơn một đến hai tuần, nên kiểu "tải về và chạy" như Ollama sẽ chưa tồn tại vào ngày phát hành. Chi phí ẩn là điện năng, một chiếc máy yên tĩnh và thời gian của bạn. Phần thưởng là sự riêng tư — không thứ gì rời khỏi máy bạn — và chi phí biên bằng không, vốn sẽ nhân lên nếu bạn cũng dùng GPU cho các mô hình khác.

Lộ trình 2: Các bậc miễn phí được lưu trữ — miễn phí về tiền bạc, nhưng phải trả giá bằng giới hạn.

Khi bộ trọng số được công bố, hãy mong đợi một hạn mức đánh giá từ Alibaba Cloud và các gói miễn phí từ những nền tảng serverless thông thường. Hình thức cần kỳ vọng là hình thức Alibaba đã áp dụng cho Qwen3.8-Max: hạn mức 1 triệu token cho người dùng mới, chỉ riêng khu vực Singapore, hiệu lực 90 ngày, không cộng dồn — và token suy luận được tính phí như token đầu ra, nên một mô hình mặc định suy luận có thể đốt hết toàn bộ hạn mức chỉ trong một ngày cuối tuần thử nghiệm. Thứ bạn thực sự phải trả là giới hạn tốc độ, khóa khu vực, ngày hết hạn, và prompt của bạn bị gửi cho bên thứ ba. Gói miễn phí chỉ là cửa ngõ để đánh giá mô hình, không phải nơi để triển khai.

Route 3: gói miễn phí của OrcaRouter — đã lên kế hoạch, chưa hoạt động

Vì truy vấn tìm kiếm theo nghĩa đen là "free," chúng tôi sẽ nói rõ: OrcaRouter dự định cung cấp một gói miễn phí cho Qwen3.8-27B khi bộ trọng số được phát hành. Nó chưa hoạt động. Không có endpoint nào để gọi, và tôi sẽ không dán một ví dụ giữ chỗ. Chúng tôi sẽ thông báo khi có điều gì đó để thông báo. Những gì chúng tôi thực sự lưu trữ hôm nay là Qwen3.8-Max với giá $2/$6 cho mỗi 1M token, không tính thêm phí — và bản 27B chưa có trên nền tảng, vì chưa ai có thể phục vụ nó.

Những gì bạn có thể sử dụng miễn phí ngay bây giờ

Nếu nhu cầu của bạn là "một mô hình mở thuộc lớp 27B mà tôi có thể chạy mà không phải trả phí," bạn không cần phải chờ đợi. Câu trả lời trung thực ở cùng cấp độ là Qwen3.6-27B, bản tiền thân trực tiếp của mô hình bạn đang chờ đợi.

Comparison of Qwen3.6-27B and Nemotron 3.5 Lightning 30B A3B, which you can run free today, against Qwen3.8-27B, which is not yet released.

Qwen3.6-27B là Apache 2.0, một mô hình dense 27.8B với ngữ cảnh 262K và hỗ trợ đầu vào văn bản, hình ảnh và video gốc. Một tệp GGUF Q4_K_M khoảng 16.5GB và chạy với tốc độ khoảng 25 token mỗi giây trên GPU tiêu dùng 24GB (16–18 token mỗi giây trên M4 Max). Các con số do nhà cung cấp báo cáo từ bảng thông số mô hình: SWE-Bench Verified 77.2, MMLU-Pro 86.2, AIME 2026 94.1, GPQA Diamond 87.8, và MMMU 82.9. Nếu Qwen3.8-27B là "một 27B," thì đây chính là 27B mà bạn có thể thực sự chạm tay vào hôm nay — cùng dòng, cùng thiết kế dense, và đã mở mã nguồn.

Nemotron 3.5 Lightning 30B A3B là một biến thể khác, cũng miễn phí: phát hành ngày 11 tháng 8 năm 2026 theo giấy phép OpenMDW 1.1 của NVIDIA. Đây là mô hình Mixture-of-Experts có tổng cộng 30B tham số, ~3B tham số kích hoạt, với kiến trúc Mamba-2 lai và ngữ cảnh lên tới 1M — checkpoint NVFP4 có dung lượng khoảng 21,6GB và bản GGUF Q4 khoảng 25GB. Mô hình cần một card GPU từ 24GB trở lên, vì toàn bộ 30 tỷ tham số phải nằm trong bộ nhớ dù chỉ khoảng 3 tỷ tham số được kích hoạt cho mỗi token. Các báo cáo đầu tiên ghi nhận tốc độ khoảng 45 token mỗi giây trên một GPU duy nhất. Mô hình được xây dựng cho tầng thực thi agent — gọi công cụ, xác thực, định dạng — chứ không phải để suy luận đỉnh cao. Nếu khối lượng công việc của bạn là các tác vụ agent nặng nhọc khối lượng lớn, mô hình này có thể vượt trội hơn cả mô hình dense 27B trong công việc thực tế của bạn.

Và nếu điều bạn muốn cụ thể là một API lưu trữ miễn phí ngay hôm nay thay vì cài đặt cục bộ, thì lựa chọn “miễn phí” thực sự duy nhất là hạn mức Qwen3.8-Max của Alibaba: 1M token, khu vực Singapore, 90 ngày. Đó không phải là bản 27B, và đây là khoản trợ cấp đánh giá, không phải dịch vụ — hãy dùng nó để thử hành vi của Qwen3.8 ngay bây giờ, sau đó chuyển tiếp.

Khi lời khuyên này sai

Nếu bạn đã sở hữu GPU 24GB+, thì cách suy nghĩ "chờ bản miễn phí" là sai với bạn. Ngay khi trọng số được tung ra, vLLM chạy trên trọng số chính thức chính là bản miễn phí của bạn; bạn sẽ chờ đợi một sự tiện lợi mà bạn không cần. Chỉ kiên nhẫn chờ khoảng hai tuần nếu bạn thực sự muốn thang lượng tử hóa GGUF được trau chuốt.

Nếu bạn đang tạo nguyên mẫu dựa trên một hợp đồng API, các hạn mức miễn phí được lưu trữ (một khi bản 27B có chúng) có thể tốn kém ít hơn so với thời gian của bạn — ngay cả với thời hạn 90 ngày và khóa vùng, thuê một máy GPU trong một tuần để tạo nguyên mẫu thường là lựa chọn đắt đỏ hơn.

Nếu giấy phép hóa ra là Tongyi Qianwen thay vì Apache,"trọng số miễn phí" sẽ không có nghĩa là được tự do thương mại hóa vượt qua ngưỡng 100 triệu MAU. Hãy đọc tệp LICENSE trong kho lưu trữ thực tế trước khi bạn xây dựng bất cứ thứ gì dựa trên nó — đó là cách phổ biến nhất khiến "trọng số mở miễn phí" trở thành một hóa đơn.

Và nếu Alibaba lại trễ hẹn lần nữa — hiện đã quá hai ngày so với thời hạn đã hứa — thì mỗi tuần trôi qua khiến Qwen3.6-27B trở thành lựa chọn đúng đắn thay vì chỉ là giải pháp tạm thời.

A timeline from announcement to free local run of Qwen3.8-27B.

Kết luận

{{1}}Không có API Qwen3.8-27B miễn phí nào vì không tồn tại Qwen3.8-27B ở bất cứ đâu.{{/1}} {{2}}Khi trọng số được phát hành, ba con đường miễn phí là tự lưu trữ (trả bằng phần cứng), các gói miễn phí được lưu trữ (trả bằng giới hạn), và gói miễn phí theo kế hoạch của OrcaRouter — vốn chưa hoạt động, và chúng tôi sẽ nói rõ khi nó hoạt động.{{/2}} {{3}}Hôm nay, thứ miễn phí gần nhất là Qwen3.6-27B trên phần cứng của chính bạn.{{/3}} {{4}}Chờ đợi không tốn của bạn gì ngoài con 27B; chạy phiên bản tiền nhiệm không tốn của bạn gì ngoài một GPU mà bạn có thể tận dụng cho mọi thứ khác trong lúc chờ đợi.{{/4}}

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày