Thẻ tiêu đề cho hướng dẫn tải xuống Qwen3.8-27B trên Hugging Face, hiển thị đường dẫn kho lưu trữ Qwen/Qwen3.8-27B, huy hiệu giấy phép Apache 2.0 và các thẻ BF16, 55.6 GB và 18 phân đoạn safetensors.
Guides & Insights

Qwen3.8-27B trên Hugging Face: repo chính thức, bên trong có gì, và cách tải xuống

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Qwen3.8 27B có trên Hugging Face tại Qwen/Qwen3.8-27B, được phát hành bởi tổ chức Qwe​n vào ngày 14 tháng 8 năm 2026 theo giấy phép Apache 2.0. Kho lưu trữ chứa 55,6 GB safetensors BF16 trải trên 18 phân đoạn, cùng với tokenizer, mẫu trò chuyện và cấu hình đi kèm — miễn phí tải xuống, miễn phí sử dụng thương mại và không thu phí theo token. Có hai điều khiến mọi người dễ nhầm lẫn: kho chính thức chỉ cung cấp safetensors, còn các bản lượng tử GGUF mà mọi người chạy trên GPU tiêu dùng nằm trong các kho cộng đồng riêng biệt; và các kho giả mạo đã xuất hiện trước khi phát hành, vì vậy chỉ bản sao của tổ chức Qwe​n mới là thật. Bài viết này là hướng dẫn tải xuống: những gì có trong kho, ba cách để tải về và cách xác minh bạn đã lấy đúng bộ trọng số chính hãng.

Thông tin nhanh, đã kiểm tra ngày 15 tháng 8 năm 2026

Kho lưu trữQwen/Qwen3.8-27B trên Hugging Face, do tổ chức Qwe​n xuất bản; được nhân bản tại Qwen/Qwen3.8-27B trên ModelScope.

Phát hành — các trọng số chính thức có mặt vào ngày 14 tháng 8 năm 2026; các bài đưa tin theo múi giờ cũng trích dẫn ngày 13 tháng 8, và các bài viết trước phát hành trong tuần trước đó đã mô tả chúng là đang chờ.

Giấy phép — Apache 2.0: tải xuống, sửa đổi và phân phối lại, bao gồm cả sử dụng thương mại.

Dung lượng — 55,57 GB safetensors trên 18 phân đoạn (mỗi phân đoạn 2,1–3,99 GB); trang repo làm tròn tổng thành 55,6 GB.

Mô hình — 27B tham số dense (28B khi tính cả bộ mã hóa thị giác), 64 lớp, kích thước ẩn 5,120, từ vựng 248.320.

Attention — lai: 48 lớp Gated DeltaNet (attention tuyến tính) so với 16 lớp Gated Attention toàn phần, được huấn luyện với dự đoán đa token — tỷ lệ chia 3:1 là lý do khiến 262.144 token ngữ cảnh gốc chạy được trên mô hình 27B.

Ngữ cảnh — 262.144 token vốn có, có thể mở rộng lên 1.000.000 nhờ kỹ thuật mở rộng YaRN RoPE.

Đầu vàohình ảnh và video gốc cùng với văn bản; trả về văn bản.

Signal — 91.917 lượt tải trên bộ đếm 30 ngày trượt của thẻ mô hình, được kiểm tra vào ngày 15 tháng 8 năm 2026.

Mọi con số ở trên đều lấy từ trang mô hình Hugging Face, cây kho lưu trữ và cấu hình của Qwen3.8 27B, đọc ngày 15 tháng 8 năm 2026. Các tuyên bố benchmark trên thẻ (SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3) là do Ali​baba công bố; tính đến hôm nay, chưa có phòng thí nghiệm độc lập nào tái lập được chúng.

Tại sao nên tải xuống: câu hỏi giữa local và API

Trọng số mở là loại mô hình duy nhất mà chi phí biên để chạy một token chỉ bằng chi phí điện năng của bạn. Không phí bản quyền, không giá theo token, không giới hạn tốc độ và không có gì rời khỏi máy của bạn. Qwen3.8 27B được cấp phép Apache 2.0, nên sự tự do đó là vĩnh viễn: Alibaba không thể thu hồi trọng số, cấp phép lại hoặc tính phí bạn.

Sự đánh đổi là phần cứng và khâu thiết lập. Các trọng số BF16 đầy đủ cần một GPU tầm 80 GB ở độ chính xác nguyên bản, và 55.6 GB là một bản tải xuống không hề nhỏ. Nếu bạn muốn đánh giá mô hình trước khi quyết định làm điều đó, thì đường API sẽ nhanh hơn: Qwen3.8 27B được phục vụ trên OrcaRouter với mức giá của Qwe​n là $0.33 cho mỗi triệu token đầu vào và $2.40 cho mỗi triệu token đầu ra, được chuyển tiếp thẳng không chênh lệch giá — và OrcaRouter cũng có gói miễn phí có giới hạn tốc độ cho cùng mô hình này, nên bạn có thể chạy thử miễn phí mà không cần tải xuống gì cả. Nhưng API chỉ là tiện ích, không phải thứ bắt buộc — trọng số mới là sản phẩm, và chúng hoàn toàn miễn phí.

Thực sự có gì trong repo

Kho lưu trữ này không chỉ là các trọng số. Nó là một gói hoàn chỉnh có thể chạy được: 18 phân đoạn (shards) cùng các tệp siêu dữ liệu mà Transformers, vLLM và SGLang cần. Xem xét từ trên xuống dưới:

model-00001-of-00018.safetensors … model-00018-of-00018.safetensors — các trọng số, 2,1–3,99 GB mỗi phân đoạn, tổng cộng 55,57 GB.

model.safetensors.index.json — ánh xạ mỗi tensor tới shard của nó; đây là thứ mà trình tải đọc đầu tiên.

config.json — kiến trúc: 64 lớp, kích thước ẩn 5.120, từ vựng 248.320, và bố cục Gated DeltaNet / Gated Attention.

tokenizer.json (12.8 MB), tokenizer_config.json, vocab.json (6.72 MB), merges.txt (3.35 MB) — bộ tokenizer.

chat_template.jinja — mẫu trò chuyện, bao gồm khối suy nghĩ; llama.cpp cần nó được truyền dưới dạng một template jinja, nếu không, mô hình sẽ trả lời bạn trong các thẻ suy nghĩ.

preprocessor_config.jsonvideo_preprocessor_config.json — tiền xử lý hình ảnh và video.

crc32.txt — tổng kiểm tra theo từng phần; đối chiếu bản tải xuống với tệp này và một lần truyền tải bị hỏng sẽ không còn là điều bí ẩn.

README.md (thẻ mô hình 65 kB), LICENSE (Apache 2.0), generation_config.json, .gitattributes (đánh dấu các tệp trọng số là Git LFS).

A repository file-table card for Qwen/Qwen3.8-27B: 18 safetensors weight shards at 2.1 to 3.99 GB each totalling 55.57 GB, plus the index, config, tokenizer files, chat template, checksum file, model card, and license with their sizes.

Một hệ quả của cách bố trí này có liên quan đến vấn đề repo giả mạo bên dưới. Một bản sao thực sự của repo này có dung lượng lớn và đầy đủ. Một repo giữ chỗ có tên chứa "Qwen3.8" và chỉ có một tệp README không phải là bản tải xuống bị lỗi — đó là một kho lưu trữ khác, trống rỗng.

Cách tải xuống — ba cách

Cách thứ nhất, huggingface-cli, là cách gọn gàng nhất. Mô hình là công khai, nên không cần đăng nhập; lệnh này sẽ tải tất cả 18 phân đoạn cùng với siêu dữ liệu vào một thư mục:

huggingface-cli tải xuống Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B

Đối với một lần truyền tải 55.6 GB, hf_transfer backend đáng để cài đặt — nó song song hóa việc tải xuống và thường rút ngắn thời gian đáng kể:

pip install hf_transfer

HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B

Cách hai, git clone, sẽ đưa cho bạn kho lưu trữ như một bản sao làm việc có lịch sử. Yêu cầu Git LFS:

git lfs install

git clone https://huggingface.co/Qwen/Qwen3.8-27B

Phương pháp thứ ba, trình duyệt — mở tab Files và tải xuống từng phần một. Chỉ hợp lý khi bạn cần một tệp (chẳng hạn, chỉ cần config.json để xem kiến trúc). Đối với toàn bộ repo, bạn cần tải thủ công 18 lần cộng với việc kiểm tra checksum; hãy dùng CLI.

A download-command card showing the three ways to fetch Qwen/Qwen3.8-27B: the recommended huggingface-cli download with --local-dir, the hf_transfer speed-up one-liner, and a git clone with Git LFS installed.

Bạn thực sự nên tải xuống những tệp nào

Kho chính thức là BF16 safetensors — độ chính xác đầy đủ, 55.6 GB — đúng là bản phù hợp nếu bạn có GPU loại 80 GB, hoặc muốn tự lượng tử hóa xuống sau này. Không có GGUF chính thức. Các bản dựng GGUF mà mọi người thực sự dùng trên card tiêu dùng là các bản phát hành cộng đồng: Hugging Face liệt kê 303 mô hình lượng tử hóa được dựng từ nền tảng này (kiểm tra ngày 15 tháng 8 năm 2026), và những bản mà runbook hướng đến là các bản dựng unsloth và lmstudio-community. Nấc thang gần đúng:

BF16 safetensors — 55.6 GB, cần GPU loại 80 GB ở độ chính xác gốc.

GGUF Q8_0 — khoảng 29 GB, vừa với thẻ 48 GB.

GGUF Q4_K_M — khoảng 17 GB, lựa chọn tiêu chuẩn cho card 24 GB.

GGUF 2-bit — khoảng 9 GB, vừa khít trên các card 12 GB với chất lượng giảm rõ rệt.

Nếu bạn muốn có khả năng thị giác từ bản dựng GGUF, bạn cũng cần tệp mmproj riêng cho bộ mã hóa thị giác, được mô tả trên mỗi thẻ cộng đồng. Để có bảng phân tích đầy đủ về lượng tử hóa và thời gian chạy — bao gồm cả lưu ý về mẫu chat-template của llama.cpp — sổ tay hướng dẫn của chúng tôi về cách chạy Qwen3.8 27B cục bộ có các chi tiết.

Cách phân biệt repo thật với các repo giả

Trước khi các trọng số được phát hành, tìm kiếm trên Hugging Face đầy rẫy các kho lưu trữ "Qwen3.8" không có tệp trọng số — các thẻ giữ chỗ và bản fork được để lại để bắt gặp những người tìm kiếm sớm. Một số vẫn còn tồn tại. Danh sách kiểm tra xác minh:

Hãy kiểm tra nhà phát hành, đừng chỉ nhìn tên. Kho lưu trữ chính thức nằm dưới tổ chức Qwe​n: Qwen/Qwen3.8-27B. Một kho lưu trữ có tên Qwen3.8 27B dưới bất kỳ tài khoản nào khác không phải là bản phát hành chính thức, dù trông có vẻ chuyên nghiệp đến đâu.

Sử dụng bộ sưu tập chính thức. Qwen duy trì huggingface.co/collections/Qwen/qwen38; mọi kho lưu trữ trong đó đều thuộc về họ.

Kiểm tra trường giấy phép. Thẻ thật ghi Apache 2.0.

Kiểm tra kích thước và hình dạng. Kho lưu trữ thực sự có 18 phân đoạn safetensors tổng cộng khoảng 55,6 GB, một tệp checksum crc32.txt và một README 65 kB. Không có tệp trọng số nào nghĩa là kho trống, không phải bản tải bị lỗi.

Hãy coi số lượt tải là một tín hiệu, không phải bằng chứng. Kho lưu trữ thật đã vượt 91.000 lượt tải trong một ngày, điều đó cho bạn biết những người khác đang hướng đến đâu. Nhưng một bản giả cũng có thể được tải xuống; nhà phát hành mới là sự bảo đảm.

Sau khi tải xuống, hãy xác minh tính toàn vẹn: kiểm tra CRC32 của từng phân đoạn so với crc32.txt, hoặc tải mô hình bằng Transformers và xác nhận state dict được tải mà không có cảnh báo. Việc này phát hiện cả lỗi truyền tải bị hỏng lẫn mô hình sai bị đóng gói lại.

Khi tải xuống là nước đi sai lầm

Tải xuống 55,6 GB không phải là lựa chọn phù hợp cho tất cả mọi người, và phiên bản trung thực của bài viết này nói rõ điều đó.

Bạn chỉ muốn đánh giá mô hình. Sử dụng API nhanh hơn — một bài kiểm tra có cấu trúc chỉ tốn vài xu và vài phút, thay vì tải xuống và mất cả buổi chiều thiết lập.

Bạn không có GPU nào gần 80 GB. Bản tải BF16 là artifact không phù hợp với bạn. Hãy chọn bản GGUF quant hoặc API.

Bạn cần các benchmark đã được kiểm chứng. Mọi con số chính cho Qwen3.8 27B đều do Ali​baba công bố tính đến ngày 15 tháng 8 năm 2026. Nếu quyết định của bạn phụ thuộc vào những con số mà một phòng thí nghiệm độc lập đã tái tạo, hãy chờ những con số đó — các trọng số vẫn sẽ ở đây.

Bạn đang xây dựng dựa trên một mô hình mới chỉ vài ngày tuổi. Các trọng số được phát hành vào ngày 14 tháng 8. Trang mô hình của OrcaRouter, được đọc hôm nay, cho thấy tỷ lệ lỗi 33.3% trong bảy ngày gần nhất và độ trễ token đầu tiên ở phân vị p50 là 225 ms — một mô hình hoàn toàn mới đang chịu tải ban đầu, vì vậy hãy coi dữ liệu đo từ xa ban đầu là tạm thời. Những người tự triển khai nên ghim commit họ đã tải xuống và giữ một phương án dự phòng; người dùng API nên giữ một quy tắc chuyển đổi dự phòng như một sự bảo hiểm tương tự.

The OrcaRouter model page for Qwen3.8 27B at qwen/qwen3.8-27b, showing the by-Qwen vendor label, vision-tools-JSON capability badges, a 262K-token context window, text-image-and-video input, and p50 first-token latency of 225 ms.

Bạn muốn có hợp đồng hỗ trợ. Apache 2.0 là giấy phép cởi mở, nhưng giấy phép không phải là SLA. Nếu khối lượng công việc của bạn cần hỗ trợ từ nhà cung cấp, thì sử dụng API được lưu trữ là lựa chọn an toàn hơn.

Điểm mấu chốt

đích thựcQwen3.8 27Bđang có trên Hugging Face tạiQwen/Qwen3.8-27B, theo giấy phép Apache 2.0, phát hành ngày 14 tháng 8 năm 2026, gồm 55,6 GB safetensors BF16 trong 18 shard. Hãy tải xuống bằng huggingface-cli hoặc git clone, xác minh nhà phát hành là tổ chức Qwen, và bạn sẽ nắm giữ một mô hình 27B open-weights tiên tiến nhất mà không ai có thể lấy đi hoặc tính phí bạn. Nếu việc đó đòi hỏi nhiều cam kết hơn nhu cầu sử dụng của bạn, thì mô hình tương tự cũng chỉ tốn vài xu thông qua API. Tuy nhiên, weights mới là thứ quan trọng — và chúng miễn phí.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube