Thẻ tiêu đề hero cho Qwen3.8-27B, mô hình ngôn ngữ-thị giác dense 27 tỷ tham số trong dòng Qwen3.8 của Alibaba, với phụ đề '27B dense - ngôn ngữ-thị giác nguyên bản - Apache 2.0' và ba chip tính năng ghi 'ngữ cảnh 262,144 token', 'văn bản + hình ảnh + video đầu vào' và 'văn bản đầu ra', cùng logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Qwen3.8-27B: Mô hình đa phương thức nhỏ gọn trong dòng Qwen3.8 của Alibaba

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Qwen3.8-27B là thành viên dense, single-node thuộc thế hệ Qwe​n3.8 của Aliba​ba: một mô hình ngôn ngữ - thị giác gốc với 27 tỷ tham số, được công bố trên Hugging Face theo giấy phép Apache 2.0, có thể tiếp nhận văn bản, hình ảnh và video rồi trả về văn bản với cửa sổ ngữ cảnh 262.144 token. Đây là trang tham chiếu cho mô hình đó — bản viết chuẩn mực về nó là gì, gọi nó tốn bao nhiêu, và nó có thể làm được những gì — và cần nói rõ ngay từ đầu vì sao lại tồn tại một trang dành cho một mô hình mà trọng số lần đầu xuất hiện vào tháng 8 năm 2026 chứ không phải trong bảy ngày qua. Chúng tôi không đưa tin về một màn ra mắt. Chúng tôi đang trả lời một câu hỏi thường trực: độc giả tìm đến chúng tôi với cái tên "Qwen3.8-27B" hàng nghìn lần mỗi tháng, và cho đến nay chưa có trang nào của chúng tôi nắm giữ câu trả lời đó. Ngày phát hành của chính mô hình, được ghi trên card của Qwe​n và được Artificial Analysis ghi nhận là 2026-08-14, là một dữ kiện mà trang này dùng để định tuổi mô hình, chứ không phải một sự kiện mà trang đưa tin.

Hãy coi đó là ngoại lệ đúng như nó vốn là: nếu đọc theo tiêu chí bảy ngày nghiêm ngặt, một mô hình từ giữa tháng 8 năm 2026 thì không còn mới, và mục này sẽ bị bỏ qua như một tin tức. Cơ sở ở đây thì khác. Đây là một trang tham chiếu có các số liệu đã được xác minh đối chiếu với model card của chính Qwe​n, tệp giấy phép của kho lưu trữ, bảng giá Qwe​n Cloud và Artificial Analysis vào ngày 2026-09-28, và lý do tồn tại của nó là nhu cầu tìm kiếm mà chúng tôi đo lường trực tiếp cùng ngày. Đây không phải là một thông báo thứ hai, và không ai nên hiểu nó như vậy.

27B nằm ở đâu trong dòng sản phẩm Qwen3.8

Thế hệ Qwe​n3.8 không phải là một mô hình duy nhất, và hậu tố kích thước chính là ý nghĩa cốt lõi của tên gọi. Các ghi chú trong kho lưu trữ của chính Qwe​n trên khắp dòng mô hình đã nói rõ sự phân chia:

• Qwen3.8-27B — 27B tham số dense, hỗ trợ đầu vào hình ảnh và video gốc, giấy phép Apache 2.0. Thành viên thân thiện với việc triển khai: một mô hình có kích thước đủ để chạy trên một GPU hoặc một nút nhỏ, và cũng là chủ đề của trang này.

• Qwen3.8-Max, được xây dựng trên Qwen3.8-2.4T-A95B — tổng cộng 2,4 nghìn tỷ tham số với 95 tỷ hoạt động, mô hình thuộc lớp Qwen-Max mà Alibaba lần đầu tiên mở trong thế hệ này. Kho của nó đi kèm một giấy phép qwen3.8-max riêng thay vì Apache 2.0.

• Qwen3.8-Flash-Next — bản xem trước kiến trúc thử nghiệm mà Qwe​n nói sẽ làm nền tảng cho Qwen4, được phát hành theo giấy phép qwen-community-1.0. Qwen3.8-Flash bản lưu trữ được xây dựng trên nền tảng đó.

Vậy nên “27B” không phải là một mức trang bị của mô hình Max; đó là hạng kích thước mà một nhóm đơn lẻ thực sự có thể phục vụ. Điều mà Aliba​ba tuyên bố nó thừa hưởng là công thức huấn luyện: thẻ mô tả Qwen3.8-27B như tiếp nhận những tiến bộ của thế hệ này trong lập trình, công việc chuyên môn, nghiên cứu và các tác vụ agentic dài hạn, rồi nén chúng vào một checkpoint dense.

Scoreboard infographic titled 'Qwen3.8-27B - the scoreboard' with six rows: Parameters 27B dense (27.8B with vision), Context 262,144 native and 1M with YaRN, Modalities text + image + video in and text out, Licence Apache 2.0 with commercial use, Terminal Bench 2.1 of 73.0 marked vendor-reported, and AA Intelligence Index 33.7 marked independent, with a footer reading 'Qwen figures vendor-reported and unreproduced; AA figures per Artificial Analysis.' and the OrcaRouter logo in the bottom-right corner.

Kiến trúc mà Qwen công bố

Mọi số liệu dưới đây đều lấy từ thẻ mô hình tại Qwe​n/Qwen3.8-27B, vốn là tài liệu của chính nhà cung cấp:

• Tham số — 27B như được quảng cáo. Metadata safetensors của chính kho lưu trữ tổng cộng 27.781.427.952 tham số ở định dạng BF16 trải trên 18 shard, vậy khoảng 27,8B khi tính cả tháp thị giác. Ở đây không có mixture-of-experts: mọi tham số đều được kích hoạt trên mỗi token.

• Kích thước — 64 lớp, chiều ẩn 5.120, chiều trung gian feed-forward 17.408, embedding token và đầu ra LM 248.320 (đã đệm).

• Attention hybrid — bố cục mà Qwen in ra là 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): ba khối attention tuyến tính cho mỗi khối attention đầy đủ, tỷ lệ 3:1. Gated DeltaNet chạy 48 đầu attention tuyến tính cho V và 16 đầu cho QK ở chiều đầu 128; Gated Attention chạy 24 đầu truy vấn so với 4 đầu KV ở chiều đầu 256, với chiều rotary là 64. Tỷ lệ đó là thứ khiến một cửa sổ 262K trở nên khả thi trên một mô hình 27B, và nó cũng chính là dòng mà Qwen3.8-Flash-Next mở rộng bằng attention thưa.

• Dự đoán nhiều token — thẻ cho biết mô hình được huấn luyện bằng MTP qua nhiều bước, thủ thuật drafting giúp tăng tốc quá trình sinh trong các serving stack có hỗ trợ MTP.

• Kiểm soát suy nghĩ — chế độ suy nghĩ được bật theo mặc định và có thể tắt theo từng yêu cầu. reasoning_effort nhận xhigh (mặc định), medium hoặc low, và preserve_thinking được bật theo mặc định để dấu vết lập luận được giữ qua các lượt thay vì bị tạo lại.

Cửa sổ ngữ cảnh và giới hạn đầu ra

Thẻ cho biết 262.144 token nguyên bản, có thể mở rộng lên 1.000.000 bằng RoPE scaling (YaRN). Hướng dẫn phục vụ của chính Qwe​n cho các lần chạy agentic dài, trong phạm vi 1M đó, là cho phép tối đa 262.144 token cho nội dung suy luận và tối đa 131.072 token cho phản hồi cuối cùng — mức trần là cấu hình phục vụ, không phải thuộc tính cố định của checkpoint.

Có hai cửa sổ cần được tách bạch rõ ràng, vì chúng rất dễ bị nhầm lẫn với nhau. Trọng số mở chạy ở mức 262,144 một cách gốc; còn bản được lưu trữ trên Qwe​n Cloud, mà thẻ mô hình mô tả là vẫn chưa ra mắt ("dịch vụ sắp ra mắt"), lại được liệt kê trên trang mô hình của Qwe​n Cloud với ngữ cảnh 1M, đầu vào tối đa 991K, đầu ra tối đa 131K và ngân sách suy luận tối đa 262K. Bảng thông số của sản phẩm được lưu trữ không phải là bảng thông số của checkpoint.

Các phương thức: đầu vào và đầu ra gồm những gì

Đầu vào là văn bản, hình ảnh và video; đầu ra chỉ là văn bản. Thẻ mô hình gọi Qwen3.8-27B là "một mô hình ngôn ngữ – thị giác gốc, hiểu được hình ảnh và video" và đoạn mã ví dụ của nó truyền cả ba loại đầu vào. Không có đầu vào âm thanh, không có tạo hình ảnh và không có đầu ra giọng nói. Bản ghi mô hình của Artificial Analysis cho cùng checkpoint cũng đồng tình về phạm vi này — đầu vào gồm hình ảnh, video và văn bản, đầu ra là văn bản — đây là một góc nhìn thứ hai hữu ích vì nó không phải là trang của chính Aliba​ba.

Bản phát hành Apache 2.0 thực sự cho phép những gì

Giấy phép này không phải là một bản tóm tắt trên bài đăng blog nào đó; kho lưu trữ mang chính văn bản Apache License, Version 2.0, và siêu dữ liệu của thẻ khai báo license: apache-2.0. Những gì giấy phép cấp, đọc từ chính văn bản giấy phép: một giấy phép bản quyền vĩnh viễn, trên toàn thế giới, miễn phí bản quyền để sao chép, tạo tác phẩm phái sinh, hiển thị công khai, cấp phép lại và phân phối tác phẩm cùng các tác phẩm phái sinh của nó, và một giấy phép sáng chế từ những người đóng góp — trong đó sử dụng thương mại nằm trong số các mục đích được phép, không có hạn chế về lĩnh vực sử dụng, không có ngưỡng số lượng người dùng và không cần thỏa thuận thương mại riêng. Apache 2.0 cũng mang tính cấp phép thoáng (permissive) theo đúng nghĩa quan trọng đối với việc phát hành sản phẩm: trọng số phái sinh có thể được phân phối lại theo các điều khoản khác, miễn là bạn giữ nguyên các thông báo giấy phép và ghi nhận nguồn gốc, đồng thời nêu rõ những gì bạn đã thay đổi (Mục 4a–4c). Mục 6 không cấp bất kỳ quyền nào đối với tên gọi hay nhãn hiệu Qwe​n, vì vậy một bản fork theo Apache-2.0 không thể tự quảng bá mình là Qwe​n.

Việc so sánh trong nội bộ dòng mô hình này rất đáng chú ý, và có thể thấy rõ từ các repository chứ không phải từ mức độ phủ sóng: checkpoint 2.4T-A95B tự nhận mình là other với giấy phép qwen3.8-max, còn Qwen3.8-Flash-Next thì dùng qwen-community-1.0. Mô hình 27B là mô hình duy nhất trong ba mô hình được phát hành theo Apache 2.0 nguyên bản.

Vị trí đánh giá chuẩn độc lập

Artificial Analysis đã chạy mô hình, và kết quả của nó đáng được tách riêng khỏi bảng riêng của Alibaba vì hai bên trả lời những câu hỏi khác nhau. Chỉ số độc lập, được đo trên xhighcấu hình

• Intelligence Index 33.7 — giá trị lưu trữ của Artificial Analysis, giá trị mà trang mô hình của nó in ra được làm tròn thành 34. Có hai thứ hạng được công bố và chúng đo các nhóm khác nhau: ô tóm tắt của chính trang đó xếp mô hình ở vị trí thứ nhất trong số 142 mô hình thuộc lớp kích thước của nó, theo so sánh cùng lớp mà chú thích nổi của trang mô tả, trong khi dòng lấy nguồn từ Artificial Analysis trong danh mục của chúng tôi ghi nhận vị trí thứ 45 trong số 145, khoảng phân vị thứ 67. Không cái nào là thứ hạng so với cùng một nhóm như cái kia, nên đừng đọc chúng như một con số ở hai định dạng.

• Chỉ số Lập trình 68.1 — được ghi trong danh mục của chúng tôi với artificialanalysis.ai là nguồn được nêu tên, xếp thứ 35 trong số 138 trong nhóm của chỉ số đó. Mô hình này có thứ hạng về lập trình cao hơn so với trí tuệ tổng quát, điều này nhất quán với hình dạng bảng của chính nhà cung cấp.

• Thang mức nỗ lực, cùng một harness — giảm mức nỗ lực suy luận làm chỉ số dịch chuyển rất xa: 33,7 ở mức xhigh, 27,6 ở mức medium, 26,2 ở mức low, và 20,2 khi tắt hoàn toàn suy luận. Đó là mức chênh lệch đo được lên tới 13,5 điểm, và đây là lập luận cụ thể nhất cho việc tinh chỉnh mức nỗ lực theo từng khối lượng công việc thay vì theo từng mô hình.

• Hai nguồn đồng thuận và bất đồng ở đâu — trên GPQA Diamond, thẻ của Aliba​ba báo cáo 89,2 còn Artificial Analysis đo được 90,5. Ở Humanity's Last Exam, thẻ báo cáo 30,8 và Artificial Analysis là 33,9. Gần nhau, nhưng không cùng một con số, và điều đó là bình thường: khung đánh giá khác nhau, các lần chạy khác nhau. Một lưu ý nên nằm trong bài viết chứ không phải ở chú thích — chưa có bên thứ ba nào công bố so sánh trực tiếp giữa Qwen3.8-27B và bất kỳ mô hình nào trong bảng so sánh của Aliba​ba khi chạy ở cùng mức nỗ lực trên cùng một khung đánh giá, nên mọi so sánh giữa các mô hình trên trang này đều là so sánh những phép đo riêng lẻ, chứ không phải một kết quả.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B in its xhigh configuration showing a same-class comparison rank of 1 of 142 next to an Intelligence tile, 46.6 output tokens per second at rank 55 of 142, $0.50 per million input tokens and $3.00 per million output tokens, a 256k-token context window, 27B total parameters, an Apache 2.0 licence, an open-weights marker and a release month of August 2026, with the summary text reporting a score of 34 on the Artificial Analysis Intelligence Index.

Qwen báo cáo những gì và cách đọc nó

Thẻ mô hình mang khoảng hai chục điểm số với các cột so sánh cho Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B và Opus4.6 Max. Tất cả đều do nhà cung cấp báo cáo và chưa được tái lập — đánh giá của chính Alibaba, do Alibaba công bố — và một số hàng sử dụng harness Claude Code được chấm bởi một bản dựng GPT-5.4, điều mà chú thích cuối trang của thẻ ghi rõ. Những con số nhà cung cấp được nêu bật, trên cơ sở đó:

• Lập trình terminal dạng agentic — Terminal Bench 2.1 (Terminus) 73.0, so với 63.4 của Qwen3.6-27B mà nó thay thế, với Opus4.6 Max dẫn đầu hàng ở mức 78.2.

• Lập trình dạng tác tử — SWE-bench Pro 61.7, QwenSWEBench 79.0, DeepSWE 1.1 42.2, NL2Repo-Bench 42.3, LiveCodeBench v6 90.3.

• Tác nhân và công việc văn phòng — CoWorkBench 70.7, JobBench 33.4, Agents' Last Exam 42.9 theo điểm số (Pass@1 20.4).

• Suy luận tổng quát — GPQA Diamond 89,2, HLE 30,8, IFBench 79,5. Opus4.6 Max dẫn đầu cả hai hàng suy luận trong bảng của chính nhà cung cấp, ở mức 91,3 và 40,0.

• Thị giác và sử dụng máy tính — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.

Bản tóm tắt trung thực về bảng đó thì hẹp hơn vẻ ngoài của bảng. So với phiên bản tiền nhiệm trực tiếp, mức cải thiện là lớn và nhất quán — QwenSWEBench 79.0 so với 49.3, DeepSWE 42.2 so với 13.3 — và đó là một nhận định về một thế hệ thay đổi công thức. So với các mô hình tiên phong ở các cột lân cận, nó thắng một số hàng và thua một số hàng khác, trên chính các con số của Aliba​ba, theo chính lựa chọn bộ khung đánh giá của Aliba​ba.

Đang chạy nó

Các trọng số là 18 phân đoạn BF16 ở định dạng Transformers, và thẻ liệt kê Hugging Face Transformers, vLLM, SGLang và TokenSpeed là các stack được hỗ trợ. Chúng tôi đã viết riêng các lộ trình triển khai cục bộ và lượng tử hóa, và đó là những nơi phù hợp cho chi tiết đó: Qwen3.8-27B trên Ollama cho daemon cục bộ, và phần hướng dẫn benchmark để có bảng điểm đầy đủ, bao gồm những gì đã thay đổi so với Qwen3.6-27B. Trang này chỉ tập trung vào chính mô hình.

Qwen3.8-27B trên danh mục của chúng tôi

Hai card đang hoạt động trên OrcaRouter ngay hôm nay, nằm cạnh nhau, và cả hai đều đã được đọc lại vào ngày 2026-09-28 trước khi đoạn này được viết. qwen/qwen3.8-27b có giá niêm yết là 0,33 USD cho mỗi triệu token đầu vào và 2,40 USD cho mỗi triệu token đầu ra với cửa sổ đầy đủ 262.144 token, đầu vào văn bản, hình ảnh và video, cùng các bề mặt suy luận, công cụ, đầu ra có cấu trúc và JSON được phơi mở dưới dạng tham số. Người anh em của nó là obsidian/Qwen3.8-27B — cùng trọng số được phục vụ ở chế độ block-FP8 với tháp thị giác được giữ ở độ chính xác đầy đủ, và, theo đúng lời trong card, "được thiết kế để cung cấp các phản hồi trực tiếp, đầy đủ trên nhiều loại prompt khác nhau" — có giá niêm yết là 0,40 USD đầu vào và 4,21 USD đầu ra. Cả hai đều đáp ứng chat completions và Responses API, nên một tác vụ phân tích tài liệu hoặc ảnh chụp màn hình có thể được trỏ tới một trong hai model dưới cùng một key và một endpoint, mà không cần hợp đồng thứ hai và không cần thay đổi mã.

Để thấy quy mô, sân chơi của chúng tôi đã xử lý 105,1 triệu token qua qwen/qwen3.8-27b trong bảy ngày qua, với thời gian trung vị đến byte đầu tiên là 3,8 giây và tỷ lệ lỗi 3,3% trong cùng khoảng thời gian. Đó là những con số phục vụ của chúng tôi, không phải phán quyết về mô hình.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing a 262K-token context window, text, image and video input, text output, the vision, tools, JSON and reasoning badges, a 3.80-second p50 time to first token, 105.1M tokens served in seven days, and list pricing of $0.33 per million input tokens and $2.40 per million output tokens.

Các tìm kiếm dẫn đến đây

Nhu cầu đằng sau trang này bị phân tán mỏng và nằm ngay ngoài cú nhấp. Trong 28 ngày tính đến 2026-09-25, tài sản của chúng tôi đã nhận 8.931 lượt hiển thị và 273 lượt nhấp trên 69 cách viết chính xác riêng biệt của tên model — "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" và hàng tá cách viết khác của cùng ba token. Vị trí tốt nhất của chúng tôi trên các cách viết lớn nhất nằm trong khoảng 9,0 đến 10,6. Đó là những vị trí chúng tôi giữ được do tình cờ từ các trang khác, và đây chính xác là vấn đề mà một trang canonical khắc phục: ở vị trí thứ chín, bạn đang ở trên trang, và không ai nhấp cả. Nơi duy nhất mà lưu lượng chuyển đổi là phi tiếng Anh — một cách viết tên bằng tiếng Nga của chúng tôi đứng ở vị trí 1,8 và chuyển đổi ở mức 14,4%.

Không có gì trong số đó là bằng chứng về mô hình. Đó là bằng chứng về những gì người ta gõ vào, và đó chính là lý do trang này tồn tại.

Tất cả những điều đó cộng lại thành: một checkpoint dense 27B với bố cục attention thực sự khác thường, giấy phép thoáng, khả năng hiểu video gốc, các điều khoản Apache-2.0 cho phép bạn phát hành một sản phẩm phái sinh, xếp hạng lập trình độc lập thuộc nhóm 25% dẫn đầu trong những gì Artificial Analysis đo lường, và một bảng so sánh do nhà cung cấp công bố mạnh khi đặt cạnh bản tiền nhiệm nhưng trái chiều khi đặt cạnh nhóm tiên phong. Câu hỏi còn bỏ ngỏ là điều mà chưa ai ngoài Alibaba có thể trả lời được — đường dẫn được host với 1M token hành xử thế nào trong môi trường sản xuất, và liệu kiến trúc Flash-Next có xuất hiện trong một mô hình cỡ này hay không.

Lõi 2.4T-A95B đằng sau Qwen3.8-Max đã có trên cùng danh mục: qwen/qwen3.8-max với mức $2.00 / $6.00 mỗi triệu token, nếu 27B không phải kích thước bạn cần.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày