
Qwen3.8-27B: Mô hình đa phương thức nhỏ gọn trong dòng Qwen3.8 của Alibaba
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 316 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 196 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Qwen3.8-27B là thành viên dense, single-node thuộc thế hệ Qwen3.8 của Alibaba: một mô hình ngôn ngữ - thị giác gốc với 27 tỷ tham số, được công bố trên Hugging Face theo giấy phép Apache 2.0, có thể tiếp nhận văn bản, hình ảnh và video rồi trả về văn bản với cửa sổ ngữ cảnh 262.144 token. Đây là trang tham chiếu cho mô hình đó — bản viết chuẩn mực về nó là gì, gọi nó tốn bao nhiêu, và nó có thể làm được những gì — và cần nói rõ ngay từ đầu vì sao lại tồn tại một trang dành cho một mô hình mà trọng số lần đầu xuất hiện vào tháng 8 năm 2026 chứ không phải trong bảy ngày qua. Chúng tôi không đưa tin về một màn ra mắt. Chúng tôi đang trả lời một câu hỏi thường trực: độc giả tìm đến chúng tôi với cái tên "Qwen3.8-27B" hàng nghìn lần mỗi tháng, và cho đến nay chưa có trang nào của chúng tôi nắm giữ câu trả lời đó. Ngày phát hành của chính mô hình, được ghi trên card của Qwen và được Artificial Analysis ghi nhận là 2026-08-14, là một dữ kiện mà trang này dùng để định tuổi mô hình, chứ không phải một sự kiện mà trang đưa tin.
Hãy coi đó là ngoại lệ đúng như nó vốn là: nếu đọc theo tiêu chí bảy ngày nghiêm ngặt, một mô hình từ giữa tháng 8 năm 2026 thì không còn mới, và mục này sẽ bị bỏ qua như một tin tức. Cơ sở ở đây thì khác. Đây là một trang tham chiếu có các số liệu đã được xác minh đối chiếu với model card của chính Qwen, tệp giấy phép của kho lưu trữ, bảng giá Qwen Cloud và Artificial Analysis vào ngày 2026-09-28, và lý do tồn tại của nó là nhu cầu tìm kiếm mà chúng tôi đo lường trực tiếp cùng ngày. Đây không phải là một thông báo thứ hai, và không ai nên hiểu nó như vậy.
27B nằm ở đâu trong dòng sản phẩm Qwen3.8
Thế hệ Qwen3.8 không phải là một mô hình duy nhất, và hậu tố kích thước chính là ý nghĩa cốt lõi của tên gọi. Các ghi chú trong kho lưu trữ của chính Qwen trên khắp dòng mô hình đã nói rõ sự phân chia:
• Qwen3.8-27B — 27B tham số dense, hỗ trợ đầu vào hình ảnh và video gốc, giấy phép Apache 2.0. Thành viên thân thiện với việc triển khai: một mô hình có kích thước đủ để chạy trên một GPU hoặc một nút nhỏ, và cũng là chủ đề của trang này.
• Qwen3.8-Max, được xây dựng trên Qwen3.8-2.4T-A95B — tổng cộng 2,4 nghìn tỷ tham số với 95 tỷ hoạt động, mô hình thuộc lớp Qwen-Max mà Alibaba lần đầu tiên mở trong thế hệ này. Kho của nó đi kèm một giấy phép qwen3.8-max riêng thay vì Apache 2.0.
• Qwen3.8-Flash-Next — bản xem trước kiến trúc thử nghiệm mà Qwen nói sẽ làm nền tảng cho Qwen4, được phát hành theo giấy phép qwen-community-1.0. Qwen3.8-Flash bản lưu trữ được xây dựng trên nền tảng đó.
Vậy nên “27B” không phải là một mức trang bị của mô hình Max; đó là hạng kích thước mà một nhóm đơn lẻ thực sự có thể phục vụ. Điều mà Alibaba tuyên bố nó thừa hưởng là công thức huấn luyện: thẻ mô tả Qwen3.8-27B như tiếp nhận những tiến bộ của thế hệ này trong lập trình, công việc chuyên môn, nghiên cứu và các tác vụ agentic dài hạn, rồi nén chúng vào một checkpoint dense.

Kiến trúc mà Qwen công bố
Mọi số liệu dưới đây đều lấy từ thẻ mô hình tại Qwen/Qwen3.8-27B, vốn là tài liệu của chính nhà cung cấp:
• Tham số — 27B như được quảng cáo. Metadata safetensors của chính kho lưu trữ tổng cộng 27.781.427.952 tham số ở định dạng BF16 trải trên 18 shard, vậy khoảng 27,8B khi tính cả tháp thị giác. Ở đây không có mixture-of-experts: mọi tham số đều được kích hoạt trên mỗi token.
• Kích thước — 64 lớp, chiều ẩn 5.120, chiều trung gian feed-forward 17.408, embedding token và đầu ra LM 248.320 (đã đệm).
• Attention hybrid — bố cục mà Qwen in ra là 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): ba khối attention tuyến tính cho mỗi khối attention đầy đủ, tỷ lệ 3:1. Gated DeltaNet chạy 48 đầu attention tuyến tính cho V và 16 đầu cho QK ở chiều đầu 128; Gated Attention chạy 24 đầu truy vấn so với 4 đầu KV ở chiều đầu 256, với chiều rotary là 64. Tỷ lệ đó là thứ khiến một cửa sổ 262K trở nên khả thi trên một mô hình 27B, và nó cũng chính là dòng mà Qwen3.8-Flash-Next mở rộng bằng attention thưa.
• Dự đoán nhiều token — thẻ cho biết mô hình được huấn luyện bằng MTP qua nhiều bước, thủ thuật drafting giúp tăng tốc quá trình sinh trong các serving stack có hỗ trợ MTP.
• Kiểm soát suy nghĩ — chế độ suy nghĩ được bật theo mặc định và có thể tắt theo từng yêu cầu. reasoning_effort nhận xhigh (mặc định), medium hoặc low, và preserve_thinking được bật theo mặc định để dấu vết lập luận được giữ qua các lượt thay vì bị tạo lại.
Cửa sổ ngữ cảnh và giới hạn đầu ra
Thẻ cho biết 262.144 token nguyên bản, có thể mở rộng lên 1.000.000 bằng RoPE scaling (YaRN). Hướng dẫn phục vụ của chính Qwen cho các lần chạy agentic dài, trong phạm vi 1M đó, là cho phép tối đa 262.144 token cho nội dung suy luận và tối đa 131.072 token cho phản hồi cuối cùng — mức trần là cấu hình phục vụ, không phải thuộc tính cố định của checkpoint.
Có hai cửa sổ cần được tách bạch rõ ràng, vì chúng rất dễ bị nhầm lẫn với nhau. Trọng số mở chạy ở mức 262,144 một cách gốc; còn bản được lưu trữ trên Qwen Cloud, mà thẻ mô hình mô tả là vẫn chưa ra mắt ("dịch vụ sắp ra mắt"), lại được liệt kê trên trang mô hình của Qwen Cloud với ngữ cảnh 1M, đầu vào tối đa 991K, đầu ra tối đa 131K và ngân sách suy luận tối đa 262K. Bảng thông số của sản phẩm được lưu trữ không phải là bảng thông số của checkpoint.
Các phương thức: đầu vào và đầu ra gồm những gì
Đầu vào là văn bản, hình ảnh và video; đầu ra chỉ là văn bản. Thẻ mô hình gọi Qwen3.8-27B là "một mô hình ngôn ngữ – thị giác gốc, hiểu được hình ảnh và video" và đoạn mã ví dụ của nó truyền cả ba loại đầu vào. Không có đầu vào âm thanh, không có tạo hình ảnh và không có đầu ra giọng nói. Bản ghi mô hình của Artificial Analysis cho cùng checkpoint cũng đồng tình về phạm vi này — đầu vào gồm hình ảnh, video và văn bản, đầu ra là văn bản — đây là một góc nhìn thứ hai hữu ích vì nó không phải là trang của chính Alibaba.
Bản phát hành Apache 2.0 thực sự cho phép những gì
Giấy phép này không phải là một bản tóm tắt trên bài đăng blog nào đó; kho lưu trữ mang chính văn bản Apache License, Version 2.0, và siêu dữ liệu của thẻ khai báo license: apache-2.0. Những gì giấy phép cấp, đọc từ chính văn bản giấy phép: một giấy phép bản quyền vĩnh viễn, trên toàn thế giới, miễn phí bản quyền để sao chép, tạo tác phẩm phái sinh, hiển thị công khai, cấp phép lại và phân phối tác phẩm cùng các tác phẩm phái sinh của nó, và một giấy phép sáng chế từ những người đóng góp — trong đó sử dụng thương mại nằm trong số các mục đích được phép, không có hạn chế về lĩnh vực sử dụng, không có ngưỡng số lượng người dùng và không cần thỏa thuận thương mại riêng. Apache 2.0 cũng mang tính cấp phép thoáng (permissive) theo đúng nghĩa quan trọng đối với việc phát hành sản phẩm: trọng số phái sinh có thể được phân phối lại theo các điều khoản khác, miễn là bạn giữ nguyên các thông báo giấy phép và ghi nhận nguồn gốc, đồng thời nêu rõ những gì bạn đã thay đổi (Mục 4a–4c). Mục 6 không cấp bất kỳ quyền nào đối với tên gọi hay nhãn hiệu Qwen, vì vậy một bản fork theo Apache-2.0 không thể tự quảng bá mình là Qwen.
Việc so sánh trong nội bộ dòng mô hình này rất đáng chú ý, và có thể thấy rõ từ các repository chứ không phải từ mức độ phủ sóng: checkpoint 2.4T-A95B tự nhận mình là other với giấy phép qwen3.8-max, còn Qwen3.8-Flash-Next thì dùng qwen-community-1.0. Mô hình 27B là mô hình duy nhất trong ba mô hình được phát hành theo Apache 2.0 nguyên bản.
Vị trí đánh giá chuẩn độc lập
Artificial Analysis đã chạy mô hình, và kết quả của nó đáng được tách riêng khỏi bảng riêng của Alibaba vì hai bên trả lời những câu hỏi khác nhau. Chỉ số độc lập, được đo trên xhighcấu hình
• Intelligence Index 33.7 — giá trị lưu trữ của Artificial Analysis, giá trị mà trang mô hình của nó in ra được làm tròn thành 34. Có hai thứ hạng được công bố và chúng đo các nhóm khác nhau: ô tóm tắt của chính trang đó xếp mô hình ở vị trí thứ nhất trong số 142 mô hình thuộc lớp kích thước của nó, theo so sánh cùng lớp mà chú thích nổi của trang mô tả, trong khi dòng lấy nguồn từ Artificial Analysis trong danh mục của chúng tôi ghi nhận vị trí thứ 45 trong số 145, khoảng phân vị thứ 67. Không cái nào là thứ hạng so với cùng một nhóm như cái kia, nên đừng đọc chúng như một con số ở hai định dạng.
• Chỉ số Lập trình 68.1 — được ghi trong danh mục của chúng tôi với artificialanalysis.ai là nguồn được nêu tên, xếp thứ 35 trong số 138 trong nhóm của chỉ số đó. Mô hình này có thứ hạng về lập trình cao hơn so với trí tuệ tổng quát, điều này nhất quán với hình dạng bảng của chính nhà cung cấp.
• Thang mức nỗ lực, cùng một harness — giảm mức nỗ lực suy luận làm chỉ số dịch chuyển rất xa: 33,7 ở mức xhigh, 27,6 ở mức medium, 26,2 ở mức low, và 20,2 khi tắt hoàn toàn suy luận. Đó là mức chênh lệch đo được lên tới 13,5 điểm, và đây là lập luận cụ thể nhất cho việc tinh chỉnh mức nỗ lực theo từng khối lượng công việc thay vì theo từng mô hình.
• Hai nguồn đồng thuận và bất đồng ở đâu — trên GPQA Diamond, thẻ của Alibaba báo cáo 89,2 còn Artificial Analysis đo được 90,5. Ở Humanity's Last Exam, thẻ báo cáo 30,8 và Artificial Analysis là 33,9. Gần nhau, nhưng không cùng một con số, và điều đó là bình thường: khung đánh giá khác nhau, các lần chạy khác nhau. Một lưu ý nên nằm trong bài viết chứ không phải ở chú thích — chưa có bên thứ ba nào công bố so sánh trực tiếp giữa Qwen3.8-27B và bất kỳ mô hình nào trong bảng so sánh của Alibaba khi chạy ở cùng mức nỗ lực trên cùng một khung đánh giá, nên mọi so sánh giữa các mô hình trên trang này đều là so sánh những phép đo riêng lẻ, chứ không phải một kết quả.

Qwen báo cáo những gì và cách đọc nó
Thẻ mô hình mang khoảng hai chục điểm số với các cột so sánh cho Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B và Opus4.6 Max. Tất cả đều do nhà cung cấp báo cáo và chưa được tái lập — đánh giá của chính Alibaba, do Alibaba công bố — và một số hàng sử dụng harness Claude Code được chấm bởi một bản dựng GPT-5.4, điều mà chú thích cuối trang của thẻ ghi rõ. Những con số nhà cung cấp được nêu bật, trên cơ sở đó:
• Lập trình terminal dạng agentic — Terminal Bench 2.1 (Terminus) 73.0, so với 63.4 của Qwen3.6-27B mà nó thay thế, với Opus4.6 Max dẫn đầu hàng ở mức 78.2.
• Lập trình dạng tác tử — SWE-bench Pro 61.7, QwenSWEBench 79.0, DeepSWE 1.1 42.2, NL2Repo-Bench 42.3, LiveCodeBench v6 90.3.
• Tác nhân và công việc văn phòng — CoWorkBench 70.7, JobBench 33.4, Agents' Last Exam 42.9 theo điểm số (Pass@1 20.4).
• Suy luận tổng quát — GPQA Diamond 89,2, HLE 30,8, IFBench 79,5. Opus4.6 Max dẫn đầu cả hai hàng suy luận trong bảng của chính nhà cung cấp, ở mức 91,3 và 40,0.
• Thị giác và sử dụng máy tính — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.
Bản tóm tắt trung thực về bảng đó thì hẹp hơn vẻ ngoài của bảng. So với phiên bản tiền nhiệm trực tiếp, mức cải thiện là lớn và nhất quán — QwenSWEBench 79.0 so với 49.3, DeepSWE 42.2 so với 13.3 — và đó là một nhận định về một thế hệ thay đổi công thức. So với các mô hình tiên phong ở các cột lân cận, nó thắng một số hàng và thua một số hàng khác, trên chính các con số của Alibaba, theo chính lựa chọn bộ khung đánh giá của Alibaba.
Đang chạy nó
Các trọng số là 18 phân đoạn BF16 ở định dạng Transformers, và thẻ liệt kê Hugging Face Transformers, vLLM, SGLang và TokenSpeed là các stack được hỗ trợ. Chúng tôi đã viết riêng các lộ trình triển khai cục bộ và lượng tử hóa, và đó là những nơi phù hợp cho chi tiết đó: Qwen3.8-27B trên Ollama cho daemon cục bộ, và phần hướng dẫn benchmark để có bảng điểm đầy đủ, bao gồm những gì đã thay đổi so với Qwen3.6-27B. Trang này chỉ tập trung vào chính mô hình.
Qwen3.8-27B trên danh mục của chúng tôi
Hai card đang hoạt động trên OrcaRouter ngay hôm nay, nằm cạnh nhau, và cả hai đều đã được đọc lại vào ngày 2026-09-28 trước khi đoạn này được viết. qwen/qwen3.8-27b có giá niêm yết là 0,33 USD cho mỗi triệu token đầu vào và 2,40 USD cho mỗi triệu token đầu ra với cửa sổ đầy đủ 262.144 token, đầu vào văn bản, hình ảnh và video, cùng các bề mặt suy luận, công cụ, đầu ra có cấu trúc và JSON được phơi mở dưới dạng tham số. Người anh em của nó là obsidian/Qwen3.8-27B — cùng trọng số được phục vụ ở chế độ block-FP8 với tháp thị giác được giữ ở độ chính xác đầy đủ, và, theo đúng lời trong card, "được thiết kế để cung cấp các phản hồi trực tiếp, đầy đủ trên nhiều loại prompt khác nhau" — có giá niêm yết là 0,40 USD đầu vào và 4,21 USD đầu ra. Cả hai đều đáp ứng chat completions và Responses API, nên một tác vụ phân tích tài liệu hoặc ảnh chụp màn hình có thể được trỏ tới một trong hai model dưới cùng một key và một endpoint, mà không cần hợp đồng thứ hai và không cần thay đổi mã.
Để thấy quy mô, sân chơi của chúng tôi đã xử lý 105,1 triệu token qua qwen/qwen3.8-27b trong bảy ngày qua, với thời gian trung vị đến byte đầu tiên là 3,8 giây và tỷ lệ lỗi 3,3% trong cùng khoảng thời gian. Đó là những con số phục vụ của chúng tôi, không phải phán quyết về mô hình.

Các tìm kiếm dẫn đến đây
Nhu cầu đằng sau trang này bị phân tán mỏng và nằm ngay ngoài cú nhấp. Trong 28 ngày tính đến 2026-09-25, tài sản của chúng tôi đã nhận 8.931 lượt hiển thị và 273 lượt nhấp trên 69 cách viết chính xác riêng biệt của tên model — "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" và hàng tá cách viết khác của cùng ba token. Vị trí tốt nhất của chúng tôi trên các cách viết lớn nhất nằm trong khoảng 9,0 đến 10,6. Đó là những vị trí chúng tôi giữ được do tình cờ từ các trang khác, và đây chính xác là vấn đề mà một trang canonical khắc phục: ở vị trí thứ chín, bạn đang ở trên trang, và không ai nhấp cả. Nơi duy nhất mà lưu lượng chuyển đổi là phi tiếng Anh — một cách viết tên bằng tiếng Nga của chúng tôi đứng ở vị trí 1,8 và chuyển đổi ở mức 14,4%.
Không có gì trong số đó là bằng chứng về mô hình. Đó là bằng chứng về những gì người ta gõ vào, và đó chính là lý do trang này tồn tại.
Tất cả những điều đó cộng lại thành: một checkpoint dense 27B với bố cục attention thực sự khác thường, giấy phép thoáng, khả năng hiểu video gốc, các điều khoản Apache-2.0 cho phép bạn phát hành một sản phẩm phái sinh, xếp hạng lập trình độc lập thuộc nhóm 25% dẫn đầu trong những gì Artificial Analysis đo lường, và một bảng so sánh do nhà cung cấp công bố mạnh khi đặt cạnh bản tiền nhiệm nhưng trái chiều khi đặt cạnh nhóm tiên phong. Câu hỏi còn bỏ ngỏ là điều mà chưa ai ngoài Alibaba có thể trả lời được — đường dẫn được host với 1M token hành xử thế nào trong môi trường sản xuất, và liệu kiến trúc Flash-Next có xuất hiện trong một mô hình cỡ này hay không.
Lõi 2.4T-A95B đằng sau Qwen3.8-Max đã có trên cùng danh mục: qwen/qwen3.8-max với mức $2.00 / $6.00 mỗi triệu token, nếu 27B không phải kích thước bạn cần.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
