
Qwen3.8-27B so với Qwen 3.8: Cùng thế hệ, một GPU so với một Rack
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Tuần này, Alibaba đã đưa Qwen3.8-27B lên làn suy luận nhanh của Cerebras — lần đầu tiên mô hình dense 27B có một tùy chọn chạy trên máy chủ thực sự nhanh — và Artificial Analysis cuối cùng đã lập chỉ mục cho cả hai phía của cuộc đối đầu này. Qwen3.8-27B đạt 34 điểm trên AA Intelligence Index. Qwen 3.8, tức phần lõi mở mà hầu hết mọi người ám chỉ khi viết tên mà không kèm hậu tố, đạt 40 điểm. Hai con số đó đặt lại một phép so sánh mà các bài đưa tin hồi tháng Tám đã phải hoàn toàn dựa vào lời của nhà cung cấp.
Mô hình đằng sau “Qwen 3.8” với tư cách là một tên độc lập là Qwen3.8-2.4T-A95B: trọng số mixture-of-experts 2,4 nghìn tỷ tham số mà Alibaba đã công bố theo một giấy phép tùy chỉnh. Qwen3.8-27B là thành viên dense cùng thế hệ — khoảng 27 tỷ tham số, Apache 2.0, được thiết kế cho một GPU đơn. Chúng chia sẻ tên họ, độ dài ngữ cảnh gốc 262K và một cửa sổ ra mắt. Mọi thứ khác về chúng là một minh họa cho sự đối lập: một cái bạn có thể sở hữu, cái kia bạn chỉ có thể thuê. Đây là mục đích thực sự của từng mô hình, giờ đây khi cả hai đều đã có những con số độc lập.
Cùng một thế hệ, những hình dạng đối lập
Qwen3.8-27B là một mô hình dense — 27B tham số (28B nếu tính cả bộ mã hóa thị giác), 64 lớp, một ngăn xếp attention lai gồm 48 lớp linear-attention Gated DeltaNet so với 16 lớp full-attention. Chính sự lai này là lý do một mô hình 27B có thể mang 262.144 token ngữ cảnh gốc. Qwen3.8-2.4T-A95B là kiến trúc chủ lực: tổng 2,4T tham số, khoảng 95B tham số hoạt động mỗi token, 92 lớp với 512 chuyên gia mỗi lớp, và 69 trong số 92 lớp đó dùng linear attention. Cùng một mẹo, với dấu chân gấp chín mươi lần.
• Kiến trúc — Qwen3.8-27B: 27B dense, mỗi token đều kích hoạt toàn bộ mô hình. Qwen3.8-2.4T-A95B: tổng 2.4T / ~95B hoạt động MoE.
• Ngữ cảnh — cả hai đều có 262K native; phần mở rộng 1M của 27B chỉ có trên hosted, còn 2.4T đạt ~984K đo được.
• Đầu vào — Qwen3.8-27B: văn bản, hình ảnh và video. Qwen3.8-2.4T-A95B: chỉ văn bản, chế độ suy luận được khóa bật.
• Giấy phép — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: Giấy phép Qwen3.8-Max tùy chỉnh.
• Trọng số — Qwen3.8-27B: 55,6GB BF16, lượng tử hóa thành bản Q4 ~16GB. Qwen3.8-2.4T-A95B: ~2,4TB BF16, một rack GPU, không phải máy để bàn.
• Nơi bạn gặp chúng — Qwen3.8-27B: tự host hoặc thuê với giá rẻ. Qwen3.8-2.4T-A95B: thuê, vì chẳng ai tỉnh táo lại tự sở hữu rack.
Số độc lập, cuối cùng cũng đã có
Mọi bài đối chiếu tháng Tám về Qwen3.8-27B đều mang cùng một lưu ý: “chưa có điểm số độc lập nào.” Điều đó không còn đúng nữa. Artificial Analysis đã đo cả hai mô hình tính đến tuần này, và hình dạng của dữ liệu thực sự thú vị.
Trên Intelligence Index, Qwen3.8-2.4T-A95B đạt 40 điểm, xếp thứ 4 trong số 113 mô hình cùng lớp. Qwen3.8-27B đạt 34 điểm — đưa nó lên vị trí đầu tiên trong số 140 mô hình thuộc lớp kích thước 4–40B trọng số mở của mình, một màn thể hiện thực sự mạnh mẽ đối với một mô hình dense 27B. Cả hai đều chậm theo đo lường độc lập: 39,0 token đầu ra mỗi giây đối với 27B và 38,1 đối với 2.4T, so với trung vị của lớp vào khoảng 90. Cả hai đều dài dòng, khi 27B tạo ra khoảng 200M token đầu ra qua các lần chạy chỉ số, so với trung vị của lớp là 68M. Không mô hình nào là mô hình tiên phong hàng đầu; cả hai đều là những mô hình chủ lực, và chỉ số cho thấy 2.4T là mô hình chủ lực mạnh hơn với khoảng cách rõ rệt.

Giá ở phía độc lập cũng kể cùng một câu chuyện bằng đô-la. Artificial Analysis định giá 27B ở mức $0,50 mỗi triệu token đầu vào và $3,00 mỗi triệu token đầu ra trên bản hosted của Qwen Cloud (chiết khấu bộ nhớ đệm 90%), và 2.4T ở mức $2,00 / $6,00 (chiết khấu bộ nhớ đệm 88%). Chi phí cho mỗi tác vụ Intelligence Index: $0,82 cho 27B so với $2,16 cho 2.4T. Mô hình nhỏ hơn chạy rẻ hơn trên mỗi đơn vị trí tuệ — và cả hai đều đắt so với phân khúc tốc độ của chúng vì cả hai đều là mô hình suy luận đốt token đầu ra.
Mọi thứ còn lại — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3 đối với mô hình 27B; Terminal-Bench 2.1 86.6 và SWE-bench Pro 67.7 của mô hình 2.4T — vẫn do nhà cung cấp báo cáo, chưa được tái lập, và được ghi chú như vậy xuyên suốt bài viết này. Các chỉ số AA ở trên là mức sàn độc lập bên dưới tất cả những con số đó.
Việc niêm yết của Cerebras thay đổi những gì
Vào ngày 12 tháng 9 năm 2026, tài khoản Qwen đã thông báo rằng Qwen3.8-27B hiện đang chạy trên Cerebras, mục trong danh mục của nó đã hoạt động dưới biểu ngữ "Qwen 3.8 27B is now available on Cerebras PayGo." Cerebras niêm yết nó ở mức 0,99 đô la cho mỗi triệu token đầu vào và 1,49 đô la cho mỗi triệu token đầu ra trên phần cứng cấp WSE — thứ đã làm nên tên tuổi của công ty về tốc độ. Điều đó mang lại cho mô hình 27B một thứ mà lõi 2,4T chưa từng có: một làn đường nhanh.

Điều này quan trọng vì chậm và dài dòng là điểm trừ thực sự duy nhất đối với 27B ngay từ đầu. Trên bộ kiểm thử độc lập, nó đạt 39 t/s; trên dữ liệu đo từ xa khi phục vụ của chính chúng tôi, nó đã đạt ~154 token đầu ra mỗi giây với độ trễ token đầu tiên ở p50 là 4,48 giây — và giờ đây một nhà cung cấp thứ hai đang cạnh tranh trên chính trục đó. Ngược lại, 2.4T hoàn toàn không có làn nhanh: ở 38 t/s, bạn đang trả mức giá frontier cho tốc độ tầm trung, và cách duy nhất để thoát khỏi tình trạng đó là tự thuê một cụm GPU để chạy trọng số mở.
Ba làn cho 27B, một làn cho 2.4T
Tính đến hôm nay, mô hình dense 27B có thể được thuê theo ba cách, và mức chênh lệch giá rất đáng để tìm hiểu trước khi bạn chọn:
• Làn tự vận hành — Qwen3.8-27B đã hoạt động trên OrcaRouter với giá $0.33 / $2.40 mỗi triệu, chạy trên hạ tầng của chính chúng tôi. Giá đầu vào rẻ nhất trên thị trường dành cho nó, đầu ra ~154 tok/s, ngữ cảnh 262K.
• Kênh nhà cung cấp — bản dựng được lưu trữ của Qwen Cloud, $0,50 / $3,00 mỗi triệu token với ngữ cảnh 1M token và chiết khấu 90% cho bộ nhớ đệm.
• Làn nhanh — Cerebras PayGo, $0.99 / $1.49 mỗi triệu, được định vị dựa trên tốc độ thay vì giá cả.

Bản open core 2.4T không có mức chênh tương đương. API chủ lực phục vụ cùng kiến trúc đó — Qwen3.8-Max — có giá $2.00 / $6.00 mỗi triệu token, và đó là con số không đổi dù bạn gọi nó là Max hay open core. Thay vào đó, nếu chạy trọng số, bài toán kinh tế lại nghiêng về phần cứng: bản 2.4T cần ~2.4TB trọng số BF16 và một node đa GPU, một quyết định đầu tư vốn mà không ai đưa ra một cách tùy tiện. Một GPU 24GB chạy bản build Q4 của 27B với chi phí biên làm tròn về không.
Ví dụ thực tế quyết định phần lớn các đội: 100 triệu token đầu vào và 20 triệu token đầu ra mỗi ngày. Với mức $2/$6 của 2.4T, con số đó vào khoảng $320 một ngày, ~$117.000 một năm. Với 27B ở mức $0.33/$2.40 của chúng tôi, con số đó vào khoảng $81 một ngày — và với bản tự vận hành, chi phí chỉ là tiền điện. 2.4T mang lại cho bạn lợi thế chất lượng thực sự, AA 40 so với 34. Liệu lợi thế đó có đáng với hóa đơn hàng tháng năm chữ số hay không chính là toàn bộ câu hỏi mà sự kết hợp này đặt ra.
Nơi chúng thực sự phân kỳ
Ngoài chỉ mục, ba khác biệt thực tiễn sẽ quyết định cái nào phù hợp với một khối lượng công việc cụ thể.
Đầu vào đa phương thức là bộ lọc dứt khoát nhất. Qwen3.8-27B đọc được văn bản, hình ảnh và video — ảnh chụp màn hình, biểu đồ, tài liệu có hình minh họa, khung hình video đều đi vào cùng một cửa sổ 262K. Qwen3.8-2.4T-A95B thì chỉ hỗ trợ văn bản một cách triệt để. Nếu đầu vào của bạn có bất kỳ thứ gì mang tính hình ảnh, thì 2.4T bị loại bất kể chỉ số cao hơn của nó.
Kiểm soát suy nghĩ là điểm thứ hai. Chế độ suy luận của 27B có thể được tắt theo từng yêu cầu, điều này quan trọng đối với việc trích xuất nhạy cảm với độ trễ, nơi chuỗi suy luận chỉ là chi phí dư thừa; nó cũng để lộ reasoning_effort. Lõi 2.4T không thể tắt suy nghĩ — mỗi phản hồi đều mở đầu bằng một khối think>, và bạn phải trả cho những token đó dù bạn có muốn hay không. API flagship khắc phục được điều này, nhưng lõi mở thì không.
Cấp phép là yếu tố thứ ba, và nó âm thầm quan trọng ở quy mô lớn. Apache 2.0 áp dụng cho 27B là tiêu chuẩn cấp phép thoáng: được sửa đổi, phân phối lại, thương mại hóa, bao gồm cả cấp quyền sáng chế. Bản 2.4T được phát hành theo giấy phép Qwen3.8-Max tùy chỉnh — thoáng về tinh thần, nhưng đó là các điều khoản của Alibaba, không phải tiêu chuẩn cộng đồng, và đáng để đọc tệp trước khi bạn xây dựng sản phẩm dựa trên nó.
Định tuyến quyết định
Cả hai phía của cặp đối đầu này đều có thể truy cập chỉ qua một khóa OrcaRouter, và chính điều đó khiến câu hỏi "tôi nên chọn cái nào" trở nên rẻ để trả lời bằng thực nghiệm. Qwen3.8-27B đang hoạt động với mã qwen/qwen3.8-27b ở mức giá niêm yết của nhà cung cấp, không có phụ phí, và API chủ lực được xây dựng trên cùng lõi 2.4T đang hoạt động với mã qwen/qwen3.8-max ở mức $2.00 / $6.00 mỗi triệu — mức giá của chính Alibaba, được chuyển thẳng, nên mọi thay đổi giá từ nhà cung cấp đều được cập nhật tại đây ngay trong cùng ngày.
Cùng kiến trúc 2.4T đó dưới dạng trọng số có thể tải xuống không phải là thứ chúng tôi cung cấp — nếu bạn muốn lõi mở qua API ngay hôm nay, làn flagship là cách thiết thực để tiếp cận nó, và qwen/qwen3.8 đã được nối sẵn để bật ngay khi một nhà cung cấp phục vụ trọng số mở. Một quy tắc định tuyến gửi lưu lượng hình ảnh và nhạy cảm với độ trễ đến qwen/qwen3.8-27b và phần đuôi suy luận khó đến qwen/qwen3.8-max không tốn gì để thiết lập và tự động chuyển đổi dự phòng giữa các nhà cung cấp. Một khóa, không cần hợp đồng thứ hai, và việc tách này là một thay đổi cấu hình chứ không phải tái kiến trúc — cách rẻ nhất để kiểm tra liệu sáu điểm chỉ số tăng thêm của 2.4T có đáng với $5.67 mỗi triệu token đầu ra đối với bạn hay không.
Ai nên chọn cái nào
• Chọn Qwen3.8-27B nếu đầu vào của bạn bao gồm hình ảnh hoặc video, nếu bạn muốn chế độ suy nghĩ có thể tắt đi, nếu bạn sở hữu GPU 24GB hoặc có ý định mua, hoặc nếu mức chi tiêu trên mỗi token của bạn đủ lớn để mà $0.33/$2.40 so với $2.00/$6.00 chính là toàn bộ lý lẽ.
• Chọn Qwen 3.8 (lõi 2.4T) nếu bạn chỉ dùng văn bản, bạn muốn chỉ số suy luận độc lập mạnh nhất trong dòng (AA 40), và mức giá $2/$6 — hoặc chi phí vận hành một nút GPU — nằm gọn trong ngân sách của bạn.
• Chọn cả hai nếu lưu lượng của bạn trải rộng trên cả hai hồ sơ: định tuyến qua gateway, để router phân tách theo phương thức và độ khó, và đổi ý khi checkpoint hoặc mức giá tiếp theo của một trong hai model ra mắt.
Bản án
Cái tên Qwen 3.8 vốn dĩ luôn là hai sản phẩm giả vờ là một dòng sản phẩm, và giờ cả hai đều có những con số riêng để tranh cãi. Qwen3.8-2.4T-A95B là bộ não mạnh hơn, chỉ văn bản, đắt đỏ, và không thể phủ nhận là có thể sinh lời ở mức $2/$6. Qwen3.8-27B là cái có thể triển khai được — đa phương thức, Apache 2.0, tự lưu trữ được, và tính đến tuần này nó cuối cùng cũng có làn đường nhanh. Khoảng cách chỉ số là có thật: 40 so với 34. Khoảng cách giá cũng vậy: chi phí mỗi token cao hơn khoảng năm lần khi bạn chạy 2.4T dưới dạng API. Với hầu hết các nhóm, quyết định không nằm ở sáu điểm chỉ số. Mà là ở chỗ bạn đang mua token hay mua phần cứng — và 27B là cái duy nhất trong hai cái cho phép bạn mua phần cứng.
