
Đánh giá Qwen3.8-27B: mô hình 27B trọng số mở được ví như "Opus tại nhà" — được kiểm chứng thực tế trước sự thổi phồng
- obsidianMỚIQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 trên 1 triệu token · 22 tok/s
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
Qwen3.8 27B là mô hình 27B trọng số mở tốt nhất mà bạn có thể tự lưu trữ ngay bây giờ, và không hề có đối thủ sát nút. Bộ trọng số được phát hành ngày 14 tháng 8 năm 2026 theo giấy phép Apache 2.0: một mô hình dense 27B (28B nếu tính cả bộ mã hóa thị giác) với ngữ cảnh gốc 262K, hỗ trợ nguyên bản đầu vào hình ảnh và video, và các điểm số lập trình tác tử do nhà cung cấp công bố nằm ở mức bằng hoặc vượt Claude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Điểm nhấn về giá là con số 0: tải xuống 55.6 GB và chạy nó. Các lưu ý cũng rất thực — kiểm thử độc lập cho thấy nó chậm hơn khoảng ba lần và tốn token hơn nhiều so với phiên bản tiền nhiệm, mọi điểm chuẩn trên bảng thông số vẫn do Alibaba công bố, và ngữ cảnh 1M là tính năng chỉ có ở phiên bản hosted. Kết luận: nếu bạn có GPU từ 24 GB trở lên và muốn năng lực gần tiên phong mà không phải trả phí theo mức sử dụng, hãy tự lưu trữ nó — nhưng hãy bắt đầu khi đã biết chính xác những con số nào còn chưa chắc chắn.
Kết luận trước: bạn có nên sử dụng Qwen3.8 27B?
Câu trả lời ngắn gọn — có, đối với khối lượng công việc cục bộ và riêng tư; hãy chờ số liệu từ bên thứ ba trước khi quyết định mua sắm. Qwen3.8 27B là mô hình hiếm hoi mà trọng số mở là sản phẩm và API là sự tiện lợi. Vì giấy phép là Apache 2.0, giá mỗi token vĩnh viễn bằng 0 khi bạn đã có phần cứng, và không gì bạn xây dựng trên nó có thể bị cấp phép lại hoặc tính phí hồi tố. Điều bạn đánh đổi là tốc độ, sự xác minh và sự tiện lợi.
Nếu bạn đã chạy Qwen3.6-27B và hài lòng với nó, thì bản nâng cấp là có thật nhưng không miễn phí về mặt thời gian thực tế. Nếu bạn đến đây từ buổi ra mắt Qwen3.8-Max, thì đây là thành viên nhỏ hơn, có thể tự lưu trữ trong cùng thế hệ — một công cụ khác cho một công việc khác.
Thông tin nhanh, đã kiểm tra ngày 15 tháng 8 năm 2026
• Phát hành — trọng số đã được phát hành vào ngày 14 tháng 8 năm 2026 tại Qwen/Qwen3.8-27B trên Hugging Face, được nhân bản trên ModelScope; các bài đưa tin theo múi giờ cũng ghi nhận ngày 13 tháng 8, và bản phát hành ra mắt khoảng một tuần sau khi thế hệ Qwen3.8 được công bố.
• Giấy phép — Apache 2.0: tải xuống, sửa đổi, phân phối lại, sử dụng thương mại, kèm theo cấp bằng sáng chế rõ ràng. Vĩnh viễn.
• Tham số — 27B dense (28B tính cả bộ mã hóa thị giác), 64 lớp, kích thước ẩn 5.120, từ vựng 248.320.
• Kiến trúc — cơ chế chú ý lai: 48 lớp chú ý tuyến tính Gated DeltaNet so với 16 lớp Gated Attention đầy đủ (tỷ lệ 3:1). Đây là lý do một mô hình dense 27B có thể mang theo 262K token ngữ cảnh gốc.
• Ngữ cảnh — 262.144 token gốc; có thể mở rộng lên 1.000.000 qua YaRN trên phiên bản lưu trữ.
• Đầu vào — hình ảnh và video gốc cùng với văn bản; trả về văn bản. Bộ mã hóa thị giác là lý do số tham số được ghi là 28B.
• Suy nghĩ — chế độ suy luận bật theo mặc định và có thể tắt theo yêu cầu; reasoning_effort (thấp/trung bình/cao) và preserve_thinking cho các lần chạy agent dài.
• Trọng số — 55,6 GB safetensors BF16 được chia thành 18 phần; FP8 và GGUFs từ cộng đồng cũng được cung cấp.
Các thông số kỹ thuật ở trên được lấy từ thẻ mô hình và cấu hình Hugging Face cho Qwen3.8 27B, được đọc vào hôm nay. Các tuyên bố benchmark do Alibaba công bố; tính đến hôm nay, chưa có phòng thí nghiệm độc lập nào tái tạo được chúng.
Qwen3.8 27B thực sự giỏi ở điểm gì
Trường hợp thuyết phục nhất là kỹ thuật phần mềm tác tử. Alibaba báo cáo DeepSWE 1.1 tăng gấp 3 lần so với phiên bản 27B trước đó (42.2 so với 13.3) và đạt điểm số vượt qua Claude Opus 4.6 Max trên SWE-bench Pro (61.7 so với 53.4). Đó là những con số đã giúp nó có biệt danh "Opus tại nhà" — một mô hình dense 27B thực hiện các tác vụ lập trình gần mức tiên phong trên phần cứng mà một người thực sự có thể sở hữu.

Ba điều ngoài những con số thô khiến đây là một lựa chọn mua hợp lý:
• Đa phương thức nguyên bản. Ảnh và video đầu vào, văn bản đầu ra — một tài liệu có sơ đồ hoặc video hướng dẫn không phải là một mô hình riêng biệt. Điểm suy luận thị giác (85.6 với tính năng chuỗi suy nghĩ được bật, 94.6 toán thị giác, cả hai do nhà cung cấp công bố) là nơi bộ mã hóa thị giác chứng tỏ giá trị của nó.
• 262K ngữ cảnh gốc. Các tác vụ agent tầm xa, codebase lớn và bản ghi nhiều giờ đều vừa trong một cửa sổ. Thiết kế linear-attention lai giúp chi phí KV của ngữ cảnh đó thấp hơn so với mô hình full-attention thuần túy cùng kích thước.
• Trọng số miễn phí, vĩnh viễn.Đây chính là toàn bộ ý nghĩa của danh mục: một mô hình API đóng được thuê; Qwen3.8 27Bthì bạn sở hữu. Ở mức 4-bit, nó chạy trên card 24 GB (loại RTX 3090/4090), và AMD đã cung cấp hỗ trợ Day-0 (lên tới 24.5 tokens/s trên Ryzen AI Max+ 395 và 51.8 tokens/s trên Radeon AI PRO R9700, theo chính blog của AMD).
Nơi bài đánh giá trở nên khó coi: tốc độ, token và xác minh
Việc kiểm tra độc lập cho đến nay mới chỉ là bộ khung kiểm tra của một người thử nghiệm, không phải phòng thí nghiệm — nhưng đó là tín hiệu tốt nhất chúng ta có. Chạy Qwen3.8 27B so với Qwen3.6-27B trên mười tác vụ thực tế (được GPT-5.5 đánh giá thông qua bộ khung llmcompare), bản 3.8 đã thắng chín trên mười và đạt điểm trung bình 8.838 so với 6.862 — "một trong những sự cải thiện trí thông minh ấn tượng nhất" mà người thử nghiệm từng thấy. Nó cũng sử dụng gần gấp ba lần số token và chậm hơn đáng kể; một tác vụ mất thời gian lâu hơn khoảng 600%. Vì vậy, bước nhảy về chất lượng là có thật, và cái giá về thời gian thực tế cũng vậy.
Bốn điểm trừ nữa:
• Chưa có điểm chuẩn từ bên thứ ba. Mọi con số đáng chú ý trong bài viết này do Alibaba công bố tính đến ngày 15 tháng 8. Thẻ thông tin nhà cung cấp rất chi tiết, nhưng việc tái lập bởi một phòng thí nghiệm độc lập vẫn chưa diễn ra. Nếu quyết định của bạn phụ thuộc vào những con số đã được xác minh, hãy chờ chúng — các trọng số vẫn sẽ ở đó.
• Ngưỡng VRAM tối thiểu là có thật. BF16 cần một GPU tầm 80 GB. Để chạy trên card 24 GB, bạn phải dùng bản 4-bit, và phản hồi từ cộng đồng (chuỗi bình luận trên dev.to, vài ngày sau khi phát hành) cho biết các bản lượng tử hóa "mất tập trung khi ngữ cảnh dài." Dùng trọng số chính thức nếu bạn có đủ VRAM; dùng bản lượng tử hóa nếu không.
• Ngữ cảnh 1M chỉ có trên bản hosted. Các trọng số mở giới hạn ở mức 262K. Con số mở rộng lên 1M là tính năng của bản hosted Qwen Cloud, không phải điều mà bản sao cục bộ làm được mặc định.
• "Beats Opus" cần các điều kiện đi kèm. Các benchmark agentic khen thưởng các hành vi đặc thù của harness, và một bình luận hàng đầu trên bài đăng ra mắt tại dev.to đã nói thẳng: "chúng không đánh bại được opus khi sử dụng thực tế." Hãy coi bảng điểm là giới hạn trên trong một ngày thuận lợi, chứ không phải một lời hứa.
Nó nằm ở đâu trong gia đình Qwen 3.8
• so với Qwen3.6-27B — cùng phân khúc phần cứng và ngữ cảnh 262K, nhưng là bước nhảy vọt về khả năng, đánh đổi bằng tốc độ và hiệu suất token. Nếu bạn đã chạy 3.6 và bị giới hạn về thông lượng, giữ nguyên là hợp lý.
• so với Qwen3-Coder-30B-A3B — Coder là một MoE với khoảng 3,3 tỷ tham số hoạt động, chạy nhanh hơn nhiều (~90–110 token/giây). Bản dense 27B chậm hơn mỗi token nhưng kế thừa các lợi ích agentic của thế hệ; nếu điểm số kỹ thuật phần mềm của bản 27B được giữ vững qua kiểm tra độc lập, vai trò của Coder-30B sẽ thu hẹp.
• so với Qwen3.8-Max — mô hình chủ lực 2.4T MoE là mô hình dành cho trung tâm dữ liệu (chỉ dùng qua API, khoảng $2/$6 mỗi triệu token theo các bài viết công bố) với ngữ cảnh 1M và hỗ trợ video. Bản 27B mới là bản có thể triển khai. Chúng giải quyết những câu hỏi khác nhau.
Chi phí: câu hỏi local so với API, đã ngã ngũ
Đối với mô hình đóng, bạn so sánh giá theo từng token. Còn với Qwen3.8 27B thì token biên không tốn chi phí trên phần cứng của bạn — cái giá thực sự là chi phí GPU ban đầu và thời gian của bạn. Ở mức 4-bit, đó là một card 24 GB; còn ở BF16, đó là một máy cấp 80 GB. Nếu bạn chỉ cần đánh giá mô hình, hoặc bạn không có phần cứng, thì vẫn có lựa chọn sử dụng dịch vụ lưu trữ: OrcaRouter hiện liệt kê Qwen3.8 27B với một gói miễn phí có giới hạn tốc độ, tính phí $0 và trả về HTTP 429 khi vượt hạn mức, cùng một gói trả phí với giá $0,33 cho mỗi triệu token đầu vào và $2,40 cho mỗi triệu token đầu ra (kiểm tra ngày 15 tháng 8). Phiên bản lưu trữ của Qwen Cloud, với ngữ cảnh 1M, được đánh dấu là "sắp ra mắt."

Cách nhìn nhận thẳng thắn: đối với mô hình có trọng số mở, nhà cung cấp chỉ là một tiện ích, không phải sự phụ thuộc. Gói miễn phí là cách rẻ nhất để quyết định liệu bản tải xuống 55.6 GB có đáng giá hay không. Nhưng một khi bạn đã quyết định, trọng số mới là thứ quan trọng — và chúng miễn phí.
Cách thực sự thử nó
• Đánh giá nhanh nhất — hãy thử gói lưu trữ miễn phí có giới hạn tốc độ; nếu nó trả lời được điều bạn cần, bạn đã xong việc và không tốn chi phí gì cả.
• Kiểm tra thực tế trên phần cứng của bạn — tải xuống một GGUF từ cộng đồng (bản Q4_K_M nặng khoảng 17 GB và vừa với thẻ 24 GB) và chạy nó trong llama.cpp hoặc Ollama. Truyền mẫu trò chuyện Jinja, nếu không mô hình sẽ trả lời bạn trong các thẻ suy nghĩ. Đối với thị giác từ GGUF, bạn cũng cần tệp mmproj riêng. Runbook của chúng tôi về cách chạy Qwen3.8 27Bcục bộ sẽ hướng dẫn bạn qua từng bước.
• Độ chính xác đầy đủ — dùng huggingface-cli tải Qwen/Qwen3.8-27B lên GPU phân khúc 80 GB.
• Xác minh những gì bạn đã tải xuống — hãy kiểm tra nhà phát hành là tổ chức Qwen và xác thực các shard với crc32.txt; các kho lưu trữ giả mạo đã xuất hiện trước khi phát hành.
Khi bài đánh giá này sai (và ai nên bỏ qua Qwen3.8 27B)
• Bạn không có GPU và sẽ không thuê một cái. Gói miễn phí bị giới hạn tốc độ và gói trả phí là $0.33/$2.40 mỗi triệu — một mô hình API nhỏ có thể phục vụ bạn rẻ hơn và đáng tin cậy hơn. Mô hình này dành cho những người muốn tự sở hữu quá trình suy luận.
• Bạn cần một SLA. Gói lưu trữ mới chỉ vài ngày tuổi; trang mô hình OrcaRouter, đọc hôm nay, cho thấy tỷ lệ lỗi 33,3% trong bảy ngày gần đây và độ trễ token đầu tiên ở phân vị p50 là 225 ms. Đó là một mô hình hoàn toàn mới đang chịu tải ban đầu, không phải một cam kết production. Những người tự lưu trữ nên cố định commit tải về của họ và giữ một phương án dự phòng.
• Bạn cần các benchmark đã được kiểm chứng để đưa ra quyết định mua hàng. Các con số do nhà cung cấp công bố chỉ hữu ích mang tính định hướng, không đạt chuẩn cho việc mua sắm. Hãy chờ kết quả tái lập độc lập.
• Ngữ cảnh 262K open-weights là không đủ. Bản mở rộng 1M hiện chỉ khả dụng dưới dạng hosted.
• Thông lượng là điểm nghẽn của bạn. Tóm tắt hàng loạt hoặc các batch lớn sẽ gây bất lợi: đây là một mô hình dense 27B cũng tiêu tốn lượng token gấp khoảng 3 lần so với phiên bản tiền nhiệm. Với các tác vụ hàng loạt giá rẻ, một mô hình nhỏ hơn hoặc nhanh hơn sẽ thắng.
• Bạn đang dùng card 12 GB. Các GGUF 2-bit nhét vừa đủ nhưng chất lượng giảm rõ rệt; đây không phải là mô hình dành cho bạn.

Điểm mấu chốt
Qwen3.8 27B là mô hình 27B mở trọng số mạnh nhất hiện nay, và miễn phí vĩnh viễn theo Apache 2.0. Nếu bạn có GPU từ 24 GB trở lên, muốn lập trình tác nhân, ngữ cảnh 262K, và đầu vào hình ảnh/video gốc mà không phải trả phí theo mức sử dụng, thì đây là lựa chọn đáng mua. Các lý do để chần chừ cũng cụ thể không kém: bạn cần xác nhận benchmark độc lập, một SLA, mô hình mở trọng số có ngữ cảnh hơn 262K, hoặc thông lượng cao hơn những gì một mô hình 27B dense mang lại. Mô hình đã ra mắt, trọng số là thật, và các con số đều tốt — chỉ cần nhớ những con số đó là của ai.
