Hero card hiển thị 'Qwen3.8-27B for Coding' với phụ đề 'Điều gì sẽ xảy ra trước khi trọng số được phát hành', các chip cho 'khoảng 27B trọng số mở', 'Lập trình tác nhân' và 'Được công bố ngày 3 tháng 8 năm 2026', với logo OrcaRouter ở góc.
Engineering & Research

Qwen3.8-27B cho Lập trình: Những điều cần mong đợi trước khi các trọng số được phát hành

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Nếu bạn chạy các mô hình cục bộ để viết mã, con số quan trọng nhất từ sự kiện ra mắt {{1}}Qwe​n3.8{{/1}} của Alibaba vào ngày 3 tháng 8 năm 2026 không phải là con số gây chú ý 2,4 nghìn tỷ tham số của {{2}}Qwen3.8-Max{{/2}} — mà là điểm {{3}}FrontierSWE{{/3}} đã tăng từ 40,7 ở thế hệ trước lên 73,5 ở thế hệ này. Bước nhảy đó xảy ra ở mô hình chủ lực. Mô hình có thể mang một phần bước nhảy đó lên phần cứng của bạn là {{4}}Qwen3.8-27B{{/4}}, thành viên khoảng 27 tỷ tham số với trọng số mở của thế hệ {{5}}Qwe​n3.8{{/5}}, được công bố cùng ngày và chưa thể tải xuống tại thời điểm bài viết này được viết. Đây là bài viết tổng hợp những gì đã biết cho đến nay, không phải bài đánh giá: chưa ai bên ngoài phòng thí nghiệm của Alibaba chạy thử {{6}}Qwen3.8-27B{{/6}}, chưa có thẻ mô hình chính thức, và bất kỳ bản tải xuống nào hiện tại tự nhận là mô hình này đều là bản giữ chỗ hoặc bản tải lên từ bên thứ ba.

Đây là điểm xuất phát trung thực cho bất kỳ ai đang có kế hoạch thiết lập môi trường lập trình cục bộ xoay quanh 27B: những cải thiện của mẫu flagship mới chỉ được nhà cung cấp báo cáo cho đến khi có các bài chạy độc lập, thông số của bản thân 27B vẫn chưa được xác nhận, và điều duy nhất chúng ta có thể đo được ngay hôm nay là mẫu tiền nhiệm Qwen3.6-27B — vốn đã là một trong những mô hình lập trình cục bộ tốt nhất của năm 2026. Đó chính là mốc chuẩn mà thế hệ này phải vượt qua, và đó là một mốc rất cao.

Vì sao 27B là mô hình mà các lập trình viên thực sự quan tâm

Qwen3.8-Max là mô hình trung tâm dữ liệu: một mô hình hỗn hợp chuyên gia với 2,4 nghìn tỷ tham số, khoảng 95 tỷ tham số hoạt động, ngữ cảnh 1 triệu token và không có lộ trình nào cho người dùng phổ thông chạy cục bộ. Qwen3.8-27B là lựa chọn ngược lại — một mô hình trọng số mở thuộc lớp ~27B được thiết kế cho một GPU đơn, định vị là bản phát hành có thể tự lưu trữ của thế hệ này. Với đối tượng nhà phát triển, bản 27B chính là sản phẩm. Bản Max là minh chứng rằng quá trình huấn luyện của thế hệ này đã tạo ra điều gì đó thực sự.

Điều "gì đó" đó là gì, theo đánh giá của chính Alibaba: Terminal-Bench 2.1 đạt 86.6 (tăng từ 74.5 của Qwen 3.7 Max), SWE-bench Pro đạt 67.7, PaperBench đạt 93.0, và cú nhảy của FrontierSWE từ 40.7 lên 73.5 báo hiệu một bước ngoặt trong lập trình tác tử (agentic coding) tầm xa — mô hình tự động xử lý các tác vụ nhiều bước trong kho mã nguồn thay vì trả lời các prompt đơn lẻ. Các trang theo dõi độc lập cho thấy Qwen3.8-Max đạt chỉ số Coding của Artificial Analysis là 71.8 và chỉ số Intelligence là 58.1, vì vậy bước tiến thế hệ này là có thật ngay cả khi bạn gạt bỏ phần tiếp thị của Alibaba. Không con số nào trong số đó áp dụng trực tiếp cho 27B. Nhưng chúng chính là lý do khiến 27B trở thành mô hình lập trình cục bộ được mong đợi nhất trong nửa cuối năm 2026: một mô hình nhỏ hơn kế thừa dù chỉ một phần nhỏ sự cải thiện tác tử đó sẽ định nghĩa lại ý nghĩa của "lập trình cục bộ tốt" ở quy mô 27B.

Scoreboard titled 'Qwen3.8-27B for coding - what is known' listing: status announced, weights not yet downloadable; class approx 27B, successor to Qwen3.6-27B; 4-bit VRAM 16-24 GB projected; Terminal-Bench 2.1 (Max) 86.6 vendor-reported; FrontierSWE (Max) 73.5 up from 40.7; independent coding score none yet.

Phiên bản tiền nhiệm đã đặt ra tiêu chuẩn: Qwen3.6-27B

Qwen3.6-27B là mô hình mà mọi dự đoán cho 3.8 27B đều được xây dựng dựa trên, vì nó cùng phân loại và cùng cơ chế vật lý. Đây là mô hình dense 27B với ngữ cảnh gốc 262K, chế độ kép suy luận và không suy luận, hỗ trợ nhập văn bản/hình ảnh/video gốc, và giấy phép Apache 2.0. Nó tạo dựng danh tiếng như một công cụ lập trình cục bộ không phải bằng cách thắng mọi benchmark mà bằng cách là mô hình lớn nhất vẫn vừa trên GPU tiêu dùng ở chất lượng sử dụng được — điểm trên đường cong kích thước/chất lượng nơi bạn ngừng đánh đổi khả năng lấy phần cứng.

Đó là cửa sổ ngữ cảnh trên 3.8-27B: nó cần ít nhất phải tốt bằng 3.6-27B ở cùng chi phí phần cứng, và lý tưởng là tốt hơn trong công việc agentic, vì đó là lý do trung thực duy nhất để chuyển đổi. Nếu nó ngang bằng 3.6 về code thô và bổ sung các cải tiến agentic của thế hệ này, nó sẽ trở thành lựa chọn cục bộ mặc định. Nếu nó chỉ chạy lại cùng các điểm số, thì việc nâng cấp chỉ là thay đổi nhỏ.

Thực tế phần cứng: 16 GB là câu hỏi sai.

Vì không có thông số kỹ thuật chính thức nào, các ước tính về VRAM dựa trên các phép đo của Qwen3.6-27B, và tóm lại một cách trung thực thì lượng tử hóa 4-bit là bài toán 24 GB, không phải 16 GB. Ở mức Q4_K_M, trọng số khoảng 16–17 GB, nghe có vẻ như card 16 GB có thể chứa vừa — cho đến khi bộ đệm KV và chi phí phụ trội của mô hình đẩy yêu cầu thực tế lên khoảng 20–24 GB. Hướng dẫn thực tế từ chính bài viết của Alibaba Cloud rất thẳng thắn: Q4_K_M không vừa với GPU 16 GB trong sử dụng thực tế. Các con số từ cộng đồng dao động quanh:

• Q3_K_M — ~13 GB trọng số, tương thích với card 12–16 GB ở chất lượng giảm

• Q4_K_M — khoảng 16–17 GB trọng số, thực tế 20–24 GB khi tính cả ngữ cảnh — điểm tối ưu cho RTX 3090/4090

• Q6_K — ~21–22 GB, gần như lossless trên các card 24 GB

• Q8_0 — ~28.6 GB, cần 32 GB

• Độ chính xác đầy đủ BF16 — ~54–56 GB, ngoài tầm với của mọi GPU tiêu dùng

Unsloth đã xem trước một bản build 4-bit chạy trên khoảng 17 GB, phù hợp với mô hình ~27B ở 4-bit — hãy coi đó là mức sàn cho khối lượng công việc không ngữ cảnh, đã được lược giản, không phải là con số sản xuất của bạn. Nếu bạn đang lên kế hoạch phần cứng, hãy lên kế hoạch dựa trên một card 24 GB.

Toolchain: những gì ra mắt trong ngày đầu tiên so với tuần thứ hai

Khi trọng số được phát hành, hỗ trợ không đến cùng một lúc. Các engine phục vụ vLLM và SGLang thường tích hợp hỗ trợ trong vòng vài ngày sau khi Alibaba phát hành, nhờ đó những người tự lưu trữ nhanh chóng có được endpoint tương thích OpenAI. Các bản lượng tử hóa GGUF và AWQ từ cộng đồng chậm hơn từ một đến hai tuần, nghĩa là trải nghiệm "kéo về và chạy" qua các công cụ dựa trên llama.cpp (Ollama, LM Studio) sẽ chậm hơn so với trọng số gốc — và nếu bản 27B dùng chung kiến trúc thực sự mới với bản Max thay vì tái sử dụng cấu trúc 3.6, hãy dự kiến rằng các công cụ sẽ cần nhiều thời gian hơn. Trong một hoặc hai tuần đầu, con đường nhanh nhất sẽ là dùng vLLM trên trọng số chưa lượng tử hóa, chứ không phải một lệnh kéo về.

Screenshot of the official Qwen Studio blog post 'Qwen3.8-Max: A New Bar for Coding and Cowork', dated 2026/08/03, announcing the Qwen3.8 generation.

Những gì một mô hình 27B thực sự có thể làm cho công việc agentic

Đặt kỳ vọng cho đúng: bản demo tự động 16 ngày — Alibaba's Qwe​n3.8 xây dựng một hệ thống agent tự tiến hóa qua hàng trăm commit mà không có sự can thiệp của con người — là một màn trình diễn hàng đầu. Một model 27B sẽ không làm được điều đó. Điều mà một local coder lớp 27B chứng minh là làm tốt, dựa trên kinh nghiệm cộng đồng với Qwen3.6-27B và Qwen3-Coder-30B-A3B:

• Chăm sóc và phân loại ticket, xác định nguyên nhân gốc rễ, và đặt nền móng để một mô hình mạnh hơn có thể hoàn thành

• Xử lý các đợt tái cấu trúc quy mô kho mã nguồn và các vòng lặp gọi công cụ ở tốc độ tương tác

• Chạy khối lượng lập trình hàng ngày trên máy cục bộ — dữ liệu lưu trên máy của bạn, chi phí cố định

• Duy trì tỷ lệ thành công ~50/50 trong việc sửa hoàn toàn một lỗi thực sự phức tạp — đủ tốt để hữu ích, nhưng chưa đủ tin cậy để trở thành tác nhân duy nhất của bạn

27B là một mô hình khối lượng với phần đuôi phán đoán. Nó sẽ xuất sắc ở phân khúc giữa khối lượng lớn của khối lượng công việc bạn và sai ở mười phần trăm khó nhất. Đó không phải là lỗi; đó là thiết kế.

Xây dựng xoay quanh nó: tách lưu lượng truy cập.

Cách tiếp cận mà hầu hết các đội chọn là chia đôi: mô hình 27B cục bộ xử lý khối lượng công việc — sinh mã thông thường, boilerplate, tái cấu trúc, sửa lỗi kiểu lint — còn mô hình frontier được lưu trữ xử lý phần đuôi khó, nơi mà việc cải thiện thêm vài điểm chất lượng là đáng để trả chi phí API. Cách triển khai sạch sẽ cho sự phân chia đó là thông qua một bộ định tuyến, vì hai phía có tỷ lệ thất bại khác nhau và bạn không muốn agent pipeline của mình bị kẹt vì nút thắt cục bộ hoặc trục trặc của nhà cung cấp.

Đó là quy trình vận hành mà OrcaRouter được xây dựng để phục vụ. Qwen3.8-Max đang hoạt động tại đó theo đúng giá niêm yết của nhà cung cấp — 2 USD mỗi triệu token đầu vào, 6 USD mỗi triệu token đầu ra — chuyển qua không cộng thêm bất kỳ khoản phí nào, nên khi Alibaba hạ giá, hóa đơn của bạn cũng giảm ngay trong ngày. Bạn trỏ một endpoint tương thích OpenAI vào điểm tách luồng, định tuyến phần khó đến Qwen3.8-Max, giữ mô hình 27B cục bộ để xử lý khối lượng lớn khi trọng số của nó được phát hành, và để cơ chế chuyển đổi dự phòng tự động bắt kịp nhà cung cấp chậm hoặc lỗi mà không cần thay đổi mã. Bạn đánh giá mô hình 27B trên phần cứng của riêng mình trong khi đường dẫn sản xuất vẫn hoạt động — mô hình chưa được kiểm chứng sẽ không bao giờ trở thành điểm lỗi đơn lẻ.

Screenshot of the OrcaRouter model page for Qwen3.8 Max showing model ID qwen/qwen3.8-max, $2.00 per 1M input tokens, p50 TTFT 4.84 s, and a code sample.

Những điều cần kiểm tra vào ngày cân nặng được công bố

Khi kho lưu trữ chính thức xuất hiện trên Hugging Face hoặc ModelScope, hãy xác minh những điều này trước khi bạn xây dựng bất cứ thứ gì trên đó:

• Repo nằm trong tổ chức Qwen chính thức — không phải mirror hay kẻ chiếm dụng tên

Tệp LICENSE thực sự tồn tại và khớp với giấy phép mà ghi chú phát hành nêu ra.

Thẻ mô hình tiết lộ cửa sổ ngữ cảnh, kiến trúc (dense hoặc MoE) và các chế độ suy luận.

• Các lần chạy độc lập đầu tiên xuất hiện trên Terminal-Bench hoặc Artificial Analysis — tuyên bố của nhà cung cấp vẫn chỉ là tuyên bố của nhà cung cấp cho đến khi đó

• Hỗ trợ GGUF đã có mặt trong llama.cpp và trình chạy cục bộ yêu thích của bạn

Về điểm cuối cùng đó, nguyên tắc từ trước vẫn được áp dụng: cho đến khi một lần chạy độc lập xác nhận những cải thiện về mã nguồn, hãy coi lời hứa kế thừa từ FrontierSWE là lý do để kiểm thử, chứ không phải lý do để phát hành.

Kỳ vọng, nói một cách công bằng: Qwen3.8-27B là bản phát hành mã nguồn cục bộ hứa hẹn nhất năm 2026 trên lý thuyết — một nền tảng 27B đã được kiểm chứng cộng với một thế hệ thành quả từ huấn luyện tác nhân, với chi phí phần cứng mà cộng đồng đã biết cách chi trả. Liệu nó có thực sự đáp ứng được hay không phụ thuộc vào những gì các trọng số thực sự chứa đựng. Hãy theo dõi kho lưu trữ chính thức, đọc giấy phép, và để điểm chuẩn độc lập đầu tiên quyết định. Cho đến lúc đó, Qwen3.6-27B vẫn đang giữ vị trí, và một flagship lưu trữ định tuyến sẽ gánh vác phần khó khăn còn lại.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube