
AesCode 32B vs Qwen3.8 27B: Microsoft đã xây dựng nó trên Qwen, và một trong hai có thể gọi được
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 85 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Chi tiết làm thay đổi toàn bộ cục diện của so sánh này nằm ở dòng thứ hai của thẻ mô hình: AesCode 32Bbắt đầu từ Qwen3-VL-32B-Instruct. Mô hình mã chuyên cho thiết kế của Microsoft là một bản tinh chỉnh Qwen3-VL, Apache 2.0, nằm trên một kho Hugging Face được tạo ngày 29 tháng 9 năm 2026, với commit mang tiêu đề "Release AesCode-32B" ngày 7 tháng 10 năm 2026 và không có bất kỳ thông báo nào từ Microsoft ở đâu cả. Qwen3.8 27B là đầu bên kia của dòng dõi đó: mô hình đa phương thức dense 27B trọng số mở của chính nhà cung cấp, phát hành ngày 14 tháng 8 năm 2026 theo Apache 2.0, kiến trúc kế nhiệm của checkpoint VL mà Microsoft đã tinh chỉnh. Vậy đây không phải là cuộc đối đầu giữa những nỗ lực chủ lực của hai nhà cung cấp. Đây là cuộc đối đầu giữa mô hình trọng số mở đa dụng của một phòng thí nghiệm và bản tinh chỉnh nghiên cứu thuộc cùng dòng họ của một đối thủ, và khác biệt thực tế giữa chúng hóa ra gần như hoàn toàn nằm ở việc bạn được phép làm gì với tệp sau khi đã có nó.
Cùng giấy phép, cùng dòng, số lượng model khác nhau.
Cả hai đều là Apache 2.0, cả hai đều nhận cả hình ảnh lẫn văn bản và cả hai đều trả về văn bản. Mọi thứ sau đó đều khác biệt, và hàng triển khai khác biệt mạnh nhất.
• Tham số — AesCode 32B: 33B dense trên nền Qwen3-VL-32B-Instruct. Qwen3.8 27B: 27B dense, 28B nếu tính cả bộ mã hóa thị giác, 64 lớp với kích thước ẩn là 5120.
• Bộ nhớ để chạy nó — AesCode 32B: thẻ khuyến nghị dự trù khoảng 65 GB bộ nhớ tăng tốc chỉ riêng cho các tham số bf16, và ví dụ phục vụ của chính nó sử dụng song song tensor bốn chiều. Qwen3.8 27B: khoảng 55.6 GB ở dạng bf16.
• Ngữ cảnh — AesCode 32B: 24.576 token trong cấu hình được báo cáo, với prompt và phản hồi ở thời điểm huấn luyện được giới hạn tối đa ở 8.192. Qwen3.8 27B: 262.144 token nguyên bản, có thể mở rộng lên 1.000.000 bằng phương pháp mở rộng YaRN.
• Attention — AesCode 32B: kế thừa từ backbone Qwen3-VL. Qwen3.8 27B: lai, 48 lớp linear-attention Gated DeltaNet so với 16 lớp full-attention theo tỷ lệ 3:1, chính điều này khiến việc phục vụ cửa sổ 262K trở nên khả thi về chi phí.
• Mục đích sử dụng — AesCode 32B: tạo ra các sản phẩm trực quan giàu thông tin dưới dạng HTML và CSS có thể chỉnh sửa, cùng với nghiên cứu về sinh mã đa phương thức. Qwen3.8 27B: công việc tác tử và đa phương thức nói chung — lập trình, sử dụng máy tính, hiểu tài liệu và video, gọi công cụ.
• Nơi bạn tải về — AesCode 32B: bản tải xuống từ Hugging Face; không có nhà cung cấp suy luận nào triển khai nó. Qwen3.8 27B: trọng số, hoặc một endpoint được lưu trữ.
Ngữ cảnh gấp đôi, mức chiếm dụng nhỏ hơn một chút, backbone mới hơn một thế hệ, và giấy phép thì giống hệt. Hàng duy nhất mà AesCode 32B thắng áp đảo là hàng đầu tiên, và nó thắng được hàng đó nhờ fine-tune chuyên biệt cho tác vụ.
Mỗi thứ thực sự được đo lường dựa trên điều gì
Hai chế độ đánh giá không hề giao nhau, và giả vờ rằng có là lỗi điển hình trên những trang như trang này.
Thẻ của Qwen3.8 27B vừa bao quát vừa cụ thể cùng một lúc. Lập trình: Terminal-Bench 2.1 đạt 73.0, SWE-bench Pro đạt 61.7, QwenSWEBench đạt 79.0, LiveCodeBench v6 đạt 90.3. Suy luận: GPQA Diamond 89.2, Humanity's Last Exam 30.8. Sử dụng máy tính: OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9. Thị giác: MathVision 94.6 với phần tăng cường lúc suy luận của nhà cung cấp và 90.0 khi không có nó, OmniDocBench 1.5 đạt 91.1. Tất cả đều là số liệu của chính nhà cung cấp trên harness của chính nhà cung cấp — kèm một chú thích đáng đọc, rằng các lần chạy SWE-bench Pro và QwenSWEBench đã dùng harness Claude Code, nên chúng không thể so sánh trực tiếp với các mô hình được chấm điểm trên một harness khác.
AesCode 32B chỉ có một benchmark duy nhất và đây là một benchmark đơn mục đích: 300 mẫu infographic, ba lần tạo sinh cho mỗi prompt mà không qua chọn lọc, được kết xuất và chấm điểm trên bảy kênh. Điểm đáng chú ý nhất là điểm Tổng thể 85,89 khi có ảnh tham chiếu được cung cấp, so với 81,28 của GPT-5.5 và 80,39 của Claude Opus 4.8 trong cùng một khung đánh giá — cùng với tuyên bố rằng AesCode 32B vượt qua mô hình nền Qwen3-VL-32B của chính mình 22,4 điểm ở hạng mục Hình ảnh và 24,8 điểm ở hạng mục Tổng thể.
Đặt chúng cạnh nhau thì chẳng có gì khớp. Terminal-Bench đo lường liệu một tác vụ shell có hoàn thành hay không; đánh giá AesCode đo lường liệu văn bản của một infographic có dễ đọc không, bố cục của nó có không tràn khỏi khung vẽ và bảng của nó có phải là một bảng HTML thật hay không. Không có thước đo chung, không có harness chung và không có tác vụ chung. Tuyên bố trung thực duy nhất là AesCode 32B giỏi hơn nhiều về các sản phẩm thiết kế so với backbone của chính nó, và Qwen3.8 27B là một mô hình tổng quát mạnh — và cả hai nhận định đều không cho bạn biết gì về cái còn lại.

Lần này khoảng trống bằng chứng là có thật, theo một hướng
Điểm chuẩn do nhà cung cấp công bố là chuyện thường thấy trong ngành này, nên điều đáng lưu tâm là hai cái này khác nhau ở chỗ có bao nhiêu tuyên bố của nhà cung cấp đã được người khác kiểm chứng.
Qwen3.8 27B ra mắt với bảng kết quả của chính nhà cung cấp, rồi chỉ trong vài tuần đã tích lũy thêm các kết quả từ bên ngoài. Hồ sơ độc lập của mô hình bao gồm một nghiên cứu về tác nhân pháp lý do công ty AI pháp lý Harvey thực hiện cùng startup về bộ nhớ Engram, trong đó một Qwen3.8 27B đã được tinh chỉnh dẫn đầu mọi mô hình mà nghiên cứu đem ra thử nghiệm, bao gồm cả Claude Opus 4.8, trên 250 tác vụ pháp lý — kèm lưu ý quan trọng rằng mô hình được tinh chỉnh trước đó đã học kho ngữ liệu 100 triệu token của công ty được đưa vào kiểm nghiệm, nên đây là kết quả nói về khả năng thích ứng cũng nhiều như nói về chính bản thân mô hình. Hồ sơ đó cũng bao gồm một vị trí trên bảng xếp hạng WebDev của Code Arena và vị trí dẫn đầu nhóm trọng số mở trên bảng xếp hạng Image-to-WebDev của Arena.ai, cả hai đều là những tuyên bố về thứ hạng được nhà cung cấp chuyển tiếp chứ không phải phương pháp luận đã công bố. Và hồ sơ còn có một bảng xếp hạng của bên thứ ba với điểm số đã công bố: Artificial Analysis ghi nhận Qwen3.8 27B đạt 33,70 trên Chỉ số Trí tuệ của mình với chi phí cho mỗi tác vụ hoàn thành khoảng 1,01 USD, đồng thời công bố bảng phân tích token đằng sau con số đó.
AesCode 32B không có bất kỳ điều nào trong số đó. Không có vị trí trên arena, không có niêm yết trên bảng xếp hạng, không có tái lập bởi bên thứ ba, không có kiểm thử thông lượng độc lập — và không phải vì ai đó đã nhìn vào và thấy nó không đạt yêu cầu, mà vì một checkpoint không được nhà cung cấp nào phục vụ thì ngay từ đầu không thể được đánh giá bởi một harness bên ngoài. Các con số của nó là của nhà cung cấp, được tính bằng chính ngăn xếp xác minh đã huấn luyện mô hình, trên các mẫu do nhà cung cấp chọn, so với các baseline do nhà cung cấp chạy. Bản phát hành minh bạch một cách bất thường về phương pháp — tên các kênh thưởng, số lượt rollout, tham số giải mã và tỷ lệ thất bại đều được công bố — nhưng minh bạch về cách một con số được tạo ra không giống với việc người khác tạo ra nó.
Cái mà đòi hỏi phải có thẻ lưu trên hồ sơ
Đây là lúc dòng dõi thôi còn là chuyện vụn vặt và bắt đầu trở thành quyết định.
AesCode 32B đòi hỏi bạn 65 GB bộ nhớ tăng tốc, một luồng phục vụ đa phương thức và sự sẵn lòng chạy một mô hình chưa được công bố với vai trò người dùng tiên phong. Ví dụ phục vụ của chính nó cần tới song song tensor bốn chiều, và mô hình được tài liệu hóa cho ngữ cảnh 24.576 token mà không có tùy chọn dịch vụ được host nào để dự phòng. Nếu bạn đã sở hữu phần cứng và pipeline của bạn thực sự cần tinh chỉnh dành riêng cho thiết kế, thì đó là một sự đánh đổi hợp lý. Đối với hầu hết các nhóm, đó là một dự án kéo dài hai tuần trước khi có được kết quả hữu ích đầu tiên.
Qwen3.8 27B được tự vận hành trên hạ tầng riêng của OrcaRouter và có thể gọi ngay hôm nay với mức giá 0,33 USD mỗi triệu token đầu vào và 2,40 USD mỗi triệu token đầu ra, cùng ngữ cảnh 262.144 token và đầu vào dạng văn bản, hình ảnh lẫn video. Đây là mức giá niêm yết được chuyển thẳng, không cộng thêm phụ phí từ phía chúng tôi, và mô hình nằm trên cùng một khóa với hơn 200 mô hình khác, nên việc so sánh với bất kỳ lựa chọn thay thế nào trong danh mục chỉ là một tham số trong yêu cầu chứ không phải một hợp đồng thứ hai. Đó là toàn bộ lập luận thực tế, và nó là một lập luận lớn: mô hình kém backbone của AesCode 32B một thế hệ xét về dòng họ lại chính là mô hình bạn có thể đánh giá ngay chiều nay, trên chính các prompt của mình, với chi phí chỉ vài xu.
Có một điểm bậc hai ở đây mà góc nhìn định tuyến làm cho trở nên cụ thể. Bởi vì AesCode 32B là một bản tinh chỉnh của một checkpoint Qwen3-VL, họ mô hình này mang đến cho bạn một cách rẻ để kiểm tra liệu phía hosted của kiến trúc có hoạt động được chút nào không trước khi bạn cam kết tự host bất cứ thứ gì. Qwen3-VL 235B A22B Instruct có sẵn với giá 0,40 đô la cho mỗi triệu token đầu vào và 1,60 đô la đầu ra, và Qwen3-VL 8B Instruct với giá 0,18 và 0,70 đô la. Cả hai đều không phải là AesCode 32B và cả hai đều chưa được huấn luyện để đạt chất lượng thiết kế — nhưng câu hỏi "liệu một mô hình ngôn ngữ-thị giác có thể đọc ảnh chụp màn hình của chúng ta và viết ra phần markup mà chúng ta cần hay không" có thể được trả lời bằng chúng chỉ với vài xu, và tính năng chuyển đổi dự phòng tự động bên dưới cùng một endpoint nghĩa là một ngày nhà cung cấp gặp trục trặc sẽ không làm sập pipeline.

Ai nên chọn cái nào
Hãy dùng AesCode 32B nếu sản phẩm đầu ra chính là thứ cần bàn giao. Bạn sản xuất slide, bảng điều khiển, poster hoặc báo cáo với số lượng lớn, bạn cần đầu ra có cấu trúc vẫn có thể chỉnh sửa và so sánh khác biệt — mô hình xuất ra một tài liệu HTML hoàn chỉnh, dùng cấu trúc bảng HTML thật và đặc tả ECharts để cả hai vẫn có thể kiểm tra được — và bạn có phần cứng hoặc ngân sách để thuê nó. Hãy chấp nhận ba điều khi bắt tay vào: không có xác minh độc lập cho bất kỳ con số nào, khoảng 65 GB cho trọng số, và ngữ cảnh 24K sẽ hạn chế các tài liệu dài. Tỷ lệ thất bại nghiêm trọng ở ranh giới canvas 4,3% mà card báo cáo, so với 34,7% của GPT-5.5, là con số đơn lẻ đáng khích lệ nhất trong bản phát hành, và con số đó cũng là của Microsoft.
Hãy chọn Qwen3.8 27B nếu bạn cần một mô hình đa phương thức trọng số mở tổng quát mà bạn thực sự có thể chạy và thực sự có thể phục vụ. Ngữ cảnh 262K, có thể mở rộng lên một triệu; mức chiếm dụng triển khai vừa vặn ở nơi AesCode 32B không vừa; vị thế cấp phép không khác gì; một số đo lường độc lập về cả chất lượng lẫn chi phí cho mỗi tác vụ hoàn thành; và một tùy chọn được lưu trữ sẵn nghĩa là bạn có thể bắt đầu ngay hôm nay và tự lưu trữ sau này mà không cần viết lại phần tích hợp. Thiết kế attention theo giai đoạn, theo từng lớp của nó là lý do ngữ cảnh dài có mức chi phí chấp nhận được, và ngữ cảnh dài là thứ mà các pipeline thiết kế và tài liệu có xu hướng cần nhất.
Và nếu bạn cần cả hai — một trình tạo tạo tác thiết kế và một cỗ máy chủ lực đa dụng — thì cách phân chia hợp lý không phải là chạy hai mô hình ngôn ngữ-thị giác lớp 30B trên bộ thiết bị của riêng bạn. Hãy định tuyến lưu lượng chung sang phía dịch vụ lưu trữ và giữ chuyên gia ở dạng tự lưu trữ, nằm sau một khóa duy nhất, nơi việc nhà cung cấp ngừng dịch vụ trên một trong hai đường là một sự kiện chuyển đổi dự phòng chứ không phải một sự cố.

Điều cần chú ý
Vị thế của AesCode 32B thay đổi hoàn toàn nếu nó trở nên có thể gọi được. Hiện tại, điểm yếu thực sự duy nhất của mô hình là khả năng truy cập, và đó là một tình trạng tạm thời — một nhà cung cấp suy luận tiếp nhận checkpoint, hoặc Microsoft công bố một endpoint, sẽ biến việc mua sắm 65 GB thành một lựa chọn mô hình. Cho đến lúc đó, tóm tắt trung thực về cuộc so tài này là: bản tinh chỉnh làm tốt hơn ở một công việc, mô hình tổng quát tốt hơn ở việc có thể dùng được, và mô hình tổng quát hóa ra lại chính là tổ tiên: Microsoft đã chọn một checkpoint Qwen3-VL làm nền tảng để phát triển vì đó là nền tảng đa phương thức mở mạnh nhất hiện có, và bản thân điều đó là thông tin hữu ích nhất mà so sánh này có thể nói về Qwen3.8 27B.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
