Một thẻ tiêu đề được tạo tự động, có tiêu đề "AesCode-8B vs Qwen3-8B", với hai thẻ bo tròn đặt cạnh nhau. Thẻ bên trái AesCode-8B mang biểu tượng cửa sổ trình duyệt hiển thị một trang áp phích cùng các dòng "Cơ sở: Qwen3-VL-8B-Instruct" và "Phát ra một trang đã kết xuất"; thẻ bên phải Qwen3-8B mang biểu tượng tài liệu kèm bong bóng hội thoại và các dòng "Mô hình đa dụng của riêng Qwen" và "Văn bản, 119 ngôn ngữ". Một đường phân cách giữa hai thẻ ghi "anh em họ, không phải cha và con" và một dải chú thích chạy ngang phía trên ghi "AesCode-8B không phải là bản tinh chỉnh của Qwen3-8B". Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

AesCode-8B vs Qwen3-8B: Chúng trông như cha và con, nhưng thực tế không phải vậy.

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Những cái tên này rất dễ khiến người ta nhầm lẫn. AesCode-8B là một mô hình 8B với backbone Qwen3-VL-8B-Instruct, Qwen3-8B là mô hình 8B của chính nhà cung cấp, và cách hiểu hiển nhiên là mô hình thứ nhất là bản fine-tune của mô hình thứ hai. Thực tế không phải vậy. Cấu hình được công bố của AesCode-8B khai báo Qwen3-VL-8B-Instruct là base — người anh em vision-language, một checkpoint khác với nhiệm vụ khác — và siêu dữ liệu trên Hugging Face liệt kê nó là bản finetune của mô hình đó, chứ không phải của Qwen3-8B thuần văn bản. Hai mô hình AesCode trong cùng hạng cân nặng này là anh em họ chứ không phải cha và con, và sự phân biệt đó chính là toàn bộ lý do trang này hữu ích: nó cho bạn biết Microsoft đã mua gì khi khởi đầu từ một checkpoint vision-language, điều đó tốn kém ra sao ở phía văn bản, và vì sao khi so sánh với mô hình đa dụng 8B thuần của dòng này, ta lại đang đo một nhánh rẽ chứ không phải một bước nâng cấp.

Cả hai đều theo giấy phép Apache 2.0 và đều có thể tải xuống, nhưng hồ sơ công bố của chúng thì khác nhau một trời một vực. Qwen3-8B được phát hành vào tháng 4 năm 2025 như một phần trong dòng Qwen3 của nhà cung cấp, với tài liệu, tích hợp hệ sinh thái và mười tám tháng triển khai của người khác làm bệ đỡ. AesCode-8B không ghi ngày phát hành ở bất kỳ đâu trong các tệp của nó. Microsoft đã tạo kho lưu trữ Hugging Face vào ngày 2026-09-29, commit các trọng số với thông điệp "Release AesCode-8B" lúc 03:35 UTC ngày 2026-10-07, và đưa mã huấn luyện lên GitHub vào ngày hôm sau. Không có bài đăng trên Microsoft Research, không có ghi chú phát hành, không có trang sản phẩm và không có bài báo — phần trích dẫn trong model card ghi "Under review" với năm giữ chỗ là 2027, và kho lưu trữ chỉ hiển thị hai lượt tải xuống tính đến thời điểm viết bài. Mọi số liệu định lượng về AesCode-8B dưới đây đều do chính Microsoft cung cấp và chưa được ai tái lập.

Cây gia phả mà những cái tên che giấu

Dòng thế hệ Qwen3 bao gồm một số checkpoint lớp 8B cùng chung một dòng dõi và hầu như không chia sẻ nhiều điểm chung nào khác. Qwen3-8B là mô hình tổng quát chỉ dành cho văn bản: tổng cộng khoảng 8,2 tỷ tham số với khoảng 7 tỷ tham số phi embedding, cơ chế attention truy vấn theo nhóm, ngữ cảnh gốc 32K token có thể mở rộng lên 131K nhờ YaRN, và được huấn luyện trên 119 ngôn ngữ và phương ngữ. Nó suy luận, trò chuyện, viết mã và gọi công cụ, và chính vì những lý do đó, nó là một trong những mô hình 8B được tự lưu trữ rộng rãi nhất trong hệ sinh thái mở. Qwen3-VL-8B-Instruct là thành viên đa phương thức: cùng một thế hệ trong gia đình, có thêm một tháp thị giác chuyên dụng ở phía trên, đầu vào là hình ảnh và văn bản, đầu ra là văn bản.

Microsoft bắt đầu từ cái thứ hai. Cấu hình AesCode-8B ghi là Qwen3VLForConditionalGeneration, với 36 lớp ẩn, kích thước ẩn 4.096, 32 đầu attention và 8 đầu key-value, từ vựng 151.936 token và các vị trí mrope xen kẽ, và nó cần transformers 4.57 trở lên. Tổng các shard là 17.543.339.408 byte, khoảng 8,8 tỷ tham số bf16, đó là lý do trường kích thước được làm tròn của Hugging Face ghi 9B trong khi nhà cung cấp ghi 8B. Đó là làm tròn chứ không phải sự sai lệch, và số lượng tham số không phải là điểm rẽ nhánh quan trọng — phương thức đầu vào và ngữ cảnh phục vụ 24.576 token mới là.

Vậy nên cách diễn đạt trung thực không phải là "mô hình tổng quát so với bản fine-tune của nó". Mà là: một mô hình tổng quát chuyên văn bản với ngữ cảnh dài và mười tám tháng lịch sử vận hành thực tế, đối đầu với một checkpoint nghiên cứu đa phương thức chỉ xuất ra một tài liệu và chưa từng được đánh giá độc lập.

A generated two-column scoreboard titled "AesCode-8B vs Qwen3-8B - the scoreboard". Left column AesCode-8B reads Base Qwen3-VL-8B-Instruct, Parameters 8.8B, Output HTML and CSS page, Context 24,576 tokens, Languages English only, Evidence vendor rubric and unreproduced. Right column Qwen3-8B reads Base Qwen3-8B itself, Parameters 8.2B, Output text and tool calls, Context 32K native and 131K extended, Languages 119, Evidence 18 months independent. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Qwen3-8B specifications are Alibaba's." The OrcaRouter logo is composited bottom-right.

Microsoft đã chi ngân sách đào tạo cho việc gì

Bản tóm tắt thiết kế được trích dẫn trên thẻ mô hình và nó giải thích sự rẽ nhánh: các mô hình mã "không thể thấy cách bố cục, thứ bậc và màu sắc hòa quyện với nhau trên khung vẽ", trong khi các trình tạo ảnh "tạo nên những trang có sức hấp dẫn thị giác nhưng thường hiển thị sai văn bản, số liệu và các mối quan hệ logic". AesCode là nỗ lực lấy cảm quan bố cục từ một bên và khả năng kiểm chứng từ bên kia, và công thức này khác thường theo một cách cụ thể.

Mỗi prompt huấn luyện đều được ghép cặp với một ảnh tham chiếu được tạo ra từ chính prompt đó — các lần chạy của chính Microsoft đã dùng GPT-Image-2 để tạo ảnh và GPT-5.5 để mở rộng một đề bài ngắn thành một prompt nội dung chi tiết. Ảnh tham chiếu chỉ mang bố cục và phong cách; prompt văn bản vẫn là nguồn quyết định về nội dung. Rồi đến lúc suy luận, mô hình hầu như không cần đến nó: khi bỏ ảnh tham chiếu khỏi AesCode-8B, điểm Visual của nó chỉ giảm 1.00 điểm trên thang một trăm, so với 19.55 ở backbone và 10.04 ở GPT-5.5. Một kết quả liên quan là phần thưởng dựa trên ảnh tham chiếu đã nâng điểm Visual chỉ-dùng-prompt từ 25.17 lên 69.71, tức là tiên nghiệm thị giác đã chuyển vào các trọng số thay vì nằm lại trong đầu vào.

Phần còn lại là một câu chuyện thiết kế phần thưởng. Giám sát là một "đồ thị thiết kế" gồm các nút và cạnh — văn bản, biểu đồ, bảng, thẻ, vùng, khe hình ảnh, với sự chứa đựng, căn chỉnh, thứ tự và kết nối là các cạnh — được chọn sao cho mọi thuộc tính trên khung vẽ đều thuộc về một phần tử được đặt tên và do đó có thể được chấm điểm riêng. Bảy kênh chấm điểm kết quả: sáu bộ xác minh tất định cho thực thi, văn bản, ranh giới, dữ liệu bảng và biểu đồ, bố cục ngữ nghĩa và khoảng trắng, cộng với một Visual Graph Rubric dành riêng cho mẫu được đánh giá bởi một mô hình thị giác-ngôn ngữ. Các ứng viên được kết xuất trong một trình duyệt Playwright chạy trong sandbox với các yêu cầu bên ngoài bị chặn, và harness đọc lại DOM, kiểu tính toán, hộp bao và ảnh chụp màn hình, đó là lý do tại sao bảng phải là bảng HTML và biểu đồ phải là đặc tả ECharts. Quá trình huấn luyện là tinh chỉnh có giám sát khởi động nguội trên 3.000 bản trình diễn, sau đó là GDPO trên 7.408 lời nhắc trong 400 bước trên một nút gồm tám NVIDIA B200, với mỗi kênh thưởng được chuẩn hóa trong nhóm rollout của nó để một tín hiệu dày đặc dựa trên quy tắc không thể lấn át tín hiệu thị giác thưa thớt. Microsoft đo lường việc chuẩn hóa đó ở mức 5,12 điểm Visual so với GRPO vô hướng thuần túy.

Không có cỗ máy nào trong số đó tồn tại để biến AesCode-8B thành một trợ lý tổng quát tốt hơn. Nó tồn tại để khiến đầu ra có thể kiểm tra được, và đó là lý do vì sao ngữ cảnh của mô hình là như vậy.

Cạnh nhau, với các con số được ghi nhãn

• Base — AesCode-8B: Qwen3-VL-8B-Instruct, một checkpoint ngôn ngữ – thị giác. Qwen3-8B: mô hình tổng quát chỉ-văn-bản cùng thế hệ.

• Tham số — ACode-8B: khoảng 8,8B bf16 trên các shard. Qwen3-8B: tổng khoảng 8,2B, 7B không tính embedding.

• Đầu vào — AesCode-8B: văn bản cùng một hình ảnh tham chiếu tùy chọn. Qwen3-8B: văn bản.

• Đầu ra — AesCode-8B: một tài liệu HTML và CSS hoàn chỉnh. Qwen3-8B: văn bản, lệnh gọi công cụ, mã.

• Ngữ cảnh — AesCode-8B: 24,576 token trong cấu hình được báo cáo. Qwen3-8B: 32K gốc, 131K mở rộng qua YaRN.

• Ngôn ngữ — AesCode-8B: tag của thẻ chỉ là "en". Qwen3-8B: 119 ngôn ngữ và phương ngữ.

• Bằng chứng — AesCode-8B: thang đánh giá infographic 300 mẫu của chính Microsoft, ba lần sinh cho mỗi prompt, không có sự tái lập từ bên ngoài. Qwen3-8B: mười tám tháng benchmark độc lập, công việc lượng tử hoá và triển khai trong môi trường sản xuất.

• Giấy phép — Cả hai đều dùng Apache 2.0, không hạn chế. Hòa nhau, và đây không phải là điểm khác biệt như nhiều người vẫn tưởng.

Khoảng trống bằng chứng mới là phép so sánh thực sự.

Microsoft báo cáo AesCode-8B đạt 82,94 Overall trên thang điểm của mình, vượt qua GPT-5.5 có điều kiện tham chiếu ở 81,28 và Claude Opus 4.8 ở 80,39, đồng thời hơn backbone có điều kiện tham chiếu của chính nó 31,1 điểm Visual. Ba con số trong bảng đó đáng giá hơn cả dòng tiêu đề. Thứ nhất là Style, nơi AesCode-8B đứng ở 53,21 và không mô hình nào trong so sánh vượt qua 60 — và định nghĩa của Microsoft về Style là thiết kế không cần chỉnh sửa trực quan thêm trước khi giao, nên trên chiều duy nhất hỏi liệu một con người có giao trang mà không cần biên tập hay không, mô hình này không dẫn đầu. Thứ hai là lỗi ranh giới: tình trạng tràn canvas nghiêm trọng tái diễn ở 4,3% trong 300 mẫu, so với 34,7% ở GPT-5.5. Thứ ba là nửa phần thị giác của điểm số đến từ một giám khảo ngôn ngữ-thị giác giấu tên, nghĩa là nửa mang tính xác định có thể được người ngoài tái lập còn nửa kia thì không.

Các con số của Qwen3-8B đến từ một nơi hoàn toàn khác, và điều đó quan trọng hơn việc bộ số liệu nào cao hơn. Mười tám tháng đánh giá độc lập, lượng tử hóa bởi cộng đồng, các phép đo hiệu năng phục vụ và triển khai trong môi trường thực tế là một loại bằng chứng khác: đó không phải là một tuyên bố, mà là một thành tích đã được kiểm chứng. Bạn có thể biết Qwen3-8B hoạt động thế nào dưới lượng tử hóa bốn bit trên một card cụ thể vì ai đó đã công bố điều đó. Bạn không thể làm điều tương tự với AesCode-8B, vì chưa ai ngoài Microsoft từng chạy nó trên bất cứ thứ gì.

Và không có chỉ số chung nào giữa hai bảng. Qwen3-8B không có điểm bố cục infographic; AesCode-8B hoàn toàn không có chuẩn đánh giá suy luận tổng quát nào được công bố. Việc so sánh không phải là sát nút hay không sát nút — mà là không thể thực hiện được.

Chạy từng cái thực sự cần những gì

A screenshot of the OrcaRouter model page for qwen/qwen3-vl-8b-instruct showing the Vision, Tools and JSON capability badges, the byline "by Qwen - 2025-10-14", the description "Qwen3-VL 8B Instruct - open-weight small vision-language model, 8B params, 128k context, no thinking mode", the pricing row reading $0.18 input and $0.70 output per million tokens, and the OpenAI-compatible code sample against the https://api.orcarouter.ai/v1 base URL.

Qwen3-8B là lựa chọn dễ dàng. Một mô hình văn bản 8.2B có thể lượng tử hóa vừa trên một card tiêu dùng duy nhất, có mười tám tháng công cụ hỗ trợ phía sau trải khắp mọi framework phục vụ và runtime cục bộ, và hoạt động có thể dự đoán được. Việc mở rộng ngữ cảnh lên 131K đã được ghi trong tài liệu chứ không phải truyền miệng, và độ bao phủ 119 ngôn ngữ chính là lý do nó xuất hiện trong rất nhiều pipeline đa ngôn ngữ.

AesCode-8B là một dự án phục vụ (serving project). Lệnh riêng của card là vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, với transformers 4.57 trở lên cho đường đi không dùng vLLM. 17,5 GB trọng số bf16 phải vừa bên cạnh một KV cache cho 24.576 token và tối đa hai ảnh, nên một card 24 GB về mặt kỹ thuật là đủ và chật chội đến mức khó chịu, còn 40-48 GB hoặc hai card 24 GB mới là mức sàn thực tế. Cũng phải tính đến một renderer, bởi vì mọi tuyên bố về chất lượng của mô hình này đều được đưa ra bằng cách render đầu ra HTML của nó trong một trình duyệt sandbox — nếu bạn muốn biết liệu đầu ra của chính mình có tốt hay không, thì đó là bộ khung mà bạn phải dựng lên. Và lưu ý rằng ngữ cảnh 24.576 token đã được thử nghiệm trên các trang infographic đơn lẻ, chứ không phải trên các bộ slide nhiều trang mà mô hình hướng tới, nên áp lực ngữ cảnh trên một bộ slide thực tế vẫn là vùng chưa được kiểm chứng.

Tính sẵn có là nửa còn lại của chính vấn đề đó. AesCode-8B không phải là thứ mà OrcaRouter định tuyến, và chúng tôi cũng không tìm thấy nó được phục vụ ở bất kỳ nơi nào khác; đánh giá nó ngay hôm nay đồng nghĩa với việc phải tự chạy trọng số trên phần cứng của bạn. Tổ tiên của nó lại là câu chuyện khác — Qwen3-VL-8B-Instruct hiện có thể gọi qua OrcaRouter với giá 0,18 USD cho mỗi triệu token đầu vào và 0,70 USD cho mỗi triệu token đầu ra trong ngữ cảnh 131.072 token, khiến nó trở thành cách rẻ nhất để xem phiên bản chưa tinh chỉnh của chính kiến trúc này làm được gì với các prompt infographic của riêng bạn. Xa hơn trên cùng dòng đó, Qwen3.8-27B có thể định tuyến với giá 0,33 và 2,40 USD. Giá niêm yết của nhà cung cấp được chuyển nguyên vẹn, không cộng thêm phụ phí, và việc chuyển đổi dự phòng giữa các nhà cung cấp diễn ra tự động, vì vậy việc tạo nguyên mẫu prompt trên backbone được lưu trữ chỉ tốn một khóa thay vì một tuần GPU, và chỉ những prompt thực sự hiển thị tốt mới đáng để bỏ công tái tạo.

A Hugging Face screenshot of the microsoft/AesCode-8B model card showing 0 likes at capture time, the Microsoft organisation follower count, the Image-Text-to-Text, Transformers, Safetensors and English tags with qwen3_vl and code-generation, an Apache-2.0 licence badge, and the opening card text describing AesCode as generating information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS, followed by the line that AesCode-8B starts from Qwen3-VL-8B-Instruct.

Bạn muốn cái nào thì còn tùy vào cổ vật

Chọn AesCode-8B khi sản phẩm bàn giao là một trang và nó phải có thể chỉnh sửa. Đầu ra HTML có cấu trúc có thể diff trong Git, bảng là bảng thật và biểu đồ là đặc tả ECharts, là một loại tạo tác thực sự khác biệt so với một đoạn văn bản, và dù có bao nhiêu năng lực tổng quát đi nữa cũng không thể thay thế được nó. Hãy chấp nhận sự đánh đổi một cách có ý thức: một checkpoint nghiên cứu không được công bố với số lượt tải ở mức hai chữ số, ngữ cảnh 24K, chỉ tiếng Anh, không có đánh giá độc lập, một trần Style do chính nhà cung cấp công bố, và hóa đơn phục vụ được đo bằng hàng chục gigabyte.

Hãy chọn Qwen3-8B cho mọi thứ còn lại — mà với hầu hết các đội, đó chính là mọi thứ. Nó là mô hình tổng quát đã được chứng minh ở kích thước này, nó có ngữ cảnh dài hơn, nó nói được một trăm mười chín ngôn ngữ, nó chạy trên phần cứng bạn đã sở hữu, và nó có mười tám tháng kinh nghiệm vận hành thực tế của người khác đằng sau những quyết định mà bạn sắp đưa ra. Nếu bạn không có nhu cầu cụ thể nào để xuất ra các trang đã kết xuất, thì so sánh này chỉ có một câu trả lời.

Lý lẽ cho việc muốn cả hai là có cơ sở, và đó không phải là một yếu tố phá vỡ thế hòa. Một pipeline đọc tài liệu và tạo ra các bộ slide sử dụng hai mô hình với hai kiểu đầu ra thực sự khác biệt, và cách tiếp cận hữu ích là giữ trình kết xuất trang trên phần cứng có thể đảm đương được nó và định tuyến công việc đọc và suy luận đến một dịch vụ nằm sau cùng một endpoint với mọi thứ khác.

Điều gì sẽ khiến đây trở thành một trang dễ chốt hơn?

Ba điều, và chỉ một trong số đó là về các benchmark. Một bản tái lập độc lập đối với con số 82,94 và mức giảm tham chiếu 1,00 điểm sẽ đưa AesCode-8B từ tuyên bố của nhà cung cấp thành kết quả, và sẽ cho phép câu hỏi về kích thước 8B-so-với-8B được trả lời dựa trên thực chất. Một nhà cung cấp đón nhận checkpoint này sẽ thu gọn cột triển khai và biến "một tuần GPU" thành "một lệnh gọi API." Và bài báo mà thẻ viện dẫn là đang được phản biện — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — sẽ trả lời câu hỏi mà thẻ mô hình không thể: rubric thị giác làm gì khi chính đồ thị thiết kế mà nó chấm điểm lại sai.

Cho đến khi một trong những điều đó thành hiện thực, cách diễn giải có thể biện minh được là cách diễn giải hẹp. AesCode-8B là mô hình thú vị hơn trong hai mô hình này và cũng ít dùng được hơn. Nó rất giỏi ở những phần của thiết kế thị giác mà máy có thể kiểm tra, ở mức trung bình ở phần không thể tự động hóa, và nó thuộc cùng họ thế hệ Qwen3 với mô hình mà nó đang được so sánh, nhưng không phải là hậu duệ của mô hình đó. Qwen3-8B là mô hình bạn có thể đưa vào pipeline ngay chiều nay.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày