
AesCode-32B: Mô hình 33B âm thầm của Microsoft biết viết slide dưới dạng HTML có thể chỉnh sửa
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 87 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Dấu thời gian trên AesCode-32B không khớp với nhau, và sự không khớp đó là phần lớn những gì có thể báo cáo. Kho lưu trữ Hugging Face microsoft/AesCode-32B được tạo vào ngày 29 tháng 9 năm 2026, nhưng mọi thứ trong đó đến trong một commit duy nhất đề ngày 7 tháng 10 năm 2026 với thông điệp chỉ đơn giản là "Release AesCode-32B" — và ngăn xếp huấn luyện giúp kết quả có thể tái lập đã được đẩy lên github.com/microsoft/AesCode vào ngày 8 tháng 10. Microsoft chưa công bố gì: không có bài blog, không có bản thảo trước arXiv, không có bài gửi lên bảng xếp hạng, không có trang mô hình trên trang web riêng của mình. Thứ tồn tại là một mô hình ngôn ngữ - thị giác 33 tỷ tham số, nhận một lời nhắc và xuất ra một tài liệu HTML hoàn chỉnh, khép kín — một slide, một poster, một bảng điều khiển — cùng với một mô hình đồng hành nhỏ hơn, microsoft/AesCode-8B. Cả hai đều được tinh chỉnh từ các mô hình thị giác Qwen3-VL — Qwen3-VL-32B-Instruct và Qwen3-VL-8B-Instruct tương ứng — cả hai đều theo Apache 2.0, và cả hai đều có thể tải xuống ngay hôm nay.
ID repo ghi là microsoft/AesCode-32B và model card mở đầu bằng mẹo: AesCode ghép prompt của bạn với một hình ảnh được tạo ra từ chính prompt đó, dùng hình ảnh làm tham chiếu thẩm mỹ, và tuân theo phần văn bản cho nội dung thực tế. Các mô hình tạo ảnh dựng nên một trang trông đẹp mắt nhưng hiển thị sai các con số trên đó; các mô hình lập trình ghi đúng các con số nhưng không thể thấy trang đó trông như thế nào. AesCode là một nỗ lực nhằm có được cả hai, và bản tóm tắt trung thực về nó tính đến ngày 11 tháng 10 năm 2026 là: trọng số là thật và có thể kiểm chứng, các con số benchmark là của chính phòng thí nghiệm đo trên một benchmark do phòng thí nghiệm viết, và chưa có ai ngoài Microsoft công bố một con số nào cho nó. Bài viết này tách bạch những hạng mục đó xuyên suốt.
Thực sự có gì trong kho lưu trữ, từng byte một

Hãy bắt đầu với những gì bạn có thể xác minh mà không cần tin một chữ nào từ thẻ mô hình. Kho lưu trữ 32B chứa mười bốn phân đoạn safetensors, tổng cộng 66,714,912,704 byte, mà ở BF16 là khoảng 33,4 tỷ tham số — nhất quán với "33B params" trong thẻ và cảnh báo của thẻ rằng riêng trọng số đã cần khoảng 65 GB bộ nhớ tăng tốc. Cấu hình khai báo Qwen3VLForConditionalGeneration là kiến trúc và qwen3_vl là loại mô hình, nên đây không phải một kiến trúc mới và cũng không cần kiến trúc mới: nó tải bằng transformers>=4.57, và thẻ cung cấp một lệnh vLLM phục vụ nó trên bốn rank tensor-parallel, cho phép hai hình ảnh mỗi prompt và mức trần 24,576 token.
Các bộ đếm tương tác là phần yên ắng nhất của bản phát hành. Hai lượt tải xuống và một lượt thích trên kho 32B tại thời điểm viết bài. Không có mục nào trong ánh xạ nhà cung cấp suy luận của Hugging Face, nghĩa là không có điểm cuối được lưu trữ nào được kết nối phía sau trang repo, và không có bản dựng GGUF, MLX hay llama.cpp nào được quảng bá ở bất cứ đâu. Đối với một mô hình mang tên Microsoft và có kết quả vượt qua GPT-5.5 trên chính bảng của nhà cung cấp, đó là một dấu vết nhỏ đến đáng kinh ngạc — và đó là bằng chứng mạnh nhất hiện có cho thấy thứ này đã được đăng lên mà không có một đợt ra mắt nào phía sau.
Kho mã đi kèm lấp đầy nửa còn lại của dòng thời gian, và đây chính là nơi câu hỏi về ngày phát hành trở nên thực sự mơ hồ. microsoft/AesCode được tạo vào ngày 23 tháng 7 năm 2026 — mười tuần trước khi có trọng số — và chứa mười bốn commit, tất cả đều do cùng một người đóng góp thực hiện và tất cả đều được gắn dấu thời gian nằm trong khoảng của nhau vào ngày 8 tháng 10 năm 2026, từ 23:14:04 đến 23:14:24 UTC. Chúng bao gồm đặc tả để tạo prompt cùng các yêu cầu có thể xác minh, pipeline dữ liệu xây dựng đồ thị thiết kế và bộ tiêu chí, một SFT cold-start, vòng lặp học tăng cường GDPO, trình xác minh kết xuất dựa trên Playwright, và README ghi lại toàn bộ những điều đó. Không có bản phát hành nào và không có tag nào, phần mô tả kho chứa trống, và nó có một sao.

Vậy ngày phát hành là ngày nào? Bản ghi kho lưu trữ ghi ngày 29 tháng 9. Commit chứa mô hình ghi ngày 7 tháng 10. Đoạn mã giải thích cách mô hình được tạo ra ghi ngày 8 tháng 10. Ba mốc thời gian trong cùng một khoảng hai tuần, và không mốc nào đi kèm một câu từ Microsoft nói rằng "chúng tôi đang phát hành cái này." Hãy coi ngày 7–8 tháng 10 là ngày có hiệu lực đối với các artefact mà hầu hết mọi người sẽ thực sự tải xuống, còn ngày 29 tháng 9 là ngày kho lưu trữ được đặt trước. Bất kỳ ai nói với bạn rằng AesCode-32B đã "ra mắt" vào một ngày cụ thể đều đang thay bạn chọn một trong những mốc thời gian đó.
Cơ chế: một hình ảnh làm định hướng thẩm mỹ, một đồ thị làm phần thưởng
Tuyên bố kỹ thuật của thẻ này hẹp và cụ thể, đó là một điểm cộng cho nó. Mô hình được huấn luyện bằng tinh chỉnh có giám sát khởi động nguội trên 3.000 mẫu minh họa với tốc độ học 1e-5, sau đó bằng GDPO — một biến thể tối ưu hóa chính sách tương đối theo nhóm — trên 7.408 prompt trong 520 bước. Mô hình 8B dùng cùng công thức và dừng ở 400 bước. Lần chạy RL sử dụng engine lai FSDP-vLLM của verl, không có critic và không có mô hình phần thưởng được huấn luyện riêng, AdamW ở mức hằng số 5e-6 không có warmup, 128 prompt mỗi bước với tám rollout cho mỗi prompt, và prompt cùng phản hồi mỗi loại đều được giới hạn ở 8.192 token.
Điều khiến phần thưởng trở nên khác thường là nó không phải một đại lượng vô hướng đơn lẻ. Mỗi mục tiêu huấn luyện được mô tả dưới dạng một đồ thị thiết kế bao phủ toàn bộ khung vẽ, nhờ đó từng thuộc tính riêng lẻ có thể được quy gán một cách tách biệt. Từ đồ thị đó sinh ra bảy kênh — execution, text, boundary, tablechart, layout, whitespace và design — mỗi kênh được chuẩn hoá trong nhóm rollout của nó trước khi tổng hợp, để một tín hiệu trội không thể lấn át các tín hiệu khác. Các bộ kiểm định tất định chấm điểm những gì có thể được phân tích cú pháp từ mã và bản kết xuất của nó; một giám định thị giác–ngôn ngữ chấm điểm những gì không thể, dùng một thang đánh giá gắn với chính các phần tử và quan hệ của đồ thị. HTML ứng viên được chấm điểm bằng cách kết xuất nó trong một trình duyệt Playwright chạy trong sandbox với các yêu cầu bên ngoài bị chặn, rồi xuất ra DOM, các kiểu tính toán, hộp bao, trạng thái console và một ảnh chụp màn hình.
Hệ quả kỹ thuật đáng được nêu rõ vì nó xuất hiện trong đầu ra mà bạn nhận được: mô hình được huấn luyện để phát ra bảng dưới dạng cấu trúc bảng HTML thực sự và biểu đồ dưới dạng đặc tả ECharts, nên cả hai đều có thể được kiểm tra trực tiếp thay vì bị nhúng vào pixel. Đó là sự khác biệt giữa một bộ slide bạn có thể đưa cho nhà thiết kế và một bộ slide bạn có thể đưa cho linter. Các yêu cầu tái lập tương ứng cũng nặng nề không kém — README yêu cầu Python 3.10, CUDA 12.6 và một node gồm tám GPU B200, ghim một commit cụ thể của verl và nói thẳng rằng cần một bản vá cho nó vì verl gốc thiếu hỗ trợ Qwen3-VL, đồng thời cảnh báo rằng nếu không có các thư viện hệ thống Playwright thì trình duyệt sẽ thất bại khi khởi chạy và các trang bị điểm 0, và rằng nếu không có ngăn xếp OCR đã ghim thì kênh thưởng tương ứng sẽ trả về 0 thay vì không đưa ra kết quả và âm thầm làm hỏng tín hiệu.
Bảng benchmark, và bốn lý do để không nắm chắc nó
Các con số nổi bật của AesCode-32B đến từ 300 mẫu infographic, ba lần sinh cho mỗi prompt ở temperature 0,8 và top-p 0,95, tối đa 12.000 token đầu ra mỗi lần, không chọn lọc giữa các lần sinh. Điểm số là phần trăm. Khi có tham chiếu, mô hình 32B báo cáo Text 95,34, Boundary 97,27, Table/Chart 90,37 và trung bình Rule là 94,33; về phần hình ảnh, Content 85,76, Layout 90,58, Style 55,99, với trung bình Visual là 77,44 và Overall là 85,89. Trong cùng bảng, GPT-5.5 có tham chiếu đạt Overall 81,28 và Claude Opus 4.8 có tham chiếu đạt 80,39, trong khi backbone Qwen3-VL-32B-Instruct mà mô hình được huấn luyện từ đó đạt 61,10.

Bốn lưu ý cần được nói cùng lúc với những con số đó, và không lưu ý nào trong số đó là sự bôi nhọ công trình. Thứ nhất, mọi hàng, kể cả các hàng GPT-5.5 và Claude Opus 4.8, đều do Microsoft chạy trên harness của Microsoft với rubric của Microsoft — đó không phải là các con số của những phòng thí nghiệm khác, mà là các phép đo của Microsoft đối với mô hình của đối thủ, và chính tấm thẻ gọi rubric là “đặc thù theo mẫu” cho từng đồ thị thiết kế. Thứ hai, rubric được tạo ra bởi cùng pipeline đã sinh ra dữ liệu huấn luyện, đúng kiểu thiết lập mà ở đó một benchmark có thể trôi dạt về phía các điểm mạnh của mô hình; tấm thẻ thẳng thắn về những giới hạn của rubric đó — Style, tiêu chí yêu cầu một thiết kế không cần sửa đổi trực quan nào nữa trước khi bàn giao, được gọi là “giới hạn trần chung cho mọi hệ thống” và không mô hình nào trong bảng vượt qua 60. Thứ ba, không có phép đo độc lập nào về mô hình này ở bất cứ đâu: không có mục nào trên bảng xếp hạng của bên thứ ba, không có tái lập, và với hai lượt tải xuống, gần như chắc chắn chưa có ai ngoài phòng thí nghiệm chạy nó. Thứ tư, so sánh này có một sự bất đối xứng tinh vi đáng chú ý — các hàng của AesCode-32B đều được điều kiện hóa theo tham chiếu, nên mô hình đang được đo trong cấu hình mà nó được huấn luyện, điều mà tấm thẻ thừa nhận khi cho thấy chất lượng vẫn cao nhất khi có tham chiếu được cung cấp.
Kết quả duy nhất trong bảng trụ vững hơn cả con số tiêu đề lại là một tuyên bố về độ bền bỉ, chứ không phải về chất lượng. Việc không cung cấp ảnh tham chiếu khi suy luận chỉ khiến AesCode-8B mất 1,00 điểm Visual, so với 19,55 ở backbone Qwen3-VL-8B-Instruct của nó và 10,04 ở GPT-5.5. Lập luận của model card là huấn luyện có điều kiện bằng ảnh tham chiếu sẽ nội hóa việc lập kế hoạch thị giác vào policy, thay vì dạy mô hình sao chép những gì nó nhìn thấy. Đó là thông tin do nhà cung cấp báo cáo và chưa được tái lập, đồng thời cũng là kiểu tuyên bố mà chỉ một lần chạy độc lập là đủ để ngã ngũ — và là kiểu quan trọng nhất trong môi trường sản xuất, nơi bạn sẽ không phải lúc nào cũng có sẵn ảnh tham chiếu trong tay.
Chi phí để vận hành nó là bao nhiêu, và điều đó có ý nghĩa gì đối với việc so sánh
Không có gì ở mô hình này là rẻ khi tự lưu trữ. Mười đến mười hai nghìn token đầu ra là kích thước làm việc của một artifact đơn lẻ, và một tài liệu HTML đầy đủ với đặc tả ECharts thì gần với cận trên của khoảng đó hơn là cận dưới, nên mỗi lần sinh là một lần giải mã dài. Công thức phục vụ của chính card yêu cầu bốn GPU ở chế độ song song tensor để chứa khoảng 65 GB tham số BF16, và công thức huấn luyện yêu cầu tám B200. Đó là một cỗ máy thực thụ, không phải một triển khai nghiệp dư, và nó đặt ra các điều khoản của phép so sánh: các mô hình mà AesCode-32B đang được đo lường so với chúng được thuê theo token, và bản thân mô hình được thuê theo giờ GPU, bất kể bạn có sở hữu phần cứng hay không.
Hình dạng thực tế của phép so sánh đó chính là lý do một lớp định tuyến tồn tại, và đáng để nói chính xác về những gì chúng tôi host và không host. AesCode-32B không nằm trong danh mục của OrcaRouter và chúng tôi không phục vụ nó — không có endpoint được host nào cho nó ở bất cứ đâu tôi có thể xác minh, kể cả của Microsoft. Thứ có trong danh mục là phía bên kia của bàn so sánh: những mô hình được host mà bạn sẽ dùng để benchmark một trình tạo artifact tự host, bao gồm GPT-5.5 và các mô hình thị giác Qwen3-VL nhỏ hơn, có thể truy cập qua một khóa API với giá niêm yết của nhà cung cấp và mức markup 0%, nghĩa là thay đổi giá của nhà cung cấp có hiệu lực phía chúng tôi ngay trong ngày. So sánh một endpoint thuê sẵn với một mô hình bạn tự chạy không cần hợp đồng thứ hai hay SDK thứ hai, và một DSL định tuyến cho phép một lệnh gọi tự host nằm cạnh những lệnh gọi được host sau một endpoint duy nhất. Nếu AesCode-32B hóa ra giỏi đúng một việc mà thẻ của nó tuyên bố, chi phí để biết điều đó là một hóa đơn GPU, còn chi phí của các lựa chọn thay thế mà bạn đang so sánh với nó là một khóa bạn có lẽ đã có sẵn.
Bạn có thể làm gì với nó ngày hôm nay, và điều gì không tồn tại
• Tải về và chạy thử — trọng số mang giấy phép Apache 2.0, theo backbone Qwen3-VL, với mười bốn shard BF16 và một transformers hoạt động ở phiên bản trên 4.57 cùng công thức vLLM có trong card.
• Tái lập quá trình huấn luyện — mã nguồn được cấp phép MIT và đủ hoàn chỉnh để thực sự có ý nghĩa: bộ xác minh phần thưởng, bộ tạo rubric, các giai đoạn SFT và GDPO, một commit verl được ghim kèm bản vá bổ sung hỗ trợ Qwen3-VL, và một README liệt kê các kiểu thất bại thay vì che giấu chúng.
• Đánh giá nó theo cách không cần tham chiếu — mô hình chấp nhận prompt có hoặc không có ảnh tham chiếu, và tuyên bố dễ kiểm chứng nhất của thẻ nằm chính ở cấu hình đó.
• Muốn có một API cho nó — bạn không thể. Không có endpoint được host, không có ánh xạ nhà cung cấp suy luận trên repository, và không có bản dựng GGUF hay MLX; chạy thứ này nghĩa là chạy chính phần cứng.
• Đọc bài báo — bạn chưa thể. Thẻ này liên kết đến một bài báo có tiêu đề AesCode: Sinh mã thẩm mỹ với phần thưởng đa phương thức tách rời, và mục BibTeX của chính nó ghi địa điểm là "Under review" và năm là 2027. Tìm kiếm trên arXiv không trả về bài báo nào có tiêu đề đó. Có một bài báo Microsoft khác, trước đó, với tên gần như giống hệt — Thẩm mỹ mã với phản hồi thưởng tác nhân từ tháng 10 năm 2025, đã phát hành một mô hình AesCoder-4B và một bộ dữ liệu AesCode-358K — và không có gì trong thẻ AesCode-32B trích dẫn nó hoặc nêu mối quan hệ với nó. Nếu bạn tìm đọc tài liệu nền và lại rơi vào bài đó, thì bạn đang đọc về một mô hình khác được xây dựng bởi các tác giả chồng lấn.
• So sánh nó trên một bảng xếp hạng công khai — vẫn chưa. Dường như chưa có chỉ mục bên thứ ba nào đánh giá nó, điều này không có gì đáng ngạc nhiên đối với một kho lưu trữ chỉ có hai lượt tải xuống.
Ai nên quan tâm, và ai nên chờ đợi
Đối tượng của mô hình này hẹp hơn so với những gì bảng tiêu đề gợi ra, và cụ thể hơn cả "bất kỳ ai đang xây dựng với các mô hình". Nếu sản phẩm của bạn biến prompt thành slide, poster, báo cáo hay dashboard mà sau đó ai đó phải chỉnh sửa, thì bạn đã nhận ra chính sự lựa chọn mà mô hình này nhắm tới: tạo ảnh cho bạn một hình chữ nhật đẹp đẽ mà bạn không thể thay đổi, còn tạo mã cho bạn thứ gì đó có thể chỉnh sửa được nhưng trông như do trình biên dịch lắp ráp nên. Một mô hình 33B với trọng số mở, phát ra một tài liệu HTML hoàn chỉnh với bảng thật và các đặc tả ECharts, giữ được chất lượng chỉ cách mức chất lượng khi có điều kiện tham chiếu khoảng một điểm khi bạn không có tham chiếu nào để đưa cho nó, và bạn có thể tinh chỉnh theo phong cách riêng của mình dưới giấy phép Apache 2.0, là một thứ thực sự hữu ích khi tồn tại. Không có mô hình nào khác làm đúng công việc đó ở kích thước này với những điều khoản này.
Đối lại điều đó: mọi thứ bạn biết về chất lượng đều đến từ một bảng dữ liệu do nhà cung cấp tự dựng, tiêu chí đánh giá đằng sau nó được tạo ra bởi chính pipeline đã làm ra dữ liệu huấn luyện, và mức trần duy nhất mà model card thừa nhận — Style dưới 60 với mọi hệ thống được kiểm thử — lại đúng là khía cạnh mà một sản phẩm nhạy cảm với thiết kế sẽ quan tâm nhất. Một nhóm có lý do tuân thủ để giữ việc tạo sinh trong nội bộ và có sẵn một node tám GPU rảnh thì đã đủ để bắt đầu ngay hôm nay. Một nhóm đang chọn model để đưa vào vận hành thực tế vào tuần sau thì không có con số độc lập nào để làm căn cứ lựa chọn, và không nên coi mức 85,89 so với 81,28 là một kết quả đã ngã ngũ.
Điều gì sẽ biến điều này thành một câu chuyện
Bốn điều, chưa có điều nào trong số đó tồn tại. Một thông báo — Microsoft chưa nói gì, và bài báo mà card tham chiếu được ghi rõ là đang được xem xét, nên một báo cáo kỹ thuật với các chi tiết huấn luyện vượt ngoài phần tóm tắt của card có thể xuất hiện bất cứ lúc nào. Một lần chạy độc lập — tuyên bố về độ bền vững không cần tham chiếu và điểm Boundary, mà card cho biết rơi vào lỗi nghiêm trọng trên 4.3% mẫu so với 34.7% của GPT-5.5, đều rẻ để kiểm thử và đều đáng để kiểm thử. Hỗ trợ serving nằm ngoài công thức của nhà cung cấp — một bản dựng GGUF hoặc một mục runtime phổ biến sẽ thay đổi câu chuyện phần cứng nhiều hơn bất kỳ benchmark nào. Và một điểm dữ liệu thứ hai cho câu hỏi về kích thước: một mô hình 8B đạt 82.94 Overall so với 85.89 của mô hình 32B trên cùng một bảng là khoảng cách hai điểm cho một phần tư số tham số, đúng kiểu điều mà hoặc là được tái lập, hoặc lặng lẽ không còn được nhắc đến.
Cho đến khi một trong những điều đó thành hiện thực, mô tả chính xác về AesCode-32B là thế này: trọng số thật dưới một giấy phép cấp phép thoáng, một ngăn xếp huấn luyện được trình bày chi tiết đủ để một phòng thí nghiệm được trang bị đầy đủ có thể tái tạo, một bảng benchmark vốn là phép đo của một công ty đối với mô hình của chính mình và hai đối thủ cạnh tranh, cùng một lịch sử kho lưu trữ không cho phép bạn gọi bất kỳ ngày nào là ngày ra mắt. Đó là một tạo tác thú vị hơn mức mà bộ đếm lượt tải xuống chỉ hai của nó gợi ra, và ít được chứng minh hơn mức mà điểm 85.89 của nó hàm ý. Cả hai vế của câu đó đều là cách diễn giải trung thực vào ngày 11 tháng 10 năm 2026.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
