
AesCode-8B so với Gemma 4 12B: Hai mô hình thị giác nhỏ, hai đầu ra hoàn toàn khác biệt
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 87 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
AesCode-8B và Gemma 4 12B đều nhận một hình ảnh cùng một câu lệnh, và cả hai đều là các checkpoint Apache-2.0 mà bạn tải về chứ không phải thuê, đó là lý do các công cụ tìm kiếm cứ thoải mái đặt chúng cạnh nhau. Sự tương đồng là có thật, nhưng cũng hời hợt. Gemma 4 12B trả về một câu trả lời — một đoạn mô tả, một bản chép lại, một đoạn mã, một mạch lập luận. AesCode-8B trả về một trang đã được dựng: một slide, một poster hay một bảng điều khiển dưới dạng một tài liệu HTML và CSS hoàn chỉnh mà bạn có thể mở trong trình duyệt và chỉnh sửa bằng tay. Cùng dạng đầu vào, cùng tầm trọng lượng tương đối, mà đầu ra gần như chẳng giống nhau chút nào. Chính khác biệt duy nhất đó quyết định gần như mọi câu hỏi thực tiễn bên dưới, kể cả việc bạn có thể đặt cái nào trước mặt người dùng vào ngày mai.
Đáng nói ngay từ đầu, vì điều này quyết định mức độ đáng tin mà những con số có thể mang lại: Gemma 4 12B được DeepMind ra mắt vào ngày 2026-06-03 với một model card, tài liệu và một hệ sinh thái, và nó đã được kiểm nghiệm độc lập kể từ đó. AesCode-8B thì hoàn toàn không được ra mắt. Kho lưu trữ của Microsoft cho nó được tạo vào ngày 2026-09-29 và các trọng số đã xuất hiện trong một commit có tiêu đề "Release AesCode-8B" vào lúc 03:35 UTC ngày 2026-10-07, với mã huấn luyện và đánh giá xuất hiện trên GitHub vào ngày hôm sau. Không có bài đăng nào trên Microsoft Research, không có trang sản phẩm, không có ghi chú phát hành và không có bản tiền in — phần trích dẫn của model card ghi "Under review" với năm giữ chỗ là 2027. Tính đến thời điểm viết bài, kho lưu trữ 8B hiển thị hai lượt tải xuống và một lượt thích. Do đó, mọi thông tin định lượng về AesCode-8B đều là của chính Microsoft, và chưa có gì được bất kỳ ai khác tái lập.
Hai mô hình, theo cách của riêng chúng.
Gemma 4 12B là một mô hình mở cỡ trung bình, một checkpoint dense 11,95 tỷ tham số với lựa chọn thiết kế đặc trưng là không có bộ mã hóa thị giác hay âm thanh riêng: các patch ảnh và dạng sóng âm thanh đi thẳng vào transformer. Mô hình có ngữ cảnh 256K token và cần khoảng 16 GB VRAM, với trọng số BF16 khoảng 27 GB và các bản lượng tử hóa dưới 7 GB. Thẻ của chính nhà cung cấp — do nhà cung cấp báo cáo, và được ghi nhãn như vậy ở đây — liệt kê DocVQA 94,9, InfoVQA 88,4, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 và LiveCodeBench v6 72,0 ở chế độ suy nghĩ. Đánh giá độc lập mới là phần quan trọng hơn: Artificial Analysis chấm cấu hình suy luận ở Chỉ số Thông minh 14, đo được khoảng 114 token mỗi giây, và định giá một lượt gọi phục vụ điển hình ở mức gần 0,10 USD mỗi triệu token đầu vào và 0,30 USD mỗi triệu token đầu ra. Nó đã có ba tháng rưỡi triển khai phía sau.
AesCode-8B là một bản tinh chỉnh của Qwen3-VL-8B-Instruct, được phát hành với bốn shard safetensors tổng cộng 17.543.339.408 byte — khoảng 8,8 tỷ tham số bf16, đó là lý do trường kích thước được làm tròn của Hugging Face ghi 9B trong khi nhà cung cấp nói 8B. Cấu hình được công bố là một công thức Qwen3-VL chuẩn: 36 lớp ẩn, kích thước ẩn 4.096, 32 đầu attention với 8 đầu key-value, từ vựng 151.936 token, và yêu cầu transformers 4.57 trở lên. Các lần chạy được Microsoft báo cáo đã dùng ngữ cảnh 24.576 token với tối đa 12.000 token đầu ra, temperature 0,8, top-p 0,95 và ba lần sinh cho mỗi prompt mà không chọn lọc. Giấy phép là Apache 2.0, không yêu cầu cổng truy cập, không có phụ lục về sử dụng được chấp nhận. Điều không có trong gói là dữ liệu huấn luyện và đánh giá, cùng bất kỳ endpoint được host nào — chúng tôi không thể tìm thấy AesCode-8B được phục vụ ở bất cứ đâu, và nó không nằm trong danh mục của chính chúng tôi.
Các mô hình thực sự được huấn luyện để làm gì
Bản tóm tắt thiết kế được trích dẫn trong thẻ mô hình và đáng để đọc như toàn bộ luận đề: các mô hình mã "không thể thấy cách bố cục, thứ bậc và màu sắc hòa quyện với nhau trên khung vẽ", trong khi các trình tạo hình ảnh "tạo nên những trang có sức hấp dẫn thị giác nhưng thường kết xuất sai văn bản, số và các mối quan hệ logic." AesCode là nỗ lực giữ đồng thời cả cảm nhận bố cục lẫn khả năng kiểm chứng.
Cơ chế này khác thường ở một điểm cụ thể. Mỗi prompt huấn luyện được ghép cặp với một ảnh tham chiếu được tạo ra từ chính prompt đó, ảnh này cung cấp bố cục và phong cách trong khi prompt văn bản vẫn là thứ quyết định về nội dung. Rồi, khi suy luận, mô hình hầu như không cần bức ảnh: nếu không đưa ảnh tham chiếu cho AesCode-8B, điểm Visual của nó giảm 1.00 điểm trên một trăm. Không đưa nó cho Qwen3-VL-8B-Instruct thì mức giảm là 19.55. Không đưa nó cho GPT-5.5, được đánh giá dưới cùng một khung kiểm thử, thì mức giảm là 10.04. Tiền nghiệm thị giác đã nằm trong trọng số thay vì trong đầu vào, và đó chính là kết quả nghiên cứu thực sự nằm dưới tiêu đề.
Mục tiêu huấn luyện của Gemma 4 12B là mục tiêu đa phương thức thông thường, và nói như vậy không phải là một lời chỉ trích: đọc hình ảnh, trả lời câu hỏi, tuân theo chỉ dẫn, gọi công cụ. Không có gì trong thẻ mô hình của nó cho thấy nó từng được hướng tới việc tạo ra một sản phẩm được kết xuất, và không có đánh giá Gemma 4 12B nào được công bố đo lường chất lượng bố cục tài liệu, tình trạng tràn canvas hay tính nhất quán thiết kế, vì đó không phải là các chỉ số của mô hình.
Bảng điểm, và tiêu chí đánh giá đó là của ai

• Tham số — AesCode-8B: 8.8B bf16, dense. Gemma 4 12B: 11.95B dense.
• Đầu vào — AesCode-8B: văn bản cùng một hình ảnh tham chiếu tùy chọn. Gemma 4 12B: văn bản, hình ảnh, âm thanh và video.
• Đầu ra — AesCode-8B: một tài liệu HTML và CSS hoàn chỉnh. Gemma 4 12B: văn bản, bao gồm các lệnh gọi công cụ.
• Ngữ cảnh — AesCode-8B: 24.576 token trong cấu hình được báo cáo. Gemma 4 12B: 256K token.
• Giấy phép — cả hai đều là Apache 2.0, không hạn chế, bao gồm trọng số.
• Bằng chứng — AesCode-8B: bộ tiêu chí đánh giá infographic 300 mẫu của chính Microsoft, ba lần sinh cho mỗi lời nhắc, không có tái lập độc lập. Gemma 4 12B: thẻ thông tin nhà cung cấp cùng chỉ số Intelligence Index độc lập là 14 và thông lượng đo được trên Artificial Analysis.
Giờ đến phần mà bảng điểm không thể truyền tải. Microsoft báo cáo AesCode-8B đạt 82.94 Overall trên bộ 300 mẫu đó, dẫn trước GPT-5.5 được điều kiện hóa theo tham chiếu ở 81.28 và Claude Opus 4.8 ở 80.39, đồng thời hơn xương sống Qwen3-VL-8B của chính nó 31.1 điểm Visual. Hãy đọc toàn bộ như do nhà cung cấp báo cáo và chưa được tái lập, trên một rubric do nhà cung cấp tự xây, trên các mẫu do nhà cung cấp chọn, được chấm bởi một harness mà nhà cung cấp đã huấn luyện mô hình dựa theo. Thẻ này đủ trung thực để công bố một chiều mà không mô hình nào trong so sánh vượt 60 — Style, nơi AesCode-8B ở mức 53.21 và GPT-5.5 dẫn đầu với 57.91 — và định nghĩa của chính Microsoft về chiều đó là thiết kế không cần chỉnh sửa thị giác nào thêm trước khi giao. Trên trục duy nhất hỏi liệu một con người có giao trang mà không chỉnh sửa hay không, mô hình 8B không phải là kẻ dẫn đầu. Đó là con số cần nắm giữ khi ai đó trích dẫn 82.94.
Ở những chỗ chúng thực sự trùng lặp
Chỉ có đúng một kệ dùng chung, và nó hẹp hơn vẻ ngoài. Nếu bạn đang đánh giá các mô hình thị giác mở nhỏ cho một quy trình xử lý nhiều tài liệu, cả hai đều là ứng cử viên — một mô hình để đọc tài liệu, mô hình kia để tạo ra tài liệu. Một nhóm tạo bảng điều khiển nội bộ dưới dạng HTML và cũng cần trích xuất hình vẽ từ các PDF được tải lên sẽ đụng đến cả hai sản phẩm trong cùng một tuần.
Sự phân chia bên trong vùng chồng lấn đó rất rạch ròi. Gemma 4 12B là mô hình bạn dùng cho một tài liệu đầu vào. AesCode-8B là mô hình bạn dùng cho một bản brief khi sản phẩm bàn giao là một trang. Không mô hình nào thay thế mô hình kia, và một pipeline muốn có cả hai là một pipeline hai mô hình chứ không phải một lựa chọn.

Triển khai, đó chính là nơi mà sự bất đối xứng thực sự cắn
Chuyện phục vụ Gemma 4 12B đã ngã ngũ. Bạn tải nó về, lượng tử hóa nếu muốn, chạy nó trên 16 GB VRAM, và có một nền tảng công cụ rộng lớn đã làm được điều này. Nếu bạn không muốn tự chạy nó chút nào, thì một lệnh gọi qua dịch vụ là rẻ và được định giá độc lập.
Câu chuyện phục vụ của AesCode-8B chỉ gồm một dòng lệnh và vài phép tính. Model card đưa ra thẳng cách chạy — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, với transformers 4.57 trở lên cho lối không dùng vLLM. 17,5 GB trọng số bf16 phải nằm cạnh một KV cache cho 24.576 token và tối đa hai ảnh, nên một card 24 GB là đủ về mặt kỹ thuật nhưng chật vật đến khó chịu; 40-48 GB, hoặc hai card 24 GB, mới là mức sàn thực tế. Cũng phải tính đến một renderer, vì mọi tuyên bố về chất lượng của model này đều được đưa ra bằng cách render đầu ra HTML của nó trong một trình duyệt sandbox, nên chấm điểm kết quả của chính bạn đồng nghĩa với việc dựng một thứ dạng Playwright với các yêu cầu bên ngoài bị chặn.
Vậy còn tình trạng khả dụng thực tế thì sao. Chúng tôi không định tuyến AesCode-8B, và theo những gì chúng tôi tìm được, cũng không có ai khác làm vậy; một đánh giá vào lúc này đồng nghĩa với việc bạn phải chạy trọng số trên phần cứng của chính mình. Thứ gần nhất có thể gọi được chính là kiến trúc mà mô hình được tinh chỉnh từ đó. Qwen3-VL-8B-Instruct hiện có thể định tuyến qua OrcaRouter với giá 0,18 đô-la mỗi một triệu token đầu vào và 0,70 đô-la mỗi một triệu token đầu ra trong ngữ cảnh 131.072 token, và hai checkpoint mà chúng tôi có cũng được định giá theo cùng cách — Gemma 4 26B-A4B ở mức 0,06 và 0,33, Gemma 4 31B ở mức 0,13 và 0,38. Giá niêm yết của nhà cung cấp được giữ nguyên, không cộng thêm phụ phí, và việc chuyển đổi dự phòng giữa các nhà cung cấp diễn ra tự động, vì vậy cách rẻ nhất để biết liệu các câu lệnh của bạn có hiển thị tốt hay không là thử nghiệm trên mô hình gốc chưa tinh chỉnh trước, rồi chỉ dành cả tuần GPU cho những câu lệnh nào trụ được.

Bạn thực sự muốn cái nào?
Chọn AesCode-8B nếu sản phẩm bàn giao là một trang. Mô hình xuất ra HTML có cấu trúc, có thể chỉnh sửa — bảng dưới dạng bảng HTML, biểu đồ dưới dạng đặc tả ECharts — nghĩa là đầu ra tạo diff trong Git và có thể được nhà thiết kế tạo kiểu lại mà không cần tạo lại nó. Hãy chấp nhận đánh đổi: một checkpoint nghiên cứu chưa được công bố với số lượt tải xuống ở mức hai chữ số, không có đánh giá độc lập, không có endpoint được host, ngữ cảnh 24K chỉ mới được kiểm chứng trên các trang infographic đơn lẻ, và thẻ ngôn ngữ chỉ có tiếng Anh trên card.
Chọn Gemma 4 12B cho mọi thứ khác. Nó đọc tài liệu tốt hơn hầu hết các mô hình có kích thước gấp đôi, nó xử lý âm thanh, nó tuân theo hướng dẫn công cụ, nó có một phần tư triệu token ngữ cảnh, và nó có ba tháng rưỡi kinh nghiệm của người khác đằng sau. Nếu bạn đang chọn một trong hai mô hình này làm mô hình thị giác nhỏ của mình, và bạn chưa được yêu cầu cụ thể tạo bản trình chiếu dưới dạng mã, thì đây là câu trả lời.
Và nếu yêu cầu thực sự là cả hai, đừng coi đó là một tiêu chí phân định thắng thua. Hãy định tuyến công việc đọc sang một mô hình chạy trên máy chủ và giữ công việc kết xuất trên bất kỳ máy nào có thể chứa được các trọng số.
Điều gì sẽ thay đổi trang này
Ba tín hiệu. Một bản tái lập độc lập cho mức giảm tham chiếu 82,94 và 1,00 điểm sẽ đưa AesCode-8B từ chỗ là tuyên bố của nhà cung cấp thành một kết quả, và sẽ khiến câu hỏi về kích thước 8B so với 12B thực sự thú vị thay vì chỉ thú vị trên danh nghĩa. Một nhà cung cấp suy luận nhận checkpoint này sẽ làm sụp đổ cột triển khai, vốn hiện là toàn bộ khác biệt thực tiễn. Và bài báo mà Microsoft dẫn là đang được xem xét — “AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards” — sẽ trả lời những câu hỏi mà model card không thể, bắt đầu từ việc rubric thị giác hành xử ra sao khi chính đồ thị thiết kế bị sai. Cho đến khi một trong những điều đó thành hiện thực, cách đọc có thể bảo vệ được là hẹp và có thật: AesCode-8B rất giỏi ở những phần của thiết kế thị giác mà máy có thể kiểm tra, ở mức trung bình ở phần mà máy không thể, còn Gemma 4 12B là một sản phẩm hoàn chỉnh đang làm một công việc khác.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
