
AesCode-8B vs North Mini Code: Cùng giấy phép, cùng nút tải xuống, những vấn đề trái ngược
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 87 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Con số hữu ích nhất trong cuộc đối đầu này là 150.000. Đó là số lượt tải mà Cohere gán cho North Mini Code vào ngày 14-08-2026, hai tháng sau khi mô hình ra mắt vào ngày 09-06-2026, và đây chính là con số khiến việc so sánh với AesCode-8B trở nên rõ ràng. AesCode-8B, bản tinh chỉnh của Microsoft dựa trên Qwen3-VL-8B-Instruct, chỉ hiển thị hai lượt tải trên kho Hugging Face của nó. Cả hai đều dùng Apache 2.0, cả hai đều không bị hạn chế, cả hai đều có thể tải về ngay chiều nay, và một trong số chúng đã nằm trong tay các đội sản xuất suốt một quý trong khi cái còn lại vẫn chưa rời khỏi phòng thí nghiệm. Khoảng cách đó không phải là một phán xét về chất lượng — chưa ai đo lường AesCode-8B một cách độc lập, nên không bên nào có gì để tự mãn — nhưng đó là điểm khởi đầu trung thực, vì nó cho bạn biết bên nào có một cộng đồng mà bạn có thể đặt câu hỏi.
Hai cái này ra đời rất khác nhau và điều đó định hình những gì bạn có thể xác minh. North Mini Code là bản phát hành trọng số mở của Cohere và Cohere Labs với một thẻ mô hình, một bài đăng blog phía sau nó, một dấu vết tài liệu về các lựa chọn harness, và một API đi kèm đã cung cấp nó ở mức $0.00 mỗi triệu token trong giai đoạn ra mắt. AesCode-8B không có thông báo nào cả: Microsoft đã tạo kho lưu trữ vào 2026-09-29, commit các trọng số với thông điệp "Release AesCode-8B" lúc 03:35 UTC ngày 2026-10-07, và đẩy mã huấn luyện lên GitHub vào 2026-10-08. Không có bài đăng trên Microsoft Research, không có ghi chú phát hành, không có trang sản phẩm, và một dòng trích dẫn ghi "Under review" với năm giữ chỗ là 2027. Mô hình 8B tạo ra các bộ slide, poster và bảng điều khiển dưới dạng HTML và CSS; North Mini Code viết mã bên trong một harness tác nhân. Chúng không hẳn là đối thủ cạnh tranh mà đúng hơn là những hàng xóm trong danh mục, và đó tự nó là một kiểu phát hiện.
Mỗi cái được huấn luyện để phát ra gì
Cách rõ ràng nhất để thấy rằng hai thứ này không làm cùng một việc là nhìn vào những gì chúng tạo ra.
• Đầu ra — AesCode-8B: một tài liệu HTML và CSS hoàn chỉnh, mỗi yêu cầu cho ra một trang được kết xuất. North Mini Code: văn bản và các lệnh gọi công cụ, mà trên thực tế có nghĩa là các bản vá, lệnh shell và quỹ đạo tác nhân.
• Kích thước — AesCode-8B: dense bf16 8,8B, trong bốn shard safetensors với tổng cộng 17.543.339.408 byte. North Mini Code: tổng 30B với 3B tham số hoạt động, một mixture-of-experts thưa với 128 expert và 8 expert hoạt động trên mỗi token.
• Ngữ cảnh — AesCode-8B: 24.576 token trong cấu hình được báo cáo, với prompt và phản hồi ở thời điểm huấn luyện đều được giới hạn ở mức 8.192. North Mini Code: 256K đầu vào, 64K sinh tối đa.
• Đầu vào — AesCode-8B: văn bản cùng một hình ảnh tham chiếu tùy chọn. North Mini Code: chỉ văn bản, với harness cung cấp mọi thứ còn lại.
• Được huấn luyện trên — AesCode-8B: 3.000 minh họa khởi động nguội và sau đó là học tăng cường GDPO trên 7.408 lời nhắc trong 400 bước, được chấm điểm bởi sáu trình xác minh tất định cùng một thang đánh giá trực quan sau khi kết xuất từng ứng viên trong trình duyệt sandbox. North Mini Code: các bộ khung agent — SWE-Agent, mini-SWE-Agent, OpenCode và Terminus 2 — nên nó hoạt động bên trong bất kỳ bộ khung nào bạn đã chạy thay vì ghim bạn vào một bộ.
• Giấy phép — Apache 2.0 cho cả hai, bao gồm trọng số, không có ngoại lệ theo lĩnh vực sử dụng, không có phân tầng dành cho người đóng góp. Trên trục này, chúng giống hệt nhau và điều đó không quyết định gì cả.
• Bằng chứng — AesCode-8B: bộ tiêu chí đánh giá infographic gồm 300 mẫu của chính Microsoft, chưa được tái lập. North Mini Code: một con số từ nhà cung cấp cùng với một phép đo độc lập.
Sự bất đối xứng về bằng chứng, vốn hẹp hơn vẻ ngoài của nó
Phía đông của so sánh này có một nhân tố ngoài cuộc, và điều đó đáng giá hơn khoảng cách benchmark. Artificial Analysis đã tự chạy North Mini Code và chấm nó 33,4 điểm trên Coding Index cùng 27,6 điểm trên Intelligence Index — cạnh tranh ngang bằng hoặc vượt các mô hình mở cùng kích cỡ. Cohere báo cáo 61,0% pass@1 trên SWE-Bench Verified và thông lượng đầu ra cao tới 2,8× so với Devstral Small 2 của Mistral, cả hai đều là số liệu của nhà cung cấp. Lần chạy độc lập mới là lần phát hiện ra vấn đề: North Mini Code phát ra lượng token đầu ra gấp khoảng ba lần mức trung vị cùng nhóm kích cỡ để hoàn thành cùng bộ benchmark, khoảng 75-77 triệu token đầu ra so với mức trung vị 25-38 triệu. Với mức giá thời kỳ ra mắt là 0, điều đó không tốn đồng nào. Nó tốn độ trễ, và báo trước hóa đơn một khi mức giá khuyến mãi kết thúc.
AesCode-8B không có tương đương nào ngoài đo lường. Microsoft báo cáo 82,94 Overall trên đánh giá infographic 300 mẫu của riêng mình, ba lần sinh cho mỗi prompt mà không chọn lọc, dẫn trước GPT-5.5 được điều kiện tham chiếu ở 81,28 và Claude Opus 4.8 ở 80,39, đồng thời hơn backbone của chính nó 31,1 điểm Visual. Nó cũng báo cáo rằng phần thưởng được điều kiện tham chiếu đã nâng Visual chỉ dùng prompt từ 25,17 lên 69,71, và rằng việc không cung cấp ảnh tham chiếu khi suy luận chỉ khiến mô hình mất 1,00 điểm Visual, so với 19,55 đối với backbone. Đó là những tuyên bố cụ thể một cách bất thường và harness được mã nguồn mở, điều mà hầu hết bảng của nhà cung cấp không đưa ra được. Chưa có phần nào trong đó được ai tái lập. Không có danh sách arena, không có vị trí trên bảng xếp hạng, không có đo lường thông lượng và không có bên thứ ba nào rà soát rubric.
Lưu ý điều đó có nghĩa gì cụ thể cho việc so sánh: không có một con số chung. Một mô hình được chấm điểm dựa trên việc các tác vụ kỹ thuật phần mềm có đạt hay không và chúng tốn bao nhiêu token; mô hình kia được chấm điểm dựa trên việc văn bản của một infographic có còn dễ đọc hay không và bố cục của nó có nằm trong khung vẽ hay không. Đặt 33.4 cạnh 82.94 là đem so sánh một chỉ số lập trình với điểm tổng thể của một infographic.
Mỗi thứ được triển khai ở đâu và chi phí của việc đó là bao nhiêu

Câu chuyện triển khai của North Mini Code chính là lý do nó vượt qua 150.000 lượt tải. Một MoE 3B active khi lượng tử hóa sẽ gọn vào khoảng 20-24 GB bộ nhớ, đội ngũ Cohere đã trình diễn nó trên một chiếc Mac Studio thông qua MLX, và chính dấu chân 3B active là thứ khiến suy luận cục bộ trở nên tiết kiệm. Nó chạy trên một H100 duy nhất ở độ chính xác đầy đủ. Cohere đã phục vụ nó ở mức $0.00 cho mỗi triệu token đầu vào và đầu ra trong giai đoạn ra mắt, đồng thời cung cấp một lộ trình triển khai theo từng instance được quản lý cho quy mô sản xuất. Bản thân con số này là số liệu của chính Cohere, được tổng hợp trên mọi kênh phân phối mà không có phân tách theo từng nền tảng, và con số hàng tháng công khai trên Hugging Face nhỏ hơn một bậc độ lớn, điều này nhất quán với việc số tổng hợp bao trùm API, các cổng hosted, các trình quản lý gói và các lượt tải cục bộ. Hãy đọc nó như đà tăng trưởng hơn là dữ liệu đo lường từ xa.
Câu chuyện triển khai của AesCode-8B gói gọn trong một dòng lệnh. Card mô hình đưa ra trực tiếp — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, cùng với transformers 4.57 trở lên cho đường đi không dùng vLLM. 17,5 GB trọng số bf16 nằm bên cạnh một KV cache cho 24.576 token và tối đa hai hình ảnh, nên về mặt kỹ thuật một card 24 GB là đủ, nhưng thực tế thì vẫn chật vật; 40-48 GB mới là mức sàn thực tế. Hãy thêm một stack render nếu bạn muốn chấm điểm đầu ra theo cách mà các tác giả đã làm, bởi vì mọi tuyên bố về chất lượng của mô hình này đều được đưa ra bằng cách render HTML của nó trong trình duyệt với các yêu cầu bên ngoài bị chặn. Chúng tôi không tìm thấy endpoint hosted nào, và nó cũng không nằm trong danh mục của chúng tôi.
Điểm cuối cùng đó là điểm thực tế đối với bất kỳ ai đang so sánh hai mô hình này về tính sẵn có. North Mini Code nằm sau API riêng của nhà cung cấp và một số nền tảng bên thứ ba cũng như chính các trọng số. AesCode-8B chỉ có trên Hugging Face và GitHub. Nếu ràng buộc của bạn là "Tôi cần gọi nó từ một dịch vụ vào ngày mai," thì chỉ một trong hai mô hình này trả lời có.
Câu hỏi về composition mà cả hai mô hình đều không giải được
Đây là cái bẫy trong cả hai nửa của so sánh này, và đó là cùng một cái bẫy. Việc áp dụng một trong hai nghĩa là duy trì một đường dẫn phục vụ tự lưu trữ cho một chuyên gia. AesCode-8B cần một ngăn xếp đa phương thức và một trình kết xuất để được đánh giá đúng cách. North Mini Code cần một vị trí cho MoE hoạt động 3B cùng với một bộ khung tác nhân xung quanh nó, và tính dài dòng của nó có nghĩa là lộ trình tốn kém hơn số lượng token ngụ ý. Một nhóm muốn cả hai khả năng — một trình tạo trang và một tác nhân repo — giờ đây đang vận hành hai triển khai suy luận, và đối với mọi thứ không phải cả hai, thì cần thêm một cái thứ ba.
Đó là trường hợp một endpoint đặt trước nhiều mô hình thực sự đảm nhận công việc thật chứ không chỉ là một tiện ích. Hãy giữ mô hình chuyên biệt trên phần cứng của riêng bạn, nơi bài toán kinh tế và việc xử lý dữ liệu biện minh cho điều đó, và định tuyến lưu lượng thông thường đến bất kỳ mô hình được lưu trữ nào tốt nhất cho việc đó trong tuần này, tất cả nằm sau một khóa duy nhất với giá niêm yết của nhà cung cấp được chuyển nguyên qua ở mức markup 0% và tự động chuyển đổi dự phòng nếu một nhà cung cấp gặp trục trặc. Xương sống dòng Qwen3 là một minh họa tốt cho thấy ranh giới trở nên mong manh đến mức nào: Microsoft đã xây dựng AesCode-8B dựa trên Qwen3-VL-8B-Instruct, và các thành viên thị giác-ngôn ngữ của dòng đó có thể được gọi qua OrcaRouter — Qwen3-VL-8B-Instruct ở mức $0.18 mỗi triệu token đầu vào và $0.70 đầu ra trên ngữ cảnh 131,072 token, và Qwen3-VL 235B A22B ở mức $0.40 và $1.60. Không mô hình nào trong hai mô hình đó là AesCode-8B; bản tinh chỉnh thuộc về Microsoft và không nhà cung cấp nào cung cấp nó. Nhưng nếu điều bạn muốn ở nó là một mô hình đọc ảnh chụp màn hình và viết mã, và bạn không đặc biệt cần bản tinh chỉnh về thiết kế thẩm mỹ, thì lựa chọn có thể gọi được chỉ tốn một phần nhỏ GPU và chỉ mất một buổi chiều để thử, thay vì cả một chu kỳ mua sắm.

Làm thế nào để quyết định, khi mà cả hai đều không phải là đa mục đích
Trước tiên hãy gạt giấy phép ra khỏi bàn, vì nó là một thế hòa và nó sẽ chẳng quyết định được điều gì.
Hãy tự hỏi bạn muốn văn bản trở thành gì. Nếu câu trả lời là một trang được kết xuất, có thể chỉnh sửa — một bộ slide, một báo cáo, một bảng điều khiển — thì North không thể giúp bạn và AesCode-8B là cái duy nhất trong hai cái được nhắm vào vấn đề. Hãy bước vào với đôi mắt tỉnh táo: một checkpoint nghiên cứu không được công bố trước, hai lượt tải xuống, một ngữ cảnh 24K chỉ được xác thực trên một infographic duy nhất, một thẻ ngôn ngữ tiếng Anh, và không có bất kỳ đánh giá độc lập nào ở đâu cả. Mức trần Style trong bảng của Microsoft là 53.21 trên một chiều được định nghĩa là không cần chỉnh sửa thêm trước khi bàn giao, đó là dấu hiệu cho thấy một con người vẫn đang chỉnh sửa đầu ra.
Nếu câu trả lời là một thay đổi đối với kho mã — một bản di trú, một bản sửa lỗi, một tác vụ terminal nhiều bước — thì North Mini Code là lựa chọn có huấn luyện harness, cửa sổ 256K, cấu hình triển khai 3B-active, API nhà cung cấp hoạt động được, và một phép đo từ bên ngoài về cả chất lượng lẫn độ dài dòng của nó. Hãy tính ngân sách theo số token thay vì theo mức giá được quảng cáo, bởi vì phát hiện độc lập cho thấy nó viết dài gấp khoảng ba lần so với các đối thủ cùng loại để đạt tới cùng một kết quả.
Và nếu quý của bạn vừa có một artifact thiết kế vừa có một đợt migration repo, đừng coi đây là quyết định hai mô hình. Hãy chạy mô hình chuyên biệt ở nơi nó xứng đáng với GPU của nó, định tuyến phần còn lại, và ngừng duy trì những serving path mà bạn không cần.

Sự khác biệt trường tồn hơn các chuẩn đối sánh
Một điều cuối cùng phân biệt hai mô hình này, và nó không mang tính kỹ thuật. North Mini Code có một nhà cung cấp đã công bố một model card, một bài đăng, một Space để dùng thử và một phương pháp luận mà bạn có thể tranh luận, cùng với kinh nghiệm của người khác đến từ 150.000 lượt tải xuống. AesCode-8B có một repository, một README và một trích dẫn ghi là đang được xem xét.
Điều đó thay đổi cả những câu hỏi mở thực sự là gì. Với North Mini Code, câu hỏi nóng hiện tại là liệu tính dài dòng của nó có khiến nó không kinh tế ở quy mô lớn sau khi mức giá khuyến mãi kết thúc hay không — và bạn có thể trả lời điều đó bằng cách chạy thử nó, bởi vì nhiều người khác đã làm vậy rồi. Với AesCode-8B, câu hỏi nóng hiện tại là Microsoft định làm gì với nó: một tạo tác nghiên cứu, bản phát hành đầu tiên của một dòng sản phẩm, hay một thứ gì đó âm thầm bị thay thế trong sáu tuần. Không có gì trong kho chứa trả lời được điều đó, và dù có đọc thẻ mô hình bao nhiêu lần cũng vô ích. Hãy để mắt đến ba tín hiệu — một thông báo chính thức, một bản tái tạo độc lập của 82,94, hoặc một nhà cung cấp nào đó nhận lấy checkpoint — và coi việc thiếu vắng cả ba tín hiệu là trạng thái bằng chứng hiện tại, thay vì là lý do khiến mô hình không đáng quan tâm. Lý do nó đáng quan tâm là mức giảm tham chiếu 1,00 điểm, và con số đó vẫn đang ở đó chờ ai đó không phải Microsoft kiểm tra nó.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
