Thẻ chính cho so sánh Ideogram 4.5 và MAI Image 2.6 Preview. Tiêu đề ghi 'Ideogram 4.5 vs MAI Image 2.6 Preview' phía trên dòng 'Một chuyên gia đối đầu với một nền tảng'. Thẻ bên trái, có tiêu đề 'Ideogram 4.5', liệt kê 'API công khai kể từ 30/09/2026', 'Elo 1.013, 2.278 mẫu' và '$0,03 đến $0,22 mỗi ảnh'; thẻ bên phải, có tiêu đề 'MAI Image 2.6 Preview', liệt kê 'Bản xem trước công khai trong Microsoft Foundry', 'Elo 1.161, 9.410 mẫu' và 'Đầu ra tối đa 1,5K'. Phần chân trang ghi 'Cùng bảng, cùng hội đồng - Artificial Analysis'.
Guides & Insights

Ideogram 4.5 vs MAI Image 2.6 Preview: Chuyên gia đối đầu với nền tảng

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ideogram 4.5 tồn tại để làm một việc: chỉnh sửa một hình ảnh lặp đi lặp lại mà không để nó bị giảm chất lượng. MAI Image 2.6 Preview, mô hình hình ảnh chủ lực của Microsoft AI, tồn tại để làm mọi thứ cùng lúc — tạo sinh, chỉnh sửa với nhiều tham chiếu, neo một prompt vào nội dung web trực tiếp và tự chọn tỷ lệ khung hình — và nó đã có thể được gọi trong bản xem trước công khai thông qua Microsoft Foundry kể từ ngày 4 tháng 9 năm 2026. Đặt chúng cạnh nhau, các con số chỉ về một hướng còn hình thái sản phẩm lại chỉ về hướng khác. Ideogram thắng ở thứ nó được tạo ra để làm; Microsoft thắng gần như mọi trục khác, bao gồm cả những trục quyết định liệu một đội ngũ có thể thực sự triển khai nó hay không.

Mỗi loại là gì

Ideogram 4.5 ra mắt ngày 30 tháng 9 năm 2026 trên ứng dụng của Ideogram, API riêng của hãng, tích hợp MCP và bộ ứng dụng của hãng, cùng các nền tảng đối tác. Nó tạo và chỉnh sửa ở bốn tốc độ kết xuất, xuất ra gốc ở 2K, và thể hiện khả năng chỉnh sửa cục bộ trên nguồn 4.016 × 6.016 — 24,2 megapixel — mà không hạ mẫu. Nhà cung cấp khẳng định rằng các lượt xử lý lặp lại không còn bị trôi: các cạnh giữ nguyên vị trí, kết cấu vẫn tồn tại, một vùng cắt đã chỉnh sửa ghép trở lại được vào ảnh gốc. Trọng số không được công bố.

MAI Image 2.6 là mô hình hình ảnh mạnh nhất của Microsoft AI và là đỉnh cao của một dòng phát triển bao gồm MAI-Image-1, MAI-Image-2 vào tháng 3 năm 2026, MAI-Image-2.5 vào tháng 6, MAI-Image-2.5-Pro vào tháng 7 và MAI-Image-2-Efficient trên chặng đường đó. Nó ra mắt trên bảng xếp hạng của Arena vào tháng 8 năm 2026 ở vị trí số 2, và vào ngày 4 tháng 9 năm 2026, Microsoft đưa nó vào bản xem trước công khai trong Microsoft Foundry và MAI Playground cùng với MAI-Image-2.6-Flash mới cho các khối lượng công việc thông lượng cao. Các khả năng được liệt kê rất rộng: chỉnh sửa đa tham chiếu kết hợp người, sản phẩm, phong cách và bối cảnh từ nhiều hình ảnh, web grounding, tỷ lệ khung hình động, và đầu ra lên đến độ phân giải 1.5K. Nó cũng là mô hình đóng, và chỉ chạy trên đám mây của Microsoft.

A generated two-column comparison scoreboard for Ideogram 4.5 and MAI Image 2.6 Preview. The Ideogram column reads 'Access: public API', 'Price: $0.03 to $0.22', 'Text-to-image: Elo 1,013', 'Editing: rank 23', 'Output: native 2K' and 'Announced: Sep 30, 2026'; the MAI column reads 'Access: invite-gated', 'Price: none published', 'Text-to-image: Elo 1,161', 'Editing: No. 3 on Arena', 'Output: not specified' and 'Announced: Aug 19, 2026'. The footer reads 'Elo figures per Artificial Analysis; access per Microsoft.'

Đội hình

• Truy cập — ứng dụng công khai, tích hợp API và MCP kể từ ngày 30 tháng 9 năm 2026 so với bản xem trước công khai trong Microsoft Foundry và MAI Playground kể từ ngày 4 tháng 9 năm 2026.

• Giá — $0.03 mỗi ảnh ở mức Thấp, $0.06 ở mức Trung bình và $0.22 ở mức Cao, trên bảng giá của nhà cung cấp so với không có bảng giá được công bố trên bài đăng tin tức của Microsoft; thông tin giá nằm đằng sau model card của Foundry, và các bảng độc lập liệt kê mô hình ở mức $38.90 cho 1.000 ảnh.

• Điểm text-to-image — xếp hạng 34 ở mức 1.013 Elo từ 2.278 mẫu so với 1.161 Elo từ 9.410 mẫu, phát hành vào tháng 8 năm 2026.

• Điểm chỉnh sửa — xếp hạng 23 với 1.064 Elo từ 2.459 mẫu ở mức 220,00 USD cho mỗi 1.000 hình ảnh so với xếp hạng 3 với 1.137 Elo từ 15.684 mẫu ở mức 38,90 USD cho mỗi 1.000.

• Đầu ra — 2K gốc, với các chỉnh sửa được minh họa ở 4,016 × 6,016 so với độ phân giải tối đa 1.5K theo bảng thông số của máy.

• Cấu trúc năng lực — một mũi nhọn (độ trung thực khi chỉnh sửa đa lượt) so với một tập hợp rộng: chỉnh sửa đa tham chiếu, neo thông tin web, tỷ lệ khung hình động, và một phiên bản Flash nhanh hơn.

A screenshot of the MAI-Image-2.6 model card in Microsoft Foundry, captured in English with a throwaway browser profile, showing the model's publisher, its Preview lifecycle stage, a context window of 32,000 and token limits of 4,096 output, and the pay-as-you-go pricing link. The card does not display a per-image rate.

Cùng bo mạch, cùng tấm nền, và không hề sát nút

Đây là một cuộc so tài hiếm hoi có thể đưa ra so sánh rõ ràng, bởi vì cả hai mô hình đều có mặt trên Artificial Analysis với các hàng được đo bởi cùng một hội đồng và cùng một nhóm phiếu bầu.

Văn bản thành hình ảnh: MAI-Image-2.6 đạt 1.161 Elo từ 9.410 mẫu, so với Ideogram 4.5 (High) đạt 1.013 Elo từ 2.278 mẫu. Đó là mức chênh 148 Elo với số mẫu gấp bốn lần, và cột giá hiển thị $38,90 so với $100,00 mỗi nghìn hình ảnh.

Chỉnh sửa ảnh: MAI-Image-2.6 đạt 1.137 Elo từ 15.684 mẫu, so với Ideogram 4.5 (High) đạt 1.064 Elo từ 2.459 mẫu, theo một quy đổi độc lập là 38,90 USD so với 220,00 USD mỗi nghìn.

Bài đăng ngày 4 tháng 9 của chính Microsoft đã tuyên bố vị trí số 2 ở hạng mục text-to-image và số 1 ở hạng mục chỉnh sửa ảnh trên bảng xếp hạng này, cả hai đều được ghi chú “tính đến ngày 4 tháng 9 năm 2026”. Khi đọc lại sau một tháng, vị trí text-to-image vẫn giữ nguyên, còn tuyên bố về chỉnh sửa ảnh thì không còn đúng nữa: GPT Image 2.5 Sunburst ra mắt vào tháng 9 và đang đứng đầu bảng xếp hạng đó với 1.182 Elo, còn MAI-Image-2.6 đứng thứ ba với 1.137. Đó không phải là lời chê bai mô hình — mà là điều xảy ra với bất kỳ tuyên bố “số 1 hiện tại” nào trong một thị trường ra mắt sản phẩm hằng tuần, và đó là lý do bài viết này ghi kèm ngày tháng với mỗi thứ hạng.

A screenshot of the Artificial Analysis text-to-image leaderboard, captured in English, showing MAI-Image-2.6 at 1,161 Elo, Ideogram 4.5 (High) at rank 34 with 1,013 Elo from 2,278 samples at $100.0 per 1,000 images, and GPT Image 2.5 Sunburst (max) first at 1,197 Elo.

Điều khác biệt thực sự quan trọng không phải là điểm số.

Nếu các ban lãnh đạo quyết định điều này, thì mọi chuyện sẽ kết thúc. Họ không làm vậy, vì hai lý do.

Điều thứ nhất là không bảng nào đo lường tuyên bố thực tế của Ideogram. Các đấu trường chỉnh sửa cho người bỏ phiếu thấy một ảnh nguồn và hai kết quả từ một chỉ dẫn đơn; chúng không bao giờ cho người bỏ phiếu thấy chỉnh sửa thứ mười trong một chuỗi đối chiếu với lần đầu, đó chính là sự trôi lệch mà Ideogram đã tạo ra 4.5 để ngăn chặn. Khoảng cách chỉnh sửa 73 điểm cho bạn biết MAI Image 2.6 được ưu tiên cho các chỉnh sửa đơn lẻ. Nó chẳng cho bạn biết gì về lượt thứ mười trên một tệp lớn, và lượt thứ mười mới là thứ mà một nhóm làm catalogue, một lần thay biển hiệu hay một ca phục chế ảnh thực sự phụ thuộc vào.

Điểm thứ hai là hình thái khả dụng. Bản xem trước không giống như một sản phẩm. Foundry public preview là nơi phù hợp để đánh giá và dùng cho công cụ nội bộ, và Microsoft chưa gắn các điều khoản sẵn sàng chung cho nó — không cam kết về tính khả dụng, không thông báo ngừng hỗ trợ, không bảo đảm thông lượng. Mô hình của Microsoft cũng chỉ có thể truy cập qua cloud và playground của Microsoft, nên không có nhà cung cấp thứ hai để dự phòng khi một endpoint xem trước bị giới hạn. Ideogram 4.5 được phát hành theo một thang bậc đã công bố với bảng giá bạn có thể đưa vào ngân sách, và API riêng của Ideogram là một cam kết chứ không phải bản xem trước.

Rồi còn chuyện hướng giá cả, điều thực sự khiến mẫu mới hơn thấy không thoải mái. Khi không có bảng giá chính thức nào được Microsoft công bố, những con số duy nhất có thể so sánh được là mức quy đổi từ các bảng xếp hạng: MAI-Image-2.6 ở mức 38,90 USD mỗi nghìn so với Ideogram 4.5 ở mức 100,00 USD cho text-to-image và 220,00 USD cho chỉnh sửa. Một mô hình có điểm số tốt hơn trên cả hai bảng xếp hạng và mức giá quy đổi thấp hơn thì không phải là lựa chọn khó bán — nó là mặc định.

Nơi mỗi thứ thực sự khẳng định được vị trí của mình

Hãy dùng Ideogram 4.5 khi phần tốn kém trong quy trình của bạn là sửa chữa công việc đã được duyệt thay vì tạo ra công việc mới: các biến thể phối màu cho một danh mục, biển hiệu được dịch xuyên suốt một chiến dịch, một bức ảnh bị hư hại được phục hồi mà không vẽ lại những gì còn nguyên vẹn. Bản trình diễn 24,2 megapixel và tuyên bố bảo toàn đường biên đều nhắm chính xác vào đó, và không có mô hình cạnh tranh nào đưa ra tuyên bố đó với bằng chứng tương đương. Hãy kiểm thử nó trên chuỗi trường hợp xấu nhất của bạn trước khi cam kết; tuyên bố này chưa được bất kỳ ai ngoài nhà cung cấp tái tạo lại.

Hãy dùng MAI Image 2.6 khi bạn cần bề rộng và tốc độ tích hợp. Chỉnh sửa đa tham chiếu với nhiều ảnh nguồn, web grounding và tỷ lệ khung hình động bao quát hầu hết các đề bài sản xuất mà không cần mô hình thứ hai trong pipeline, và MAI-Image-2.6-Flash dành cho phân khúc khối lượng lớn — con số của chính Microsoft cho thấy nó nhanh hơn 2,8× so với GPT-Image-2-Medium, được đo trong một bài kiểm tra tải nội bộ ở 100 yêu cầu mỗi phút tại 1024 × 1024, đây là số liệu do nhà cung cấp báo cáo và chưa được tái lập. Nếu nhóm của bạn vốn đã ở trong Azure, chi phí tích hợp gần như bằng không và điều đó có thể quan trọng hơn 24 megapixel độ trung thực khi chỉnh sửa.

Hãy dùng cả hai nếu bạn đang vận hành một hoạt động nội dung thực thụ. Một mô hình nền tảng để tạo sinh và đảm bảo khối lượng, một chuyên gia cho những lượt phải trung thực đến từng pixel, và một quy tắc về việc cái nào phụ trách bước nào. Sai lầm là coi đây là một giao dịch mua duy nhất.

Định tuyến, khi hai điểm cuối có các bảo đảm khác nhau

Không có gì trong màn so tài này nằm trong danh mục của OrcaRouter. Ideogram 4.5 có sẵn qua API của chính nhà cung cấp và một số nền tảng bên thứ ba; MAI Image 2.6 có thể truy cập qua Microsoft Foundry và MAI Playground. Dòng hình ảnh của chúng tôi nằm ở nơi khác — các định danh Gemini 3.1 Flash Image và Imagen 4 của Google, các mô hình GPT-Image của OpenAI — và việc nói rằng chúng tôi định tuyến một trong hai mục này sẽ không trụ nổi dù chỉ một lần kiểm tra.

Điều mà một lớp định tuyến thực sự có ích ở đây chính là sự bất đối xứng trong hai câu chuyện về tính sẵn sàng đó. Một điểm cuối xem trước không có SLA chính là trường hợp mà chuyển đổi dự phòng tự động chứng tỏ được giá trị của nó: lượt gọi rơi vào một phương án thay thế đang được phục vụ thay vì ném lỗi lúc 2 giờ sáng, và bạn phát hiện ra điều đó trong log thay vì trong một phiếu hỗ trợ. Định giá theo từng lượt gọi ở mức giá niêm yết của nhà cung cấp, không cộng thêm gì nghĩa là việc nhà cung cấp giảm giá hoặc mức giá công bố đầu tiên của bản xem trước sẽ xuất hiện trên hóa đơn của bạn ngay ngày nó được áp dụng — điều này quan trọng khi phép so sánh bạn đang thực hiện là 2,6× trên dòng chỉnh sửa. Và nếu bạn muốn A/B một bản xem trước với một dịch vụ chuyên biệt mà không cần hai hợp đồng, một khóa là cách rẻ nhất để làm điều đó.

Bây giờ làm gì

Nếu hôm nay bạn đang chọn một mô hình, câu trả lời trung thực là mô hình tốt hơn cũng chính là mô hình rẻ hơn và là mô hình bạn chỉ có thể dùng ở dạng xem trước. Hãy chọn MAI Image 2.6 nếu bạn có thể chấp nhận ở trong đám mây của Microsoft và các điều khoản xem trước; hãy chọn Ideogram 4.5 nếu bạn cần một bảng giá có thể dự báo được, một API chính chủ, hoặc hành vi trung thực khi chỉnh sửa cụ thể, và chấp nhận rằng bạn đang trả khoảng hai lần rưỡi mức giá chỉnh sửa quy đổi cho nó.

Hai điều sẽ giải quyết dứt điểm. Điều thứ nhất là một benchmark độ trung thực đa lượt: cùng một hình ảnh, mười lần chỉnh sửa tuần tự, đo độ phân kỳ. Cho đến khi có ai đó chạy một benchmark như vậy, thuộc tính khiến Ideogram 4.5 trở nên thú vị vẫn chưa được đo, còn thuộc tính khiến MAI Image 2.6 trở nên thú vị thì đã được đo. Điều thứ hai là việc Microsoft đưa MAI Image 2.6 từ bản xem trước sang phát hành chính thức kèm bảng giá được công bố; điều đó loại bỏ phản đối thực tiễn cuối cùng đối với chiến lược nền tảng và khiến lập luận ủng hộ mô hình chuyên biệt chỉ còn dựa hoàn toàn vào drift.