
MAI-Image-2.5-Pro vs Bernini-Diffusers-v2: Hạng Nhất Có Căn Cứ Đo Lường So Với Canh Bạc Trọng Số Mở Chưa Được Đo Lường
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B Uncensored (Aggressive)2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
So sánh MAI-Image-2.5-Pro với Bernini-Diffusers-v2thực sự không phải là so sánh hai mô hình hình ảnh. Đây là so sánh hai câu trả lời khác nhau cho cùng một câu hỏi — "làm thế nào để tôi có được một bản chỉnh sửa tốt cho một hình ảnh hiện có?" — khi một bên có 6.100 phiếu bầu mù của con người sau vị trí chỉnh sửa số 1, còn bên kia chỉ có một README. MAI-Image-2.5-Pro, mô hình hình ảnh phân khúc chất lượng của Microsoft, đã được phát hành bản xem trước công khai trên Microsoft Foundry vào ngày 23 tháng 7 năm 2026 và hiện đứng đầu Artificial Analysis Image Editing Arena. Bernini-Diffusers-v2, khuôn khổ tạo sinh hợp nhất thế hệ thứ hai của ByteDance, xuất hiện trên Hugging Face vào ngày 13 tháng 8 năm 2026 dưới dạng trọng số Apache-2.0 mà không có thông báo và không có bài đánh giá chất lượng hình ảnh nào được bất kỳ ai bên ngoài ByteDance thực hiện. Mọi khác biệt thực tế trong cuộc so sánh này đều xuất phát từ hai sự thật đó.
Một cái bạn gọi, một cái bạn chạy.
• MAI-Image-2.5-Pro — một mô hình API được lưu trữ, đang trong giai đoạn xem trước công khai trên Azure AI Foundry và MAI Playground. Mô hình độc quyền, tính phí theo token, không hỗ trợ tinh chỉnh, không hỗ trợ tự lưu trữ. Bạn nhận được endpoint và trả phí theo token; Microsoft vận hành hạ tầng.
• Bernini-Diffusers-v2 — Bộ trọng số Apache-2.0 bạn tải xuống từ Hugging Face và tự chạy. Kiến trúc gồm một bộ lập kế hoạch ngữ nghĩa Qwen2.5-VL-7B điều khiển bộ kết xuất DiT dựa trên Wan2.2, và khuyến nghị phần cứng trong README là GPU lớp Hopper (H100/H800/H200) với Python 3.11.2 / PyTorch 2.5.1+cu124. Bạn tự cung cấp cụm máy tính.
Đó là quy tắc quyết định gọn trong một câu: nếu tổ chức của bạn muốn sở hữu toàn bộ stack, {{1}}Bernini{{/1}} là một lựa chọn; nếu tổ chức của bạn muốn có hóa đơn và SLA, thì chỉ có {{2}}MAI-Image-2.5-Pro{{/2}} mới đáng để cân nhắc. Chúng không thể thay thế cho nhau.
Lỗ hổng bằng chứng mới là điểm nhấn thực sự.
Hai mô hình này nằm ở hai phía đối lập của vấn đề chất lượng lớn nhất trong AI hình ảnh: đo lường đầu ra. Kỹ năng chỉnh sửa của MAI-Image-2.5-Pro được chấm điểm độc lập — Đứng số 1 trên Artificial Analysis Image Editing Arena với Elo 1,272 từ ~6,100 so sánh mù, vượt qua Reve 2.1, GPT Image 2, và phiên bản anh em của nó MAI-Image-2.5. Xếp hạng text-to-image của nó đứng thứ bảy với Elo 1,292, đây là đối trọng trung thực: nó là một chuyên gia chỉnh sửa, không phải là người dẫn đầu ở khung vẽ trống. Những con số này có thể được kiểm chứng bởi bất kỳ ai có trình duyệt.
Bernini-Diffusers-v2 không có điểm số công khai tương đương. Thẻ mô hình báo cáo EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 và VBench 84.46 — tất cả đều do nhà cung cấp tự báo cáo và đều là các chỉ số về phía video. Trên thẻ không có gì mà người mua ảnh có thể nhận ra là kết quả bảng xếp hạng chuyển văn bản thành hình ảnh hoặc chỉnh sửa hình ảnh. Thẻ mô hình có tuyên bố rằng Bernini đạt "hạng nhất" trong số các mô hình thương mại đóng trong đấu trường so sánh cặp mù nội bộ của ByteDance — đây chính là loại tự đánh giá của nhà cung cấp cần được kiểm tra độc lập trước khi có ý nghĩa.
• MAI-Image-2.5-Pro:Elo chỉnh sửa 1.272 (độc lập, ~6.100 phiếu bầu); Elo văn bản thành hình ảnh 1.292 (độc lập, ~11.500 phiếu bầu)
• Bernini-Diffusers-v2: không có điểm chuẩn hình ảnh công khai; chỉ có số liệu đánh giá phía video, do nhà cung cấp báo cáo

Hai lý thuyết biên tập khác nhau
Cả hai mô hình đều được xây dựng dựa trên ý tưởng rằng việc chỉnh sửa không nên đồng nghĩa với việc tái tạo lại cảnh. Nhưng chúng đạt được điều đó theo những cách khác nhau.
MAI-Image-2.5-Pro là lời chào hàng của Microsoft về "chỉnh sửa chính xác, tinh tế với tính nhất quán": thay đổi một đối tượng, cập nhật văn bản trong hình, làm sạch hiệu ứng mờ chuyển động, và giữ nguyên mọi thứ khác — nhận diện chủ thể, ánh sáng, kết cấu — ổn định. Sự nhất quán đó chính là cơ chế đằng sau tuyên bố nhất quán nhân vật đa hình ảnh 94% (do nhà cung cấp công bố, chưa được xác minh). Mục tiêu sản phẩm là một mô hình thực hiện chỉnh sửa hẹp và dừng lại.
Bernini-Diffusers-v2 là một pipeline lập kế hoạch rồi kết xuất: bộ lập kế hoạch Qwen2.5-VL phân rã một chỉ dẫn thành các bước ngữ nghĩa — thay đổi thời tiết, hoán đổi phong cách, chèn một đối tượng, giữ nguyên chủ thể — và bộ kết xuất vẽ ra kết quả. Thiết kế này nhắm đến các chỉ dẫn phức tạp, nhiều bước, và cùng một bộ trọng số đảm nhiệm các tác vụ văn bản-thành-hình ảnh, hình ảnh-thành-hình ảnh và video (t2i, i2i, t2v, v2v, rv2v, r2v). Bề rộng đó là điểm mạnh; cái giá chưa được đo lường là một bộ lập kế hoạch 7B là một nút thắt thực sự đối với các chỉnh sửa rất tinh tế, và chưa ai ngoài ByteDance định lượng được cách nó xử lý chúng.

Kết xuất văn bản, chiến trường thực tế
Văn bản trong hình ảnh là nơi một trình chỉnh sửa ảnh hiện đại chứng tỏ giá trị của mình, và ở đây sự bất đối xứng là rõ rệt. Tính năng nổi bật của MAI-Image-2.5-Pro là kết xuất văn bản chính xác — Microsoft tuyên bố độ chính xác 96,8% trên tiếng Anh, tiếng Trung, tiếng Nhật, tiếng Hàn và tiếng Tây Ban Nha (theo báo cáo của nhà cung cấp; các tài liệu này cũng giới hạn đầu ra ở gần một megapixel, vì vậy hãy coi con số này chỉ mang tính định hướng). Bernini-Diffusers-v2 chưa công bố bất kỳ số liệu độ chính xác kết xuất văn bản nào. Đối với quy trình làm việc tạo ra quảng cáo bản địa hóa, bao bì hoặc bất kỳ thứ gì có chữ đọc được, một ứng viên đưa ra tuyên bố có thể đo lường được còn ứng viên kia chẳng đưa ra gì cả.
Chi phí, và hình thức của hóa đơn
• MAI-Image-2.5-Pro — 5 đô la cho mỗi triệu token đầu vào văn bản, 8 đô la cho mỗi triệu token đầu vào hình ảnh, 106 đô la cho mỗi triệu token đầu ra hình ảnh. Chi phí cho mỗi hình ảnh không được công bố; theo quy đổi của Artificial Analysis, một hình ảnh 1024×1024 có giá khoảng 108,50 đô la cho mỗi 1.000 hình ảnh. Giá xem trước, có thể thay đổi khi phát hành chính thức.
• Bernini-Diffusers-v2 — các trọng số được miễn phí, nhưng tự lưu trữ (self-hosting) đòi hỏi phần cứng cấp H100 (hoặc thuê cloud), vận hành để duy trì hoạt động, và việc tự mở rộng của bạn. Cơ chế chi phí đảo ngược mô hình API: đắt đỏ nếu chỉ tạo mười ảnh mỗi ngày, rẻ khi có khối lượng sử dụng lớn.
Với hầu hết các đội ngũ, cách nhìn thẳng thắn là: tổng chi phí sở hữu của Bernini chỉ có lợi nếu bạn đã vận hành một hạ tầng GPU và khối lượng công việc lớn và ổn định. Ngược lại, một API tính phí theo mức sử dụng với mức giá cao vẫn là lựa chọn rẻ hơn khi thất bại.

Router có thể làm gì và không thể làm gì ở đây
Không mô hình nào có thể định tuyến qua OrcaRouter hôm nay, vì những lý do trái ngược: MAI-Image-2.5-Pro nằm sau bản xem trước trực tiếp của Microsoft Foundry, còn Bernini-Diffusers-v2 hoàn toàn không phải là một endpoint — nó chỉ là các trọng số. Điều đó có ý nghĩa như một nguyên tắc cho cuộc so sánh này: mẫu định tuyến chỉ áp dụng cho nửa của sự so sánh này vốn là một API có thể gọi được. Khi MAI-Image-2.5-Pro đạt đến một API bên thứ ba có thể gọi được, cách để áp dụng nó mà không đặt cược đường đi sản xuất vào mã xem trước là định tuyến một phần lưu lượng đến nó với một mô hình đã được chứng minh làm cơ chế dự phòng tự động — trên OrcaRouter, đó là một endpoint, giá nhà cung cấp được chuyển qua với mức cộng thêm 0%, và một cơ chế dự phòng bắt được bất cứ thứ gì mà bảng xếp hạng ít phiếu bầu không thể thấy. Phía trọng số mở không có gì tương đương: bạn hoặc tự chạy stack của Bernini hoặc bạn không sử dụng nó.
Bản án
MAI-Image-2.5-Pro là một trình chỉnh sửa cao cấp, có thể đo lường, được lưu trữ: đứng #1 trên một bảng xếp hạng chỉnh sửa độc lập, có khả năng kết xuất văn bản thực thụ, và mức giá tương xứng. Bernini-Diffusers-v2 là một pipeline mã nguồn mở (open-weights) miễn phí, bao quát, chưa được kiểm chứng về hình ảnh, đồng thời cũng xử lý video — thực sự thú vị nếu bạn tự lưu trữ, thực sự không thể chấm điểm cho đến khi có ai đó chạy một bài đánh giá hình ảnh công khai. Nếu quy trình làm việc của bạn cần một API có thể gọi và một con số bạn có thể bảo vệ, lựa chọn là MAI-Image-2.5-Pro hoặc một trong những trình chỉnh sửa lưu trữ khác mà nó vượt trội. Nếu quy trình làm việc của bạn cần quyền sở hữu và bạn có thể vận hành phần cứng, Bernini-Diffusers-v2 đáng để thử nghiệm — nhưng hãy coi đó là một canh bạc vào tiềm năng chưa được đo lường, chứ không phải đối thủ của một #1 đã được đo lường.
