Microsoft Foundry 미리보기의 프리미엄 편집 모델인 MAI-Image-2.5-Pro와 ByteDance의 Apache-2.0 오픈 가중치 파이프라인인 Bernini-Diffusers-v2 간의 대결을 위한 히어로 카드
Guides & Insights

MAI-Image-2.5-Pro 대 Bernini-Diffusers-v2: 측정된 #1 대 측정되지 않은 오픈 가중치 도박

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

비교하자면, MAI-Image-2.5-ProBernini-Diffusers-v2를 비교하는 것은 사실상 두 이미지 모델을 비교하는 것이 아니다. 그것은 "기존 이미지를 어떻게 잘 편집할 수 있을까?"라는 같은 질문에 대한 서로 다른 두 가지 답변을 비교하는 것이다. 한쪽에는 편집 부문 1위라는 순위를 뒷받침하는 6,100표의 블라인드 인간 투표가 있고, 다른 쪽에는 README 하나뿐이다. MAI-Image-2.5-Pro는 Microsoft의 quality-tier 이미지 모델로, 2026년 7월 23일 Microsoft Foundry에서 공개 미리보기(public preview)를 시작했으며 현재 Artificial Analysis Image Editing Arena에서 1위를 달리고 있다. Bernini-Diffusers-v2는 ByteDance의 2세대 통합 생성 프레임워크로, 2026년 8월 13일 아무런 발표도 없이 Apache-2.0 가중치로 Hugging Face에 공개되었으며, ByteDance 외부에서 실행된 이미지 품질 벤치마크도 하나도 없다. 이 맞대결에서 나타나는 모든 실질적 차이는 바로 이 두 가지 사실에서 비롯된다.

하나는 부르고, 하나는 달린다.

MAI-Image-2.5-Pro — Azure AI Foundry 및 MAI Playground에서 공개 미리 보기로 제공되는 호스팅 API 모델입니다. 독점 모델이며, 토큰 기반으로 과금되고, 미세 조정이나 자체 호스팅은 지원되지 않습니다. 엔드포인트를 제공받아 토큰당 비용을 지불하며, 인프라는 Microsoft가 운영합니다.

Bernini-Diffusers-v2 — Hugging Face에서 다운로드하여 직접 실행하는 Apache-2.0 가중치입니다. 스택은 Qwen2.5-VL-7B 시맨틱 플래너가 Wan2.2 기반 DiT 렌더러를 구동하는 구조이며, README의 하드웨어 권장 사항은 Hopper급 GPU(H100/H800/H200)와 Python 3.11.2 / PyTorch 2.5.1+cu124입니다. 클러스터는 직접 준비해야 합니다.

결정 규칙을 한 줄로 말하면 이렇습니다. 조직이 스택을 소유하려 한다면 Bernini가 선택지이고, 조직이 인보이스와 SLA를 원한다면 오직 MAI-Image-2.5-Pro만이 고려 대상에 오릅니다. 이 둘은 서로 대체재가 아닙니다.

증거 격차가 진짜 헤드라인이다.

이 두 모델은 이미지 AI의 가장 큰 품질 문제인 출력 측정을 두고 상반된 입장에 있다. MAI-Image-2.5-Pro의 편집 능력은 독립적으로 평가된다 — 약 6,100건의 블라인드 비교에서 Elo 1,272로 Artificial Analysis Image Editing Arena 1위이며, Reve 2.1, GPT Image 2, 그리고 자매 모델인 MAI-Image-2.5보다 앞선다. 텍스트-이미지 순위는 1,292 Elo로 7위인데, 이는 정직한 균형추이다: 이 모델은 빈 캔버스에서의 선두주자가 아니라 전문 편집자이다. 이 수치는 브라우저가 있는 사람이라면 누구나 검증할 수 있다.

Bernini-Diffusers-v2에는 이에 상응하는 공개 점수가 없습니다. 모델 카드에는 {{1}}EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83, VBench 84.46{{/1}}이 보고되어 있지만, 이는 모두 공급업체 보고 수치이며 모두 비디오 측면 지표입니다. 카드에는 이미지 구매자가 텍스트-이미지 또는 이미지 편집 리더보드 결과로 알아볼 수 있는 내용이 전혀 없습니다. 카드는 Bernini가 ByteDance의 내부 블라인드 페어와이즈 아레나에서 비공개 상용 모델의 '최상위 계층'에 도달한다고 주장하지만, 이는 독립적인 검증이 있어야만 의미가 있는 공급업체 자체 평가의 전형입니다.

MAI-Image-2.5-Pro:이미지 편집 Elo 1,272 (독립 평가, 약 6,100표); 텍스트-이미지 Elo 1,292 (독립 평가, 약 11,500표)

Bernini-Diffusers-v2: 공개 이미지 벤치마크 없음; 비디오 관련 지표만 제공되며, 공급업체 보고 기준

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

편집에 관한 두 가지 서로 다른 이론

두 모델 모두 편집이 장면을 재생성하는 것을 의미해서는 안 된다는 아이디어를 기반으로 합니다. 그러나 접근 방식은 서로 다릅니다.

MAI-Image-2.5-Pro는 Microsoft의 "일관성을 갖춘 정밀하고 외과적인 편집"이라는 제안입니다. 하나의 객체를 변경하고, 이미지 내부의 텍스트를 업데이트하고, 모션 블러를 정리하면서, 피사체 정체성, 조명, 질감 등 다른 모든 것은 안정적으로 유지합니다. 바로 이 일관성이 94% 다중 이미지 캐릭터 일관성 주장(공급업체 보고, 미검증)의 메커니즘입니다. 제품의 목표는 좁은 범위의 편집만 수행하고 멈추는 모델입니다.

Bernini-Diffusers-v2는 계획-후-렌더링(plan-then-render) 파이프라인입니다: Qwen2.5-VL 플래너가 지시를 의미론적 단계로 분해합니다 — 날씨 변경, 스타일 교체, 객체 삽입, 주제 유지 — 그리고 렌더러가 결과를 그립니다. 이 설계는 복잡하고 다단계인 지시를 겨냥하며, 동일한 가중치가 텍스트-이미지, 이미지-이미지, 비디오 작업(t2i, i2i, t2v, v2v, rv2v, r2v)을 처리합니다. 그 폭이 장점입니다. 측정되지 않은 비용은 7B 플래너가 매우 미묘한 편집에 실질적인 병목이라는 점이며, ByteDance 외부에서 그 처리 방식을 정량화한 사람은 없습니다.

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

텍스트 렌더링, 실전의 격전장

이미지 내 텍스트는 현대 이미지 편집기가 그 값을 증명하는 영역이며, 여기서 그 차이는 극명합니다. MAI-Image-2.5-Pro의 핵심 기능은 정확한 텍스트 렌더링입니다 — 마이크로소프트는 영어, 중국어, 일본어, 한국어, 스페인어에서 96.8% 정확도를 주장합니다 (공급업체 보고 기준이며, 동일 문서에서 출력을 약 1메가픽셀로 제한하므로 이 수치는 방향성 참고용으로 보아야 합니다). Bernini-Diffusers-v2는 텍스트 렌더링 정확도를 전혀 공개하지 않았습니다. 현지화된 광고, 패키지, 또는 읽을 수 있는 단어가 포함된 모든 것을 제작하는 워크플로우의 경우, 한 후보는 측정 가능한 수치를 제공하고 다른 후보는 아무것도 제공하지 않습니다.

비용, 그리고 청구서의 형태

MAI-Image-2.5-Pro — 텍스트 입력 토큰 100만 개당 $5, 이미지 입력 토큰 100만 개당 $8, 이미지 출력 토큰 100만 개당 $106입니다. 이미지당 비용은 공개되지 않았으며, Artificial Analysis의 환산에 따르면 1024×1024 이미지는 1,000개당 약 $108.50입니다. 미리보기 가격으로, GA(일반 공개) 시 변경될 수 있습니다.

Bernini-Diffusers-v2 — 가중치는 무료이지만, 자체 호스팅에는 H100급 하드웨어(또는 클라우드 임대), 계속 운영하기 위한 관리 작업, 그리고 자체적인 확장이 필요합니다. 비용 구조는 API 모델과 정반대입니다. 하루에 열 장이면 비싸고, 대량으로 사용하면 저렴합니다.

대부분의 팀에게 솔직하게 말하자면, Bernini의 총소유비용은 이미 GPU 팜을 운영 중이고 워크로드가 크고 꾸준한 경우에만 유리하다. 그렇지 않으면 프리미엄 요금의 종량제 API가 더 저렴한 실패 방식이다.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

여기서 라우터가 할 수 있는 일과 할 수 없는 일

오늘날 두 모델 모두 OrcaRouter를 통해 라우팅할 수 없습니다. 그 이유는 정반대입니다. MAI-Image-2.5-Pro는 Microsoft Foundry의 직접 미리보기 뒤에 있으며, Bernini-Diffusers-v2는 전혀 엔드포인트가 아닙니다. 즉, 가중치(weights)에 불과합니다. 이는 이번 대결의 원칙으로서 중요합니다. 라우터 패턴은 이 비교에서 호출 가능한 API에 해당하는 절반에만 적용됩니다. MAI-Image-2.5-Pro가 호출 가능한 타사 API에 도달하면, 프로덕션 경로를 미리보기 코드에 의존하지 않고 채택하는 방법은 검증된 모델을 자동 장애 조치로 삼아 트래픽 일부를 그쪽으로 라우팅하는 것입니다. OrcaRouter에서 이는 하나의 엔드포인트, 0% 마크업으로 전달되는 공급자 가격, 그리고 낮은 표를 받은 리더보드가 보지 못한 모든 것을 잡아내는 폴백으로 구성됩니다. 오픈 가중치 측에는 이에 상응하는 것이 없습니다. Bernini의 스택을 직접 실행하거나 전혀 사용하지 않아야 합니다.

평결

MAI-Image-2.5-Pro는 프리미엄급이며 측정 가능한 호스팅 편집기입니다. 독립적인 편집 평가에서 1위를 차지했고, 실제 텍스트 렌더링 성능을 내세우며, 그에 걸맞은 가격을 갖추고 있습니다. Bernini-Diffusers-v2는 무료이고 광범위하며 이미지 분야에서 검증되지 않은 오픈 가중치 파이프라인으로, 비디오도 처리합니다 — 자체 호스팅한다면 정말 흥미롭지만, 누군가 공개 이미지 평가를 실행하기 전까지는 정말로 점수를 매길 수 없습니다. 워크플로에 호출 가능한 API와 방어할 수 있는 수치가 필요하다면, 선택은 MAI-Image-2.5-Pro 또는 그것이 능가하는 다른 호스팅 편집기 중 하나입니다. 워크플로에 소유권이 필요하고 하드웨어를 직접 운영할 수 있다면, Bernini-Diffusers-v2는 테스트해 볼 가치가 있습니다 — 다만 측정되지 않은 잠재력에 대한 베팅으로 구매해야지, 측정된 1위의 경쟁자로 구매해서는 안 됩니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube