כרטיס גיבור להתמודדות בין MAI-Image-2.5-Pro, מודל עריכה פרימיום בתצוגה המקדימה של Microsoft Foundry, לבין Bernini-Diffusers-v2, ה-pipeline בעל המשקלים הפתוחים ברישיון Apache-2.0 של ByteDance.
Guides & Insights

MAI-Image-2.5-Pro נגד Bernini-Diffusers-v2: #1 נמדד מול הימור לא נמדד במשקלים פתוחים

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

השוואה בין MAI-Image-2.5-Pro לבין Bernini-Diffusers-v2 אינה ממש השוואה בין שני מודלי תמונה. זוהי השוואה בין שתי תשובות שונות לאותה שאלה — "איך משיגים עריכה טובה של תמונה קיימת?" — כאשר בצד האחד עומדים 6,100 קולות אנושיים עיוורים מאחורי דירוג העריכה מספר 1 שלו, ובצד השני קובץ README. MAI-Image-2.5-Pro, מודל התמונה בדרגת האיכות של מיקרוסופט, נכנס לתצוגה מקדימה ציבורית ב-Microsoft Foundry ב-23 ביולי 2026 וכיום מוביל את זירת עריכת התמונות של Artificial Analysis. Bernini-Diffusers-v2, מסגרת הייצור המאוחדת מדור שני של ByteDance, הופיע ב-Hugging Face ב-13 באוגוסט 2026 כמשקולות Apache-2.0 ללא הודעה מוקדמת וללא אמת מידה לאיכות תמונה שהריצה מישהו מחוץ ל-ByteDance. כל הבדל מעשי בהתמודדות זו נובע משתי העובדות הללו.

אחד שאליו מתקשרים, אחד שממנו בורחים

MAI-Image-2.5-Pro — מודל API מתארח ב-preview ציבורי ב-Azure AI Foundry וב-MAI Playground. קנייני, מתומחר לפי טוקנים, ללא fine-tuning, ללא אירוח עצמי. מקבלים endpoint ומשלמים לפי טוקן; מיקרוסופט מתפעלת את התשתית.

Bernini-Diffusers-v2 — משקלי Apache-2.0 שאתה מוריד מ-Hugging Face ומריץ בעצמך. הערימה כוללת מתכנן סמנטי Qwen2.5-VL-7B שמניע רנדרר DiT מבוסס Wan2.2, והמלצת החומרה ב-README היא GPUs מסוג Hopper (H100/H800/H200) עם Python 3.11.2 / PyTorch 2.5.1+cu124. אתה מספק את הקלאסטר.

זהו כלל ההכרעה בשורה אחת: אם הארגון שלך רוצה להיות הבעלים של הערימה, Bernini היא אופציה; אם הארגון שלך רוצה חשבונית ו-SLA, רק MAI-Image-2.5-Pro אפילו בתמונה. הם אינם תחליף זה לזה.

פער הראיות הוא הכותרת האמיתית.

שני הדגמים נמצאים בצדדים מנוגדים של בעיית האיכות הגדולה ביותר ב-AI לתמונות: מדידת הפלט. כישור העריכה של MAI-Image-2.5-Pro מקבל ציון עצמאי — מקום 1 ב-Artificial Analysis Image Editing Arena עם Elo 1,272 מתוך ~6,100 השוואות עיוורות, לפני Reve 2.1, GPT Image 2, ואחיו MAI-Image-2.5. הדירוג שלו בטקסט-לתמונה הוא שביעי עם 1,292 Elo, וזהו המשקל הנגדי הכנה: הוא עורך מומחה, לא מוביל ביצירה מקנבס ריק. המספרים האלה ניתנים לאימות על ידי כל אחד עם דפדפן.

ל-Bernini-Diffusers-v2 אין ציון ציבורי מקביל. כרטיס המודל מדווח על EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83, ו-VBench 84.46 — כולם מדווחים על ידי הספק, וכולם מדדים הקשורים לוידאו. אין בכרטיס שום דבר שקונה תמונות היה מזהה כתוצאה של לוח תוצאות לטקסט-לתמונה או לעריכת תמונות. הכרטיס אכן טוען שברניני מגיע ל"דרגה הראשונה" של מודלים מסחריים סגורים בזירה הפנימית העיוורת של ByteDance — וזה בדיוק סוג ההערכה העצמית של ספק שצריכה בדיקה בלתי תלויה לפני שהיא אומרת משהו.

MAI-Image-2.5-Pro:עריכת Elo 1,272 (עצמאי, ~6,100 הצבעות); טקסט-לתמונה Elo 1,292 (עצמאי, ~11,500 הצבעות)

Bernini-Diffusers-v2: אין בנצ'מרק ציבורי לתמונות; מדדי וידאו בלבד, לפי דיווח הספק

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

שתי תאוריות שונות של עריכה

שני המודלים בנויים סביב הרעיון שעריכה לא אמורה להביא לשחזור של הסצנה. אבל הם מגיעים לשם בדרכים שונות.

MAI-Image-2.5-Pro הוא המסר של Microsoft בנוסח "עריכות מדויקות וכירורגיות עם עקביות": לשנות אובייקט אחד, לעדכן את הטקסט שבתוך התמונה, לנקות טשטוש תנועה, ולשמור על כל השאר — זהות הנושא, התאורה, המרקם — יציבים. אותה עקביות היא המנגנון מאחורי הטענה של 94% עקביות דמות בין תמונות מרובות (מדווח על ידי הספק, לא מאומת). מטרת המוצר היא מודל שמבצע את העריכה המצומצמת ועוצר.

Bernini-Diffusers-v2 הוא צינור (pipeline) של תכנון-ואז-רנדור: מתכנן ה-Qwen2.5-VL מפרק הוראה לשלבים סמנטיים — שנה את מזג האוויר, החלף את הסגנון, הכנס אובייקט, שמור על הנושא — והמרנדר מצייר את התוצאה. העיצוב מיועד להוראות מורכבות ורבות-שלבים, ואותם משקלים (weights) מכסים משימות של טקסט-לתמונה, תמונה-לתמונה ווידאו (t2i, i2i, t2v, v2v, rv2v, r2v). הרוחב הזה הוא היתרון; המחיר הבלתי-נמדד הוא שמתכנן 7B הוא צוואר בקבוק אמיתי לעריכות עדינות מאוד, ואף אחד מחוץ ל-ByteDance לא כימת כיצד הוא מתמודד איתן.

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

רינדור טקסט, שדה הקרב המעשי

טקסט בתוך תמונה הוא המקום שבו עורך תמונות מודרני מוכיח את שוויו, וכאן האסימטריה בולטת. היכולת המרכזית של MAI-Image-2.5-Pro היא עיבוד טקסט מדויק — מיקרוסופט טוענת לדיוק של 96.8% באנגלית, סינית, יפנית, קוריאנית וספרדית (דיווח של הספק; אותן מסמכים מגבילים את הפלט לכמעט מגה-פיקסל אחד, אז התייחסו למספר כאל כיוון). Bernini-Diffusers-v2 לא פרסם שום נתון דיוק לעיבוד טקסט. עבור זרימת עבודה שמייצרת פרסומות מקומיות, אריזות, או כל דבר שמכיל מילה קריאה, מועמד אחד מציע טענה מדידה והשני לא מציע כלום.

עלות, וצורת החשבון

MAI-Image-2.5-Pro — $5 למיליון טוקני קלט טקסט, $8 למיליון טוקני קלט תמונה, $106 למיליון טוקני פלט תמונה. העלות לתמונה לא מפורסמת; ההמרה של Artificial Analysis מעמידה תמונה של 1024×1024 על כ-$108.50 ל-1,000. תמחור תצוגה מקדימה, עשוי להשתנות בזמינות הכללית (GA).

Bernini-Diffusers-v2 — המשקלים חינמיים, אבל אירוח עצמי דורש חומרה ברמת H100 (או השכרת ענן), תפעול שוטף, וסקיילינג משלך. הכלכלה היא ההיפך ממודל ה-API: יקר לעשר תמונות ביום, זול בכמויות גדולות.

עבור רוב הצוותים, הניסוח הכנה הוא: עלות הבעלות הכוללת של ברניני משתלמת רק אם כבר מריצים צי GPU והעומס גדול ויציב. אחרת, API מדודה בתעריף גבוה היא הכישלון הזול יותר.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

מה נתב יכול ומה לא יכול לעשות כאן

אף אחד מהמודלים אינו ניתן לניתוב דרך OrcaRouter כיום, מסיבות הפוכות: MAI-Image-2.5-Pro נמצא מאחורי התצוגה המקדימה הישירה של Microsoft Foundry, ו-Bernini-Diffusers-v2 אינו נקודת קצה כלל — הוא משקלים. לכך יש משמעות עקרונית בהשוואה הזו: תבנית הניתוב חלה רק על החצי שבהשוואה זו הוא API שניתן לקרוא לו. כש-MAI-Image-2.5-Pro יגיע ל-API חיצוני קריא, הדרך לאמץ אותו מבלי להמר על מסלול ייצור המבוסס על קוד תצוגה מקדימה היא לנתב אליו נתח תעבורה עם מודל מוכח כגיבוי אוטומטי — ב-OrcaRouter מדובר בנקודת קצה אחת, מחירי ספקים שמועברים הלאה ללא תוספת מחיר (0%), וגיבוי שתופס את כל מה שלוח התוצאות בעל מספר ההצבעות הנמוך לא יכול היה לראות. לצד המשקלים הפתוחים אין מקבילה: או שאתה מריץ את המחסנית של Bernini בעצמך, או שאינך משתמש בה.

פסק הדין

MAI-Image-2.5-Pro הוא עורך מתארח, פרימיום ומדיד: #1 בלוח דירוג עריכה בלתי-תלוי, טענת רינדור-טקסט אמיתית, ומחיר תואם. Bernini-Diffusers-v2 הוא צינור במשקלים פתוחים, חינמי, רחב, ושלא הוכח בתחום התמונות, שעושה גם וידאו — מעניין באמת אם אתה מארח אותו בעצמך, ובלתי-מדיד באמת עד שמישהו יריץ הערכת תמונות פומבית. אם זרימת העבודה שלך דורשת API שאפשר לקרוא לו ומספר שאתה יכול להגן עליו, הבחירה היא MAI-Image-2.5-Pro או אחד העורכים המתארחים האחרים שהוא גובר עליהם. אם זרימת העבודה שלך דורשת בעלות ואתה יכול להריץ את החומרה, Bernini-Diffusers-v2 שווה בדיקה — אבל קנה אותו כהימור על פוטנציאל לא-נמדד, לא כמתחרה ל-#1 המדוד.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube