Hero-titelkaart met de tekst 'Ming-Image-0.1-Design vs GPT Image 2.5', ondertitel 'De ene score werd door vreemden gestemd, de andere werd getekend door het eigen team van het model', met twee kaarten waarop staat 'GPT Image 2.5: 1.227 Elo op het UI/UX Design-board, 1.287 blinde stemmen, $210,72 per 1.000 afbeeldingen' en 'Ming-Image-0.1-Design: 1.082 Elo op een ranglijst die in zijn eigen repository is gepubliceerd, 0 downloads'. Het OrcaRouter-logo is samengesteld in de rechteronderhoek.
Guides & Insights

Ming-Image-0.1-Design vs GPT Image 2.5: Het eigen cijfer van een lab tegen de stemmen van een panel van vreemden

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet Ming-Image-0.1-Design en GPT Image 2.5 in dezelfde zin en de voor de hand liggende vergelijking is kwaliteit. De nuttige vergelijking is herkomst. GPT Image 2.5 bekleedt de eerste en de tweede plaats op het live Artificial Analysis UI/UX Design-bord, met 1.227 en 1.218 Elo, op respectievelijk 1.287 en 1.303 blinde menselijke stemmen — dat wil zeggen een rangschikking die tot stand is gekomen door mensen die het model niet hebben gebouwd en niet te horen kregen welke output van wie was. Aan Ming-Image-0.1-Design hangt precies één score, 1.082 Elo, en die score staat op een leaderboard-afbeelding die is meegeleverd in inclusionAI's eigen Hugging Face-repository, op een bord dat we nergens anders konden vinden, voor een model met nul downloads. Een van die cijfers is bewijs. Het andere is een bewering met een lettertype. Die kloof, niet de 145 Elo tussen beide, is wat een beslissing over een van beide modellen zou moeten vormgeven.

De twee getallen naast elkaar, en de valkuil bij het vergelijken ervan

De getallen liggen dicht genoeg bij elkaar om vergelijkbaar te lijken en verschillen genoeg in aard dat ze dat niet zijn. Hier is de verzameling, precies uiteengezet.

• GPT Image 2.5, op het live leaderboard — eerste plaats met 1.227,0 Elo voor de Flare (max)-configuratie, tweede met 1.218,1 voor Sunburst (max), met sample-aantallen van 1.287 en 1.303 en een bijgehouden prijs van $ 210,72 per 1.000 afbeeldingen. Het model stond op dat leaderboard vermeld als uitgebracht op 8 september 2026.

• Ming-Image-0.1-Design, op een eigen kaart — eerste plaats met 1.082 Elo, vóór Ideogram 4.0 (Quality) met 1.052 en de FLUX.2 dev-varianten tussen 994 en 1.000, op een afbeelding met als titel "Ranglijst voor tekst naar afbeelding: UI/UX-ontwerp" en als voettekst "Elo-scores op basis van blinde voorkeursstemmen in onze Image Arena". Er wordt geen aantal samples getoond. Er is geen methodologie gepubliceerd. De ranglijst zelf staat, voor zover wij kunnen nagaan, niet op het publieke web.

• De valkuil — Elo wordt per ranglijst berekend. Een score is alleen betekenisvol ten opzichte van de andere scores op dezelfde ranglijst. Daarom scoort dezelfde FLUX.2-release 1.026 op de algemene ranglijst voor tekst-naar-afbeelding en 1.065 in de categorieweergave UI/UX Design. Trek 1.082 af van 1.227 en je hebt geen kwaliteitsverschil tussen twee modellen gemeten. Je hebt een getal van een ander getal afgetrokken.

A two-column scoreboard comparing GPT Image 2.5 with Ming-Image-0.1-Design. The GPT Image 2.5 column reads: 1,227 Elo first place, 1,287 blind votes, released 8 Sep 2026, $210.72 per 1,000 images, independent board, callable. The Ming-Image-0.1-Design column reads: 1,082 Elo first place, no vote count published, weights 17 Sep 2026, no published price, vendor-published board, not callable. A footer notes the two Elo figures are not on the same scale.

Wat maakt een blinde stemming een blinde stemming

Artificial Analysis publiceert genoeg van zijn methode om controleerbaar te zijn. Zijn image arena zet twee generaties van anonieme modellen tegenover elkaar, vraagt een stemmer een winnaar te kiezen en zet de uitkomsten om in een Elo-rating — de aantallen samples op het bord zijn het aantal van zulke vergelijkingen dat elk model heeft verzameld. Die structuur zorgt ervoor dat een score weerbaar is tegen de eigen auteurs van het model: de mensen die GPT Image 2.5 hebben getraind komen niet in het proces voor, en een model kan niet op de eerste plaats komen door het model te zijn dat zijn maker verkiest. Het is geen perfect instrument — de groep stemmers is zelfgeselecteerd en de prompts vormen geen gecontroleerde benchmark-suite — maar het is een instrument dat door iemand anders dan de leverancier wordt vastgehouden.

De grafiek in de Ming-Image-0.1-Design-repository leent dat formaat zonder de onderdelen die het verifieerbaar maken. "Blinde voorkeursstemmen" is de bewering. "Our Image Arena" is de operator, en de operator is inclusionAI. Er is geen gepubliceerd aantal stemmen, geen zichtbare promptdistributie, en geen manier om de paren te inspecteren. Het is heel goed mogelijk dat de evaluatie achter die grafiek eerlijk en rigoureus is — het team van het model zou dat weten. Het is ook volledig oncontroleerbaar van buitenaf, wat het enige is dat ertoe doet als jij degene bent die beslist of je erop voortbouwt.

De moeite waard om toe te voegen, want het gaat tegen het gemakkelijke verhaal in: Ming-Image-0.1-Design staat helemaal niet op de live Artificial Analysis-ranglijst. Niet in de categorie UI/UX Design, niet op de algemene text-to-image-ranglijst, niet in de open-weights-weergave. Het ontbreken ervan is geen bewijs dat het slechter is — een model met nul downloads en geen gehost endpoint heeft geen manier om stemmen te verzamelen. Het is bewijs dat er nog geen onafhankelijk cijfer bestaat, wat een andere bewering is.

Prijs is het onderdeel dat niet dubbelzinnig is.

Qua kosten liggen de twee modellen niet dicht bij elkaar en valt er niets over te discussiëren.

• GPT Image 2.5 is een commercieel endpoint. Artificial Analysis registreert het op $210,72 per 1.000 afbeeldingen in de categorie UI/UX — ongeveer 21 cent per afbeelding, waarmee het bovenaan het prijsbereik van het vakgebied staat. Voor context op dezelfde ranglijst: Grok Imagine Image 2.0 wordt geregistreerd op $60 per 1.000, MAI-Image-2.6 op $38,9 en Muse Image op $10.

• Ming-Image-0.1-Design heeft geen prijs omdat het geen endpoint heeft. De gewichten zijn MIT-gelicentieerd en gratis te downloaden; het draaien ervan kost wat één 80 GiB CUDA-GPU je per uur kost. De gevalideerde configuratie van de modelkaart is één kaart van die klasse, bij een resolutie van 2048 x 2048 en 12 samplingstappen.

• Geen van beide cijfers is stabiel. Beide leveranciers herzien hun tarieven, en een vergelijking per afbeelding die vandaag wordt geschreven, heeft een houdbaarheid van weken. Dit is de enige plek waar het loont om de economie van OrcaRouter ronduit te benoemen: we geven de lijstprijzen van providers door met 0% opslag, zodat een tariefwijziging van een leverancier bij ons dezelfde dag live is in plaats van na een eigen prijsherzieningscyclus — wat van belang is wanneer het verschil tussen twee kandidaten 21 cent tegen 6 cent per afbeelding is en beide kunnen veranderen.

Wat je vandaag daadwerkelijk kunt aanroepen, en waar wij daarin staan

Beschikbaarheid is het punt waarop deze vergelijking ophoudt een gedachte-experiment te zijn.

GPT Image 2.5 is een echt product met een echte API erachter, verkocht door OpenAI op zijn eigen voorwaarden. Het kan niet via OrcaRouter worden gerouteerd — onze catalogus bevat per 23 september 2026 geen vermelding voor GPT Image 2.5 — en we gaan geen route beschrijven die we niet hebben. Wat de catalogus uit dezelfde lijn wél bevat, is de vorige generatie, openai/gpt-image-2 tegen $8,00 per miljoen inputtokens en $30,00 per miljoen outputtokens, naast openai/gpt-image-1.5, en die zitten achter dezelfde sleutel als al het andere dat we routeren.

Ming-Image-0.1-Design is nergens routeerbaar. De repository heeft inferentie uitgeschakeld, Hugging Face meldt geen implementatie van een inferentieprovider, en de Quick Start verwijst naar een bijbehorende GitHub-repository die 404 teruggeeft. Geen enkel inclusionAI-model van welke aard dan ook staat in onze catalogus. De enige manier om het te draaien is de shards te downloaden en ze zelf te serveren.

De vorm van de keuze is dus: één optie die je vandaag kunt kopen tegen de hoogste marktprijs, en één optie die je vandaag kunt draaien voor de prijs van een GPU en je eigen engineeringtijd, zonder onafhankelijk bewijs dat het presteert. Iedereen die je vertelt dat Ming-Image-0.1-Design een goedkoper alternatief is voor GPT Image 2.5, heeft de tweede optie niet meegerekend.

The Artificial Analysis text-to-image leaderboard's UI/UX Design category view, captured 23 September 2026, showing GPT Image 2.5 Flare (max) first at 1,227 Elo with 1,287 samples and $210.7 per 1,000 images, GPT Image 2.5 Sunburst (max) second at 1,218, GPT Image 2 (high) third at 1,206, and Grok Imagine Image 2.0 fourth at 1,182. No Ming-Image-0.1-Design row appears on the board.

Hoe je beide kunt vasthouden zonder op een van beide te wedden

Het praktische advies hier is beperkter dan een uitspraak, omdat de twee modellen nog geen vervanging voor elkaar zijn.

Als je in productie beeldgeneratie van UI- of designkwaliteit nodig hebt, is GPT Image 2.5 de verdedigbare keuze, en de prijs is het punt waarover je met jezelf moet onderhandelen, niet de kwaliteit — het staat aan kop op de onafhankelijke ranglijst met een marge die breed genoeg is dat de rangschikking niet ter discussie staat. Als je wilt weten of Ming-Image-0.1-Design goed is, heb je twee opties en slechts één ervan is vrij van giswerk: zet de MIT-gewichten op een 80 GiB-kaart en draai je eigen evaluatieset, of wacht tot iemand anders dat doet. Behandel de 1.082 in de tussentijd niet als een resultaat. En als je werkelijke behoefte het hebben van opties is in plaats van specifiek een van beide modellen, is de discipline die loont: de generatieaanroep achter één enkele interface houden — één sleutel voor meer dan 200 modellen, een wijziging van model-ID in plaats van een herschrijving, automatische failover wanneer een endpoint zich misdraagt — zodat, welke van deze twee ook als eerste een onafhankelijk cijfer naar buiten brengt, het adopteren ervan je een configuratieregel kost en geen sprint.

Een slotopmerking over wat dit stuk zou veranderen. Een rij voor Ming-Image-0.1-Design die op het Artificial Analysis UI/UX Design-board verschijnt, met daarnaast een aantal samples, zou de 1.082 van de leverancier omzetten van een claim in een datapunt — en het zou de eerste keer zijn dat iemand buiten inclusionAI iets meetbaars over het model zegt. Dat is de gebeurtenis om in de gaten te houden, en het is iets nuttigers om te volgen dan de downloadteller.

The OrcaRouter models catalogue, captured 23 September 2026, showing the English-language model directory with its search box, the copy-the-model-ID instructions, and the filter panel for input modalities, context length, price, status and series.