Hero-titelkaart met de tekst 'Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash', ondertitel 'De ene levert een gelaagd ontwerp op, de andere kan helemaal geen stilstaand beeld teruggeven', met twee minimalistische icoonkaarten. Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash: Een design deliverable heeft beide helften nodig

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Vraag Ming-Image-0.1-Design om een video en je krijgt een still. Vraag Gemini Omni 1.1 Flash om een still en je krijgt een foutmelding — in de eigen documentatie van het model worden beeldgeneratie, beeldbewerking en afwisselende beeld- en tekstuitvoer genoemd als niet-ondersteunde mogelijkheden. Een pagina die deze twee in twee kolommen zet, vergelijkt dus een renderer met een projector. Wat echt de moeite waard is om te vergelijken, is het punt waarop designteams het steeds mis hebben: een deliverable die is opgeleverd, heeft meestal een scherm en een bewegende asset nodig, en deze twee modellen bezitten elk de helft daarvan, met een overdracht in het midden die geruisloos werk vernietigt.

Ming-Image-0.1-Design is het 6B tekst-naar-afbeelding-model van inclusionAI, uitgebracht onder MIT met gewichten die op 17 september 2026 zijn gepubliceerd, gebouwd voor tekstintensief grafisch ontwerp. Gemini Omni 1.1 Flash is het productievideomodel van Google, algemeen beschikbaar sinds 27 augustus 2026, gebouwd voor korte bewegingen met gesynchroniseerde audio. Geen van beide is een vervanging voor de ander, en de interessante vraag is wat er tussen hen gebeurt.

De twee helften, simpelweg gesteld

Begin met wat elk ervan fysiek teruggeeft, want al het andere volgt daaruit.

• Uitvoer — Ming-Image-0.1-Design retourneert een stilstaand beeld, tot 2048 x 2048 bij 12 samplingstappen en CFG 1.0, of 1024 x 1024 voor snelheid; Gemini Omni 1.1 Flash retourneert video, tot 40 seconden, samengesteld uit generatie- en verlengingsaanroepen van 10 seconden

• Transparantie — Ming-Image-0.1-Design levert native RGBA wanneer de prompt begint met een gedocumenteerde transparantieformulering, zodat alpha rechtstreeks uit de sampler komt; Gemini Omni 1.1 Flash heeft geen transparante uitvoer, en er is ook geen transparant videoformaat in de pipeline

• Structuur — het bijbehorende Layer-model van Ming-Image-0.1-Design splitst een afgevlakt ontwerp op in 2–9 afzonderlijke RGBA-PNG's die weer samenvoegen tot het origineel; Gemini Omni 1.1 Flash retourneert één enkele afgeplatte clip

• Referentie-invoer — Ming-Image-0.1-Design genereert alleen op basis van een prompt, zonder dat een referentieafbeelding nodig is; Gemini Omni 1.1 Flash accepteert tot 10 afbeeldingen per prompt en tot drie referentievideoclips van 3 seconden, en leest tot 10 seconden eerdere footage bij het verlengen van een scène

• Resolutieplafond — Ming-Image-0.1-Design is native 2048; Gemini Omni 1.1 Flash rendert native op 720p en schaalt op naar 1080p en 4K, met een 360p-conceptlaag

• Kosten — Ming-Image-0.1-Design heeft geen gehoste prijs omdat er geen gehost endpoint is, dus de kosten bestaan uit je eigen GPU-tijd op één kaart van 80 GiB; Gemini Omni 1.1 Flash rekent $0,10 per seconde bij 720p, met de 360p-conceptlaag op ongeveer $0,03 per seconde

• Licentie — MIT voor Ming-Image-0.1-Design, commercieel gebruik toegestaan; een commerciële API voor Gemini Omni 1.1 Flash waarvan de uitvoer SynthID-watermerking bevat

A rendered two-column scoreboard headed 'Two halves', titled 'Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash'. The Ming-Image-0.1-Design column reads: returns a still to 2048 x 2048; 12 steps, CFG 1.0; transparency native RGBA; structure 2-9 editable RGBA layers; cost your own 80 GiB GPU; independent placement #1 open weights in the UI/UX slice. The Gemini Omni 1.1 Flash column reads: returns video to 40 seconds; 10-second calls with 10s lookback; transparency none and no alpha video; structure one flattened clip; cost $0.10 per second at 720p; independent placement top of the video arenas with no audio.

Waar de overdracht misgaat

Als je een ontwerppijplijn bouwt die beide produceert, is de richting slechts één kant op: Ming-Image-0.1-Design maakt het frame, Gemini Omni 1.1 Flash animeert het. Het omgekeerde bestaat niet. En de naad tussen beide is waar het ontwerpwerk verloren gaat.

Het eerste slachtoffer is het alfakanaal. Een UI-asset die met een transparante achtergrond is gegenereerd, is überhaupt de reden om een sampler te gebruiken die RGBA uitstuurt — zo'n asset kan op een bestaande lay-out worden geplaatst zonder een uitsnijdstap. Stop dat frame in een videopad en de transparantie is verdwenen, omdat er geen transparante video-uitvoer is om die in te bewaren. Transparantie overleeft in je compositor, toegepast nadat de clip terugkomt, niet in de modelketen. Teams die de compositie plannen voordat de clip bestaat, moeten het uiteindelijk overdoen.

Het tweede slachtoffer is resolutie. Ming-Image-0.1-Design rendert native op 2048. Gemini Omni 1.1 Flash rendert native op 720p en schaalt daarna op. Een ontwerpframe van 2048 pixels dat door een 720p-renderpad wordt gehaald, is grotendeels weggegooid detail, en de daaropvolgende upscale is een stap aan de leverancierskant die u niet zelf in de hand hebt.

De derde is tekst. Het hele uitgangspunt van Ming-Image-0.1-Design is dat weergegeven tekst leesbaar blijft op de grootte waarop die gelezen zal worden — dat is de as die zijn 1.084 Elo in de Artificial Analysis UI/UX Design-slice meet. Een videomodel dat dat frame animeert, rendert de tekst niet opnieuw; het verplaatst de pixels die het heeft gekregen. Elke beweging die het perspectief, de schaal of de belichting van het frame verandert, verplaatst de typografie mee, en kleine letters die in een stilstaand beeld leesbaar waren, overleven de transformatie niet.

Geen van die dingen is een defect in een van beide modellen. Het is wat er gebeurt wanneer een op te leveren resultaat over twee systemen wordt verdeeld die nooit ontworpen zijn om aan elkaar over te dragen, en de oplossing is een productiebeslissing, niet een modelkeuze: bepaal welke laag van het op te leveren resultaat mag worden platgeslagen, en sla die bewust plat.

Waar elke helft eigenlijk goed in is

Het bewijs voor Ming-Image-0.1-Design is een arena van een derde partij. Het staat op rang 45 van 104 op de Artificial Analysis Text to Image-leaderboard met een Elo van 995 over 21.342 stemmen, en op de eerste plaats onder de open-weightmodellen in de UI/UX Design-slice van dat leaderboard met 1.084 Elo bij 2.100 stemmen in die slice. Het verschil tussen die twee cijfers is de eerlijke beschrijving van het model: een gemeten specialist, geen generalist. De cijfers van zijn metgezel Layer — RGB L1-fout van 0,0574 en alpha soft IoU van 0,8923 bij 1024 op de Crello-testset — zijn door de leverancier gerapporteerd en niet gereproduceerd, en moeten als zodanig worden gelabeld.

Het bewijs van Gemini Omni 1.1 Flash is ook onafhankelijk, maar op een andere ranglijst. Op Artificial Analysis stond het per 2 september 2026 op de eerste plaats in zowel de arena's voor tekst-naar-video als die voor afbeelding-naar-video in de categorie zonder audio, met een Elo van 1.324 en 1.364. Met audio ingeschakeld zakt het naar 1.237 en 1.180 — de tweede en vierde plaats. Dat gat in audioprestaties is een detail dat een specificatieblad verbergt en een ranglijst blootlegt, en het is de moeite waard om dat te weten voordat je een campagne begroot op basis van een claim over een toppositie op de ranglijst.

De twee borden overlappen niet, en dat is juist het punt. Er is geen arena waarin een ontwerpstilstaand beeld en een clip van tien seconden tegen elkaar worden afgewogen, en elk artikel dat het tegendeel suggereert, verzint een scorebord.

Screenshot of Google's Gemini API models documentation at ai.google.dev/gemini-api/docs/models, captured 24 September 2026 in English. The left navigation lists Gemini 3, Nano Banana, Veo, Gemini Omni Flash, Lyria 3.5 & Lyria Clip, Text-to-speech, Transcribe and other model families. The body shows the Models guide heading, a Gemini 3 section with Gemini 3.8 Flash, Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking cards marked New and Stable, and a Generative media models entry in the on-this-page rail.

Wat de split kost, per poging

De economie van de twee helften is niet vergelijkbaar en mag niet worden gemiddeld tot één begrotingspost.

Aan de stilstaande-beeldkant kost Ming-Image-0.1-Design niets per afbeelding zodra de hardware er is. Dat maakt iteratie gratis op de manier die ertoe doet: je kunt in één middag twintig dashboardvarianten genereren en er negentien weggooien. Aan de bewegende-beeldkant kost een clip van 10 seconden in 720p op Gemini Omni 1.1 Flash ongeveer $1,00; dezelfde 10 seconden op het 360p-conceptniveau kosten ongeveer $0,30; een volledige scène van 40 seconden in 720p — één generatie plus drie extensieaanroepen — komt uit op bijna $4,00. Google heeft geen tarieven per seconde gepubliceerd voor de 1080p- en 4K-niveaus, en resellervermeldingen die $0,15 en $0,30 per seconde noemen, zijn schattingen van marktplaatsen in plaats van leverancierscijfers, dus elk productiebudget voor hoge resolutie blijft voorlopig.

Het praktische gevolg is dat de twee helften tegenovergestelde werkwijzen willen. Itereer op de stil, waar nieuwe pogingen gratis zijn. Leg vast op de video, waar elke nieuwe poging wordt afgemeten. Een team dat itereert op de videohelft is het team dat wordt verrast door de factuur, want het eerste frame kost niets en de heropnames kosten alles.

Waar een routeringslaag hier past, is smaller dan een pitch zou suggereren, en het is de moeite waard om dat precies te zeggen. Ming-Image-0.1-Design is een MIT-download — OrcaRouter routeert geen enkel inclusionAI-model, dus het draait op jouw hardware of helemaal niet. Gemini Omni 1.1 Flash is een provider-API met een eigen sleutel en een eigen meter per seconde, en die routeren wij ook niet; Google heeft de Omni-video-API niet opengesteld voor routering door derden. Wat wij aan de videokant wel aanbieden is de videolijn van Kling, waaronder kling-v3, kling-v3-omni en kling-video-o1, plus MiniMax H3 — dus als de geanimeerde helft van een deliverable een gehoste route nodig heeft in plaats van een tweede providercontract, dan bestaat die aan onze kant. Aan de beeldkant bieden we de OpenAI GPT-Image-familie, de Imagen 4-niveaus van Google en Gemini-afbeeldingspreviews, en het Grok Imagine-afbeeldingseindpunt van xAI. Omdat de lijstprijs van de provider wordt doorgegeven tegen 0% opslag in plaats van met een opslag te worden verhoogd, is een prijsverlaging van een provider op elk van hen dezelfde dag bij ons live.

A rendered summary card headed 'The handoff', titled 'What a still loses on the way to motion', listing four losses: the alpha channel (Ming-Image-0.1-Design emits it from the sampler, Gemini Omni 1.1 Flash has no transparent video output); resolution (2048 x 2048 in against a path that renders natively at 720p and upscales); typography (the video model moves the pixels it is given and does not re-render the copy); and working style (stills iterate for free, video bills about $1.00 per 10 seconds at 720p and about $0.30 at the 360p draft tier).

De beslissing, in één keer

• Je hebt bewerkbare designassets nodig — Ming-Image-0.1-Design, en laagdecompositie is de reden. Transparante uitsneden, iconen, sprites en gelaagde composities zijn waar een sampler die RGBA uitstuurt een hele fase uit de pipeline verwijdert.

• Je hebt beweging nodig, gemeten — Gemini Omni 1.1 Flash. Het is de enige van de twee met onafhankelijke arenaresultaten bovenaan een ranglijst, en de enige met een gepubliceerde prijs per seconde die je in een prognose kunt opnemen.

• Je hebt beide nodig — begroot de videohalve per poging in plaats van per asset, ga er niet van uit dat het alfakanaal overleeft, en plan de compositie nadat de clip terugkomt.

• Je moet de output verkopen — Gemini Omni 1.1 Flash is onbetwistbaar de veiligere helft, aangezien MIT de Ming-Image-0.1-Design-gewichten dekt en de API-voorwaarden van Google de video dekken. De watermerken zijn de ruil: elke Omni-clip bevat SynthID, en geen enkele output van Ming-Image-0.1-Design doet dat.

Wat de moeite waard is om vervolgens in de gaten te houden, is niet nog een directe confrontatie. Het is of inclusionAI een gehost endpoint aan Ming-Image-0.1-Design koppelt — wat de instapkosten van 80 GiB zou wegnemen en deze vergelijking volledig zou veranderen — en of Google de audiokloof op de Omni-videoborden dicht. Die twee feiten, niet nog een scorebord, bepalen welk deel van een design-deliverable het budget krijgt.