
Ming-Image-0.1-Design vs Qwen-Image 3.0: Wie laat je zien hoe de tekst wordt getekend
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Het interessantste aan Ming-Image-0.1-Design staat niet op zijn modelkaart. Het staat in een commit aan een inferentieframework. Rond de tijd van de stille upload van het model naar Hugging Face op 17 september 2026 voegde vLLM-Omni een wijziging samen met de titel feat: byte5-ondersteuning voor Ming toevoegen die een ByT5-glyph-encoder aansluit op een nieuwe ming_flash_omni-pipeline — een speciale component waarvan de hele taak erin bestaat om naar de tekens te kijken die je wilde laten weergeven, niet naar de afbeelding waar je om vroeg. Dat is het soort detail dat je alleen kunt vinden door code te lezen, en het is precies het detail dat Qwen-Image 3.0 — het gesloten gehoste beeldmodel van de leverancier, uitgebracht op 21 juli 2026 en op 5 augustus algemeen beschikbaar geworden — niemand überhaupt te lezen krijgt. Beide modellen zijn gericht op ontwerpwerk waar leesbare typografie het moeilijke deel is. Slechts één van hen zal je vertellen hoe het dat doet.
Wat elk van hen over tekst zegt
Het verhaal over tekstweergave van Qwen-Image 3.0 is volledig een lanceerclaim, en op papier is het een goede. Het materiaal van Alibaba beschrijft prompts van tot ongeveer 4.500 tokens, leesbare tekst tot ongeveer 10 pixels, dekking van 12 talen in meer dan 20 lettertypen, uitvoer tot 2048×2048 en tot zes afbeeldingen per aanroep, geleverd in Pro- en Standard-edities via één gehoste API. Er is geen release van gewichten, geen vermelde licentie, geen modelkaart, geen technisch rapport en geen gepubliceerde benchmarktabel om dit alles tegen te controleren. Het veelvuldig herhaalde cijfer van ~20B MMDiT-parameters wordt gemeld in plaats van bevestigd.
Het verhaal van Ming-Image-0.1-Design is een repository. 6.154.901.056 parameters, MIT-licentie, een diffusers-pipelinetag, alle gewichten in BF16 safetensors, ongeveer 71,5 GB verdeeld over connector/, mllm/, mlp/, scheduler/, transformer/ en vae/. Aanbevolen inferentie is 2048×2048 met 12 samplingstappen en guidance op 1.0 op één 80 GiB CUDA-GPU, of 1024 voor snelheid, waarbij vLLM-Omni genoemd wordt voor deployment en een afzonderlijk vision-language-model voor promptverbetering. De kaart beschrijft het als een tekst-naar-afbeelding-model voor UI, infographics, posters en andere tekstrijke visuele vormgeving, met RGBA-uitvoer voor transparante achtergronden.
Die twee alinea's zijn niet hetzelfde soort bewering, en het is de moeite waard om er bot over te zijn waarom. De ene is een beschrijving van een product, geschreven door de mensen die het verkopen. De andere is een beschrijving van een artefact dat iedereen kan downloaden en controleren.
De glyph-encoder is het onderdeel dat de categorie verklaart
Tekstweergave in beeldmodellen mislukt meestal op een specifieke manier: het model genereert iets dat op schrift lijkt zonder schrift te zijn. De lettervormen zijn aannemelijk en het woord is verkeerd. De reden is in de eerste plaats architecturaal — de meeste beeldmodellen hebben geen component dat tekens als tekens ziet, dus wordt type gereconstrueerd uit visuele statistieken, op dezelfde manier als gras.
De vLLM-Omni-commit is juist interessant omdat die daar precies op wijst. De toegevoegde bestanden — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py en een stage-invoerprocessor — beschrijven een pad waarin een ByT5-encoder op byteniveau de tekst leest die in de afbeelding moet verschijnen, de tokenizer-vocabulaire wordt uitgebreid met lettertype- en kleurmarkeringen, en de resulterende kenmerken langs de sequentiedimensie worden toegevoegd, waarbij de negatieve zijde nullen krijgt. Dat laatste detail verraadt dat dit een echte ontwerpbeslissing is en niet louter plumbing: als de negatieve tak dezelfde glyph-kenmerken zou bevatten, zou classifier-free guidance naar het renderen van de tekst toe en weg van de prompt worden getrokken, dus de nullen bestaan om te voorkomen dat de twee doelstellingen met elkaar botsen. De encoder wordt alleen geladen wanneer de checkpoint daadwerkelijk bevat: een byte5/ submap.
Twee eerlijkheidsopmerkingen. Dit is een commit van een inferentieframework van een derde partij, geen verklaring van Ant Group, en de interpretatie van wat die bestanden betekenen is de onze in plaats van die van de leverancier. En het ondersteunt een ontwerpintentie, geen resultaat: de aanwezigheid van een glyph-encoder is verenigbaar met goede tekstweergave, en het is geen bewijs dat tekstweergave goed is. Het enige onafhankelijke bewijs van kwaliteit is een enkele positie op de ranglijst, hieronder besproken.

Het contrast met Qwen-Image 3.0 is niet dat het model van Alibaba tekst slecht weergeeft — niemand buiten Alibaba kan zeggen hoe goed het tekst weergeeft, en dat is juist het punt. Het is dat de vraag "hoe tekent dit model letters" voor een van deze modellen een antwoord heeft en voor het andere een marketingclaim, en de kloof tussen een antwoord en een claim is waar technische beslissingen worden genomen.
Het ene nummer, en het bord waarop het niet staat.
Ming-Image-0.1-Design staat eerste op de Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights-weergave, met een Elo van 1.082 — vóór Ideogram 4.0 (Quality) met 1.052, Ideogram 4.0 met 1.015, HunyuanImage 3.0 Instruct met 1.005, FLUX.2 [dev] met 1.000, FLUX.2 [dev] Flash met 999 en FLUX.2 [dev] Turbo met 994. Het exemplaar van dat leaderboard is het exemplaar dat op de eigen kaart van het model is weergegeven, en het draagt de branding van Artificial Analysis; niemand heeft de score onafhankelijk gereproduceerd.
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1124.png)
Het is een open-weights-ranglijst, dus Qwen-Image 3.0 heeft er geen vermelding en die afwezigheid zegt niets over de kwaliteit. Wat het wel zegt, is structureel: een ranglijst op basis van blinde voorkeur kan alleen modellen rangschikken waarvan de gewichten openbaar zijn. Dat geeft een open release een meetbare positie maanden voordat er een product is, en het geeft een gesloten release een marketingcijfer en verder niets. De claims van Qwen-Image 3.0 — leesbaarheid van 10 pixels, prompts van 4.500 tokens, meer dan 20 lettertypen — hebben helemaal geen onafhankelijke meting achter zich.

Hoe je dit daadwerkelijk zou testen, en wat het kost om het te proberen
Als leesbare typografie de reden is dat u dit leest, is de test geen ranglijst. Het is uw eigen lettertype, uw eigen taal en uw eigen strings, door beide kandidaten laten lopen en door een persoon gelezen. Voor die test moet een van deze modellen bereikbaar en goedkoop zijn en het andere downloadbaar, en ze zijn geprijsd volgens tegenovergestelde principes.
• Qwen-Image 3.0 — ongeveer $0,04 per afbeelding op de Pro-editie en ongeveer $0,03 op Standard, met binnenlandse consumentenprijzen vanaf ongeveer ¥0,18 per afbeelding. Dat zijn introductiecijfers en ze zijn niet gecontroleerd. Je kunt vanmiddag een promptmatrix draaien en per aanroep betalen.
• Ming-Image-0.1-Design — geen gepubliceerde prijs, want er is geen gehost endpoint. De kosten zijn een download van 71,5 GB, een kaart van 80 GiB en je eigen tijd, en het voordeel is dat je dezelfde test op het pad van de glyph-encoder kunt richten en kunt zien of dat onderdeel het werk doet.
Dit is de situatie waarvoor een routeringslaag is gebouwd, en het is de moeite waard om precies te zijn over welk deel ervan van toepassing is. Noch Qwen-Image 3.0 noch Ming-Image-0.1-Design staat op ons platform, dus een routeringslaag kan vandaag geen van beide achter een sleutel plaatsen. Wat het wel kan, is de vergelijking eerlijk houden terwijl je die uitvoert: OrcaRouter zet 200+ modellen achter één OpenAI-compatibel eindpunt tegen de lijstprijs van de provider, zonder markup, met automatische failover tussen providers, zodat het model dat je al vertrouwt het productiepad kan bezetten — en de kosten ervan gekoppeld blijven aan de lijstprijs van de provider, zodat een tariefwijziging van een leverancier dezelfde dag nog aan onze kant terechtkomt — terwijl een ongemeten ontwerpmodel ernaast wordt geëvalueerd in plaats van ervoor.
Twee open releases, één gesloten, en een patroon
Het is de moeite waard op te merken waarvan de Ming-release, los van zichzelf, een bewijs is. Ant Group publiceerde zonder aankondiging een ontwerpmodel met 6,15 miljard parameters onder een MIT-licentie, naast een tweede model voor laagdecompositie onder dezelfde licentie. Alibaba publiceerde een gesloten gehost model zonder licentie, zonder modelkaart en zonder rapport, gericht op dezelfde soort werk, en rekende er per afbeelding voor.
Dat zijn twee verschillende gokken over waar de waarde in ontwerpmodellen zit. De ene zegt dat het model het product is en de gewichten het distributiekanaal zijn. De andere zegt dat het model een dienst is en de gewichten het ding zijn dat je houdt. Beide gokken kunnen in dezelfde markt kloppen, en ze leveren heel verschillende antwoorden op de enige vraag die op het moment van evaluatie ertoe doet: kan ik erachter komen hoe dit werkt voordat ik ervan afhankelijk word?
• Als je wilt weten hoe tekst wordt weergegeven, en waarom dat soms niet gebeurt — Ming-Image-0.1-Design is de enige van de twee waarmee je kunt kijken, en de MIT-licentie betekent dat je kunt handelen op basis van wat je ontdekt.
• Als je vandaag een productie-endpoint nodig hebt met een prijs per afbeelding en zonder infrastructuur — Qwen-Image 3.0 is de enige van de twee die er een biedt, en de interne onderdelen ervan maken deel uit van de prijs.
• Als je onafhankelijk bewijs nodig hebt voordat je je vastlegt — geen van beide heeft voldoende bewijs. De ene heeft één niet-gereproduceerde positie op een ranglijst; de andere heeft een claimblad van een leverancier zonder dat er cijfers bij staan.
Waar je op moet letten, is of het patroon standhoudt. Een onaangekondigde MIT-release met een glyph-encoder erin is een statement over hoe de auteurs verwachten dat het model wordt gebruikt — geïnspecteerd, lokaal gedraaid, aangepast. Als de volgende release van hetzelfde team wordt aangekondigd, gebenchmarkt en gehost, dan was dat een eenmalige gebeurtenis. Als het weer een stille repository is, heeft de design-modelcategorie er een tweede open concurrent bij, en kampt de gesloten helft van de markt met een prijsprobleem dat er in juli niet was.
