Hero-kaart gegenereerd voor het artikel Qwen-Image-2.1 versus Hy Image3.5, met de kop Qwen-Image-2.1 vs Hy Image3.5, de ondertitel De ranglijsten plaatsen ze in omgekeerde volgorde, chips met de tekst Bewerken: Hy Image3.5 leidt met 1.088 tegen 1.074 en Tekst-naar-afbeelding: Qwen-Image-2.1 leidt met 1.034 tegen 975, en de voettekst Beide modellen gescoord volgens Artificial Analysis, september 2026, met het OrcaRouter-logo rechtsonder samengevoegd
Guides & Insights

Qwen-Image-2.1 vs Hy Image3.5: de onafhankelijke ranglijsten plaatsen ze in tegengestelde volgorde

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet Qwen-Image-2.1 en Hy Image3.5 tegenover elkaar op de twee imageboards van Artificial Analysis, en de boards zijn het er niet over eens welke beter is. Bij tekst-naar-afbeelding staat Qwen-Image-2.1 59 Elo boven Hy Image3.5 — 1.034 tegen 975, rang 18 tegen rang 66. Bij beeldbewerking wisselen dezelfde twee modellen van plaats: Hy Image3.5 staat op 1.088 Elo en rang 14, Qwen-Image-2.1 op 1.074 en rang 18. Een verschil van 14 punten de andere kant op. De twee modellen werden twee dagen na elkaar openbaar gemaakt — Qwen-Image-2.1 met open gewichten op 20 september 2026, Hy Image3.5 in publieke preview op 22 september 2026 — en dit is de eerste keer dat een van beide een score heeft op hetzelfde instrument, wat de onenigheid het lezen waard maakt in plaats van het rapporteren.

De voor de hand liggende zet is om te zeggen dat het redactieboard rumoerig is en verder te gaan. Dat klopt half. De andere helft is dat de twee rijen niet even solide zijn, dat de prijs op een van de twee niet de prijs op de andere is, en dat een van deze modellen de rechten op de gewichten heeft, terwijl het andere die nooit zal hebben.

Twee boards, twee orders

Artificial Analysis voert blinde paarsgewijze vergelijkingen uit — dezelfde prompt aan twee modellen, een stemmer kiest de winnaar, Elo accumuleert — en publiceert een apart leaderboard per taak. Het tekst-naar-afbeelding-leaderboard bevat 166 rijen; het bewerkingsleaderboard bevat 97. Beide rijen voor beide modellen komen uit de snapshot van dezelfde provider, dus dit is geen versiemismatch.

• Tekst-naar-afbeelding — Qwen-Image-2.1 met 1.034 Elo (interval 1.024 tot 1.044) uit 5.286 vergelijkingen, rang 18 van 166. Hy Image3.5 met 975 Elo (interval 966 tot 984) uit 5.334 vergelijkingen, rang 66 van 166. De intervallen raken elkaar niet. Een scheiding van 59 punten bij steekproeven van vergelijkbare omvang is een echte rangschikking, geen afrondingsartefact.

• Beeldbewerking — Hy Image3.5 met 1.088 Elo (interval 1.079 tot 1.097) op basis van 5.550 vergelijkingen, rang 14 van 97. Qwen-Image-2.1 met 1.074 Elo (interval 1.065 tot 1.083) op basis van 5.536 vergelijkingen, rang 18 van 97. Die intervallen overlappen elkaar over een band van vier punten van 1.079 tot 1.083. De ordening is richtinggevend, niet vastgesteld.

• De steekproefgroottes ontlopen elkaar op beide boards weinig — 5.286 tegenover 5.334 bij tekst-naar-afbeelding, 5.536 tegenover 5.550 bij bewerken — dus het verschil in betrouwbaarheid komt niet doordat één model te weinig stemmen heeft gekregen.

• Het bord labelt de modellen anders, en dat maakt uit: de Qwen-Image-2.1-rijen dragen de Open Weights-markering, de Hy Image3.5-rijen niet.

Dus de eerlijke lezing is asymmetrisch. Tekst-naar-afbeelding: Qwen-Image-2.1 wint duidelijk. Bewerken: Hy Image3.5 ligt waarschijnlijk voor, met een marge die binnen de ruis van de meting valt.

Waar de asymmetrie vandaan komt

De bewerkingskracht van Hy Image3.5 is geen verrassing zodra je kijkt waarmee Tencent het heeft uitgebracht. De preview werd openbaar met maximaal vijf referentieafbeeldingen per verzoek, tekst-naar-afbeelding en afbeelding-naar-afbeelding in hetzelfde model, en multi-turn bewerking — de nadruk bij de lancering lag op het bewerkingsoppervlak. Qwen-Image-2.1 is gebouwd met een uniforme generatie- en bewerkingsstack die ook referentieafbeeldingen aankan, maar de rijen op het klassement laten zien dat de bewerkingskant twee Elo onder Alibaba's eigen Qwen-Image-3.0-Pro eindigt, wat een beperkter resultaat is dan de framing bij de lancering deed vermoeden.

Tencents eigen claim is ook niet wat de ranglijst laat zien. De leverancier noemt voor de preview een winstpercentage bij blinde evaluatie van ongeveer 30% ten opzichte van Hy Image3.0. Dat cijfer is door niemand buiten Tencent gereproduceerd, en de onafhankelijke ranglijst bevestigt het niet bij tekst-naar-afbeelding — waar Hy Image3.5 preview op 975 20 Elo onder de open-weights HunyuanImage 3.0 Instruct op 995 staat. Bij bewerken valt dezelfde vergelijking in het voordeel van de leverancier uit: Hy Image3.5 preview op 1,088 staat 22 Elo boven HunyuanImage 3.0 Instruct op 1,066. Eén generatie vooruitgang op de ene ranglijst, en een stap terug op de andere, uit Tencents eigen opeenvolging.

Screenshot of the Artificial Analysis image editing leaderboard, AA-Image-Editing v2.0, captured in English and cropped from the top row down through the Ideogram 4.5 row, showing GPT Image 2.5 Sunburst (max) first at 1,182 Elo from 17,899 samples, the Hunyuanimage 3.5 (Preview) row at rank 14 with 1,088 Elo and 5,550 appearances, the Qwen-Image-2.1 row at rank 18 with 1,074 Elo and 5,536 appearances and a No API available note, and the Hunyuanimage 3.0 Instruct row at 1,066 with No API available

De prijsas, waar de twee totaal niet vergelijkbaar zijn

Hy Image3.5 preview is een verbruiksgebaseerde API. Tencent Cloud rekent ¥0,15 voor een 2K-afbeelding op het mainland-endpoint en US$0,024 op het internationale endpoint, en brengt alleen kosten in rekening voor afbeeldingen die de API retourneert. De prijskolom van Artificial Analysis vermeldt $24,00 per 1.000 afbeeldingen, wat hetzelfde cijfer is in de eenheden die de ranglijst gebruikt — en tegenover de $210,70 die de bovenste rij van de tekst-naar-afbeelding-ranglijst heeft voor dezelfde duizend afbeeldingen, is het minder dan een negende van de prijs.

Qwen-Image-2.1 heeft geen prijsregel, omdat het geen endpoint heeft. Beide rijen op het bord voor dit model dragen een expliciete Geen API beschikbaarvermelding. Je koopt dit model niet; je downloadt het, en je betaalt ervoor in GPU-uren en in de licentiekwestie hieronder. De 5.286 en 5.536 stemmen op zijn rijen kwamen van mensen die de weights zelf draaien. Dat feit geeft de ranglijst ook een voorbehoud dat het waard is om te onthouden: een onafhankelijke Elo voor een model dat alleen self-hosted is, meet een andere populatie dan een Elo voor iets dat iedereen kan aanroepen.

Als het plan is om een van deze twee in een product te verwerken, is de praktische splitsing nu duidelijk, en het is dezelfde splitsing die de prijs impliceert: het model met de betere bewerkingsscore is degene die je huurt, en het model met de betere tekst-naar-afbeelding-score is degene die je zelf draait. OrcaRouter is de huurkant daarvan — één API over meer dan 200 modellen, waarbij de lijstprijs van de provider met nul opslag wordt doorgegeven, automatische failover tussen providers, en een routing-DSL om meerdere modellen in één aanroep te combineren. We routeren Hy Image3.5 preview en Qwen-Image-2.1 niet; de beeldlijnen op het platform zijn Google's Imagen-tiers en Gemini image previews, xAI's Grok Imagine-image-endpoint en OpenAI's GPT-Image-familie. Geen van deze twee is op grond van alleen een rij in een leaderboard een eerste keuze uit die lijst, en dat is precies waarom de licentievraag hieronder degene is die de doorslag geeft.

De as waarvoor geen van beide borden een kolom heeft

Generated comparison scoreboard for Qwen-Image-2.1 and Hy Image3.5, listing editing Elo 1,074 against 1,088 with ranks 18 and 14, editing intervals 1,065 to 1,083 against 1,079 to 1,097, text-to-image Elo 1,034 against 975 with ranks 18 and 66, and the board labels Open Weights, no API for Qwen-Image-2.1 against no Open Weights and $24.00 per 1,000 images for Hy Image3.5

Qwen-Image-2.1 wordt uitgebracht onder de Qwen Research License Agreement, gedateerd 20 september 2026, die alleen rechten voor niet-commerciële doeleinden verleent en voor commercieel gebruik een aparte licentie van de leverancier vereist. De Hugging Face-repositories vermelden de licentie daarom als overig om die reden — het is geen OSI-licentie en moet ook niet als zodanig worden gelezen. De Open Weights-markering op beide rijen van het board is correct en zegt niets over dit.

Hy Image3.5 preview heeft geen gewichten om te licentiëren. Tencent heeft ze niet gepubliceerd; de preview wordt aangeboden vanaf Tencent's eigen platform en er is geen downloadbare release van deze generatie. Wat je krijgt is een tariefkaart, een limiet voor referentieafbeeldingen en een dienst die je kunt starten en stoppen. Niets om te controleren, niets om te hosten, niets om te onderhandelen — en niets dat je behoudt als Tencent de prijs wijzigt of de preview buiten gebruik stelt.

De vergelijking die de open-weightskwestie echt beslecht, is Tencents eigen voorganger, niet het model van Qwen. HunyuanImage 3.0 Instructstaat op beide ranglijsten met de Open Weights-markering — 1.066 op bewerken, 995 op tekst-naar-afbeelding. Qwen-Image-2.1 scoort op beide beter. Dus als de vereiste is "downloadbare gewichten die ik op mijn eigen hardware kan draaien", is de beste optie in deze confrontatie die van Alibaba, op beide ranglijsten, onder een licentie die nog steeds de verkoop van de output verbiedt.

Er bestaat geen versie hiervan waarin het papierwerk zichzelf oplost. Je kunt de betere bewerkingsscore krijgen zonder gewichten en met een factuur op basis van verbruik, of de betere tekst-naar-afbeeldingsscore met gewichten die je niet commercieel mag gebruiken. Kies met welke beperking je kunt leven en meet ze daarna allebei op je eigen prompts — het bewerkingsverschil tussen beide is vier punten breed binnen overlappende intervallen, precies het soort marge dat één enkele achtergehouden promptset kan wegpoetsen.