Generata la hero card per l'articolo Qwen-Image-2.1 versus Hy Image3.5, con il titolo Qwen-Image-2.1 vs Hy Image3.5, il sottotitolo The Boards Rank Them in Opposite Orders, le chip con scritto Editing: Hy Image3.5 leads 1,088 to 1,074 e Text-to-image: Qwen-Image-2.1 leads 1,034 to 975, e il footer Both models scored per Artificial Analysis, September 2026, con il logo OrcaRouter compositato in basso a destra
Guides & Insights

Qwen-Image-2.1 vs Hy Image3.5: le classifiche indipendenti li ordinano in modo opposto

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti Qwen-Image-2.1 e Hy Image3.5a confronto diretto sulle due classifiche di immagini di Artificial Analysis, e le classifiche non concordano su quale dei due sia migliore. Sul text-to-image, Qwen-Image-2.1 è avanti di 59 punti Elo su Hy Image3.5 — 1.034 contro 975, posizione 18 contro posizione 66. Sull'image editing, gli stessi due modelli si scambiano di posto: Hy Image3.5 si colloca a 1.088 Elo e alla posizione 14, Qwen-Image-2.1 a 1.074 e posizione 18. Un divario di 14 punti nella direzione opposta. I due modelli sono diventati pubblici a due giorni di distanza — Qwen-Image-2.1 con pesi aperti il 20 settembre 2026, Hy Image3.5 in anteprima pubblica il 22 settembre 2026 — e questa è la prima volta che uno dei due ha un punteggio sullo stesso strumento, ed è ciò che rende il disaccordo degno di essere letto anziché semplicemente riportato.

La mossa ovvia è dire che la classifica di editing è rumorosa e passare oltre. È vero a metà. L'altra metà è che le due righe non sono ugualmente solide, il prezzo su una non è il prezzo sull'altra, e uno di questi modelli detiene i diritti sui pesi mentre l'altro non li avrà mai.

Due tavole, due ordini

Artificial Analysis esegue confronti a coppie in cieco — stesso prompt a due modelli, un votante sceglie il vincitore, l'Elo si accumula — e pubblica una classifica separata per ogni attività. La classifica text-to-image contiene 166 righe; quella di editing ne contiene 97. Entrambe le righe per entrambi i modelli provengono dallo snapshot dello stesso provider, quindi non si tratta di un disallineamento di versione.

Da testo a immagine — Qwen-Image-2.1 a 1.034 Elo (intervallo da 1.024 a 1.044) da 5.286 confronti, posizione 18 su 166. Hy Image3.5 a 975 Elo (intervallo da 966 a 984) da 5.334 confronti, posizione 66 su 166. Gli intervalli non si toccano. Una separazione di 59 punti su campioni di dimensioni simili è un ordinamento reale, non un artefatto di arrotondamento.

• Modifica delle immagini — Hy Image3.5 a 1.088 Elo (intervallo da 1.079 a 1.097) su 5.550 confronti, posizione 14 su 97. Qwen-Image-2.1 a 1.074 Elo (intervallo da 1.065 a 1.083) su 5.536 confronti, posizione 18 su 97. Tali intervalli si sovrappongono lungo una banda di quattro punti, da 1.079 a 1.083. L'ordinamento è direzionale, non stabilito.

• Le dimensioni dei campioni sono simili su entrambe le classifiche — 5.286 contro 5.334 su text-to-image, 5.536 contro 5.550 su editing — quindi la differenza di confidenza non è una questione di un modello che riceve meno voti.

• La board etichetta i modelli in modo diverso, e questo è importante: le righe di Qwen-Image-2.1 riportano il contrassegno Open Weights, quelle di Hy Image3.5 no.

Quindi la lettura onesta è asimmetrica. Da testo a immagine: Qwen-Image-2.1 vince chiaramente. Editing: Hy Image3.5 è probabilmente avanti, per un margine che rientra nel rumore della misurazione.

Da dove deriva l'asimmetria

La forza di editing di Hy Image3.5 non è una sorpresa una volta che si guarda con cosa Tencent l'ha lanciata. L'anteprima è diventata pubblica con fino a cinque immagini di riferimento per richiesta, text-to-image e image-to-image nello stesso modello, e editing multi-turn: l'ambito di editing ha ricevuto l'enfasi del lancio. Qwen-Image-2.1 è stato costruito con uno stack unificato di generazione ed editing che gestisce anche le immagini di riferimento, ma le sue righe della classifica mostrano che il lato editing si piazza due Elo sotto Qwen-Image-3.0-Pro della stessa Alibaba, un risultato più ristretto di quanto lasciasse intendere la presentazione del lancio.

Neanche l'affermazione di Tencent è ciò che mostra la classifica. Il fornitore indica per l'anteprima un tasso di vittoria di circa il 30% in valutazione cieca rispetto a Hy Image3.0. Quel numero non è stato riprodotto da nessuno al di fuori di Tencent, e la classifica indipendente non lo conferma sul text-to-image — dove Hy Image3.5 preview a 975 è 20 Elo sotto HunyuanImage 3.0 Instruct a pesi aperti a 995. Sull'editing lo stesso confronto va a favore del fornitore: Hy Image3.5 preview a 1.088 è 22 Elo sopra HunyuanImage 3.0 Instruct a 1.066. Una generazione di progressi su una classifica, e un passo indietro sull'altra, dalla stessa successione di Tencent.

Screenshot of the Artificial Analysis image editing leaderboard, AA-Image-Editing v2.0, captured in English and cropped from the top row down through the Ideogram 4.5 row, showing GPT Image 2.5 Sunburst (max) first at 1,182 Elo from 17,899 samples, the Hunyuanimage 3.5 (Preview) row at rank 14 with 1,088 Elo and 5,550 appearances, the Qwen-Image-2.1 row at rank 18 with 1,074 Elo and 5,536 appearances and a No API available note, and the Hunyuanimage 3.0 Instruct row at 1,066 with No API available

L'asse del prezzo, dove i due non sono affatto comparabili

Hy Image3.5 preview è un'API a consumo. Tencent Cloud addebita ¥0,15 per un'immagine 2K sull'endpoint della Cina continentale e US$0,024 su quello internazionale, addebitando solo le immagini che l'API restituisce. La colonna del prezzo di Artificial Analysis registra 24,00 $ per 1.000 immagini, che è la stessa cifra nelle unità utilizzate dalla classifica — e rispetto ai 210,70 $ che la prima riga della classifica text-to-image riporta per le stesse mille immagini, è meno di un nono del prezzo.

Qwen-Image-2.1 non ha una riga di prezzo, perché non ha un endpoint. Entrambe le sue righe in classifica riportano una nota esplicita Nessuna API disponibile. Questo modello non si acquista; si scarica, e lo si paga in ore di GPU e nella questione di licenza qui sotto. I 5.286 e 5.536 voti sulle sue righe arrivano da persone che eseguono i pesi in proprio. Questo fatto aggiunge alla classifica anche un'avvertenza che vale la pena mantenere: un Elo indipendente per un modello disponibile solo in self-hosting misura una popolazione diversa da un Elo per qualcosa che chiunque può chiamare.

Se il piano è mettere uno di questi due in un prodotto, la separazione pratica ora è chiara, ed è la stessa separazione che implica il prezzo: il modello con il punteggio di editing migliore è quello che noleggi, e il modello con il punteggio text-to-image migliore è quello che esegui. OrcaRouter è il lato del noleggio di questo — una sola API su oltre 200 modelli con il prezzo di listino del provider passato senza alcun ricarico, failover automatico tra provider, e un DSL di routing per comporre diversi modelli in un'unica chiamata. Non instradiamo Hy Image3.5 preview né Qwen-Image-2.1; le linee di immagini sulla piattaforma sono i livelli Imagen di Google e le anteprime immagini di Gemini, l'endpoint immagini Grok Imagine di xAI e la famiglia GPT-Image di OpenAI. Nessuno di questi due è una prima scelta da quell'elenco solo in base a una riga di classifica, ed è esattamente per questo che la questione della licenza qui sotto è quella che decide.

L'asse per cui nessuna delle due bacheche ha una colonna

Generated comparison scoreboard for Qwen-Image-2.1 and Hy Image3.5, listing editing Elo 1,074 against 1,088 with ranks 18 and 14, editing intervals 1,065 to 1,083 against 1,079 to 1,097, text-to-image Elo 1,034 against 975 with ranks 18 and 66, and the board labels Open Weights, no API for Qwen-Image-2.1 against no Open Weights and $24.00 per 1,000 images for Hy Image3.5

Qwen-Image-2.1 è rilasciato con la Qwen Research License Agreement, datata 20 settembre 2026, che concede diritti solo per scopi non commerciali e richiede una licenza separata dal fornitore per l'uso commerciale. I repository Hugging Face riportano la licenza come altro per questo motivo — non è una licenza OSI e non deve essere interpretata come tale. L'indicatore Open Weights su entrambe le righe della board è accurato e non dice nulla al riguardo.

Hy Image3.5 preview non ha pesi da concedere in licenza. Tencent non li ha pubblicati; l'anteprima viene erogata dalla piattaforma di Tencent e non esiste una release scaricabile di questa generazione. Quello che ottieni è un tariffario, un limite di immagini di riferimento e un servizio che puoi avviare e fermare. Niente da verificare, niente da ospitare, niente da negoziare — e niente che rimane tuo se Tencent cambia il prezzo o dismette l'anteprima.

Il confronto che risolve davvero la questione dei pesi aperti è il predecessore di Tencent stesso anziché il modello di Qwen. HunyuanImage 3.0 Instruct è presente su entrambe le classifiche con il marcatore Open Weights — 1.066 sull'editing, 995 sul text-to-image. Qwen-Image-2.1 lo batte su entrambe. Quindi, se il requisito è "pesi scaricabili che posso eseguire sul mio hardware", l'opzione migliore in questo confronto è quella di Alibaba, su entrambe le classifiche, con una licenza che vieta ancora la vendita dell'output.

Non esiste una versione di questa storia in cui le scartoffie si risolvano da sole. Puoi avere il punteggio migliore per l'editing senza pesi e con una fatturazione a consumo, oppure il punteggio migliore per il text-to-image con pesi che potresti non poter commercializzare. Scegli quale vincolo riesci a sopportare, poi vai e misura entrambi sui tuoi prompt: il divario di editing tra loro è largo quattro punti all'interno di intervalli sovrapposti, che è il tipo di margine che un singolo set di prompt tenuto fuori può cancellare.