Una card hero con titolo per il confronto 'InternLumina-U2 vs Qwen2.5 Omni', con il sottotitolo 'Il modello omni che Alibaba ha consegnato contro quello ancora promesso', tre chip statistici — 'Qwen2.5 Omni: 17 mesi in produzione', 'InternLumina-U2: un giorno di codice', 'Apache-2.0 da entrambe le parti' — e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

InternLumina-U2 vs Qwen2.5 Omni: il modello omni consegnato da Alibaba contro quello che lo Shanghai AI Lab sta ancora promettendo

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

InternLumina-U2 e Qwen2.5 Omni sono entrambe risposte alla stessa ambizione — un unico modello che gestisce ogni modalità invece di uno zoo di specialisti — a due generazioni di distanza. Qwen2.5 Omni è la risposta che è stata effettivamente distribuita: un modello open-weight da 7 miliardi di parametri rilasciato a marzo 2025, diciassette mesi al momento in cui scriviamo, che accetta testo, immagini, audio e video come input e risponde in testo o con voce naturale in streaming. InternLumina-U2 è la risposta dello Shanghai AI Laboratory, pubblicata come codice di inferenza il 1° settembre 2026: un modello di diffusione sparsa da 16 miliardi di parametri che afferma di percepire immagini, video e 3D e di generare e modificare immagini tramite un'unica interfaccia condivisa a token discreti. Una generazione dell'idea omni è in produzione da un anno e mezzo; l'altra ha un giorno di vita e nessuno può eseguirla, perché i suoi pesi non esistono ancora. Il divario tra le due è la differenza tra una promessa mantenuta e una promessa fatta.

L'omni che è stato rilasciato: Qwen2.5 Omni

{{1}}Qwen2.5 Omni merita di essere preso seriamente come baseline perché è uno dei rari modelli open che ha davvero mantenuto la promessa di "percepire tutto, rispondere in qualsiasi forma".{{/1}} La sua architettura Thinker-Talker abbina un pensatore testuale a un parlante che genera voce, utilizzando una codifica posizionale multimodale allineata temporalmente così che audio e video rimangano sincronizzati; l'input comprende testo, immagini, audio e video, e l'output può essere testo più voce nello stesso turno, con quattro voci integrate. {{2}}I limiti sono documentati tanto quanto le capacità: il contesto è di 32K token, non c'è function calling né output strutturato, ed è un conversatore omni piuttosto che un agente.{{/2}} {{3}}Ciò che non fa merita di essere sottolineato per questo confronto — percepisce immagini, audio e video, ma non li genera.{{/3}} L'"omni" in Qwen2.5 Omni è omni-percezione con sintesi vocale sul lato dell'output; i pixel entrano e le parole escono.

Il track record è reale. Il modello è stato scaricato centinaia di migliaia di volte, dispone di un'API ospitata sulla piattaforma dello stesso sviluppatore e su diverse piattaforme di terze parti, e ha trascorso diciassette mesi accumulando quantizzazioni, strumenti della community e un prezzo noto: gli elenchi degli aggregatori indicano circa $0,09 per milione di token in input e $0,34 per milione in output, con l'audio fatturato separatamente. Diciassette mesi sono abbastanza perché i suoi punti di forza e i suoi limiti siano entrambi ben mappati. È questo ciò che la maturità compra: non la perfezione, ma la prevedibilità.

L'omni promesso: InternLumina-U2

InternLumina-U2 sta cercando di fare un passo avanti rispetto a Qwen2.5 Omni, e il passo è esattamente dove risiede la difficoltà. La sua tesi progettuale è che percezione e generazione dovrebbero condividere un'unica interfaccia a token discreti: invece di un modello linguistico che percepisce video e un modello di diffusione separato che disegna, un unico backbone di diffusione MoE sparso — 16B totali, 1B attivi — dovrebbe sia leggere un'immagine, un grafico, un video o un asset 3D, sia scrivere una nuova immagine o una modifica, usando un vocabolario visivo completamente discreto a otto codebook, così che ogni posizione visiva contenga abbastanza informazioni per supportare entrambe le direzioni. Questa è un'affermazione materialmente più grande di quella di Qwen2.5 Omni. Una cosa è instradare ogni modalità di input in testo e parlato; un'altra è far sì che un unico set di pesi generi pixel con la stessa fluidità con cui ragiona su di essi.

È anche, adesso, un'affermazione non verificabile. Il laboratorio ha pubblicato il codice di inferenza, una pagina di progetto con una tabella di benchmark "preliminare, parziale" e uno stub vuoto su Hugging Face; i pesi, il codice di addestramento, il rapporto tecnico e lo stack Ascend-NPU sono tutti contrassegnati come "prossimamente". Non esiste alcuna valutazione indipendente perché non c'è nulla da valutare. L'architettura di Qwen2.5 Omni era verificabile la settimana in cui è uscita, perché i pesi erano inclusi; l'architettura di InternLumina-U2 è leggibile oggi, ma la sua qualità è ancora una promessa del fornitore.

Il tabellone

Poiché uno di questi modelli ha diciassette mesi di storia e l'altro ha un giorno di codice, le righe recano la provenienza piuttosto che fingere che le colonne siano simmetriche.

• Età — Qwen2.5 Omni: rilasciato a marzo 2025, diciassette mesi in circolazione, centinaia di migliaia di download. InternLumina-U2: codice di inferenza pubblicato il 1° settembre 2026, zero download, zero esecuzioni indipendenti.

• Forma — Qwen2.5 Omni: ~7B end-to-end, Thinker-Talker con codifica posizionale multimodale allineata temporalmente. InternLumina-U2: 16B totali / 1B attivi, LLM diffusivo a MoE sparso con tokenizzatore visivo discreto a otto codebook.

• Input — entrambi accettano testo e immagini; Qwen2.5 Omni accetta inoltre audio e video per la chat omni; InternLumina-U2 dichiara inoltre di supportare la comprensione video su 64 frame campionati e la comprensione 3D su viste GLB/GLTF renderizzate con Blender.

• Output — Qwen2.5 Omni: testo e voce in streaming, quattro voci. InternLumina-U2: testo, text-to-image fino a 1024×1024 e modifica delle immagini basata su istruzioni.

• Frontiera della generazione — Qwen2.5 Omni: genera parole e voce, non pixel. InternLumina-U2: tenta la generazione e la modifica di pixel all'interno dello stesso modello a token discreti che legge.

• Pesi e licenza — entrambi, in linea di principio, open weights con licenza Apache-2.0; quelli di Qwen2.5 Omni sono scaricabili oggi, quelli di InternLumina-U2 non sono ancora pubblici.

• Servizio — Qwen2.5 Omni: API hosted più self-host (un deployment pesante a piena precisione); contesto noto di 32K, nessuna chiamata di funzione. InternLumina-U2: non servibile — il driver rilasciato si aspetta checkpoint che non esistono.

• Numeri principali — Qwen2.5 Omni: da tempo presente nella classifica OmniBench (un punteggio di circa 0.561 nelle classifiche attuali); InternLumina-U2: ChartQA 86.52, MathVision 33.22, GenEval 0.81 — tutti forniti dal produttore, preliminari e parziali.

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

Perché il divario generazionale è la vera storia

Messe da parte le differenze di età, la differenza sostanziale è il confine a cui si ferma ciascun modello. Qwen2.5 Omni ha scelto una versione praticabile dell'omni: percepire in modo ampio, rispondere in linguaggio o con la voce, e lasciare la sintesi di immagini e video a modelli di generazione dedicati altrove nello stack. Questa divisione del lavoro è il modo in cui praticamente ogni sistema multimodale di produzione del 2026 è costruito, ed è il motivo per cui Qwen2.5 Omni ha potuto uscire nel 2025 e rimanere utile nel 2026 — fa bene la sua parte e si integra con il resto. InternLumina-U2 è una scommessa sul fatto che la divisione del lavoro sia il problema: che un modello costretto a rappresentare tutto — percezione e generazione — in un unico vocabolario discreto condiviso imparerà una comprensione più profonda della visione rispetto a un modello che deve solo descriverla. Se quella scommessa paga, è il risultato più importante. Se non paga, InternLumina-U2 finisce per essere una Qwen2.5 Omni più lenta e più avida, con un generatore di immagini imbullonato goffamente negli stessi pesi. L'intera sfida — ed è una sfida tra un design rilasciato e un'ipotesi, non tra due modelli eseguibili — è se l'architettura più complessa si giustifichi da sola.

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

La scheda Hugging Face di Qwen/Qwen2.5-Omni-7B, catturata il 27 agosto 2026 — la panoramica Thinker-Talker, la licenza Apache-2.0 e i tag di modalità testo, immagine, audio e video del modello.

Cosa compra davvero un anno e mezzo di download

La maturità non è una sensazione; è un elenco di cose che sai. Con Qwen2.5 Omni sai che il contesto a 32K è un vincolo rigido e puoi progettare intorno ad esso. Sai che non esiste alcun percorso di function-calling e non fingerai che esista. Sai all'incirca quanto costa un deployment, sia tramite un'API ospitata sia sulle tue GPU, perché il modello ha un prezzo noto ed è stato eseguito da abbastanza persone, tanto che i numeri si sono assestati. Sai che la posizione su OmniBench è reale perché classifiche indipendenti la monitorano da oltre un anno. Con InternLumina-U2 nessuno di quei verbi si applica — non sai, non puoi sapere, perché non esiste alcun artefatto. Quando un modello ha un giorno di vita ed è senza peso, ogni affermazione su di esso è una dichiarazione di intenti. Questa asimmetria non è una critica alla scienza; è la corretta posizione epistemica per chiunque scelga su cosa costruire.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

Il repository GitHub InternLM/InternLumina-U2, catturato il 2 settembre 2026 — la pagina di destinazione del repository che rende pubblica l'architettura — descrizione, licenza e gli script di inferenza — mentre i pesi stessi sono assenti dall'albero.

La decisione di routing, presentata onestamente

Sul fronte della disponibilità, parliamo chiaro: OrcaRouter non ospita InternLumina-U2 — non ci sono pesi, per nessuno, da poter ospitare — e al momento non offriamo nemmeno Qwen2.5 Omni, che gira tramite l'API del suo sviluppatore e piattaforme di terze parti. La lezione di routing, qui, è una questione di postura, non di chiamare questi due modelli oggi tramite un'unica chiave. Il pattern duraturo è quello in cui prima o poi si imbatte ogni decisione tra un modello maturo e un nuovo arrivato: tenere il modello collaudato sul percorso principale — dove un'unica API su oltre 200 modelli e un pass-through con margine 0% significano che paghi il prezzo di listino del provider e niente di più — e indirizzare il nuovo arrivato non collaudato su un percorso di test con failover automatico, così che alla prima volta in cui si blocca, perde la bussola o restituisce risposte senza senso, la chiamata ricada sul modello con diciassette mesi di esperienza alle spalle. È così che potrai valutare una nuova architettura ambiziosa come InternLumina-U2 il giorno in cui verranno rilasciati i pesi, senza scommettere sul percorso di produzione da cui dipendi già.

Il verdetto

Qwen2.5 Omni è il modello omni su cui puoi costruire oggi: consegnato, scaricabile, documentato, con limiti noti e un prezzo stabilito. InternLumina-U2 è il modello omni da tenere d'occhio: un vero passo architettonico oltre la percezione verso la creazione, Apache-2.0, con codice pubblico e pesi in attesa. Se la scommessa multi-codebook del laboratorio regge a test indipendenti, InternLumina-U2 non sarà tanto un rivale di Qwen2.5 Omni quanto la prossima generazione della stessa idea. Se non regge, il generalista di diciassette mesi che è stato effettivamente rilasciato sarà ancora lì, a fare il lavoro che ha sempre fatto. Guarda lo stub di Hugging Face; il verdetto dipende dai file safetensors, non da questo articolo.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube