
InternLumina-U2 vs Qwen2.5 Omni: il modello omni consegnato da Alibaba contro quello che lo Shanghai AI Lab sta ancora promettendo
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
InternLumina-U2 e Qwen2.5 Omni sono entrambe risposte alla stessa ambizione — un unico modello che gestisce ogni modalità invece di uno zoo di specialisti — a due generazioni di distanza. Qwen2.5 Omni è la risposta che è stata effettivamente distribuita: un modello open-weight da 7 miliardi di parametri rilasciato a marzo 2025, diciassette mesi al momento in cui scriviamo, che accetta testo, immagini, audio e video come input e risponde in testo o con voce naturale in streaming. InternLumina-U2 è la risposta dello Shanghai AI Laboratory, pubblicata come codice di inferenza il 1° settembre 2026: un modello di diffusione sparsa da 16 miliardi di parametri che afferma di percepire immagini, video e 3D e di generare e modificare immagini tramite un'unica interfaccia condivisa a token discreti. Una generazione dell'idea omni è in produzione da un anno e mezzo; l'altra ha un giorno di vita e nessuno può eseguirla, perché i suoi pesi non esistono ancora. Il divario tra le due è la differenza tra una promessa mantenuta e una promessa fatta.
L'omni che è stato rilasciato: Qwen2.5 Omni
{{1}}Qwen2.5 Omni merita di essere preso seriamente come baseline perché è uno dei rari modelli open che ha davvero mantenuto la promessa di "percepire tutto, rispondere in qualsiasi forma".{{/1}} La sua architettura Thinker-Talker abbina un pensatore testuale a un parlante che genera voce, utilizzando una codifica posizionale multimodale allineata temporalmente così che audio e video rimangano sincronizzati; l'input comprende testo, immagini, audio e video, e l'output può essere testo più voce nello stesso turno, con quattro voci integrate. {{2}}I limiti sono documentati tanto quanto le capacità: il contesto è di 32K token, non c'è function calling né output strutturato, ed è un conversatore omni piuttosto che un agente.{{/2}} {{3}}Ciò che non fa merita di essere sottolineato per questo confronto — percepisce immagini, audio e video, ma non li genera.{{/3}} L'"omni" in Qwen2.5 Omni è omni-percezione con sintesi vocale sul lato dell'output; i pixel entrano e le parole escono.
Il track record è reale. Il modello è stato scaricato centinaia di migliaia di volte, dispone di un'API ospitata sulla piattaforma dello stesso sviluppatore e su diverse piattaforme di terze parti, e ha trascorso diciassette mesi accumulando quantizzazioni, strumenti della community e un prezzo noto: gli elenchi degli aggregatori indicano circa $0,09 per milione di token in input e $0,34 per milione in output, con l'audio fatturato separatamente. Diciassette mesi sono abbastanza perché i suoi punti di forza e i suoi limiti siano entrambi ben mappati. È questo ciò che la maturità compra: non la perfezione, ma la prevedibilità.
L'omni promesso: InternLumina-U2
InternLumina-U2 sta cercando di fare un passo avanti rispetto a Qwen2.5 Omni, e il passo è esattamente dove risiede la difficoltà. La sua tesi progettuale è che percezione e generazione dovrebbero condividere un'unica interfaccia a token discreti: invece di un modello linguistico che percepisce video e un modello di diffusione separato che disegna, un unico backbone di diffusione MoE sparso — 16B totali, 1B attivi — dovrebbe sia leggere un'immagine, un grafico, un video o un asset 3D, sia scrivere una nuova immagine o una modifica, usando un vocabolario visivo completamente discreto a otto codebook, così che ogni posizione visiva contenga abbastanza informazioni per supportare entrambe le direzioni. Questa è un'affermazione materialmente più grande di quella di Qwen2.5 Omni. Una cosa è instradare ogni modalità di input in testo e parlato; un'altra è far sì che un unico set di pesi generi pixel con la stessa fluidità con cui ragiona su di essi.
È anche, adesso, un'affermazione non verificabile. Il laboratorio ha pubblicato il codice di inferenza, una pagina di progetto con una tabella di benchmark "preliminare, parziale" e uno stub vuoto su Hugging Face; i pesi, il codice di addestramento, il rapporto tecnico e lo stack Ascend-NPU sono tutti contrassegnati come "prossimamente". Non esiste alcuna valutazione indipendente perché non c'è nulla da valutare. L'architettura di Qwen2.5 Omni era verificabile la settimana in cui è uscita, perché i pesi erano inclusi; l'architettura di InternLumina-U2 è leggibile oggi, ma la sua qualità è ancora una promessa del fornitore.
Il tabellone
Poiché uno di questi modelli ha diciassette mesi di storia e l'altro ha un giorno di codice, le righe recano la provenienza piuttosto che fingere che le colonne siano simmetriche.
• Età — Qwen2.5 Omni: rilasciato a marzo 2025, diciassette mesi in circolazione, centinaia di migliaia di download. InternLumina-U2: codice di inferenza pubblicato il 1° settembre 2026, zero download, zero esecuzioni indipendenti.
• Forma — Qwen2.5 Omni: ~7B end-to-end, Thinker-Talker con codifica posizionale multimodale allineata temporalmente. InternLumina-U2: 16B totali / 1B attivi, LLM diffusivo a MoE sparso con tokenizzatore visivo discreto a otto codebook.
• Input — entrambi accettano testo e immagini; Qwen2.5 Omni accetta inoltre audio e video per la chat omni; InternLumina-U2 dichiara inoltre di supportare la comprensione video su 64 frame campionati e la comprensione 3D su viste GLB/GLTF renderizzate con Blender.
• Output — Qwen2.5 Omni: testo e voce in streaming, quattro voci. InternLumina-U2: testo, text-to-image fino a 1024×1024 e modifica delle immagini basata su istruzioni.
• Frontiera della generazione — Qwen2.5 Omni: genera parole e voce, non pixel. InternLumina-U2: tenta la generazione e la modifica di pixel all'interno dello stesso modello a token discreti che legge.
• Pesi e licenza — entrambi, in linea di principio, open weights con licenza Apache-2.0; quelli di Qwen2.5 Omni sono scaricabili oggi, quelli di InternLumina-U2 non sono ancora pubblici.
• Servizio — Qwen2.5 Omni: API hosted più self-host (un deployment pesante a piena precisione); contesto noto di 32K, nessuna chiamata di funzione. InternLumina-U2: non servibile — il driver rilasciato si aspetta checkpoint che non esistono.
• Numeri principali — Qwen2.5 Omni: da tempo presente nella classifica OmniBench (un punteggio di circa 0.561 nelle classifiche attuali); InternLumina-U2: ChartQA 86.52, MathVision 33.22, GenEval 0.81 — tutti forniti dal produttore, preliminari e parziali.

Perché il divario generazionale è la vera storia
Messe da parte le differenze di età, la differenza sostanziale è il confine a cui si ferma ciascun modello. Qwen2.5 Omni ha scelto una versione praticabile dell'omni: percepire in modo ampio, rispondere in linguaggio o con la voce, e lasciare la sintesi di immagini e video a modelli di generazione dedicati altrove nello stack. Questa divisione del lavoro è il modo in cui praticamente ogni sistema multimodale di produzione del 2026 è costruito, ed è il motivo per cui Qwen2.5 Omni ha potuto uscire nel 2025 e rimanere utile nel 2026 — fa bene la sua parte e si integra con il resto. InternLumina-U2 è una scommessa sul fatto che la divisione del lavoro sia il problema: che un modello costretto a rappresentare tutto — percezione e generazione — in un unico vocabolario discreto condiviso imparerà una comprensione più profonda della visione rispetto a un modello che deve solo descriverla. Se quella scommessa paga, è il risultato più importante. Se non paga, InternLumina-U2 finisce per essere una Qwen2.5 Omni più lenta e più avida, con un generatore di immagini imbullonato goffamente negli stessi pesi. L'intera sfida — ed è una sfida tra un design rilasciato e un'ipotesi, non tra due modelli eseguibili — è se l'architettura più complessa si giustifichi da sola.

La scheda Hugging Face di Qwen/Qwen2.5-Omni-7B, catturata il 27 agosto 2026 — la panoramica Thinker-Talker, la licenza Apache-2.0 e i tag di modalità testo, immagine, audio e video del modello.
Cosa compra davvero un anno e mezzo di download
La maturità non è una sensazione; è un elenco di cose che sai. Con Qwen2.5 Omni sai che il contesto a 32K è un vincolo rigido e puoi progettare intorno ad esso. Sai che non esiste alcun percorso di function-calling e non fingerai che esista. Sai all'incirca quanto costa un deployment, sia tramite un'API ospitata sia sulle tue GPU, perché il modello ha un prezzo noto ed è stato eseguito da abbastanza persone, tanto che i numeri si sono assestati. Sai che la posizione su OmniBench è reale perché classifiche indipendenti la monitorano da oltre un anno. Con InternLumina-U2 nessuno di quei verbi si applica — non sai, non puoi sapere, perché non esiste alcun artefatto. Quando un modello ha un giorno di vita ed è senza peso, ogni affermazione su di esso è una dichiarazione di intenti. Questa asimmetria non è una critica alla scienza; è la corretta posizione epistemica per chiunque scelga su cosa costruire.

Il repository GitHub InternLM/InternLumina-U2, catturato il 2 settembre 2026 — la pagina di destinazione del repository che rende pubblica l'architettura — descrizione, licenza e gli script di inferenza — mentre i pesi stessi sono assenti dall'albero.
La decisione di routing, presentata onestamente
Sul fronte della disponibilità, parliamo chiaro: OrcaRouter non ospita InternLumina-U2 — non ci sono pesi, per nessuno, da poter ospitare — e al momento non offriamo nemmeno Qwen2.5 Omni, che gira tramite l'API del suo sviluppatore e piattaforme di terze parti. La lezione di routing, qui, è una questione di postura, non di chiamare questi due modelli oggi tramite un'unica chiave. Il pattern duraturo è quello in cui prima o poi si imbatte ogni decisione tra un modello maturo e un nuovo arrivato: tenere il modello collaudato sul percorso principale — dove un'unica API su oltre 200 modelli e un pass-through con margine 0% significano che paghi il prezzo di listino del provider e niente di più — e indirizzare il nuovo arrivato non collaudato su un percorso di test con failover automatico, così che alla prima volta in cui si blocca, perde la bussola o restituisce risposte senza senso, la chiamata ricada sul modello con diciassette mesi di esperienza alle spalle. È così che potrai valutare una nuova architettura ambiziosa come InternLumina-U2 il giorno in cui verranno rilasciati i pesi, senza scommettere sul percorso di produzione da cui dipendi già.
Il verdetto
Qwen2.5 Omni è il modello omni su cui puoi costruire oggi: consegnato, scaricabile, documentato, con limiti noti e un prezzo stabilito. InternLumina-U2 è il modello omni da tenere d'occhio: un vero passo architettonico oltre la percezione verso la creazione, Apache-2.0, con codice pubblico e pesi in attesa. Se la scommessa multi-codebook del laboratorio regge a test indipendenti, InternLumina-U2 non sarà tanto un rivale di Qwen2.5 Omni quanto la prossima generazione della stessa idea. Se non regge, il generalista di diciassette mesi che è stato effettivamente rilasciato sarà ancora lì, a fare il lavoro che ha sempre fatto. Guarda lo stub di Hugging Face; il verdetto dipende dai file safetensors, non da questo articolo.
