
InternLumina-U2 vs Gemini Omni 1.1 Flash: il modello che non puoi ancora eseguire contro quello che paghi al secondo
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Se la tua scadenza è questa settimana, questo confronto si risolve in una sola frase. Gemini Omni 1.1 Flash è il modello di generazione video di Google in disponibilità generale: lo chiami tramite API, ottieni un clip con audio sincronizzato e paghi al secondo di output. InternLumina-U2 è il modello di ricerca Apache-2.0 pubblicato in sordina dallo Shanghai AI Laboratory: puoi scaricare il codice di inferenza, ma non i pesi, che il laboratorio indica ancora come «in arrivo». Uno è un prodotto che puoi acquistare subito; l'altro è una scommessa che esiste solo sulla carta e che non puoi eseguire affatto. La domanda interessante è perché mai qualcuno li metterebbe nella stessa frase, e che cosa ciascuno dei due dice su dove sta andando il lavoro multimodale aperto a fine 2026.
Tutto ciò che segue è etichettato in base alla fonte. I dettagli di InternLumina-U2 provengono dal repository GitHub e dalla pagina del progetto pubblicati dal laboratorio il 1° settembre 2026 — lo stesso giorno in cui è apparso lo stub vuoto su Hugging Face — e tutti i suoi dati benchmark sono dichiarati dal fornitore, preliminari e non riprodotti. I dettagli di Gemini Omni 1.1 Flash provengono dai materiali di rilascio e dalla pagina dei prezzi di Google per il modello diventato generalmente disponibile il 27 agosto 2026.
Due risposte alla stessa domanda "multimodale"
Entrambi i modelli vivono sotto la vaga bandiera di "un modello, molte modalità", e questa etichetta condivisa è l'unico motivo per cui vengono confrontati. Sotto quell'etichetta non hanno quasi nulla in comune. Gemini Omni 1.1 Flash è un servizio di generazione video-first, chiuso e ospitato: dagli del testo, un'immagine, un breve clip di riferimento o dell'audio, e produrrà fino a dieci secondi di video 720p con parlato, musica ed effetti sonori integrati, estendibile in incrementi di dieci secondi fino a una scena di quaranta secondi. Ragiona sul clip che hai già — il passaggio di estensione ora esamina fino a dieci secondi di contesto precedente, invece del singolo secondo di prima — e supporta il controllo del primo/ultimo fotogramma, così puoi fissare l'inizio e la fine di un'inquadratura e lasciare che il modello riempia la parte centrale. È uno strumento per creare immagini in movimento, venduto al secondo.
InternLumina-U2 è una scommessa in direzione opposta: un singolo modello sparso mixture-of-experts, con 16B di parametri totali e 1B attivi, che afferma di comprendere immagini, video e asset 3D e di generare e modificare immagini attraverso un'unica interfaccia condivisa a token discreti. Il suo lato visivo è completamente discreto — otto codebook complementari provenienti da un tokenizer che il laboratorio chiama AToken, quindi ogni posizione visiva è descritta da otto codici anziché uno — e il suo lato linguistico è un backbone di diffusione che il laboratorio estende da LLaDA-2.0. L'idea è che comprensione e generazione dovrebbero rafforzarsi a vicenda in un unico insieme di pesi, invece di essere assemblate da modelli specialistici. Se questo funzioni è attualmente senza risposta: il modello non è eseguibile da nessuna parte, perché i pesi non esistono pubblicamente.
Il tabellone, per quel che è.
Il tabellone onesto per questa coppia deve riportare la provenienza su ogni riga, perché una colonna è un prodotto in vendita con prezzi pubblicati e l'altra è un'affermazione di ricerca non pubblicata senza alcun prezzo.
• Cos'è — Gemini Omni 1.1 Flash: un modello hosted di generazione e modifica video (ID modello: gemini-omni-1.1-flash), GA il 27 agosto 2026. InternLumina-U2: un LLM di diffusione open-science per la comprensione omni-visiva, la generazione e la modifica di immagini, codice rilasciato il 1° settembre 2026.
• Pesi — Gemini Omni 1.1 Flash: nessuno, chiuso e solo tramite hosting. InternLumina-U2: ancora nessuno, ma con licenza Apache-2.0 ed esplicitamente marcato "in arrivo".
• Output che ottieni — Gemini Omni 1.1 Flash: clip da 10 secondi a 720p con audio, estendibili fino a 40 secondi; upscale a 1080p e 4K; testo incluso. InternLumina-U2: per ora niente — codice di inferenza e una roadmap.
• Cosa accetta in input — Gemini Omni 1.1 Flash: testo, immagini, video (fino a ~131K token di input; tre clip da 10 secondi per prompt), audio. InternLumina-U2: dichiara testo, immagini naturali, grafici densi, video su oltre 64 frame campionati e asset 3D GLB/GLTF renderizzati in 64 viste colore e profondità.
• Come eseguirlo — Gemini Omni 1.1 Flash: API Gemini di Google tramite la stateful Interactions API; accesso consumer tramite Google Flow per gli abbonati AI Plus, Pro e Ultra. InternLumina-U2: solo self-hosting, e solo dopo il rilascio dei pesi; il codice richiede una directory di checkpoint suddivisa, i pesi del tokenizer AToken, FlashAttention e Blender 4.5 per il percorso 3D.
• Quanto costa — Gemini Omni 1.1 Flash: $0,03/sec a 360p in bozza, $0,10/sec a 720p, $0,15/sec a 1080p, $0,30/sec a 4K, con una tariffa token di $1,50 per milione di input e $9,00 per milione di output di testo. InternLumina-U2: qualunque cosa costino le vostre GPU, una volta che esiste.

Le due colonne non misurano lo stesso asse. Il lato Gemini è a pagamento, erogato e immediatamente utile; il lato InternLumina è una specifica di un modello che non è ancora un modello.
La parte effettivamente attuale: la GA di Gemini Omni 1.1 Flash
Gemini Omni 1.1 Flash conta di per sé questa settimana perché è il momento in cui la linea video omni di Google ha smesso di essere un'anteprima. Il precedente endpoint di anteprima Gemini Omni Flash è programmato per essere disattivato il 30 settembre 2026, e questo modello GA è il sostituto su cui gli sviluppatori vengono migrati. L'elenco dei miglioramenti è concreto: estensione delle scene fino a quaranta secondi costruita con incrementi da dieci secondi, controllo dei keyframe che consente di specificare un primo e un ultimo fotogramma e di far generare al modello le riprese di collegamento, clip di riferimento fino a tre secondi per mantenere coerenti personaggio o ambientazione, e un livello di bozza a 360p con un prezzo pari a un terzo di quello del 720p e con prestazioni fino al 60% più veloci per iterare sui prompt prima della costosa resa finale. Se costruisci pipeline video, la tabella dei prezzi — $0,10 per un secondo di 720p, $1,01 per una clip di dieci secondi, circa $4 per una scena di quaranta secondi a 720p costruita con quattro chiamate di estensione — è il numero che cambia il tuo modello di costo.
Nulla di tutto ciò la rende un concorrente di InternLumina-U2 in alcun senso operativo. Gemini Omni 1.1 Flash genera movimento; InternLumina-U2, se le sue affermazioni sopravvivono al contatto con i pesi, comprenderà il movimento e genererà immagini fisse. Un team che ha bisogno di video di prodotto entro questo trimestre non sta scegliendo tra i due: il modello Gemini è l'unico dei due che può essere effettivamente chiamato, ed è disponibile tramite l'API di Google e diverse piattaforme di terze parti.

La documentazione "Models" dell'API Gemini sul sito per sviluppatori AI di Google, catturata il 2 settembre 2026 — la pagina che elenca la famiglia Gemini attuale, con la linea Gemini Omni nella barra di navigazione laterale.
La parte che non è affatto attuale: InternLumina-U2
Il rilascio del 1° settembre di InternLumina-U2 è stato dei più silenziosi: tre commit su un repository GitHub, una pagina di progetto, uno stub Hugging Face da 28 byte il cui intero contenuto è un'intestazione di licenza Apache-2.0, e nessun annuncio. Ciò che è davvero pubblico è l'infrastruttura di inferenza e l'architettura, e meritano una lettura attenta proprio perché nessuno è stato in grado di testare il modello stesso. Il repository mostra un driver con un punto di ingresso per ogni compito — testo, text-to-image fino a 1024×1024, comprensione di immagini naturali e di grafici densi, editing di immagini basato su istruzioni con una modalità dual-CFG opzionale, comprensione video su 64 frame campionati e comprensione 3D su viste GLB/GLTF renderizzate con Blender. La scommessa progettuale è che un vocabolario visivo discreto multi-codebook consenta a un unico backbone di fare tutto questo senza aumentare la lunghezza delle sequenze — lo stesso istinto, "i token visivi dovrebbero trasportare più informazioni", che guida i modelli video nativi del codec, applicato a un'interfaccia unificata di comprensione e generazione.

Il repository GitHub InternLM/InternLumina-U2, catturato il 2 settembre 2026 — la pagina principale del repository con licenza Apache-2.0, la descrizione "Multi-Codebook Diffusion Large Language Model", tre commit e gli script di inferenza per attività che rappresentano l'intera release pubblica finora.
La tabella benchmark nella pagina del progetto è etichettata dal laboratorio stesso come "risultati preliminari e parziali", e i numeri presenti sono contrastanti: punteggi forti su grafici e documenti (ChartQA 86,52, CharXiv-DQ 83,65, dichiarati dal fornitore) si affiancano a un GenEval di 0,81 che resta indietro rispetto allo 0,89 di almeno un modello che il laboratorio afferma di superare. Non esiste una valutazione indipendente, perché non c'è alcun modello da valutare. Tutto ciò che riguarda la qualità reale resta una semplice affermazione finché i file safetensors non compariranno in quello stub vuoto di Hugging Face.
Cosa fa un livello di routing quando esiste solo un lato
Questo è uno di quei confronti in cui, dal punto di vista del routing, conta davvero il tempo, non la scelta. Non fingeremo che OrcaRouter serva InternLumina-U2 — nessuno può farlo, i pesi non sono stati rilasciati — e Gemini Omni 1.1 Flash non è nemmeno nel nostro catalogo; lo raggiungi tramite l'API di Google. Ciò a cui serve davvero un layer di routing, in questo vuoto, è tenere aperte le opzioni senza ricostruire due volte la pipeline. Il modello pass-through è il meccanismo: quando un modello hosted di un vendor approda davvero in un catalogo, il prezzo di listino del provider viene passato con un ricarico dello 0%, quindi la tariffa al secondo pubblicata dal vendor è la tariffa al secondo che paghi tramite un'unica chiave, invece di un contratto per ogni provider. E quando finalmente arriva un rilascio di pesi Apache-2.0 come InternLumina-U2, la mossa razionale non è smontare il tuo stack video funzionante — è mettere in piedi il nuovo modello su un percorso di test dietro un failover automatico, così la prima volta che il modello di diffusione non collaudato si comporta male, la chiamata ripiega sul modello di cui ti fidi già, senza cambiare codice. Prova la novità dove non può farti male; instrada ciò che paga le bollette.
Il verdetto
Se ti serve un video questo mese, la decisione è già presa: Gemini Omni 1.1 Flash è reale, ha un prezzo ed è generalmente disponibile, mentre InternLumina-U2 non può essere invocato da nessuno. Se stai osservando dove va la ricerca multimodale aperta, InternLumina-U2 è l'artefatto più interessante: una rara scommessa completamente discreta e multi-codebook da parte di un grande laboratorio, con licenza Apache-2.0, con l'architettura già pubblica e i pesi probabilmente non molto lontani. Tratta la repo come un'anteprima di una direzione di ricerca, tratta il modello video GA come uno strumento su cui puoi costruire oggi, e non lasciare che l'etichetta condivisa "multimodale" ti convinca che competono per lo stesso lavoro.
