
Qwen3.8-Omni-Flash vs InternLumina U2: Sensi a noleggio vs Pesi di proprietà
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il modo utile per confrontare Qwen3.8-Omni-Flash e InternLumina U2non è per riga di benchmark, perché non compaiono sugli stessi. Lo si fa chiedendo chi è autorizzato a eseguirli. Il Qwen3.8-Omni-Flashdel fornitore, aperto ai clienti API dal 18 settembre 2026, è un modello chiuso sulle piattaforme del fornitore stesso: un milione di token di contesto, fino a un'ora di audio e video continui per chiamata, output solo testo e nessun peso. Lo InternLumina U2dello Shanghai AI Laboratory è un modello di diffusione mixture-of-experts 16B-A1B con licenza Apache 2.0, i cui checkpoint Ascend sono scaricabili da Hugging Face già adesso, mentre i checkpoint NVIDIA e il rapporto tecnico sono ancora indicati come in arrivo. Uno è un servizio che si noleggia a token. L'altro è un file che si può tenere, con un avvertimento su quale hardware supporta attualmente. Questa differenza decide più deployment reali di qualsiasi punteggio nelle tabelle di entrambi i fornitori.
Che cos'è realmente InternLumina U2
L'architettura è la parte interessante ed è davvero insolita. InternLumina U2 è un MoE sparso con 16 miliardi di parametri totali e 1 miliardo attivi, ed è un modello linguistico a diffusione anziché autoregressivo — raffina un'intera sequenza in parallelo invece di emettere token da sinistra a destra. La sua rappresentazione visiva è completamente discreta: otto codebook di token visivi costruiti sull'AToken di Apple, ed è ciò che consente a un unico modello sia di leggere un'immagine sia di produrne una senza un decoder separato aggiunto in coda. Risposta a domande testuali, generazione da testo a immagine, comprensione delle immagini, editing delle immagini, comprensione video e comprensione 3D sono tutte lo stesso modello che svolge lo stesso tipo di lavoro sullo stesso vocabolario.
• Dimensioni e architettura — InternLumina U2 è un MoE sparso con 16B totali, 1B attivi; il numero di parametri di Qwen3.8-Omni-Flash non è divulgato.
• Generazione — InternLumina U2 genera e modifica immagini e gestisce la comprensione 3D; Qwen3.8-Omni-Flash non genera alcun tipo di media e restituisce testo.
• Decodifica — InternLumina U2 è un LLM a diffusione che decodifica in parallelo; Qwen3.8-Omni-Flash è autoregressivo.
• Contesto e durata — Qwen3.8-Omni-Flash dispone di una finestra di 1M token e fino a un'ora di audio-video continuo in una singola chiamata; i materiali pubblicati di InternLumina U2 non descrivono nulla di tutto ciò, e l'audio di lunga durata non è tra le sue capacità elencate.
• Pesi — InternLumina U2 è Apache 2.0 con checkpoint Ascend pubblicati e checkpoint NVIDIA in sospeso; Qwen3.8-Omni-Flash non ha pesi e non ha annunciato alcun piano per averne.
• Come si ottiene — InternLumina U2 è un download da Hugging Face con codice di inferenza su GitHub; Qwen3.8-Omni-Flash è una chiamata API ad Alibaba Cloud Model Studio o alla piattaforma Qianwen.
• Punteggi indipendenti — non ce ne sono per nessuno dei due. La scheda di InternLumina U2 etichetta la propria tabella di benchmark come «risultati preliminari, parziali»; quelli di Qwen sono tutti nei confronti del suo stesso predecessore e non replicati.

La questione dei pesi si è spostata da quando è uscita la copertura in anteprima
Se avete letto il nostro precedente articolo su InternLumina U2 quando il codice è apparso per la prima volta, lo stato delle cose è cambiato in una direzione ed è rimasto invariato in un'altra, ed entrambe le metà contano. Il repository Hugging Face non è più uno stub: la cartella ascend/ ora contiene sette shard safetensors più la configurazione, il tokenizer e il codice di modellazione, il che significa che il modello è realmente scaricabile ed eseguibile da chiunque disponga dell'hardware giusto. La cartella nvidia/ è ancora contrassegnata come prossimamente disponibile, il rapporto tecnico è ancora in arrivo, e la sezione dei benchmark del repository stesso dice ancora "risultati preliminari, parziali". Quindi l'affermazione accurata oggi non è "i pesi sono disponibili" né "i pesi mancano" — è che i checkpoint di uno stack hardware sono pubblicati e quelli dell'altro no, il che è un vincolo reale per chiunque abbia un cluster NVIDIA.
Altre due cose si sono mosse in silenzio. Il repository GitHub ha continuato a ricevere commit ben oltre il rilascio iniziale del 1° settembre, quindi il codice rilasciato viene mantenuto anziché parcheggiato. E il contatore dei download sul repository Hugging Face continua a segnare zero, il che dice meno sul modello che sul pubblico: un modello diffusion 16B-A1B con checkpoint Ascend-first è pensato per un laboratorio, non per un team di prodotto che cerca un endpoint ospitato in questo trimestre.
Dove i due si sovrappongono davvero, e dove no
La comprensione delle immagini è l'intersezione, ed è più limitata di quanto sembri. Entrambi i modelli possono guardare un'immagine e rispondere a domande al riguardo, il che è l'intero compito di Qwen3.8-Omni-Flash e uno dei sei compiti di InternLumina U2. Tutto il resto diverge nettamente. InternLumina U2 può poi modificare quell'immagine o generarne una nuova da un prompt, nello stesso modello, usando lo stesso vocabolario visivo che ha usato per leggerla. Qwen3.8-Omni-Flash non può produrre un pixel, ma accetta un'ora di audio e video in una sola chiamata e ti dice chi ha parlato, quando e cosa è stato deciso — cosa che i materiali pubblicati di InternLumina U2 non affermano affatto di fare.
La sovrapposizione che conta meno di quanto si pensi è il video. Entrambi sono descritti come in grado di gestire il video, ma ne fanno cose diverse: uno comprende una lunga registrazione come un documento, l'altro gestisce il video come modalità visiva insieme al 3D. Un team che ha bisogno che un'ora di filmato venga riassunta non è servito dal secondo, e un team che ha bisogno che venga generato un fotogramma non è servito dal primo.

Costo, controllo e ciò che stai effettivamente acquistando
Il confronto dei prezzi non è omogeneo. Qwen3.8-Omni-Flashfattura per token — 0,15 $ per milione di input, 0,016 $ in cache, 0,47 $ di output nel listino internazionale, con un listino separato per la Cina continentale che non è comparabile — e il titolo del suo lancio era un taglio, dichiarato dal fornitore, di oltre il 98% sul costo di un'ora di input audio, calcolato prezzando un campione di due minuti e moltiplicando per trenta, con video campionato a 720p e un fotogramma al secondo. InternLumina U2non fattura nulla, perché non c'è nulla da fatturare: il costo è il tuo hardware e il tuo tempo, e la scheda del modello stesso non pubblica un valore di throughput che permetta di trasformarlo in un numero per token.
Questo è il compromesso, in una riga. L'API ti offre capacità che non puoi ospitare e un costo orario che scala con l'uso; i pesi aperti ti danno un costo fisso e il pieno controllo sul percorso dei dati, al prezzo di uno stack di inferenza che devi costruire e di un set di checkpoint che attualmente significa hardware Ascend. Per carichi di lavoro regolamentati in cui i dati non possono lasciare l'edificio, la seconda non è una preferenza — è l'unica opzione su questa pagina. Per un team che questo mese ha bisogno di analizzare audio di lunga durata, la prima è l'unica opzione su questa pagina.
OrcaRouter oggi non ospita nessuno dei due modelli, e preferiamo dirlo chiaramente piuttosto che lasciar intendere un percorso di routing che non esiste: Qwen3.8-Omni-Flashgira solo sulle piattaforme di Alibaba, e InternLumina U2è un download e non un endpoint. Quello che gestiamo è il resto della linea Qwen3.8 — Qwen3.8-Flashe Qwen3.8-Max— tramite un'unica APIal prezzo di listino del provider con 0% di markup, che è il modo pratico per mantenere una baseline funzionante per il lato a modelli chiusi di questo confronto, mentre il lato open-weight sta ancora mettendo in ordine i propri checkpoint NVIDIA.

Quale dovresti scegliere davvero
Scegli InternLumina U2 se ti serve un unico modello che legge, genera e modifica immagini e sei disposto a gestire in autonomia lo stack di inferenza — e se i tuoi acceleratori sono Ascend, oppure puoi aspettare i checkpoint NVIDIA. È l'unico dei due modelli in grado di creare un'immagine, e l'unico che puoi eseguire senza inviare dati a un fornitore. Considera i suoi numeri di benchmark come non comprovati finché non arriverà il rapporto tecnico, perché la model card dice esattamente questo.
Scegli Qwen3.8-Omni-Flash se il tuo problema sono ore di audio e video invece che pixel in uscita — intelligenza per riunioni, analisi di registrazioni lunghe, lavoro agentico ad alto contenuto audio in cinese e inglese — e se puoi accettare una dipendenza da un'unica fonte e un output solo testuale. La sua storia dei costi è forte sulle ore di audio in input e molto più debole sulla fattura totale, i suoi benchmark sono riportati dal fornitore e non riprodotti, e le prime esecuzioni di terze parti ad apparire lo collocano al 28° percentile sul ragionamento, su un campione abbastanza piccolo da suggerire un test piuttosto che una decisione.
Se ti servono entrambi, sono complementari, non alternative: un modello per immagini open-weight che ospiti tu e un modello chiuso per contenuti multimediali lunghi che chiami tramite API. Nessuno dei due è instradabile tramite noi oggi. La cosa da tenere d'occhio da un lato è il checkpoint NVIDIA e il report tecnico; dall'altro, la prima valutazione indipendente, che non esiste ancora e che è la lacuna singola più grande in tutto ciò che è stato scritto su Qwen3.8-Omni-Flash finora.
