Una card hero generata intitolata 'Qwen3.8-Omni-Flash vs InternLumina U2' sotto l'occhiello 'Sensi a noleggio vs pesi di proprietà', con il sottotitolo 'Un'API chiusa per contenuti long-media contro un modello di diffusione da 16B che puoi scaricare.' e quattro chip: 'Pesi: chiusi vs Apache 2.0', 'Genera immagini: solo da un lato', 'Contesto: 1M vs non divulgato', 'Instradabile qui: nessuno dei due'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Qwen3.8-Omni-Flash vs InternLumina U2: Sensi a noleggio vs Pesi di proprietà

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il modo utile per confrontare Qwen3.8-Omni-Flash e InternLumina U2non è per riga di benchmark, perché non compaiono sugli stessi. Lo si fa chiedendo chi è autorizzato a eseguirli. Il Qwen3.8-Omni-Flashdel fornitore, aperto ai clienti API dal 18 settembre 2026, è un modello chiuso sulle piattaforme del fornitore stesso: un milione di token di contesto, fino a un'ora di audio e video continui per chiamata, output solo testo e nessun peso. Lo InternLumina U2dello Shanghai AI Laboratory è un modello di diffusione mixture-of-experts 16B-A1B con licenza Apache 2.0, i cui checkpoint Ascend sono scaricabili da Hugging Face già adesso, mentre i checkpoint NVIDIA e il rapporto tecnico sono ancora indicati come in arrivo. Uno è un servizio che si noleggia a token. L'altro è un file che si può tenere, con un avvertimento su quale hardware supporta attualmente. Questa differenza decide più deployment reali di qualsiasi punteggio nelle tabelle di entrambi i fornitori.

Che cos'è realmente InternLumina U2

L'architettura è la parte interessante ed è davvero insolita. InternLumina U2 è un MoE sparso con 16 miliardi di parametri totali e 1 miliardo attivi, ed è un modello linguistico a diffusione anziché autoregressivo — raffina un'intera sequenza in parallelo invece di emettere token da sinistra a destra. La sua rappresentazione visiva è completamente discreta: otto codebook di token visivi costruiti sull'AToken di Apple, ed è ciò che consente a un unico modello sia di leggere un'immagine sia di produrne una senza un decoder separato aggiunto in coda. Risposta a domande testuali, generazione da testo a immagine, comprensione delle immagini, editing delle immagini, comprensione video e comprensione 3D sono tutte lo stesso modello che svolge lo stesso tipo di lavoro sullo stesso vocabolario.

• Dimensioni e architettura — InternLumina U2 è un MoE sparso con 16B totali, 1B attivi; il numero di parametri di Qwen3.8-Omni-Flash non è divulgato.

• Generazione — InternLumina U2 genera e modifica immagini e gestisce la comprensione 3D; Qwen3.8-Omni-Flash non genera alcun tipo di media e restituisce testo.

• Decodifica — InternLumina U2 è un LLM a diffusione che decodifica in parallelo; Qwen3.8-Omni-Flash è autoregressivo.

• Contesto e durata — Qwen3.8-Omni-Flash dispone di una finestra di 1M token e fino a un'ora di audio-video continuo in una singola chiamata; i materiali pubblicati di InternLumina U2 non descrivono nulla di tutto ciò, e l'audio di lunga durata non è tra le sue capacità elencate.

• Pesi — InternLumina U2 è Apache 2.0 con checkpoint Ascend pubblicati e checkpoint NVIDIA in sospeso; Qwen3.8-Omni-Flash non ha pesi e non ha annunciato alcun piano per averne.

• Come si ottiene — InternLumina U2 è un download da Hugging Face con codice di inferenza su GitHub; Qwen3.8-Omni-Flash è una chiamata API ad Alibaba Cloud Model Studio o alla piattaforma Qianwen.

• Punteggi indipendenti — non ce ne sono per nessuno dei due. La scheda di InternLumina U2 etichetta la propria tabella di benchmark come «risultati preliminari, parziali»; quelli di Qwen sono tutti nei confronti del suo stesso predecessore e non replicati.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

La questione dei pesi si è spostata da quando è uscita la copertura in anteprima

Se avete letto il nostro precedente articolo su InternLumina U2 quando il codice è apparso per la prima volta, lo stato delle cose è cambiato in una direzione ed è rimasto invariato in un'altra, ed entrambe le metà contano. Il repository Hugging Face non è più uno stub: la cartella ascend/ ora contiene sette shard safetensors più la configurazione, il tokenizer e il codice di modellazione, il che significa che il modello è realmente scaricabile ed eseguibile da chiunque disponga dell'hardware giusto. La cartella nvidia/ è ancora contrassegnata come prossimamente disponibile, il rapporto tecnico è ancora in arrivo, e la sezione dei benchmark del repository stesso dice ancora "risultati preliminari, parziali". Quindi l'affermazione accurata oggi non è "i pesi sono disponibili" né "i pesi mancano" — è che i checkpoint di uno stack hardware sono pubblicati e quelli dell'altro no, il che è un vincolo reale per chiunque abbia un cluster NVIDIA.

Altre due cose si sono mosse in silenzio. Il repository GitHub ha continuato a ricevere commit ben oltre il rilascio iniziale del 1° settembre, quindi il codice rilasciato viene mantenuto anziché parcheggiato. E il contatore dei download sul repository Hugging Face continua a segnare zero, il che dice meno sul modello che sul pubblico: un modello diffusion 16B-A1B con checkpoint Ascend-first è pensato per un laboratorio, non per un team di prodotto che cerca un endpoint ospitato in questo trimestre.

Dove i due si sovrappongono davvero, e dove no

La comprensione delle immagini è l'intersezione, ed è più limitata di quanto sembri. Entrambi i modelli possono guardare un'immagine e rispondere a domande al riguardo, il che è l'intero compito di Qwen3.8-Omni-Flash e uno dei sei compiti di InternLumina U2. Tutto il resto diverge nettamente. InternLumina U2 può poi modificare quell'immagine o generarne una nuova da un prompt, nello stesso modello, usando lo stesso vocabolario visivo che ha usato per leggerla. Qwen3.8-Omni-Flash non può produrre un pixel, ma accetta un'ora di audio e video in una sola chiamata e ti dice chi ha parlato, quando e cosa è stato deciso — cosa che i materiali pubblicati di InternLumina U2 non affermano affatto di fare.

La sovrapposizione che conta meno di quanto si pensi è il video. Entrambi sono descritti come in grado di gestire il video, ma ne fanno cose diverse: uno comprende una lunga registrazione come un documento, l'altro gestisce il video come modalità visiva insieme al 3D. Un team che ha bisogno che un'ora di filmato venga riassunta non è servito dal secondo, e un team che ha bisogno che venga generato un fotogramma non è servito dal primo.

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

Costo, controllo e ciò che stai effettivamente acquistando

Il confronto dei prezzi non è omogeneo. Qwen3.8-Omni-Flashfattura per token — 0,15 $ per milione di input, 0,016 $ in cache, 0,47 $ di output nel listino internazionale, con un listino separato per la Cina continentale che non è comparabile — e il titolo del suo lancio era un taglio, dichiarato dal fornitore, di oltre il 98% sul costo di un'ora di input audio, calcolato prezzando un campione di due minuti e moltiplicando per trenta, con video campionato a 720p e un fotogramma al secondo. InternLumina U2non fattura nulla, perché non c'è nulla da fatturare: il costo è il tuo hardware e il tuo tempo, e la scheda del modello stesso non pubblica un valore di throughput che permetta di trasformarlo in un numero per token.

Questo è il compromesso, in una riga. L'API ti offre capacità che non puoi ospitare e un costo orario che scala con l'uso; i pesi aperti ti danno un costo fisso e il pieno controllo sul percorso dei dati, al prezzo di uno stack di inferenza che devi costruire e di un set di checkpoint che attualmente significa hardware Ascend. Per carichi di lavoro regolamentati in cui i dati non possono lasciare l'edificio, la seconda non è una preferenza — è l'unica opzione su questa pagina. Per un team che questo mese ha bisogno di analizzare audio di lunga durata, la prima è l'unica opzione su questa pagina.

OrcaRouter oggi non ospita nessuno dei due modelli, e preferiamo dirlo chiaramente piuttosto che lasciar intendere un percorso di routing che non esiste: Qwen3.8-Omni-Flashgira solo sulle piattaforme di Alibaba, e InternLumina U2è un download e non un endpoint. Quello che gestiamo è il resto della linea Qwen3.8 — Qwen3.8-Flashe Qwen3.8-Max— tramite un'unica APIal prezzo di listino del provider con 0% di markup, che è il modo pratico per mantenere una baseline funzionante per il lato a modelli chiusi di questo confronto, mentre il lato open-weight sta ancora mettendo in ordine i propri checkpoint NVIDIA.

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

Quale dovresti scegliere davvero

Scegli InternLumina U2 se ti serve un unico modello che legge, genera e modifica immagini e sei disposto a gestire in autonomia lo stack di inferenza — e se i tuoi acceleratori sono Ascend, oppure puoi aspettare i checkpoint NVIDIA. È l'unico dei due modelli in grado di creare un'immagine, e l'unico che puoi eseguire senza inviare dati a un fornitore. Considera i suoi numeri di benchmark come non comprovati finché non arriverà il rapporto tecnico, perché la model card dice esattamente questo.

Scegli Qwen3.8-Omni-Flash se il tuo problema sono ore di audio e video invece che pixel in uscita — intelligenza per riunioni, analisi di registrazioni lunghe, lavoro agentico ad alto contenuto audio in cinese e inglese — e se puoi accettare una dipendenza da un'unica fonte e un output solo testuale. La sua storia dei costi è forte sulle ore di audio in input e molto più debole sulla fattura totale, i suoi benchmark sono riportati dal fornitore e non riprodotti, e le prime esecuzioni di terze parti ad apparire lo collocano al 28° percentile sul ragionamento, su un campione abbastanza piccolo da suggerire un test piuttosto che una decisione.

Se ti servono entrambi, sono complementari, non alternative: un modello per immagini open-weight che ospiti tu e un modello chiuso per contenuti multimediali lunghi che chiami tramite API. Nessuno dei due è instradabile tramite noi oggi. La cosa da tenere d'occhio da un lato è il checkpoint NVIDIA e il report tecnico; dall'altro, la prima valutazione indipendente, che non esiste ancora e che è la lacuna singola più grande in tutto ciò che è stato scritto su Qwen3.8-Omni-Flash finora.