Una scheda titolo hero generata per InternLumina-U2 con un badge a pillola PREVIEW, l'intestazione 'InternLumina-U2', il sottotitolo 'Un modello di diffusione da 16B per immagini, video e 3D', una tagline che indica Shanghai AI Laboratory, LLM di diffusione multi-codebook, codice rilasciato il 2026-09-01 e pesi in arrivo, chip per Immagine, Video e 3D, forme astratte blu, ciano e ambra Understand-Generate-Edit sulla destra e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Anteprima di InternLumina-U2: un unico modello di diffusione da 16B per immagini, video e 3D — Pesi ancora in arrivo

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Alle 04:03 UTC del 1° settembre 2026, lo Shanghai AI Laboratory ha creato il repository GitHub InternLumina-U2. Tredici minuti dopo, la stessa organizzazione ha registrato un repository con lo stesso nome su Hugging Face. Non c'è stato alcun post di lancio, nessuna model card e nessun annuncio di alcun tipo — solo il codice di inferenza per InternLumina-U2, un modello mixture-of-experts da 16B di parametri (1B attivi) che il laboratorio presenta come un unico modello in grado di coprire la comprensione delle immagini, la generazione testo-immagine, l'editing delle immagini, la comprensione video e la comprensione 3D attraverso un'unica interfaccia a token discreti. Il codice è reale e pubblico; il modello in sé non lo è — ancora. I pesi sono contrassegnati come "coming soon", il repository Hugging Face è un segnaposto vuoto e il rapporto tecnico promesso non è ancora apparso. Ciò che è uscito in silenzio il 1° settembre è comunque il quadro pubblico più completo di questo modello che esista in assoluto.

Se è la prima volta che senti parlare di InternLumina-U2, è proprio questo il punto. Non è stato annunciato nulla riguardo al rilascio, e non sembra ancora esistere alcuna copertura indipendente — i resoconti sui primi segnali sono esattamente il luogo in cui un modello come questo emerge per la prima volta, prima del post di lancio e talvolta prima dei pesi. Tutto ciò che segue è tratto dal repository GitHub, dalla pagina del progetto e dallo stub di Hugging Face che il laboratorio stesso ha pubblicato il 1° settembre, e qualsiasi cosa al di là di queste fonti è esplicitamente etichettata come inferenza.

Cosa è stato effettivamente spedito il 1° settembre

Il repository GitHub InternLM/InternLumina-U2 è stato creato il 1º settembre 2026 e ha visto tre commit quel giorno: il commit init, un passaggio che contrassegnava il link del modello come "coming soon" e i risultati dei benchmark come "preliminary", e una correzione di navigazione. È concesso in licenza Apache-2.0 e include un README intitolato "Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing", in versione inglese e cinese, un harness di inferenza completo e una roadmap. Una particolarità degna di nota: la notizia del repository stesso è contrassegnata dal timbro "[2026-08]", ma il commit init ed entrambi i timestamp del repository sono datati 1º settembre 2026 — considerate l'inizio di settembre come data di rilascio effettiva, non agosto. Il repository qui sotto è l'intera release pubblica: ogni file visibile nell'albero fa parte di ciò che è stato distribuito e non esiste altro altrove, per ora.

A screenshot of the GitHub repository InternLM/InternLumina-U2 captured September 2, 2026, showing the repo description 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', an Apache-2.0 license, 4 stars, commits dated 'yesterday' including 'init repo', and the file tree with the inference entrypoints infer_1024_sft.sh, infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py.

GitHub — InternLM/InternLumina-U2, creato il 2026-09-01 con licenza Apache-2.0, con codice di inferenza per testo, generazione di immagini da testo, comprensione delle immagini, modifica delle immagini, comprensione video e comprensione 3D.

Hugging Faceinternlm/InternLumina-U2, creato il 2026-09-01, attualmente contiene solo un file .gitattributes e un README di 28 byte il cui intero contenuto è l'intestazione della licenza Apache-2.0. Nessun peso, nessuna configurazione, nessun file tokenizer.

Pagina del progetto — internlm.github.io/InternLumina-U2, con figure dell’architettura, una tabella preliminare dei benchmark e demo segnaposto; il report tecnico è contrassegnato con la dicitura "coming soon".

Il codice di inferenza è organizzato come un unico script driver con una sezione per attività: generazione di testo semplice, text-to-image fino a 1024×1024 con CFG e timestep configurabili, comprensione delle immagini su immagini naturali e grafici densi, editing di immagini basato su istruzioni con modalità dual-CFG opzionale, comprensione video su 64 frame campionati e comprensione 3D su asset GLB/GLTF che vengono renderizzati in 64 viste colore e profondità tramite una pipeline Blender inclusa prima della tokenizzazione. Questa ampiezza di attività è l'intera tesi progettuale del modello, e vale la pena soffermarsi su di essa prima di immergersi nell'architettura.

Un modello, sei compiti, un vocabolario di token

InternLumina-U2 appartiene a una linea di ricerca in rapida evoluzione che scommette sul fatto che linguaggio e visione dovrebbero condividere una singola interfaccia a token discreti, piuttosto che vivere in stack separati di comprensione e generazione. Il precedente lavoro del laboratorio in questa direzione — Lumina-DiMOO, il modello unificato di diffusione discreta presentato al WAIC 2025 — viene citato insieme a LLaDA2.0-Uni, Show-o2 e MMaDA come i sistemi pionieristici su cui InternLumina-U2 si basa e che afferma di superare. La scommessa specifica di InternLumina-U2 è che il collo di bottiglia per questi modelli unificati non sia l'architettura ma il vocabolario visivo: un singolo codebook limita la quantità di informazioni che un token visivo può trasportare, mentre gli ibridi discreto-continui che dividono comprensione e generazione tra rappresentazioni diverse costringono comunque il modello a mantenere due stack.

La risposta di InternLumina-U2 è una modellazione completamente discreta multi-codebook. Il lato visivo utilizza il tokenizer AToken di Apple, che descrive ogni posizione visiva con otto codebook complementari — un tentativo di preservare la texture locale, il testo incorporato, la geometria e i dettagli ad alta frequenza senza aumentare la lunghezza della sequenza. Sul lato input, ciascuno degli otto codebook mantiene il proprio embedding, e gli otto embedding di ciascuna posizione vengono concatenati e proiettati in un singolo token del backbone. Sul lato output, la predizione è spazialmente parallela ma autoregressiva lungo la profondità dei codebook: il backbone di diffusione denoizza molte posizioni spaziali mascherate in parallelo, e una testa autoregressiva multi-codebook predice quindi in ordine gli otto codici di ogni posizione.

Scala — 16B parametri totali, 1B attivi (16B-A1B), un MoE sparso.

Backbone linguistico — modello linguistico a diffusione LLaDA-2.0 MoE, il cui obiettivo di diffusione a blocchi è esteso ai compiti visivi tramite addestramento multi-task congiunto (descrizione del fornitore).

Rappresentazione visiva — token completamente discreti a 8 codebook dal tokenizzatore AToken di Apple.

Hardware — adattato sia a GPU NVIDIA che a NPU Huawei Ascend per training, valutazione e inferenza, con allineamento numerico a livello di operatore tra i backend.

A generated single-column state-of-play scoreboard titled 'InternLumina-U2 — the state of play' listing: Size 16B MoE, 1B active; Modalities image, video, 3D + T2I + editing; Visual tokens 8-codebook discrete (AToken); Backbone LLaDA-2.0 MoE diffusion LLM; Weights not released yet; Released code and page 2026-09-01, with a footer reading 'All details vendor-reported; no independent scores yet' and the OrcaRouter logo in the bottom-right corner.

Ciò che questo offre in pratica, se le affermazioni reggono, è il sogno più antico del campo multimodale: un unico insieme di pesi che possa leggere un'immagine, modificarla, disegnarne una nuova a partire dal testo, rispondere a domande su un video e descrivere un asset 3D — con comprensione e generazione che si rafforzano a vicenda attraverso la stessa interfaccia, piuttosto che essere assemblate da modelli specialistici. È anche l'affermazione che più merita un occhio scettico, perché è la più difficile da realizzare.

I numeri, quali che siano.

Ogni benchmark di InternLumina-U2 è dichiarato dal fornitore, preliminare e parziale. Il README e la pagina del progetto lo dichiarano esplicitamente: "Risultati preliminari e parziali. Le tabelle di confronto complete appariranno nel prossimo rapporto tecnico." Non esiste alcuna valutazione indipendente, perché i pesi non sono pubblici. Considera le cifre seguenti come dichiarazioni del laboratorio, non punteggi verificati.

Comprensione di grafici / documenti — ChartQA 86.52, CharXiv-DQ 83.65 (riportato dal fornitore).

Ragionamento matematico visivo — MathVision 33.22, DynaMath 56.37; il laboratorio afferma che supera l'InternVL3-8B, limitato alla sola comprensione, su entrambi.

Robustezza alle allucinazioni — HallusionBench 62.15.

Comprensione video — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (pagina del progetto).

comprensione 3D — 3D MM-Vet 41.8.

Text-to-image — DPG-Bench 87.10, TIIF-Bench Short/Long 84.60/85.95, GenEval 0.81 (project page).

Modifica immagini — ImgEdit 3.83.

Il racconto del confronto è il punto in cui un lettore onesto dovrebbe rallentare. Il README afferma che InternLumina-U2 supera modelli unificati come InternVL-U, LLaDA2.0-Uni, Show-o2 e Lumina-DiMOO nei benchmark di comprensione fine-grained e generazione — ma la tabella della pagina del progetto mostra InternLumina-U2 a GenEval 0.81 contro lo 0.89 di LLaDA2.0-Uni, quindi il modello resta dietro almeno un concorrente su almeno una metrica di generazione di punta. Scegliere qualche numero favorevole da una tabella parziale è esattamente ciò che l'avvertenza "tabelle di confronto complete nel report tecnico" è pensata per attenuare. I numeri sono un segnale direzionale proveniente dal laboratorio, niente di più.

Ciò che è reale rispetto a ciò che è promesso

L'ambito del rilascio è insolitamente esplicito, ed è importante per chiunque debba decidere se può provarlo oggi. Fornito: il codice di inferenza. Non forniti: i pesi, il codice di addestramento (promesso in un repository separato), lo stack di addestramento e inferenza Ascend e il report tecnico. Il repository Hugging Face che alla fine ospiterà il modello è uno stub: lo screenshot qui sotto è l'intero contenuto attuale della pagina che un lettore raggiunge cliccando sul link "Model (coming soon)" nel README.

A screenshot of the Hugging Face model page internlm/InternLumina-U2 captured September 2, 2026, showing the empty placeholder: the model name under the internlm organisation, a License badge reading apache-2.0, the notice 'README.md exists but content is empty', 'Downloads are not tracked for this model', and no inference provider yet serving the model.

Anche il codice rilasciato non può ancora produrre output. Il driver di inferenza prevede una directory checkpoint Hugging Face suddivisa e i pesi del tokenizer AToken in un percorso specifico — nessuno dei due è presente nel repository — quindi ciò che è scaricabile oggi è una specifica di come il modello funzionerà, non un modello funzionante. E quando i pesi arriveranno, l'auto-hosting non sarà un semplice lavoro di pip-install. Il modello usa un'API di generazione block-diffusion piuttosto che l'interfaccia standard Transformers generate, il tokenizer AToken richiede FlashAttention, il codice richiede una GPU visibile al momento dell'importazione, il driver principale è single-process e la pipeline 3D prevede Blender 4.5 per la codifica degli asset. È un vero progetto di deployment, non un esperimento del fine settimana — ed è esattamente il tipo di attrito che un livello di routing esiste per assorbire per la maggior parte dei team.

Quando i pesi atterrano, trattalo come il modello non comprovato che è.

Nessuno può eseguire InternLumina-U2 oggi, né alcun provider può servirlo, perché i pesi non esistono pubblicamente. Questo cambierà a un certo punto: la licenza Apache-2.0 e la prassi del laboratorio nel 2026 di apertura aggressiva all'open source (la spinta ArchSpace "open everything", InternVL3.5, i modelli scientifici Intern-S2) rendono probabile, non solo ipotetico, un rilascio dei pesi. Quando accadrà, il primo passo razionale non è scommettere una pipeline di produzione su un modello di diffusione al day one con requisiti di servizio insoliti e zero valutazioni indipendenti. È eseguirlo fianco a fianco con il modello di cui già ti fidi, su un percorso di test, con failover automatico verso il modello comprovato nel momento in cui il nuovo si comporta male. Questo è il caso d'uso per cui è costruito un livello di routing: un'unica API su oltre 200 modelli, prezzi di listino dei provider applicati con markup allo 0% e failover che trasforma "prova la novità" in una regola di routing invece che in una migrazione. OrcaRouter è impostato così — e per essere chiari, non instradiamo InternLumina-U2 e non possiamo farlo, perché i pesi non sono stati rilasciati. Questa sezione riguarda il flusso di lavoro per quando lo saranno, non un'affermazione che il modello sia disponibile oggi da qualche parte.

Cosa guardare dopo

Quattro eventi porterebbero InternLumina-U2 dall'anteprima alla realtà, in ordine approssimativo di probabilità. Primo, il popolamento del repository Hugging Face: la comparsa dei file safetensors, di una config e dei pesi del tokenizer AToken in quello stub è il momento in cui il modello esiste davvero. Secondo, il report tecnico, che dovrebbe contenere le tabelle comparative complete e trasformerebbe i numeri parziali del fornitore sopra in qualcosa di verificabile. Terzo, il repository del codice di training e lo stack Ascend, che contano per chiunque voglia fare fine-tuning o eseguire il modello su hardware non NVIDIA. Quarto, una prima valutazione indipendente — un Elo in arena, un'esecuzione riprodotta di ChartQA o GenEval — che metta alla prova la promessa "un modello, sei compiti" senza il bias di selezione del laboratorio stesso. Il fatto che il codice sia pubblico dal 1° settembre significa che l'architettura è già conoscibile; l'assenza dei pesi significa che tutto ciò che riguarda la qualità effettiva è ancora solo un'affermazione. Osserva il repository del modello piuttosto che il feed degli annunci — le parti interessanti sono già pubbliche, e il modello stesso probabilmente non è molto indietro.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube