Eine generierte Hero-Karte mit dem Titel „Qwen3.8-Omni-Flash vs InternLumina U2“ unter der Überzeile „Gemietete Sinne vs. eigene Gewichte“, mit dem Untertitel „Eine geschlossene Long-Media-API gegen ein 16B-Diffusionsmodell, das Sie herunterladen können.“ und vier Chips: „Gewichte: geschlossen vs. Apache 2.0“, „Generiert Bilder: nur eine Seite“, „Kontext: 1M vs. nicht offengelegt“, „Hier routbar: keine“. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Qwen3.8-Omni-Flash vs. InternLumina U2: Gemietete Sinne vs. eigene Gewichte

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die nützliche Art, Qwen3.8-Omni-Flash und InternLumina U2 zu vergleichen, ist nicht anhand von Benchmark-Zeilen, denn sie tauchen nicht in denselben auf. Sie besteht darin, zu fragen, wer sie betreiben darf. Das Modell des Anbieters, Qwen3.8-Omni-Flash, seit 18. September 2026 für API-Kunden zugänglich, ist ein geschlossenes Modell auf den eigenen Plattformen des Anbieters: eine Million Tokens Kontext, bis zu eine Stunde kontinuierliches Audio und Video pro Aufruf, reine Textausgabe und keine Gewichte. InternLumina U2 des Shanghai AI Laboratory ist ein 16B-A1B-Mixture-of-Experts-Diffusionsmodell unter Apache 2.0, dessen Ascend-Checkpoints ab sofort von Hugging Face heruntergeladen werden können, während die NVIDIA-Checkpoints und der technische Bericht noch als kommend aufgeführt sind. Das eine ist ein Dienst, den man pro Token mietet. Das andere ist eine Datei, die man besitzen kann, mit der Einschränkung, auf welcher Hardware sie derzeit läuft. Dieser Unterschied entscheidet über mehr reale Bereitstellungen als jede Punktzahl in den Tabellen beider Anbieter.

Was InternLumina U2 wirklich ist

Die Architektur ist der interessante Teil, und sie ist wirklich ungewöhnlich. InternLumina U2 ist ein sparse MoE mit insgesamt 16 Milliarden Parametern, von denen 1 Milliarde aktiv ist, und es ist ein Diffusions-Sprachmodell statt eines autoregressiven — es verfeinert eine ganze Sequenz parallel, anstatt Token von links nach rechts auszugeben. Seine visuelle Repräsentation ist vollständig diskret: acht Codebooks visueller Tokens, die auf Apples AToken aufbauen, was es einem Modell ermöglicht, sowohl ein Bild zu lesen als auch eines zu erzeugen, ohne dass ein separater Decoder am Ende angeflanscht werden muss. Text-Fragebeantwortung, Text-zu-Bild-Generierung, Bildverständnis, Bildbearbeitung, Videoverständnis und 3D-Verständnis sind alles dasselbe Modell, das dieselbe Art von Arbeit über demselben Vokabular verrichtet.

• Größe und Form — InternLumina U2 umfasst insgesamt 16B Parameter, 1B aktiv, Sparse-MoE; die Parameteranzahl von Qwen3.8-Omni-Flash wird nicht offengelegt.

• Generierung — InternLumina U2 generiert und bearbeitet Bilder und übernimmt 3D-Verständnis; Qwen3.8-Omni-Flash generiert überhaupt keine Medien und gibt Text zurück.

• Dekodierung — InternLumina U2 ist ein Diffusions-LLM, das parallel dekodiert; Qwen3.8-Omni-Flash ist autoregressiv.

• Kontext und Dauer — Qwen3.8-Omni-Flash bietet ein Fenster von 1 Mio. Token und bis zu einer Stunde durchgehendes Audio-Video in einem einzigen Aufruf; die veröffentlichten Unterlagen zu InternLumina U2 beschreiben nichts davon, und Langform-Audio zählt nicht zu den aufgeführten Fähigkeiten.

• Gewichte — InternLumina U2 steht unter Apache 2.0, wobei Ascend-Checkpoints veröffentlicht und NVIDIA-Checkpoints noch ausstehend sind; Qwen3.8-Omni-Flash hat keine Gewichte und keinen angekündigten Plan dafür.

• Wie Sie es erhalten – InternLumina U2 ist ein Download von Hugging Face mit Inferenzcode auf GitHub; Qwen3.8-Omni-Flash ist ein API-Aufruf an Alibaba Cloud Model Studio oder die Qianwen-Plattform.

• Unabhängige Punktzahlen – für keinen von beiden. Die eigene Karte von InternLumina U2 bezeichnet die Benchmark-Tabelle als „vorläufige, partielle Ergebnisse“; die von Qwen beziehen sich alle auf dessen eigenen Vorgänger und sind nicht reproduziert.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

Die Frage der Gewichte hat sich seit der Vorabberichterstattung verschoben.

Wenn Sie unseren früheren Artikel über InternLumina U2 gelesen haben, als der Code zum ersten Mal auftauchte: Der Stand der Dinge hat sich in eine Richtung verändert und in einer anderen ist er unverändert geblieben, und beide Hälften sind wichtig. Das Repository von Hugging Face ist kein Platzhalter mehr: Der ascend/ Ordner enthält jetzt sieben Safetensors-Shards plus die Konfiguration, den Tokenizer und den Modellierungscode, was bedeutet, dass das Modell wirklich von jedem mit der richtigen Hardware heruntergeladen und ausgeführt werden kann. Der nvidia/ Ordner ist weiterhin als „coming soon“ gekennzeichnet, der technische Bericht steht weiterhin aus, und der eigene Benchmark-Abschnitt des Repositories sagt weiterhin „vorläufige, partielle Ergebnisse“. Die zutreffende Aussage heute lautet also nicht „die Gewichte sind veröffentlicht“ oder „die Gewichte fehlen“ – sie lautet, dass die Checkpoints des einen Hardware-Stacks veröffentlicht sind und die des anderen nicht, was für alle, deren Cluster NVIDIA ist, eine echte Einschränkung darstellt.

Zwei weitere Dinge haben sich im Stillen entwickelt. Das GitHub-Repository erhält weiterhin Commits, weit über den ursprünglichen Veröffentlichungstermin am 1. September hinaus, sodass der veröffentlichte Code gepflegt und nicht stillgelegt wird. Und der Download-Zähler im Hugging-Face-Repository steht weiterhin auf null, was weniger über das Modell als über die Zielgruppe aussagt: Ein 16B-A1B-Diffusionsmodell mit Ascend-first-Checkpoints richtet sich an ein Labor, nicht an ein Produktteam, das in diesem Quartal einen gehosteten Endpunkt sucht.

Wo sich die beiden tatsächlich überschneiden und wo nicht

Bildverständnis ist die Schnittmenge, und sie ist schmaler, als sie aussieht. Beide Modelle können ein Bild betrachten und Fragen dazu beantworten, was die gesamte Aufgabe für Qwen3.8-Omni-Flash und eine von sechs Aufgaben für InternLumina U2. Alles danach divergiert stark. InternLumina U2 kann dann dieses Bild bearbeiten oder aus einem Prompt ein neues generieren – im selben Modell, mit demselben visuellen Vokabular, mit dem es das Bild gelesen hat. Qwen3.8-Omni-Flash kann kein Pixel erzeugen, aber es wird eine Stunde Audio und Video in einem Aufruf entgegennehmen und dir sagen, wer wann gesprochen hat und was entschieden wurde – was die veröffentlichten Materialien von InternLumina U2 überhaupt nicht für sich beanspruchen.

Die Überschneidung, die weniger ins Gewicht fällt, als man annimmt, ist Video. Von beiden heißt es, sie würden Video verarbeiten, doch sie machen damit unterschiedliche Dinge: Das eine begreift eine lange Aufnahme als Dokument, das andere behandelt Video als visuelle Modalität neben 3D. Ein Team, das eine Stunde Filmmaterial zusammengefasst braucht, wird vom zweiten nicht bedient, und ein Team, das ein Einzelbild generiert braucht, wird vom ersten nicht bedient.

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

Kosten, Kontrolle und was Sie tatsächlich kaufen

Der Preisvergleich ist nicht annähernd gleichartig. Qwen3.8-Omni-Flash berechnet pro Token — 0,15 $ pro Million Input, 0,016 $ gecacht, 0,47 $ Output auf der internationalen Liste, mit einer separaten Festlandspreisliste, die nicht vergleichbar ist — und seine Start-Schlagzeile war eine vom Anbieter gemeldete Senkung um mehr als 98 % bei den Kosten für eine Stunde Audio-Input, berechnet, indem eine zwei Minuten lange Stichprobe bepreist und mit dreißig multipliziert wurde, wobei Video mit 720p und einem Bild pro Sekunde abgetastet wurde. InternLumina U2 berechnet nichts, denn es gibt nichts zu berechnen: Die Kosten sind Ihre Hardware und Ihre Zeit, und die Modellkarte selbst veröffentlicht keine Durchsatzangabe, mit der Sie das in eine Pro-Token-Zahl umrechnen könnten.

Das ist der Kompromiss in einer Zeile. Die API liefert Ihnen Fähigkeiten, die Sie nicht selbst hosten können, und stündliche Kosten, die mit der Nutzung skalieren; die offenen Gewichte bieten Ihnen feste Kosten und die volle Kontrolle über den Datenpfad – zum Preis eines Inferenz-Stacks, den Sie selbst aufbauen müssen, und eines Checkpoint-Sets, das derzeit Ascend-Hardware bedeutet. Für regulierte Workloads, bei denen Medien das Gebäude nicht verlassen dürfen, ist die zweite Option keine Präferenz – sie ist die einzige Option auf dieser Seite. Für ein Team, das diesen Monat Langaudio-Analyse benötigt, ist die erste die einzige Option auf dieser Seite.

OrcaRouter hostet heute keines der beiden Modelle, und wir sagen das lieber klar, als einen Routing-Pfad anzudeuten, der nicht existiert: Qwen3.8-Omni-Flash läuft nur auf Alibabas eigenen Plattformen, und InternLumina U2 ist ein Download und kein Endpunkt. Was wir betreiben, ist der Rest der Qwen3.8-Linie — Qwen3.8-Flash und Qwen3.8-Max — über eine API zum Listenpreis des Anbieters mit 0 % Aufschlag, was der praktische Weg ist, eine funktionierende Baseline für die Closed-Model-Seite dieses Vergleichs zu halten, während die Open-Weight-Seite noch dabei ist, ihre NVIDIA-Checkpoints in Ordnung zu bringen.

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

Welche du tatsächlich wählen solltest

Wähle InternLumina U2, wenn du ein Modell brauchst, das Bilder liest, generiert und bearbeitet, und bereit bist, den Inference-Stack selbst zu betreiben – und wenn deine Beschleuniger Ascend sind oder du auf die NVIDIA-Checkpoints warten kannst. Es ist das einzige der beiden Modelle, das ein Bild erzeugen kann, und das einzige, das du ausführen kannst, ohne Daten an einen Anbieter zu senden. Behandle seine Benchmark-Zahlen als nicht belegt, bis der technische Bericht vorliegt, denn genau das besagt die Model Card.

Wählen Sie Qwen3.8-Omni-Flash, wenn es bei Ihrem Problem um Stunden von Audio und Video statt um Pixel-Ausgabe geht – Meeting-Intelligenz, Analyse langer Aufnahmen, audiointensive agentische Arbeit auf Chinesisch und Englisch – und wenn Sie eine Abhängigkeit von einer einzigen Quelle und reine Textausgabe akzeptieren können. Seine Kostenbilanz ist stark bei Eingabe-Audiostunden und deutlich schwächer bei der Gesamtrechnung, seine Benchmarks sind vom Anbieter gemeldet und nicht reproduziert, und die ersten Drittanbieter-Durchläufe, die auftauchen, verorten es beim Reasoning im 28. Perzentil, an einer Stichprobe, die klein genug ist, dass sie eher einen Test als eine Entscheidung nahelegen sollte.

Wenn Sie beides brauchen, sind sie Komplemente, keine Alternativen: ein Open-Weight-Bildmodell, das Sie selbst hosten, und ein geschlossenes Langmedien-Modell, das Sie aufrufen. Keines von beiden ist heute über uns routbar. Worauf man auf der einen Seite achten sollte, ist der NVIDIA-Checkpoint und der technische Bericht; auf der anderen Seite die erste unabhängige Evaluierung, die es noch nicht gibt und die die mit Abstand größte Lücke in allem ist, was man über Qwen3.8-Omni-Flashbisher

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert