
Qwen3.8-Omni-Flash vs InternLumina U2: Hyrda sinnen vs ägda vikter
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Det användbara sättet att jämföra Qwen3.8-Omni-Flash och InternLumina U2 är inte rad för rad i benchmarkar, för de förekommer inte i samma sådana. Det är genom att fråga vem som får köra dem. Leverantörens Qwen3.8-Omni-Flash, öppen för API-kunder sedan 18 september 2026, är en sluten modell på leverantörens egna plattformar: en miljon tokens i kontext, upp till en timmes kontinuerlig ljud och video per anrop, endast textutdata och inga vikter. Shanghai AI Laboratorys InternLumina U2 är en 16B-A1B mixture-of-experts-diffusionsmodell under Apache 2.0 vars Ascend-checkpoints går att ladda ner från Hugging Face just nu, medan NVIDIA-checkpoints och den tekniska rapporten fortfarande listas som kommande. Den ena är en tjänst du hyr per token. Den andra är en fil du kan hålla i handen, med en varning om vilken hårdvara den för närvarande körs på. Den skillnaden avgör fler verkliga driftsättningar än någon poäng i någon av leverantörernas tabeller.
Vad InternLumina U2 egentligen är
Arkitekturen är den intressanta delen och den är verkligen ovanlig. InternLumina U2 är en gles MoE med 16 miljarder totala parametrar och 1 miljard aktiva, och det är en diffusionsspråkmodell snarare än en autoregressiv – den förfinar en hel sekvens parallellt i stället för att sända ut tokens från vänster till höger. Dess visuella representation är helt diskret: åtta kodtabeller med visuella tokens byggda på Apples AToken, vilket är det som gör att en och samma modell både kan läsa en bild och producera en utan en separat avkodare påhängd i änden. Frågebesvarande på text, text-till-bild-generering, bildförståelse, bildredigering, videoförståelse och 3D-förståelse är alla samma modell som utför samma typ av arbete med samma vokabulär.
• Storlek och form — InternLumina U2 är totalt 16B, 1B aktiva, gles MoE; Qwen3.8-Omni-Flash:s parameterantal är inte offentliggjort.
• Generering – InternLumina U2 genererar och redigerar bilder och hanterar 3D-förståelse; Qwen3.8-Omni-Flash genererar inga medier alls och returnerar text.
• Avkodning – InternLumina U2 är en diffusion-LLM som avkodar parallellt; Qwen3.8-Omni-Flash är autoregressiv.
• Kontext och varaktighet — Qwen3.8-Omni-Flash har ett fönster på 1 M tokens och upp till en timmes kontinuerlig ljudvideo i ett enda anrop; InternLumina U2:s publicerade material beskriver inget av detta, och långformat ljud ingår inte bland dess listade kapaciteter.
• Vikter — InternLumina U2 är Apache 2.0 med Ascend-checkpoints publicerade och NVIDIA-checkpoints väntande; Qwen3.8-Omni-Flash har inga vikter och ingen annonserad plan för några.
• Hur du får det — InternLumina U2 är en nedladdning från Hugging Face med inferenskod på GitHub; Qwen3.8-Omni-Flash är ett API-anrop till Alibaba Cloud Model Studio eller Qianwen-plattformen.
• Oberoende poäng — inga för någon av dem. InternLumina U2:s eget modellkort betecknar sin benchmark-tabell som "preliminära, partiella resultat"; Qwens är alla mot dess egen föregångare och oreproducerade.

Frågan om vikterna har förskjutits sedan förhandsbevakningen.
Om du läste vår tidigare text om InternLumina U2 när koden först dök upp, har läget förändrats i en riktning och stått still i en annan, och båda delarna spelar roll. Hugging Face-repositoriet är inte längre en stubbe: ascend/-mappen innehåller nu sju safetensors-shards plus konfigurationen, tokenizern och modelleringskoden, vilket betyder att modellen verkligen går att ladda ner och köra för alla med rätt hårdvara. nvidia/-mappen är fortfarande markerad som "kommer snart", den tekniska rapporten är fortfarande på väg, och repositoriets egen benchmarksektion säger fortfarande "preliminära, delvisa resultat". Så det korrekta påståendet i dag är inte "vikterna är ute" eller "vikterna saknas" — det är att en hårdvarustacks checkpoints är publicerade och den andra inte är det, vilket är en verklig begränsning för alla vars kluster är NVIDIA.
Två andra saker har förändrats i tysthet. GitHub-repositoriet har fortsatt att ta emot commits långt efter det första släppet den 1 september, så den släppta koden underhålls i stället för att parkeras. Och nedladdningsräknaren på Hugging Face-repositoriet visar fortfarande noll, vilket säger mindre om modellen än om målgruppen: en 16B-A1B-diffusionsmodell med checkpoints som i första hand är för Ascend riktar sig till ett labb, inte till ett produktteam som söker en hostad endpoint det här kvartalet.
Där de två faktiskt överlappar varandra, och där de inte gör det
Bildförståelse är snittmängden, och den är snävare än den ser ut. Båda modellerna kan titta på en bild och svara på frågor om den, vilket är hela uppgiften för Qwen3.8-Omni-Flash och en av sex uppgifter för InternLumina U2. Allt bortom det divergerar kraftigt. InternLumina U2 kan sedan redigera den bilden eller generera en ny från en prompt, i samma modell, med samma visuella vokabulär som den använde för att läsa den. Qwen3.8-Omni-Flash kan inte producera en enda pixel, men den tar emot en timme ljud och video i ett enda anrop och berättar vem som talade, när och vad som beslutades – vilket InternLumina U2:s publicerade material inte gör anspråk på att kunna alls.
Den överlappning som spelar mindre roll än man antar är video. Båda beskrivs hantera video, men de gör olika saker med den: den ena handlar om att förstå en lång inspelning som ett dokument, den andra handlar om att hantera video som en visuell modalitet vid sidan av 3D. Ett team som behöver få en timmes filmmaterial sammanfattat har inte nytta av den andra, och ett team som behöver få en bildruta genererad har inte nytta av den första.

Kostnad, kontroll och vad du faktiskt köper
Prisjämförelsen är inte av samma slag. Qwen3.8-Omni-Flash debiterar per token – 0,15 USD per miljon indata, 0,016 USD cachad, 0,47 USD utdata på den internationella listan, med en separat prislista för fastlandet som inte är jämförbar – och dess lanseringsrubrik var en av leverantören rapporterad sänkning med mer än 98 % av kostnaden för en timmes ljudinmatning, beräknad genom att prissätta ett tvåminutersprov och multiplicera med trettio, med video samplad i 720p och en bildruta per sekund. InternLumina U2 debiterar ingenting, eftersom det inte finns något att debitera: kostnaden är din hårdvara och din tid, och modellens eget kort publicerar ingen genomströmningssiffra som skulle låta dig omvandla det till ett antal per token.
Det är avvägningen i en rad. API:et ger dig kapacitet som du inte kan drifta själv och en timkostnad som skalas med användningen; de öppna vikterna ger dig en fast kostnad och full kontroll över datavägen, till priset av en inferensstack som du måste bygga och en uppsättning checkpoints som för närvarande innebär Ascend-hårdvara. För reglerade arbetsbelastningar där media inte får lämna byggnaden är det andra inte en preferens — det är det enda alternativet på den här sidan. För ett team som behöver långljudsanalys den här månaden är det första det enda alternativet på den här sidan.
OrcaRouter hostar inte någon av modellerna idag, och vi säger hellre det rakt ut än antyder en routingväg som inte finns: Qwen3.8-Omni-Flash körs bara på Alibabas egna plattformar, och InternLumina U2 är en nedladdning snarare än en endpoint. Vad vi däremot kör är resten av Qwen3.8-serien — Qwen3.8-Flash och Qwen3.8-Max — via ett API till leverantörens listpris med 0 % påslag, vilket är det praktiska sättet att hålla en fungerande baslinje för den slutna modellsidan i den här jämförelsen medan den öppna viktsidan fortfarande får sina NVIDIA-checkpoints i ordning.

Vilken du egentligen borde välja
Välj InternLumina U2 om du behöver en modell som läser, genererar och redigerar bilder och du är beredd att äga inferensstacken — och om dina acceleratorer är Ascend, eller om du kan vänta på NVIDIA-checkpointarna. Det är den enda av de två modellerna som kan skapa en bild, och den enda du kan köra utan att skicka data till en leverantör. Betrakta dess benchmark-siffror som obevisade tills den tekniska rapporten kommer, eftersom modellkortet säger precis det.
Välj Qwen3.8-Omni-Flash om ditt problem är timmar av ljud och video snarare än pixlar ut – mötesintelligens, analys av långa inspelningar, ljudtungt agentiskt arbete på kinesiska och engelska – och om du kan acceptera ett beroende av en enda källa och endast textutdata. Dess kostnadsbild är stark för inmatade ljudtimmar och mycket svagare för den totala fakturan, dess benchmarkresultat är leverantörsrapporterade och ej reproducerade, och de första tredjepartskörningarna som dyker upp placerar den i 28:e percentilen för resonemang, på ett urval som är tillräckligt litet för att det bör föranleda ett test snarare än ett beslut.
Om du behöver båda är de komplement, inte alternativ: en öppen viktmodell för bilder som du driftar själv och en sluten modell för långa medier som du anropar. Ingen av dem kan dirigeras via oss i dag. På ena sidan är det NVIDIA-checkpointen och den tekniska rapporten man bör hålla ögonen på; på den andra den första oberoende utvärderingen, som ännu inte finns och som är den enskilt största luckan i allt som hittills skrivits om Qwen3.8-Omni-Flash så här långt.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
