
InternLumina-U2 vs Qwen2.5 Omni: Den omni-modell som Alibaba levererade vs den som Shanghai AI Lab fortfarande utlovar
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
InternLumina-U2 och Qwen2.5 Omni är båda svar på samma ambition — en modell som hanterar alla modaliteter i stället för en samling specialister — från två skilda generationer. Qwen2.5 Omni är svaret som faktiskt levererades: en 7-miljardersparameter-modell med öppna vikter, släppt i mars 2025, sjutton månader gammal när detta skrivs, som tar emot text, bilder, ljud och video som indata och svarar med text eller naturligt strömmande tal. InternLumina-U2 är Shanghai AI Laboratorys svar, publicerat som inferenskod den 1 september 2026: en 16-miljardersparameter-modell för gles diffusion som påstår sig kunna uppfatta bilder, video och 3D samt generera och redigera bilder genom ett gemensamt gränssnitt för diskreta token. En generation av omni-idén har varit i produktion i ett och ett halvt år; den andra är en dag gammal och kan inte köras av någon, eftersom dess vikter ännu inte finns. Klyftan mellan dem är skillnaden mellan ett hållet löfte och ett avgett löfte.
Den omni som släpptes: Qwen2.5 Omni
Qwen2.5 Omni är värd att ta på allvar som en baslinje eftersom det är en av de sällsynta öppna modellerna som faktiskt levererade löftet om att ”uppfatta allt och svara i vilken form som helst”. Dess Thinker-Talker-arkitektur kopplar samman en textbaserad tänkare med en talare som återger tal, med hjälp av en tidsanpassad multimodal positionskodning så att ljud och video förblir synkroniserade. Indata omfattar text, bilder, ljud och video, och utdata kan vara text plus röst i samma tur, med fyra inbyggda röster. Begränsningarna är lika väldokumenterade som kapaciteterna: kontexten är 32 000 tokens, det finns ingen funktionsanropning och inga strukturerade utdata, och modellen är en omni-konversationspartner snarare än en agent. Vad den inte gör är värt att understryka för den här jämförelsen – den uppfattar bilder, ljud och video, men den genererar dem inte. ”Omni” i Qwen2.5 Omni är omni-perception med talsyntes på utdatasidan; pixlarna går in, och ord kommer ut.
Meritlistan är verklig. Modellen har laddats ner hundratusentals gånger, har en API-tjänst via utvecklarens egen plattform och flera tredjepartsplattformar, och har tillbringat sjutton månader med att ackumulera kvantiseringar, communityverktyg och ett känt pris – aggregatorlistor anger text runt 0,09 USD per miljon inmatningstokens och 0,34 USD per miljon utdatatokens, med ljud som faktureras separat. Sjutton månader är långt nog för att både dess styrkor och dess begränsningar ska vara väl kartlagda. Det är vad mognad ger: inte perfektion, utan förutsägbarhet.
Den omni som utlovats: InternLumina-U2
InternLumina-U2 försöker gå ett steg längre än Qwen2.5 Omni, och steget är precis där svårigheten ligger. Dess bärande tes är att perception och generering bör dela ett gemensamt gränssnitt med diskreta token: i stället för en språkmodell som uppfattar video och en separat diffusionsmodell som ritar, skulle en enda gles MoE-diffusionsstomme — 16B totalt, 1B aktiv — både kunna läsa en bild, ett diagram, en video eller en 3D-tillgång och skriva en ny bild eller en redigering, med hjälp av ett helt diskret visuellt vokabulär med åtta codebooks, så att varje visuell position bär tillräckligt med information för att stödja båda riktningarna. Det är ett väsentligt större anspråk än Qwen2.5 Omnis. Det är en sak att dirigera varje inmatningsmodalitet till text och tal; en annan sak är att få en enda uppsättning vikter att generera pixlar lika ledigt som den resonerar om dem.
Det är också, just nu, ett påstående som inte går att kontrollera. Laboratoriet publicerade inferenskod, en projektsida med en "preliminär, ofullständig" benchmark-tabell och en tom Hugging Face-stub; vikterna, träningskoden, den tekniska rapporten och Ascend-NPU-stacken är alla märkta med "kommer snart". Det finns ingen oberoende utvärdering eftersom det inte finns något att utvärdera. Arkitekturen för Qwen2.5 Omni gick att kontrollera samma vecka som den släpptes, eftersom vikterna följde med; arkitekturen för InternLumina-U2 är läsbar idag och dess kvalitet är fortfarande ett löfte från leverantören.
Resultattavlan
Eftersom en av dessa modeller har sjutton månaders historik och den andra har en dags kod, bär raderna på ursprung snarare än att låtsas att kolumnerna är symmetriska.
• Ålder — Qwen2.5 Omni: släppt i mars 2025, sjutton månader i det vilda, hundratusentals nedladdningar. InternLumina-U2: inferenskod publicerad 1 september 2026, noll nedladdningar, noll oberoende körningar.
• Form — Qwen2.5 Omni: ~7B end-to-end, Thinker-Talker med tidsanpassad multimodal positionskodning. InternLumina-U2: 16B totalt / 1B aktiv gles MoE-diffusions-LLM med en diskret visuell tokenizer med åtta kodböcker.
• Indata — båda tar emot text och bilder; Qwen2.5 Omni tar dessutom emot ljud och video för omni-chatt; InternLumina-U2 hävdar dessutom videoförståelse över 64 samplade bildrutor och 3D-förståelse över Blender-renderade GLB/GLTF-vyer.
• Utdata — Qwen2.5 Omni: text och strömmande tal, fyra röster. InternLumina-U2: hävdar stöd för text, text-till-bild upp till 1024×1024 och instruktionsbaserad bildredigering.
• Generationsfronten — Qwen2.5 Omni: genererar ord och röst, inte pixlar. InternLumina-U2: försöker generera och redigera pixlar i samma diskreta-tokenmodell som läser.
• Vikter och licens — båda har Apache-2.0 öppna vikter i princip; Qwen2.5 Omnis är nedladdningsbara idag, InternLumina-U2:s är ännu inte publika.
• Servering — Qwen2.5 Omni: värdbaserat API plus självhostning (en tung utrullning med full precision); känd 32K-kontext, inget funktionsanropsstöd. InternLumina-U2: kan inte serveras — den släppta drivrutinen förväntar sig checkpoints som inte finns.
• Huvudsiffror — Qwen2.5 Omni: sedan länge etablerad på OmniBench-ledartavlan (en poäng runt 0.561 på nuvarande listor); InternLumina-U2: ChartQA 86.52, MathVision 33.22, GenEval 0.81 — allt leverantörsrapporterat, preliminärt och ofullständigt.

Varför generationsklyftan är den verkliga historien
Om man bortser från lanseringstidpunkterna, handlar den väsentliga skillnaden om vid vilken gräns varje modell stannar. Qwen2.5 Omni valde en hanterbar form av omni: uppfatta brett, svara på språk eller röst och lämna bild- och videogenerering åt dedikerade generationsmodeller på andra håll i stacken. Den arbetsfördelningen är grunden för i stort sett alla produktionsmässiga multimodala system 2026, och det är därför Qwen2.5 Omni kunde lanseras 2025 och förbli relevant 2026 — den gör sin del bra och fungerar ihop med resten. InternLumina-U2 är ett vad om att arbetsfördelningen är problemet: att en modell som tvingas representera allt — perception och generering — i ett gemensamt diskret ordförråd lär sig en djupare förståelse av syn än en modell som bara behöver beskriva den. Om det vadet håller är det det viktigaste resultatet. Om det inte gör det, blir InternLumina-U2 en långsammare och mer resurskrävande Qwen2.5 Omni med en på ett otympligt sätt fastskruvad bildgenerator i samma vikter. Hela tävlingen — och det är en tävling mellan en lanserad design och en hypotes, inte mellan två körbara modeller — gäller om den svårare arkitekturen rättfärdigar sig själv.

Qwen/Qwen2.5-Omni-7B:s Hugging Face-kort, fångat den 27 augusti 2026 — Thinker-Talker-översikten, Apache-2.0-licensen och modellens text-, bild-, ljud- och videomodalitetstaggar.
Vad ett och ett halvt år av nedladdningar faktiskt köper
Mognad är inte en vibe; det är en lista över saker du vet. Med Qwen2.5 Omni vet du att 32K-kontexten är en hård begränsning och att du kan arbeta runt den. Du vet att det inte finns någon funktionsanropsväg och kommer inte att låtsas att det finns. Du vet ungefär vad en driftsättning kostar, både via ett värdbaserat API och på dina egna GPU:er, eftersom modellen har prissatts och körts av tillräckligt många för att siffrorna har lagt sig. Du vet att OmniBench-positionen är verklig eftersom oberoende leaderboards har följt den i över ett år. Med InternLumina-U2 gäller inget av dessa verb — du vet inte, du kan inte veta, eftersom det inte finns någon artefakt. När en modell är en dag gammal och viktlös är varje påstående om den en avsiktsförklaring. Den asymmetrin är inte en kritik mot vetenskapen; det är den korrekta epistemiska hållningen för alla som väljer vad de ska bygga på.

GitHub-repositoriet InternLM/InternLumina-U2, fångat den 2 september 2026 – repots landningssida som gör arkitekturen offentlig – beskrivning, licens och inferensskripten – medan själva vikterna saknas i trädet.
Routningsbeslutet, ärligt formulerat
Vi ska vara tydliga med tillgängligheten: OrcaRouter hostar inte InternLumina-U2, eftersom det inte finns några vikter för någon att hosta, och vi har inte heller Qwen2.5 Omni för närvarande — den går via utvecklarens eget API och tredjepartsplattformar. Routingläxan här handlar alltså om förhållningssätt, inte om att anropa dessa två genom en enda nyckel idag. Det hållbara mönstret är det som varje beslut mellan en etablerad modell och en nykomling förr eller senare hamnar i: behåll den beprövade modellen på huvudvägen, där ett API täcker 200+ modeller och 0 % påslag innebär att du betalar leverantörens listpris och ingenting mer; peka den obeprövade nykomlingen mot en testväg med automatisk failover, så att anropet faller tillbaka på modellen med sjutton månaders meritlista första gången den hakar upp sig, spårar ur eller returnerar nonsens. På så sätt kan du utvärdera en ambitiös ny arkitektur som InternLumina-U2 den dag dess vikter släpps — utan att sätta den produktionsväg du redan är beroende av på spel.
Domen
Qwen2.5 Omni är den omni-modell som du kan bygga på i dag: levererad, nedladdningsbar, dokumenterad, med kända begränsningar och ett fast pris. InternLumina-U2 är omni-modellen att hålla ögonen på: ett genuint arkitektoniskt steg bortom perception mot skapande, Apache-2.0, med koden offentlig och vikterna ännu inte tillgängliga. Om labbets satsning på multi-codebook håller måttet under oberoende testning, kommer InternLumina-U2 inte att vara så mycket en rival till Qwen2.5 Omni som nästa generation av samma idé. Om den inte gör det, kommer den sjutton månader gamla generalisten som faktiskt levererades fortfarande att finnas där och göra det jobb den har gjort hela tiden. Håll ett öga på Hugging Face-stubben; domen väntar på safetensors-filerna, inte på den här artikeln.
