Ett hero-titelkort för jämförelsen "Qwen3.8-Omni-Flash vs Qwen2.5-Omni" med överrubriken "Arton månader isär – mars 2025 till september 2026", underrubriken "Trettio gånger så mycket kontext, en timme media i stället för sekunder – och det enda den äldre modellen kunde göra som den nyare inte kan", och tre statistikchips med texten "Kontext: 32K till 1M", "Media per anrop: sekunder till 1 timme" och "Talutmatning: endast 2025 års modell".
Guides & Insights

Qwen3.8-Omni-Flash vs Qwen2.5-Omni: 18 månader senare har uppgraderingen förlorat sin röst

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Här är det faktum som gör den här jämförelsen mer intressant än en generationsuppdatering. Den äldre modellen kan tala och den nyare kan inte. Qwen2.5-Omni, släppt i mars 2025, tog text, bilder, ljud och video som indata och svarade i text eller i strömmande naturligt tal, i en enda end-to-end-modell som du kunde ladda ner. Qwen3.8-Omni-Flash, släppt den 18 september 2026, tar samma fyra modaliteter över ett kontextfönster som är trettio gånger större, tar in en timme kontinuerlig ljudvideo där dess förfader hanterade sekunder, och returnerar endast text. Arton månaders arbete köpte ett enormt mycket bredare intag och gav upp utdatakanalen. Huruvida det är framsteg eller en avvägning beror helt och hållet på vad du använde den gamla modellen till — och svaret delar sig tydligt i två.

Siffrorna för Qwen2.5-Omni är leverantörens, från dess utgivningsmaterial i mars 2025, och arton månader av bred driftsättning har delvis bekräftat dem. Siffrorna för Qwen3.8-Omni-Flash är också Alibabas, från lanseringsmaterial som publicerades timmar innan detta skrevs, och inget i dem har reproducerats oberoende. När ett påstående kommer från en kritiker snarare än leverantören tillskrivs det som sådant. Det enda strukturella faktumet som inte behöver verifieras är också det mest konsekvensrika: Qwen2.5-Omni har öppna vikter och är nedladdningsbar, och Qwen3.8-Omni-Flash har inte det.

Vad Qwen2.5-Omni var, och varför det spelade roll

När den lanserades den 26 mars 2025, Qwen2.5-Omni var den första end-to-end omnimodala modellen i familjen — lanseringen framställde den som svaret på problemet med "en djurpark av specialister", där transkribering, vision och röst var och en behövde en separat modell och ett separat limlager. 7B-modellen hanterade alla fyra indatamodaliteter och både text- och talutdata, hävdade toppmoderna resultat på OmniBench-fusionsbenchmarken före Gemini-1.5-Pro, och rapporterade en kvalitetspoäng för talgenerering på 4,51 som Alibaba beskrev som mänsklig nivå. En 3B-variant följde samma arkitektur.

Ingenjörskonsten som fick det att fungera är värd att namnge, eftersom den nya modellen inte använder den. Thinker-Talker delade upp jobbet i två delar: en Thinker-transformerare fusionerade ljud- och bildkodarna och producerade semantik och text, medan en Talker strömmade taltoken från Thinkerns dolda tillstånd och delade hela konversationshistoriken. Tidsjusterad multimodal RoPE (TMRoPE) flätade samman video- och ljudpositioner så att de två strömmarna hölls i synk. Blockvis strömning lät kodarna utföra perception medan språkmodellen hanterade långa sekvenser, vilket möjliggjorde talade svar med låg latens. Två fasta röster medföljde: Chelsie och Ethan.

Begränsningarna var precis lika verkliga. Kontexten var 32 768 tokens. Minnet var den begränsande faktorn i mycket högre grad än beräkningskraften: Alibabas egna tabeller angav BF16-inferens med FlashAttention-2 till ungefär 31 GB GPU-minne för en video på 15 sekunder, 42 GB för 30 sekunder och 60 GB för en hel minut. En minut video, på en 7B-modell, på en av de största enskilda GPU:erna du kunde hyra. Det talet är det man bör hålla i åtanke, eftersom det är talet som 2026 års modell byggdes för att krossa.

Vad Qwen3.8-Omni-Flash är

Den nya modellen är inbyggt omnimodal snarare än ihopsatt – byggd direkt på Qwen3.8-Flash-arkitekturlinjen i stället för som en text-LLM med påskruvade perceptionskodare, vilket är en strukturell skillnad och inte bara en generationsbeteckning. Den tar emot text, bild, ljud och video, inklusive stereo och fyrakanaligt spatialt ljud, och returnerar text inom en kontext på en miljon tokens med ungefär 991K maximal indata, 131K maximal utdata och en resonemangsbudget på 262K. Den hanterar upp till en timmes kontinuerlig ljudvideo per anrop. Taligenkänningen täcker 74 språk, medan talgenerering för 29 språk hanteras i den omgivande verktygsuppsättningen i stället för av modellen. Den finns tillgänglig på Qianwen AI-plattformen och Alibaba Cloud Model Studio under id:t qwen3-8-omni-flash, för 0,15 USD per miljon indatatokens och 0,47 USD per miljon utdata, med cachad indata för 0,016 USD.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni - the scoreboard'. Left column Qwen3.8-Omni-Flash: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Weights API only, Hardware hosted endpoint. Right column Qwen2.5-Omni: Released 26 Mar 2025, Context 32,768 tokens, Media per call seconds and GPU-bound, Output text + streaming speech, Weights open and downloadable, Hardware roughly 60GB GPU for 60s of video. The footer reads 'Qwen2.5-Omni figures per Alibaba's March 2025 release materials; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

Arton månader, dimension för dimension

• Kontext — Qwen2.5-Omni 32 768 token mot Qwen3.8-Omni-Flash på en miljon, ungefär en trettiofaldig ökning.

• Medielängd – sekunder video, begränsad av GPU-minne, jämfört med en timmes kontinuerlig ljudvideo i ett enda hostat samtal.

• Utdata – text plus strömmande naturligt tal på den gamla modellen; endast text på den nya.

• Driftsättning – Qwen2.5-Omni har öppna vikter under Apache-2.0 och kan laddas ner från Hugging Face och ModelScope; Qwen3.8-Omni-Flash finns endast via API, utan något annonserat släpp av vikter.

• Hårdvara — 7B parametrar som kräver upp till ~60 GB GPU-minne för en minut video, mot en hostad endpoint som du inte provisionerar alls.

• Pris — den gamla modellen kostar dig en GPU; den nya kostar 0,15 USD per miljon indatatoken, och Alibaba hävdar att ljudinmatning per timme är 98 % billigare än den Qwen3.5-Omni-Plus-generation den ersätter.

• Talgenerering — två fasta röster i 2025, mot 29 språk för talgenerering i 2026 års verktyg, inget av det producerat av modellen själv.

Bytet som ingen annonserade

Läser man de två specifikationsbladen tillsammans framträder konturerna av de senaste arton månaderna. Alibaba tillbringade intervallet med att lösa intaget – hur mycket media en modell kan absorbera, hur billigt, och hur mycket av beslutsfattandet den kan sköta själv. Qwen3.8-Omni-Flash är en triumf på den axeln. Läget Agentic Understanding, där modellen väljer vad den ska sampla i stället för att bearbeta varje bildruta, minskar antalet token per fråga från 145 736 till 79 117 samtidigt som OmniVideoBench-noggrannheten höjs från 63,4 till 67,8, och leverantören rapporterar att talardiariseringsfelet på AliMeeting kollapsar från 88,11 till 3,35.

Det som intervallet inte prioriterade var utdata. 2025 års modells definierande trick – en modell som hör dig och svarar högt, från början till slut, utan en separat talsyntes – har ingen efterföljare här. Om du byggde en röstagent, en dubbningspipeline eller ett tillgänglighetsverktyg på Qwen2.5-Omni's Talker, är 2026 års modell inte en uppgradering av den; den är en komponent som du skulle behöva montera ett nytt text-till-tal-steg på, vilket lägger till latens och en leverantör i en pipeline som tidigare inte hade något av dem. Lanseringsmaterialet är ärligt om detta om du läser modalitetsraden noga, men det är inte rubriken, och den som migrerar utifrån antagandet att "omni" betyder samma sak i båda utgåvorna kommer att upptäcka skillnaden i produktion.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Varför 2025-modellen fortfarande har ett jobb

Tre skäl, och inget av dem är nostalgi. Det första är rösten, som ovan. Det andra är öppna vikter: 32K kontext och ett 7B-fotavtryck körs på hårdvara du kontrollerar, offline, utan att data lämnar byggnaden och utan mätare per token — det enda alternativet om ditt ljud omfattas av en residensregel eller din latensbudget förbjuder en rundtur. Det tredje är kostnaden vid mycket låg volym. En GPU du redan äger är gratis i marginalen; den hostade modellens $0,15 per miljon tokens är billigt men inte noll, och den fasta kostnaden för att provisionera mot den är verklig för en arbetsbelastning som körs två gånger i veckan.

Motargumentet är att den gamla modellens begränsningar biter allt hårdare för varje år. En minut video, 32K kontext och varken verktygsanrop eller strukturerad utdata i en värld där agenter är standardformen för driftsättning utgör ett snävt utrymme. För en pipeline som måste läsa in inspelade möten, Qwen3.8-Omni-Flash är inte bara bättre — den är skillnaden mellan möjligt och omöjligt, eftersom 2025-modellen fysiskt inte kan rymma indata.

Det är värt att vara konkret om hur mycket liv det finns kvar i de gamla vikterna, eftersom "legacy" underskattar dem. Qwen2.5-Omni-7B-repot registrerade 343 676 nedladdningar den senaste månaden när vi kontrollerade det den 18 september 2026, med omkring hundra community Spaces och dussintals finjusteringar, adaptrar och kvantiseringar byggda ovanpå. Vad flaggskeppet än gör, fortsätter en stor mängd människor fortfarande att leverera på 2025-modellen — och noterbart är att Hugging Face inte listade någon inferensleverantör som driftsatte den, vilket innebär att nästan all den användningen är självhostad.

Den nya modellen förbättrar den gamla.

Den märkligaste och mest övertygande detaljen i lanseringen ligger begravd nära slutet av materialet. I ett experiment som Alibaba beskriver som en modell som optimerar en modell, Qwen3.8-Omni-Flash förbättrade autonomt taligenkänningen av sichuandialekt hos Qwen2.5-Omni-3B — den lilla syskonmodellen till den modell som den nominellt ersätter — och minskade teckenfelkvoten från 25,79 % till 15,30 % inom tolv timmar och byggde 3 413 träningsexempel i fyra omgångar.

Det är ett bättre argument för den nyare modellen än något benchmarktest i släppet, och det omramar relationen mellan de två. 2026-modellen är inte bara en ersättare för 2025-modellen; den är ett verktyg som gör 2025-vikterna bättre. Om du kör Qwen2.5-Omni i produktion för ett språk eller en dialekt som den hanterar dåligt, kan den praktiska vägen vara att behålla driftsättningen och använda den nya modellen för att bygga träningsdata, i stället för att migrera arbetsbelastningen. Observera dock att detta är en leverantörsrapporterad demonstration utan publicerad metodik, och den bör betraktas som en uppmuntrande anekdot snarare än ett reproducerbart recept.

A screenshot of the Hugging Face model card for Qwen/Qwen2.5-Omni-7B (captured 18 September 2026), showing the Apache-2.0 licence tag, a 'Downloads last month' figure of 343,676, a Safetensors model size of 11B params, 100 Spaces using the model, 57 adapters, 67 finetunes and 24 quantisations, a note that the model is not deployed by any Inference Provider, and the model card text describing the Thinker-Talker architecture and TMRoPE position embedding.

Om du migrerar

Beslutet handlar sällan om en enda modell. Ett team som lämnar en självhostad omnimodell väljer mellan tre upplägg: att stanna kvar på öppna vikter och fortsätta provisionera, att gå över till en leverantörs-API och ge upp kontrollen, eller att dela upp arbetsbelastningen så att bara den del som behöver ett intag på en miljon token går till den hostade modellen. Det tredje alternativet är oftast rätt och är också det som folk hoppar över, eftersom det låter som mer arbete än det är – den dialektfinjustering du la en månad på behöver inte kastas bara för att mötessammanfattningssteget flyttades.

Där routning gör nytta är i skarvarna. OrcaRouter ger dig en nyckel till fler än 200 modeller med 0 % påslag på leverantörens listpris och automatisk redundansväxling om en endpoint försämras, vilket innebär att den hostade halvan av en delad pipeline inte behöver ett eget avtal, egen klientkod och egen övervakning innan du vet om arbetsbelastningen motiverar något av det. För att vara tydliga med vad vi inte gör: ingen av omni-modellerna finns i vår katalog – båda körs på Alibabas plattformar eller på din egen hårdvara – så det här är ett routningsbeslut du fattar kring modellerna, inte genom oss.

Vilka bör flytta, och vilka bör inte

Byt om din arbetsbelastning är långformat ljud eller video, om 32K kontext är det som hindrar en pipeline från att existera, om du behöver agentiskt beteende över media, eller om talardiarisering i stor skala är problemet du har. Stanna kvar om du behöver att modellen talar, om ditt ljud inte kan lämna din infrastruktur, om du är beroende av de specifika Qwen2.5-Omni-vikter som du redan har justerat, eller om din anropsvolym är tillräckligt låg för att en GPU du äger slår en mätare.

Den obekväma sammanfattningen är att detta mindre är en ersättare än en förgrening i produktlinjen. Alibaba har tillbringat arton månader med att bygga den bästa intagsmodell de kan och har inte byggt en efterträdare till utdatahalvan. Om ditt arbete ligger på intagssidan är uppgraderingen nära nog obligatorisk. Om det ligger på utdatasidan är 2025 års modell fortfarande det nyaste som gör det du behöver – och det är värt att veta innan du planerar en migrering som tyst skulle radera en funktion du är beroende av.