
Qwen3.8-Omni-Flash vs Qwen2.5-Omni: 18 månader senare har uppgraderingen förlorat sin röst
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Här är det faktum som gör den här jämförelsen mer intressant än en generationsuppdatering. Den äldre modellen kan tala och den nyare kan inte. Qwen2.5-Omni, släppt i mars 2025, tog text, bilder, ljud och video som indata och svarade i text eller i strömmande naturligt tal, i en enda end-to-end-modell som du kunde ladda ner. Qwen3.8-Omni-Flash, släppt den 18 september 2026, tar samma fyra modaliteter över ett kontextfönster som är trettio gånger större, tar in en timme kontinuerlig ljudvideo där dess förfader hanterade sekunder, och returnerar endast text. Arton månaders arbete köpte ett enormt mycket bredare intag och gav upp utdatakanalen. Huruvida det är framsteg eller en avvägning beror helt och hållet på vad du använde den gamla modellen till — och svaret delar sig tydligt i två.
Siffrorna för Qwen2.5-Omni är leverantörens, från dess utgivningsmaterial i mars 2025, och arton månader av bred driftsättning har delvis bekräftat dem. Siffrorna för Qwen3.8-Omni-Flash är också Alibabas, från lanseringsmaterial som publicerades timmar innan detta skrevs, och inget i dem har reproducerats oberoende. När ett påstående kommer från en kritiker snarare än leverantören tillskrivs det som sådant. Det enda strukturella faktumet som inte behöver verifieras är också det mest konsekvensrika: Qwen2.5-Omni har öppna vikter och är nedladdningsbar, och Qwen3.8-Omni-Flash har inte det.
Vad Qwen2.5-Omni var, och varför det spelade roll
När den lanserades den 26 mars 2025, Qwen2.5-Omni var den första end-to-end omnimodala modellen i familjen — lanseringen framställde den som svaret på problemet med "en djurpark av specialister", där transkribering, vision och röst var och en behövde en separat modell och ett separat limlager. 7B-modellen hanterade alla fyra indatamodaliteter och både text- och talutdata, hävdade toppmoderna resultat på OmniBench-fusionsbenchmarken före Gemini-1.5-Pro, och rapporterade en kvalitetspoäng för talgenerering på 4,51 som Alibaba beskrev som mänsklig nivå. En 3B-variant följde samma arkitektur.
Ingenjörskonsten som fick det att fungera är värd att namnge, eftersom den nya modellen inte använder den. Thinker-Talker delade upp jobbet i två delar: en Thinker-transformerare fusionerade ljud- och bildkodarna och producerade semantik och text, medan en Talker strömmade taltoken från Thinkerns dolda tillstånd och delade hela konversationshistoriken. Tidsjusterad multimodal RoPE (TMRoPE) flätade samman video- och ljudpositioner så att de två strömmarna hölls i synk. Blockvis strömning lät kodarna utföra perception medan språkmodellen hanterade långa sekvenser, vilket möjliggjorde talade svar med låg latens. Två fasta röster medföljde: Chelsie och Ethan.
Begränsningarna var precis lika verkliga. Kontexten var 32 768 tokens. Minnet var den begränsande faktorn i mycket högre grad än beräkningskraften: Alibabas egna tabeller angav BF16-inferens med FlashAttention-2 till ungefär 31 GB GPU-minne för en video på 15 sekunder, 42 GB för 30 sekunder och 60 GB för en hel minut. En minut video, på en 7B-modell, på en av de största enskilda GPU:erna du kunde hyra. Det talet är det man bör hålla i åtanke, eftersom det är talet som 2026 års modell byggdes för att krossa.
Vad Qwen3.8-Omni-Flash är
Den nya modellen är inbyggt omnimodal snarare än ihopsatt – byggd direkt på Qwen3.8-Flash-arkitekturlinjen i stället för som en text-LLM med påskruvade perceptionskodare, vilket är en strukturell skillnad och inte bara en generationsbeteckning. Den tar emot text, bild, ljud och video, inklusive stereo och fyrakanaligt spatialt ljud, och returnerar text inom en kontext på en miljon tokens med ungefär 991K maximal indata, 131K maximal utdata och en resonemangsbudget på 262K. Den hanterar upp till en timmes kontinuerlig ljudvideo per anrop. Taligenkänningen täcker 74 språk, medan talgenerering för 29 språk hanteras i den omgivande verktygsuppsättningen i stället för av modellen. Den finns tillgänglig på Qianwen AI-plattformen och Alibaba Cloud Model Studio under id:t qwen3-8-omni-flash, för 0,15 USD per miljon indatatokens och 0,47 USD per miljon utdata, med cachad indata för 0,016 USD.

Arton månader, dimension för dimension
• Kontext — Qwen2.5-Omni 32 768 token mot Qwen3.8-Omni-Flash på en miljon, ungefär en trettiofaldig ökning.
• Medielängd – sekunder video, begränsad av GPU-minne, jämfört med en timmes kontinuerlig ljudvideo i ett enda hostat samtal.
• Utdata – text plus strömmande naturligt tal på den gamla modellen; endast text på den nya.
• Driftsättning – Qwen2.5-Omni har öppna vikter under Apache-2.0 och kan laddas ner från Hugging Face och ModelScope; Qwen3.8-Omni-Flash finns endast via API, utan något annonserat släpp av vikter.
• Hårdvara — 7B parametrar som kräver upp till ~60 GB GPU-minne för en minut video, mot en hostad endpoint som du inte provisionerar alls.
• Pris — den gamla modellen kostar dig en GPU; den nya kostar 0,15 USD per miljon indatatoken, och Alibaba hävdar att ljudinmatning per timme är 98 % billigare än den Qwen3.5-Omni-Plus-generation den ersätter.
• Talgenerering — två fasta röster i 2025, mot 29 språk för talgenerering i 2026 års verktyg, inget av det producerat av modellen själv.
Bytet som ingen annonserade
Läser man de två specifikationsbladen tillsammans framträder konturerna av de senaste arton månaderna. Alibaba tillbringade intervallet med att lösa intaget – hur mycket media en modell kan absorbera, hur billigt, och hur mycket av beslutsfattandet den kan sköta själv. Qwen3.8-Omni-Flash är en triumf på den axeln. Läget Agentic Understanding, där modellen väljer vad den ska sampla i stället för att bearbeta varje bildruta, minskar antalet token per fråga från 145 736 till 79 117 samtidigt som OmniVideoBench-noggrannheten höjs från 63,4 till 67,8, och leverantören rapporterar att talardiariseringsfelet på AliMeeting kollapsar från 88,11 till 3,35.
Det som intervallet inte prioriterade var utdata. 2025 års modells definierande trick – en modell som hör dig och svarar högt, från början till slut, utan en separat talsyntes – har ingen efterföljare här. Om du byggde en röstagent, en dubbningspipeline eller ett tillgänglighetsverktyg på Qwen2.5-Omni's Talker, är 2026 års modell inte en uppgradering av den; den är en komponent som du skulle behöva montera ett nytt text-till-tal-steg på, vilket lägger till latens och en leverantör i en pipeline som tidigare inte hade något av dem. Lanseringsmaterialet är ärligt om detta om du läser modalitetsraden noga, men det är inte rubriken, och den som migrerar utifrån antagandet att "omni" betyder samma sak i båda utgåvorna kommer att upptäcka skillnaden i produktion.

Varför 2025-modellen fortfarande har ett jobb
Tre skäl, och inget av dem är nostalgi. Det första är rösten, som ovan. Det andra är öppna vikter: 32K kontext och ett 7B-fotavtryck körs på hårdvara du kontrollerar, offline, utan att data lämnar byggnaden och utan mätare per token — det enda alternativet om ditt ljud omfattas av en residensregel eller din latensbudget förbjuder en rundtur. Det tredje är kostnaden vid mycket låg volym. En GPU du redan äger är gratis i marginalen; den hostade modellens $0,15 per miljon tokens är billigt men inte noll, och den fasta kostnaden för att provisionera mot den är verklig för en arbetsbelastning som körs två gånger i veckan.
Motargumentet är att den gamla modellens begränsningar biter allt hårdare för varje år. En minut video, 32K kontext och varken verktygsanrop eller strukturerad utdata i en värld där agenter är standardformen för driftsättning utgör ett snävt utrymme. För en pipeline som måste läsa in inspelade möten, Qwen3.8-Omni-Flash är inte bara bättre — den är skillnaden mellan möjligt och omöjligt, eftersom 2025-modellen fysiskt inte kan rymma indata.
Det är värt att vara konkret om hur mycket liv det finns kvar i de gamla vikterna, eftersom "legacy" underskattar dem. Qwen2.5-Omni-7B-repot registrerade 343 676 nedladdningar den senaste månaden när vi kontrollerade det den 18 september 2026, med omkring hundra community Spaces och dussintals finjusteringar, adaptrar och kvantiseringar byggda ovanpå. Vad flaggskeppet än gör, fortsätter en stor mängd människor fortfarande att leverera på 2025-modellen — och noterbart är att Hugging Face inte listade någon inferensleverantör som driftsatte den, vilket innebär att nästan all den användningen är självhostad.
Den nya modellen förbättrar den gamla.
Den märkligaste och mest övertygande detaljen i lanseringen ligger begravd nära slutet av materialet. I ett experiment som Alibaba beskriver som en modell som optimerar en modell, Qwen3.8-Omni-Flash förbättrade autonomt taligenkänningen av sichuandialekt hos Qwen2.5-Omni-3B — den lilla syskonmodellen till den modell som den nominellt ersätter — och minskade teckenfelkvoten från 25,79 % till 15,30 % inom tolv timmar och byggde 3 413 träningsexempel i fyra omgångar.
Det är ett bättre argument för den nyare modellen än något benchmarktest i släppet, och det omramar relationen mellan de två. 2026-modellen är inte bara en ersättare för 2025-modellen; den är ett verktyg som gör 2025-vikterna bättre. Om du kör Qwen2.5-Omni i produktion för ett språk eller en dialekt som den hanterar dåligt, kan den praktiska vägen vara att behålla driftsättningen och använda den nya modellen för att bygga träningsdata, i stället för att migrera arbetsbelastningen. Observera dock att detta är en leverantörsrapporterad demonstration utan publicerad metodik, och den bör betraktas som en uppmuntrande anekdot snarare än ett reproducerbart recept.

Om du migrerar
Beslutet handlar sällan om en enda modell. Ett team som lämnar en självhostad omnimodell väljer mellan tre upplägg: att stanna kvar på öppna vikter och fortsätta provisionera, att gå över till en leverantörs-API och ge upp kontrollen, eller att dela upp arbetsbelastningen så att bara den del som behöver ett intag på en miljon token går till den hostade modellen. Det tredje alternativet är oftast rätt och är också det som folk hoppar över, eftersom det låter som mer arbete än det är – den dialektfinjustering du la en månad på behöver inte kastas bara för att mötessammanfattningssteget flyttades.
Där routning gör nytta är i skarvarna. OrcaRouter ger dig en nyckel till fler än 200 modeller med 0 % påslag på leverantörens listpris och automatisk redundansväxling om en endpoint försämras, vilket innebär att den hostade halvan av en delad pipeline inte behöver ett eget avtal, egen klientkod och egen övervakning innan du vet om arbetsbelastningen motiverar något av det. För att vara tydliga med vad vi inte gör: ingen av omni-modellerna finns i vår katalog – båda körs på Alibabas plattformar eller på din egen hårdvara – så det här är ett routningsbeslut du fattar kring modellerna, inte genom oss.
Vilka bör flytta, och vilka bör inte
Byt om din arbetsbelastning är långformat ljud eller video, om 32K kontext är det som hindrar en pipeline från att existera, om du behöver agentiskt beteende över media, eller om talardiarisering i stor skala är problemet du har. Stanna kvar om du behöver att modellen talar, om ditt ljud inte kan lämna din infrastruktur, om du är beroende av de specifika Qwen2.5-Omni-vikter som du redan har justerat, eller om din anropsvolym är tillräckligt låg för att en GPU du äger slår en mätare.
Den obekväma sammanfattningen är att detta mindre är en ersättare än en förgrening i produktlinjen. Alibaba har tillbringat arton månader med att bygga den bästa intagsmodell de kan och har inte byggt en efterträdare till utdatahalvan. Om ditt arbete ligger på intagssidan är uppgraderingen nära nog obligatorisk. Om det ligger på utdatasidan är 2025 års modell fortfarande det nyaste som gör det du behöver – och det är värt att veta innan du planerar en migrering som tyst skulle radera en funktion du är beroende av.
