Ett genererat hero-kort med titeln 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash' under överrubriken 'Direkt jämförelse – två olika uppgifter', med underrubriken 'Den ena läser av en timme videomaterial. Den andra genererar fyrtio sekunder av det.' och fyra chips: 'Överlappning: videoförståelse', 'Indata: ljud + video vs prompt', 'Utdata: text vs video', 'Routbar här: ingen av dem'. OrcaRouter-logotypen är komponerad i nedre högra hörnet.
Guides & Insights

Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash: En tittar på videon, en skapar den

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Kort svar: dessa två är inte utbytbara, och jämförelsen blir bara meningsfull när man slutar behandla "omni" som en kategori. Qwen3.8-Omni-Flash, som leverantören öppnade för API-kunder den 18 september 2026, tar in text, bild, ljud och video och returnerar text — det är en modell för att läsa en timme av möte eller filmmaterial och berätta vad som hände. Gemini Omni 1.1 Flash, som leverantören släppte den 27 augusti 2026, tar en text- eller bildprompt och returnerar video med synkroniserat ljud — det är en modell för att skapa filmmaterialet. Den ena konsumerar media, den andra producerar media. Om din pipeline behöver båda behöver du båda, och den ärliga frågan är inte vilken som vinner utan vilken av dem du faktiskt saknar.

Ingen av modellerna har öppna vikter, ingen av dem kan dirigeras via OrcaRouter, och båda är prissatta utifrån axlar som inte kan omvandlas till varandra – tokens på ena sidan, sekunder genererad video på den andra. Där de faktiskt överlappar är snävare än vad inramningen ”omni vs omni” antyder, och det överlappet är värt att fastställa före prisaritmetiken, eftersom prisaritmetiken är där de två oftast jämförs på fel sätt.

Kategorimisstaget som är värt att reda ut först

Alibabas lanseringsmaterial benchmarkar Qwen3.8-Omni-Flash mot Gemini 3.8 Flash, och en stor del av bevakningen som följde komprimerade det till "slår Gemini". Det är en annan Google-modell än Gemini Omni 1.1 Flash, och de två är inte utbytbara referenspunkter: Gemini 3.8 Flash är den generella multimodala modellen, och Gemini Omni 1.1 Flash är videogenereringsmodellen med en separat prislista och en separat API-yta. Varje Qwen-mot-Gemini-siffra som cirkulerat sedan lanseringen – WildClawBench-MM 71,0 mot 58,9, SpotSoundBench 67,2 mot 39,7, AgenticVBench 36,8 mot 45,0 – är mot Gemini 3.8 Flash, inte mot Omni-videomodellen, och inget av det är oberoende i något fall. Om du kom hit med en resultattavla som ställer de två modellerna i den här artikeln på samma axel, är det nästan säkert fel Google-modell i den högra kolumnen.

Vad var och en faktiskt gör

• Vad den tar in — Qwen3.8-Omni-Flash accepterar text, bild, ljud och video, inklusive stereo och fyrkanaligt spatialt ljud; Gemini Omni 1.1 Flash accepterar text- och bildpromptar plus upp till tre sekunder av referensvideo.

• Vad den ger tillbaka — Qwen3.8-Omni-Flash returnerar endast text; Gemini Omni 1.1 Flash returnerar video med nativt synkroniserat ljud, i scener som kan förlängas till 40 sekunder i steg om tio sekunder.

• Kontrollpanel — Qwen3.8-Omni-Flash exponerar kontext, sampling och ett agentiskt läge som själv avgör vad den ska titta på; Gemini Omni 1.1 Flash exponerar styrning av första bildrutan och sista bildrutan, en tillbakablick på tio sekunder för kontinuitet, och en 360p-utkastnivå som Google beskriver som ungefär en tredjedel av kostnaden och cirka 60 % snabbare.

• Upplösning och finish — Qwen3.8-Omni-Flash har ingen utgångsupplösning eftersom den inte producerar några medier; Gemini Omni 1.1 Flash matar ut i 720p, 1080p och 4K.

• Kontext och varaktighet — Qwen3.8-Omni-Flash rymmer en miljon tokens och upp till en timmes kontinuerlig ljud- och video i ett enda anrop; Gemini Omni 1.1 Flash begränsas av klippet den genererar, inte av ett inmatningsfönster.

• Hur du betalar — Qwen3.8-Omni-Flash faktureras per token: 0,15 USD per miljon indata, 0,016 USD för cachad, 0,47 USD utdata på den internationella listan; Gemini Omni 1.1 Flash faktureras per sekund genererad video, med Googles publicerade pris på 0,10 USD per sekund för 720p.

• Öppenhet – stängt på båda sidor. Inga vikter för någon av modellerna, och ingen av dem kan routas via vårt API i dag.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Input: text, image, audio, video', 'Output: text only', 'Context: 1M tokens', 'Max media: 1 hour per call', 'Billing: per token', 'Price: $0.15 / $0.47 per M'; right column Gemini Omni 1.1 Flash: 'Input: text and image prompts', 'Output: video with audio', 'Context: clip-bound', 'Max media: 40s scenes', 'Billing: per second', 'Price: $0.10 per second at 720p'. The footer reads 'Qwen figures vendor-reported; Google rates per its published list.' The OrcaRouter logo is composited in the bottom-right corner.

Överlappningen är videoförståelse, och den är asymmetrisk.

Det enda stället där en köpare rimligen kan ställa dessa sida vid sida är i en pipeline som måste både förstå material och producera det – säg en redigeringsassistent som läser in en lång inspelning, hittar stunderna som är värda att behålla och genererar en klippning. På förståelsesidanQwen3.8-Omni-Flash är byggd för exakt detta: en timme kontinuerlig ljud och video per anrop, talarseparering och ett agentiskt läge som höjer noggrannheten på leverantörens OmniVideoBench från 63,4 till 67,8 samtidigt som det minskar antalet tokens per fråga från 145 736 till 79 117. På produktionssidanGemini Omni 1.1 Flash är den som kan generera det resulterande klippet med synkroniserat ljud, och Qwens modell kan inte producera en enda bildruta video.

Asymmetrin går också åt andra hållet, och den är lättare att missa. En videogenereringsmodells grepp om förståelse är instrumentellt – den behöver tillräckligt av en scen för att hålla en tagning konsekvent genom en förlängning på tio sekunder, vilket är ett annat krav än att svara på en fråga om vad som sades under mötets tredje timme. Googles modell har den längre historiken när det gäller genereringskvalitet och den kortare när det gäller långformsanalys; Alibabas har det omvända. Om din uppgift är ”hitta de tre minuter som spelar roll i den här inspelningen” är genereringsmodellen inte rätt verktyg. Om din uppgift är ”producera ett trettio sekunder långt klipp som matchar den här briefen” är förståelsemodellen inte heller rätt verktyg.

Varför prisjämförelsen hela tiden går fel

Ett pris per sekund och ett pris per token kan inte omvandlas, och försöket att omvandla dem ger de två fel som dominerar den här jämförelsen. Det första är att jämföra ett helt genererat klipp mot ett indatapris per token och dra slutsatsen att videomodellen är hundratals gånger dyrare — vilket är sant och meningslöst, eftersom de inte säljer samma sak. Det andra är att bara jämföra indatapriser och missa att Alibabas 98-procentiga ljudrabatt gäller indataljudtimmar, medan Googles pris gäller utdatavideosekunder, så de två "rabatterna" är inte ens på samma sida av mätaren.

Vad som ärligt kan sägas är detta. Enligt Alibabas egen metodik – ett tvåminutersprov multiplicerat med trettio, video i 720p och en bildruta per sekund – anges en timme kombinerad ljud- och videoinmatning till Qwen3.8-Omni-Flash till cirka 0,20 dollar, ned från 3,27 dollar jämfört med föregående generation. Att generera fyrtio sekunder 720p-video med Gemini Omni 1.1 Flash till Googles publicerade 0,10 dollar per sekund kostar 4,00 dollar, och att ta fram samma fyrtio sekunder i 360p landar nära 1,20 dollar enligt Googles ramverk med en tredjedels kostnad. Båda uppsättningarna siffror är leverantörsrapporterade och ingen av dem har reproducerats oberoende. Den användbara slutsatsen är inte vilket tal som är mindre, utan att analysera en timme filmmaterial och generera fyrtio sekunder av det ligger i samma storleksordning – vilket är den verkliga anledningen till att en produktionspipeline som gör båda behöver en kostnadsmodell, inte en vinnare.

Det är också argumentet för att hålla de två på en och samma nyckel i stället för två avtal. Ingen av omni-modellerna går att routa via OrcaRouter i dag: Qwen3.8-Omni-Flash körs endast på Alibabas egna plattformar, och Google har inte öppnat Omni-video-API:et för tredjepartsroutning, så vi hostar ingen av dem och tänker inte låtsas något annat. Det som är live i vår katalog är varje familjs syskon – Qwen3.8-Flash och Gemini 3.8 Flash – båda anropbara i dag via en slutpunkt till leverantörens listpris med 0 % påslag, vilket gör att ett A/B-test mot endera leverantörens egna siffror är en fråga om en konfigurationsändring snarare än en andra integration.

A headless screenshot of the OrcaRouter model page for Gemini 3.8 Flash at www.orcarouter.ai/models/google/gemini-3.8-flash, showing the model header, the input-modality and capability row (text, image, video, audio, tools, JSON, reasoning), the published pricing and the p50 TTFT figure.

Där var och en vinner – sagt rakt ut

Qwen3.8-Omni-Flash vinner på allt som mäts i timmar av indata: mötestranskribering och diarisering, sammanfattning av långa inspelningar, ljudtung agentisk verktygsanvändning och kostnad per timme bearbetad media. Dess leverantörsrapporterade ljudresultat är starka, och dess svaghet ligger där modellen aldrig var avsedd — de resonemangstunga resultattavlorna, där de första tredjepartskörningarna placerade den i 28:e percentilen för resonemang med en hastighetssiffra i 21:a percentilen, på ett urval som är litet nog att siffrorna bör behandlas som en uppmaning att testa snarare än en dom.

Gemini Omni 1.1 Flash vinner på output: generering av tagningar med synkroniserat ljud, kontinuitet över längre scener, styrning på bildrutenivå och den 4K-finish som en leveranspipeline helt enkelt kan kräva. Dess fördel är inte en benchmark-poäng — det är att den andra modellen inte kan göra jobbet alls. Där den är svagare är allt som kräver att hålla en timmes kontext, eftersom den inte är byggd för det.

Beslutet, och det man bör hålla ögonen på

Om du väljer mellan dem är frågan vilken halva av pipelinen som saknar täckning. Ett team som redan genererar video och behöver förstå långa inspelningar bör testa Qwen3.8-Omni-Flash på sitt eget ljud den här veckan; ett team som analyserar media och behöver producera det bör testa Gemini Omni 1.1 Flash. Ett team som behöver båda tittar på två leverantörer, två faktureringsmodeller och två integrationer, vilket är situationen där ett enda routinglager slutar vara en bekvämlighet och börjar vara det som håller kostnadsmodellen begriplig.

Två saker skulle förändra den här bedömningen. En oberoende utvärdering av Qwen3.8-Omni-Flash skulle ersätta varje leverantörssiffra ovan med en jämförbar sådan — ingen finns ännu, och dess frånvaro är den enskilt största luckan i den här jämförelsen. Och en publicerad taxa för 1080p- och 4K-utdata från Google skulle göra beräkningarna för högsta nivån kontrollerbara; i dag cirkulerar dessa siffror bara som marknadsplatsuppskattningar snarare än som Googles egen lista.

A headless screenshot of Google's Gemini API documentation page for Gemini Omni Flash at ai.google.dev/gemini-api/docs/omni, showing the docs navigation, the model identifier gemini-omni-1.1-flash, and the description of its native multimodality and conversational editing.

En avslutande kommentar om inramningen. "Omni" har slutat betyda något exakt – det täcker nu en modell som läser in en timmes mötesljud och en som renderar ett fyrtiosekundersklipp med ljud, och att behandla ordet som en kategori är hur köpare till slut jämför en per-token-avgift med en per-sekund-avgift och drar en slutsats av det. Modellerna är komplement med en smal överlappning, och den korrekta hållningen till båda, fem dagar och fyra veckor efter deras respektive lanseringar, är densamma: mät dem på ditt eget material och håll en andra väg öppen.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen