Qwen 3.7 Flash: Alibabas Cent-Cheap Vision Model för agenter som faktiskt tittar på skärmar
Guides & Insights

Qwen 3.7 Flash: Alibabas Cent-Cheap Vision Model för agenter som faktiskt tittar på skärmar

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Alibabas Qwen-team har under de senaste två åren släppt en tät rad modeller inom nästan varje tänkbar pris- och kapacitetsklass, och den 27 juli 2026 dök ännu en tyst upp som en kommersiell API-notering: qwen/qwen3.7-flash. Den kom inte med samma fanfarer som en flaggskeppslansering, och Alibaba har inte publicerat någon teknisk rapport, benchmark-svit eller arkitekturdiagram för den. Vad den däremot kom med är en beskrivning som betyder mycket mer för utvecklare än ännu en topplistepoäng: en vision-språk-resonerande modell, ett kontextfönster på 1 miljon token, och ett pris så lågt att det knappt märks som en radpost.

Den kombinationen — billigt, enormt sammanhang och "ser" bilder inbyggt — placerar Qwen 3.7 Flash rakt i en kategori som har blivit en av de mest konkurrenskraftiga och mest användbara på hela modellmarknaden: den lågkostnads multimodala arbetshästen. Dessa är inte modellerna som vinner benchmark-tabeller. Det är modellerna som anropas tio miljoner gånger om dagen i agentloopar, webbläsarautomatiseringspipelines och supportverktyg, eftersom kostnaden vid $0,03 input och $0,13 output per miljon tokens i princip upphör att vara en designbegränsning.

Den här texten är en första titt-förklaring: vad Qwen 3.7 Flash faktiskt är, vad Alibaba har avslöjat (och, viktigt, vad de inte har), hur ekonomin utspelar sig med riktig token-matematik, och var den passar in bredvid resten av Qwen-familjen — inklusive den mycket större Qwen 3.8 och Qwen 3.7 Max — och mot billiga multimodala rivaler som Gemini 3.5 Flash-Lite. Vi går också igenom hur ett routinglager som OrcaRouter behandlar en sådan modell: inte som en hjältemodell, utan som en standardnivå som tyst absorberar merparten av den multimodala trafiken.

Sammanfattning

Qwen 3.7 Flash är en visionspråkmodell från Alibabas Qwen-team, listad under modell-ID qwen/qwen3.7-flash sedan 27 juli 2026. Den är byggd för multimodala agenter, visuell kodning, sökning och dator/UI-interaktion, med påstådda styrkor inom objektigenkänning och rumslig förståelse. Den stöder ett kontextfönster på 1 000 000 token och prissätts till $0,03 per 1M input-token och $0,13 per 1M output-token — bland de billigaste visionskapabla modellerna som finns någonstans. Maximal utdatalängd, exakt parameterantal och arkitektur är inte officiellt offentliggjorda; communitiespekulation pekar på en liten mixture-of-experts-design och en möjlig föregångare till en open-weight Qwen 3.7-utgåva, men det är obekräftat. Det är en distinkt, mindre och billigare modell än både Qwen 3.8 (Alibabas separat annonserade open-weight-flaggskepp med 2,4T parametrar) och Qwen 3.7 Max (det större flaggskeppet i denna generation). Ingen oberoende benchmark-svit — inklusive Artificial Analysis — har betygsatt den ännu, så behandla kvalitetspåståenden som tidiga och obevisade tills tredjepartssiffror finns.

Viktiga slutsatser

• Qwen 3.7 Flash är vision-språk, inte bara text — den är positionerad för multimodala agenter, visuell kodning, sökning och datoranvändningsuppgifter, inte allmän chatt.

• Priset är $0.03/1M inmatning och $0.13/1M utmatningstoken, ungefär i linje med den billigaste nivån av frontier-nära multimodala modeller på marknaden idag.

• Kontextfönstret är 1M tokens, vilket är viktigare för bildtunga och flervarviga agentsessioner än det låter, eftersom bilder och skärmdumpar förbrukar tokens snabbt.

• Listningens prisanteckningar säger att med promptcachning för upprepad kontext kan den effektiva kostnaden bli 60–80 % lägre än listpriset — en meningsfull hävstång för agentloopar som spelar upp samma systemprompt eller skärmbildshistorik.

• Alibaba har inte publicerat maximala utdatatokens, parameterantal eller arkitekturdetaljer; allt mer specifikt du läser på annat håll är slutsatser från communityn, inte uppgifter från leverantören.

• Det är inte Qwen 3.8 (det 2.4T tunga flaggskeppet med öppna vikter) och inte Qwen 3.7 Max (det större stängda flaggskeppet i samma lanseringsvåg) — bortsett från namnsimilariteten är dessa tre olika modeller med tre olika uppgifter.

• Ingen oberoende benchmarkorganisation, inklusive Artificial Analysis, har publicerat poäng för Qwen 3.7 Flash i skrivande stund — kvaliteten är genuint obeprövad utanför leverantörens beskrivning.

Vad Qwen 3.7 Flash egentligen är

Om man bortser från namngivningskonventionen är Qwen 3.7 Flash Alibabas svar på en fråga som varje stort labb nu har ställt: hur ser en modell ut när hela dess designbrief är "hantera visuell, agentisk trafik med hög volym så billigt som möjligt utan att vara oanvändbar"? Google svarade med nivåerna Gemini Flash och Flash-Lite. OpenAI svarade med sina mini- och nano-linjer. Alibabas svar, i denna generation, är Qwen 3.7 Flash.

Den officiella beskrivningen fokuserar på fyra användningsfall: multimodala agenter, visuell kodning, sökning samt dator- eller UI-interaktion. Det är en mycket medveten lista. Det är inte "bra på kreativt skrivande" eller "starkt resonemang inom matematikolympiadproblem" — det är en lista över uppgifter där en modell behöver titta på en skärmbild, en webbsida, en UI-del eller en visuellt renderad koddiff, och sedan agera på den. Alibaba lyfter också fram objektigenkänning och rumslig förståelse som särskilda styrkor, vilket stämmer överens med ramverket för datoranvändning och UI-interaktion: en agent som ska klicka på knappar, läsa layouter eller navigera på en skärm behöver veta var saker finns, inte bara vad de säger.

Det är värt att vara explicit om vad "resonemang" betyder i detta sammanhang. Qwen 3.7 Flash beskrivs som en vision-språk-resonemangsmodell, vilket innebär att den förväntas arbeta igenom flerstegs visuella uppgifter snarare än att bara beskriva en bild eller svara på en enkel uppslagsfråga. Det är skillnaden mellan "beskriv denna skärmdump" och "här är en skärmdump av ett formulär med tre valideringsfel — lista ut vad som är fel och säg vilket fält jag ska åtgärda först."

Specifikationer och det multimodala-agentiska fokuset

Här är den fullständiga listan över vad som faktiskt är bekräftat, jämfört med vad som inte är.

Bekräftat:Tillverkaren är Alibabas Qwen-team. Den är listad under modell-ID:t qwen/qwen3.7-flash, live sedan 27 juli 2026. Den accepterar multimodal indata (vision och språk). Kontextfönstret är 1 000 000 token. Priset är 0,03 USD per 1M inmatningstoken och 0,13 USD per 1M utmatningstoken. Listans egna prisanmärkningar flaggar att prompt-cachning på upprepad kontext kan sänka den effektiva kostnaden med 60–80 % jämfört med listpriset för arbetsbelastningar som återanvänder samma systeminstruktioner eller referensbilder mellan anrop — en detalj som spelar stor roll för agentloopar som skickar om samma skärmbildshistorik eller verktygsschema vid varje tur.

Ej avslöjat:Maximalt antal utdatatokens. Exakt parametrarantal. Arkitektur (tät kontra mixture-of-experts). Träningsdatas sammansättning. Eventuella första parts riktmärkesresultat.

Gemenskapsspekulation (märk den som sådan, för det är allt det är): Med tanke på namnet "Flash", den aggressiva prissättningen och mönstret som Alibaba har följt med tidigare Qwen-generationer, misstänker vissa observatörer att Qwen 3.7 Flash använder en liten mixture-of-experts-arkitektur optimerad för låg beräkningskostnad per token, och att den kan vara ett förhandsvisnings- eller destillationssteg inför en eventuell open-weight-utgåva av Qwen 3.7, vilket speglar hur tidigare Qwen-"flash"- eller "turbo"-varianter ibland föregick bredare öppna utgåvor. Inget av detta är bekräftat av Alibaba. Behandla det som informerad gissning, inte fakta, tills en officiell teknisk rapport eller modellkort säger annat.

Avsaknaden av en publicerad maxoutput-siffra är värd att flagga för alla som bygger mot denna modell: om ditt användningsfall producerar långa strukturerade utdata (stora JSON-nyttolaster, generering av flera filer, långa transkript), testa den faktiska utgångstaket empiriskt innan du förbinder dig till det i produktion, eftersom du inte kan kontrollera dokumentationen för en siffra som inte finns där.

Prissättningsexempel: Vad Detta Faktiskt Kostar

Så små tal är lätta att vifta bort, så låt oss göra aritmetiken ordentligt.

Vid $0.03 per 1M inmatningstokens och $0.13 per 1M utmatningstokens kostar ett enskilt anrop med 2,000 inmatningstokens (en skärmbild av hyfsad storlek plus en kort instruktion) och 300 utmatningstokens (ett strukturerat svar): 2,000/1,000,000 × $0.03 = $0.00006 för inmatning, plus 300/1,000,000 × $0.13 = $0.000039 för utmatning. Totalt: ungefär $0.0001 per anrop — en hundradels cent.

Skala upp det till volym. Kör 1 miljon sådana anrop – en rimlig daglig last för en medelstor agentisk produkt som utför skärmbildsanalys eller UI-tillståndskontroller – och du hamnar på: 1,000,000 × 2,000 = 2 miljarder inmatningstokens × $0.03/1M = $60, plus 1,000,000 × 300 = 300 miljoner utdatatokens × $0.13/1M = $39. Totalt: cirka $99 för en miljon vision-agentanrop. Redan innan du lägger till prompt-cachning (som listans anteckningar antyder kan minska detta med 60–80 % för arbetsbelastningar med återkommande kontext), är det en summa som de flesta team kan godkänna utan ett budgetmöte.

Jämför nu ett tyngre scenario: en datoranvändningsagent som håller en löpande kontext på 50 000 token (skärmbilder, åtgärdshistorik, verktygsresultat) och genererar 500 tokens åtgärd per steg, körs 100 000 gånger om dagen. Inmatningskostnad: 100 000 × 50 000 = 5 miljarder tokens × $0,03/1M = $150/dag. Utmatningskostnad: 100 000 × 500 = 50 miljoner tokens × $0,13/1M = $6,50/dag. Det är ungefär $156/dag, eller cirka $4 700/månad, för en ganska aggressiv långkontext agentisk arbetsbelastning – och det är innan någon cacheringsrabatt på de upprepade delarna av den 50 000-kontexten, vilket i en datoranvändningsloop (samma systemprompt, samma verktygsdefinitioner, överlappande skärmtillstånd) är precis den typen av arbetsbelastning som prompt caching byggdes för.

Genomgångar av verkliga scenarier

Högvolyms visionuppgifter

Föreställ dig en produktkatalogiseringspipeline som måste klassificera, tagga och extrahera attribut från några hundra tusen produktbilder per dag — det är precis den typen av arbetsbelastning där kostnaden per token multipliceras tillräckligt snabbt för att spräcka budgeten på en medelklass visionsmodell men förblir bekvämt överkomlig med Qwen 3.7 Flashs prissättning. Objektigenkänning och rumslig förståelse, de två förmågor som Alibaba uttryckligen nämner, kartlägger direkt på "vad finns i den här bilden, var är det och vilket skick är det i".

Visuell kodning

"Visuell kodning" som ett namngivet användningsfall antyder arbetsflöden som: mata modellen med en skärmdump av ett renderat gränssnitt tillsammans med den underliggande komponentkoden och be den hitta avvikelsen, eller ta en Figma-export och få tillbaka en första implementation. Detta är en uppgiftskategori som specifikt straffar textbaserade kodmodeller – du kan beskriva en layoutbugg i ord, men en modell som faktiskt kan se den trasiga utfyllnaden eller den felaktigt placerade knappen kommer att diagnostisera den snabbare och mer tillförlitligt.

Agentisk / Datoranvändning

Detta är det huvudsakliga användningsfallet. En datoranvändande agent måste titta på en skärm, förstå vad som är klickbart, besluta om en handling och upprepa – ofta under dussintals steg per uppgift. Ekonomin här är brutal för dyra modeller: en 30-stegs webbläsar- eller skrivbordsautomatiseringsuppgift, där varje steg medför en ny skärmdump, kan stapla upp hundratusentals token innan uppgiften är klar. Till frontlinjemodellens prissättning är det verkliga pengar per uppgift; till Qwen 3.7 Flash prissättning, att köra tusentals sådana sessioner om dagen håller sig inom räckhåll för ett litet teams budget.

Visuell sökning — att matcha en bild mot en korpus, verifiera att ett hämtat resultat faktiskt matchar ett referensfoto, eller förankra en sökfråga i en skärmbild av vad användaren tittar på — gynnas av samma kombination av stort sammanhang (för att hålla flera kandidatbilder eller en lång uppsättning hämtade dokument) och låg kostnad per anrop (eftersom sök-och-verifiera-loopar ofta innebär många modellanrop per användarfråga, inte ett).

Hur man får tillgång till och använder Qwen 3.7 Flash

Qwen 3.7 Flash anropas med modellidentifieraren qwen/qwen3.7-flash, och den fungerar med alla OpenAI-kompatibla verktyg — vilket innebär att befintliga chat-completions- eller responses-integreringar kan peka på den med en ändring av modellnamnet och utan omskriven klientkod. Det är också här som ett ruttningslager som OrcaRouter blir praktiskt snarare än teoretiskt: i stället för att hårdkoda en enda modell i varje tjänst låter en enhetlig OpenAI-kompatibel slutpunkt dig sätta en billig, kapabel multimodal modell som din standardnivå för vision- och agenttrafik, och reservera dyrare resonemangsmodeller för den delmängd av förfrågningar som faktiskt behöver dem. För en modell vars hela värdeerbjudande är "mycket billig, ganska kapabel, oprövad i framkanten" är den typen av nivåbaserad ruttning — billig som standard, eskalera vid behov — utan tvekan det rätta sättet att driftsätta den i produktion snarare än att satsa en hel pipeline på en enda overifierad modell.

Standardformatering för multimodala förfrågningar gäller: bildinmatningar tillsammans med text i samma meddelande, stora kontextfönster för sessioner med flera bilder eller flera turer, och fakturering per token som visas tydligt i användningsinstrumentpaneler. Testa den praktiska maxgränsen för utdatalängd för din arbetsbelastning innan du förlitar dig på den, eftersom maxgränsen inte är publicerad.

Ärliga begränsningar och vad som är obekräftat

För att vara rak om vad som verkligen är okänt här: det finns inga oberoende riktmärkesdata för Qwen 3.7 Flash från Artificial Analysis eller någon jämförbar utvärderare i skrivande stund. Allt om dess kvalitet — hur väl den faktiskt presterar inom visuellt resonemang, hur tillförlitlig den är för agentiska flerstegsuppgifter, hur den klarar distraktorer i långa kontextscenarier — stöds för närvarande endast av Alibabas eget positioneringsspråk, inte av en tredje part som kör den genom en standardiserad testsvit. Leverantörsbeskrivning och oberoende verifiering är inte samma sak, och läsare bör väga denna modells förmågor därefter tills sådan verifiering finns.

Utöver benchmarks har Alibaba inte avslöjat arkitekturen, parameterantalet eller maximala utdatalängden. Teorin om en "liten MoE, möjlig föregångare till en open-weight Qwen 3.7" som cirkulerar i communityn är en rimlig gissning baserad på namngivningsmönster och prissättning, men det är spekulation, inte något som Alibaba har bekräftat. Om modelltransparens (publicerad arkitektur, öppna vikter, en teknisk rapport) är ett krav för ditt användningsområde, når Qwen 3.7 Flash för närvarande inte upp till den ribban — det är en sluten, API-only-modell med minimal offentlig dokumentation utöver sin API-lista.

Hur det jämför: Qwen 3.8, Qwen 3.7 Max och billiga konkurrenter

Namngivningen här lurar många, så det är värt att vara precis. Qwen 3.8 är Alibabas separat annonserade open-weight-flaggskepp, som enligt uppgift är byggt kring en design med 2,4 biljoner parametrar — en fundamentalt annorlunda modell med ett annat syfte: en stor, öppen, allmän modell avsedd att konkurrera i frontlinjen, inte en billig multimodal verktygsnivå. Qwen 3.7 Max är det större, förmodligen mer kapabla stängda flaggskeppet inom samma "3.7"-releasevåg — modellen du vänder dig till när en uppgift kräver maximal kvalitet oavsett kostnad. Qwen 3.7 Flash, ämnet för denna artikel, är den tredje och billigaste punkten i den konstellationen: mindre, snabbare, dramatiskt billigare och specifikt inriktad på multimodala agentiska arbetsbelastningar snarare än allmän excellens. Anta inte att förmåga eller beteende överförs mellan dessa tre bara för att två av dem delar ett versionsnummer — de är olika modeller med olika uppgifter.

Mot utomstående konkurrens är den närmaste jämförelsen Googles Gemini 3.5 Flash-Lite, som upptar en liknande nisch: en lågkostnads-, multimodal, högkapacitetsnivå avsedd för exakt den typen av volymarbetsbelastningar som beskrivs ovan. Båda modellerna konkurrerar främst på samma axlar — pris per token, kontextlängd och multimodal hantering — snarare än på råa resonemangsriktmärken, eftersom ingen av dem är positionerad som en frontlinjeresonemangsmodell. Utan oberoende benchmarkdata för Qwen 3.7 Flash är ett direkt kvalitetspåstående mot Gemini 3.5 Flash-Lite inget som denna artikel kan ansvarsfullt göra; vad som kan sägas är att Qwen 3.7 Flashs prissättning är konkurrenskraftig med eller under den nivån, och dess 1M kontextfönster är generöst för en modell i denna kostnadsklass, vilket är precis den typen av gap som gör billiga multimodala nivåer värda att testa empiriskt mot din egen arbetsbelastning snarare än att välja enbart baserat på pris.

FAQ

Vad är Qwen 3.7 Flash?

Det är en vision-språk-resoneringsmodell från Alibabas Qwen-team, byggd för multimodala agenter, visuell kodning, sökning och dator-/UI-interaktion, listad under modell-ID:t qwen/qwen3.7-flash sedan 27 juli 2026.

Hur mycket kostar Qwen 3.7 Flash?

0,03 USD per 1 miljon inmatningstokens och 0,13 USD per 1 miljon utmatningstokens — bland de billigaste visionmodellerna som för närvarande finns tillgängliga, med noteringen att ytterligare rabatter på 60–80 % är möjliga via prompt-cachning vid upprepad kontext.

Vad är kontextfönstret?

1 000 000 tokens.

Är Qwen 3.7 Flash samma som Qwen 3.8?

Nej. Qwen 3.8 är Alibabas separat tillkännagivna flaggskeppsmodell med öppen vikt på 2,4 biljoner parametrar. Qwen 3.7 Flash är en mycket mindre, billigare, sluten multimodal modell med ett annat syfte. De bör inte förväxlas trots att båda kommer från Alibabas Qwen-serie.

Är Qwen 3.7 Flash samma som Qwen 3.7 Max?

Nej. Qwen 3.7 Max är den större flaggskeppsmodellen i samma "3.7"-utgivningsvåg. Qwen 3.7 Flash är den mindre, snabbare och mycket billigare nivån, avsedd för högvolyms multimodala och agentiska uppgifter snarare än maximal utdatakvalitet.

Stödjer Qwen 3.7 Flash bilder?

Ja, det är en vision-språkmodell — den accepterar multimodal (bild och text) input och är specifikt inriktad på visuella uppgifter som objektigenkänning, rumslig förståelse, visuell kodning och dator/användargränssnittsinteraktion.

Vad är den maximala utdatalängden?

Inte officiellt avslöjat av Alibaba. Den som bygger en produktionsarbetsbelastning bör testa den praktiska utmatningstaket direkt istället för att anta en siffra.

Är Qwen 3.7 Flash en mixture-of-experts-modell?

Obekräftat. Vissa i communityn spekulerar att den använder en liten MoE-arkitektur baserat på dess pris- och namngivningsmönster, men Alibaba har inte publicerat arkitekturdetaljer, så detta förblir spekulation snarare än fakta.

Hur jämför den sig med Gemini 3.5 Flash-Lite?

Båda befinner sig i en liknande lågkostnads-, högpresterande multimodal nivå och konkurrerar främst på pris och kontextlängd snarare än på råa resonemangsriktmärken. Det finns ännu inga oberoende riktmärkesdata för att göra en definitiv kvalitetsjämförelse för Qwen 3.7 Flash.

Var kan jag få tillgång till Qwen 3.7 Flash?

Använda modell-ID:t qwen/qwen3.7-flash via valfri OpenAI-kompatibel klient, eller genom ett routningslager som OrcaRouter som kan ställa in det som en standard billig multimodal-nivå tillsammans med andra modeller.

Är Qwen 3.7 Flash bra?

Obevisad oberoende vid tidpunkten för detta skrivande – ingen tredjeparts benchmarkorganisation, inklusive Artificial Analysis, har publicerat poäng för den. Dess värdeerbjudande är pris och kontextstorlek, inte en demonstrerad kvalitetsledning, så det är värt att testa empiriskt mot din specifika arbetsbelastning innan du förbinder dig.

Slutsats

Qwen 3.7 Flash försöker inte vinna en ledartavla, och Alibaba har inte gett någon dokumentationen att kontrollera även om den ville. Vad den försöker göra är att göra vision- och agentarbetsbelastningar — skärmbildsanalys, visuella kodkontroller, datoranvändningsloopar, visuell sökning — tillräckligt billiga så att kostnaden inte längre är anledningen till att du inte bygger funktionen. Till $0,03/$0,13 per miljon tokens med en 1M-tokens kontext, stödjer ekonomin genuint högvolym, alltid-på multimodala agenttrafik på ett sätt som få modeller på någon kvalitetsnivå kan matcha. Haken är ärlighet om luckorna: inga oberoende riktmärken, ingen avslöjad arkitektur eller maximal utmatningslängd, och verklig osäkerhet om hur den står sig mot etablerade billiga konkurrenter som Gemini 3.5 Flash-Lite. Behandla den som ett lovande, extremt prisvärt standardval för multimodala agentarbetsbelastningar värda att testa nu — och håll den tydligt separat i ditt huvud från både Qwen 3.8 och Qwen 3.7 Max, som är olika modeller som löser helt olika problem.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen