
Gemini 3.1 Pro vs Qwen3.8-27B: En förhandsvisning sju månader i förväg mot en checkpoint du kan ladda ner
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Den 18 september 2026 började användare på leverantörens eget AI-utvecklarforum rapportera att Gemini 3.1 Pro hade försvunnit från AI Studio-modellväljaren — även betalkonton, oavsett rensad cache och inkognitofönster. Tråden där man bad leverantören säga huruvida det var "en bugg eller avsiktligt" var fortfarande aktiv den 21 september. Det finns ingen avvecklingsnotis, ingen migreringsväg och inget svar från personalen. Under tiden Qwen3.8-27B, som labbet släppte som öppen källkod den 14 augusti under Apache 2.0, kan inte tas ifrån någon som laddat ner den. Den asymmetrin — inte benchmark-klyftan, som är verklig men blygsam — är vad den här jämförelsen faktiskt handlar om, och det är därför de två modellerna egentligen inte konkurrerar om samma plats även om jämförelsetabellerna ställer dem sida vid sida.
Det som följer är en direkt jämförelse av de siffror som finns, där var och en är märkt: Artificial Analysis-siffror från insamlingar gjorda den 23 september 2026, Alibabas eget modellkort, Googles lanseringsinlägg och vår egen routingtelemetri, hållna åtskilda hela vägen. Där inget har mätts säger den här sidan det i stället för att gissa.
Vad som hände den här veckan, och vad det betyder och inte betyder
Rapporterna är specifika och de kommer från Googles eget forum snarare än en konkurrents blogg. En tråd med titeln "Gemini 3.1 Pro saknas i AI Studio sedan 2026-09-18 – bugg eller avsiktligt?" beskriver hur betalande användare förlorar modellen utan tillkännagivande, hur Google One-supporten erbjuder irrelevanta felsökningssteg och hur Googles statussida inte visar något fel. En andra tråd, "Gemini 3.1 Pro Preview-modellen är inte tillgänglig i AI Studio för att bygga app", samlar samma klagomål, bland annat från en användare vars kodassistent hade byggts på förhandsversionen i månader och som säger att Flash "gör skräp" i deras kodbas.
Tre ärliga förbehåll. Det rör sig om ett försvinnande från utvecklarkonsolen, inte ett bekräftat API-avbrott: Gemini 3.1 Pro finns fortfarande listad och routbar i vår egen katalog, där den hanterade 94,7 miljoner tokens under de senaste sju dagarna. Det är användarrapporterat – Google har inte sagt något, så ingen utanför Google kan skilja en "tyst utfasning" från ett "kapacitetsproblem" från en "konsolbugg". Och tidpunkten är inte smickrande med tanke på att den här modellen har varit i förhandsversion sedan den 19 februari 2026 – sju månader, utan att något GA-datum har publicerats, medan Google släppte en stege av Flash-modeller under den. Separat avvecklade GitHub Copilot Gemini 3.1 Pro den 1 september 2026 med 30 dagars varsel, vilket är en annan och orelaterad händelse, men den pekar åt samma håll: en förhandsversionsendpoint utan GA-åtagande är ett beroende som du har rätt att vara nervös över.
Ett tal från vår sida är värt att ställa bredvid den kontexten, eftersom vi inte kan förklara det och hellre säger det. Vår sjudagarstelemetri för katalogposten Gemini 3.1 Pro visar en felfrekvens på 80,5 %; de närliggande modeller vi kontrollerade samma morgon – Qwen3.8-Max, Claude Fable 5.1 – ligger på 5,9 % och 6,9 %. Vi vet inte om det är samma problem som forumet rapporterar, en dålig vecka för en upstream-leverantör eller en artefakt i instrumenteringen. Se det som ett skäl att köra en kanariekörning innan du committar, inte som en dom över modellen.
Samma måttstock, två olika resultat
Det här är delen som de flesta jämförelsesidor gör fel på, så den är värd att hantera noggrant. Artificial Analysis poängsätter båda dessa modeller på Intelligence Index v4.3.2. Vi hämtade båda sidorna den 23 september 2026, och båda har samma revision – så till skillnad från de flesta indexpåståenden mellan modeller är den här från samma ögonblicksbild och gapet är verkligt.
• Qwen3.8-27B (xhigh) — Intelligensindex 33,7
• Gemini 3.1 Pro Preview — Intelligensindex 29.7
Qwen leder med fyra poäng på den nuvarande måttstocken. Den svårare frågan är vad det betyder, för måttstocken själv har förändrats minst tre gånger i år. I februari publicerade Artificial Analysis en artikel som kallade Gemini 3.1 Pro Preview ”den nya ledaren inom AI”, fyra poäng före Claude Opus 4.6, och samtida pressrapportering uppgav en poäng på 57 på det som då var Index v4.0. På v4.3.2 är den 29,7. Artificial Analysis tillkännagav v4.3 den 7 september 2026, fyra dagar efter v4.2, och revisionen bytte ut Terminal-Bench 2.1 mot det mycket svårare Terminal-Bench 4.0 med 66 uppgifter och ersatte τ³-Banking med AutomationBench-AA. Gemini 3.1 Pros styrkor i februari låg i utvärderingar som det nya indexet tog bort eller viktade om. Så: modellen blev inte sämre, provet blev det. Men om du väljer en modell i dag är dagens siffra den du faktiskt kan agera utifrån, och dagens siffra gynnar Qwen.
Där de två genuint går isär
Aggregerade poäng döljer skillnadens form, och formen är den användbara delen. Varje siffra nedan kommer från samma fångst från den 23 september av Artificial Analysis v4.3.2-sidor för båda modellerna, på samma revision.
• Resonemang och kunskap — Gemini leder tydligt. GPQA Diamond 94,1 mot 90,5; Humanity's Last Exam 47,0 mot 33,9; SciCode 58,7 mot 46,6; CritPt 17,7 mot 5,4.
• Verkliga yrkesuppgifter – Qwen leder, och med stor marginal. GDPval normaliserat 45,4 % mot 13,8 %.
• Agentisk bankverksamhet och transaktioner – Qwen leder. τ-Banking 48,0 mot Geminis 21,4.
• Agentisk verktygsanvändning på ett allmänt benchmark — Gemini leder där Qwen inte mättes. τ²-Bench 95,6 för Gemini; det finns ingen siffra för Qwen3.8-27B.
• Terminalarbete – jämnt, och båda dåliga på det nya benchmarket. Terminal-Bench 2.1: Qwen 79,8, Gemini 73,8. Terminal-Bench 4.0: Qwen 5,6 %, Gemini 4,0 % – båda ensiffriga.
• Kalibrering – den skarpaste divergensen på någon av sidorna. På AA-Omniscience får Gemini 31,9 med 54,9 % träffsäkerhet och en hallucinationsfrekvens på 50,9 %; Qwen får −10,0 med 15,6 % träffsäkerhet och en hallucinationsfrekvens på 30,3 %. Gemini vet mer och hittar på saker i mer än hälften av fallen; Qwen avstår ofta från att svara och hallucinerar i ungefär en tredjedel av de svar den faktiskt ger.
• Lång kontext – helt jämnt på återkallning i lång kontext, 82,0 vardera. Vid multimodal återkallning i lång kontext: Qwen 21,7 % mot Gemini 15,6 %.
Läs posterna för ”ej uppmätt” som de är. Gemini har inget publicerat normaliserat GDPval-AA-värde mot Qwens 45,4 %, och Qwen har inga värden för τ²-Bench, IFBench, Terminal-Bench Hard eller ITBench-SRE mot Geminis 77,1, 53,8 och 30,3. Var och en av dessa luckor är en plats där en sammanfattningstabell i tysthet skulle ha planterat en vinnare.

Divergensen som avgör budgetar: samma kostnad att driva indexet
Qwen3.8-27B är dramatiskt billigare per token. Enligt de marknadssiffror som Artificial Analysis publicerar kostar den $0,50 per miljon input och $3,00 per miljon output med 80 % cacherabatt och en blandad 7:2:1-taxa på $0,47. Gemini 3.1 Pro Preview kostar $2,00 och $12,00 — fyra gånger inputpriset och fyra gånger outputpriset — med 90 % cacherabatt och en blandad taxa på $1,74.
Sedan kommer siffran som ingen trycker: Artificial Analysis egen redovisning sätter kostnaden för att köra hela Intelligence Index till $1 310,21 för Gemini 3.1 Pro Preview och $1 335,92 för Qwen3.8-27B. Qwen är inte billigare att köra. Det är väldigt lite dyrare, eftersom det tar längre tid att nå dit. Av Qwens utdatakostnad utgjorde $512,36 resonemangstoken mot $82,51 faktiskt svar; av Geminis utgjorde $691,82 resonemang mot $113,08 svar. Priset per token är en taxa, inte en räkning.
Ytterligare två prisfakta som jämförelsetabeller utelämnar. För det första är priset för Gemini 3.1 Pro trappstegsbaserat efter storleken på varje begärans indata: 2,00/12,00 USD upp till 200K indatatoken, därefter 4,00/18,00 USD däröver, där cacheläsningar dubbleras från 0,20 till 0,40 USD. Kontextfönstret på en miljon token är verkligt, men de sista 800 000 tokenen i det kostar dubbelt. För det andra: vår egen katalogpost för Qwen3.8-27B – serverad i block-FP8, vision tower i full precision – anger 0,40 USD i indata och 4,21 USD i utdata, vilket är billigare på indata och dyrare på utdata än marknadssiffran ovan, och publicerar ingen taxa för cachade token alls. Olika leverantörer, olika uppdelning. Kontrollera vilken taxa du faktiskt kommer att debiteras.
Båda modellerna är nåbara genom en enda OrcaRouter-nyckel till leverantörens listpris med 0 % påslag, så en ändring av leverantörspriset landar på vår sida samma dag i stället för efter en omprissättningscykel — vilket spelar större roll än vanligt när en av de två har en nivågräns som ligger vid 200K tokens.
Latens: den snabbaste första token tillhör den långsammare modellen
Det här är det mest missvisande sifferparet i hela jämförelsen, och det är det som en läsare med störst sannolikhet kommer att agera felaktigt utifrån.
• Tid till första chunk — Qwen 4,04 s mot Gemini 28,37 s. Qwen verkar sju gånger snabbare.
• Tid till det faktiska svaret — Gemini 28,37 s mot Qwen 52,52 s. Gemini vinner med ungefär 1,8 gånger, eftersom Qwen lägger 48,48 sekunder på att tänka mellan den första chunken och den första svars-tokenen.
• Utdatashastighet — Gemini 116,5 tokens per sekund mot Qwen 41,3. Gemini är 2,8 gånger snabbare när den väl börjar skriva, mot en jämförelsemedian som Artificial Analysis anger till 95,4 tokens per sekund. Qwens egen sida kallar den ”anmärkningsvärt långsam”.
Om din produkt streamar en första token till en användare, är Qwens framhävda latens en lögn du kommer att berätta för dig själv en gång. Om din produkt väntar på ett komplett svar, är Gemini den snabbare modellen. Båda siffrorna är mätningar från Artificial Analysis; båda togs vid Qwens xhigh-ansträngningsinställning, vilket är modellkortets standard.
Den standardinställningen är ett aktuellt klagomål bland utövare, och modellkortet erkänner det delvis. Qwen3.8-27B exponerar enreasoning_effort-parameter med tre nivåer — xhigh (standardinställningen, ”för komplexa uppgifter som kräver noggrann analys”), medium och low. Community-inlägg fram till september rapporterar att xhigh ger upphov till mycket långa tankefaser och rekommenderar att sänka till medium eller low och sätta ett tak för resonemangsbudgeten. Alibabas eget kort varnar för att sänkt ansträngning i agentiskt arbete med flera turer ”inte alltid minskar den totala tiden för att slutföra uppgiften” — vilket är en uppriktig sak för ett modellkort att säga och en varning om att den uppenbara lösningen inte alltid är lösningen.
Kontext: 1M vs 262K, och vad som faktiskt får plats
Gemini 3.1 Pro har ett kontextfönster på 1 000 000 token och en maximal utdata på 65 536 token. Qwen3.8-27B har 262 144 token inbyggt, utökningsbart till 1 000 000 med YaRN-skalning, med separata budgetar rekommenderade inom det: resonemangsinnehåll på upp till 262 144 och ett slutligt svar på upp till 131 072.
Två ärliga fotnoter. Artificial Analysis specifikationstabell listar Qwens fönster som 256 000, medan deras egen FAQ-text säger 260K och modellkortet säger 262 144 – det är avrundningsskillnader för samma siffra, men citera 262 144 eftersom det är vad kortet säger. Och utökningen till 1M är en skalningsteknik, inte samma sak som ett inbyggt fönster på en miljon token: återkallning i lång kontext vid 1M på en YaRN-utökad modell är inte vad siffran 82,0 AA-LCR mäter. Ingen har publicerat en återkallningspoäng för 1M-kontext för Qwen3.8-27B. Behandla Geminis fönster som det som har uppmätt beteende vid full längd och Qwens som det du bör testa själv innan du designar runt det – och kom ihåg att över 200K indatatoken fördubblas Geminis pris.
Agentiskt arbete och verktygsanrop
Det här är där jämförelsen är genuint oavgjord, och där en konstruerad vinnare skulle vara enkel och fel. Qwen3.8-27B har uppmätta agentiska poäng som Gemini saknar, och vice versa.
Qwens argument vilar på en stark oberoende siffra och en stark leverantörssiffra. Den oberoende siffran är τ-Banking på 48,0 mot Geminis 21,4 – mer än dubbelt så högt, på samma revision, i ett benchmark för verktygsanvändning i flera steg i en bankmiljö. Leverantörssiffran är Alibabas eget kort, som listar OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9, CoWorkBench 70,7, JobBench 33,4 och Agents' Last Exam 20,4 Pass@1. Det är Alibabas utvärderingar, inte omkörda av någon annan, och de ligger i exakt de kategorier där det oberoende uppmätta GDPval-resultatet (45,4 % normaliserat mot 13,8 %) pekar i samma riktning.
Geminis argument är att det har det enda höga absoluta agentiska värdet i jämförelsen – τ²-Bench 95,6 – och Qwen har inget τ²-Bench-resultat alls. Det har också IFBench 77,1 för instruktionsföljning, ännu en lucka på Qwens sida. Och det har ett sju månader långt produktionsrekord som ett fem veckor gammalt open weights-släpp inte har.
Tiebreakern är inte en poäng, den är din topologi. Qwens agentiska fördel mäts på benchmarks där modellen arbetar inuti ett stort, redan befintligt mjukvarusystem som den inte har designat. Geminis mäts på benchmarks där modellen måste följa instruktioner exakt under lång tid. Det är olika färdigheter, och båda är verkliga.

Kodning
Kodning delar sig på samma sätt, vilket är anledningen till att "vilken som är bättre på kod" inte har något entydigt svar här. Gemini leder den vetenskapliga beräkningsdelen — SciCode 58,7 mot 46,6 — och dess AA Coding Index på 68,8 på vår katalogsida ligger inom ett avrundningsfel från Qwens 68,1, väl inom vilket konfidensintervall som helst som är värt att citera. När det gäller agentiskt terminalarbete ligger de två nära varandra på det äldre riktmärket, Qwen 79,8 mot Gemini 73,8 på Terminal-Bench 2.1, och går inte att skilja på det nyare, där båda faller till ensiffriga tal.
Alibabas modellkort hävdar mycket mer – SWE-bench Pro 61,7, LiveCodeBench v6 90,3, QwenSWEBench 79,0 – men de är rapporterade av leverantören, och i en fotnot på modellkortet står det att SWE-bench Pro och QwenSWEBench kördes i Claude Code-testramverket, vilket inte är det testramverk som en konkurrents siffra skulle ha använt. Det säkra påståendet är att på det enda kodningsbenchmark där båda labbarnas modeller mättes av en tredje part skiljer de två sig med fyra punkter på Terminal-Bench 2.1 och med 1,6 punkter på Terminal-Bench 4.0, och båda är dåliga på den svårare.
Öppna vikter mot en förhandsvisningsslutpunkt
Detta är den axel på vilken de två inte alls är jämförbara, och det är den med störst praktisk konsekvens.
Qwen3.8-27B är Apache 2.0, 27B täta parametrar, 64 lager, med en hybrid av Gated DeltaNet linjär attention och full attention i ungefär 3:1-förhållande — designen som gör ett 262K-fönster överkomligt att köra som tjänst. Den körs. Kvantiserad till 4 bitar får den plats i ungefär 17 GB, vilket motsvarar en konsument-GPU; ett helt komprimeringsekosystem växte fram kring den inom fem veckor, från Unsloths Dynamic V3-kvantiseringar, inklusive en 1-bitarsversion som Unsloth säger körs i 8 GB vid omkring 77 % av den ursprungliga noggrannheten, till PrismMLs Ternary Bonsai 2 27B i mitten av september. Du kan finjustera den, du kan granska den och du kan köra den på en bärbar dator med nätverket urkopplat.
Gemini 3.1 Pro är en sluten förhandsvisnings-endpoint, sju månader gammal, utan GA-datum, ett modellkort som uttryckligen varnar för att förhandsvisningar kan sakna den stabilitet, tillgänglighet och support som en stabil version har, och — sedan den här veckan — en utvecklarkonsol som den tycks ha lämnat i tysthet. Du kan inte ladda ner den, du kan inte låsa en version, och du kan inte redundansväxla till dig själv.
Om du vill ha det ärliga routing-svaret i stället för en dom: förekomsten av den öppna checkpointen är det som gör Gemini-beroendet överlevnadsbart. Sätt Qwen3.8-27B bakom en lokal eller självhostad väg som fallback, behåll Gemini 3.1 Pro på den primära vägen för det resonemangstunga arbete som den är mätbart bättre på, och sätt båda bakom en enda endpoint med automatisk failover så att ett tyst försvinnande från någon annans konsol är en incident som ditt routinglager absorberar i stället för ett avbrott som dina användare ser. Det är inte en säljpitch för en produkt – det är den enda konfigurationen där veckans nyheter inte kostar dig en helg.
Välj Gemini 3.1 Pro om
• Ditt svåraste arbete är kunskapsintensivt resonemang snarare än verktygsanvändning över långa tidshorisonter – det leder GPQA Diamond med 94,1 mot 90,5, Humanity's Last Exam med 47,0 mot 33,9, SciCode med 58,7 mot 46,6 och CritPt med 17,7 mot 5,4.
• Du behöver verkligt långa indata. Ett uppmätt fönster på en miljon token, med återkallningsbeteende som testats ingående, slår ett 262K-fönster som utökats med teknik — förutsatt att du kan leva med att priset fördubblas efter 200K indatatoken.
• Tid till fullständigt svar spelar större roll än tid till första token, och du vill ha 116,5 tokens per sekund i stället för 41,3.
• Du behöver bred multimodalitet i dag: ljud-, fil-, bild-, text- och videoindata mot Qwens text, bild och video.
• Du är villig att acceptera förhandsgranskningsrisk, och du har en reservlösning som du kontrollerar.
Välj Qwen3.8-27B om
• Dina agenter arbetar i stora befintliga system – τ-Banking 48,0 till 21,4 och GDPval 45,4 % till 13,8 % normaliserat är de två största fördelarna med en enskild modell någonstans i den här jämförelsen.
• Du behöver ett svar som är ärligt snarare än självsäkert. En hallucinationsfrekvens på 30,3 % jämfört med Geminis 50,9 % är en annan typ av produkt.
• Licensiering eller krav på datahemvist utesluter ett stängt API, eller så behöver du finjustera på dina egna data.
• Du vill ha en räkning per token som är en fjärdedel av Geminis och accepterar att du lägger skillnaden på tanketokens — indexet kostar lika mycket att köra på båda.
• Du är beredd att justera ned reasoning_effort från dess xhigh-standardvärde i stället för att leverera det som det är.
Vad vi inte kunde verifiera
För protokollet, och eftersom en jämförelsesida bara är så bra som sina tomrum: ingen oberoende utvärdering har publicerats för Qwen3.8-27B vid reducerad resonemangsansträngning, så dess avvägning mellan hastighet och kvalitet vid medel och låg är omätt. Ingen återkallningspoäng för lång kontext finns för den YaRN-utökade 1M-konfigurationen. Gemini 3.1 Pro har ingen publicerad normaliserad GDPval-AA-poäng, och Qwen3.8-27B har ingen för τ²-Bench, IFBench eller ITBench-SRE. Och ingen — inklusive Google — har sagt varför Gemini 3.1 Pro lämnade AI Studio-väljaren den 18 september. Vi kommer att uppdatera den här sidan när något av detta ändras.

Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
