Ett hero-titelkort för "Qwen 4 Max vs Gemini 3.1 Pro" med underrubriken "Det oannonserade flaggskeppet mot förhandsvisningen som aldrig tog slut", tre pillerbadges med texten "Förhandsvisning sedan 19 februari 2026", "1 048 576 tokenkontext" och "26,3 % hämtning vid 1M", en sidfotsrad som lyder "Alibaba annonserade 22 september 2026; Google förhandsvisade 19 februari 2026", och OrcaRouter-logotypen i nedre högra hörnet.
Engineering & Research

Qwen 4 Max vs Gemini 3.1 Pro: det oannonserade flaggskeppet mot förhandsvisningen som aldrig tog slut

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

De flesta jämförelser ställer en släppt produkt mot en släppt produkt. Den här är ovanlig: Qwen 4 Max förhandsvisades på Yunqi-konferensen i Hangzhou den 22 september 2026 utan releasedatum, pris eller vikter, och Gemini 3.1 Pro har varit i förhandsversion sedan den 19 februari 2026 och är fortfarande i förhandsversion — sju månader senare, utan att något datum för allmän tillgänglighet har meddelats och utan nedstängningsdatum i sin utfasningstabell. Ingen av modellerna i den här duellen är en färdig produkt. Det är inte ett skäl att hoppa över jämförelsen. Det är själva jämförelsen, och det är det enda hos den som är genuint informativt.

Sju månaders förhandsvisning

En förhandsvisningsetikett ska vara ett kortvarigt tillstånd. Gemini 3.1 Pro har nu behållit den genom tre Flash-släpp från samma labb, inklusive Gemini 3.8 Flash den 2 september 2026, som Google beskriver som sin mest intelligenta Flash-modell. I de oberoende sammanställningarna får den modellen nu högre poäng än 3.1 Pro. Googles Pro-serie har ingen nyare medlem: det finns ingen Gemini 3.8 Pro, och 3.5 Pro-generationen försenades och uppges ha lagts åt sidan. Den praktiska konsekvensen är att modellen som bär Pro-namnet inte längre är den modell som får högst poäng från sin egen leverantör.

Googles egen begränsningstext på katalogposten råder dig att planera för att förhandsversionen fasas ut, vilket är det ärliga sättet att läsa statusen. En förhandsversion utan GA-datum och utan nedstängningsdatum är en modell du kan bygga på men inte planera kring.

Qwen-sidan är en spegelbild med omvänt tecken. Qwen 4 Max är inte i en lång förhandsvisning; den är i förförhandsvisningsstadiet, med inget publicerat alls. De två felmoderna är motsatta: Gemini 3.1 Pro är en verklig slutpunkt vars långsiktiga existens är ospecificerad, och Qwen 4 Max är en specificerad post på färdplanen utan slutpunkt.

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

Jämförelsen, och långkontextsiffran som avgör det

Gemini 3.1 Pros specifikation är offentlig och specifik. Qwen 4 Max är tom. Det som är värt att dröja vid är en rad i Gemini-kolumnen, eftersom det är den sorts siffra som blir citerad och inte borde bli det:

• Status — Gemini 3.1 Pro i förhandsversion sedan 19 februari 2026, jämfört med Qwen 4 Max som annonserades den 22 september 2026 utan datum

• Indatapris — Gemini 3.1 Pro 2,00 USD per 1 miljon tokens upp till en prompt på 200K och 4,00 USD därutöver, jämfört med Qwen 4 Max där priset inte har publicerats

• Pris för utdata — Gemini 3.1 Pro $12.00 per 1 miljon upp till 200 000 och $18.00 däröver, jämfört med Qwen 4 Max, vars pris inte är publicerat

• Cachad indata – Gemini 3.1 Pro $0,20 per 1M vid en cacheläsning, jämfört med Qwen 4 Max som inte har publicerats

• Kontext — Gemini 3.1 Pro 1 048 576 tokens, jämfört med Qwen 4 Max som inte har publicerats

• Utdatatak — Gemini 3.1 Pro 65 536 tokens, mot Qwen 4 Max: ej publicerat

• Modalitet — Gemini 3.1 Pro: inmatning av text, bild, video, ljud och PDF med textutmatning, jämfört med Qwen 4 Max som inte är publicerad

• Resonemangsstyrning – Gemini 3.1 Pro med låg, medel och hög tankenivå, jämfört med Qwen 4 Max som inte har publicerats

• Långkontexthämtning — Gemini 3.1 Pro:s leverantörsrapporterade MRCR v2 vid 84,9 procent i genomsnitt över åtta nålar vid 128K, men 26,3 procent vid den punktvisa inställningen för en miljon token, jämfört med Qwen 4 Max där inget rapporterats

• Leverantörsrapporterade poäng — Gemini 3.1 Pro SWE-bench Verified 80,6 procent, GPQA Diamond 94,3 procent, ARC-AGI-2 77,1 procent, Humanity's Last Exam 44,4 procent utan verktyg, jämfört med Qwen 4 Max där inget rapporterats

• Oberoende poäng — Gemini 3.1 Pro 30 på Artificial Analysis Intelligence Index v4.3.2, jämfört med Qwen 4 Max, där ingen oberoende utvärdering finns

Den där långkontextraden är den man bör ta med sig. Ett kontextfönster på 1 048 576 token är en marknadsföringssiffra; 26,3 procents återvinning vid inställningen en miljon token är vad samma leverantör rapporterar när den mäter den bortre änden av det fönstret. Båda siffrorna kommer från Google, vilket gör gapet till ett uttalande om modellen snarare än om utvärderaren. Om din arbetsbelastning är beroende av att hitta ett faktum begravt nära slutet av en prompt på en miljon token, säger den framhävda kontextsiffran dig ingenting användbart och den här raden säger dig nästan allt.

Indexet rörde sig, modellen gjorde det inte

Gemini 3.1 Pro lanserades den 19 februari 2026 med 57 på Artificial Analysis Intelligence Index, först i fältet. Under indexrevision v4.3.2, publicerad den 19 september 2026, visar den 30. Ingenting hos modellen ändrades mellan dessa två datum. Måttstocken byggdes om, och den byggdes om fyra dagar före Alibabas Qwen 4-tillkännagivande.

Det sammanträffandet är värt mer än själva siffrorna. Tre av de fyra modellerna i den här omgången jämförelser – Gemini 3.1 Pro, Claude Opus 5 och Qwen 3.8-flaggskeppet – har oberoende poäng som förändrades i samma revision, och i varje fall var förändringen tillräckligt stor för att vända en rangordning. Varje jämförelse som skrivs den här månaden och som anger ett enda indexvärde utan att namnge revisionen jämför poäng tagna med olika måttstockar, och felet kommer inte att vara synligt för en läsare.

För Qwen 4 Max är konsekvensen att målet hela tiden förflyttas. När Alibaba till slut publicerar kommer poängen att slå i detta index att vara vad den aktuella revideringen säger den dagen, och revideringen har ändrats minst en gång under den senaste veckan.

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

Vad de operativa siffrorna säger, inklusive den obekväma

Gemini 3.1 Pro kan routas på OrcaRouter som google/gemini-3.1-pro-preview, med märkena Flagship och Featured utan någon förhandsversionsbanner, till Googles listpris på $2.00 och $12.00 per miljon tokens med 0 % påslag. Själva routningen är ärlig — priset på sidan är det pris som Google publicerar. De operativa siffrorna under de sju dagarna fram till den 22 september är också värda att ta med snarare än att hoppa över: en p50-tid till första token på 10,00 sekunder, en utdatahastighet på runt 632 tokens per sekund, och en felfrekvens på 77,5 procent över fönstret. Den felfrekvensen är inte en fotnot. För en förhandsversionsmodell utan GA-datum är den det enskilt mest beslutsrelevanta numret på sidan, och en jämförelse som citerar priset utan den säljer snarare än informerar.

Samma katalog rymmer nästan 200 modeller på en och samma OpenAI-kompatibla endpoint med automatisk failover och en routing-DSL, vilket är mekanismen som gör en felfrekvens som denna överlevbar snarare än fatal: en degraderad leverantörsväg kan flyttas över i stället för att tas ned. Qwen 3.8-familjen – Qwen3.8-Max, Qwen3.8-Flash och Qwen3.8-27B – finns på samma endpoint som Gemini 3.1 Pro Preview, så den substitution som den här artikeln egentligen handlar om, den du kan göra idag, är en ändring av routingprincipen snarare än ett migreringsprojekt. Qwen 4 Max finns inte i katalogen, och ingen Qwen 4-nivå finns där; när en sådan lanseras är det där den skulle dyka upp.

Beslutet, sådant det nu är

Ingen av modellerna här är en produkt du kan förbinda dig till, och det ärliga rådet är att behandla båda därefter. Gemini 3.1 Pro går att anropa i dag till ett publicerat pris med ett publicerat kontextfönster och ett offentligt utvärderingsspår, inklusive hämtningssvagheten vid den bortre änden av det fönstret; den är också en förhandsversion vars leverantör säger åt dig att planera för utfasning, och den ligger på en felfrekvens som skulle vara oacceptabel för ett produktionsberoende. Qwen 4 Max har inga av de problemen eftersom den inte har några av de egenskaperna.

Om du behöver en modell nu står valet inte mellan dessa två. Det står mellan Gemini 3.1 Pro och den Qwen-flaggmodell som redan har släppts, och utifrån tillgängligt underlag är det ett beslut om kvalitet vid hämtning i långa kontexter kontra en indatakostnad på 2,00 USD med publicerade vikter. Om du kan vänta bör du hålla koll på två saker i stället för en: ett modellkort för Qwen 4 Max och ett datum för allmän tillgänglighet för Gemini 3.1 Pro. Det som kommer först visar vilken av dessa två färdplaner Alibaba och Google faktiskt prioriterar.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.