
Mercury 2.5 Preview vs Gemini 3.1 Pro: Två förhandsversioner, sex månader emellan
- googleNYGoogle: Gemini 3.8 Flash2026-09-0259Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0258Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0166Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
Båda modellerna i den här matchningen bär ordet "preview" i sina namn, och där slutar likheterna. Mercury 2.5 Preview och Gemini 3.1 Pro är båda resonemangsmodeller som du kan anropa via ett API idag, men de är förhandsversioner i motsatta ändar av sina liv. Gemini 3.1 Pro, flaggskeppsmodellen för resonemang, har varit i förhandsversion sedan 19 februari 2026 — sex månader av oberoende utvärderingar, offentliga leaderboard-placeringar och produktionstrafik bakom sig, med ett Artificial Analysis Intelligence Index på 57 vid lanseringen, multimodal input över text, bild, ljud och video, en kontext på 1M-token, och ett pris på $2.00 / $12.00 per miljon token. Mercury 2.5 Preview, Inceptions diffusions-LLM som släpptes den 31 augusti 2026, är två dagar gammal: en textbaserad modell med en kontext på 256K, ett påstått 1 107 token per sekund, ett listpris på $0.20 / $0.75 (cirka $0.04 / $0.15 med rabatt till och med 8 september), och inte ett enda oberoende riktmärke. Att kalla dem båda för "previews" döljer den verkliga frågan, nämligen hur mycket ett sex månader långt försprång med bevis är värt jämfört med ett fundamentalt snabbare sätt att generera text.
Vad varje modell faktiskt är
Gemini 3.1 Pro är ett slutet, multimodalt, generellt reasoning-flaggskepp. Den läser text, bilder, ljud och video, hanterar ett kontextfönster på 1M tokens med ett utdatatak på 64K och justerar sitt resonemangsdjup dynamiskt — leverantören beskriver en fyrnivåig resonemangsintensitet som skalar med uppgiftens komplexitet. Lanseringssiffrorna — ARC-AGI-2 på 77,1 %, GPQA Diamond på 94,3 %, SWE-bench Verified på 80,6 %, Terminal-Bench 2.0 på 68,5 % — är leverantörsrapporterade, men de bygger på sex månader av oberoende granskning, inklusive en ny mätning av Artificial Analysis på en strängare indexskala där modellen landar runt 46,5. Den nya mätningen är precis vad en mogen modell förtjänar: den har testats tillräckligt hårt för att indexet ska bli svårare runt den. Mercury 2.5 Preview är en diffusionsmodell — den genererar och förfinar tokens parallellt i stället för en i taget — med justerbart resonemang, parallella verktygsanrop och schemaanpassad JSON, byggd för de latensackumulerande arbetsbelastningar som Inception namnger: sökagenter, röstpipelines, kodningssubagenter. Alla kvalitetspåståenden som är kopplade till den, inklusive ett hopp på över tio poäng jämfört med Mercury 2, är leverantörens egna, och ingen tredje part har mätt den.

Spec-kontrast
• Pris — Mercury 2.5 Preview: $0.20 / $0.75 per 1M in/ut, ~$0.04 / $0.15 introduktionspris till och med 8 sep. Gemini 3.1 Pro: $2.00 / $12.00 per 1M, trappas upp till $4.00 / $18.00 över 200K inmatning.
• Kontext / utdata — Mercury 2.5 Preview: 256K kontext. Gemini 3.1 Pro: 1M kontext, 64K max utdata.
• Inmatningar — Mercury 2.5 Preview: endast text. Gemini 3.1 Pro: text, bild, ljud, video, fil.
• Arkitektur — Mercury 2.5 Preview: diffusion LLM, parallell tokengenerering. Gemini 3.1 Pro: autoregressiv, dynamiskt resonemangsdjup.
• Hastighet — Mercury 2.5 Preview: 1 107 tokens/sek enligt uppgift. Gemini 3.1 Pro: inget jämförbart rubrikanspråk.
• Bevis — Mercury 2.5 Preview: endast leverantörsrapporterad. Gemini 3.1 Pro: AA Index 57 vid lansering (46.5 i nyare skala) plus en lång oberoende utvärderingshistorik.

Multimodalitetsgapet är den avgörande skillnaden.
För de flesta användningsfall avgörs den här jämförelsen redan innan prissättning eller benchmarks kommer in i bilden, eftersom Mercury 2.5 Preview inte kan se. Gemini 3.1 Pro läser skärmavbilder, diagram, ljud och video – det är modellen du riktar mot en PDF, en graf, en mötesinspelning eller ett användargränssnitt när du vill ha ett svar om något som inte redan är text. Mercury 2.5 Preview är utformad för endast text; det är en diffusionsbaserad språkmodell som genererar text parallellt och saknar helt bild- och ljudingång. För en dokumenttung applikation, en visionsagent eller en multimodal produkt är Gemini 3.1 Pro den enda kandidaten här, punkt slut. Mercury 2.5 Previews begränsning till endast text är inte en brasklapp i det finstilta – det är den gräns som avgör vilka arbetsuppgifter modellen överhuvudtaget är kvalificerad för.
Sex månaders testning jämfört med två dagar
På tal om bevis är detta ingen tävling, och det är viktigt att säga rakt ut varför. Gemini 3.1 Pro har granskats av oberoende laboratorier i sex månader; dess poäng har fastställts, mätts om och diskuterats, vilket är vad "trovärdighet" innebär för en modell. Mercury 2.5 Preview har en enda informationskälla — sin tillverkare — och den källan hävdar ett intelligenshopp på över tio poäng jämfört med Mercury 2 samt paritet med den kostnadsoptimerade nivån hos frontlinjen. Båda påståendena kan vara sanna. Ingetdera har bekräftats av någon utanför Inception, och modellen är för ny för att det ska vara något annat än väntat. Asymmetrin är inte att den ena är bättre; den är att den ena är kännbar och den andra ännu inte är det.
Där Merkurius hastighet faktiskt vinner
Det ärliga fallet för Mercury 2.5 Preview är snävt, textbaserat och verkligt. Parallell token-generering ändrar latensmatematiken på ett sätt som ingen autoregressiv modell — inklusive Gemini 3.1 Pro — kan följa, eftersom en autoregressiv modell är seriell till sin konstruktion. För en röstpipeline är ironin att in- och utdata är ljud, men tänkandet däremellan är text: ett snabbt textresonemangslager är precis vad som får en röstagent att kännas responsiv. För en sökagent som gör upprepade verktygsanrop, och för en kodningssubagent som avfyrar många små kompletteringar per uppgift, ackumuleras per-anrops latens till upplevd hastighet. Till introduktionspriset — $0,04 in, $0,15 ut — är Mercury 2.5 Preview ungefär 80 gånger billigare än Gemini 3.1 Pros standardpris för utdata, vilket gör den inte bara snabbare utan också till en annan kostnadsklass för högkvalitativ textresonemang. Haken som måste följa med var och en av dessa meningar: hastigheten är påstådd, kvalitetspariteten är påstådd, och ingen oberoende mätning finns.
Prissättning: Geminis premium för lång kontext kontra Mercurys teaser
Gemini 3.1 Pros prislista har en detalj som är värd att känna till innan du jämför huvudsiffrorna: förfrågningar som passerar 200K inmatningstokens stiger från $2.00 / $12.00 till $4.00 / $18.00 per miljon. På en modell med 1M-kontext är den premien för lång kontext inte ett undantagsfall – det är priset för att faktiskt använda det fönster som modellen är känd för. Mercury 2.5 Preview har inget sådant steg, och dess 256K-kontext kommer sannolikt inte att nå långkontext-området särskilt ofta. Men Mercurys låga pris är ett lockbete med utgång den 8 september, medan Geminis är ett stabilt publicerat pris. När du jämför, jämför Mercurys listpris på $0.20 / $0.75 mot Geminis standardnivå, inte den rabatterade siffran – rabatten är incitamentet att testa, inte priset att planera utifrån.
Routningsbeslutet
Båda modellerna kan dirigeras idag, och det förändrar hur du bör behandla var och en. Gemini 3.1 Pro finns på OrcaRouter som google/gemini-3.1-pro-preview, till leverantörens listpris som förmedlas vidare med 0 % påslag, så standard- och långkontextnivåerna kostar exakt vad leverantören publicerar, tillsammans med över 200 andra modeller på en enda API-nyckel. En preview-märkning är precis den typ av sak man bör dirigera runt snarare än satsa på — modellsidans panel för felfrekvens finns där av en anledning, och automatisk failover innebär att ett försämrat preview-svar dirigeras till en andra leverantör utan en kodändring. Mercury 2.5 Preview finns ännu inte på OrcaRouter; Inception levererar den genom sitt eget API och flera tredjepartsplattformar. En modell som är två dagar gammal och som du ännu inte kan lägga bakom failover är en testkandidat, inte ett produktionsberoende. Den dag en leverantör listar den gäller samma vidareförmedling, och introduktionsrabatten hamnar här samma dag — vilket är när den här jämförelsen blir en dirigeringsregel i stället för ett beslut.
Den ärliga bedömningen är att dessa två förhandsversioner svarar på olika frågor. Gemini 3.1 Pro svarar på "vilken modell ska jag bygga min produkt på idag" — den är multimodal, har lång kontext, är oberoende testad och stabil, till ett pris som återspeglar allt detta. Mercury 2.5 Preview svarar på "hur snabbt kan textresonemang fysiskt bli" — och dess hastighetsarkitektur är det mest intressanta i modellen, i väntan på att ett oberoende labb bekräftar om kvaliteten som följer med den är verklig. Om din arbetsbelastning är multimodal eller långkontext är valet redan gjort. Om den är textbaserad, latensackumulerande och priskänslig, är Mercury 2.5 Preview satsningen att hålla ögonen på — och 8 september är datumet att mäta det mot.

