
Dots vs Gemini 3.1 Pro: En agent med ett skrivbord mot en modell med fem sinnen
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 349 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 210 tok/s
- OrcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
The word "multimodal" hides the real difference between these two, so start with what each one does with the world. Gemini 3.1 Pro Preview is Google's flagship reasoning model, released in preview on February 19, 2026: it accepts text, images, audio, video and files as input and returns text, works across a 1,048,576-token context window with up to 65,536 tokens of output, and costs $2.00 per million input tokens and $12.00 per million output tokens below a 200,000-token prompt, repricing to $4.00 and $18.00 above it. Dots is the company's always-on agent, announced at DevDay on September 29, 2026: an agent with its own cloud computer and browser that works across more than 4,000 connected apps, runs on GPT-6 Astra, and comes included with Pro and Business Premium. Gemini 3.1 Pro watches the world and describes it; a dot acts inside it. Those are different verbs, and almost every practical question about this pair follows from which verb your problem needs.
Input är inte samma sak som handling
Gemini 3.1 Pros mediestöd är verkligen brett — en två timmars inspelning, ett produktfoto, en kalkylbladsexport och ett kontrakt kan alla komma in i samma begäran — men vart och ett av dessa indata är något som redan existerade före anropet. Modellens utdata är text: ett svar, en extraktion, en plan, ett utkast. Ingenting utanför konversationen förändras eftersom modellen kördes.
En punkt vänder på det. Dess indata är vardagliga – dina meddelanden, dina appdata, en uppgift du beskrev – och dess utdata är en förändring i världen: en fil flyttad, ett ärende uppdaterat, ett meddelande skickat efter ditt godkännande, en sida öppnad i dess egen webbläsare. OpenAI:s lanseringsmaterial beskriver hur den driver flera projekt framåt samtidigt, lär sig av feedback och tar emot nya uppgifter utan en ny tråd. Det är en beskrivning av en arbetare, inte av en modell, och det förklarar varför OpenAI inte publicerade något benchmark för den: man benchmarkar inte en kollega på en resultattavla, man ser vad den får gjort och kollar Activity View.
• Vad den tar emot – meddelanden, uppgiftsbeskrivningar och data från anslutna appar å ena sidan; text, bild, ljud, video och fil å andra sidan
• Vad den producerar – ändringar i annan programvara, med förbehåll för regler och godkännandegrindar, mot text som du sedan hanterar själv
• Var den körs – OpenAI:s molndator med sin egen webbläsare, isolerad från din dator om du inte länkar samman dem, mot Googles serveringsinfrastruktur, nåbar via ett API varifrån du vill
• Kontext – odokumenterad för en punkt, mot 1 048 576 tokens in och 65 536 tokens ut
• Bevis — leverantörsdemos, inget oberoende benchmark, ett Artificial Intelligence Index på 29 med 94,1 på GPQA Diamond och 82 på lång kontext, listat oberoende.
Vad Gemini 3.1 Pro är värt att ha
Anledningen till att behålla en sådan här modell är att perception är svårt och att de flesta agenter är dåliga på det. Gemini 3.1 Pros publicerade oberoende profil är ovanlig: 94,1 på GPQA Diamond är ett resultat nära frontlinjen, 82 på återkallning i lång kontext är den näst bästa siffran bland de modeller vi listar, och 58,7 på SciCode placerar den högst upp på just den resultattavlan. Där den inte glänser är agentiskt beslutsfattande — en poäng på 95,6 i τ²-Bench är respektabel, men dess τ-banking-del, den som mäter verktygsanvändning i flera steg mot en banks system, landar på 21,4. Alla dessa är tredjepartsmätningar som anges med sin källa i vår katalog, inte leverantörssiffror, vilket är anledningen till att de är värda mer än en lanseringspresentation.
Den andra halvan av den där per-request-berättelsen är att modellen inte är gratis. Den gick in i förhandsversion i februari, månader innan den nuvarande frontlinjen släpptes, och den är prissatt över den billiga nivån: $2,00 och $12,00 per miljon tokens är ungefär $0,0006 input per sida med tät text, vilket är ingenting förrän man kör en videoingest över ett bibliotek och då är det en utgiftspost. Att läsa en bildruta i en video kostar lika mycket som att läsa ett stycke, och modellen fakturerar dig gladeligen för båda.

Två kostnadsmodeller som vägrar konvertera
Kostnaden för en dot är en prenumeration med en opublicerad kvot: den första ingår i Pro eller Business Premium, utökade gränser gäller under den första månaden, konversationer med din dot räknas inte mot ChatGPT:s användningsgränser, och det finns inget publicerat pris för en andra dot, för extra hastighet eller kapacitet, eller för en slutförd uppgift. I CNBC:s redogörelse för keynoten prissätter Sarah Friar den nya Pro 500-nivån för $500 som en användningskvot plus Ultrafast-läget snarare än som ett pris per dot, så den dyraste planen i OpenAI:s prislista ger inte heller någon kostnad per enhet agentarbete.
Gemini 3.1 Pro omvandlar allt till tokens, inklusive de delar som inte är text. Ljud, video och bilder faktureras som indata, så kostnaden för en uppgift beror på hur mycket av världen du lät modellen titta på – en användbar egenskap, eftersom du kan mäta den, och en farlig sådan, eftersom den största siffran i räkningen ofta är den ingen hade planerat för. Modellroutning hjälper här på ett sätt som är specifikt snarare än generiskt: med över 200 modeller bakom en enda nyckel till leverantörens listpris utan påslag, kan den dyra multimodala läsningen och det billiga uppföljningsarbetet ligga på olika modeller i samma pipeline, och en prisändring från Google landar på ditt konto samma dag i stället för vid förnyelsen.

Där de två arbetar tillsammans
Den naturliga kombinationen är en dot som koordinerar och en multimodal modell som uppfattar. Arbete kommer in, en dot dirigerar det: allt som behöver tittas på eller lyssnas på går till Gemini 3.1 Pro för en strukturerad beskrivning, och beskrivningen går tillbaka in i arbetsflödet där ett schema eller en regel kan agera på den. Dot sköter uppföljningen; modellen sköter läsningen. Att dela upp det så håller också de dyra modalitetsanropen granskningsbara, vilket spelar roll eftersom det är de som överraskar folk.
På OrcaRouter routas modellen som google/gemini-3.1-pro-preview till leverantörens listpris, vidaresänt med 0 % påslag, tillsammans med resten av katalogen, med automatisk failover mellan uppströmsleverantörer när en av dem försämras och en routing-DSL för att komponera flera modeller till ett enda anrop. Det är värt att vara precis kring vad det inte innefattar: dots finns inte i vår katalog, det finns ingen endpoint för en sådan, och det finns ingen modellidentifierare att rikta en begäran mot. Om du vill ha perceptionslagret under din egen kontroll – och en förhandsgranskningsmodell från februari är precis den typen av beroende som är värt att begränsa – hör modellen hemma bakom din endpoint, och agenten stannar där du hyrde den.
Vilket verb behöver ditt problem?
Om arbetet innebär att titta på eller lyssna på något och producera ett svar är Gemini 3.1 Pro verktyget och en dot är ett felköp. Om arbetet innebär att få något färdigställt i flera applikationer utan att du själv kör, är en dot verktyget och ingen mängd multimodal indata kan ersätta det. De team som gör detta rätt kör båda och håller gränsen explicit: perception på en modell med mätning som du kan mäta, handling bakom en produkt du kan säga upp.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
