
Dots vs Gemini 3.1 Pro: un agente con un desktop contro un modello con cinque sensi
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 349 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 210 tok/s
- OrcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
The word "multimodal" hides the real difference between these two, so start with what each one does with the world. Gemini 3.1 Pro Preview is Google's flagship reasoning model, released in preview on February 19, 2026: it accepts text, images, audio, video and files as input and returns text, works across a 1,048,576-token context window with up to 65,536 tokens of output, and costs $2.00 per million input tokens and $12.00 per million output tokens below a 200,000-token prompt, repricing to $4.00 and $18.00 above it. Dots is the company's always-on agent, announced at DevDay on September 29, 2026: an agent with its own cloud computer and browser that works across more than 4,000 connected apps, runs on GPT-6 Astra, and comes included with Pro and Business Premium. Gemini 3.1 Pro watches the world and describes it; a dot acts inside it. Those are different verbs, and almost every practical question about this pair follows from which verb your problem needs.
L'input non è la stessa cosa dell'azione
Il supporto ai media di Gemini 3.1 Pro è davvero ampio — una registrazione di due ore, la foto di un prodotto, un'esportazione di un foglio di calcolo e un contratto possono arrivare tutti nella stessa richiesta — ma ognuno di quegli input è qualcosa che esisteva già prima della chiamata. L'output del modello è testo: una risposta, un'estrazione, un piano, una bozza. Nulla al di fuori della conversazione cambia perché il modello è stato eseguito.
Un punto inverte questo. I suoi input sono banali — i tuoi messaggi, i dati della tua app, un'attività che hai descritto — e il suo output è un cambiamento nel mondo: un file spostato, un ticket aggiornato, un messaggio inviato dopo la tua approvazione, una pagina aperta nel suo browser. I materiali di lancio di OpenAI lo descrivono mentre porta avanti più progetti contemporaneamente, impara dal feedback e accetta nuovi compiti senza un nuovo thread. Questa è la descrizione di un lavoratore, non di un modello, e spiega perché OpenAI non ha pubblicato alcun benchmark per esso: non valuti un collega su una classifica, osservi ciò che riesce a portare a termine e controlli la Activity View.
• Cosa accetta in input — messaggi, descrizioni delle attività e dati delle app collegate da un lato; testo, immagine, audio, video e file dall'altro
• Ciò che produce — modifiche all'interno di altri software, soggette a regole e passaggi di approvazione, su testi che poi gestisci tu stesso
• Dove viene eseguito — il computer cloud di OpenAI con il proprio browser, isolato dalla tua macchina a meno che tu non li colleghi, rispetto all'infrastruttura di serving di Google, raggiungibile tramite un'API da qualsiasi luogo tu voglia
• Contesto — non documentato per un punto, a fronte di 1.048.576 token in input e 65.536 token in output
• Prove — demo dei fornitori, nessun benchmark indipendente, a fronte di un Artificial Analysis Intelligence Index di 29,7 con 94,1 su GPQA Diamond e 82 sul richiamo su contesto lungo, elencato indipendentemente da Google
Quanto vale la pena avere Gemini 3.1 Pro
Il motivo per tenere in circolazione un modello come questo è che la percezione è difficile e la maggior parte degli agenti è scarsa in questo. Il profilo indipendente pubblicato di Gemini 3.1 Pro è insolito: 94,1 su GPQA Diamond è un risultato quasi di frontiera, 82 sul richiamo a contesto lungo è il secondo miglior valore nell'insieme di modelli che elenchiamo, e 58,7 su SciCode lo colloca in cima a quella particolare classifica. Dove non brilla è nel processo decisionale agentico — un punteggio di 95,6 su τ²-Bench è rispettabile, ma la sua sezione τ-banking, quella che misura l'uso di strumenti multi-step contro i sistemi di una banca, si attesta a 21,4. Tutte queste sono misurazioni di terze parti elencate con la loro fonte nel nostro catalogo, non cifre fornite dai produttori, ed è per questo che valgono più di una presentazione di lancio.
L'altra metà di quella storia per-richiesta è che il modello non è gratuito. È entrato in anteprima a febbraio, mesi prima del rilascio dell'attuale modello di frontiera, e ha un prezzo superiore alla fascia economica: 2,00 $ e 12,00 $ per milione di token corrispondono a circa 0,0006 $ di input per pagina di testo denso, che non è nulla finché non esegui un'importazione video su un'intera libreria, e a quel punto diventa una voce di costo. Leggere un fotogramma video costa quanto leggere un paragrafo, e il modello ti fatturerà volentieri entrambi.

Due modelli di costo che si rifiutano di convertire
Il costo di un dot è un abbonamento con una quota non pubblicata: il primo è incluso con Pro o Business Premium, nel primo mese si applicano limiti estesi, le conversazioni con il tuo dot non intaccano i limiti di utilizzo di ChatGPT, e non esiste un prezzo pubblicato per un secondo dot, per velocità o capacità aggiuntive, o per un'attività completata. Il resoconto del keynote di CNBC riporta che Sarah Friar definisce il nuovo livello Pro 500 da 500 $ come una quota di utilizzo più la modalità Ultrafast, anziché come una tariffa per dot, quindi nemmeno il piano più costoso nel listino di OpenAI produce un costo per unità di lavoro dell'agente.
Gemini 3.1 Pro converte tutto in token, incluse le parti che non sono testo. Audio, video e immagini vengono fatturati come input, quindi il costo di un'attività dipende da quanta parte del mondo hai fatto guardare al modello — una proprietà utile, perché puoi misurarla, e una pericolosa, perché il numero più grande nella fattura è spesso quello che nessuno aveva previsto. Il routing dei modelli aiuta qui in modo specifico anziché generico: con oltre 200 modelli dietro un'unica chiave al prezzo di listino del provider senza ricarico, la costosa lettura multimodale e il lavoro di follow-up economico possono stare su modelli diversi nella stessa pipeline, e una variazione di tariffa da Google arriva sul tuo account lo stesso giorno invece che al rinnovo.

Dove i due lavorano insieme
L'abbinamento naturale è un dot che coordina e un modello multimodale che percepisce. Il lavoro arriva, un dot lo instrada: tutto ciò che va guardato o ascoltato viene inviato a Gemini 3.1 Pro per ottenere una descrizione strutturata, e la descrizione rientra nel flusso di lavoro, dove una pianificazione o una regola può agire su di essa. Il dot si occupa di inseguire; il modello si occupa di leggere. Separare le cose in questo modo rende anche verificabili le costose chiamate alle modalità, il che conta perché sono proprio quelle a sorprendere le persone.
Su OrcaRouter il modello viene instradato come google/gemini-3.1-pro-preview al prezzo di listino del provider, applicato senza alcun ricarico (0% di markup), insieme al resto del catalogo, con failover automatico tra i provider a monte quando uno si degrada e un DSL di routing per comporre diversi modelli in un'unica chiamata. Vale la pena essere precisi su ciò che questo non include: dots non è nel nostro catalogo, non esiste un endpoint per esso e non esiste alcun identificatore di modello a cui puntare una richiesta. Se vuoi il livello di percezione sotto il tuo controllo — e un modello in anteprima di febbraio è esattamente il tipo di dipendenza che vale la pena circoscrivere — il modello appartiene dietro il tuo endpoint e l'agente resta dove l'hai noleggiato.
Di quale verbo ha bisogno il tuo problema?
Se il lavoro consiste nel guardare o ascoltare qualcosa e nel produrre una risposta, Gemini 3.1 Pro è lo strumento e un dot è l'acquisto sbagliato. Se il lavoro consiste nel portare a termine qualcosa attraverso diverse applicazioni senza che sia tu a guidare, un dot è lo strumento e nessuna quantità di input multimodale può sostituirlo. I team che lo fanno bene usano entrambi e mantengono esplicito il confine: la percezione su un modello a consumo che puoi misurare, l'azione dietro un prodotto che puoi disdire.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
