Eine generierte Hero-Karte mit dem Titel 'Dots vs Gemini 3.1 Pro'. Ein vertikaler Strich teilt sie: Das linke Panel, beschriftet mit 'Dots', trägt ein Cloud-Computer-Symbol und die Zeile 'eigener Computer + Browser - 4.000+ Apps'; das rechte Panel, beschriftet mit 'Gemini 3.1 Pro', trägt ein Augen- und Wellenform-Symbol und 'Text, Bild, Audio, Video als Eingabe - 1M Kontext - $2,00 / $12,00'. Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Dots vs. Gemini 3.1 Pro: Ein Agent mit einem Desktop gegen ein Modell mit fünf Sinnen

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

The word "multimodal" hides the real difference between these two, so start with what each one does with the world. Gemini 3.1 Pro Preview is Goog​le's flagship reasoning model, released in preview on February 19, 2026: it accepts text, images, audio, video and files as input and returns text, works across a 1,048,576-token context window with up to 65,536 tokens of output, and costs $2.00 per million input tokens and $12.00 per million output tokens below a 200,000-token prompt, repricing to $4.00 and $18.00 above it. Dots is the company's always-on agent, announced at DevDay on September 29, 2026: an agent with its own cloud computer and browser that works across more than 4,000 connected apps, runs on GPT-6 Astra, and comes included with Pro and Business Premium. Gemini 3.1 Pro watches the world and describes it; a dot acts inside it. Those are different verbs, and almost every practical question about this pair follows from which verb your problem needs.

Input ist nicht dasselbe wie Handlung

Die Medienunterstützung von Gemini 3.1 Pro ist wirklich breit gefächert – eine zwei Stunden lange Aufnahme, ein Produktfoto, ein Tabellenexport und ein Vertrag können alle in derselben Anfrage eingehen –, doch jede dieser Eingaben ist etwas, das bereits vor dem Aufruf existierte. Die Ausgabe des Modells ist Text: eine Antwort, eine Extraktion, ein Plan, ein Entwurf. Nichts außerhalb der Konversation ändert sich, weil das Modell ausgeführt wurde.

Ein Punkt kehrt das um. Seine Eingaben sind unspektakulär – deine Nachrichten, deine App-Daten, eine Aufgabe, die du beschrieben hast – und seine Ausgabe ist eine Veränderung in der Welt: eine verschobene Datei, ein aktualisiertes Ticket, eine Nachricht, die nach deiner Freigabe gesendet wird, eine Seite, die in seinem eigenen Browser geöffnet wird. Die Launch-Materialien von OpenAI beschreiben, wie es mehrere Projekte gleichzeitig voranbringt, aus Feedback lernt und neue Aufgaben ohne einen neuen Thread annimmt. Das ist die Beschreibung eines Arbeiters, nicht eines Modells, und es erklärt, warum OpenAI keinen Benchmark dafür veröffentlicht hat: Einen Kollegen benchmarkt man nicht auf einem Leaderboard, man beobachtet, was er zustande bringt, und prüft die Activity View.

• Was es entgegennimmt – auf der einen Seite Nachrichten, Aufgabenbeschreibungen und Daten verbundener Apps; auf der anderen Seite Text, Bild, Audio, Video und Datei

• Was es erzeugt — Änderungen in anderer Software, vorbehaltlich Regeln und Freigabestufen, an Text, den Sie anschließend selbst bearbeiten

• Wo es läuft — OpenAIs Cloud-Computer mit eigenem Browser, von deinem Rechner isoliert, es sei denn, du verknüpfst sie, gegen Googles Serving-Infrastruktur, über eine API von jedem beliebigen Ort aus erreichbar

• Kontext — undokumentiert für einen Punkt, gegen 1.048.576 Eingabe-Tokens und 65.536 Ausgabe-Tokens

• Belege — Anbieter-Demos, kein unabhängiger Benchmark, gegenüber einem Artificial Analysis Intelligence Index von 29,7 mit 94,1 bei GPQA Diamond und 82 beim Long-Context-Recall, unabhängig von Google aufgeführt

Was es wert ist, Gemini 3.1 Pro zu haben

Der Grund, ein Modell wie dieses weiterhin vorzuhalten, ist, dass Wahrnehmung schwierig ist und die meisten Agenten darin schlecht sind. Das veröffentlichte unabhängige Profil von Gemini 3.1 Pro ist ungewöhnlich: 94,1 bei GPQA Diamond ist ein Ergebnis nahe der Frontier, 82 bei Long-Context-Recall ist der zweitbeste Wert unter den Modellen, die wir auflisten, und 58,7 bei SciCode setzt es an die Spitze dieser speziellen Rangliste. Wo es nicht glänzt, ist die agentische Entscheidungsfindung – ein τ²-Bench-Wert von 95,6 ist respektabel, aber sein τ-Banking-Teilbereich, der die mehrstufige Tool-Nutzung gegenüber den Systemen einer Bank misst, liegt bei 21,4. All das sind Drittanbieter-Messungen, die in unserem Katalog mit ihrer Quelle aufgeführt sind, keine Herstellerangaben, weshalb sie mehr wert sind als eine Launch-Präsentation.

Die andere Hälfte dieser Geschichte zu den Kosten pro Anfrage ist, dass das Modell nicht kostenlos ist. Es ging im Februar in die Vorschau, Monate bevor das aktuelle Frontier-Modell auf den Markt kam, und es liegt preislich über der günstigen Tarifstufe: $2,00 und $12,00 pro Million Tokens entsprechen rund $0,0006 Eingabe pro Seite dichten Texts, was nichts ist, bis man einen Video-Ingest über eine Bibliothek laufen lässt, und dann ist es ein eigener Posten. Das Lesen eines Videoframes kostet so viel wie das Lesen eines Absatzes, und das Modell stellt Ihnen beides gerne in Rechnung.

A screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview, showing the identifier 'google/gemini-3.1-pro-preview' with Vision, Audio, Tools, JSON and Reasoning badges, a publication date of 2026-02-19, the description of it as Google's frontier reasoning model with improved software engineering and agentic reliability, a side panel showing 1M tokens of context and 65K maximum output over audio, file, image, text and video input, and a price strip reading $2.00 and $12.00. The page's own sidebar note records this as a headless screenshot of the live page.

Zwei Kostenmodelle, die sich nicht konvertieren lassen

Die Kosten für einen dot sind ein Abonnement mit einem nicht veröffentlichten Kontingent: Der erste ist in Pro oder Business Premium enthalten, erweiterte Limits gelten im ersten Monat, Gespräche mit Ihrem dot werden nicht auf die ChatGPT-Nutzungslimits angerechnet, und es gibt keinen veröffentlichten Preis für einen zweiten dot, für zusätzliche Geschwindigkeit oder Kapazität oder für eine abgeschlossene Aufgabe. In CNBCs Bericht über die Keynote bepreist Sarah Friar den neuen $500 Pro 500-Tarif als Nutzungskontingent plus den Ultrafast-Modus statt als Preis pro dot, sodass auch der teuerste Tarif auf OpenAIs Liste keine Kosten pro Einheit Agentenarbeit ergibt.

Gemini 3.1 Pro verwandelt alles in Tokens, auch die Teile, die kein Text sind. Audio, Video und Bilder werden als Input abgerechnet, sodass die Kosten einer Aufgabe davon abhängen, wie viel von der Welt du das Modell hast ansehen lassen – eine nützliche Eigenschaft, weil man sie messen kann, und eine gefährliche, weil die größte Zahl in der Rechnung häufig diejenige ist, mit der niemand gerechnet hat. Modell-Routing hilft hier auf eine spezifische statt generische Weise: Mit über 200 Modellen hinter einem einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlagkönnen die teure multimodale Auswertung und die günstige Folgearbeit auf verschiedenen Modellen in derselben Pipeline liegen, und eine Preisänderung von Google landet noch am selben Tag auf deinem Konto statt erst bei der Verlängerung.

A generated scoreboard titled 'Dots vs Gemini 3.1 Pro - inputs, outputs, evidence', with two columns. 'Dots' lists: Inputs messages and app data; Output changes inside connected apps; Model GPT-6 Astra (vendor-stated); Computer its own cloud computer and browser; Connectors 4,000+ apps; Independent benchmark none. 'Gemini 3.1 Pro' lists: Inputs text, image, audio, video, file; Output text only; Context 1,048,576 tokens; Max output 65,536 tokens; Price $2.00 in / $12.00 out per 1M below 200K; AA Intelligence Index 29.7. A footer reads 'Dots details vendor-stated from DevDay; Gemini 3.1 Pro figures from independent listings in the OrcaRouter catalogue.'

Wo die beiden zusammenarbeiten

Die natürliche Paarung ist ein dot, der koordiniert, und ein multimodales Modell, das wahrnimmt. Arbeit kommt an, ein dot leitet sie weiter: Alles, was angesehen oder angehört werden muss, geht an Gemini 3.1 Pro für eine strukturierte Beschreibung, und die Beschreibung fließt zurück in den Workflow, wo ein Zeitplan oder eine Regel darauf reagieren kann. Der dot übernimmt das Nachfassen; das Modell übernimmt das Lesen. Diese Aufteilung sorgt außerdem dafür, dass die teuren Modalitätsaufrufe auditierbar bleiben, was wichtig ist, denn sie sind diejenigen, die Menschen überraschen.

Auf OrcaRouter wird das Modell als google/gemini-3.1-pro-preview zum Listenpreis des Anbieters ohne Aufschlag (0 % Aufschlag) weitergegeben, zusammen mit dem übrigen Katalog, mit automatischem Failover über vorgelagerte Anbieter hinweg, wenn einer beeinträchtigt ist, und einer Routing-DSL, mit der sich mehrere Modelle zu einem einzigen Aufruf zusammenfassen lassen. Es lohnt sich, genau zu benennen, was das nicht umfasst: dots ist nicht in unserem Katalog, es gibt keinen Endpunkt dafür, und es existiert keine Modellkennung, auf die sich eine Anfrage richten ließe. Wenn du die Wahrnehmungsschicht selbst unter Kontrolle haben willst — und ein Preview-Modell vom Februar ist genau die Art von Abhängigkeit, die man eingrenzen sollte —, dann gehört das Modell hinter deinen eigenen Endpunkt und der Agent bleibt dort, wo du ihn gemietet hast.

Welches Verb benötigt Ihr Problem?

Wenn die Arbeit darin besteht, etwas anzusehen oder anzuhören und eine Antwort zu erzeugen, ist Gemini 3.1 Pro das Werkzeug und ein dot der falsche Kauf. Wenn die Arbeit darin besteht, etwas über mehrere Anwendungen hinweg fertigzustellen, ohne dass Sie selbst steuern, ist ein dot das Werkzeug, und keine noch so große Menge multimodaler Eingaben kann es ersetzen. Die Teams, die das richtig hinbekommen, betreiben beides und halten die Grenze explizit: Wahrnehmung auf einem nach Verbrauch abgerechneten Modell, das Sie messen können, Aktion hinter einem Produkt, das Sie kündigen können.

A screenshot of the OrcaRouter model catalogue page headed 'Models', showing the line '206 models - 16 providers - one API key, one bill' above filter controls for input modalities, context length, input price, status and supported parameters, with a grid of model cards and credit top-up offers visible beneath.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert