
Dots vs. Gemini 3.1 Pro: Ein Agent mit einem Desktop gegen ein Modell mit fünf Sinnen
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 349 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 210 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
The word "multimodal" hides the real difference between these two, so start with what each one does with the world. Gemini 3.1 Pro Preview is Google's flagship reasoning model, released in preview on February 19, 2026: it accepts text, images, audio, video and files as input and returns text, works across a 1,048,576-token context window with up to 65,536 tokens of output, and costs $2.00 per million input tokens and $12.00 per million output tokens below a 200,000-token prompt, repricing to $4.00 and $18.00 above it. Dots is the company's always-on agent, announced at DevDay on September 29, 2026: an agent with its own cloud computer and browser that works across more than 4,000 connected apps, runs on GPT-6 Astra, and comes included with Pro and Business Premium. Gemini 3.1 Pro watches the world and describes it; a dot acts inside it. Those are different verbs, and almost every practical question about this pair follows from which verb your problem needs.
Input ist nicht dasselbe wie Handlung
Die Medienunterstützung von Gemini 3.1 Pro ist wirklich breit gefächert – eine zwei Stunden lange Aufnahme, ein Produktfoto, ein Tabellenexport und ein Vertrag können alle in derselben Anfrage eingehen –, doch jede dieser Eingaben ist etwas, das bereits vor dem Aufruf existierte. Die Ausgabe des Modells ist Text: eine Antwort, eine Extraktion, ein Plan, ein Entwurf. Nichts außerhalb der Konversation ändert sich, weil das Modell ausgeführt wurde.
Ein Punkt kehrt das um. Seine Eingaben sind unspektakulär – deine Nachrichten, deine App-Daten, eine Aufgabe, die du beschrieben hast – und seine Ausgabe ist eine Veränderung in der Welt: eine verschobene Datei, ein aktualisiertes Ticket, eine Nachricht, die nach deiner Freigabe gesendet wird, eine Seite, die in seinem eigenen Browser geöffnet wird. Die Launch-Materialien von OpenAI beschreiben, wie es mehrere Projekte gleichzeitig voranbringt, aus Feedback lernt und neue Aufgaben ohne einen neuen Thread annimmt. Das ist die Beschreibung eines Arbeiters, nicht eines Modells, und es erklärt, warum OpenAI keinen Benchmark dafür veröffentlicht hat: Einen Kollegen benchmarkt man nicht auf einem Leaderboard, man beobachtet, was er zustande bringt, und prüft die Activity View.
• Was es entgegennimmt – auf der einen Seite Nachrichten, Aufgabenbeschreibungen und Daten verbundener Apps; auf der anderen Seite Text, Bild, Audio, Video und Datei
• Was es erzeugt — Änderungen in anderer Software, vorbehaltlich Regeln und Freigabestufen, an Text, den Sie anschließend selbst bearbeiten
• Wo es läuft — OpenAIs Cloud-Computer mit eigenem Browser, von deinem Rechner isoliert, es sei denn, du verknüpfst sie, gegen Googles Serving-Infrastruktur, über eine API von jedem beliebigen Ort aus erreichbar
• Kontext — undokumentiert für einen Punkt, gegen 1.048.576 Eingabe-Tokens und 65.536 Ausgabe-Tokens
• Belege — Anbieter-Demos, kein unabhängiger Benchmark, gegenüber einem Artificial Analysis Intelligence Index von 29,7 mit 94,1 bei GPQA Diamond und 82 beim Long-Context-Recall, unabhängig von Google aufgeführt
Was es wert ist, Gemini 3.1 Pro zu haben
Der Grund, ein Modell wie dieses weiterhin vorzuhalten, ist, dass Wahrnehmung schwierig ist und die meisten Agenten darin schlecht sind. Das veröffentlichte unabhängige Profil von Gemini 3.1 Pro ist ungewöhnlich: 94,1 bei GPQA Diamond ist ein Ergebnis nahe der Frontier, 82 bei Long-Context-Recall ist der zweitbeste Wert unter den Modellen, die wir auflisten, und 58,7 bei SciCode setzt es an die Spitze dieser speziellen Rangliste. Wo es nicht glänzt, ist die agentische Entscheidungsfindung – ein τ²-Bench-Wert von 95,6 ist respektabel, aber sein τ-Banking-Teilbereich, der die mehrstufige Tool-Nutzung gegenüber den Systemen einer Bank misst, liegt bei 21,4. All das sind Drittanbieter-Messungen, die in unserem Katalog mit ihrer Quelle aufgeführt sind, keine Herstellerangaben, weshalb sie mehr wert sind als eine Launch-Präsentation.
Die andere Hälfte dieser Geschichte zu den Kosten pro Anfrage ist, dass das Modell nicht kostenlos ist. Es ging im Februar in die Vorschau, Monate bevor das aktuelle Frontier-Modell auf den Markt kam, und es liegt preislich über der günstigen Tarifstufe: $2,00 und $12,00 pro Million Tokens entsprechen rund $0,0006 Eingabe pro Seite dichten Texts, was nichts ist, bis man einen Video-Ingest über eine Bibliothek laufen lässt, und dann ist es ein eigener Posten. Das Lesen eines Videoframes kostet so viel wie das Lesen eines Absatzes, und das Modell stellt Ihnen beides gerne in Rechnung.

Zwei Kostenmodelle, die sich nicht konvertieren lassen
Die Kosten für einen dot sind ein Abonnement mit einem nicht veröffentlichten Kontingent: Der erste ist in Pro oder Business Premium enthalten, erweiterte Limits gelten im ersten Monat, Gespräche mit Ihrem dot werden nicht auf die ChatGPT-Nutzungslimits angerechnet, und es gibt keinen veröffentlichten Preis für einen zweiten dot, für zusätzliche Geschwindigkeit oder Kapazität oder für eine abgeschlossene Aufgabe. In CNBCs Bericht über die Keynote bepreist Sarah Friar den neuen $500 Pro 500-Tarif als Nutzungskontingent plus den Ultrafast-Modus statt als Preis pro dot, sodass auch der teuerste Tarif auf OpenAIs Liste keine Kosten pro Einheit Agentenarbeit ergibt.
Gemini 3.1 Pro verwandelt alles in Tokens, auch die Teile, die kein Text sind. Audio, Video und Bilder werden als Input abgerechnet, sodass die Kosten einer Aufgabe davon abhängen, wie viel von der Welt du das Modell hast ansehen lassen – eine nützliche Eigenschaft, weil man sie messen kann, und eine gefährliche, weil die größte Zahl in der Rechnung häufig diejenige ist, mit der niemand gerechnet hat. Modell-Routing hilft hier auf eine spezifische statt generische Weise: Mit über 200 Modellen hinter einem einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlagkönnen die teure multimodale Auswertung und die günstige Folgearbeit auf verschiedenen Modellen in derselben Pipeline liegen, und eine Preisänderung von Google landet noch am selben Tag auf deinem Konto statt erst bei der Verlängerung.

Wo die beiden zusammenarbeiten
Die natürliche Paarung ist ein dot, der koordiniert, und ein multimodales Modell, das wahrnimmt. Arbeit kommt an, ein dot leitet sie weiter: Alles, was angesehen oder angehört werden muss, geht an Gemini 3.1 Pro für eine strukturierte Beschreibung, und die Beschreibung fließt zurück in den Workflow, wo ein Zeitplan oder eine Regel darauf reagieren kann. Der dot übernimmt das Nachfassen; das Modell übernimmt das Lesen. Diese Aufteilung sorgt außerdem dafür, dass die teuren Modalitätsaufrufe auditierbar bleiben, was wichtig ist, denn sie sind diejenigen, die Menschen überraschen.
Auf OrcaRouter wird das Modell als google/gemini-3.1-pro-preview zum Listenpreis des Anbieters ohne Aufschlag (0 % Aufschlag) weitergegeben, zusammen mit dem übrigen Katalog, mit automatischem Failover über vorgelagerte Anbieter hinweg, wenn einer beeinträchtigt ist, und einer Routing-DSL, mit der sich mehrere Modelle zu einem einzigen Aufruf zusammenfassen lassen. Es lohnt sich, genau zu benennen, was das nicht umfasst: dots ist nicht in unserem Katalog, es gibt keinen Endpunkt dafür, und es existiert keine Modellkennung, auf die sich eine Anfrage richten ließe. Wenn du die Wahrnehmungsschicht selbst unter Kontrolle haben willst — und ein Preview-Modell vom Februar ist genau die Art von Abhängigkeit, die man eingrenzen sollte —, dann gehört das Modell hinter deinen eigenen Endpunkt und der Agent bleibt dort, wo du ihn gemietet hast.
Welches Verb benötigt Ihr Problem?
Wenn die Arbeit darin besteht, etwas anzusehen oder anzuhören und eine Antwort zu erzeugen, ist Gemini 3.1 Pro das Werkzeug und ein dot der falsche Kauf. Wenn die Arbeit darin besteht, etwas über mehrere Anwendungen hinweg fertigzustellen, ohne dass Sie selbst steuern, ist ein dot das Werkzeug, und keine noch so große Menge multimodaler Eingaben kann es ersetzen. Die Teams, die das richtig hinbekommen, betreiben beides und halten die Grenze explizit: Wahrnehmung auf einem nach Verbrauch abgerechneten Modell, das Sie messen können, Aktion hinter einem Produkt, das Sie kündigen können.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
