Wygenerowana karta hero zatytułowana „Dots vs Gemini 3.1 Pro”. Pionowa linia dzieli ją: lewy panel, oznaczony „Dots”, zawiera ikonę chmurowego komputera i wiersz „własny komputer + przeglądarka - 4 000+ aplikacji”; prawy panel, oznaczony „Gemini 3.1 Pro”, zawiera ikonę oka i przebiegu fali oraz „tekst, obraz, audio, wideo na wejściu - kontekst 1M - $2.00 / $12.00”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Dots kontra Gemini 3.1 Pro: agent z pulpitem przeciwko modelowi o pięciu zmysłach

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Słowo „multimodalny” ukrywa prawdziwą różnicę między tymi dwoma, więc zacznij od tego, co każde z nich robi ze światem. Gemini 3.1 Pro Preview to flagowy model rozumujący Google, wydany w wersji preview 19 lutego 2026 r.: przyjmuje tekst, obrazy, wideo i pliki jako dane wejściowe, a zwraca tekst, działa w oknie kontekstowym o długości 1 048 576 tokenów, generując do 65 536 tokenów wyjściowych, i kosztuje 2,00 USD za milion tokenów wejściowych oraz 12,00 USD za milion tokenów wyjściowych przy prompcie poniżej 200 000 tokenów, a powyżej tego progu cena zmienia się na 4,00 USD i 18,00 USD. Dots to zawsze aktywny agent firmy, ogłoszony na DevDay 29 września 2026 r.: agent z własnym komputerem w chmurze i przeglądarką, który działa w ponad 4 000 połączonych aplikacjach, korzysta z GPT-6 Astra i jest dołączony do planów Pro i Business Premium. Gemini 3.1 Pro obserwuje świat i opisuje go; pojedynczy dot działa w nim. To różne czasowniki, a niemal każde praktyczne pytanie dotyczące tej pary wynika z tego, którego czasownika potrzebuje twój problem.

Dane wejściowe to nie to samo co działanie

Obsługa multimediów przez Gemini 3.1 Pro jest naprawdę szeroka — dwugodzinne nagranie, zdjęcie produktu, eksport arkusza kalkulacyjnego i umowa mogą trafić w tym samym żądaniu — ale każdy z tych danych wejściowych istniał już przed wywołaniem. Dane wyjściowe modelu to tekst: odpowiedź, wyodrębnienie danych, plan, szkic. Nic poza rozmową nie zmienia się w wyniku uruchomienia modelu.

Kropka odwraca to. Jej dane wejściowe są przyziemne — twoje wiadomości, dane twojej aplikacji, zadanie, które opisałeś — a jej wynikiem jest zmiana w świecie: przeniesiony plik, zaktualizowane zgłoszenie, wiadomość wysłana po twojej zgodzie, strona otwarta w jej własnej przeglądarce. Materiały premierowe OpenAI opisują, jak realizuje kilka projektów naraz, uczy się na podstawie informacji zwrotnych i przyjmuje nowe zadania bez nowego wątku. To opis pracownika, a nie modelu, i wyjaśnia, dlaczego OpenAI nie opublikowało dla niej żadnego benchmarku: nie mierzy się kolegi w rankingu, tylko obserwuje się, co udaje mu się załatwić, i sprawdza Activity View.

• Co przyjmuje na wejściu — z jednej strony wiadomości, opisy zadań i dane z połączonych aplikacji; z drugiej tekst, obraz, dźwięk, wideo i plik

• Co wytwarza — zmiany w innym oprogramowaniu, podlegające regułom i bramkom zatwierdzeń, względem tekstu, którym następnie zajmujesz się samodzielnie

• Gdzie to działa — chmurowy komputer OpenAI z własną przeglądarką, odizolowany od twojej maszyny, chyba że je połączysz, w zestawieniu z infrastrukturą serwującą Google, dostępną przez API z dowolnego miejsca, jakie chcesz

• Kontekst — nieudokumentowane ani na jotę, wobec 1,048,576 tokenów wejściowych i 65,536 tokenów wyjściowych

• Dowody — dema dostawców, brak niezależnego benchmarku, w zestawieniu z Artificial Analysis Intelligence Index wynoszącym 29,7, z wynikiem 94,1 na GPQA Diamond i 82 w przywoływaniu długiego kontekstu, wymienionym niezależnie od Google

Co warto mieć w Gemini 3.1 Pro

Powód, dla którego warto mieć pod ręką taki model, jest taki, że percepcja jest trudna, a większość agentów sobie z nią nie radzi. Opublikowany niezależny profil Gemini 3.1 Pro jest nietypowy: 94,1 w GPQA Diamond to wynik bliski czołówki, 82 w odtwarzaniu z długiego kontekstu to druga najlepsza wartość wśród wymienianych przez nas modeli, a 58,7 w SciCode stawia go na szczycie tego konkretnego rankingu. Nie błyszczy natomiast, jeśli chodzi o podejmowanie decyzji przez agentów — wynik 95,6 w τ²-Bench jest przyzwoity, ale jego wycinek τ-banking, ten, który mierzy wieloetapowe korzystanie z narzędzi wobec systemów banku, wynosi 21,4. Wszystkie te wartości to pomiary stron trzecich, w naszym katalogu podane wraz ze źródłem, a nie dane producenta, i dlatego są warte więcej niż prezentacja premierowa.

Druga połowa tej historii o koszcie na żądanie jest taka, że model nie jest darmowy. Wszedł do wersji zapoznawczej w lutym, miesiące przed premierą obecnego modelu czołowego, a jego cena jest powyżej taniej kategorii: 2,00 USD i 12,00 USD za milion tokenów to około 0,0006 USD za dane wejściowe na stronę gęstego tekstu, co jest niczym, dopóki nie uruchomisz przetwarzania wideo na całej bibliotece, a wtedy staje się pozycją w budżecie. Czytanie klatki wideo kosztuje tyle samo co czytanie akapitu, a oni chętnie policzą ci za oba.

A screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview, showing the identifier 'google/gemini-3.1-pro-preview' with Vision, Audio, Tools, JSON and Reasoning badges, a publication date of 2026-02-19, the description of it as Google's frontier reasoning model with improved software engineering and agentic reliability, a side panel showing 1M tokens of context and 65K maximum output over audio, file, image, text and video input, and a price strip reading $2.00 and $12.00. The page's own sidebar note records this as a headless screenshot of the live page.

Dwa modele kosztów, które nie chcą się konwertować

Koszt dota to subskrypcja z nieopublikowanym przydziałem: pierwszy jest wliczony w Pro lub Business Premium, rozszerzone limity obowiązują w pierwszym miesiącu, rozmowy z twoim dotem nie zużywają limitów użytkowania ChatGPT, a nie ma opublikowanej ceny za drugiego dota, za dodatkową szybkość lub przepustowość ani za ukończone zadanie. Według relacji CNBC z keynote Sarah Friar wycenia nowy plan Pro 500 za 500 dolarów jako przydział użytkowania plus tryb Ultrafast, a nie jako stawkę za dota, więc najdroższy plan w cenniku OpenAI również nie daje kosztu na jednostkę pracy agenta.

Gemini 3.1 Pro zamienia wszystko na tokeny, w tym także to, co nie jest tekstem. Dźwięk, wideo i obrazy są rozliczane jako dane wejściowe, więc koszt zadania zależy od tego, jak dużą część świata kazałeś modelowi obejrzeć — właściwość użyteczna, bo da się ją zmierzyć, i niebezpieczna, bo największa liczba na rachunku jest często tą, której nikt nie zaplanował. Routing modeli pomaga tu w sposób konkretny, a nie ogólny: gdy za jednym kluczem masz ponad 200 modeli w cenie katalogowej dostawcy, bez marży, drogi odczyt multimodalny i tania praca następcza mogą trafić na różne modele w tym samym potoku, a zmiana stawek ze strony Google trafia na Twoje konto tego samego dnia, a nie dopiero przy odnowieniu.

A generated scoreboard titled 'Dots vs Gemini 3.1 Pro - inputs, outputs, evidence', with two columns. 'Dots' lists: Inputs messages and app data; Output changes inside connected apps; Model GPT-6 Astra (vendor-stated); Computer its own cloud computer and browser; Connectors 4,000+ apps; Independent benchmark none. 'Gemini 3.1 Pro' lists: Inputs text, image, audio, video, file; Output text only; Context 1,048,576 tokens; Max output 65,536 tokens; Price $2.00 in / $12.00 out per 1M below 200K; AA Intelligence Index 29.7. A footer reads 'Dots details vendor-stated from DevDay; Gemini 3.1 Pro figures from independent listings in the OrcaRouter catalogue.'

Tam, gdzie te dwa współpracują

Naturalnym połączeniem jest kropka, która koordynuje, oraz model multimodalny, który postrzega. Praca nadchodzi, kropka ją kieruje: wszystko, co trzeba obejrzeć lub wysłuchać, trafia do Gemini 3.1 Pro po ustrukturyzowany opis, a opis wraca do przepływu pracy, gdzie harmonogram lub reguła może na nim zadziałać. Kropka zajmuje się poganianiem; model zajmuje się czytaniem. Taki podział sprawia też, że kosztowne wywołania modalności pozostają audytowalne, co ma znaczenie, bo to właśnie one zaskakują ludzi.

W OrcaRouter model jest kierowany jako google/gemini-3.1-pro-preview w cenie katalogowej dostawcy przekazywanej dalej z 0% marży, obok reszty katalogu, wraz z automatycznym przełączaniem awaryjnym między dostawcami nadrzędnymi, gdy któryś z nich zawodzi, oraz DSL routingu do komponowania kilku modeli w jedno wywołanie. Warto być precyzyjnym co do tego, czego to nie obejmuje: „dots” nie znajduje się w naszym katalogu, nie ma dla niego żadnego endpointu ani nie istnieje identyfikator modelu, na który można by skierować żądanie. Jeśli chcesz mieć warstwę percepcji pod własną kontrolą — a model w wersji preview z lutego to dokładnie ten rodzaj zależności, który warto ograniczyć — model powinien znajdować się za twoim endpointem, a agent pozostaje tam, gdzie go wynająłeś.

Jakiego czasownika potrzebuje Twój problem?

Jeśli praca polega na patrzeniu na coś lub słuchaniu czegoś i udzielaniu odpowiedzi, Gemini 3.1 Pro jest właściwym narzędziem, a dot to zły zakup. Jeśli praca polega na doprowadzeniu czegoś do końca w kilku aplikacjach bez twojego sterowania, dot jest właściwym narzędziem i żaden model multimodalny go nie zastąpi. Ci, którym się to udaje, używają obu i jasno wyznaczają granicę: percepcja na rozliczanym modelu, który można mierzyć, działanie za produktem, który można anulować.

A screenshot of the OrcaRouter model catalogue page headed 'Models', showing the line '206 models - 16 providers - one API key, one bill' above filter controls for input modalities, context length, input price, status and supported parameters, with a grid of model cards and credit top-up offers visible beneath.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie