
Dots kontra Gemini 3.1 Pro: agent z pulpitem przeciwko modelowi o pięciu zmysłach
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 349 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 210 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Słowo „multimodalny” ukrywa prawdziwą różnicę między tymi dwoma, więc zacznij od tego, co każde z nich robi ze światem. Gemini 3.1 Pro Preview to flagowy model rozumujący Google, wydany w wersji preview 19 lutego 2026 r.: przyjmuje tekst, obrazy, wideo i pliki jako dane wejściowe, a zwraca tekst, działa w oknie kontekstowym o długości 1 048 576 tokenów, generując do 65 536 tokenów wyjściowych, i kosztuje 2,00 USD za milion tokenów wejściowych oraz 12,00 USD za milion tokenów wyjściowych przy prompcie poniżej 200 000 tokenów, a powyżej tego progu cena zmienia się na 4,00 USD i 18,00 USD. Dots to zawsze aktywny agent firmy, ogłoszony na DevDay 29 września 2026 r.: agent z własnym komputerem w chmurze i przeglądarką, który działa w ponad 4 000 połączonych aplikacjach, korzysta z GPT-6 Astra i jest dołączony do planów Pro i Business Premium. Gemini 3.1 Pro obserwuje świat i opisuje go; pojedynczy dot działa w nim. To różne czasowniki, a niemal każde praktyczne pytanie dotyczące tej pary wynika z tego, którego czasownika potrzebuje twój problem.
Dane wejściowe to nie to samo co działanie
Obsługa multimediów przez Gemini 3.1 Pro jest naprawdę szeroka — dwugodzinne nagranie, zdjęcie produktu, eksport arkusza kalkulacyjnego i umowa mogą trafić w tym samym żądaniu — ale każdy z tych danych wejściowych istniał już przed wywołaniem. Dane wyjściowe modelu to tekst: odpowiedź, wyodrębnienie danych, plan, szkic. Nic poza rozmową nie zmienia się w wyniku uruchomienia modelu.
Kropka odwraca to. Jej dane wejściowe są przyziemne — twoje wiadomości, dane twojej aplikacji, zadanie, które opisałeś — a jej wynikiem jest zmiana w świecie: przeniesiony plik, zaktualizowane zgłoszenie, wiadomość wysłana po twojej zgodzie, strona otwarta w jej własnej przeglądarce. Materiały premierowe OpenAI opisują, jak realizuje kilka projektów naraz, uczy się na podstawie informacji zwrotnych i przyjmuje nowe zadania bez nowego wątku. To opis pracownika, a nie modelu, i wyjaśnia, dlaczego OpenAI nie opublikowało dla niej żadnego benchmarku: nie mierzy się kolegi w rankingu, tylko obserwuje się, co udaje mu się załatwić, i sprawdza Activity View.
• Co przyjmuje na wejściu — z jednej strony wiadomości, opisy zadań i dane z połączonych aplikacji; z drugiej tekst, obraz, dźwięk, wideo i plik
• Co wytwarza — zmiany w innym oprogramowaniu, podlegające regułom i bramkom zatwierdzeń, względem tekstu, którym następnie zajmujesz się samodzielnie
• Gdzie to działa — chmurowy komputer OpenAI z własną przeglądarką, odizolowany od twojej maszyny, chyba że je połączysz, w zestawieniu z infrastrukturą serwującą Google, dostępną przez API z dowolnego miejsca, jakie chcesz
• Kontekst — nieudokumentowane ani na jotę, wobec 1,048,576 tokenów wejściowych i 65,536 tokenów wyjściowych
• Dowody — dema dostawców, brak niezależnego benchmarku, w zestawieniu z Artificial Analysis Intelligence Index wynoszącym 29,7, z wynikiem 94,1 na GPQA Diamond i 82 w przywoływaniu długiego kontekstu, wymienionym niezależnie od Google
Co warto mieć w Gemini 3.1 Pro
Powód, dla którego warto mieć pod ręką taki model, jest taki, że percepcja jest trudna, a większość agentów sobie z nią nie radzi. Opublikowany niezależny profil Gemini 3.1 Pro jest nietypowy: 94,1 w GPQA Diamond to wynik bliski czołówki, 82 w odtwarzaniu z długiego kontekstu to druga najlepsza wartość wśród wymienianych przez nas modeli, a 58,7 w SciCode stawia go na szczycie tego konkretnego rankingu. Nie błyszczy natomiast, jeśli chodzi o podejmowanie decyzji przez agentów — wynik 95,6 w τ²-Bench jest przyzwoity, ale jego wycinek τ-banking, ten, który mierzy wieloetapowe korzystanie z narzędzi wobec systemów banku, wynosi 21,4. Wszystkie te wartości to pomiary stron trzecich, w naszym katalogu podane wraz ze źródłem, a nie dane producenta, i dlatego są warte więcej niż prezentacja premierowa.
Druga połowa tej historii o koszcie na żądanie jest taka, że model nie jest darmowy. Wszedł do wersji zapoznawczej w lutym, miesiące przed premierą obecnego modelu czołowego, a jego cena jest powyżej taniej kategorii: 2,00 USD i 12,00 USD za milion tokenów to około 0,0006 USD za dane wejściowe na stronę gęstego tekstu, co jest niczym, dopóki nie uruchomisz przetwarzania wideo na całej bibliotece, a wtedy staje się pozycją w budżecie. Czytanie klatki wideo kosztuje tyle samo co czytanie akapitu, a oni chętnie policzą ci za oba.

Dwa modele kosztów, które nie chcą się konwertować
Koszt dota to subskrypcja z nieopublikowanym przydziałem: pierwszy jest wliczony w Pro lub Business Premium, rozszerzone limity obowiązują w pierwszym miesiącu, rozmowy z twoim dotem nie zużywają limitów użytkowania ChatGPT, a nie ma opublikowanej ceny za drugiego dota, za dodatkową szybkość lub przepustowość ani za ukończone zadanie. Według relacji CNBC z keynote Sarah Friar wycenia nowy plan Pro 500 za 500 dolarów jako przydział użytkowania plus tryb Ultrafast, a nie jako stawkę za dota, więc najdroższy plan w cenniku OpenAI również nie daje kosztu na jednostkę pracy agenta.
Gemini 3.1 Pro zamienia wszystko na tokeny, w tym także to, co nie jest tekstem. Dźwięk, wideo i obrazy są rozliczane jako dane wejściowe, więc koszt zadania zależy od tego, jak dużą część świata kazałeś modelowi obejrzeć — właściwość użyteczna, bo da się ją zmierzyć, i niebezpieczna, bo największa liczba na rachunku jest często tą, której nikt nie zaplanował. Routing modeli pomaga tu w sposób konkretny, a nie ogólny: gdy za jednym kluczem masz ponad 200 modeli w cenie katalogowej dostawcy, bez marży, drogi odczyt multimodalny i tania praca następcza mogą trafić na różne modele w tym samym potoku, a zmiana stawek ze strony Google trafia na Twoje konto tego samego dnia, a nie dopiero przy odnowieniu.

Tam, gdzie te dwa współpracują
Naturalnym połączeniem jest kropka, która koordynuje, oraz model multimodalny, który postrzega. Praca nadchodzi, kropka ją kieruje: wszystko, co trzeba obejrzeć lub wysłuchać, trafia do Gemini 3.1 Pro po ustrukturyzowany opis, a opis wraca do przepływu pracy, gdzie harmonogram lub reguła może na nim zadziałać. Kropka zajmuje się poganianiem; model zajmuje się czytaniem. Taki podział sprawia też, że kosztowne wywołania modalności pozostają audytowalne, co ma znaczenie, bo to właśnie one zaskakują ludzi.
W OrcaRouter model jest kierowany jako google/gemini-3.1-pro-preview w cenie katalogowej dostawcy przekazywanej dalej z 0% marży, obok reszty katalogu, wraz z automatycznym przełączaniem awaryjnym między dostawcami nadrzędnymi, gdy któryś z nich zawodzi, oraz DSL routingu do komponowania kilku modeli w jedno wywołanie. Warto być precyzyjnym co do tego, czego to nie obejmuje: „dots” nie znajduje się w naszym katalogu, nie ma dla niego żadnego endpointu ani nie istnieje identyfikator modelu, na który można by skierować żądanie. Jeśli chcesz mieć warstwę percepcji pod własną kontrolą — a model w wersji preview z lutego to dokładnie ten rodzaj zależności, który warto ograniczyć — model powinien znajdować się za twoim endpointem, a agent pozostaje tam, gdzie go wynająłeś.
Jakiego czasownika potrzebuje Twój problem?
Jeśli praca polega na patrzeniu na coś lub słuchaniu czegoś i udzielaniu odpowiedzi, Gemini 3.1 Pro jest właściwym narzędziem, a dot to zły zakup. Jeśli praca polega na doprowadzeniu czegoś do końca w kilku aplikacjach bez twojego sterowania, dot jest właściwym narzędziem i żaden model multimodalny go nie zastąpi. Ci, którym się to udaje, używają obu i jasno wyznaczają granicę: percepcja na rozliczanym modelu, który można mierzyć, działanie za produktem, który można anulować.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
