
Gemini 3.7 Flash kontra Gemini 3.1 Pro: Czy warstwa Flash Google'a sprawiła, że jej własny flagowy model stał się przestarzały?
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
W linii modeli Google na 2026 rok kryje się niewygodne pytanie, skierowane do każdego zespołu, który obecnie płaci za Gemini 3.1 Pro: dlaczego tani model Flash zdobywa wyższe wyniki niż flagowiec w niezależnym indeksie? Gemini 3.7 Flash, wydany 13 sierpnia 2026 roku w cenie 0,75 USD za milion tokenów wejściowych i 3,75 USD za milion tokenów wyjściowych, osiąga 56 punktów w Artificial Analysis Intelligence Index przy wysokim poziomie rozumowania. Gemini 3.1 Pro, wersja podglądowa udostępniona przez Google 19 lutego 2026 roku w cenie 2,00 / 12,00 USD — oraz 4,00 / 18,00 USD powyżej kontekstu 200K — dziś uzyskuje wyniki w górnych latach 40. w tym samym indeksie. Flagowiec, który prowadził w indeksie w momencie premiery, został wyprzedzony przez własną warstwę roboczą, a ten artykuł dotyczy tego, co to oznacza dla obu modeli oraz dla zespołów, które muszą wybierać między nimi.
Założenie: flagowy poziom Google utknął w podglądzie.
Kontekst ma większe znaczenie niż liczby. Gemini 3.1 Pro jest dostępny w wersji preview od lutego 2026 roku — siedem miesięcy w chwili pisania tego tekstu — a jego następca, Gemini 3.5 Pro, został zapowiedziany na Google I/O w maju jako „nadchodzący w przyszłym miesiącu”, po czym przegapił czerwiec, lipiec i sierpień. Na początku września flagowy poziom nie ma wydanego następcy ani daty, pojawiają się też doniesienia o możliwym anulowaniu. Tymczasem poziom Flash wypuścił w tym samym czasie trzy generacje: Gemini 3.6 Flash 21 lipca, Gemini 3.7 Flash 13 sierpnia, a 1 września agentowa zdolność rozumienia wideo w obu modelach. To porównanie nie dotyczy tak naprawdę „Pro vs Flash”. Chodzi o zestawienie „poziomu, który Google wypuszcza” z „poziomem, którego Google przestał wypuszczać”.
Kontrast specyfikacji
• Cena — Gemini 3.7 Flash $0.75 / $3.75 za 1M tokenów (promocja do 31 grudnia 2026, następnie $1.50 / $7.50) vs Gemini 3.1 Pro $2.00 / $12.00 przy kontekście poniżej 200K, wzrastając do $4.00 / $18.00 powyżej 200K. Trzy do czterech razy tańszy w cenniku, przed kontrolami poziomu rozumowania.
• Kontekst / maksymalne wyjście — 1M / 64K vs 1M / 64K. Identyczne limity.
• Wejścia — zarówno tekst, obraz, audio, wideo, jak i PDF. Powierzchnia multimodalna jest taka sama; różnica polega na tym, co model robi z wideo (poniżej).
• Kontrola rozumowania — Gemini 3.7 Flash: niskie / średnie / wysokie myślenie. Gemini 3.1 Pro: niskie / średnie / wysokie, z dynamicznym myśleniem włączonym domyślnie.
• Wynik niezależny — Gemini 3.7 Flash: 56 w Artificial Analysis Intelligence Index, podczas gdy Gemini 3.1 Pro osiąga wynik w górnej czterdziestce w obecnej wersji indeksu (w momencie premiery wynik wynosił 57 w poprzedniej wersji).
• Prędkość generowania — Gemini 3.7 Flash około 285 tokenów/sek przy wysokim poziomie rozumowania vs Gemini 3.1 Pro około 112–125 tokenów/sek — około dwa i pół raza szybciej.
• Status — Gemini 3.7 Flash stabilna, GA. Gemini 3.1 Pro w wersji preview, z krótkim oknem wycofania wersji preview.
Indeks i bałagan z benchmarkami pod spodem
Najważniejszy jest indeks: Artificial Analysis, niezależny ewaluator porównujący produkty różnych producentów, przyznaje obecnie Gemini 3.7 Flash 56 punktów, a Gemini 3.1 Pro wynik w górnej czterdziestce — koń roboczy przed flagowcem, czyli odwrócenie pozycji z premiery 3.1 Pro, kiedy to 57 punktów prowadziło w indeksie. To najważniejszy fakt w tym starciu, pochodzący z niezależnego źródła, a nie z raportów producenta.
Poniżej indeksu rejestr benchmarków to bałagan nieporównywalnych środowisk testowych, a naiwne czytanie go prowadzi do błędnej odpowiedzi. Wyniki Gemini 3.1 Pro — 80,6% na SWE-bench Verified, 77,1% na ARC-AGI-2, 94,3% na GPQA Diamond, 2887 Elo na LiveCodeBench Pro — podane przez Google podczas lutowej premiery, wykorzystują inne wersje benchmarków niż wyniki Flasha i nigdy nie zostały w jednolity sposób odtworzone. Wyniki Gemini 3.7 Flash — 43,6% na FrontierCode 1.1, 65,3% na DeepSWE v1.1 oraz 1588 Elo na arenie tworzenia aplikacji internetowych — są podobnie raportowane przez producenta na nowszych środowiskach testowych. Tam, gdzie oba modele pokrywają się w niezależnym agregacie — AA Index — wygrywa Flash. Każdy, kto twierdzi, że „Pro bije Flasha na SWE-bench", porównuje dwie wersje dwóch różnych testów i nie mówi o tym wprost.


Luka w możliwościach wideo
Możliwością, która sprawia, że to porównanie wypada nierówno, jest wideo. Nowy agentowy tryb rozumienia wideo Google — ogłoszony 1 września 2026 roku — dotyczy Gemini 3.7 Flash, Gemini 3.6 Flash oraz Gemini 3.5 Flash-Lite. Gemini 3.1 Pro nie znajduje się na tej liście. Model Flash czyta wideo w sposób, w jaki nowy tryb definiuje czytanie wideo: model sam decyduje, co oglądać, z jaką prędkością oraz czy przez klatki, audio, czy transkrypt, ładując wyłącznie istotne segmenty — według danych producenta oszczędności sięgają 66% kosztów i 88% tokenów. Gemini 3.1 Pro technicznie przyjmuje wejście wideo, ale korzysta ze starszej ścieżki statycznego próbkowania i nie otrzymuje żadnych nowych narzędzi. Dla użytkowników flagowego modelu najnowsza funkcja wideo w rodzinie Gemini trafia najpierw do tańszego modelu, a warstwa Pro nie ma ogłoszonej daty jej otrzymania.
Szybkość i problem ryzyka podglądu.
Szybkość potęguje różnicę cen w ten sam sposób, co w każdym zestawieniu Gemini 3.7 Flash: mniej więcej trzykrotnie większa szybkość generowania w modelu, który już kosztuje jedną trzecią ceny. Ale druga różnica to ta, którą zespoły zapominają wycenić: status. Gemini 3.1 Pro to wersja preview, a wersje preview mają krótkie okno wypowiedzenia, gdy pojawia się następca. Obciążenie produkcyjne na modelu preview to stałe ryzyko zmiany ID modelu, zmiany cen lub przesunięcia możliwości bez ostrzeżenia. Gemini 3.7 Flash jest GA — stabilny, udokumentowany i niezaplanowany do zastąpienia pod wpływem kaprysu, nawet jeśli niemal comiesięczne wydania Flash od Google oznaczają, że 3.8 Flash może szybko nadejść. Ryzyko wycofania wersji preview 3.1 Pro nie jest hipotetyczne; to obecny stan poziomu, którego następca jest opóźniony o trzy miesiące.
Gdzie Gemini 3.1 Pro wciąż wygrywa
Uczciwa argumentacja na rzecz 3.1 Pro opiera się na trzech filarach i żaden z nich nie jest surową wydajnością. Po pierwsze, punkt końcowy narzędzi niestandardowych: Gemini 3.1 Pro jest udostępniany z dedykowanym interfejsem API bash/narzędzi niestandardowych, którego Flash nie dorównuje, a zespoły, które zbudowały narzędzia agentowe na jego podstawie, mają dziś działający system. Po drugie, zoptymalizowane obciążenia: potok już dostrojony do domyślnych ustawień dynamicznego myślenia, wzorców pamięci podręcznej i wyników ewaluacji 3.1 Pro jest ruchomym celem, a przejście na inne rozwiązanie kosztuje realny czas inżynierów, nawet jeśli cel jest szybszy i tańszy. Po trzecie, konkretne zadania, dla których dłuższa historia produkcyjna Pro nie ma odpowiednika we Flashu — benchmarki z generacji premiery, takie jak GPQA i ARC-AGI-2, na których Flash nigdy nie był testowany. Jeśli Twoje obciążenie należy do tych kategorii, stwierdzenie „Flash przewyższa Pro w indeksie” nie rozstrzyga Twojego pytania; dopiero test na własnej ewaluacji to robi.
Werdykt: co oznacza przejęcie warstwy Flash
Kierunek jest jednoznaczny. W przypadku nowego obciążenia dziś Gemini 3.7 Flash jest lepszym domyślnym modelem Gemini: tańszym, szybszym, stabilnym w wersji GA, wyżej notowanym w niezależnym indeksie i jako pierwszy dostaje nową funkcję wideo. Gemini 3.1 Pro zachowuje realną, choć wąską grupę odbiorców — użytkowników niestandardowych narzędzi, dostrojonych potoków i zadań, w których wciąż liczy się jego starszy wynik benchmarkowy. Szersza historia jest taka, że flagowy poziom Google'a utknął w miejscu, podczas gdy to na poziomie roboczym firma faktycznie konkuruje — a zespoły wciąż płacące flagowe ceny za 3.1 Pro płacą za status, którego sama firma przestała bronić.

Dla zespołów, które chcą migrować bez projektu, przejście między modelami Gemini to zmiana nazwy modelu, a nie integracja. Gemini 3.1 Pro jest serwowany na OrcaRouter w cenie katalogowej $2.00 / $12.00 przekazywanej dalej z zerowym narzutem, obok Gemini 3.6 Flash i pozostałej części routowalnej warstwy Gemini za jednym kluczem — więc obciążenie może wysyłać część ruchu do modelu Flash, utrzymywać 3.1 Pro jako rozwiązanie zapasowe dla zadań, w których wciąż wygrywa, oraz pozwolić, by automatyczne przełączanie awaryjne wchłonęło ryzyko zmian w którymkolwiek z modeli Google. Sam Gemini 3.7 Flash jest dostępny przez własne API Google oraz kilka platform zewnętrznych. DSL routingu i fuzja modeli to dokładnie to, jak przeprowadziłbyś bezpośrednie porównanie między dwoma modelami Gemini na własnej ewaluacji przed przełączeniem. Wybór, ku któremu popycha cię ta linia produktów, jest jasny: domyślnie stawiaj na warstwę Flash, a Pro zachowaj tylko dla wąskich przypadków, w których w sposób udowodniony zasługuje na swoją premię cenową.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
