
Gemini 3.7 Flash vs Grok 4.6: wojna cenowa Google vs agent samokontroli SpaceXAI
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0259Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0166Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
Trzy tygodnie po tym, jak Gemini 3.6 Flash w dużej mierze poniósł porażkę, Google obniżyło cenę o połowę i wypuściło Gemini 3.7 Flash — ruch, który większość komentarzy odczytała jako bezpośredni strzał w Grok 4.6, flagowy model SpaceXAI zoptymalizowany pod agentów, który wypuszczono dzień wcześniej w cenie 2 i 6 dolarów. Kluczowy jest tu timing: dwa modele z pogranicza czołówki, wypuszczone w odstępie jednego dnia, oba skierowane do tego samego odbiorcy — zespołu, który chce kodowania agentowego bez płacenia cen z czołówki — i wycenione według przeciwstawnych filozofii. Google kupuje sobie reakcję rynku pięciomiesięczną promocją. SpaceXAI sprzedaje zaufanie za zadanie w stałej cenie katalogowej.
Grok 4.6, wydany 12 sierpnia 2026 roku, jest udoskonaleniem modelu bazowego Grok 4.5 firmy SpaceXAI o 1,5 biliona parametrów, stworzonym z myślą o długo działających agentach, którzy weryfikują ukończenie własnych podzadań, z oknem kontekstowym 500 tys., wejściem tekstowo-obrazowym oraz stawką $2/$6, która podwaja się przy ponad 200 tys. tokenach wejściowych. Gemini 3.7 Flash, wydany 13 sierpnia 2026 roku, jest algorytmicznym udoskonaleniem Gemini 3.6 Flash firmy Google — kontekst 1M, wejście multimodalne obejmujące wideo i audio oraz promocyjna stawka $0,75/$3,75, która 1 stycznia 2027 roku podwaja się do $1,50/$7,50. W niezależnym indeksie Artificial Analysis Intelligence Index Grok 4.6 osiąga 61, wyraźnie powyżej wczesnych wyników wynoszących około 56 dla Gemini 3.7 Flash.
Wojna cenowa, jedna linia na wymiar.
• Cena za 1M tokenów wejściowych — Gemini 3.7 Flash $0.75 (promocyjnie) vs Grok 4.6 $2.00. Google jest o ponad 60% tańszy.
• Cena za 1M tokenów wyjściowych — Gemini 3.7 Flash $3.75 (cena promocyjna) vs Grok 4.6 $6.00.
• Po 1 stycznia 2027 — Gemini podwaja ceny do 1,50/7,50 USD, a Grok pozostaje bez zmian na poziomie 2/6 USD.
• Okno kontekstu — Gemini 3.7 Flash 1M vs Grok 4.6 500K.
• Rozliczanie długich wejść — Gemini pobiera stałą opłatę w całym oknie; Grok podwaja do $4/$12 przy wejściu 200K lub większym.
• Tokeny myślenia — Gemini rozlicza je jako tokeny wyjściowe; koszt Groka jest uwzględniony w niezależnie zmierzonym ~0,84 USD za zadanie.
Krótkie podsumowanie: Gemini 3.7 Flash jest dziś tańszy w każdej pozycji cennika, a większość tej przewagi znika 1 stycznia. Grok 4.6 kosztuje w sierpniu tyle samo, ile będzie kosztował w marcu.

Gdzie podziały się pieniądze Gemini 3.7 Flash
Własne dane Google'a pokazują duże skoki dla Gemini 3.7 Flash względem 3.6 Flash: 65,3% w DeepSWE v1.1 (wzrost z 49,0%), 43,6% w FrontierCode 1.1 Main (wzrost z 34,4%), 85,8% w Terminal-bench 2.1 (wzrost z 78,0%) oraz Elo 1588 w WebDev Arena (wzrost z 1538). Są to liczby podawane przez producenta, bez niezależnego potwierdzenia — tego rodzaju wskaźnik mierzy trajektorię, a nie werdykt w porównaniu między producentami. Ale właśnie trajektoria jest sednem: poprawki trafiły do użytkowników trzy tygodnie po premierze, którą recenzenci w większości skreślili, co pokazuje, że Google traktuje warstwę Flash jako pole bitwy, a nie flagowy produkt.
Inną rzeczą, jaką robi promocja Google, jest skrócenie okna zakupowego. Przy $0.75/$3.75 model jest wystarczająco tani, aby testować go na dużą skalę; przy $1.50/$7.50 jest nadal konkurencyjny, ale nie jest już bronią w wojnie cenowej. Każdy zespół produkcyjny, który wdroży go w oknie wprowadzenia, powinien ponownie ocenić jego opłacalność w grudniu, nie zakładając, że liczba zmieni się razem z nim.
Na co poszły pieniądze Groka 4.6
Argumentacja Groka 4.6 jest inna: nie chodzi o tańsze tokeny, lecz o mniej zmarnowanych. Został wytrenowany do samodzielnej weryfikacji — sprawdzania, czy podzadanie zostało faktycznie wykonane, zanim przejdzie dalej — a niezależne pomiary potwierdzają ten efekt: Artificial Analysis szacuje jego koszt na około 0,84 dolara za zadanie, z wynikiem GDPVal-AA v2 wynoszącym 1 753 i wskaźnikiem Intelligence Index na poziomie 61. To dane niezależnych podmiotów trzecich i stanowią najmocniejszy argument w tym porównaniu, ponieważ uwzględniają to, czego nie oddaje cena za token: model, który potrzebuje mniej kroków do wykonania zadania, jest tańszy w przeliczeniu na ukończone zadanie, nawet przy wyższej cenie za token.
Kompromis polega na tym, że tańszy model ma tu pole do poprawy. Kontekst 500K w Grok 4.6 to połowa z 1M w Gemini 3.7 Flash, a jego stawka $2/$6 podwaja się po przekroczeniu 200K wejścia — więc zadania o długim kontekście i dużej liczbie tokenów wejściowych to dokładnie scenariusz, w którym cena katalogowa Grok 4.6 przestaje być konkurencyjna w porównaniu z promocyjną stawką Gemini.
Ekonomia pojedynczego zadania
Przy cenie wprowadzającej średnia stawka Gemini 3.7 Flash przy podziale 80/20 wejście/wyjście wynosi mniej więcej 1,35 USD za milion tokenów; cena Grok 4.6 przy tym samym podziale to 2,80 USD za milion, zanim w grę wejdzie kara za długie wejście. Na papierze model Google wygląda na zdecydowanego zwycięzcę pod względem wolumenu. Komplikacja polega na tym, że tokeny myślowe Gemini są rozliczane jako wyjściowe, jego deklaracje dotyczące benchmarków mają tydzień, a jego wydajność na zadanie nie została jeszcze niezależnie zmierzona — podczas gdy Grok 4.6 już tak. Tanie tokeny plus zmarnowane tury mogą kosztować więcej niż drogie tokeny, które kończą zadanie, a to jest starcie, w którym jedna strona ma dane na ten temat, a druga nie.
Stawianie na nowy model bez stawiania na pipeline
Grok 4.6 jest na OrcaRouter w cenie katalogowej SpaceXAI wynoszącej 2/6 USD z 0% narzutu, w tym krok 2x powyżej 200K, który strona modelu pobiera na żywo z warstwy routingu. Gemini 3.7 Flash ma jeden dzień i jest dostępny we własnym API Google; jego poprzednik Gemini 3.6 Flash jest na OrcaRouter w cenie katalogowej Google.


Jeśli pytanie, które tak naprawdę stawia to porównanie, brzmi: „czy powinienem postawić mój pipeline agentowy na nowym tanim modelu", warstwa routingu jest zabezpieczeniem: reguła failover, która dziś uruchamia agenta na Grok 4.6, a gdy tylko pojawi się Gemini 3.7 Flash, przełącza na niego, albo panel fuzyjny, w którym odpowiadają oba modele, a sędzia uzgadnia ich odpowiedzi — rodzaj konfiguracji, do której powstał DSL routingu i która nie wymaga opowiadania się po żadnej stronie, zanim pojawią się dowody.
Uczciwa ocena
Jeśli chcesz najtańszy token dziś i ufasz trzytygodniowemu terminowi realizacji, Gemini 3.7 Flash to agresywny zakład — wojna cenowa jest prawdziwa, zyski w benchmarkach są udokumentowane, a okno wprowadzające to prawdziwy rabat. Jeśli chcesz modelu, którego wydajność agentowa jest mierzona niezależnie, którego cena nie zmienia się w styczniu, i którego pętla samoweryfikacji jest zaprojektowana do długotrwałej pracy, Grok 4.6 to konserwatywny wybór, a dane AA dają mu przewagę w koszcie na ukończone zadanie. Jedna strona to wyprzedaż z odliczaniem; druga to cena z udokumentowaną historią. Obie opcje są do obrony — właśnie dlatego to prawdziwe porównanie, a nie formalność.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
