
Reflection Beam vs Gemini 3.1 Pro Preview: Jeden czyta wideo, drugi czyta tekst
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Zacznijmy od asymetrii, o której nie wspomina żadna tabela benchmarków w tym porównaniu. Reflection Beam, ogłoszony 5 października 2026 roku, to rzadki model mieszaniny ekspertów o 501 miliardach parametrów, z 23 miliardami parametrów aktywnych na token, który przyjmuje tekst i zwraca tekst. Nic więcej. Gemini 3.1 Pro Preview, flagowy multimodalny model dostawcy od 19 lutego 2026 roku, przyjmuje tekst, obrazy, wideo, audio i pliki, i jest jedynym modelem w tym porównaniu, w którym na pytanie „czy widzi to, o co chcę zapytać” odpowiedź jest inna dla każdej ze stron. Wszystko inne — współczynniki rzadkości, okna kontekstowe, poziomy cenowe — to argument. Ten jeden to specyfikacja.
To oznacza również, że jest to najmniej symetryczna para w zestawie — i najbardziej użyteczna, ponieważ pokazuje, do czego właściwie służy porównanie modeli. Jeśli Twoim obciążeniem jest tekst, Beam i Gemini 3.1 Pro to dwie opcje na spektrum rozciągającym się od taniej i niezmierzonej do drogiej i gruntownie ocenionej. Jeśli w Twoim obciążeniu jest choćby jedna klatka wideo, nie ma czego porównywać.
Czym jest każdy model
Gemini 3.1 Pro Preview to flagowy model Google w warstwie preview: 1 048 576 tokenów kontekstu, maksymalnie 65 536 tokenów wyjściowych, pięć modalności wejściowych oraz okno 1 miliona tokenów osiągane przez drabinkę cenową, a nie jednolitą stawkę. Google pozycjonuje go jako rozwiązanie do ulepszonej inżynierii oprogramowania, większej niezawodności agentowej i efektywniejszego wykorzystania tokenów w złożonych przepływach pracy. Nie jest modelem z otwartymi wagami. Jego nazwa nadal zawiera „Preview”, status, który Google utrzymuje dla tego modelu od lutego.
Reflection Beam to pierwszy model Reflection i początek serii otwartych wag. 501 miliardów parametrów łącznie, 23 miliardy aktywne — około 4,6 procent modelu jest aktywne na token. 23,8 biliona tokenów wstępnego treningu na 6 144 chipach GB300 w niecałe cztery tygodnie, a następnie kampania uczenia ze wzmocnieniem na 10 500 chipach GB300 przez cztery tygodnie z ponad 100 milionami rolloutów w około milionie środowisk. Jego API jest zgodne z OpenAI pod adresem api.reflection.ai/openai/v1, z Chat Completions i listą Models, jego kontekst to 256 000 tokenów z przypisem beta, jego parametr reasoning_effort ma pięć poziomów i nie ma wyłącznika, a jego wagi obiecano na później w tym miesiącu na licencji Apache 2.0.
• Modalność — Gemini 3.1 Pro Preview przyjmuje tekst, obraz, wideo, audio i plik; Reflection Beam przyjmuje tylko tekst.
• Kontekst i wyjście — 1 048 576 tokenów wejściowych i 65 536 wyjściowych dla Gemini, w porównaniu z 256 000 tokenów wejściowych i 128 000 wyjściowych dla Beam.
• Cena — Gemini 3.1 Pro Preview po 2,00 USD za milion tokenów wejściowych i 12,00 USD za milion tokenów wyjściowych do 200 000 tokenów, wzrasta do 4,00 USD i 18,00 USD powyżej tego, z odczytami z pamięci podręcznej po 0,20 USD; Reflection Beam nie ma opublikowanej ceny.
• Zakres narzędzi — natywne wywoływanie narzędzi, strukturyzowane dane wyjściowe i grounding wyszukiwania po stronie Google; wywoływanie narzędzi i strukturyzowane dane wyjściowe po stronie Beam, z punktem końcowym ograniczonym do Chat Completions.
• Wagi — zastrzeżone dla Gemini; Apache 2.0 obiecane dla Beam, jeszcze nieudostępnione.
• Niezależny wynik — Gemini 3.1 Pro Preview ma indeks Artificial Analysis; Beam nie ma wiersza na tablicy.
Luka modalnościowa to cały argument
Warto być konkretnym, zamiast jedynie sugerować „multimodalność”, ponieważ praktyczne konsekwencje są ściśle określone.
Obciążenie, które przyjmuje nagranie ekranu, zdjęcie produktu, zeskanowany kontrakt lub plik audio z centrum obsługi telefonicznej, nie może zostać obsłużone przez Beam za żadną cenę, z żadnym promptem, w żadnym planie. Na poziomie API nie ma obejścia: dokumentacja Beam opisuje jedną modalność wejściową i jedną modalność wyjściową, a nie wymieniono żadnej ścieżki dla obrazu ani dźwięku. Gemini 3.1 Pro Preview obsługuje wszystkie pięć, co oznacza, że jest to jedyny model tutaj, który można wstawić do przepływu pracy, w którym dane wejściowe nie są już tekstem.
Odwrotny przypadek też warto omówić, bo to właśnie w nim ludzie się mylą. Jeśli dane wejściowe są tekstem i pozostaną tekstem, pięć modalności Gemini nie daje ci nic, a płacisz cenę modelu multimodalnego za uruchamianie obciążenia tekstowego. To nie jest argument za Beam — to argument, że kwestię modalności należy rozstrzygnąć przed kwestią benchmarku, ponieważ eliminuje opcje taniej i bardziej niezawodnie niż jakiekolwiek porównanie wyników.
Dwa podglądy, dwa różne znaczenia
Obie nazwy modeli niosą ze sobą zastrzeżenie, a zastrzeżenia te nie są do siebie podobne, co jest najciekawsze w tym zestawieniu.
„Preview” w nazwie Gemini 3.1 Pro to konwencja nazewnicza stosowana wobec modelu, który jest powszechnie dostępny do wywoływania od lutego, ma niezależny wynik, opublikowany cennik obejmujący udokumentowany poziom długiego kontekstu oraz pełny zestaw narzędzi. W praktyce „preview” oznacza tu, że Google zastrzega sobie prawo do zastąpienia go nowszą wersją, a nie że trudno go uzyskać albo że nie ma wyniku.
Beta Beama to prawdziwa brama. Dostęp odbywa się przez listę oczekujących, identyfikator modelu utworzono 5 października 2026 r., nie ma cennika ani oceny strony trzeciej, a artefakty, które pozwoliłyby komukolwiek zweryfikować główne twierdzenie — wagi, raport techniczny, karta modelu — są obiecywane, a nie dostarczane. Wartość kontekstu ma przypis ostrzegający, że może się zmienić podczas bety, co jest asekuracją, której nie potrzebuje żaden ogólnie dostępny model.
Konsekwencja jest asymetryczna w sposób, który ma znaczenie dla działu zakupów. Zespół, który wdraża Gemini 3.1 Pro Preview, akceptuje ryzyko związane ze zmianami modelu. Zespół, który wdraża dziś Beam, akceptuje nieznaną cenę, nieznany niezależny wynik oraz brak możliwości samodzielnego uruchomienia modelu. To różne kategorie ryzyka, a to cena najczęściej rozstrzyga.

Benchmarki i problem cytowania
Tabele opublikowane przy premierze Reflection nie obejmują Gemini 3.1 Pro Preview ani żadnego modelu Google. Zestaw porównawczy Reflection obejmuje wyłącznie modele otwarte i półotwarte: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max i DeepSeek V4.1 Flash. Oba modele nigdy więc nie zostały ze sobą zestawione w opublikowanej tabeli, a poniższe wartości pochodzą z różnych środowisk testowych po obu stronach.
• Artificial Analysis Index — Gemini 3.1 Pro Preview notuje 29,7, co daje mu 58. miejsce na 147 w jego przebiegu. Beam nie ma w ogóle wiersza w indeksie.
• GPQA Diamond — Gemini 3.1 Pro Preview z wynikiem 94,1 według Artificial Analysis w porównaniu z 90,5 podanymi przez producenta Beam.
• SciCode — 58,7 dla Gemini w porównaniu z raportowanym przez producenta wynikiem 49,7 dla Beam.
• Humanity's Last Exam — 47,0 dla Gemini wobec 36,2 podawanych przez producenta Beama, przy czym ten drugi wyraźnie bez narzędzi.
• Terminal-Bench v2.1 — 73,8 dla Gemini według Artificial Analysis wobec 80,1 raportowanych przez dostawcę Beama. To najmocniejszy wiersz Beama w tym pojedynku, a jednocześnie jest to żniwo na modelu, który jest na rynku od lutego.
• Przywoływanie informacji z długiego kontekstu — 82,0 dla Gemini wobec 79,3, które Beam podaje dla swojego rozwiązania w AA-LCR.
• tau-squared Bench — 95,6 dla Gemini w zestawieniu z wynikiem Beam wynoszącym 78,7 na MCP Atlas i 38,0 w tau3 banking. Powiązane ewaluacje agentowego użycia narzędzi, ale nie ta sama, a różnica w nazewnictwie ma znaczenie.
Istnieje osobny problem z uczciwością po stronie Gemini w tej tabeli, który zasługuje na własne zdanie. Niezależne wyniki indeksu dla Gemini 3.1 Pro Preview były cytowane jako 30, 46, 47,7 i 57 w różnych źródłach, a Artificial Analysis udostępnia różne wersje indeksu na różnych stronach modeli w tym samym momencie. Wartość 29,7 powyżej to ta ze strony, którą czytaliśmy 6 października 2026 r., i tylko ją będziemy cytować — ale każdy artykuł, który stawia pojedynczą liczbę indeksu Gemini obok konkurenta, nie mówiąc, z której migawki pochodzi, przedstawia nieustaloną liczbę jako ustaloną. Ta sama ostrożność odnosi się w drugą stronę do Beam, gdzie nie ma żadnej migawki.
Cena — i poziom, którego nikt nie planuje
Gemini 3.1 Pro Preview kosztuje 2,00 USD za milion tokenów wejściowych i 12,00 USD za milion tokenów wyjściowych do 200 000 tokenów, a powyżej tej granicy 4,00 i 18,00 USD. Odczyt z pamięci podręcznej kosztuje 0,20 USD za milion, a zapis do niej 0,375 USD. Granica progu to element, wokół którego warto planować: głównym argumentem sprzedażowym modelu jest okno o rozmiarze 1 048 576 tokenów, a w momencie, gdy żądanie przekroczy 200 000 tokenów, stawka za dane wejściowe podwaja się, a stawka za dane wyjściowe rośnie o połowę. Obciążenie zaprojektowane wokół okna miliona tokenów jest zatem obciążeniem wycenianym według drugiego progu przez większość swojego ruchu, a nie pierwszego.
Beam nie ma cennika stawek, więc nie ma poziomu do modelowania ani niczego do porównania. Ten brak nie jest neutralny: oznacza, że najtańszym możliwym do obrony stwierdzeniem na temat kosztu Beam jest to, że jest nieznany, a jedynym ilościowym wsparciem dla jego pozycjonowania w zakresie wydajności jest własny wykres Reflection, który szacuje wygenerowane FLOPs jako dwukrotność liczby aktywnych parametrów pomnożoną przez średnią liczbę wygenerowanych tokenów na próbę w DeepSWE, HLE i Terminal-Bench 2.1 — z podpisem przyznającym, że prefill promptu, attention i narzut związany z obsługą są wyłączone. W obciążeniach, w których kontekst o długości miliona tokenów ma znaczenie, prefill nie jest błędem zaokrąglenia i jest dokładnie tym składnikiem, który formuła pomija.

Użycie narzędzi, wyszukiwanie i gdzie różnią się oba projekty
Reklamowane atuty Gemini 3.1 Pro Preview to inżynieria oprogramowania, niezawodność działania agentów i oszczędność tokenów, a jego opublikowany zestaw narzędzi obejmuje wywoływanie funkcji, ustrukturyzowane dane wyjściowe i ugruntowanie w wyszukiwaniu. Ten ostatni punkt warto zauważyć, jeśli porównujesz stosy agentowe: wyszukiwanie ugruntowane to funkcja własna po stronie Google i zmienia to, co agent korzystający z narzędzi może zrobić bez podłączonej zewnętrznej usługi wyszukiwania informacji.
Historia narzędzi Beam jest ciekawsza, niż sugeruje wiersz specyfikacji, i trudniejsza do oceny. Reflection podaje MCP Atlas na 78,7, AutomationBench public na 37,0, tau3 banking na 38,0, BrowseComp z zarządzaniem kontekstem na 77,4 i DeepSearchQA z zarządzaniem kontekstem na 80,1 — i zauważa, że podczas uczenia ze wzmocnieniem model sam z siebie nauczył się odpytywać inne modele językowe i wywoływać API OCR, gdy dano mu dostęp do sieci, mimo że zadań przeglądania nie było w mieszance treningowej. Jeśli ta generalizacja się utrzymuje, to prawdziwy sygnał dotyczący transferu agentowego. Na tym etapie to również obserwacja dostawcy z przebiegu treningowego, bez niezależnej weryfikacji.
W wierszach dotyczących korzystania z narzędzi, w których obie strony podają liczby, obraz jest mieszany, a nie jednostronny. Tabela dostawcy Beama stawia go przed GLM 5.2 w MCP Atlas i na równi z GLM 5.2 oraz Kimi K3 w tau3 banking, podczas gdy wynik Gemini w tau-squared Bench na poziomie 95,6 to najwyższa liczba agentowa, jaką opublikowała którakolwiek ze stron. Różne zestawy testów, różne środowiska testowe i brak wspólnej ewaluacji — co jest powracającym problemem w tym porównaniu.
Wybór i jak się zabezpieczyć
Reguła decyzyjna, która z tego wynika, jest na tyle prosta, że można ją wyrazić w jednym zdaniu: jeśli którekolwiek dane wejściowe nie są tekstem, Beam nie wchodzi w grę i porównanie się kończy. Jeśli wszystkie dane wejściowe są tekstem, pytanie sprowadza się do tego, czy nieprzypisane twierdzenie Beam o wydajności jest warte nieznanej ceny i braku niezależnej oceny, w zestawieniu z modelem, który kosztuje 2,00 i 12,00 USD, ma udokumentowaną drabinkę cenową i pełny zestaw narzędzi.
Gemini 3.1 Pro Preview jest w naszym katalogu, ze stawką katalogową dostawcy przekazaną bez żadnych narzutów, za jednym kluczem zgodnym z OpenAI pod api.orcarouter.ai/v1 obok ponad 200 innych modeli — a ten sam klucz obsługuje modele, z którymi Beam konkuruje cenowo, od GLM 5.3 za 1,26 i 3,96 USD po DeepSeek V4.1 Flash za 0,15 i 0,60 USD, odczytane na żywo dziś rano. Ponieważ granica warstwy przy 200 000 tokenów to problem routingu, a nie problem modelu, DSL routingu pozwala wyrazić to wprost: krótkie żądania utrzymuj w taniej warstwie, a te naprawdę długie przypinaj tam, gdzie okno jest powodem, dla którego wybrałeś model — w jednym wywołaniu, a nie w kodzie aplikacji.
Reflection Beam nie jest jedną z naszych tras i nie skierujemy cię do nikogo, kto twierdzi, że go ma. Jeśli wagi Apache 2.0 pojawią się w tym miesiącu zgodnie z obietnicą, samodzielny hosting stanie się trzecią opcją dla pracy wyłącznie tekstowej, a twierdzenie o wydajności stanie się możliwe do przetestowania na twoim własnym sprzęcie.

Co zmieniłoby odpowiedź
Argumentacja Beam przeciwko Gemini opiera się na tych samych dwóch punktach, na których opiera się każde porównanie z Beam, a to starcie dodaje trzeci.
Cena. Bez niej argument o efektywności nie może zostać przełożony na decyzję budżetową, a model konkuruje diagramem, a nie cennikiem.
Niezależny wynik. Artificial Analysis powiedział 5 października, że Reflection przyznał mu dostęp i że prowadził benchmarking Beam, opisując wczesne wskaźniki jako sugerujące, że Beam będzie jednym z najbardziej oszczędnych pod względem tokenów otwartych modeli, jakie widziano na tym poziomie inteligencji. To właściwe źródło, które mówi właściwą rzecz, a na tablicy wciąż nie ma wiersza Beam — strony modeli zwracają 404, a ranking według stanu na dzisiejszy poranek nie zawiera żadnego wpisu Beam.
A rzecz, która się nie zmienia: Beam to tekst — żadne wydanie, żadna cena i żadne porównanie tego nie zmienia; co dla pewnej klasy obciążeń oznacza, że porównanie nigdy nie stanie się porównaniem. Jeśli na wejściu masz wideo, odpowiedź brzmiała Gemini 3.1 Pro już przed pierwszym.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
