Wygenerowana karta hero dla artykułu „Reflection Beam vs Claude Opus 5.5: Ten, do którego możesz zadzwonić już dziś, ten, na który musisz poczekać”, zatytułowanego „Reflection Beam vs Claude Opus 5.5”, z podtytułem „Ten, do którego możesz zadzwonić dziś, ten, na który musisz poczekać” i trzema chipami o treści „Lista oczekujących vs ogólna dostępność”, „Brak ceny vs $4 / $20” oraz „Tylko tekst vs multimodalność”.
Guides & Insights

Reflection Beam vs Claude Opus 5.5: Jeden dostępny już dziś, na drugi musisz poczekać

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Reflection Beam i Claude Opus 5.5 nie są jeszcze prawdziwymi rywalami, a powód jest administracyjny, a nie techniczny. Beam, pierwszy model Reflection, został ogłoszony 5 października 2026 roku i jest rzadkim modelem mieszaniny ekspertów (sparse mixture-of-experts) o 501 miliardach parametrów, aktywującym 23 miliardy parametrów na token — ale jest dostępny tylko poprzez listę oczekujących, jego wagi są obiecane na później w tym miesiącu na licencji Apache 2.0, a nigdzie nie opublikowano ceny. Opus 5.5 został wydany 22 września 2026 roku jako flagowy model Anthropic: okno 1 miliona tokenów, wejście tekstowe, obrazkowe i plikowe oraz cena katalogowa 4,00 USD za milion tokenów wejściowych i 20,00 USD za milion wyjściowych. Tak więc uczciwa wersja tego porównania jest taka, że jeden z tych modeli można wdrożyć produkcyjnie jeszcze dziś po południu przy znanym koszcie, a drugiego nie — a wszystko inne tutaj to prognoza dotycząca tego, co się stanie, gdy wagi zostaną udostępnione.

Krótka odpowiedź

Jeśli pytanie brzmi, na jakim modelu budować w tym tygodniu, to jest nim Opus 5.5 i nie ma co do tego większych wątpliwości: jest ogólnie dostępny, niezależnie oceniany, multimodalny, ma określoną cenę i jest udostępniany przez API, które można wywołać w pięć minut. Argumentacja Beama nie opiera się na pokonaniu Opusa 5.5 — nic w materiałach samego Reflection nie twierdzi, że tak jest. Opiera się na znacznie węższej tezie: że przy danym wyniku rozumowania Beam zużywa około jednej czwartej obliczeń inferencyjnych. Jeśli to się potwierdzi, gdy zmierzy to ktoś spoza Reflection, Beam staje się interesujący dla pracy o dużym wolumenie, w której odpowiedź musi być dobra, ale nie najlepsza. Jeśli nie, Beam to otwarty model ze środka stawki z listą oczekujących.

To, co następuje, oddziela te części tego starcia, które są dzisiejszymi faktami, od tych, które są zakładami.

Czym dokładnie jest każdy model

Opus 5.5 to zamknięty, hostowany następca Claude Opus 5, pozycjonowany przez Anthropic do wieloetapowych zmian w dużych bazach kodu, przeglądu kodu i długich sesji autonomicznych. Przyjmuje tekst, obrazy i pliki, zwraca tekst, oferuje okno kontekstowe o rozmiarze 1 000 000 tokenów z maksymalnie 128 000 tokenów wyjściowych oraz udostępnia rozszerzone myślenie z konfigurowalnym poziomem intensywności rozumowania. Nie jest modelem o otwartych wagach, a jego wiedza jest ograniczona datą odcięcia treningu Anthropic, a nie czymkolwiek, co kontrolujesz.

Reflection Beam to konstrukcja odwrotna. Ma łącznie 501 miliardów parametrów, z czego 23 miliardy są aktywne — około 4,6 proc. modelu aktywnych na token, agresywny współczynnik nawet w porównaniu z około 5,4 proc. w GLM 5.2 — zbudowany tak, aby był tani w obsłudze, a nie w trenowaniu. Jest wyłącznie tekstowy. Jego kontekst API wynosi 256 000 tokenów, z przypisem ostrzegającym, że ta liczba może się zmienić w trakcie bety, a maksymalna wielkość wyjścia to 128 000 tokenów. Punkt końcowy jest zgodny z OpenAI pod api.reflection.ai/openai/v1 i udostępnia Chat Completions oraz listę modeli, i nic więcej. Jego parametr reasoning_effort przyjmuje pięć wartości, domyślnie ma wartość medium i nie można go wyłączyć.

• Cena — Claude Opus 5.5: 4,00 USD za wejście i 20,00 USD za wyjście za milion tokenów, przy odczytach z pamięci podręcznej po 0,20 USD i zapisach do pamięci podręcznej po 5,00 USD, w porównaniu z Reflection Beam: nieopublikowane w poście na blogu, dokumentacji ani na liście modeli.

• Dostępność — Opus 5.5 jest od dziś ogólnie dostępny; Beam to lista oczekujących na wersję beta, przy czym wagi, raport techniczny i kartę modelu obiecano jeszcze w tym miesiącu.

• Modalność — Opus 5.5 obsługuje tekst, obrazy i pliki; Beam obsługuje tylko tekst.

• Kontekst — 1 000 000 tokenów wobec 256 000, przy czym liczba Beam jest opatrzona zastrzeżeniem dotyczącym wersji beta.

• Otwarte wagi — nie dla Opus 5.5, obiecane na licencji Apache 2.0 dla Beam, jeszcze niedostarczone.

• Niezależny wynik — Opus 5.5 go ma; Beam nie.

A generated two-column scoreboard titled 'Reflection Beam vs Claude Opus 5.5 — the scoreboard'. Left column 'Reflection Beam': Availability waitlisted beta; Price not published; Context 256,000 tokens (beta); Input text only; Open weights promised Apache 2.0, not out; Independent score none yet. Right column 'Claude Opus 5.5': Availability generally available; Price $4.00 / $20.00; Context 1,000,000 tokens; Input text, image, file; Open weights no; Independent score AA index 57.6. Footer reads 'Beam figures vendor-reported and unaudited. Opus 5.5 price is the provider list rate; its index is Artificial Analysis, read 6 October 2026.'

Cena jest tym elementem, którego nie da się porównać

Stawki 4,00 USD i 20,00 USD dla Opus 5.5 to cena katalogowa dostawcy, a w naszym cenniku są przekazywane bez zmian, bez niczego dodanego. Odczyty z pamięci podręcznej po 0,20 USD i zapisy do pamięci podręcznej po 5,00 USD mają ogromne znaczenie dla obciążenia, dla którego sprzedawany jest Opus 5.5 — długa sesja agentowa, która raz po raz odczytuje ten sam kod o rozmiarze 200 000 tokenów, płaci stawkę za pamięć podręczną za niemal całość, a nie stawkę za dane wejściowe. To realna i często niedoceniana dźwignia, którą warto zamodelować, zanim uznasz, że model frontierowy jest poza budżetem.

Beam nie ma porównywalnej liczby. Nie ma ceny katalogowej, z którą można by ją porównać, żadnego poziomu pamięci podręcznej do modelowania ani opublikowanej stawki dla wersji beta. Reflection nie powiedział, czy Beam będzie sprzedawany za token, rozliczany za miejsce, czy rozdawany wraz z wagami. Każdy, kto dziś podaje koszt za milion dla Beam, wymyśla go.

Praktyczna konsekwencja: porównanie cen nie brzmi „Opus 5.5 jest drogi, a Beam jest tańszy”. Brzmi: „jedno z nich ma cenę, a drugie ma datę”. Dla zespołu podejmującego decyzję dziś ta asymetria przesądza więcej niż benchmarki.

Benchmarki: dwie liczby, które się pokrywają, i dlaczego wciąż nie można ich porównać

Tabele startowe Reflection nie obejmują Opus 5.5 ani żadnego czołowego zamkniętego modelu. Zestaw porównawczy Reflection składa się w całości z modeli otwartych lub półotwartych: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max i DeepSeek V4.1 Flash. Tak więc każdą tabelę Beam kontra Opus trzeba zestawić ręcznie, a uczciwe zestawienie jej oznacza nazwanie różnic w harnessie, a nie ich wygładzanie.

Istnieją dokładnie dwa benchmarki, w przypadku których oba modele mają opublikowaną wartość, a żadna z tych par nie jest kontrolowana.

• Humanity's Last Exam — Reflection podaje, że Beam osiąga 36,2 bez użycia narzędzi; Artificial Analysis odnotowuje Opus 5.5 na poziomie 61,4. Dwa różne harnessy, dwie różne konfiguracje — wynik Opus 5.5 nie jest oznaczony jako „bez narzędzi” — a różnica dwudziestu pięciu punktów mówi mniej o modelach niż o samej konfiguracji.

• SciCode — Reflection podaje dla Beam 49,7; Artificial Analysis odnotowuje 66,9 dla Opus 5.5. Ten sam benchmark, ten sam problem: jedna liczba pochodzi z własnego przebiegu dostawcy, druga z zewnętrznego środowiska testowego.

Wszystko inne w ogóle się nie pokrywa. Tabela Beam opiera się na Terminal-Bench v2.1, podczas gdy obecny indeks Artificial Analysis działa na Terminal-Bench 4.0 — innej wersji tego samego zestawu, dlatego wyniki Beam 80,1 i Opus 5.5 59,6 na tej tablicy nie są porównaniem i nigdy nie powinny być drukowane obok siebie. W samym indeksie Artificial Analysis umieszcza Opus 5.5 na poziomie 57,6 w konfiguracji Max / Default Fallback, co daje czwarte miejsce wśród 147 modeli w tym przebiegu. Beam nie ma wiersza w indeksie: strony modeli zwracają 404, a ranking nie zawiera żadnego wpisu Beam na dzisiejszy poranek.

Jedyną naprawdę niezależną publicznie odnotowaną wypowiedzią o Beam jest stwierdzenie Artificial Analysis z 5 października, że Reflection dało Artificial Analysis dostęp i że niezależnie testuje ten model — oraz że wczesne wskaźniki sugerują, iż Beam będzie jednym z najbardziej oszczędnych pod względem tokenów otwartych modeli, jakie widziano na tym poziomie inteligencji. To mocne zdanie pochodzące z właściwego źródła, a wciąż zdanie bez liczby. To liczba zdecyduje o wyniku tego starcia.

A screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), captured 6 October 2026, showing the model name and id, Imtokens context, Max output 128K, input text + image + file, Vision & Tools and JSON Reasoning tags, the INPUT $4.00 and OUTPUT $20.00 pricing tiles, p50 TTFT 5.81 s, p95 TTFT 10.00 s, 48.5M tokens of 7-day traffic, the benchmark provenance lines 'Public benchmarks by Anthropic - 2026-09-22' and 'AI Analysis', and a code sample using base_url https://api.orcarouter.ai/v1.

Gdzie twierdzenie o wydajności naprawdę daje o sobie znać

Argument Reflection nie polega na tym, że Beam jest mądrzejszy od modelu frontierowego. Chodzi o to, że Beam osiąga wyniki porównywalne z GLM 5.2, zużywając przy tym 3 do 4 razy mniej mocy obliczeniowej na wnioskowanie, a różnica ta powiększa się w porównaniu z modelami z rodziny o 2 bilionach parametrów, do której należy Qwen 3.8-Max. Wykres, który za tym stoi, szacuje wygenerowane FLOPs jako dwukrotność liczby aktywnych parametrów pomnożoną przez średnią liczbę generowanych tokenów na próbę, a jego własny podpis przyznaje, że nie obejmuje to prefillu promptu, attention ani narzutu związanego z serwowaniem.

Jeśli wziąć to dosłownie, interesującym celem wcale nie jest Opus 5.5 — jest nim środek rynku. Opus 5.5 konkuruje pod względem możliwości na zadanie i wygrywa w zadaniach wymagających osądu: wieloetapowe refaktoryzacje, przegląd kodu, praca, w której błędna odpowiedź kosztuje więcej niż tokeny. Model, który jest aktywny w 4,6 procent na token, konkuruje kosztem na zadanie i wygrywa tam, gdzie dominuje wolumen, a poprzeczka jakości to „wystarczająco dobre i zweryfikowane na dalszym etapie”. To różne produkty, a porównanie, które stawia Beam naprzeciw Opus 5.5 na jednej tablicy wyników, mierzy niewłaściwą rzecz.

Istnieje efekt drugiego rzędu, który warto nazwać. Jeśli twierdzenie Beam o wydajności się utrzyma, jego naturalnym miejscem jest rodzaj obciążenia, w którym w przeciwnym razie wydawałoby się tokeny modelu czołowego na zadanie, do którego jest on nadmiernie wykwalifikowany. To decyzja o routingu, a nie wybór modelu, i dlatego kwestia ceny ma tu większe znaczenie niż kwestia benchmarku: nie można routować na podstawie kosztu do modelu, który nie ma kosztu.

Uruchamiając je obok siebie, gdy Beam jest wywoływalny

Opus 5.5 jest od dziś w naszej ofercie w cenie $4.00 i $20.00 za milion tokenów, cena katalogowa przekazana bez żadnych dodatków, a model ten sąsiaduje z ponad 200 innymi modelami za jednym kluczem zgodnym z OpenAI pod adresem api.orcarouter.ai/v1. Jeśli chciałbyś przeprowadzić test A/B obciążenia między modelem czołowym a tanim otwartym modelem, właśnie tak wygląda taka konfiguracja: dwa identyfikatory modeli, jeden klucz, żadnej drugiej umowy i żadnych zmian w kodzie — a automatyczne przełączanie awaryjne w routingu sprawia, że zły dzień u dostawcy nie pociąga za sobą twojego pipeline'u.

Beam nie może jeszcze być tego częścią i nie zamierzamy udawać, że jest inaczej. Reflection Beam nie należy do naszych tras i nie skierujemy cię do nikogo, kto mógłby go odsprzedawać. Gdy wagi trafią pod Apache 2.0, będziesz mógł hostować go samodzielnie i kierować ruch do własnego endpointu; do tego czasu jedyną drogą jest lista oczekujących Reflection.

W przypadku obciążenia, które rzeczywiście wymaga modelu typu frontier, porównania nie należy prowadzić z Beam. Należy je prowadzić ze wszystkim innym w katalogu: GLM 5.3 za $1.26 i $3.96, Qwen 3.8-Max za $2.00 i $6.00 oraz DeepSeek V4.1 Flash za $0.15 i $0.60, wszystkie odczytane na żywo dziś rano. To jest półka, na której znajdzie się Beam, jeśli zaoferuje konkurencyjne ceny, a to znacznie trudniejsze sąsiedztwo, niż sugeruje wykres premiery.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Co zmieniłoby ten werdykt?

Trzy rzeczy, w kolejności od tego, jak bardzo by miały znaczenie.

Wiersz Artificial Analysis dla Beam. Nie zapowiedź, że taki się pojawi — tylko ten wiersz. Jeśli indeks wyląduje blisko 57,6 Opus 5.5, a twierdzenie o efektywności tokenowej przetrwa konfrontację z harnessem strony trzeciej, dla środka rynku robi się naprawdę niekomfortowo, a Beam staje się domyślnym wyborem dla wielu zadań o dużym wolumenie. Jeśli wyląduje bliżej klastra open-weights w okolicach dolnych czterdziestek, Beam to solidny tani model i nic więcej.

Cena. Model bez stawki cennikowej nie może wygrać argumentu kosztowego, bo nie ma z czym porównać. Jeśli Beam wypadnie poniżej poziomu GLM 5.3, opowieść o wydajności bardzo szybko zmieni się w opowieść o budżecie. Jeśli wypadnie powyżej $0.15 i $0.60 DeepSeek V4.1 Flash bez przewagi w możliwościach, będzie miał trudności z pracą wolumenową, do której został stworzony.

Wagi. Dopóki nie istnieją, „open-weight” to stwierdzenie o licencji, której nie udzielono, i nikt nie może sprawdzić arytmetyki FLOPs przypadających na punkt na modelu, który faktycznie da się uruchomić. To jest ten sprawdzian, do którego Reflection zaprosił, ale jeszcze go nie umożliwił.

Dopóki co najmniej jedno z nich nie zostanie wdrożone, praktyczny wybór jest jednoznaczny. Opus 5. To model, który możesz przeanalizować, wycenić i na którym możesz oprzeć wdrożenia. Beam to model, któremu się przyglądasz.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie