
Reflection Beam udostępnia API w wersji beta, a wagi będą dostępne za dwa tygodnie
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Pierwszy model Reflection nosi nazwę Reflection Beam, a najciekawsze w nim tego poranka nie jest to, że istnieje — lecz to, że istnieje tylko połowa. Firma ogłosiła Beam 5 października 2026 roku jako rzadki model typu mixture-of-experts o łącznej liczbie 501 miliardów parametrów i 23 miliardach aktywnych na token, a tego samego dnia udostępniła przed nim punkt końcowy w wersji beta zgodny z OpenAI. Wagi mają zostać udostępnione w późniejszej części tego miesiąca na licencji Apache 2.0, wraz z raportem technicznym, kartą modelu i stosem serwującym. Dopóki się nie pojawią, jedynymi osobami, które mogą uruchomić Beam-501B-A23B, są ci, którym Reflection przekaże klucz z listy oczekujących, a każda krążąca liczba dotycząca wydajności pochodzi z własnych tabel jednego laboratorium.
To dziwne miejsce, by premiera miała się na tym zatrzymać, i warto być precyzyjnym co do tego, którą połowę mamy. Reflection wydało wersję zapoznawczą, na którą można się zapisać, oraz zestaw tabel z wynikami benchmarków, których nikt nie odtworzył. Nie wydało tego, do czego odnosi się „open-weight” w nagłówku.
Co dziś rano jest faktycznie na żywo?
Wszystko w tej sekcji pochodzi z własnego wpisu na blogu i dokumentacji Reflection, przeczytanych 6 października 2026 r.
• Identyfikator modelu — Beam-501B-A23B, utworzony 5 października 2026, udostępniany pod adresem api.reflection.ai/openai/v1 z Chat Completions i listą Models i niczym więcej.
• Kształt — 501 miliardów parametrów całkowitych, 23 miliardy aktywne na token, co daje współczynnik aktywacji około 4,6 procent. Dla porównania GLM 5.2 plasuje się blisko 5,4 procent.
• Kontekst — 256 000 tokenów w API, z przypisem dołączonym do samej liczby, ostrzegającym, że okno może się zmienić w trakcie wersji beta. Maksymalna liczba tokenów wyjściowych to 128 000.
• Rozumowanie — parametr reasoning_effort z pięcioma ustawieniami: low, medium, high, xhigh i max. Domyślnym ustawieniem jest medium, a model zawsze rozumuje. Nie ma możliwości wyłączenia ani trybu bez rozumowania.
• Modalność — tekst na wejściu, tekst na wyjściu. Brak wprowadzania obrazu, dźwięku lub wideo na starcie.
• Cena — nie została ujawniona. Wpis na blogu jej nie zawiera, dokumentacja jej nie zawiera, a konsola platformy znajduje się za bramką rejestracji.
• Dostęp — lista oczekujących. Nie ma ścieżki samoobsługowej ani wag, więc nie ma pobierania, kwantyzacji ani dostrajania.
To kwestia ceny zmienia sposób, w jaki czytasz wszystko inne. Cztery z siedmiu modeli, z którymi Beam jest porównywany w tabelach samego Reflection, mają publiczne ceny katalogowe, które możesz dziś wpisać do arkusza kalkulacyjnego. Beam ich nie ma, więc wszelkie obecne twierdzenia o jego kosztach dotyczą mocy obliczeniowej, a nie dolarów.

Liczba, od której zależy start
Propozycja wartości Reflection to wydajność wnioskowania — i jest ona niezwykle konkretna co do tego, co to oznacza: na zaawansowanych benchmarkach rozumowania Beam osiąga wyniki porównywalne z GLM 5.2, zużywając przy tym 3–4× mniej mocy obliczeniowej do wnioskowania. Mówi się, że zyski są jeszcze większe względem modeli z rodziny o 2 bilionach parametrów, do której należy Qwen 3.8-Max.
Wykres stojący za tym twierdzeniem wart jest uważnej lektury, ponieważ stanowi kluczowy dowód w całym poście. Przedstawia wynik rozumowania w zestawieniu z szacowaną liczbą FLOP-ów wnioskowania w benchmarkach DeepSWE, Humanity's Last Exam i Terminal-Bench 2.1, a liczbę FLOP-ów szacuje jako w przybliżeniu dwukrotność liczby aktywnych parametrów pomnożoną przez średnią liczbę wygenerowanych tokenów na próbę. Ten wzór celowo pomija wstępne wypełnianie promptu, operacje uwagi zależne od kontekstu i narzut związany z obsługą — Reflection mówi o tym w podpisie. To spójne porównanie między modelami, a nie pomiar czyjegokolwiek rachunku, i zarazem jedyne ilościowe poparcie dla twierdzenia o efektywności, napisane przez laboratorium, które zbudowało model. Traktuj to jako hipotezę, którą dzięki wagom będzie mógł przetestować ktoś inny.
To, co ta architektura faktycznie daje w praktyce, to profil serwowania. Dwadzieścia trzy miliardy aktywnych parametrów to model, który można realnie uruchomić na stosunkowo niewielkiej liczbie GPU przy opóźnieniu interaktywnym, co czyni go innym produktem niż gęsty model o 501 miliardach parametrów, nawet jeśli liczba na karcie jest taka sama. Właśnie dlatego Reflection może mówić o rozumowaniu zbliżonym do czołówki, nie mówiąc o wdrożeniu w skali centrum danych — i dlatego przyszłe udostępnienie wag jest wydarzeniem, które ma większe znaczenie niż klucz beta.
Gdzie Beam wypada we własnych tabelach Reflection
Każda liczba poniżej pochodzi od dostawcy, z tabel w poście premierowym Reflection, i żadna z nich nie została niezależnie odtworzona. Tam, gdzie Reflection nie opublikował liczby dla danego modelu, w oryginale w komórce widnieje NR. Kolumny porównawcze należą do Reflection, a nie do nas ani do strony trzeciej.
Kodowanie i praca w terminalu
• Terminal-Bench v2.1 — Reflection Beam 80,1 w porównaniu z GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen 3.8-Max 86,6 i DeepSeek V4.1 Flash 90,6. Beam plasuje się poniżej każdego z nich.
• SWE-Bench Verified — Reflection Beam 80,9 w porównaniu z Inkling 77,6 i Nemotron 3 Ultra 70,7. To tutaj Beam wypada najsilniej, ale warto zauważyć, że tylko dwa najsłabsze modele z listy zostały na nim uruchomione.
• SWE-Bench Pro v1 — Reflection Beam 65,5 wobec Qwen 3.8-Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Reflection Beam 77,2 wobec Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9. Dziesięciopunktowa luka do szczytu tabeli.
• DeepSWE v1.1 — Reflection Beam 44,4 wobec DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen 3.8-Max 51,0, GLM 5.2 44,0. Beam plasuje się na poziomie poprzedniej generacji i o trzydzieści punktów za liderem.
• SWE Atlas Codebase QnA — Reflection Beam 34,6 w porównaniu z Kimi K3 68,0 i GLM 5.3 61,0. Utrzymanie dużego repozytorium w pamięci podczas długiej interakcji to najtrudniejsza rzecz na tej liście, a wynik Beam 34,6 nie jest różnicą zaokrąglenia.
Rozumowanie i nauka
• AIME 2026 — Reflection Beam 97,8 w porównaniu z GLM 5.2 99,2 i Inkling 97,1.
• HLE bez narzędzi — Reflection Beam 36,2 wobec Kimi K3 46,9, Qwen 3.8-Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7. W środku stawki, wyprzedzając jedynie dwa modele poprzedniej generacji.
• GPQA Diamond — Reflection Beam 90,5 wobec Kimi K3 93,5, Qwen 3.8-Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9.
• SciCode — Reflection Beam 49,7 wobec GLM 5.3 59,0, Kimi K3 58,7, Qwen 3.8-Max 52,1, DeepSeek V4.1 Flash 52,0.
• CriPT AA — Reflection Beam 16,3 w porównaniu z Kimi K3 23,4, GLM 5.2 20,9, Qwen 3.8-Max 20,0, GLM 5.3 19,1, DeepSeek V4.1 Flash 14,3, Inkling 5,4, Nemotron 3 Ultra 3,1.
Narzędzia, wyszukiwanie i długi kontekst
• MCP Atlas — Reflection Beam 78,7 wobec Qwen 3.8-Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8.
• AutomationBench, publiczna część — Reflection Beam 37,0 w porównaniu z DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen 3.8-Max 39,8, GLM 5.2 26,2.
• tau3 banking — Reflection Beam 38.0 przeciwko Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1.
• BrowseComp z zarządzaniem kontekstem — Reflection Beam 77.4 w porównaniu z Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4.
• DeepSearchQA z zarządzaniem kontekstem — Reflection Beam 80,1 w porównaniu z Kimi K3 95,0.
• AA-LCR — Reflection Beam 79,3 wobec Kimi K3 88,7, DeepSeek V4.1 Flash 84,0, Qwen 3.8-Max 80,3, GLM 5.3 79,7, Nemotron 3 Ultra 79,3, GLM 5.2 78, Inkling 77,3. Odtwarzanie w długim kontekście to jedyny wiersz ogólnych możliwości, w którym Beam jest naprawdę konkurencyjny, a nie przeciętny.
Przeczytaj cztery tabele razem, a wyłania się spójny obraz: Beam pokonuje dwa modele poprzedniej generacji na liście Reflection i przegrywa z obecnym, w niemal każdym wierszu, różnicami od niewielkich po dyskwalifikujące. To, że dostawca publikuje tabele, w których jego własny model pozostaje w tyle w tak wielu wierszach, dobrze świadczy o uczciwości laboratorium. To nie jest oznaka, że model jest na czele.

Jedyny jak dotąd niezależny głos — i czego nie mówi
Jedyną odnotowaną oceną strony trzeciej jest Artificial Analysis, które 5 października poinformowało, że Reflection przyznało mu dostęp i że niezależnie prowadzi testy porównawcze modelu Beam, dodając, że wczesne wskaźniki sugerują, iż Beam będzie jednym z najbardziej tokenowo wydajnych otwartych modeli, jakie zaobserwowało na jego poziomie inteligencji.
To znaczące oświadczenie ze strony organizacji, której indeks jest tym, który faktycznie czyta większość nabywców, a jednocześnie oświadczenie, w którym nie ma żadnej liczby. Na dzisiejszy poranek w tabeli wyników Artificial Analysis nie ma wiersza Beam — strony modeli zwracają 404, a dane tabeli wyników nie zawierają żadnego wpisu Beam — więc twierdzenie o efektywności tokenowej jest na razie obietnicą strony trzeciej, że coś opublikuje. Nic w indeksie nie zostało jeszcze przeliczone na Beam.
Ujawnienie informacji o treningu, które jest najmocniejszą częścią wydania
Sekcja inżynieryjna wpisu Reflection zawiera liczby, które większość laboratoriów zachowuje dla siebie, a warto je odnotować, bo to ta część wydania, która wciąż będzie interesująca za miesiąc.
• Pre-trening — 23,8 biliona wyselekcjonowanych tokenów na 6 144 układach NVIDIA GB300 w szafach NVL72, ukończony od początku do końca w mniej niż cztery tygodnie, przy raportowanym 92,3 procent goodput, z dziewięcioma półautomatycznymi przewinięciami po drodze, przypisywanymi skokom normy gradientu lub podejrzeniu cichej korupcji danych.
• Uczenie ze wzmocnieniem — 10 500 chipów GB300 przez cztery tygodnie, ponad 100 milionów rolloutów, maksymalny kontekst rolloutu wynoszący 256 000 tokenów, około 1,3 miliarda piaskownic i około miliona odrębnych środowisk pozyskanych do zadań programistycznych, agentowych i STEM.
• Serwowanie — nowe wagi docierały do floty inferencyjnej w medianie około 12 sekund, a hierarchiczna dystrybucja zmniejszyła ruch międzyszafowy o 75 procent i sprawiła, że wdrożenie w całej flocie było 2,2× szybsze niż pobieranie wag samodzielnie przez każdą replikę.
• Stabilność — w pełni asynchroniczne gradienty polityki, które pozostają numerycznie stabilne podczas uczenia się na interakcjach opóźnionych o dzień, a także regulowana kara za długość, pozwalająca wymieniać długość rozumowania na wynik bez konieczności ponownego trenowania.
• Dane — około 95 procent surowych tokenów internetowych wyeliminowano poprzez parsowanie, deduplikację i selekcję, przy czym twierdzi się, że konwencjonalne filtry pominęłyby około 1,8 biliona tokenów, które Reflection zachował, w tym 87 procent jego wyselekcjonowanych tokenów web-code.
Dwie linijki zasługują na oznaczenie flagą. W poście napisano, że midtraining wydłuża efektywny kontekst Beama do 1 miliona tokenów, podczas gdy dokumentacja API podaje limit serwowania wynoszący 256 000 tokenów, z przypisem o wersji beta. To możliwość po stronie treningu i ograniczenie po stronie serwowania, a nie sprzeczność, ale ta różnica jest dokładnie tym, co staje się nagłówkiem „kontekst 1M”, jeśli nikt nie przeczyta drugiego dokumentu. A liczba ponad 100 milionów rolloutów w RL jest przedstawiana jako jeden z największych tego typu przebiegów w jakimkolwiek otwartym laboratorium, co jest twierdzeniem o skali, a nie o tym, co ta skala dała — krzywa wyniku w zależności od liczby rolloutów należy do dostawcy i kończy się tam, gdzie dostawca przestał ją wykreślać.

Co możesz dziś zrobić z Reflection Beam
Jedna rzecz: zapisz się na listę oczekujących i, jeśli dostaniesz klucz, wywołaj Beam-501B-A23B za pośrednictwem własnego endpointu Reflection przy użyciu klienta w stylu OpenAI. Nie ma opublikowanej ceny, więc nie da się modelować kosztu obciążenia przy jego użyciu. Nie ma wag, więc nie ma samodzielnego hostowania, kwantyzacji ani odtwarzania przez strony trzecie. Nie ma niezależnego wiersza benchmarku, więc cały powyższy obraz wydajności opiera się na tabelach jednego laboratorium.
Reflection Beam nie jest jedną z naszych tras i nie zamierzamy sugerować, że nią jest. Możemy ci dać poziom cen w obszarze, do którego próbuje wejść, odczytany na żywo z naszego własnego katalogu dziś rano: GLM 5.2 po $1.40 za wejście i $4.40 za wyjście za milion tokenów, GLM 5.3 po $1.26 i $3.96, Qwen 3.8-Max po $2.00 i $6.00 oraz DeepSeek V4.1 Flash po $0.15 i $0.60. To rozpiętość ponad dziewięciokrotna między najtańszym a najdroższym już na samym wejściu — i dlatego model beta bez ceny katalogowej naprawdę trudno wpasować w decyzję, niezależnie od tego, jak dobrze wygląda jego wykres wydajności.
OrcaRouter obsługuje jeden klucz zgodny z OpenAI w tych czterech i ponad 200 innych modelach, przekazując cenę katalogową dostawcy bez żadnych dodatków, więc zmiana ceny przez dostawcę jest widoczna u nas tego samego dnia, a nie wtedy, gdy reseller odświeży tabelę. Automatyczne przełączanie awaryjne jest częścią routingu, a nie czymś, co trzeba budować wokół każdego dostawcy, co oznacza, że model o niepotwierdzonej jakości — bez reprodukcji, bez niezależnej oceny i bez ceny — jest dokładnie tym, co umieszcza się na części ruchu, a nie na ścieżce krytycznej.
Kiedy twierdzenie staje się testowalne
Trzy rzeczy to rozstrzygają, a dwie z nich znalazły się w tym miesiącu za sprawą Reflection.
Pierwsze to wagi. Apache 2.0 plus raport techniczny pozwala każdemu, kto ma kilka węzłów, zmierzyć to, co się liczy — liczbę tokenów na sekundę na GPU przy ustalonym progu jakości — i sprawdzić, czy 23 miliardy aktywnych parametrów naprawdę dają wynik na FLOP, który sugeruje wykres. Do tego czasu argument o wydajności to arytmetyka na serwetce, a każdy, kto go powtarza, powtarza podpis Reflection.
Druga kwestia to cena. Model bez ceny katalogowej nie ma czego szukać w porównaniu kosztów. Jeśli Beam wyląduje powyżej poziomu GLM i DeepSeek, historia z obliczeniami przestaje mieć znaczenie dla każdego, kto ma budżet; jeśli wyląduje poniżej, obraz szybko się zmienia.
Trzeci to indeks. Artificial Analysis poinformowało, że testuje Beam w benchmarku i nie opublikowało żadnej liczby. Gdy ten wiersz się pojawi, będzie to pierwsza liczba w tej historii, której Reflection nie obliczyło.
Jeśli potrzebujesz dziś sprawnego programisty agentowego i chcesz wiedzieć, ile to kosztuje, odpowiedzią wciąż nie jest Reflection Beam. Może będzie nią za trzy tygodnie. Model, na którego twierdzenie o wydajności warto postawić, to ten, którego wagi możesz pobrać i którego FLOP-y możesz sam policzyć — a w tym teście Reflection dał nam datę i listę oczekujących, a nie model.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
