Wygenerowana karta hero zatytułowana „Reflection Beam: 501B parametrów, 23B aktywnych”, z podtytułem „Sparse MoE / 23,8 bln tokenów wstępnego trenowania / kontekst API 256K tokenów / wagi obiecane w tym miesiącu / każda liczba zgłoszona przez dostawcę”. Pod tekstem znajdują się trzy płaskie ikony liniowe: diagram warstwowy, w którym większość warstw jest przygaszona, a jedna wyróżniona, stojak z dziewięcioma modułami serwerowymi oraz zarys dokumentu z małą kłódką. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Reflection Beam, wyjaśnienie: 501B parametrów, 23B aktywnych i wagi, które nie zostały jeszcze udostępnione

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

5 października 2026 roku Reflection ogłosiło Reflection Beam, rzadki językowy model mieszanki ekspertów z łączną liczbą 501 miliardów parametrów, z których 23 miliardy są aktywowane na token, i tego samego dnia udostępniło przed nim wersję beta endpointu zgodnego z OpenAI. To 4,6 procent modelu czuwającego w dowolnym momencie — agresywny współczynnik nawet jak na standardy obecnej dziedziny otwartych wag — i to właśnie na tej liczbie opiera się cały start. Reflection twierdzi, że pełne wagi, raport techniczny i karta modelu pojawią się jeszcze w tym miesiącu na licencji Apache 2.0. Na dziś ich nie ma, cena nie została opublikowana nigdzie w zasobach samego Reflection, a Artificial Analysis nie ma wiersza dla tego modelu. Uczciwe podsumowanie premiery jest więc takie: bardzo konkretne twierdzenie o wydajności, wysunięte przez laboratorium, które wytrenowało model, a wszystkie liczby potwierdzające pochodzą od tego laboratorium.

Własne tabele porównawcze Reflection stawiają Reflection Beam obok Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max i DeepSeek V4.1 Flash, co daje uczciwy obraz poziomu, na który celuje: mocne, choć nie czołowe modele otwarte i półotwarte, z których kilka stanowi ułamek rozmiaru Beam. Beam nie wygrywa z tą stawką pod względem surowych możliwości i pokażemy dokładnie, gdzie przegrywa. To, co deklaruje, to zbliżenie się do jej szczytu przy zużyciu około trzy do czterech razy mniejszej mocy obliczeniowej wnioskowania niż GLM 5.2 przy porównywalnych wynikach rozumowania. To twierdzenie jest tematem tego artykułu.

Co tak naprawdę istnieje dzisiaj

Wszystko w tej sekcji pochodzi z własnej dokumentacji Reflection, przeczytanej 6 października 2026. API działa w wersji beta za listą oczekujących; wagi nie zostały jeszcze udostępnione.

ID modelu — Beam-501B-A23B, utworzono 5 października 2026.

• Interfejs — powierzchnia kompatybilna z OpenAI pod adresem api.reflection.ai/openai/v1, udostępniająca Chat Completions i listę Models, i nic więcej. Brak Completions, brak embeddings, brak batches.

• Kontekst — 256 000 tokenów, z przypisem dołączonym do samej liczby: „Okno kontekstu może się zmienić w wersji beta”. Maksymalna liczba tokenów wyjściowych to 128 000.

• Rozumowanie — parametr reasoning_effort z pięcioma wartościami: low, medium, high, xhigh i max. Wartością domyślną jest medium, a model zawsze rozumuje, niezależnie od ustawienia — nie ma możliwości wyłączenia.

• Modalność — tekst na wejściu, tekst na wyjściu. Brak wejścia obrazu lub dźwięku w momencie premiery, co stanowi rzeczywistą różnicę w porównaniu z Inkling, modelem stawiającym multimodalność na pierwszym miejscu, który Thinking Machines Miry Murati wypuściło w lipcu.

• Granica wiedzy — 30 czerwca 2026.

• Cena — niepublikowana. Post na blogu Reflection, jego dokumentacja i jego lista modeli — wszystkie ją pomijają, a konsola platformy znajduje się za ścianą rejestracji.

Ta ostatnia linia ma większe znaczenie, niż się wydaje. Każdy inny model w zestawie porównawczym Beam ma publiczną cenę katalogową, którą można dziś wpisać do arkusza kalkulacyjnego. Beam nie ma, co oznacza, że każdy argument dotyczący jego kosztów w tej chwili jest argumentem o mocy obliczeniowej, a nie o dolarach.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

Stosunek 501 do 23 jest argumentem

Rzadkość nie jest nowa; pytanie brzmi, jak daleko laboratorium jest gotowe ją posunąć. GLM 5.2 wykorzystuje około 40 miliardów aktywnych parametrów z łącznej liczby raportowanej w okolicach 744 miliardów — około 5,4 procent. Reflection Beam plasuje się na poziomie 4,6 procent z 501 miliardów. Na papierze to skromny dalszy krok, a Reflection ostrożnie podchodzi do tego, co mu przypisuje.

Wskaźnik efektywności w poście premierowym pochodzi z wykresu opartego na danych Artificial Analysis i DataCurve, przedstawiającego wynik rozumowania w zestawieniu z szacowanymi FLOP-ami wnioskowania, gdzie FLOP-y są przybliżane jako dwukrotność liczby aktywnych parametrów pomnożona przez średnią liczbę wygenerowanych tokenów. Ten wzór celowo pomija wstępne wypełnianie promptu, koszt uwagi i narzut obsługi. To model szacunkowy na serwetce, a nie pomiar, i Reflection nie przedstawia go jako pomiaru — ale jest to także jedyne ilościowe poparcie dla twierdzenia o „3 do 4× taniej przy tym samym wyniku”, i został napisany przez dostawcę. Traktuj go jako hipotezę, którą wagi, gdy się pojawią, pozwolą komuś innemu przetestować.

To, co ta architektura daje w praktyce, to profil serwowania. Dwadzieścia trzy miliardy aktywnych parametrów to model, który można uruchomić na stosunkowo niewielkiej liczbie GPU przy interaktywnej latencji, a to inny produkt niż gęsty model o 501 miliardach parametrów, mimo że liczba parametrów na karcie jest taka sama. To właśnie dlatego Reflection może mówić o rozumowaniu zbliżonym do czołówki, nie mówiąc o wdrożeniu w skali centrum danych.

Mniej niż cztery tygodnie na wstępne wytrenowanie, a ujawnione informacje są wyjątkowo szczegółowe

Relacja z treningu to ta część publikacji, która czyta się jako autentycznie informacyjna, ponieważ Reflection opublikowało liczby, które większość laboratoriów zachowuje dla siebie.

• Wstępne trenowanie — 23,8 biliona tokenów na 6144 układach GB300 w szafach NVL72, ukończone w niecałe cztery tygodnie przy raportowanej efektywnej przepustowości (goodput) na poziomie 92,3 proc., z dziewięcioma cofnięciami do punktów kontrolnych po drodze.

• Uczenie ze wzmocnieniem — 10 500 chipów GB300 przez cztery tygodnie, ponad 100 milionów rolloutów, maksymalny kontekst rollouta wynoszący 256 000 tokenów, około 1,3 miliarda sandboxów i około miliona odrębnych środowisk, przy średnio 110 000 rolloutów działających jednocześnie.

• Trening średni — rozszerza efektywny kontekst modelu do 1 miliona tokenów.

• Stabilność — asynchroniczne gradienty polityki, które pozostają stabilne przy dezaktualizacji sięgającej dni, a do tego kontrolowana kara za długość, dzięki której długość rozumowania można dostroić bez ponownego trenowania.

Przeczytaj razem wiersze dotyczące wstępnego trenowania i RL, a kształt tej tezy się wyłoni. Historia efektywności nie dotyczy tylko aktywnych parametrów podczas wnioskowania; chodzi także o to, jak szybko model został wytrenowany i jaka część obliczeń trafiła do RL związanego ze środowiskiem, a nie do większej liczby tokenów. Milion środowisk i 1,3 miliarda piaskownic to stwierdzenie o infrastrukturze do trenowania użycia narzędzi i pracy agentowej, i jest ono spójne z benchmarkami, od których Reflection postanowiło zacząć.

Jedna liczba zasługuje na flagę. Blog mówi, że midtraining rozszerza efektywny kontekst do 1 miliona tokenów; dokumentacja API podaje limit serwowania wynoszący 256 000 tokenów z dołączonym przypisem o wersji beta. To możliwość po stronie treningu i limit po stronie serwowania, a nie sprzeczność — ale ta rozbieżność jest dokładnie tym, co staje się nagłówkiem „1M kontekstu”, jeśli nikt nie przeczyta drugiego dokumentu, a kto w przyszłym tygodniu będzie pisał o Beam, powinien przeczytać drugi dokument.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

Benchmarki: gdzie Reflection Beam wygrywa, a gdzie nie

Każda liczba poniżej została podana przez dostawcę, pochodzi z tabel w poście o premierze Reflection i żadna z tych wartości nie została niezależnie odtworzona. Kolumny porównawcze zawierają te same liczby, które Reflection opublikował dla pozostałych modeli; tam, gdzie w oryginale w komórce widnieje „NR”, model nie został uruchomiony. Nie ma wiersza Artificial Analysis dla Beam, więc nic tutaj nie przeszło przez narzędzie testowe strony trzeciej.

Kodowanie agentowe

• Terminal-Bench v2.1 — Beam 80,1 kontra GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.

• SWE-Bench Pro v1 — Beam 65,5 vs Qwen3.8 Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.

• SWE-Bench Pro v2-Hard — Beam 77,2 vs Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9.

• SWE-Bench Verified — Beam 80,9 vs Inkling 77,6, Nemotron 3 Ultra 70,7.

• SWE-Bench Multilingual — Beam 78,0 vs Nemotron 3 Ultra 67,7.

• DeepSWE v1.1 — Beam 44,4 vs DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen3.8 Max 51,0, GLM 5.2 44,0.

• SWE Atlas Codebase QnA — Beam 34.6 vs Kimi K3 68.0, GLM 5.3 61.0.

To ten ostatni wiersz, nad którym warto się zatrzymać. Odpowiadanie na pytania dotyczące repozytoriów w długim horyzoncie to dziedzina, w której model musi utrzymać bazę kodu w głowie przez długą interakcję, a 34,6 kontra 68,0 to nie różnica wynikająca z zaokrąglenia. DeepSWE opowiada podobną historię: 44,4 stawia Beam na równi z GLM 5.2 i daleko za DeepSeek V4.1 Flash.

Rozumowanie

• AIME 2026 — Beam 97,8 vs GLM 5.2 99,2, Inkling 97,1.

• HLE, bez narzędzi — Beam 36,2 vs Kimi K3 46,9, Qwen3.8 Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7.

• GPQA Diamond — Beam 90.5 vs Kimi K3 93.5, Qwen3.8 Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9, Inkling 87.2, Nemotron 3 Ultra 87.

• SciCode — Beam 49.7 vs GLM 5.3 59.0, Kimi K3 58.7, Qwen3.8 Max 52.1, DeepSeek V4.1 Flash 52.0, Inkling 46.1, Nemotron 3 Ultra 44.6.

• CriPT AA — Beam 16,3 kontra Kimi K3 23,4, GLM 5.2 20,9, Qwen3.8 Max 20,0, GLM 5.3 19,1, DeepSeek V4.1 Flash 14,3, Inkling 5,4, Nemotron 3 Ultra 3,1.

Profil rozumowania Beama plasuje się w środku stawki, a wzorzec jest spójny: z wyraźną przewagą nad dwoma modelami z poprzedniej generacji na liście Reflection, ale za obecnym. GPQA Diamond z wynikiem 90,5 to solidny rezultat, który przebijają cztery inne modele.

• MCP Atlas — Beam 78,7 vs Qwen3.8 Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8, Inkling 76,0, Nemotron 3 Ultra 63,1.

• AutomationBench, część publiczna — Beam 37,0 vs DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen3.8 Max 39,8, GLM 5.2 26,2.

• tau3 banking — Beam 38.0 vs Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6.

• BrowseComp z zarządzaniem kontekstem — Beam 77,4 vs Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.

• DeepSearchQA z zarządzaniem kontekstem — Beam 80,1 vs Kimi K3 95,0.

Reflection również pokazał w poście dwie demonstracje możliwości: 95,5 procent skuteczności rozwiązywania łamigłówki „Land or Water”, planszy 180 na 90 o 16 200 punktach, która wymaga utrzymania dużego stanu planszy — wynik plasujący się między 92,5 a 97,8 procent, które Reflection przypisuje Opus 5 i Fable 5 w tym samym zadaniu — oraz dostrojenie najmniejszego modelu Gemma-4 do Text2SQL, które podniosło dokładność na odłożonym zbiorze do 66,5 procent. Demonstracje są starannie dobrane; pokazują, że model potrafi coś zrobić, a nie jak często.

Co możesz z tym zrobić już dziś i na czym nie powinieneś opierać planów

Dziś zasadniczo możliwa jest dokładnie jedna rzecz: poprosić o dostęp beta i wywoływać Beam-501B-A23B przez własny endpoint Reflection za pomocą klienta o kształcie OpenAI. Nie ma opublikowanej ceny, więc nie ma sposobu, by modelować koszt obciążenia na nim. Nie ma wag, więc nie ma własnego hostingu, kwantyzacji, dostrajania ani odtwarzalności przez strony trzecie. Nie ma niezależnego wiersza benchmarku, więc cały powyższy obraz wydajności opiera się na tabelach jednego laboratorium.

Reflection Beam nie jest jedną z naszych tras. Nie będziemy sugerować inaczej ani nie skierujemy cię do resellera, który może go mieć. Możemy ci powiedzieć, ile kosztuje zestaw porównawczy, bo cztery z tych modeli obsługujemy i poniższe liczby zostały dziś rano odczytane na żywo z naszego własnego katalogu: GLM 5.2 za $1.40 na wejściu i $4.40 na wyjściu za milion tokenów, GLM 5.3 za $1.26 i $3.96, Qwen3.8 Max za $2.00 i $6.00 oraz DeepSeek V4.1 Flash za $0.15 i $0.60. To naprawdę spory rozrzut — DeepSeek V4.1 Flash jest na wejściu prawie dziesięć razy tańszy niż GLM 5.2 — i właśnie dlatego model w wersji beta bez ceny trudno wpasować w decyzję. OrcaRouter obsługuje jeden klucz zgodny z OpenAI dla tych i ponad 200 innych modeli, przy czym cena katalogowa dostawcy jest przekazywana bez żadnych dodatków, co oznacza, że zmiana ceny u dostawcy jest widoczna po naszej stronie tego samego dnia, a nie dopiero wtedy, gdy odświeży ją reseller. A ponieważ automatyczne przełączanie awaryjne jest częścią routingu, a nie czymś, co trzeba samemu zbudować, nowy i nieprzetestowany model to coś, co możesz skierować na część ruchu, a nie na swoją ścieżkę krytyczną — i to jedyny odpowiedzialny sposób korzystania z czegoś, czyich benchmarków nikt jeszcze nie odtworzył.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

Na co uważać, zanim poważnie potraktujesz twierdzenie o wydajności

Trzy rzeczy rozstrzygną tę kwestię, a dwie z nich obiecano w ciągu miesiąca.

Pierwsze to wagi. Apache 2.0 i raport techniczny pozwoliłyby każdemu, kto ma kilka węzłów, zmierzyć to, co naprawdę się liczy — tokeny na sekundę na GPU przy ustalonym progu jakości oraz to, czy 23 miliardy aktywnych parametrów rzeczywiście dają wynik na FLOP, który sugeruje wykres. Do tego czasu argument o efektywności to arytmetyka na serwetce.

Drugi to cena. Model bez ceny katalogowej nie ma czego szukać w porównaniu kosztów, a jeśli Beam uplasuje się powyżej poziomu GLM i DeepSeek, kwestia mocy obliczeniowej przestaje mieć znaczenie dla każdego, kto ma budżet. Jeśli uplasuje się poniżej, obraz szybko się zmienia.

Trzeci element to strona trzecia uruchamiająca ten zestaw testów. Każda liczba powyżej pochodzi z tego samego dokumentu, a tabela zgłoszona przez dostawcę, w której jego własny model plasuje się niżej w siedmiu z szesnastu wierszy, dobrze świadczy o uczciwości laboratorium — ale to wciąż jedno laboratorium, jedno środowisko testowe, jeden zestaw promptów.

Jeśli potrzebujesz dziś kompetentnego programisty agentowego i musisz wiedzieć, ile to kosztuje, odpowiedzią wciąż nie jest Reflection Beam. Może nią być za trzy tygodnie. Modelem, na którym warto opierać twierdzenie o wydajności, jest ten, którego wagi możesz pobrać i którego FLOPs możesz samodzielnie policzyć — a w tym teście od Reflection dostaliśmy datę, a nie model.

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie