Een gegenereerde hero-kaart met de titel 'Reflection Beam: 501B parameters, 23B awake', met de ondertitel 'Sparse MoE / 23,8T pre-training tokens / 256K-token API-context / weights deze maand beloofd / elk cijfer door de leverancier opgegeven'. Onder de tekst staan drie platte lijniconen: een gestapeld laagdiagram met de meeste lagen gedimd en één gemarkeerd, een rack met negen serverblokken, en een documentoverzicht met een klein hangslot. Het OrcaRouter-logo is samengesteld in de rechteronderhoek.
Guides & Insights

Reflection Beam, uitgelegd: 501B parameters, 23B actief, en gewichten die nog niet zijn uitgebracht

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 5 oktober 2026 kondigde Reflection de komst aan van Reflection Beam, een sparse mixture-of-experts-taalmodel met in totaal 501 miljard parameters, waarvan er per token 23 miljard worden geactiveerd, en zette dezelfde dag een bèta-endpoint dat compatibel is met OpenAI ervoor. Dat is 4,6 procent van het model dat op elk moment actief is — een agressieve verhouding, zelfs naar de maatstaven van het huidige open-weight-veld — en het is het getal waar de hele lancering van afhangt. Reflection zegt dat de volledige gewichten, een technisch rapport en een modelkaart later deze maand onder Apache 2.0 beschikbaar komen. Op dit moment zijn ze er nog niet, er is nergens op de eigen platforms van Reflection een prijs gepubliceerd, en Artificial Analysis heeft geen rij voor het model. De eerlijke samenvatting van de lancering is dus deze: een heel specifieke bewering over efficiëntie, gedaan door het lab dat het model heeft getraind, waarbij elk ondersteunend cijfer door dat lab is aangeleverd.

Reflections eigen vergelijkingstabellen plaatsen Reflection Beam tegenover Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max en DeepSeek V4.1 Flash, wat een eerlijk beeld geeft van het niveau dat het nastreeft: sterke maar niet-frontier open en semi-open modellen, waarvan verscheidene een fractie van Beams omvang zijn. Beam verslaat dat veld niet op ruwe capaciteit, en we laten je precies zien waar het verliest. Wat het beweert te doen, is dicht bij de top ervan uitkomen terwijl het ongeveer drie tot vier keer minder inferentie-rekenkracht verbruikt dan GLM 5.2 bij vergelijkbare redeneerscores. Die bewering is het artikel.

Wat er vandaag daadwerkelijk bestaat

Alles in deze sectie is afkomstig uit de eigen documentatie van Reflection, gelezen op 6 oktober 2026. De API is live in bèta achter een wachtlijst; de gewichten zijn nog niet vrijgegeven.

Model-ID — Beam-501B-A23B, aangemaakt op 5 oktober 2026.

• Interface — een OpenAI-compatibel oppervlak op api.reflection.ai/openai/v1, dat Chat Completions en de Models-lijst beschikbaar stelt, en niets anders. Geen Completions, geen embeddings, geen batches.

• Context — 256.000 tokens, met een voetnoot bij het cijfer zelf: "Het contextvenster kan tijdens de bèta veranderen." Maximale uitvoer is 128.000 tokens.

• Redeneren — een reasoning_effort-parameter met vijf waarden: low, medium, high, xhigh en max. De standaardwaarde is medium, en het model redeneert altijd, ongeacht de instelling — er is geen uitschakeloptie.

• Modaliteit — tekst in, tekst uit. Geen beeld- of audio-invoer bij de lancering, wat een wezenlijk verschil is met Inkling, het model met multimodaliteit als prioriteit dat Thinking Machines van Mira Murati in juli uitbracht.

• Kennisafsluitdatum — 30 juni 2026.

• Prijs — niet gepubliceerd. De blogpost van Reflection, de documentatie en de modellenlijst laten hem allemaal weg, en de platformconsole zit achter een registratiemuur.

Die laatste regel is belangrijker dan hij lijkt. Elk ander model in Beams vergelijkingsset heeft een lijstprijs die je vandaag in een spreadsheet kunt zetten. Voor Beam geldt dat niet, wat betekent dat een kostenargument erover nu een argument over rekenkracht is, niet over dollars.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

De verhouding 501 tegen 23 is het argument.

Sparsity is niet nieuw; de vraag is hoe ver een lab bereid is ermee te gaan. GLM 5.2 draait op ruwweg 40 miljard actieve parameters van een gerapporteerd totaal van rond de 744 miljard — ongeveer 5,4 procent. Reflection Beam staat op 4,6 procent van 501 miljard. Op papier is dat een bescheiden stap verder, en Reflection is voorzichtig met wat het ervoor claimt.

Het efficiëntiecijfer in de lanceringspost komt uit een grafiek die is gebouwd op gegevens van Artificial Analysis en DataCurve, waarin de reasoning-score wordt uitgezet tegen geschatte inference-FLOPs, waarbij FLOPs worden benaderd als tweemaal het aantal actieve parameters maal het gemiddelde aantal gegenereerde tokens. Die formule sluit prompt-prefill, attention-kosten en servingoverhead bewust uit. Het is een back-of-the-envelope-model, geen meting, en Reflection presenteert het ook niet als zodanig — maar het is ook de enige kwantitatieve ondersteuning voor de bewering "3 tot 4× goedkoper bij dezelfde score", en het is door de leverancier geschreven. Beschouw het als een hypothese die iemand anders kan testen zodra de weights beschikbaar komen.

Wat de architectuur in de praktijk oplevert, is een servingprofiel. Drieëntwintig miljard actieve parameters is een model dat je op een relatief klein aantal GPU's met interactieve latentie kunt draaien, en dat is een ander product dan een dense model met 501 miljard parameters, ook al is het aantal parameters op de kaart hetzelfde. Het is de reden dat Reflection kan spreken over redeneren dat aan de frontier grenst zonder te spreken over een deployment op datacenter-schaal.

Minder dan vier weken om te pre-trainen, en de onthulling is ongewoon specifiek

Het trainingsverslag is het deel van de release dat oprecht informatief overkomt, omdat Reflection cijfers heeft gepubliceerd die de meeste labs intern houden.

• Pre-training — 23,8 biljoen tokens op 6.144 GB300-chips in NVL72-racks, voltooid in minder dan vier weken met een gerapporteerde goodput van 92,3 procent, met onderweg negen terugspoelingen vanaf checkpoints.

• Versterkend leren — 10.500 GB300-chips gedurende vier weken, meer dan 100 miljoen rollouts, maximale rollout-context van 256.000 tokens, ongeveer 1,3 miljard sandboxen en circa een miljoen afzonderlijke omgevingen, met gemiddeld 110.000 gelijktijdig draaiende rollouts.

• Midtraining — breidt de effectieve context van het model uit tot 1 miljoen tokens.

• Stabiliteit — asynchrone policy gradients die stabiel blijven bij veroudering op dagenschaal, plus een regelbare lengtestraf zodat de redeneerlengte kan worden afgestemd zonder hertraining.

Lees de pre-training- en RL-regels samen en de vorm van de bewering verschijnt. Het efficiëntieverhaal gaat niet alleen over actieve parameters bij inferentie; het gaat er ook om hoe snel het model werd getraind en hoeveel van de compute naar omgevingsgebonden RL ging in plaats van naar meer tokens. Een miljoen omgevingen en 1,3 miljard sandboxes is een statement over toolgebruik en agentische trainingsinfrastructuur, en het sluit aan bij de benchmarks die Reflection voorop heeft gezet.

Eén getal verdient een markering. De blog zegt dat midtraining de effectieve context uitbreidt tot 1 miljoen tokens; de API-documentatie vermeldt een serving-limiet van 256.000 tokens met een bijgevoegde bèta-voetnoot. Dat zijn een mogelijkheid aan de trainingskant en een limiet aan de servingkant, geen tegenstrijdigheid — maar dat gat is precies het soort ding dat een "1M context"-kop wordt als niemand het tweede document leest, en wie volgende week over Beam schrijft, zou het tweede document moeten lezen.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

Benchmarks: waar Reflection Beam wint, en waar niet

Elk cijfer hieronder is door de leverancier gerapporteerd, afkomstig uit de tabellen in de lanceringspost van Reflection, en niets ervan is onafhankelijk gereproduceerd. De vergelijkingskolommen bevatten dezelfde cijfers die Reflection voor de andere modellen heeft gepubliceerd; waar een cel in het origineel "NR" toont, is het model niet uitgevoerd. Er is geen Artificial Analysis-rij voor Beam, dus niets hier heeft een testharnas van een derde partij doorlopen.

Agentisch coderen

• Terminal-Bench v2.1 — Beam 80,1 vs GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.

• SWE-Bench Pro v1 — Beam 65,5 tegenover Qwen3.8 Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.

• SWE-Bench Pro v2-Hard — Beam 77,2 vs Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9.

• SWE-Bench Verified — Beam 80,9 vs. Inkling 77,6, Nemotron 3 Ultra 70,7.

• SWE-Bench Multilingual — Beam 78,0 vs Nemotron 3 Ultra 67,7.

• DeepSWE v1.1 — Beam 44,4 vs DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen3.8 Max 51,0, GLM 5.2 44,0.

• SWE Atlas Codebase QnA — Beam 34,6 vs Kimi K3 68,0, GLM 5,3 61,0.

Die laatste rij is er een om bij stil te staan. Bij vraagbeantwoording over repository's op de lange termijn moet een model een codebase gedurende een lange interactie in het hoofd houden, en 34,6 tegenover 68,0 is geen afrondingsverschil. DeepSWE vertelt een vergelijkbaar verhaal: 44,4 plaatst Beam op hetzelfde niveau als GLM 5.2 en ver achter DeepSeek V4.1 Flash.

Redenering

• AIME 2026 — Beam 97,8 vs GLM 5.2 99,2, Inkling 97,1.

• HLE, geen tools — Beam 36,2 vs. Kimi K3 46,9, Qwen3.8 Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7.

• GPQA Diamond — Beam 90,5 vs Kimi K3 93,5, Qwen3.8 Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9, Inkling 87,2, Nemotron 3 Ultra 87.

• SciCode — Beam 49.7 vs GL 5.3 59.0, Kimi K3 58.7, Qwen3.8 Max 52.1, DeepSeek V4.1 Flash 52.0, Inkling 46.1, Nemotron 3 Ultra 44.6.

• CriPT AA — Beam 16,3 vs. Kimi K3 23,4, GLM 5.2 20,9, Qwen3.8 Max 20,0, GLM 5.3 19,1, DeepSeek V4.1 Flash 14,3, Inkling 5,4, Nemotron 3 Ultra 3,1.

Het redeneerprofiel van Beam zit in de middenmoot, en het patroon is consistent: ruim voor op de twee modellen uit de vorige generatie op de lijst van Reflection, achter het huidige. GPQA Diamond met 90,5 is een solide score die door vier andere modellen wordt overtroffen.

• MCP Atlas — Beam 78,7 vs. Qwen3.8 Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8, Inkling 76,0, Nemotron 3 Ultra 63,1.

• AutomationBench, openbare split — Beam 37.0 vs DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2.

• tau3-bankieren — Beam 38,0 vs. Qwen3.8 Max 55,2, GLM 5.2 37,1, Kimi K3 37,1, Inkling 25,0, Nemotron 3 Ultra 22,6.

• BrowseComp met contextbeheer — Beam 77,4 vs Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.

• DeepSearchQA met contextbeheer — Beam 80.1 vs Kimi K3 95.0.

Reflection toonde in de post ook twee capability-demo's: een oplossingspercentage van 95,5 procent op de puzzel "Land or Water", een raster van 180 bij 90 met 16.200 punten waarbij een grote bordtoestand moet worden bijgehouden — een cijfer dat tussen de 92,5 en 97,8 procent ligt die Reflection aan Opus 5 en Fable 5 op dezelfde taak toeschrijft — en een Text2SQL-finetune van de kleinste Gemma-4 die de nauwkeurigheid op de achtergehouden set verhoogde tot 66,5 procent. Demo's zijn gecureerd; ze laten zien dat het model iets kán, niet hoe vaak.

Wat je er vandaag mee kunt doen, en waar je je plannen niet op moet baseren

Tegenwoordig is er doorgaans precies één ding mogelijk: beta-toegang aanvragen en Beam-501B-A23B aanroepen via Reflection's eigen endpoint met een OpenAI-vormige client. Er is geen gepubliceerde prijs, dus er is geen manier om de kosten van een workload erop te modelleren. Er zijn geen gewichten, dus er is geen self-hosting, geen quantisatie, geen fine-tune en geen reproduceerbaarheid door derden. Er is geen onafhankelijke benchmarkrij, dus het hele prestatiebeeld hierboven berust op de tabellen van één lab.

Reflection Beam is niet een van onze routes. We gaan niet het tegendeel suggereren, en we verwijzen je niet naar een reseller die het misschien heeft. Wat we je wel kunnen vertellen, is wat de vergelijkingsset kost, want we routeren vier van die modellen en de onderstaande cijfers zijn vanochtend live uit onze eigen catalogus gelezen: GLM 5.2 voor $1,40 in en $4,40 uit per miljoen tokens, GLM 5.3 voor $1,26 en $3,96, Qwen3.8 Max voor $2,00 en $6,00, en DeepSeek V4.1 Flash voor $0,15 en $0,60. Dat is een behoorlijke spreiding — DeepSeek V4.1 Flash is op input bijna tien keer goedkoper dan GLM 5.2 — en dat is de reden waarom een bètamodel zonder prijs moeilijk in een beslissing te plaatsen is. OrcaRouter draait één OpenAI-compatibele sleutel voor die en meer dan 200 andere modellen, waarbij de lijstprijs van de provider wordt doorgegeven en er niets bovenop komt, wat betekent dat een prijswijziging van een leverancier bij ons dezelfde dag live staat in plaats van wanneer een reseller maar vernieuwt. En omdat automatische failover deel uitmaakt van de routering in plaats van iets dat je zelf bouwt, is een nieuw en onbewezen model iets dat je op een deel van het verkeer kunt zetten in plaats van op je kritieke pad — wat de enige verantwoorde manier is om iets te gebruiken waarvan niemand de benchmarks nog heeft gereproduceerd.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

Waar je op moet letten voordat je de efficiëntieclaim serieus neemt

Drie dingen zullen de kwestie beslechten, en twee ervan zijn binnen de maand beloofd.

Het eerste zijn de gewichten. Apache 2.0 en een technisch rapport zouden iedereen met een paar nodes in staat stellen om het ding te meten dat er echt toe doet — tokens per seconde per GPU bij een vaste kwaliteitslat, en of 23 miljard actieve parameters echt de score-per-FLOP leveren die de grafiek suggereert. Tot dan is het efficiëntieargument rekenwerk op een servet.

De tweede is een prijs. Een model zonder lijstprijs heeft geen plaats in een kostenvergelijking, en als Beam boven de GLM- en DeepSeek-klasse uitkomt, doet het verhaal over rekenkracht er niet meer toe voor iedereen met een budget. Komt het eronder uit, dan verandert het beeld snel.

De derde is een derde partij die de suite uitvoert. Elk cijfer hierboven komt uit hetzelfde document, en een door de leverancier gerapporteerde tabel die zijn eigen model op zeven van de zestien rijen achterop laat staan, is een goed teken voor de eerlijkheid van het lab — maar het is nog steeds één lab, één testharnas, één set prompts.

Als je vandaag een capabele agentische coder nodig hebt en je wilt weten wat die kost, is het antwoord nog niet Reflection Beam. Misschien over drie weken. Het model waarop een efficiëntieclaim het wedden waard is, is het model waarvan je de gewichten kunt downloaden en waarvan je de FLOPs zelf kunt tellen — en in die test heeft Reflection ons een datum gegeven en geen model.

Vergeleken in dit artikel4

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt