Een gegenereerde hero-kaart voor het artikel 'Reflection Beam lanceert een API in bèta, en de gewichten laten nog twee weken op zich wachten', met de titel 'Reflection Beam', met de ondertitel 'Een API in bèta, en gewichten die nog niet beschikbaar zijn', en drie chips met de tekst '501B totaal / 23B actief', '256K bèta-context' en 'Geen gepubliceerde prijs'.
Guides & Insights

Reflection Beam brengt een API uit in bèta, en de weights zijn nog twee weken weg

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het eerste model van Reflection heet Reflection Beam, en wat er vanmorgen interessant aan is, is niet dat het bestaat — het is dat slechts de helft ervan bestaat. Het bedrijf kondigde Beam aan op 5 oktober 2026 als een sparse mixture-of-experts-model met 501 miljard totale parameters en 23 miljard actieve per token, en stelde dezelfde dag een bèta-endpoint beschikbaar dat compatibel is met OpenAI. De gewichten zijn beloofd voor later deze maand onder Apache 2.0, samen met een technisch rapport, een modelkaart en de servingstack. Tot ze beschikbaar komen, zijn de enigen die Beam-501B-A23B kunnen draaien, degenen aan wie Reflection een sleutel voor de wachtlijst geeft, en elk prestatiecijfer dat in omloop is, komt uit de eigen tabellen van één lab.

Dat is een vreemde plek voor een lancering om te stoppen, en het is de moeite waard om precies te zijn over welke helft we hebben. Reflection heeft een preview uitgebracht waarvoor je je kunt aanmelden en een reeks benchmarktabellen die niemand heeft gereproduceerd. Het heeft niet het ding uitgebracht waar "open-weight" in de kop naar verwijst.

Wat is er vanochtend eigenlijk live?

Alles in deze sectie is afkomstig uit Reflection's eigen blogpost en documentatie, gelezen op 6 oktober 2026.

• Model-ID — Beam-501B-A23B, aangemaakt op 5 oktober 2026, aangeboden op api.reflection.ai/openai/v1 met Chat Completions en een Models-lijst en niets anders.

• Vorm — 501 miljard totale parameters, 23 miljard actief per token, wat een activeringsratio van ongeveer 4,6 procent oplevert. Ter vergelijking: GLM 5.2 zit dicht bij 5,4 procent.

• Context — 256.000 tokens op de API, met een voetnoot bij het getal zelf die waarschuwt dat het venster tijdens de bèta kan veranderen. Maximale output is 128.000 tokens.

• Redeneren — een reasoning_effort-parameter met vijf instellingen: low, medium, high, xhigh en max. Medium is de standaard, en het model redeneert altijd. Er is geen uitschakelaar en geen niet-redeneermodus.

• Modaliteit — tekst in, tekst uit. Geen beeld-, audio- of video-invoer bij de lancering.

• Prijs — niet gepubliceerd. De blogpost vermeldt er geen, de documentatie vermeldt er geen, en de platformconsole bevindt zich achter een aanmeldmuur.

• Toegang — een wachtlijst. Er is geen selfservice-route en er zijn geen gewichten, dus er is geen download, geen kwantisatie en geen fine-tuning.

De prijsregel is degene die verandert hoe je al het andere leest. Vier van de zeven modellen waarmee Beam wordt vergeleken in de eigen tabellen van Reflection hebben openbare lijstprijzen die je vandaag in een spreadsheet kunt zetten. Bij Beam is dat niet het geval, dus elke kostenclaim erover is nu een claim over rekenkracht, niet over dollars.

A screenshot of the coding and agentic table in Reflection's Beam launch post, captured 6 October 2026, showing the header 'The below figure shows Beam's performance across a range of coding, agentic, reasoning, and STEM benchmarks. NR denotes scores that have not been reported.' and Beam's own column of rows — DeepSWE v1.1 44.4, SWE-Bench Pro v2-Hard 77.2, SWE-Bench Pro v1 65.5, Terminal-Bench v2.1 80.1, SWE Atlas Codebase QnA 34.6, SWE-Bench Multilingual 78.0 and SWE-Bench Verified 80.9 — beside the comparison columns for Inkling and Nemotron 3 Ultra.

Het getal waarvan de lancering afhangt

Reflections verkoopargument is inferentie-efficiëntie, en het is ongewoon specifiek over wat dat betekent: op geavanceerde redeneerbenchmarks scoort Beam vergelijkbaar met GLM 5.2 terwijl het 3 tot 4× minder rekenkracht voor inferentie gebruikt. De winst zou nog groter zijn ten opzichte van modellen in de familie van 2 biljoen parameters, waartoe Qwen 3.8-Max behoort.

De grafiek achter die bewering is het waard om zorgvuldig te lezen, want het is het dragende bewijs in het hele bericht. Ze zet redeneerscore uit tegen geschatte inferentie-FLOP's voor DeepSWE, Humanity's Last Exam en Terminal-Bench 2.1, en schat FLOP's op ruwweg tweemaal het aantal actieve parameters maal het gemiddelde aantal gegenereerde tokens per poging. Die formule laat bewust prompt-prefill, contextafhankelijke attention-bewerkingen en serveeroverhead buiten beschouwing — dat zegt Reflection in het bijschrift. Het is een consistente vergelijking tussen modellen, niet een meting van iemands rekening, en het is ook de enige kwantitatieve onderbouwing van de efficiëntieclaim, geschreven door het lab dat het model heeft gebouwd. Zie het als een hypothese die iemand anders met de gewichten kan testen.

Wat de architectuur in de praktijk wel oplevert, is een servingprofiel. Drieëntwintig miljard actieve parameters is een model dat je aannemelijk kunt draaien op een betrekkelijk klein aantal GPU's met interactieve latentie, wat een ander product is dan een dense model met 501 miljard parameters, ook al staat hetzelfde getal op de kaart. Daarom kan Reflection praten over redeneren dat aan de frontier grenst zonder te praten over een uitrol op datacenter-schaal — en daarom is de uiteindelijke release van de gewichten de gebeurtenis die belangrijker is dan de bètasleutel.

Waar Beam landt op Reflections eigen tabellen

Elk cijfer hieronder is door de leverancier opgegeven, afkomstig uit de tabellen in het lanceringsbericht van Reflection, en niets ervan is onafhankelijk gereproduceerd. Waar Reflection geen getal voor een model publiceerde, staat in de originele cel NR. De vergelijkingskolommen zijn van Reflection, niet van ons en niet van een derde partij.

Programmeren en terminalwerk

• Terminal-Bench v2.1 — Reflection Beam 80,1 tegenover GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen 3.8-Max 86,6 en DeepSeek V4.1 Flash 90,6. Beam staat onder elk van hen.

• SWE-Bench Verified — Reflection Beam 80,9 tegen Inkling 77,6 en Nemotron 3 Ultra 70,7. Dit is waar Beam het sterkst uit de verf komt, maar let op dat alleen de twee zwakste modellen op de lijst erop zijn gedraaid.

• SWE-Bench Pro v — Reflection Beam 5.1 tegen Qwen 3.8-Max 67.2, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 46.4.

• SWE-Bench Pro v2-Hard — Reflection Beam 77,2 tegen Kimi K3 88,2, GLM 5,3 84,3, Inkling 56,9. Een gat van tien punten naar de top van de tabel.

• DeepSWE v1.1 — Reflection Beam 44,4 tegen DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen 3.8-Max 51,0, GLM 5.2 44,0. Beam eindigt op hetzelfde niveau als de vorige generatie en dertig punten achter de koploper.

• SWE Atlas Codebase QnA — Reflection Beam 34,6 tegenover Kimi K3 68,0 en GLM 5.3 61,0. Een grote repository gedurende een lange interactie in gedachten houden is het moeilijkste op deze lijst, en Beam's 34,6 is geen afrondingsverschil.

Redeneren en wetenschap

• AIME 2026 — Reflection Beam 97,8 tegenover GLM 5.2 99,2 en Inkling 97,1.

• HLE zonder tools — Reflection Beam 36.2 tegenover Kimi K3 46.9, Qwen 3.8-Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7. Middenmoot, en alleen voor op de twee modellen uit de vorige generatie.

• GPQA Diamond — Reflection Beam 90.5 tegenover Kimi K3 93.5, Qwen 3.8-Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9.

• SciCode — Reflection Beam 49,7 tegen GLM 5.3 59,0, Kimi K3 58,7, Qwen 3.8-Max 52,1, DeepSeek V4.1 Flash 52,0.

• CriPT AA — Reflection Beam 16.3 tegen Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

Hulpmiddelen, zoeken en lange context

• MCP Atlas — Reflection Beam 78,7 tegen Qwen 3.8-Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8.

• AutomationBench, openbare split — Reflection Beam 37,0 tegen DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen 3.8-Max 39,8, GLM 5.2 26,2.

• tau3 banking — Reflection Beam 38.0 tegen Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1.

• BrowseComp met contextbeheer — Reflection Beam 77,4 tegenover Kimi K3 91,2, Ink 77,1, Nemotron 3 Ultra 44,4.

• DeepSearchQA met contextbeheer — Reflection Beam 80,1 tegenover Kimi K3 95,0.

• AA-LCR — Reflection Beam 79,3 tegenover Kimi K3 88,7, DeepSeek V4.1 Flash 84,0, Qwen 3.8-Max 80,3, GLM 5.3 79,7, Nemotron 3 Ultra 79,3, GLM 5.2 78,3, Inkling 77,3. Recall bij lange contexten is de enige rij voor algemene capaciteiten waarin Beam echt concurrerend is in plaats van middenmoot.

Lees de vier tabellen samen en er verschijnt een consistent patroon: Beam verslaat de twee modellen van de vorige generatie op de lijst van Reflection en verliest van het huidige model, op bijna elke rij, met marges die uiteenlopen van klein tot diskwalificerend. Een leverancier die tabellen publiceert die zijn eigen model op zoveel rijen achterop laten staan, is een goed teken voor de eerlijkheid van het lab. Het is geen teken dat het model aan de voorhoede staat.

A screenshot of the efficiency section of Reflection's Beam launch post, captured 6 October 2026, showing the sentence 'On advanced reasoning benchmarks, it achieves scores comparable to GLM-5.2 while using 3-4x less inference compute.', the note that gains are more pronounced against 2T+ parameter models like Qwen 3.8-Max, the claim that the results mean 'more intelligence per token', and a score-versus-estimated-FLOPs chart plotting DeepSWE, HLE (text only) and Terminal-Bench 2.1 across reasoning-effort settings.

De enige onafhankelijke stem tot nu toe, en wat die niet zegt

De enige beoordeling door een derde partij die officieel bekend is, is die van Artificial Analysis, dat op 5 oktober zei dat Reflection het toegang had gegeven en dat het onafhankelijk een benchmark van Beam uitvoerde, en voegde daaraan toe dat vroege indicatoren erop wijzen dat Beam een van de meest token-efficiënte open modellen zal zijn die het heeft gezien voor zijn intelligentieniveau.

Dat is een betekenisvolle uitspraak van de organisatie wier index degene is die de meeste kopers daadwerkelijk lezen, en het is ook een uitspraak waar geen getal in staat. Sinds vanochtend staat er geen Beam-rij op de ranglijst van Artificial Analysis — de modelpagina's geven een 404 terug en de payload van de ranglijst bevat geen Beam-vermelding — dus de claim over token-efficiëntie is voorlopig een belofte van een derde partij dat die iets zal publiceren. Er is nog niets in de index met Beam opnieuw berekend.

De trainingsdisclosure, die het sterkste onderdeel van de release is.

Het engineeringgedeelte van de post van Reflection bevat cijfers die de meeste labs intern houden, en het is de moeite waard om ze vast te leggen, want ze vormen het deel van de release dat over een maand nog steeds interessant zal zijn.

• Pre-training — 23,8 biljoen zorgvuldig samengestelde tokens op 6.144 NVIDIA GB300-chips in NVL72-racks, van begin tot eind afgerond in minder dan vier weken, met een gerapporteerde goodput van 92,3 procent, met onderweg negen semi-automatische terugspoelingen die werden toegeschreven aan pieken in de gradiëntnorm of vermoedelijke stille datacorruptie.

• Versterkend leren — 10.500 GB300-chips gedurende vier weken, meer dan 100 miljoen rollouts, een maximale rolloutcontext van 256.000 tokens, ongeveer 1,3 miljard sandboxes en circa één miljoen afzonderlijke omgevingen die zijn verkregen voor taken op het gebied van programmeren, agentisch werken en STEM.

• Serving — nieuwe gewichten bereikten de inferentievloot binnen een mediane tijd van ongeveer 12 seconden, waarbij hiërarchische distributie het verkeer tussen racks met 75 procent verminderde en de hele vloot de gewichten 2,2× sneller overnam dan wanneer elke replica ze zelf ophaalde.

• Stabiliteit — volledig asynchrone beleidsgradiënten die numeriek stabiel blijven bij het leren van interacties die een dag oud zijn, plus een regelbare lengtepenalty om redeneerlengte af te wegen tegen score zonder opnieuw te trainen.

• Data — ongeveer 95 procent van de ruwe internettokens geëlimineerd door parsing, deduplicatie en curatie, met de bewering dat conventionele filters ruwweg 1,8 biljoen van de tokens die Reflection behield zouden hebben gemist, waaronder 87 procent van zijn gecureerde webcode-tokens.

Twee regels verdienen een kanttekening. De post zegt dat midtraining de effectieve context van Beam uitbreidt tot 1 miljoen tokens, terwijl de API-documentatie een servinglimiet van 256.000 tokens vermeldt met een beta-voetnoot. Dat zijn een capaciteit aan de trainingskant en een limiet aan de servingkant, geen tegenstrijdigheid, maar precies dat gat wordt een "1M context"-kop als niemand het tweede document leest. En het RL-cijfer van meer dan 100 miljoen rollouts wordt gepresenteerd als een van de grootste dergelijke runs van enig open lab, wat een bewering over schaal is, niet over wat de schaal heeft opgeleverd — de score-versus-rollouts-curve is van de leverancier zelf en stopt waar de leverancier hem niet verder heeft geplot.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Wat je vandaag met Reflection Beam kunt doen

Eén ding: sluit je aan bij de wachtlijst en roep, als je een sleutel krijgt, Beam-501B-A23B aan via Reflection's eigen endpoint met een OpenAI-vormige client. Er is geen gepubliceerde prijs, dus er is geen manier om de kosten van een workload erop te modelleren. Er zijn geen gewichten, dus is er geen self-hosting, geen kwantisatie en geen reproductie door derden. Er is geen onafhankelijke benchmarkrij, dus het hele prestatiebeeld hierboven berust op de tabellen van één enkel lab.

Reflection Beam is geen van onze routes, en we gaan niet suggereren dat dat wel zo is. Wat we je wel kunnen geven, is de prijs van het veld dat het probeert te betreden, vanochtend live uitgelezen uit onze eigen catalogus: GLM 5.2 tegen $1,40 in en $4,40 uit per miljoen tokens, GLM 5.3 tegen $1,26 en $3,96, Qwen 3.8-Max tegen $2,00 en $6,00, en DeepSeek V4.1 Flash tegen $0,15 en $0,60. Dat is alleen al op input een verschil van meer dan negen keer tussen de goedkoopste en de duurste — en daarom is een bètamodel zonder lijstprijs echt moeilijk in een beslissing te plaatsen, hoe goed zijn efficiëntiegrafiek er ook uitziet.

OrcaRouter laat één OpenAI-compatibele sleutel werken over die vier en meer dan 200 andere modellen, geeft de lijstprijs van de provider ongewijzigd door zonder er iets aan toe te voegen, zodat een prijswijziging van een leverancier dezelfde dag bij ons live is in plaats van telkens wanneer een wederverkoper een tabel vernieuwt. Automatische failover maakt deel uit van de routering in plaats van iets dat je rond elke provider heen bouwt, wat betekent dat een onbewezen model — zonder reproductie, zonder onafhankelijke score en zonder prijs — precies iets is dat je op een deel van het verkeer zet in plaats van op je kritieke pad.

Wanneer de bewering testbaar wordt

Drie dingen beslechten dit, en Reflection heeft er twee binnen de maand geplaatst.

Het eerste zijn de gewichten. Apache 2.0 plus een technisch rapport stelt iedereen met een paar nodes in staat om het ding te meten dat ertoe doet — tokens per seconde per GPU bij een vaste kwaliteitslat, en of 23 miljard actieve parameters echt de score-per-FLOP leveren die de grafiek suggereert. Tot dan is het efficiëntieargument rekenwerk op een servet, en iedereen die het napraat, herhaalt het bijschrift van Reflection.

Het tweede is een prijs. Een model zonder lijstprijs heeft geen plek in een kostenvergelijking. Als Beam boven het GLM- en DeepSeek-segment uitkomt, doet het compute-verhaal er niet meer toe voor iedereen met een budget; als het eronder uitkomt, verandert het beeld snel.

De derde is de index. Artificial Analysis heeft gezegd dat het Beam aan het benchmarken is en heeft geen enkel cijfer gepubliceerd. Wanneer die rij verschijnt, zal het het eerste cijfer in dit verhaal zijn dat Reflection niet heeft berekend.

Als je vandaag een capabele agentische coder nodig hebt en je moet weten wat die kost, is Reflection Beam nog niet het antwoord. Misschien over drie weken wel. Het model waarop een efficiëntieclaim het waard is om te wedden, is het model waarvan je de gewichten kunt downloaden en waarvan je zelf de FLOPs kunt tellen — en op die test heeft Reflection ons een datum en een wachtlijst gegeven, geen model.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt