Een gegenereerde hero-kaart voor het artikel 'Reflection Beam vs Claude Opus 5.5: De een kun je vandaag al aanroepen, op de ander moet je wachten', getiteld 'Reflection Beam vs Claude Opus 5.5', met de ondertitel 'De een kun je vandaag al aanroepen, op de ander moet je wachten' en drie chips met de tekst 'Wachtlijst vs algemeen beschikbaar', 'Geen prijs vs $4 / $20' en 'Alleen tekst vs multimodaal'.
Guides & Insights

Reflection Beam vs Claude Opus 5.5: de een kun je vandaag al gebruiken, op de ander moet je nog wachten

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Reflection Beam en Claude Opus 5.5 zijn nog niet echt rivalen, en de reden is administratief in plaats van technisch. Beam, het eerste model van Reflection, werd aangekondigd op 5 oktober 2026 en is een sparse mixture-of-experts-model met 501 miljard parameters dat 23 miljard parameters per token activeert — maar het is alleen bereikbaar via een wachtlijst, de gewichten zijn toegezegd voor later deze maand onder Apache 2.0, en er is nergens een prijs gepubliceerd. Opus 5.5 werd op 22 september 2026 uitgebracht als het vlaggenschip van Anthropic: een venster van 1 miljoen tokens, tekst-, afbeeldings- en bestandsinvoer, en een lijstprijs van $4,00 per miljoen inputtokens en $20,00 per miljoen output. De eerlijke versie van deze vergelijking is dus dat je het ene model vanmiddag nog in productie kunt nemen met een bekende kostprijs, en het andere niet — en al het overige hier is een projectie van wat er gebeurt wanneer de gewichten arriveren.

Het korte antwoord

Als de vraag is op welk model je deze week moet bouwen, dan is dat zonder veel discussie Opus 5.5: het is algemeen beschikbaar, onafhankelijk beoordeeld, multimodaal, geprijsd en wordt aangeboden via een API die je binnen vijf minuten kunt aanroepen. De argumentatie voor Beam berust niet op het verslaan van Opus 5.5 — niets in het eigen materiaal van Reflection beweert dat. Die berust op een veel nauwere stelling: dat Beam bij een gegeven redeneerscore ruwweg een kwart van de inferentiecompute verbruikt. Als dat standhoudt wanneer iemand buiten Reflection het meet, wordt Beam interessant voor grootschalig werk waarbij het antwoord goed maar niet het beste hoeft te zijn. Als dat niet zo is, is Beam een open model uit de middenmoot met een wachtlijst.

Wat volgt scheidt de delen van deze confrontatie die vandaag feiten zijn van de delen die weddenschappen zijn.

Wat elk model precies is

Opus 5.5 is de gesloten, gehoste opvolger van Claude Opus 5, door Anthropic gepositioneerd voor meerstaps wijzigingen in grote codebases, code review en lange autonome sessies. Het accepteert tekst, afbeeldingen en bestanden, retourneert tekst, biedt een contextvenster van 1.000.000 tokens met tot 128.000 uitvoertokens, en biedt uitgebreid denken met een configureerbare redeneerinspanning. Het heeft geen open gewichten, en de kennis ervan wordt begrensd door de trainingsafsluitdatum van Anthropic in plaats van door iets waar je controle over hebt.

Reflection Beam is de tegenovergestelde constructie. Het heeft 501 miljard parameters in totaal, met 23 miljard actieve — ongeveer 4,6 procent van het model is actief per token, een agressieve verhouding zelfs vergeleken met de ongeveer 5,4 procent van GLM 5.2 — gebouwd om goedkoop te serveren in plaats van goedkoop te trainen. Het ondersteunt alleen tekst. De API-context is 256.000 tokens, met een voetnoot die waarschuwt dat het aantal tijdens de bèta kan veranderen, en de maximale uitvoer is 128.000 tokens. Het endpoint is OpenAI-compatibel op api.reflection.ai/openai/v1 en biedt Chat Completions plus een Models-lijst en niets anders. De parameter reasoning_effort accepteert vijf waarden, staat standaard op medium en kan niet worden uitgeschakeld.

• Prijs — Claude Opus 5.5 $4,00 in en $20,00 uit per miljoen tokens, met cache-reads tegen $0,20 en cache-writes tegen $5,00, tegenover Reflection Beam: niet gepubliceerd in de blogpost, de documentatie of de modellijst.

• Beschikbaarheid — Opus 5.5 is vandaag algemeen beschikbaar; Beam is een bèta met een wachtlijst, waarbij de gewichten, het technisch rapport en de modelkaart voor later deze maand zijn toegezegd.

• Modaliteit — Opus 5.5 accepteert tekst, afbeeldingen en bestanden; Beam accepteert tekst.

• Context — 1.000.000 tokens tegenover 256.000, waarbij het aantal van Beam een bèta-voorbehoud kent.

• Open gewichten — nee voor Opus 5.5, beloofd onder Apache 2.0 voor Beam, nog niet geleverd.

• Onafhankelijke score — Opus 5.5 heeft er een; Beam niet.

A generated two-column scoreboard titled 'Reflection Beam vs Claude Opus 5.5 — the scoreboard'. Left column 'Reflection Beam': Availability waitlisted beta; Price not published; Context 256,000 tokens (beta); Input text only; Open weights promised Apache 2.0, not out; Independent score none yet. Right column 'Claude Opus 5.5': Availability generally available; Price $4.00 / $20.00; Context 1,000,000 tokens; Input text, image, file; Open weights no; Independent score AA index 57.6. Footer reads 'Beam figures vendor-reported and unaudited. Opus 5.5 price is the provider list rate; its index is Artificial Analysis, read 6 October 2026.'

Prijs is het onderdeel dat niet te vergelijken is

De $4,00 en $20,00 van Opus 5.5 zijn het listtarief van de provider, en in onze catalogus worden ze ongewijzigd doorgegeven zonder dat er iets bij komt. Cache-leesbewerkingen tegen $0,20 en cache-schrijfbewerkingen tegen $5,00 maken enorm veel uit voor de workload waarvoor Opus 5.5 wordt verkocht — een lange agentische sessie die dezelfde codebase van 200.000 tokens beurt na beurt opnieuw leest, betaalt voor bijna alles het cachetarief, niet het invoertarief. Dat is een reële en vaak over het hoofd geziene hefboom, en het is de moeite waard om te modelleren voordat je concludeert dat een frontiermodel buiten het budget valt.

Beam heeft geen vergelijkbaar getal. Er is geen catalogusprijs om tegen af te zetten, geen cachetier om te modelleren, en geen gepubliceerd tarief voor de bèta. Reflection heeft niet gezegd of Beam per token wordt verkocht, per seat wordt afgerekend, of wordt weggegeven met de gewichten. Iedereen die vandaag een prijs per miljoen voor Beam noemt, verzint het.

De praktische consequentie: de prijsvergelijking is niet "Opus 5.5 is duur en Beam is goedkoper." Het is "een van deze twee heeft een prijs en de andere heeft een datum." Voor een team dat vandaag moet beslissen, is die asymmetrie doorslaggevender dan de benchmarks.

Benchmarks: de twee getallen die overlappen, en waarom ze toch niet vergelijkbaar zijn

De lanceringstabellen van Reflection bevatten Opus 5.5 niet, en ook geen enkel gesloten frontier-model. De vergelijkingsset bestaat volledig uit open of semi-open modellen: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max en DeepSeek V4.1 Flash. Elke Beam-versus-Opus-tabel moet dus met de hand worden samengesteld, en die eerlijk samenstellen betekent de harness-verschillen benoemen in plaats van ze weg te poetsen.

Er zijn precies twee benchmarks waarbij beide modellen een gepubliceerd cijfer hebben, en geen van beide combinaties is gecontroleerd.

• Humanity's Last Exam — Reflection rapporteert Beam op 36,2 zonder tools; Artificial Analysis noteert Opus 5.5 op 61,4. Twee verschillende testharnassen, twee verschillende configuraties — het cijfer van Opus 5.5 is niet als no-tools gelabeld — en een verschil van vijfentwintig punten dat minder over de modellen zegt dan over de opzet.

• SciCode — Reflection rapporteert Beam op 49,7; Artificial Analysis noteert 66,9 voor Opus 5.5. Dezelfde benchmark, hetzelfde probleem: het ene cijfer is de eigen testrun van de leverancier, het andere is een harness van een derde partij.

Al het andere overlapt helemaal niet. De tabel van Beam is gebaseerd op Terminal-Bench v2.1, terwijl de huidige Artificial Analysis-index Terminal-Bench 4.0 draait — een andere versie van dezelfde suite, waardoor Beams 80,1 en de 59,6 van Opus 5.5 op dat bord geen vergelijking vormen en nooit naast elkaar mogen worden afgedrukt. Op de index zelf plaatst Artificial Analysis Opus 5.5 op 57,6 in de Max / Default Fallback-configuratie, als vierde gerangschikt van de 147 modellen in die run. Beam heeft geen indexrij: de modelpagina's geven 404 en het leaderboard bevat vanochtend geen vermelding van Beam.

De enige werkelijk onafhankelijke, vastgelegde uitspraak over Beam is dat Artificial Analysis op 5 oktober zei dat Reflection Artificial Analysis toegang had gegeven en dat Artificial Analysis bezig was het model onafhankelijk te benchmarken — en dat vroege indicatoren erop wijzen dat Beam, gezien zijn intelligentieniveau, een van de meest token-efficiënte open modellen zal zijn die het heeft gezien. Dat is een krachtige uitspraak van de juiste bron, en het is nog steeds een uitspraak zonder een cijfer. Het is het cijfer dat deze confrontatie zal beslissen.

A screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), captured 6 October 2026, showing the model name and id, Imtokens context, Max output 128K, input text + image + file, Vision & Tools and JSON Reasoning tags, the INPUT $4.00 and OUTPUT $20.00 pricing tiles, p50 TTFT 5.81 s, p95 TTFT 10.00 s, 48.5M tokens of 7-day traffic, the benchmark provenance lines 'Public benchmarks by Anthropic - 2026-09-22' and 'AI Analysis', and a code sample using base_url https://api.orcarouter.ai/v1.

Waar de efficiëntieclaim echt toeslaat

Het argument van Reflection is niet dat Beam slimmer is dan een frontier-model. Het is dat Beam vergelijkbaar scoort met GLM 5.2 terwijl het 3 tot 4× minder inferentie-rekenkracht gebruikt, en dat de kloof groter wordt tegenover modellen in de 2 biljoen-parameter-familie waar Qwen 3.8-Max zit. De grafiek erachter schat de gegenereerde FLOP's als tweemaal het aantal actieve parameters maal het gemiddelde aantal gegenereerde tokens per poging, en het bijschrift geeft zelf toe dat dit prompt-prefill, attention en serving-overhead uitsluit.

Als je dat voetstoots aanneemt, is Opus 5.5 helemaal niet het interessante doelwit — het is het midden van de markt. Opus 5.5 concurreert op capaciteit per taak en wint bij de taken die om beoordelingsvermogen vragen: refactoringen in meerdere stappen, code review, werk waarbij een verkeerd antwoord meer kost dan de tokens. Een model dat per token voor 4,6 procent wakker is, concurreert op kosten per taak en wint waar volume domineert en de kwaliteitslat 'goed genoeg en downstream geverifieerd' is. Dat zijn verschillende producten, en een vergelijking die Beam tegenover Opus 5.5 zet op één scorebord meet het verkeerde.

Er is een tweede-orde-effect dat het benoemen waard is. Als de efficiëntieclaim van Beam standhoudt, ligt de natuurlijke toepassing bij het soort workload waarbij je anders de tokens van een frontiermodel zou uitgeven aan een taak waarvoor het overgekwalificeerd is. Dat is een routeringsbeslissing, geen modelkeuze, en het is de reden dat de prijsvraag hier belangrijker is dan de benchmarkvraag: je kunt niet op basis van kosten routeren naar een model zonder kosten.

Ze naast elkaar laten draaien, wanneer Beam aanroepbaar is

Opus 5.5 staat vandaag in onze catalogus voor $4,00 en $20,00 per miljoen tokens, de lijstprijs wordt één op één doorgegeven zonder iets erbij, en het staat naast meer dan 200 andere modellen achter één OpenAI-compatibele sleutel op api.orcarouter.ai/v1. Als je een workload wilde A/B-testen tussen een frontier-model en een goedkoop open model, dan is dat de vorm van de opzet: twee model-ID's, één sleutel, geen tweede contract en geen codewijziging — en automatische failover in de routing betekent dat een provider met een slechte middag je pipeline niet mee naar beneden haalt.

Beam kan daar nog geen deel van uitmaken, en we gaan niet doen alsof dat anders is. Reflection Beam is geen van onze routes, en we zullen je niet doorverwijzen naar wie het dan ook zou doorverkopen. Wanneer de weights onder Apache 2.0 vrijkomen, kun je het zelf hosten en naar je eigen endpoint routeren; tot dan is de enige weg de wachtlijst van Reflection.

Voor een workload waarvoor echt een frontiermodel nodig is, is de vergelijking die je moet maken niet met Beam. Die is met al het andere in de catalogus: GLM 5.3 voor $1,26 en $3,96, Qwen 3.8-Max voor $2,00 en $6,00, en DeepSeek V4.1 Flash voor $0,15 en $0,60, allemaal vanmorgen live opgehaald. Dat is het segment waarin Beam terechtkomt als het concurrerend geprijsd is, en het is een veel moeilijker speelveld dan de lanceringsgrafiek suggereert.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Wat zou deze uitspraak veranderen?

Drie dingen, in volgorde van hoeveel ze zouden uitmaken.

Een Artificial Analysis-rij voor Beam. Niet de aankondiging dat er een komt — de rij. Als de index in de buurt van de 57,6 van Opus 5.5 uitkomt terwijl de claim over token-efficiëntie standhoudt bij een harness van een derde partij, krijgt het middensegment van de markt het echt benauwd en wordt Beam de standaardkeuze voor veel werk met een hoog volume. Als de index dichter bij het open-weights-cluster in de lage veertig uitkomt, is Beam een solide, goedkoop model en niets meer.

Een prijs. Een model zonder lijsttarief kan een kostenargument niet winnen, omdat er niets is om mee te vergelijken. Als Beam onder de GLM 5.3-tier uitkomt, wordt het efficiëntieverhaal heel snel een budgetverhaal. Als het boven de $0,15 en $0,60 van DeepSeek V4.1 Flash uitkomt zonder een capaciteitsvoorsprong, zal het worstelen voor het volumewerk waarvoor het is gebouwd.

De gewichten. Totdat ze bestaan, is "open-weight" een uitspraak over een licentie die niet is verleend, en niemand kan de FLOPs-per-score-rekensom controleren tegen een model dat hij daadwerkelijk kan draaien. Dat is de controle die Reflection heeft uitgenodigd en nog niet mogelijk heeft gemaakt.

Totdat ten minste één van die dingen erdoor komt, is de praktische keuze niet moeilijk. Opus 5.5 is het model waarover je kunt redeneren, waarvan je de kosten kunt berekenen en waarop je kunt shippen. Beam is het model dat je in de gaten houdt.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt