
Reflection Beam vs Kimi K3: Dezelfde benchmarknaam, twee verschillende testharnassen
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Reflection Beam scoort 80,1 op Terminal-Bench 2.1. Kimi K3 scoort 88,3. Zet die twee cijfers naast elkaar, zoals het grootste deel van de berichtgeving deze week heeft gedaan, en je concludeert dat Beam ongeveer acht punten onder het beste open model in het veld zit. Maar die twee getallen komen niet uit dezelfde kamer. De 80,1 van Beam is door de leverancier gerapporteerd, overgenomen uit de tabel in Reflection's eigen lanceringspost. De 88,3 van Kimi K3 is ook door de leverancier gerapporteerd, ditmaal uit Moonshot's eigen tabel — en een tabel van een leverancier vermeldt de score van zijn concurrent alleen wanneer die op de eigen harness van de leverancier is gedraaid, onder de eigen promptset van de leverancier, met de eigen effort-instelling van de leverancier. Een derde partij, Artificial Analysis, heeft sindsdien Kimi K3 op een benchmark met dezelfde naam laten draaien en 85,0 gepubliceerd. Dat is een verschil van 4,9 punten, niet 8,2 — en de richting van de correctie is volledig voorspelbaar, want het getal dat wordt uitgehold is altijd het getal dat afkomstig is van het lab dat iets te bewijzen heeft.
Dat is het hele probleem met de vergelijking die de titel van dit artikel belooft, en het is de reden dat dit stuk zijn eerste helft besteedt aan herkomst in plaats van aan scores. Reflection Beam is een sparse mixture-of-experts-model met 501 miljard parameters en 23 miljard parameters actief per token, op 5 oktober 2026 aangekondigd door Reflection AI, met een bèta OpenAI-compatibel endpoint dat dezelfde dag live ging. Kimi K3 is het open vlaggenschipmodel van Moonshot AI, staat in onze eigen catalogus met een releasedatum van 15 juli 2026 en is onafhankelijk gescoord door Artificial Analysis. Een van de twee is een product dat al wordt geleverd, met een tariefkaart en een harness-run door een derde partij; de andere is een bèta met wachtlijst waarvan de gewichten, het technische rapport en de prijs nog niet bestaan. Ze vergelijken is geen symmetrische oefening, en doen alsof dat wel zo is, zou een pagina opleveren die precies lijkt en toch onjuist is.
De 30-secondenversie
• Beam is op papier sneller per FLOP, in de praktijk niet geprijsd en niet gereproduceerd. Kimi K3 wordt door een derde partij beoordeeld, is geprijsd op $3,00 voor input en $15,00 voor output per miljoen tokens, en is algemeen beschikbaar.
• Op de enige benchmark waarop beide zijn uitgevoerd — Terminal-Bench 2.1 — bedraagt het eerlijke verschil ongeveer vijf punten, niet acht, zodra de cijfers van beide kanten uit een neutrale testomgeving komen.
• Beams echte voordelen zijn structureel, niet numeriek: een servingprofiel met 23B actieve parameters en een beloofde Apache 2.0-licentie. Geen van beide is vandaag bruikbaar.
• Als je deze week een model nodig hebt, is dit geen kwestie van kop of munt. Het is één model dat al beschikbaar is en één wachtlijst.
Wat Reflection daadwerkelijk publiceerde, en tegen wie
De launchpost van Reflection zet één scorecard tegenover zeven andere modellen: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max en DeepSeek V4.1 Flash. Elk cijfer in de tabel is door de leverancier gerapporteerd, niets ervan is onafhankelijk gereproduceerd, en er is geen Artificial Analysis-pagina voor Reflection Beam — de modelpagina geeft een 404 op hun site per 6 oktober 2026. Verschillende cellen in het origineel zijn gemarkeerd met NR omdat het model niet is gedraaid.
Hier is het volledige Beam-versus-K3-deel van die tabel, één regel per dimensie:
• Terminal-Bench 2.1 — Beam 80,1 vs Kimi K3 88,3
• SWE-Bench Pro v2-Hard — Beam 77,2 vs Kimi K3 88,2
• DeepSWE v1.1 — Beam 44,4 vs Kimi K3 68,0
• SWE Atlas Codebase Q&A — Beam 34,6 vs Kimi K3 68,0
• HLE, geen tools — Beam 36.2 vs Kimi K3 46.9
• GPQA Diamond — Beam 90,5 vs Kimi K3 93,5
• SciCode — Beam 49,7 vs Kimi K3 58,7
• MCP Atlas — Beam 78,7 vs Kimi K3 82,3
• BrowseComp met contextbeheer — Beam 77.4 vs Kimi K3 91.2
• DeepSearchQA met contextbeheer — Beam 80,1 vs Kimi K3 95,0
Lees die lijst eerlijk en de vorm van de lancering komt tevoorschijn. Reflection claimt nergens een overwinning op K3. Het claimt bijna bovenaan een categorie te eindigen terwijl het bij vergelijkbare redeneerscores drie tot vier keer minder inferentiecompute verbruikt dan GLM 5.2 — en de enige rij waar de twee modellen dicht bij elkaar liggen, Terminal-Bench 2.1, is de rij waarin de vergelijking het minst betrouwbaar is.
Waarom de harness belangrijker is dan de score
Een benchmarknaam is een label, geen specificatie. Terminal-Bench 2.1 betekent een bepaalde set taken die wordt uitgevoerd onder een bepaalde agent-scaffold, met een bepaald retrybeleid, een bepaald tokenbudget en een bepaalde instelling voor reasoning-effort. Twee labs kunnen allebei oprecht een "Terminal-Bench 2.1"-cijfer rapporteren en getallen produceren die niet vergelijkbaar zijn, omdat de scaffold en de effort-instelling bepalen waar het grootste deel van de variantie zit. Artificial Analysis bestaat als organisatie precies daarom: het draait één harness, in één configuratie, over vele modellen, zodat de cijfers van elkaar afgetrokken kunnen worden.
Dus de 80,1 die Reflection voor Beam afdrukt, is een leveranciersgetal op een leveranciersharnas, en de 88,3 die het voor K3 afdrukt, is ook een leveranciersgetal — waarbij de leverancier Reflection is, die zijn eigen concurrent meet. Dat tweede cijfer is het minst betrouwbare getal in de rij: een lab dat de gewichten van een rivaal op zijn eigen testharnas draait, heeft geen prikkel om ze in de beste configuratie van de rivaal te draaien, en geen verplichting om bekend te maken welke het koos. Er is niets oneerlijks aan; het is simpelweg een getal waarvan de herkomst niet het gewicht ondersteunt dat de berichtgeving eraan heeft gegeven.
In de eigen run van Artificial Analysis staat Kimi K3 op 85,02 op Terminal-Bench 2.1, naast een 12,6 op Terminal-Bench v4.0 — een andere en moeilijkere test — een AA Coding Index van 76,2 (rang 9 van de modellen op de ranglijst), een Intelligence Index van 43,6, GPQA Diamond 93,5, HLE 46,9, SciCode 59,5, tau-banking 45,98 en een Long-Context Recall van 88,7. Die zijn afgelezen van K3's cataloguskaart in ons eigen systeem, met als bron artificialanalysis.ai, met de evaluatiesnapshot gedateerd op 15 juli 2026. Beam heeft één getal in het universum van die lijst, en dat komt van Reflection. Dat ontbreken zou tijdelijk moeten zijn in plaats van permanent: Artificial Analysis heeft gezegd dat Reflection het toegang heeft gegeven en dat het bedrijf het model aan het benchmarken is, en de eigen vroege formulering van Artificial Analysis — dat Beam "een van de meest token-efficiënte open modellen zal zijn die we op zijn intelligentieniveau hebben gezien" — is een benchmarkhuis dat een verwachting signaleert en geen resultaat rapporteert. Totdat die score wordt gepubliceerd, zijn de cijfers in dit artikel niet weg te strepen, en we gaan niet doen alsof het anders is.

Wat elk kost, en wat elk is
De kostenvergelijking komt niet eens in de buurt, en het is eigenlijk helemaal geen vergelijking, omdat één kant ervan leeg is.
• Prijs — Kimi K3: $3,00 voor invoer / $15,00 voor uitvoer per miljoen tokens, met cache-reads tegen $0,30, tegenover Reflection Beam: nergens een gepubliceerde prijs op de blog van Reflection, in de documentatie of in de modellenlijst, met de console van het platform achter een registratiemuur.
• Context — 1.048.576 tokens op Kimi K3 versus 256.000 op de Beam-bèta, met een voetnoot in Beam's eigen documentatie die luidt: "het contextvenster kan tijdens de bèta veranderen."
• Modaliteit — Kimi K3 accepteert tekst en afbeeldingen; Reflection Beam is tekst-in, tekst-uit zonder beeld- of audiopad bij de lancering.
• Beschikbaarheid — Kimi K3 is vandaag algemeen beschikbaar; Reflection Beam is een bèta met wachtlijst, waarbij de gewichten later in oktober onder Apache 2.0 worden beloofd.
• Onafhankelijke scores — K3 heeft een volledige Artificial Analysis-rij; Beam heeft die niet.
• Servingprofiel — Kimi K3 is een groot, enigszins dense frontier-model met 46,8 outputtokens per seconde in onze eigen playground-meting over de afgelopen week; de 23B actieve parameters van Beam vormen een echt architectonisch argument voor lagere latentie en lagere kosten per token, maar er is geen publiek toegankelijk endpoint om het op te meten.
De efficiëntieclaim verdient nog één extra zorgvuldige zin, want deze is de headline van de lancering en doet meer werk dan hij aankan. De "3 tot 4× minder inferentie-rekenkracht" van Reflection komt uit een grafiek die FLOPs benadert als twee keer het aantal actieve parameters maal het gemiddelde aantal gegenereerde tokens. Die formule sluit bewust prompt-prefill, attentionkosten en serving-overhead uit — de delen van de rekening die agentisch werk met lange context domineren. Het is een ruwe schatting van een rekenkracht-ratio, geen meting, geen dollarbedrag, en het is door de leverancier gemaakt. Zie het als een hypothese die iemand anders met de gewichten kan testen.
Waar OrcaRouter zich hierin bevindt
Kimi K3 is een van onze routes. Het staat vermeld tegen $3.00 input en $15.00 output per miljoen tokens met cache-leesbewerkingen tegen $0.30, wat het providertarief van Moonshot is dat wordt doorgegeven zonder iets toe te voegen — dus als Moonshot zijn tariefkaart aanpast, verandert het cijfer op onze pagina dezelfde dag, in plaats van wanneer een reseller maar vernieuwt. Het is aanroepbaar via één OpenAI-compatibele sleutel naast meer dan 200 andere modellen, wat hier om een specifieke reden toe doet: het eerlijke antwoord op "Beam of K3?" is dat een team dat zijn risico's spreidt, niet zou moeten kiezen. Omdat automatische failover deel uitmaakt van de routering in plaats van iets dat je zelf bouwt, is een model als Beam — bèta, zonder prijs, niet beoordeeld door enige derde partij — precies het ding dat je op een deel van het verkeer zet in plaats van op je kritieke pad. Je routeert het werk standaard naar K3, stuurt Beam een deel wanneer je uitnodiging voor de wachtlijst binnenkomt, en laat de routering bij een fout terugvallen op K3. Dat is een beslissing die je kunt nemen over een onbewezen model. Een productiepad erop wedden is dat niet.

Wat zou deze uitspraak veranderen?
Drie dingen, in aflopende volgorde van hoeveel ze ertoe doen.
Een prijs. Als Beam onder het K3-niveau uitkomt, zou dat het efficiëntieargument concreet maken in plaats van theoretisch. Ten tweede, de gewichten. Apache 2.0 plus een technisch rapport zou iedereen met een paar nodes in staat stellen om tokens per seconde per GPU te meten bij een vaste kwaliteitsdrempel — de test die een rekenkrachtclaim daadwerkelijk beslecht. Ten derde, een harness-run door een derde partij. Reflection heeft Artificial Analysis toegang gegeven en er wordt een score van verwacht; totdat dat getal verschijnt, voert elk Beam-versus-K3-cijfer dat circuleert terug op een document dat door een van de twee leveranciers is geschreven.
Twee vragen die een direct antwoord verdienen
Is Reflection Beam beter dan Kimi K3?
Op basis van het vandaag beschikbare bewijs: nee — en niemand heeft bewijs gepubliceerd dat dat wel zo is. In de eigen tabel van Reflection ligt K3 op alle tien hierboven gedeelde rijen voor, waarvan verschillende met marges (SWE Atlas 34,6 tegen 68,0, DeepSearchQA 80,1 tegen 95,0) die niet dicht bij elkaar liggen. Het argument van Beam is kosten per eenheid capaciteit, en dat argument is een door de leverancier getekende grafiek totdat er gewichten en een prijs zijn.
Moet ik wachten op de gewichten van Beam voordat ik op K3 bouw?
Alleen als self-hosting een vereiste is in plaats van een voorkeur, want dat is de enige dimensie waarop de twee geen substituut voor elkaar zijn — K3 is alleen API, terwijl Beam Apache 2.0-gewichten belooft. Als je een API aanroept, is K3 beschikbaar, heeft het scores en een prijs, en Beam is een wachtlijst. Er is geen versie van die beslissing die het waard is om een project voor uit te stellen.

Reflection heeft ons een datum en een grafiek gegeven, en een datum is geen model. Het enige wat de lancering echt vaststelt, is dat een 501B-model dat 23B parameters activeert, kan worden getraind om binnen een paar punten van de open frontier te zitten — wat, als de gewichten arriveren en de cijfers standhouden, een betekenisvol resultaat over efficiëntie is. Het is nog geen reden om werk weg te halen bij een model dat een derde partij daadwerkelijk heeft gemeten.
