
Reflection Beam, förklarat: 501B parametrar, 23B aktiva och vikter som ännu inte är släppta
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 145 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 128 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 183 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Den 5 oktober 2026 meddelade Reflection Reflection Beam, en gles mixture-of-experts-språkmodell med totalt 501 miljarder parametrar som aktiverar 23 miljarder av dem per token, och samma dag gjorde en OpenAI-kompatibel betaslutpunkt tillgänglig för den. Det är 4,6 procent av modellen som är vaken vid varje given tidpunkt – en aggressiv kvot även med det nuvarande open-weight-fältets mått mätt – och det är siffran som hela lanseringen hänger på. Reflection säger att de fullständiga vikterna, en teknisk rapport och ett modellkort kommer senare denna månad under Apache 2.0. I dag finns de inte här, inget pris har publicerats någonstans på Reflections egna plattformar, och Artificial Analysis har ingen rad för modellen. Så den ärliga sammanfattningen av lanseringen är denna: ett mycket specifikt påstående om effektivitet, framfört av labbet som tränade modellen, med varje stödjande siffra levererad av samma labb.
Reflections egna jämförelsetabeller ställer Reflection Beam mot Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max och DeepSeek V4.1 Flash, vilket är en rättvis bild av den nivå den siktar på: starka men inte i absoluta framkanten – öppna och halvöppna modeller, flera av dem en bråkdel av Beams storlek. Beam slår inte det fältet på rå kapacitet, och vi ska visa dig exakt var den förlorar. Det den påstår sig göra är att hamna nära toppen av det samtidigt som den gör av med ungefär tre till fyra gånger mindre inferensberäkning än GLM 5.2 vid jämförbara resonemangspoäng. Det påståendet är artikeln.
Vad som faktiskt finns idag
Allt i det här avsnittet kommer från Reflections egen dokumentation, läst den 6 oktober 2026. API:et är live i beta bakom en väntelista; vikterna är inte ute.
• Modell-ID — Beam-501B-A23B, skapad 5 oktober 2026.
• Gränssnitt — ett OpenAI-kompatibelt gränssnitt på api.reflection.ai/openai/v1, som exponerar Chat Completions och modellistan, och inget annat. Inga Completions, inga embeddings, inga batches.
• Kontext — 256 000 tokens, med en fotnot kopplad till själva siffran: ”Kontextfönstret kan ändras under betan.” Maximal utdata är 128 000 tokens.
• Resonemang – en reasoning_effort-parameter med fem värden: low, medium, high, xhigh och max. Standardvärdet är medium, och modellen resonerar alltid oavsett inställning – det finns ingen avstängningsknapp.
• Modalitet – text in, text ut. Ingen bild- eller ljudinmatning vid lansering, vilket är en verklig skillnad från Inkling, den multimodalitet-först-modell som Mira Muratis Thinking Machines släppte i juli.
• Kunskapsgräns — 30 juni 2026.
• Pris — inte publicerat. Reflections blogginlägg, dess dokumentation och dess modellförteckning utelämnar det allihop, och plattformskonsolen ligger bakom en registreringsvägg.
Den sista raden betyder mer än den verkar. Alla andra modeller i Beams jämförelseurval har ett offentligt listpris som du kan lägga in i ett kalkylblad redan i dag. Det har inte Beam, vilket innebär att varje kostnadsargument om det just nu är ett argument om beräkningskraft, inte om dollar.

Förhållandet 501 till 23 är argumentet.
Sparsitet är inget nytt; frågan är hur långt ett labb är berett att driva den. GLM 5.2 använder omkring 40 miljarder aktiva parametrar av ett totalt antal som uppges ligga i storleksordningen 744 miljarder – cirka 5,4 procent. Reflection Beam ligger på 4,6 procent av 501 miljarder. På papperet är det ett blygsamt steg till, och Reflection är noga med vad man påstår om den.
Effektivitetsiffran i lanseringsinlägget kommer från ett diagram byggt på data från Artificial Analysis och DataCurve, där resonemangspoäng ställs mot uppskattade inferens-FLOPs, och FLOPs approximeras som två gånger antalet aktiva parametrar gånger det genomsnittliga antalet genererade tokens. Den formeln utesluter medvetet prompt-prefill, uppmärksamhetskostnad och serveringskostnader. Det är en överslagsmodell, inte en mätning, och Reflection presenterar den inte som en sådan — men den är också det enda kvantitativa stödet för påståendet "3 till 4× billigare vid samma poäng", och den skrevs av leverantören. Behandla den som en hypotes som vikterna, när de släpps, gör det möjligt för någon annan att testa.
Vad arkitekturen ger i praktiken är en serveringsprofil. Tjugotre miljarder aktiva parametrar är en modell som går att köra på ett jämförelsevis litet antal GPU:er med interaktiv latens, och det är en annan produkt än en tät modell med 501 miljarder parametrar, även om parameterantalet på kortet är detsamma. Det är anledningen till att Reflection kan tala om frontier-nära resonemang utan att tala om en driftsättning i datacenterskala.
Mindre än fyra veckor att förträna, och avslöjandet är ovanligt specifikt
Träningsredogörelsen är den del av releasen som framstår som genuint informativ, eftersom Reflection offentliggjorde siffror som de flesta labb håller interna.
• Förträning – 23,8 biljoner tokens på 6 144 GB300-chip i NVL72-rack, slutförd på under fyra veckor med en rapporterad goodput på 92,3 procent, och med nio återspolningar från kontrollpunkter längs vägen.
• Förstärkningsinlärning — 10 500 GB300-chipar i fyra veckor, över 100 miljoner rollouts, maximal rollout-kontext på 256 000 tokens, ungefär 1,3 miljarder sandlådor och omkring en miljon distinkta miljöer, med i genomsnitt 110 000 rollouts som körs samtidigt.
• Midtraining — utökar modellens effektiva kontext till 1 miljon tokens.
• Stabilitet — asynkrona policy-gradienter som förblir stabila med föråldring på dagsnivå, plus ett kontrollerbart längdstraff så att resonemangslängden kan justeras utan omträning.
Läs raderna för pre-training och RL tillsammans, så framträder påståendets form. Effektivitetsberättelsen handlar inte bara om aktiva parametrar vid inferens; den handlar också om hur snabbt modellen tränades och hur mycket av beräkningskraften som gick till miljöbundet RL i stället för till fler tokens. En miljon miljöer och 1,3 miljarder sandlådor är ett uttalande om infrastruktur för verktygsanvändning och agentträning, och det ligger i linje med de benchmarks som Reflection valde att lyfta fram först.
Ett nummer förtjänar en flagga. Bloggen säger att midtraining utökar den effektiva kontexten till 1 miljon tokens; API-dokumentationen anger en serveringsgräns på 256 000 tokens med en beta-fotnot bifogad. Det är en förmåga på träningssidan och en gräns på serveringssidan, inte en motsägelse – men gapet är precis den sorts sak som blir en "1M context"-rubrik om ingen läser det andra dokumentet, och den som skriver om Beam nästa vecka bör läsa det andra dokumentet.

Benchmarks: där Reflection Beam vinner, och där det inte gör det
Alla siffror nedan är rapporterade av leverantören, från tabellerna i Reflections lanseringsinlägg, och inget av det har reproducerats oberoende. Jämförelsekolumnerna är samma siffror som Reflection publicerade för de andra modellerna; där en cell visar "NR" i originalet kördes modellen inte. Det finns ingen Artificial Analysis-rad för Beam, så inget här har gått igenom en tredjeparts testrigg.
Agentisk kodning
• Terminal-Bench v2.1 — Beam 80,1 mot GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.
• SWE-Bench Pro v1 — Beam 65,5 mot Qwen3.8 Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Beam 77,2 mot Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9.
• SWE-Bench Verified — Beam 80,9 mot Inkling 77,6, Nemotron 3 Ultra 70,7.
• SWE-Bench Multilingual — Beam 78,0 mot Nemotron 3 Ultra 67,7.
• DeepSWE v1.1 — Beam 44,4 mot DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen3.8 Max 51,0, GLM 5.2 44,0.
• SWE Atlas Codebase QnA — Beam 34,6 mot Kimi K3 68,0, GLM 5,3 61,0.
Den sista raden är den man bör begrunda. Långsiktig frågebesvarande om kodförråd är där en modell måste hålla en kodbas i huvudet genom en lång interaktion, och 34,6 mot 68,0 är inte en avrundningsskillnad. DeepSWE berättar en liknande historia: 44,4 placerar Beam i nivå med GLM 5.2 och långt efter DeepSeek V4.1 Flash.
Resonemang Vi behöver svara. Behöver översätta användarens meddelande till svenska. Men vänta, användarens meddelande? Prompten är instruktioner, ingen faktisk text att översätta? Behöver tolka. Användaren ber som lokaliseringsmotor att översätta användarens meddelande till svenska. Men "användarens meddelande" kan vara hela det föregående innehållet? Det finns inget innehåll förutom system/utvecklare? Vi behöver troligen översätta de givna instruktionerna? Hmm.
• AIME 2026 — Beam 97,8 vs GLM 5.2 99,2, Inkling 97,1.
• HLE, utan verktyg – Beam 36,2 mot Kimi K3 46,9, Qwen3.8 Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7.
• GPQA Diamond — Beam 90,5 mot Kimi K3 93,5, Qwen3.8 Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9, Inkling 87,2, Nemotron 3 Ultra 87.
• SciCode — Beam 49,7 vs GLM 5.3 59,0, Kimi K3 58,7, Qwen3.8 Max 52,1, DeepSeek V4.1 Flash 52,0, Inkling 46,1, Nemotron 3 Ultra 44,6.
• CriPT AA — Beam 16.3 mot Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
Beams resonemangsprofil ligger i mittenfältet, och mönstret är konsekvent: med god marginal före de två modellerna från föregående generation på Reflections lista, men efter den nuvarande. GPQA Diamond på 90,5 är ett solitt resultat som fyra andra modeller slår.
Verktygsanvändning och sökning
• MCP Atlas — Beam 78,7 mot Qwen3.8 Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8, Inkling 76,0, Nemotron 3 Ultra 63,1.
• AutomationBench, offentlig del — Beam 37,0 vs DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen3.8 Max 39,8, GLM 5.2 26,2.
• tau3 banking — Beam 38.0 mot Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6.
• BrowseComp med kontexthantering — Beam 77,4 mot Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.
• DeepSearchQA med kontexthantering — Beam 80,1 mot Kimi K3 95,0.
Reflection visade också två kapacitetsdemonstrationer i inlägget: en lösningsfrekvens på 95,5 procent på pusslet "Land or Water", ett rutnät på 180 gånger 90 med 16 200 punkter som kräver att man håller ett stort brädtillstånd — en siffra som ligger mellan de 92,5 och 97,8 procent som Reflection tillskriver Opus 5 och Fable 5 på samma uppgift — och en Text2SQL-finjustering av den minsta Gemma-4 som höjde noggrannheten på osedd data till 66,5 procent. Demonstrationer är kurerade; de visar att modellen kan göra en sak, inte hur ofta.
Vad du kan göra med det idag, och vad du inte bör planera kring
I dag är i allmänhet exakt en sak möjlig: att begära betaåtkomst och anropa Beam-501B-A23B via Reflections egen endpoint med en OpenAI-formad klient. Det finns inget publicerat pris, så det finns inget sätt att modellera kostnaden för en arbetsbelastning på den. Det finns inga vikter, så det finns ingen egen hosting, ingen kvantisering, ingen finjustering och ingen tredjepartsreproducerbarhet. Det finns ingen oberoende benchmark-rad, så hela prestandabilden ovan vilar på ett labbs tabeller.
Reflection Beam är inte en av våra rutter. Vi kommer inte att antyda något annat, och vi kommer inte att hänvisa dig till en återförsäljare som kanske har den. Vad vi kan berätta är vad jämförelsegruppen kostar, för vi dirigerar fyra av dessa modeller och siffrorna nedan är hämtade live från vår egen katalog i morse: GLM 5.2 till $1,40 in och $4,40 ut per miljon token, GLM 5.3 till $1,26 och $3,96, Qwen3.8 Max till $2,00 och $6,00, och DeepSeek V4.1 Flash till $0,15 och $0,60. Det är en rejäl spridning – DeepSeek V4.1 Flash är nästan tio gånger billigare på input än GLM 5.2 – och det är anledningen till att en betamodell utan pris är svår att passa in i ett beslut. OrcaRouter kör en OpenAI-kompatibel nyckel över dessa och över 200 andra modeller med leverantörens listpris vidarebefordrat och inget påslag, vilket innebär att en prisändring från en leverantör slår igenom hos oss samma dag i stället för närhelst en återförsäljare uppdaterar. Och eftersom automatisk redundansväxling är en del av routningen i stället för något du bygger själv, är en ny och obeprövad modell precis den sortens sak du kan lägga på en del av trafiken i stället för på din kritiska väg – vilket är det enda ansvarsfulla sättet att använda något vars benchmarks ingen ännu har reproducerat.

Vad du bör se upp med innan du tar effektivitetsanspråket på allvar
Tre saker kommer att avgöra frågan, och två av dem utlovas inom månaden.
Det första är vikterna. Apache 2.0 och en teknisk rapport skulle göra det möjligt för vem som helst med ett par noder att mäta det som faktiskt spelar roll – tokens per sekund per GPU vid en fast kvalitetsnivå, och huruvida 23 miljarder aktiva parametrar verkligen levererar poäng per FLOP som diagrammet antyder. Fram till dess är effektivitetsargumentet aritmetik på en servett.
Det andra är ett pris. En modell utan listpris har ingen plats i en kostnadsjämförelse, och om Beam hamnar över GLM- och DeepSeek-nivån slutar compute-berättelsen att spela roll för den som har en budget. Om den hamnar under förändras bilden snabbt.
Den tredje är en tredje part som kör sviten. Alla siffror ovan kommer från samma dokument, och en leverantörsrapporterad tabell som rangordnar sin egen modell lägre på sju av sexton rader är ett gott tecken på labbets ärlighet — men det är fortfarande ett labb, en testrigg, en uppsättning prompter.
Om du behöver en kapabel agentisk kodare idag och behöver veta vad den kostar, är svaret ännu inte Reflection Beam. Det kanske är det om tre veckor. Den modell som ett effektivitetsanspråk är värt att satsa på är den vars vikter du kan ladda ner och vars FLOPs du kan räkna själv — och i det testet har Reflection gett oss ett datum och inte en modell.
Jämförda i den här artikeln4
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
