Ett genererat hero-kort för artikeln ”Reflection Beam släpper ett API i beta, och vikterna är fortfarande två veckor bort”, med titeln ”Reflection Beam” och underrubriken ”Ett API i beta, och vikter som ännu inte är ute”, samt tre chips med texten ”501B totalt / 23B aktiva”, ”256K betakontext” och ”Inget publicerat pris”.
Guides & Insights

Reflection Beam släpper ett API i beta, och vikterna är fortfarande två veckor bort

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Reflections första modell heter Reflection Beam, och det intressanta med den i morse är inte att den finns — det är att bara hälften av den gör det. Företaget tillkännagav Beam den 5 oktober 2026 som en sparse mixture-of-experts-modell med 501 miljarder totala parametrar och 23 miljarder aktiva per token, och satte en beta, OpenAI-kompatibel slutpunkt framför den samma dag. Vikterna utlovas senare denna månad under Apache 2.0, tillsammans med en teknisk rapport, ett modellkort och serveringsstacken. Tills de har släppts är de enda som kan köra Beam-501B-A23B de som Reflection ger en väntelistenyckel till, och varje prestandasiffra i omlopp kommer från ett labs egna tabeller.

Det är en märklig plats för en lansering att stanna vid, och det är värt att vara precis om vilken halva vi har. Reflection har släppt en förhandsversion man kan anmäla sig till och en uppsättning benchmarktabeller som ingen har reproducerat. Man har inte släppt det som "open-weight" i rubriken syftar på.

Vad är egentligen live i morse?

Allt i det här avsnittet är hämtat från Reflections eget blogginlägg och dokumentation, läst den 6 oktober 2026.

• Modell-ID — Beam-501B-A23B, skapat 5 oktober 2026, tillhandahölls på api.reflection.ai/openai/v1 med Chat Completions och en Models-lista och inget annat.

• Shape — 501 miljarder parametrar totalt, 23 miljarder aktiva per token, vilket ger en aktiveringskvot på cirka 4,6 procent. Som jämförelse ligger GLM 5.2 nära 5,4 procent.

• Kontext — 256 000 tokens i API:et, med en fotnot fäst vid själva siffran som varnar för att fönstret kan ändras under betan. Maximal utdata är 128 000 tokens.

• Resonemang — en reasoning_effort-parameter med fem inställningar: low, medium, high, xhigh och max. Medium är standard, och modellen resonerar alltid. Det finns ingen avstängningsbrytare och inget icke-resonerande läge.

• Modalitet — text in, text ut. Ingen bild-, ljud- eller videoinmatning vid lansering.

• Pris — inte publicerat. Blogginlägget uppger inget pris, dokumentationen uppger inget pris, och plattformskonsolen ligger bakom en registreringsvägg.

• Tillgång — en väntelista. Det finns ingen självbetjäningsväg och inga vikter, så det finns ingen nedladdning, ingen kvantisering och ingen finjustering.

Prisraden är den som förändrar hur du läser allt annat. Fyra av de sju modeller som Beam jämförs mot i Reflections egna tabeller har offentliga listpriser som du kan lägga in i ett kalkylblad i dag. Beam har inga, så varje kostnadspåstående om den just nu är ett påstående om beräkningskraft, inte om dollar.

A screenshot of the coding and agentic table in Reflection's Beam launch post, captured 6 October 2026, showing the header 'The below figure shows Beam's performance across a range of coding, agentic, reasoning, and STEM benchmarks. NR denotes scores that have not been reported.' and Beam's own column of rows — DeepSWE v1.1 44.4, SWE-Bench Pro v2-Hard 77.2, SWE-Bench Pro v1 65.5, Terminal-Bench v2.1 80.1, SWE Atlas Codebase QnA 34.6, SWE-Bench Multilingual 78.0 and SWE-Bench Verified 80.9 — beside the comparison columns for Inkling and Nemotron 3 Ultra.

Numret som lanseringen hänger på

Reflections pitch är inferenseffektivitet, och den är ovanligt specifik om vad det innebär: på avancerade resonemangsbenchmarkar presterar Beam jämförbart med GLM 5.2 samtidigt som den använder 3 till 4× mindre inferensberäkning. Vinsterna beskrivs som ännu större mot modeller i familjen med 2 biljoner parametrar, där Qwen 3.8-Max ligger.

Diagrammet bakom det påståendet är värt att läsa noggrant, eftersom det är det bärande beviset i hela inlägget. Det visar resonemangspoäng mot uppskattade inferens-FLOPs över DeepSWE, Humanity's Last Exam och Terminal-Bench 2.1, och det uppskattar FLOPs som ungefär två gånger antalet aktiva parametrar gånger det genomsnittliga antalet genererade tokens per försök. Den formeln utesluter medvetet prompt-prefill, kontextberoende attention-operationer och overhead för servering — Reflection säger det i bildtexten. Det är en konsekvent jämförelse mellan modeller snarare än en mätning av någons faktura, och det är också det enda kvantitativa stödet för effektivitetsanspråket, skrivet av labbet som byggde modellen. Se det som en hypotes som vikterna gör det möjligt för någon annan att testa.

Det arkitekturen faktiskt ger i praktiken är en serveringsprofil. Tjugotre miljarder aktiva parametrar är en modell som du rimligen kan köra på ett jämförelsevis litet antal GPU:er med interaktiv latens, vilket är en annan produkt än en tät modell med 501 miljarder parametrar, även om siffran på kortet är densamma. Det är därför Reflection kan tala om frontier-nära resonemang utan att tala om en driftsättning i datacenterskala — och varför det slutliga släppet av vikterna är händelsen som betyder mer än betanyckeln.

Var Beam hamnar i Reflections egna tabeller

Varje siffra nedan är leverantörsrapporterad, från tabellerna i Reflections lanseringsinlägg, och inget av det har reproducerats oberoende. Där Reflection inte publicerade någon siffra för en modell står NR i cellen i originalet. Jämförelsekolumnerna är Reflections, inte våra och inte någon tredje parts.

Kodning och terminalarbete

• Terminal-Bench v2.1 — Reflection Beam 80,1 mot GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen 3.8-Max 86,6 och DeepSeek V4.1 Flash 90,6. Beam ligger under varenda en av dem.

• SWE-Bench Verified — Reflection Beam 80,9 mot Inkling 77,6 och Nemotron 3 Ultra 70,7. Det är här Beam ser starkast ut, men notera att endast de två svagaste modellerna på listan kördes på det.

• SWE-Bench Pro v1 — Reflection Beam 65,5 mot Qwen 3.8-Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.

• SWE-Bench Pro v2-Hard — Reflection Beam 77.2 mot Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9. Ett tiopoängsglapp till toppen av tabellen.

• DeepSWE v1.1 — Reflection Beam 44,4 mot DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen 3.8-Max 51,0, GLM 5.2 44,0. Beam landar i nivå med föregående generation och trettio poäng bakom ledaren.

• SWE Atlas Codebase QnA — Reflection Beam 34,6 mot Kimi K3 68,0 och GLM 5.3 61,0. Att hålla ett stort kodförråd i minnet under en lång interaktion är det svåraste på den här listan, och Beams 34,6 är inte en avrundningsskillnad.

Resonemang och vetenskap

• AIME 2026 — Reflection Beam 97,8 mot GLM 5.2 99,2 och Inkling 97,1.

• HLE utan verktyg — Reflection Beam 36,2 mot Kimi K3 46,9, Qwen 3.8-Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7. I mitten av fältet, och bara före de två modellerna från föregående generation.

• GPQA Diamond — Reflection Beam 90,5 mot Kimi K3 93,5, Qwen 3.8-Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9.

• SciCode — Reflection Beam 49,7 mot GLM 5.3 59,0, Kimi K3 58,7, Qwen 3.8-Max 52,1, DeepSeek V4.1 Flash 52,0.

• CriPT AA — Reflection Beam 16,3 mot Kimi K3 23,4, GLM 5.2 20,9, Qwen 3.8-Max 20,0, GLM 5.3 19,1, DeepSeek V4.1 Flash 14,3, Inkling 5.4, Nemotron 3 Ultra 3,1.

Verktyg, sökning och lång kontext

• MCP Atlas — Reflection Beam 78,7 mot Qwen 3.8-Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8.

• AutomationBench, offentlig delning — Reflection Beam 37.0 mot DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen 3.8-Max 39.8, GLM 5.2 26.2.

• tau3 banking — Reflection Beam 38,0 mot Qwen 3.8-Max 55,2, GLM 5.2 37,1, Kimi K3 37,1.

• BrowseComp med kontexthantering — Reflection Beam 77.4 mot Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4.

• DeepSearchQA med kontexthantering — Reflection Beam 80.1 mot Kimi K3 95.0.

• AA-LCR — Reflection Beam 79,3 mot Kimi K3 88,7, DeepSeek V4.1 Flash 84,0, Qwen 3.8-Max 80,3, GLM 5.3 79,7, Nemotron 3 Ultra 79,3, GLM 5.2 78,3, Inkling 77,3. Återkallning i lång kontext är den enda raden för allmän förmåga där Beam verkligen är konkurrenskraftig i stället för medelmåttig.

Läser man de fyra tabellerna tillsammans framträder ett konsekvent mönster: Beam slår de två modellerna från föregående generation på Reflections lista och förlorar mot den nuvarande, på nästan varje rad, med marginaler som sträcker sig från små till diskvalificerande. Att en leverantör publicerar tabeller som placerar den egna modellen efter på så många rader är ett gott tecken på labbets ärlighet. Det är inte ett tecken på att modellen är i framkant.

A screenshot of the efficiency section of Reflection's Beam launch post, captured 6 October 2026, showing the sentence 'On advanced reasoning benchmarks, it achieves scores comparable to GLM-5.2 while using 3-4x less inference compute.', the note that gains are more pronounced against 2T+ parameter models like Qwen 3.8-Max, the claim that the results mean 'more intelligence per token', and a score-versus-estimated-FLOPs chart plotting DeepSWE, HLE (text only) and Terminal-Bench 2.1 across reasoning-effort settings.

Den enda oberoende rösten hittills, och vad den inte säger

Den enda tredjepartsbedömning som finns dokumenterad är Artificial Analysis, som den 5 oktober uppgav att Reflection hade gett dem åtkomst och att de oberoende benchmarkade Beam, och tillade att tidiga indikatorer tyder på att Beam kommer att vara en av de mest token-effektiva öppna modeller de har sett för sin intelligensnivå.

Det är ett meningsfullt uttalande från organisationen vars index är det som de flesta köpare faktiskt läser, och det är också ett uttalande utan en siffra i sig. Sedan i morse finns det ingen Beam-rad på Artificial Analysis resultattavla – modellsidorna returnerar 404 och resultattavlans nyttolast innehåller ingen Beam-post – så påståendet om token-effektivitet är för närvarande ett löfte från en tredje part om att den kommer att publicera något. Inget i indexet har ännu räknats om på Beam.

Träningsredogörelsen, som är den starkaste delen av träningen.

Teknikavsnittet i Reflections inlägg innehåller siffror som de flesta labb håller internt, och de är värda att dokumentera eftersom de är den del av releasen som fortfarande kommer att vara intressant om en månad.

• Förträning — 23,8 biljoner kurerade tokens på 6 144 NVIDIA GB300-chips i NVL72-rack, slutförd från början till slut på under fyra veckor, med en rapporterad goodput på 92,3 procent, med nio halvautomatiska återspolningar längs vägen som tillskrevs spikar i gradientnormen eller misstänkt tyst dataförvanskning.

• Förstärkningsinlärning – 10 500 GB300-chippar i fyra veckor, mer än 100 miljoner rollouts, en maximal rollout-kontext på 256 000 tokens, ungefär 1,3 miljarder sandlådor och omkring en miljon distinkta miljöer som anskaffats för kodnings-, agentiska och STEM-uppgifter.

• Serving — nya vikter nådde inferensflottan på i median cirka 12 sekunder, med hierarkisk distribution som minskade trafiken mellan rack med 75 procent och gjorde att införandet i hela flottan gick 2,2× snabbare än varje replik som hämtade vikter själv.

• Stabilitet – helt asynkrona policy-gradienter som förblir numeriskt stabila när de lär sig från interaktioner som är en dag gamla, plus ett styrbart längdstraff för att avväga resonemangslängd mot poäng utan omträning.

• Data — ungefär 95 procent av råa internettoken eliminerades genom parsning, deduplicering och kurering, med påståendet att konventionella filter skulle ha missat ungefär 1,8 biljoner av de tokens som Reflection behöll, inklusive 87 procent av dess kurerade webbkodstoken.

Två rader förtjänar en flagga. Inlägget säger att midtraining utökar Beams effektiva kontext till 1 miljon token, medan API-dokumentationen anger en serveringsgräns på 256 000 token med en betafotnot. Det är en kapacitet på träningssidan och en gräns på serveringssidan snarare än en motsägelse, men gapet är precis vad som blir en rubrik om ”1M kontext” om ingen läser det andra dokumentet. Och RL-siffran på fler än 100 miljoner rollouts presenteras som en av de största sådana körningarna från något öppet labb, vilket är ett påstående om skala, inte om vad skalan gav — kurvan för poäng mot rollouts är leverantörens egen och slutar där leverantören slutade plotta den.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Vad du kan göra med Reflection Beam idag

En sak: ställ dig på väntelistan och, om du får en nyckel, anropa Beam-501B-A23B via Reflections egen endpoint med en OpenAI-formad klient. Det finns inget publicerat pris, så det går inte att modellera kostnaden för en arbetsbelastning på den. Det finns inga vikter, så det finns ingen egen hosting, ingen kvantisering och ingen tredjepartsreproduktion. Det finns ingen oberoende benchmark-rad, så hela prestandabilden ovan vilar på ett enda labs tabeller.

Reflection Beam är inte en av våra rutter, och vi kommer inte att antyda att den är det. Det vi kan ge dig är priset för det fält den försöker ta sig in på, läst live från vår egen katalog i morse: GLM 5.2 till $1.40 in och $4.40 ut per miljon tokens, GLM 5.3 till $1.26 och $3.96, Qwen 3.8-Max till $2.00 och $6.00, och DeepSeek V4.1 Flash till $0.15 och $0.60. Det är en spridning på mer än nio gånger mellan den billigaste och den dyraste enbart på input — och det är därför en betamodell utan listpris verkligen är svår att passa in i ett beslut, hur bra dess effektivitetsdiagram än ser ut.

OrcaRouter kör en OpenAI-kompatibel nyckel över de fyra och över 200 andra modeller, och förmedlar leverantörens listpris vidare utan något påslag, så att en leverantörsprisändring slår igenom hos oss samma dag i stället för närhelst en återförsäljare uppdaterar en tabell. Automatisk failover är en del av routningen i stället för något man bygger runt varje leverantör, vilket innebär att en oprövad modell – utan reproduktion, utan oberoende poäng och utan pris – är precis den typ av sak man lägger på en del av trafiken i stället för på sin kritiska väg.

När påståendet blir testbart

Tre saker avgör detta, och Reflection har lagt två av dem inom månaden.

Det första är vikterna. Apache 2.0 plus en teknisk rapport gör att vem som helst med ett par noder kan mäta det som spelar roll — tokens per sekund per GPU vid en fast kvalitetsnivå, och huruvida 23 miljarder aktiva parametrar verkligen levererar poäng per FLOP som diagrammet antyder. Fram till dess är effektivitetsargumentet aritmetik på en servett, och alla som upprepar det upprepar Reflections bildtext.

Det andra är ett pris. En modell utan listpris har ingen plats i en kostnadsjämförelse. Om Beam hamnar över GLM- och DeepSeek-nivån slutar berättelsen om beräkningskraft att spela roll för alla med en budget; om den hamnar under förändras bilden snabbt.

Den tredje är indexet. Artificial Analysis har sagt att de benchmarkar Beam och har inte publicerat någon siffra. När den raden dyker upp blir den den första siffran i den här berättelsen som Reflection inte har beräknat.

Om du i dag behöver en kapabel agentisk kodare och behöver veta vad den kostar, är svaret ännu inte Reflection Beam. Det kan vara det om tre veckor. Den modell som ett effektivitetsanspråk är värt att satsa på är den vars vikter du kan ladda ner och vars FLOPs du själv kan räkna — och i det testet har Reflection gett oss ett datum och en väntelista, inte en modell.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen