
Reflection Beam veröffentlicht eine API in der Beta, und die Gewichte lassen noch zwei Wochen auf sich warten.
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 150 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Das erste Modell von Reflection heißt Reflection Beam, und das Interessante daran ist heute Morgen nicht, dass es existiert — sondern dass nur die Hälfte davon existiert. Das Unternehmen kündigte Beam am 5. Oktober 2026 als sparse Mixture-of-Experts-Modell mit insgesamt 501 Milliarden Parametern und 23 Milliarden aktiven pro Token an und stellte noch am selben Tag einen OpenAI-kompatiblen Beta-Endpunkt dafür bereit. Die Gewichte sind für später in diesem Monat unter Apache 2.0 zugesagt, zusammen mit einem technischen Bericht, einer Modellkarte und dem Serving-Stack. Bis sie erscheinen, sind die Einzigen, die Beam-501B-A23B ausführen können, diejenigen, denen Reflection einen Waitlist-Schlüssel aushändigt, und jede im Umlauf befindliche Leistungsangabe stammt aus den eigenen Tabellen eines einzigen Labors.
Das ist ein seltsamer Punkt, an dem ein Launch endet, und es lohnt sich, genau zu sein, welche Hälfte wir haben. Reflection hat eine Preview veröffentlicht, für die man sich anmelden kann, und eine Reihe von Benchmark-Tabellen, die niemand reproduziert hat. Es hat nicht das veröffentlicht, worauf sich „open-weight“ in der Schlagzeile bezieht.
Was ist heute Morgen eigentlich live?
Alles in diesem Abschnitt stammt aus dem eigenen Blogbeitrag und der Dokumentation von Reflection, gelesen am 6. Oktober 2026.
• Modell-ID — Beam-501B-A23B, erstellt am 5. Oktober 2026, bereitgestellt unter api.reflection.ai/openai/v1 mit Chat Completions und einer Modellliste und sonst nichts.
• Form — 501 Milliarden Gesamtparameter, 23 Milliarden pro Token aktiv, was einer Aktivierungsquote von etwa 4,6 Prozent entspricht. Zum Größenvergleich: GLM 5.2 liegt bei knapp 5,4 Prozent.
• Kontext — 256.000 Token über die API, mit einer direkt an der Zahl selbst angebrachten Fußnote, die darauf hinweist, dass sich das Fenster während der Beta ändern kann. Maximale Ausgabe: 128.000 Token.
• Reasoning — ein reasoning_effort-Parameter mit fünf Einstellungen: low, medium, high, xhigh und max. Medium ist die Standardeinstellung, und das Modell betreibt immer Reasoning. Es gibt keinen Ausschalter und keinen Modus ohne Reasoning.
• Modalität — Text rein, Text raus. Zum Start kein Eingang für Bild, Audio oder Video.
• Preis — nicht veröffentlicht. Der Blogbeitrag nennt keinen Preis, die Dokumentation nennt keinen, und die Plattformkonsole befindet sich hinter einer Registrierungswand.
• Zugang — eine Warteliste. Es gibt keinen Selbstbedienungsweg und keine Gewichte, also gibt es keinen Download, keine Quantisierung und kein Fine-Tuning.
Die Preiszeile ist diejenige, die verändert, wie man alles andere liest. Vier der sieben Modelle, mit denen Beam in Reflections eigenen Tabellen verglichen wird, haben öffentliche Listenpreise, die man heute in eine Tabellenkalkulation eintragen kann. Bei Beam ist das nicht der Fall, also ist jede Kostenbehauptung über es derzeit eine Behauptung über Rechenleistung, nicht über Dollar.

Die Zahl, von der der Start abhängt
Der Pitch von Reflection ist Inferenzeffizienz, und er ist ungewöhnlich konkret darin, was das bedeutet: Auf fortgeschrittenen Reasoning-Benchmarks erzielt Beam eine vergleichbare Punktzahl wie GLM 5.2, verbraucht dabei aber 3- bis 4-mal weniger Inferenzrechenleistung. Die Gewinne werden als noch größer beschrieben gegenüber Modellen in der 2-Billionen-Parameter-Familie, in der Qwen 3.8-Max angesiedelt ist.
Das Diagramm hinter dieser Behauptung lohnt eine sorgfältige Lektüre, denn es ist das tragende Beweismittel im gesamten Beitrag. Es stellt den Reasoning-Score geschätzten Inferenz-FLOPs gegenüber – über DeepSWE, Humanity's Last Exam und Terminal-Bench 2.1 hinweg – und schätzt FLOPs als ungefähr das Doppelte der Anzahl aktiver Parameter mal die durchschnittliche Anzahl generierter Tokens pro Versuch. Diese Formel schließt absichtlich Prompt-Prefill, kontextabhängige Attention-Operationen und Serving-Overhead aus — Reflection sagt das in der Bildunterschrift. Sie ist ein konsistenter Vergleich zwischen Modellen und keine Messung der Rechnung von irgendjemandem, und sie ist außerdem die einzige quantitative Stütze für die Effizienzbehauptung, verfasst von dem Labor, das das Modell gebaut hat. Betrachte sie als eine Hypothese, die jemand anderes anhand der Gewichte testen kann.
Was die Architektur in der Praxis tatsächlich bringt, ist ein Serving-Profil. Ein Modell mit dreiundzwanzig Milliarden aktiven Parametern lässt sich plausibel auf einer vergleichsweise kleinen Anzahl von GPUs bei interaktiver Latenz betreiben, was ein anderes Produkt ist als ein dichtes Modell mit 501 Milliarden Parametern, obwohl die Zahl auf dem Datenblatt dieselbe ist. Das ist der Grund, warum Reflection über Frontier-nahes Reasoning sprechen kann, ohne über einen Einsatz im Rechenzentrumsmaßstab sprechen zu müssen — und warum die letztendliche Veröffentlichung der Gewichte das Ereignis ist, das mehr zählt als der Beta-Schlüssel.
Wo Beam auf Reflections eigenen Tabellen landet
Alle unten stehenden Zahlen sind Anbieterangaben aus den Tabellen in Reflections Launch-Post, und keine davon wurde unabhängig reproduziert. Wo Reflection für ein Modell keine Zahl veröffentlicht hat, steht in der Zelle im Original NR. Die Vergleichsspalten stammen von Reflection, nicht von uns und nicht von Dritten.
Programmieren und Terminalarbeit
• Terminal-Bench v2.1 — Reflection Beam 80,1 gegenüber GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen 3.8-Max 86,6 und DeepSeek V4.1 Flash 90,6. Beam liegt unter jedem von ihnen.
• SWE-Bench Verified — Reflection Beam 80,9 gegenüber Inkling 77,6 und Nemotron 3 Ultra 70,7. Hier schneidet Beam am stärksten ab, aber beachten Sie, dass nur die beiden schwächsten Modelle der Liste darauf ausgeführt wurden.
• SWE-Bench Pro v1 — Reflection Beam 65,5 gegenüber Qwen 3.8-Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Reflection Beam 77,2 gegenüber Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9. Eine Lücke von zehn Punkten zur Tabellenspitze.
• DeepSWE v1.1 — Reflection Beam 44,4 gegen DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen 3.8-Max 51,0, GLM 5.2 44,0. Beam liegt gleichauf mit der vorherigen Generation und dreißig Punkte hinter dem Spitzenreiter.
• SWE Atlas Codebase QnA — Reflection Beam 34,6 gegenüber Kimi K3 68,0 und GLM 5.3 61,0. Ein großes Repository über eine lange Interaktion hinweg im Kopf zu behalten, ist das Schwierigste auf dieser Liste, und Beams 34,6 ist kein Rundungsunterschied.
Logik und Wissenschaft
• AIME 2026 — Reflection Beam 97,8 gegen GLM 5.2 99,2 und Inkling 97,1.
• HLE ohne Tools — Reflection Beam 36,2 gegen Kimi K3 46,9, Qwen 3.8-Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7. Im Mittelfeld – und nur vor den beiden Modellen der vorherigen Generation.
• GPQA Diamond — Reflection Beam 90,5 gegen Kimi K3 93,5, Qwen 3.8-Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9.
• SciCode — Reflection Beam 49,7 gegen GLM 5.3 59,0, Kimi K3 58,7, Qwen 3.8-Max 52,1, DeepSeek V4.1 Flash 52,0.
• CriPT AA — Reflection Beam 16.3 gegen Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
Werkzeuge, Suche und langer Kontext
• MCP Atlas — Reflection Beam 78,7 gegen Qwen 3.8-Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8.
• AutomationBench, öffentlicher Split — Reflection Beam 37,0 gegen DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen 3.8-Max 39,8, GLM 5.2 26,2.
• tau3 banking — Reflection Beam 38.0 gegen Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1.
• BrowseComp mit Kontextmanagement — Reflection Beam 77,4 gegen Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.
• DeepSearchQA mit Kontextmanagement — Reflection Beam 80,1 gegen Kimi K3 95,0.
• AA-LCR — Reflection Beam 79,3 gegenüber Kimi K3 88,7, DeepSeek V4.1 Flash 84,0, Qwen 3.8-Max 80,3, GLM 5.3 79,7, Nemotron 3 Ultra 79,3, GLM 5.2 78,3, Inkling 77,3. Langkontext-Rückruf ist die einzige Zeile im Bereich allgemeiner Fähigkeiten, in der Beam wirklich konkurrenzfähig ist und nicht nur Mittelfeld.
Liest man die vier Tabellen zusammen, ergibt sich ein konsistentes Bild: In fast jeder Zeile schlägt Beam auf der Liste von Reflection die beiden Modelle der vorherigen Generation und verliert gegen das aktuelle – mit Abständen, die von gering bis disqualifizierend reichen. Ein Anbieter, der Tabellen veröffentlicht, die sein eigenes Modell in so vielen Zeilen schlechter dastehen lassen, ist ein gutes Zeichen für die Ehrlichkeit des Labors. Es ist kein Zeichen dafür, dass das Modell an der Spitze steht.

Die eine unabhängige Stimme bisher, und was sie nicht sagt
Die einzige dokumentierte Bewertung durch Dritte ist Artificial Analysis, die am 5. Oktober sagte, dass Reflection ihr Zugang gewährt habe und dass sie ein unabhängiges Benchmarking von Beam durchführe, und hinzufügte, dass frühe Indikatoren darauf hindeuten, dass Beam eines der token-effizientesten offenen Modelle sein werde, die sie für sein Intelligenzniveau gesehen habe.
Das ist eine bedeutsame Aussage der Organisation, deren Index derjenige ist, den die meisten Käufer tatsächlich lesen, und sie ist zugleich eine Aussage, in der keine Zahl vorkommt. Seit heute Morgen gibt es keine Beam-Zeile in der Rangliste von Artificial Analysis — die Modellseiten liefern 404, und die Nutzlast der Rangliste enthält keinen Beam-Eintrag —, sodass die Token-Effizienz-Behauptung vorerst ein Versprechen eines Dritten ist, dass er etwas veröffentlichen wird. Im Index wurde noch nichts auf Beam neu berechnet.
Die Trainingsoffenlegung, die der stärkste Teil der Veröffentlichung ist
Der Engineering-Abschnitt von Reflections Beitrag enthält Zahlen, die die meisten Labs intern behalten, und sie sind es wert, festgehalten zu werden, denn sie sind der Teil des Releases, der auch in einem Monat noch interessant sein wird.
• Pre-Training – 23,8 Billionen kuratierte Tokens auf 6.144 NVIDIA GB300 Chips in NVL72-Racks, Ende-zu-Ende in weniger als vier Wochen abgeschlossen, bei einem gemeldeten Goodput von 92,3 Prozent, mit neun halbautomatischen Rücksetzungen unterwegs, die auf Gradientennorm-Spitzen oder vermutete stille Datenkorruption zurückgeführt wurden.
• Bestärkendes Lernen — 10.500 GB300-Chips über vier Wochen, mehr als 100 Millionen Rollouts, ein maximaler Rollout-Kontext von 256.000 Tokens, rund 1,3 Milliarden Sandboxes und etwa eine Million unterschiedliche Umgebungen, die für Coding-, agentische und MINT-Aufgaben bezogen wurden.
• Bereitstellung — neue Gewichte erreichten die Inferenzflotte in einem Median von etwa 12 Sekunden, wobei hierarchische Verteilung den rackübergreifenden Verkehr um 75 Prozent reduzierte und die flottenweite Übernahme 2,2-mal schneller machte als jedes Replikat, das die Gewichte selbst abruft.
• Stabilität — vollständig asynchrone Policy-Gradienten, die numerisch stabil bleiben, wenn aus einen Tag alten Interaktionen gelernt wird, plus eine steuerbare Längenstrafe, um die Reasoning-Länge gegen den Score abzuwägen, ohne erneutes Training.
• Daten – etwa 95 Prozent der rohen Internet-Tokens wurden durch Parsing, Deduplizierung und Kuratierung entfernt, mit der Behauptung, dass herkömmliche Filter etwa 1,8 Billionen der von Reflection beibehaltenen Tokens übersehen hätten, darunter 87 Prozent seiner kuratierten Web-Code-Tokens.
Zwei Zeilen verdienen eine Markierung. Der Beitrag besagt, dass Midtraining den effektiven Kontext von Beam auf 1 Million Tokens erweitert, während die API-Dokumentation ein Serving-Limit von 256.000 Tokens mit einer Beta-Fußnote angibt. Dabei handelt es sich um eine trainingsseitige Fähigkeit und ein Serving-Limit, nicht um einen Widerspruch, aber genau diese Lücke wird zur „1M context“-Schlagzeile, wenn niemand das andere Dokument liest. Und die RL-Zahl von mehr als 100 Millionen Rollouts wird als einer der größten derartigen Runs eines offenen Labors präsentiert, was eine Behauptung über die Skalierung ist, nicht darüber, was die Skalierung gebracht hat – die Score-gegen-Rollouts-Kurve stammt vom Anbieter selbst und endet dort, wo der Anbieter aufgehört hat, sie zu zeichnen.

Was du heute mit Reflection Beam machen kannst
Eines noch: Trag dich in die Warteliste ein und, wenn du einen Schlüssel bekommst, rufe Beam-501B-A23B über den eigenen Endpoint von Reflection mit einem Client im OpenAI-Format auf. Es gibt keinen veröffentlichten Preis, also gibt es keine Möglichkeit, die Kosten einer Workload darauf zu modellieren. Es gibt keine Gewichte, also gibt es kein Self-Hosting, keine Quantisierung und keine Reproduktion durch Dritte. Es gibt keine unabhängige Benchmark-Zeile, also beruht das gesamte oben dargestellte Leistungsbild auf den Tabellen eines einzelnen Labors.
Reflection Beam ist keine unserer Routen, und wir werden nicht andeuten, dass es eine ist. Was wir Ihnen geben können, ist der Preis des Feldes, in das es einzutreten versucht, heute Morgen live aus unserem eigenen Katalog ausgelesen: GLM 5.2 bei 1,40 $ Input und 4,40 $ Output pro Million Token, GLM 5.3 bei 1,26 $ und 3,96 $, Qwen 3.8-Max bei 2,00 $ und 6,00 $ sowie DeepSeek V4.1 Flash bei 0,15 $ und 0,60 $. Das ist allein beim Input eine Spanne von mehr als dem Neunfachen zwischen dem günstigsten und dem teuersten — und deshalb ist ein Beta-Modell ohne Listenpreis wirklich schwer in eine Entscheidung einzuordnen, egal wie gut sein Effizienzdiagramm aussieht.
OrcaRouter betreibt einen einzigen OpenAI-kompatiblen Schlüssel über diese vier und über 200 weitere Modelle hinweg und gibt den Listenpreis des Anbieters ohne jeden Aufschlag weiter, sodass eine Preisänderung eines Anbieters bei uns noch am selben Tag live ist und nicht erst dann, wenn ein Wiederverkäufer irgendwann eine Tabelle aktualisiert. Automatisches Failover ist Teil des Routings und nicht etwas, das man um jeden Anbieter herum selbst bauen muss, was bedeutet, dass ein nicht erprobtes Modell – ohne Reproduktion, ohne unabhängige Bewertung und ohne Preis – genau die Art von Sache ist, die man auf einen Teil des Traffics legt statt auf den kritischen Pfad.
Wenn die Behauptung überprüfbar wird
Drei Dinge entscheiden das, und Reflection hat zwei davon in den Monat gelegt.
Das Erste sind die Gewichte. Apache 2.0 plus ein technischer Bericht erlaubt es jedem mit ein paar Knoten, das zu messen, worauf es ankommt – Tokens pro Sekunde pro GPU bei einer festen Qualitätslatte, und ob 23 Milliarden aktive Parameter wirklich den Score-pro-FLOP liefern, den das Diagramm nahelegt. Bis dahin ist das Effizienzargument Arithmetik auf einer Serviette, und jeder, der es wiederholt, wiederholt die Bildunterschrift von Reflection.
Das zweite ist ein Preis. Ein Modell ohne Listenpreis hat in einem Kostenvergleich nichts verloren. Wenn Beam über der GLM- und DeepSeek-Klasse landet, spielt die Compute-Story für alle mit Budget keine Rolle mehr; landet es darunter, ändert sich das Bild schnell.
Das Dritte ist der Index. Artificial Analysis hat angekündigt, Beam zu benchmarken, und hat keine Zahl veröffentlicht. Wenn diese Zeile erscheint, wird sie die erste Zahl in dieser Geschichte sein, die Reflection nicht berechnet hat.
Wenn Sie heute einen leistungsfähigen agentischen Coder brauchen und wissen müssen, was er kostet, lautet die Antwort noch nicht Reflection Beam. Vielleicht in drei Wochen. Das Modell, auf das man eine Effizienzbehauptung getrost wetten kann, ist dasjenige, dessen Gewichte Sie herunterladen können und dessen FLOPs Sie selbst zählen können – und in diesem Test hat Reflection uns ein Datum und eine Warteliste gegeben, kein Modell.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
