
Reflection Beam erklärt: 501B Parameter, 23B aktiv und Gewichte, die noch nicht veröffentlicht sind
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 145 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 128 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 183 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Am 5. Oktober 2026 kündigte Reflection Reflection Beam an, ein Sparse-Mixture-of-Experts-Sprachmodell mit insgesamt 501 Milliarden Parametern, von denen pro Token 23 Milliarden aktiviert werden, und stellte noch am selben Tag einen OpenAI-kompatiblen Beta-Endpunkt davor. Das sind 4,6 Prozent des Modells, die zu jedem Zeitpunkt wach sind — ein aggressives Verhältnis selbst nach den Maßstäben des derzeitigen Open-Weight-Bereichs — und es ist die Zahl, an der der gesamte Launch hängt. Reflection sagt, die vollständigen Gewichte, ein technischer Bericht und eine Modellkarte würden später in diesem Monat unter Apache 2.0 erscheinen. Stand heute sind sie nicht hier, auf Reflections eigenen Angeboten wurde nirgendwo ein Preis veröffentlicht, und Artificial Analysis hat keine Zeile für das Modell. Die ehrliche Zusammenfassung des Launches ist also diese: eine sehr spezifische Behauptung über Effizienz, aufgestellt von dem Labor, das das Modell trainiert hat, wobei jede unterstützende Zahl von diesem Labor geliefert wurde.
Reflections eigene Vergleichstabellen stellen Reflection Beam gegen Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max und DeepSeek V4.1 Flash, was ein zutreffendes Bild der Klasse ist, die es anstrebt: starke, aber nicht an der Spitze stehende offene und halboffene Modelle, von denen einige nur einen Bruchteil von Beams Größe haben. Beam schlägt dieses Feld bei der rohen Leistungsfähigkeit nicht, und wir zeigen Ihnen genau, wo es verliert. Was es zu leisten behauptet, ist, nahe an die Spitze dieses Feldes zu gelangen, während es bei vergleichbaren Reasoning-Werten etwa drei- bis viermal weniger Inferenz-Rechenleistung verbraucht als GLM 5.2. Diese Behauptung ist der Artikel.
Was heute tatsächlich existiert
Alles in diesem Abschnitt stammt aus der eigenen Dokumentation von Reflection, gelesen am 6. Oktober 2026. Die API ist in der Beta-Phase live, aber nur über eine Warteliste zugänglich; die Gewichte sind noch nicht veröffentlicht.
• Modell-ID — Beam-501B-A23B, erstellt am 5. Oktober 2026.
• Schnittstelle — eine OpenAI-kompatible Oberfläche unter api.reflection.ai/openai/v1, die Chat Completions und die Models-Liste bereitstellt und sonst nichts. Keine Completions, keine Embeddings, keine Batches.
• Kontext — 256.000 Token, mit einer direkt an der Zahl angebrachten Fußnote: „Das Kontextfenster kann sich während der Beta ändern.“ Die maximale Ausgabe beträgt 128.000 Token.
• Reasoning — ein reasoning_effort-Parameter mit fünf Werten: low, medium, high, xhigh und max. Der Standardwert ist medium, und das Modell führt unabhängig von der Einstellung immer Reasoning durch – es gibt keinen Ausschalter.
• Modalität — Text rein, Text raus. Zum Start kein Bild- oder Audio-Input, was ein echter Unterschied zu Inkling ist, dem Multimodalität-first-Modell, das Mira Muratis Thinking Machines im Juli veröffentlichte.
• Wissensstand — 30. Juni 2026.
• Preis — nicht veröffentlicht. Reflections Blogbeitrag, seine Dokumentation und sein Modell-Eintrag erwähnen ihn allesamt nicht, und die Plattform-Konsole befindet sich hinter einer Anmeldeschranke.
Die letzte Zeile ist wichtiger, als sie aussieht. Jedes andere Modell in Beams Vergleichsset hat einen öffentlichen Listenpreis, den man heute in eine Tabellenkalkulation eintragen kann. Bei Beam ist das nicht der Fall, was bedeutet, dass jede Kostenargumentation darüber derzeit eine Argumentation über Rechenleistung ist, nicht über Dollar.

Das Verhältnis 501 zu 23 ist das Argument.
Sparsity ist nicht neu; die Frage ist, wie weit ein Labor bereit ist, sie auszureizen. GLM 5.2 hat ungefähr 40 Milliarden aktive Parameter bei einer Gesamtzahl, die im Bereich von 744 Milliarden berichtet wird – etwa 5,4 Prozent. Reflection Beam liegt bei 4,6 Prozent von 501 Milliarden. Auf dem Papier ist das ein bescheidener weiterer Schritt, und Reflection ist vorsichtig mit dem, was sie dafür behauptet.
Die Effizienzkennzahl im Launch-Post stammt aus einem Diagramm, das auf Daten von Artificial Analysis und DataCurve basiert und den Reasoning-Score gegen geschätzte Inferenz-FLOPs aufträgt, wobei die FLOPs näherungsweise als das Zweifache der Anzahl aktiver Parameter multipliziert mit der mittleren Anzahl generierter Tokens berechnet werden. Diese Formel lässt Prompt-Prefill, Attention-Kosten und Serving-Overhead bewusst außen vor. Es ist ein Überschlagsmodell, keine Messung, und Reflection stellt es auch nicht als eine dar – aber es ist zugleich die einzige quantitative Stütze für die Behauptung „3- bis 4-mal günstiger bei gleichem Score“, und es wurde vom Anbieter geschrieben. Betrachten Sie es als eine Hypothese, die jemand anderes testen kann, sobald die Gewichte veröffentlicht werden.
Was die Architektur in der Praxis einbringt, ist ein Serving-Profil. 23 Milliarden aktive Parameter sind ein Modell, das man auf einer vergleichsweise kleinen Anzahl von GPUs bei interaktiver Latenz betreiben kann, und das ist ein anderes Produkt als ein dichtes Modell mit 501 Milliarden Parametern, auch wenn die Parameteranzahl auf der Karte dieselbe ist. Das ist der Grund, warum Reflection über Frontier-nahes Reasoning sprechen kann, ohne über einen Einsatz im Rechenzentrumsmaßstab zu sprechen.
In weniger als vier Wochen vortrainiert, und die Offenlegung ist ungewöhnlich konkret.
Der Trainingsbericht ist der Teil der Veröffentlichung, der wirklich informativ wirkt, weil Reflection Zahlen veröffentlicht hat, die die meisten Labore intern halten.
• Pre-Training — 23,8 Billionen Token auf 6.144 GB300-Chips in NVL72-Racks, abgeschlossen in weniger als vier Wochen bei einem berichteten Goodput von 92,3 Prozent, mit neun Rücksetzungen auf Checkpoints auf dem Weg dorthin.
• Bestärkendes Lernen — 10.500 GB300-Chips über vier Wochen, mehr als 100 Millionen Rollouts, maximaler Rollout-Kontext von 256.000 Tokens, rund 1,3 Milliarden Sandboxes und etwa eine Million unterschiedliche Umgebungen, wobei durchschnittlich 110.000 Rollouts gleichzeitig liefen.
• Midtraining — erweitert den effektiven Kontext des Modells auf 1 Million Tokens.
• Stabilität — asynchrone Policy-Gradienten, die auch bei Veraltung im Tagesmaßstab stabil bleiben, plus eine steuerbare Längenstrafe, mit der sich die Reasoning-Länge ohne Neutraining justieren lässt.
Liest man die Pre-Training- und RL-Zeilen zusammen, tritt die Gestalt der Behauptung hervor. Die Effizienzgeschichte dreht sich nicht nur um aktive Parameter bei der Inferenz; es geht auch darum, wie schnell das Modell trainiert wurde und wie viel des Rechenaufwands in umgebungsgebundenes RL statt in mehr Tokens floss. Eine Million Umgebungen und 1,3 Milliarden Sandboxen sind eine Aussage über Tool-Nutzung und agentische Trainingsinfrastruktur, und sie passt zu den Benchmarks, mit denen Reflection voranzugehen beschloss.
Eine Zahl verdient eine Kennzeichnung. Der Blog sagt, Midtraining erweitere den effektiven Kontext auf 1 Million Tokens; die API-Dokumentation führt ein Serving-Limit von 256.000 Tokens mit einer angehängten Beta-Fußnote auf. Das sind eine trainingsseitige Fähigkeit und ein Limit auf der Serving-Seite, kein Widerspruch – aber die Lücke ist genau die Art von Sache, die zu einer „1M-Kontext“-Schlagzeile wird, wenn niemand das zweite Dokument liest, und wer nächste Woche über Beam schreibt, sollte das zweite Dokument lesen.

Benchmarks: Wo Reflection Beam gewinnt und wo nicht
Jede unten stehende Zahl ist vom Anbieter angegeben, aus den Tabellen in Reflection-Launch-Post, und nichts davon wurde unabhängig reproduziert. Die Vergleichsspalten enthalten dieselben Zahlen, die Reflection für die anderen Modelle veröffentlicht hat; wo eine Zelle im Original „NR“ zeigt, wurde das Modell nicht ausgeführt. Es gibt keine Zeile von Artificial Analysis für Beam, daher ist hier nichts durch eine Drittanbieter-Testumgebung gelaufen.
Agentisches Coding
• Terminal-Bench v2.1 — Beam 80,1 vs. GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.
• SWE-Bench Pro v1 — Beam 65,5 gegenüber Qwen3.8 Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Beam 77,2 vs. Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9.
• SWE-Bench Verified — Beam 80,9 vs. Inkling 77,6, Nemotron 3 Ultra 70,7.
• SWE-Bench Multilingual — Beam 78,0 vs. Nemotron 3 Ultra 67,7.
• DeepSWE v1.1 — Beam 44,4 vs. DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen3.8 Max 51,0, GLM 5.2 44,0.
• SWE Atlas Codebase QnA — Beam 34.6 vs. Kimi K3 68.0, GLM 5.3 61.0.
Die letzte Zeile ist die, mit der man sich eingehend befassen sollte. Repository-Fragebeantwortung mit langem Horizont ist der Fall, in dem ein Modell eine Codebasis über eine lange Interaktion hinweg im Kopf behalten muss, und 34,6 gegenüber 68,0 ist kein Rundungsunterschied. DeepSWE erzählt eine ähnliche Geschichte: 44,4 stellt Beam auf eine Stufe mit GLM 5.2 und weit hinter DeepSeek V4.1 Flash.
Schlussfolgerung
• AIME 2026 — Beam 97,8 vs. GLM 5.2 99,2, Inkling 97,1.
• HLE, ohne Tools — Beam 36.2 vs. Kimi K3 46.9, Qwen3.8 Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7.
• GPQA Diamond — Beam 90,5 gegen Kimi K3 93,5, Qwen3.8 Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9, Inkling 87,2, Nemotron 3 Ultra 87.
• SciCode — Beam 49,7 vs. GLM 5,3 59,0, Kimi K3 58,7, Qwen3.8 Max 52,1, DeepSeek V4.1 Flash 52,0, Inkling 46,1, Nemotron 3 Ultra 44,6.
• CriPT AA — Beam 16.3 vs Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
Das Reasoning-Profil von Beam liegt im Mittelfeld, und das Muster ist konsistent: deutlich vor den beiden Modellen der vorherigen Generation auf der Liste von Reflection, hinter dem aktuellen. GPQA Diamond mit 90,5 ist ein solider Wert, den vier andere Modelle übertreffen.
Werkzeugnutzung und Suche
• MCP Atlas — Beam 78,7 vs. Qwen3.8 Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8, Inkling 76,0, Nemotron 3 Ultra 63,1.
• AutomationBench, öffentlicher Split — Beam 37,0 vs. DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen3.8 Max 39,8, GLM 5.2 26,2.
• tau3 banking — Beam 38,0 gegen Qwen3.8 Max 55,2, GLM 5.2 37,1, Kimi K3 37,1, Inkling 25,0, Nemotron 3 Ultra 22,6.
• BrowseComp mit Kontextmanagement — Beam 77,4 vs. Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.
• DeepSearchQA mit Kontextverwaltung — Beam 80,1 vs. Kimi K3 95,0.
Reflection zeigte in dem Beitrag außerdem zwei Fähigkeitsdemos: eine Lösungsrate von 95,5 Prozent beim „Land or Water"-Puzzle, einem 180 × 90 großen Raster mit 16.200 Punkten, das einen großen Brettzustand halten muss – ein Wert, der zwischen den 92,5 und 97,8 Prozent liegt, die Reflection bei derselben Aufgabe Opus 5 und Fable 5 zuschreibt –, und ein Text2SQL-Fine-Tuning des kleinsten Gemma-4, das die Held-out-Genauigkeit auf 66,5 Prozent hob. Demos sind kuratiert; sie zeigen, dass das Modell etwas tun kann, nicht wie oft.
Was Sie heute damit tun können – und was Sie nicht zur Grundlage Ihrer Planung machen sollten
Heute ist generell genau eine Sache möglich: Beta-Zugang anfordern und Beam-501B-A23B über Reflections eigenen Endpunkt mit einem OpenAI-förmigen Client aufrufen. Es gibt keinen veröffentlichten Preis, also gibt es keine Möglichkeit, die Kosten für eine Workload darauf zu modellieren. Es gibt keine Gewichte, also gibt es kein Selbsthosting, keine Quantisierung, kein Fine-Tuning und keine Reproduzierbarkeit durch Dritte. Es gibt keine unabhängige Benchmark-Zeile, also ruht das gesamte oben dargestellte Leistungsbild auf den Tabellen eines einzigen Labors.
Reflection Beam gehört nicht zu unseren Routen. Wir werden nichts anderes implizieren, und wir werden Sie nicht an einen Reseller verweisen, der es vielleicht hat. Was wir Ihnen sagen können, ist, was die Vergleichsgruppe kostet, denn vier dieser Modelle routen wir, und die Zahlen unten sind heute Morgen live aus unserem eigenen Katalog ausgelesen: GLM 5.2 mit $1,40 für Input und $4,40 für Output pro Million Tokens, GLM 5.3 mit $1,26 und $3,96, Qwen3.8 Max mit $2,00 und $6,00 und DeepSeek V4.1 Flash mit $0,15 und $0,60. Das ist eine echte Spanne — DeepSeek V4.1 Flash ist beim Input fast zehnmal günstiger als GLM 5.2 — und genau deshalb lässt sich ein Beta-Modell ohne Preis nur schwer in eine Entscheidung einordnen. Bei OrcaRouter läuft ein einziger OpenAI-kompatibler Key über diese und über 200 weitere Modelle, wobei der Listenpreis des Anbieters durchgereicht und nichts aufgeschlagen wird, was bedeutet, dass eine Preisänderung eines Anbieters bei uns noch am selben Tag live ist und nicht erst, wenn ein Reseller aktualisiert. Und weil automatisches Failover Teil des Routings ist und nicht etwas, das man selbst baut, ist ein neues und unerprobtes Modell genau die Art von Sache, die man auf einen Teil des Traffics legen kann statt auf den kritischen Pfad — was die einzige verantwortungsvolle Art ist, etwas zu nutzen, dessen Benchmarks noch niemand reproduziert hat.

Worauf Sie achten sollten, bevor Sie die Effizienzbehauptung ernst nehmen
Drei Dinge werden die Frage klären, und zwei davon sind noch innerhalb dieses Monats zugesagt.
An erster Stelle stehen die Gewichte. Apache 2.0 und ein technischer Bericht würden jedem mit ein paar Knoten die Sache zugänglich machen, auf die es tatsächlich ankommt — Tokens pro Sekunde pro GPU bei einer festen Qualitätslatte, und ob 23 Milliarden aktive Parameter wirklich den Score pro FLOP liefern, den das Diagramm nahelegt. Bis dahin ist das Effizienzargument Arithmetik auf einer Serviette.
Der zweite Punkt ist der Preis. Ein Modell ohne Listenpreis hat in einem Kostenvergleich nichts zu suchen, und wenn Beam über der GLM- und DeepSeek-Klasse landet, spielt die Rechenleistung für alle mit einem Budget keine Rolle mehr. Landet es darunter, ändert sich das Bild schnell.
Das dritte ist ein Drittanbieter, der die Suite ausführt. Jede Zahl oben stammt aus demselben Dokument, und eine vom Anbieter gemeldete Tabelle, die das eigene Modell in sieben von sechzehn Zeilen hinten anstellt, ist ein gutes Zeichen für die Ehrlichkeit des Labors – aber es ist immer noch ein Labor, ein Testaufbau, ein Satz Prompts.
Wenn Sie heute einen fähigen agentischen Coder brauchen und wissen müssen, was er kostet, lautet die Antwort noch nicht Reflection Beam. Vielleicht in drei Wochen. Das Modell, auf das man eine Effizienzbehauptung verwetten sollte, ist dasjenige, dessen Gewichte Sie herunterladen und dessen FLOPs Sie selbst zählen können — und bei diesem Test hat Reflection uns ein Datum gegeben und kein Modell.
In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
