
Reflection Beam vs. Claude Opus 5.5: Das eine kannst du heute nutzen, auf das andere musst du warten.
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 150 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Reflection Beam und Claude Opus 5.5 sind noch keine echten Rivalen, und der Grund dafür ist administrativer und nicht technischer Natur. Beam, das erste Modell von Reflection, wurde am 5. Oktober 2026 angekündigt und ist ein Sparse-Mixture-of-Experts-Modell mit 501 Milliarden Parametern, das pro Token 23 Milliarden Parameter aktiviert – doch es ist nur über eine Warteliste zugänglich, seine Gewichte sind für später in diesem Monat unter Apache 2.0 zugesagt, und ein Preis wurde nirgends veröffentlicht. Opus 5.5 wurde am 22. September 2026 als Flaggschiff von Anthropic ausgeliefert: ein Kontextfenster von 1 Million Token, Text-, Bild- und Dateieingabe sowie ein Listenpreis von 4,00 $ pro Million Eingabe-Token und 20,00 $ pro Million Ausgabe-Token. Die ehrliche Version dieses Vergleichs lautet also: Eines dieser Modelle lässt sich noch heute Nachmittag mit bekannten Kosten in Produktion nehmen, das andere nicht – und alles Weitere hier ist eine Prognose darüber, was passiert, wenn die Gewichte eintreffen.
Die kurze Antwort
Wenn die Frage lautet, auf welchem Modell man diese Woche aufbauen sollte, dann ist es ohne große Diskussion Opus 5.5: Es ist allgemein verfügbar, unabhängig bewertet, multimodal, bepreist und über eine API bereitgestellt, die man in fünf Minuten aufrufen kann. Die Argumentation für Beam stützt sich nicht darauf, Opus 5.5 zu schlagen – nichts in Reflections eigenem Material behauptet das. Sie stützt sich auf eine viel engere These: dass Beam bei einem gegebenen Reasoning-Score ungefähr ein Viertel der Inferenz-Rechenleistung verbraucht. Wenn das standhält, sobald jemand außerhalb von Reflection es misst, wird Beam interessant für Arbeit mit hohem Volumen, bei der die Antwort gut, aber nicht die beste sein muss. Wenn nicht, ist Beam ein offenes Modell im Mittelfeld mit einer Warteliste.
Das Folgende trennt bei diesem Aufeinandertreffen die Teile, die heute Fakten sind, von den Teilen, die Wetten sind.
Was jedes Modell genau ist
Opus 5.5 ist der geschlossene, gehostete Nachfolger von Claude Opus 5, von Anthropic positioniert für mehrstufige Änderungen über große Codebasen hinweg, Code-Review und lange autonome Sitzungen. Es akzeptiert Text, Bilder und Dateien, gibt Text zurück, bietet ein Kontextfenster von 1.000.000 Token mit bis zu 128.000 Ausgabe-Token und stellt erweitertes Denken mit konfigurierbarem Reasoning-Aufwand bereit. Es ist nicht Open Weights, und sein Wissen ist durch den Trainings-Cutoff von Anthropic begrenzt und nicht durch irgendetwas, das Sie kontrollieren.
Reflection Beam ist die entgegengesetzte Konstruktion. Es hat 501 Milliarden Gesamtparameter bei 23 Milliarden aktiven – etwa 4,6 Prozent des Modells sind pro Token aktiv, ein aggressives Verhältnis selbst gegenüber den ungefähr 5,4 Prozent von GLM 5.2 – und ist darauf ausgelegt, günstig im Betrieb statt günstig im Training zu sein. Es ist ein reines Textmodell. Sein API-Kontext umfasst 256.000 Token, mit einer Fußnote, die davor warnt, dass sich die Zahl während der Beta ändern kann, und seine maximale Ausgabe beträgt 128.000 Token. Der Endpunkt ist OpenAI-kompatibel unter api.reflection.ai/openai/v1 und bietet Chat Completions sowie eine Models-Liste und sonst nichts. Sein Parameter reasoning_effort akzeptiert fünf Werte, ist standardmäßig medium und kann nicht deaktiviert werden.
• Preis — Claude Opus 5.5: 4,00 $ Eingabe und 20,00 $ Ausgabe pro Million Tokens, Cache-Lesevorgänge zu 0,20 $ und Cache-Schreibvorgänge zu 5,00 $, im Vergleich zu Reflection Beam: weder im Blogbeitrag noch in der Dokumentation noch im Modell-Listing veröffentlicht.
• Verfügbarkeit — Opus 5.5 ist ab heute allgemein verfügbar; Beam ist eine Warteliste für eine Beta, wobei die Gewichte, der technische Bericht und die Modellkarte für später in diesem Monat versprochen wurden.
• Modalität — Opus 5.5 verarbeitet Text, Bilder und Dateien; Beam verarbeitet nur Text.
• Kontext — 1.000.000 Tokens gegenüber 256.000, wobei die Zahl von Beam mit einem Beta-Vorbehalt versehen ist.
• Offene Gewichte — nein für Opus 5.5, unter Apache 2.0 für Beam versprochen, noch nicht geliefert.
• Unabhängige Bewertung — Opus 5.5 hat eine; Beam nicht.

Der Preis ist der Teil, der sich nicht vergleichen lässt.
Die 4,00 $ und 20,00 $ von Opus 5.5 sind der Listenpreis des Anbieters, und in unserem Katalog werden sie unverändert durchgereicht, ohne dass etwas hinzugefügt wird. Cache-Lesevorgänge zu 0,20 $ und Cache-Schreibvorgänge zu 5,00 $ sind enorm wichtig für die Workload, für die Opus 5.5 verkauft wird – eine lange agentische Sitzung, die dieselbe Codebasis mit 200.000 Tokens Runde für Runde erneut liest, zahlt für fast alles davon den Cache-Tarif, nicht den Input-Tarif. Das ist ein echter und oft unterschätzter Hebel, und es lohnt sich, ihn zu modellieren, bevor Sie zu dem Schluss kommen, dass ein Frontier-Modell außerhalb des Budgets liegt.
Beam hat keine vergleichbare Zahl. Es gibt keinen Listenpreis, mit dem man es vergleichen könnte, keine Cache-Stufe, die man modellieren könnte, und keinen veröffentlichten Tarif für die Beta. Reflection hat nicht gesagt, ob Beam pro Token verkauft, pro Arbeitsplatz abgerechnet oder mit den Gewichten verschenkt wird. Wer heute einen Preis pro Million für Beam nennt, erfindet ihn.
Die praktische Konsequenz: Der Preisvergleich lautet nicht „Opus 5.5 ist teuer und Beam ist günstiger“. Er lautet: „Das eine hat einen Preis, das andere ein Datum.“ Für ein Team, das heute eine Entscheidung treffen muss, gibt diese Asymmetrie den Ausschlag – mehr als die Benchmarks.
Benchmarks: die beiden Zahlen, die sich überschneiden, und warum sie dennoch nicht vergleichbar sind
Reflections Launch-Tabellen enthalten weder Opus 5.5 noch irgendein geschlossenes Frontier-Modell. Sein Vergleichsset ist vollständig offen oder halboffen: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max und DeepSeek V4.1 Flash. Jede Beam-gegen-Opus-Tabelle muss also von Hand zusammengestellt werden, und sie ehrlich zusammenzustellen bedeutet, die Harness-Unterschiede zu benennen, statt sie zu glätten.
Es gibt genau zwei Benchmarks, bei denen beide Modelle einen veröffentlichten Wert haben, und keine der beiden Paarungen ist kontrolliert.
• Humanity's Last Exam — Reflection meldet Beam bei 36,2 ohne Tools; Artificial Analysis verzeichnet Opus 5.5 bei 61,4. Zwei verschiedene Harnesse, zwei verschiedene Konfigurationen — der Wert von Opus 5.5 ist nicht als „no-tools“ gekennzeichnet — und eine Lücke von fünfundzwanzig Punkten, die weniger über die Modelle als über das Setup aussagt.
• SciCode — Reflection gibt für Beam 49,7 an; Artificial Analysis verzeichnet 66,9 für Opus 5.5. Derselbe Benchmark, dasselbe Problem: Die eine Zahl stammt aus dem eigenen Durchlauf des Anbieters, die andere aus einer Drittanbieter-Testumgebung.
Alles andere überschneidet sich überhaupt nicht. Beams Tabelle basiert auf Terminal-Bench v2.1, während der aktuelle Artificial Analysis Index auf Terminal-Bench 4.0 läuft – eine andere Version derselben Suite, weshalb Beams 80,1 und Opus 5.5' 59,6 auf diesem Board kein Vergleich sind und niemals nebeneinander gedruckt werden sollten. Im Index selbst setzt Artificial Analysis Opus 5.5 in der Konfiguration Max / Default Fallback auf 57,6 und damit auf Platz vier der 147 Modelle in diesem Durchlauf. Beam hat keine Indexzeile: Die Modellseiten liefern 404 zurück, und die Rangliste enthält Stand heute Morgen keinen Beam-Eintrag.
Die einzige wirklich unabhängige Aussage über Beam, die öffentlich vorliegt, ist die von Artificial Analysis, die am 5. Oktober sagte, Reflection habe ihr Zugang gewährt und sie benchmarke das Modell unabhängig – und frühe Indikatoren deuteten darauf hin, dass Beam eines der token-effizientesten offenen Modelle sein werde, die sie für sein Intelligenzniveau gesehen habe. Das ist ein starkes Statement aus der richtigen Quelle, und es ist immer noch ein Satz ohne Zahl. Es ist die Zahl, die dieses Duell entscheiden wird.

Wo die Effizienzbehauptung tatsächlich greift
Das Argument von Reflection ist nicht, dass Beam klüger als ein Frontier-Modell ist. Sondern dass Beam vergleichbar mit GLM 5.2 abschneidet, dabei aber 3- bis 4-mal weniger Inferenz-Rechenleistung verbraucht, und dass die Lücke gegenüber Modellen in der 2-Billionen-Parameter-Familie größer wird, in der Qwen 3.8-Max angesiedelt ist. Das dahinterstehende Diagramm schätzt die generierten FLOPs als das Doppelte der aktiven Parameteranzahl multipliziert mit der mittleren Anzahl generierter Tokens pro Versuch, und seine eigene Bildunterschrift räumt ein, dass dies Prompt-Prefill, Attention und Serving-Overhead ausschließt.
Nimmt man das für bare Münze, dann ist das interessante Ziel überhaupt nicht Opus 5.5 – es ist die Mitte des Marktes. Opus 5.5 konkurriert über die Leistungsfähigkeit pro Aufgabe und gewinnt bei den Aufgaben, die Urteilsvermögen erfordern: mehrstufige Refactorings, Code-Reviews, Arbeiten, bei denen eine falsche Antwort mehr kostet als die Tokens. Ein Modell, das pro Token zu 4,6 Prozent wach ist, konkurriert über die Kosten pro Aufgabe und gewinnt dort, wo das Volumen dominiert und die Qualitätslatte „gut genug und nachgelagert verifiziert“ lautet. Das sind unterschiedliche Produkte, und ein Vergleich, der Beam gegen Opus 5.5 auf einem einzigen Scoreboard antreten lässt, misst das Falsche.
Es gibt einen Effekt zweiter Ordnung, den man benennen sollte. Wenn Beams Effizienzbehauptung zutrifft, liegt sein natürlicher Einsatzbereich bei der Art von Workload, bei der man sonst die Tokens eines Frontier-Modells für eine Aufgabe ausgeben würde, für die es überqualifiziert ist. Das ist eine Routing-Entscheidung, keine Modellwahl, und genau deshalb ist die Preisfrage hier wichtiger als die Benchmark-Frage: Man kann nicht anhand der Kosten zu einem Modell routen, das keine Kosten hat.
Sie nebeneinander laufen lassen, wenn Beam aufrufbar ist
Opus 5.5 ist ab heute für 4,00 $ und 20,00 $ pro Million Tokens in unserem Katalog, Listenpreis durchgereicht, ohne Aufschlag, und es steht neben über 200 weiteren Modellen hinter einem einzigen OpenAI-kompatiblen Schlüssel unter api.orcarouter.ai/v1. Wenn Sie eine Workload zwischen einem Frontier-Modell und einem günstigen offenen Modell A/B-testen wollten, dann sieht das Setup genau so aus: zwei Modell-IDs, ein Schlüssel, kein zweiter Vertrag und keine Codeänderung – und automatisches Failover im Routing bedeutet, dass ein Anbieter mit einem schlechten Nachmittag Ihre Pipeline nicht mitreißt.
Beam kann noch nicht Teil davon sein, und wir werden nicht so tun, als wäre es anders. Reflection Beam ist keine unserer Routen, und wir werden dich nicht an wen auch immer verweisen, der es möglicherweise weiterverkaufen könnte. Wenn die Gewichte unter Apache 2.0 erscheinen, kannst du es selbst hosten und zu deinem eigenen Endpunkt routen; bis dahin ist der einzige Weg die Warteliste von Reflection.
Für einen Workload, bei dem tatsächlich ein Frontier-Modell erforderlich ist, ist der anzustellende Vergleich nicht der mit Beam. Er richtet sich gegen alles andere im Katalog: GLM 5.3 zu $1.26 und $3.96, Qwen 3.8-Max zu $2.00 und $6.00 und DeepSeek V4.1 Flash zu $0.15 und $0.60, alle heute Morgen live abgerufen. Das ist die Preisklasse, in der Beam landen wird, wenn es wettbewerbsfähig bepreist wird, und es ist ein deutlich härteres Umfeld, als das Startdiagramm nahelegt.

Was würde dieses Urteil ändern?
Drei Dinge, geordnet danach, wie sehr sie von Bedeutung wären.
Eine Artificial-Analysis-Zeile für Beam. Nicht die Ankündigung, dass eine kommt – die Zeile. Wenn der Index nahe an Opus 5.5s 57,6 landet, während die Token-Effizienz-Behauptung den Kontakt mit einem Drittanbieter-Harness übersteht, wird die Marktmitte richtig ungemütlich, und Beam wird für viele Arbeiten mit hohem Volumen zum Default. Landet er näher am Open-Weights-Cluster im niedrigen Vierzigern-Bereich, ist Beam ein solides günstiges Modell und nichts weiter.
Ein Preis. Ein Modell ohne Listenpreis kann bei einem Kostenargument nicht gewinnen, weil es nichts zu vergleichen gibt. Wenn Beam unter der GLM 5.3-Stufe liegt, wird die Effizienzgeschichte sehr schnell zu einer Budgetgeschichte. Wenn es über den 0,15 $ und 0,60 $ von DeepSeek V4.1 Flash liegt, ohne einen Fähigkeitsvorsprung, wird es sich bei der Massenarbeit, für die es gebaut wurde, schwer tun.
Die Gewichte. Solange es sie nicht gibt, ist „open-weight“ eine Aussage über eine Lizenz, die nicht erteilt wurde, und niemand kann die FLOPs-pro-Score-Arithmetik gegen ein Modell prüfen, das man tatsächlich ausführen kann. Das ist die Überprüfung, zu der Reflection eingeladen hat und die Reflection noch nicht ermöglicht hat.
Bis mindestens eines davon eintrifft, ist die praktische Wahl nicht knapp. Opus 5.5 ist das Modell, über das man nachdenken, dessen Kosten man durchrechnen und auf das man ausliefern kann. Beam ist das Modell, das man beobachtet.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
