
Reflection Beam vs. Kimi K3: Derselbe Benchmark-Name, zwei verschiedene Testumgebungen
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Reflection Beam erzielt 80,1 auf Terminal-Bench 2.1. Kimi K3 erzielt 88,3. Stellt man diese beiden Zahlen nebeneinander, wie es der Großteil der Berichterstattung dieser Woche getan hat, kommt man zu dem Schluss, dass Beam rund acht Punkte vom besten offenen Modell im Feld entfernt ist. Doch diese beiden Zahlen stammen nicht aus demselben Raum. Beams 80,1 ist vom Anbieter angegeben und stammt aus der Tabelle in Reflections eigenem Launch-Post. Kimi K3s 88,3 ist ebenfalls vom Anbieter angegeben, diesmal aus Moonshots eigener Tabelle — und die Tabelle eines Anbieters druckt die Punktzahl seines Konkurrenten nur, wenn sie auf dem eigenen Harness des Anbieters, mit dem eigenen Prompt-Set des Anbieters und bei der eigenen Effort-Einstellung des Anbieters ausgeführt wurde. Ein Drittanbieter, Artificial Analysis, hat Kimi K3 seither auf einem Benchmark mit demselben Namen ausgeführt und 85,0 veröffentlicht. Das ist eine Lücke von 4,9 Punkten, nicht 8,2 — und die Richtung der Korrektur ist völlig vorhersehbar, denn die Zahl, die erodiert wird, ist immer die, die aus dem Labor stammt, das etwas zu beweisen hat.
Das ist das ganze Problem mit dem Vergleich, den der Titel dieses Artikels verspricht, und es ist der Grund, warum dieser Beitrag seine erste Hälfte der Herkunft statt den Bewertungen widmet. Reflection Beam ist ein sparses Mixture-of-Experts-Modell mit 501 Milliarden Parametern, von denen pro Token 23 Milliarden aktiv sind, angekündigt am 5. Oktober 2026 von Reflection AI, mit einem noch als Beta laufenden, OpenAI-kompatiblen Endpunkt, der am selben Tag live ging. Kimi K3 ist das Flaggschiff-Open-Model von Moonshot AI, in unserem eigenen Katalog mit einem Veröffentlichungsdatum vom 15. Juli 2026 gelistet und unabhängig von Artificial Analysis bewertet. Eines davon ist ein ausgeliefertes Produkt mit Preisliste und einem Durchlauf durch eine Drittanbieter-Testumgebung; das andere ist eine Beta mit Warteliste, deren Gewichte, technischer Bericht und Preis noch nicht existieren. Ein Vergleich der beiden ist kein symmetrisches Unterfangen, und so zu tun, als wäre es eines, würde eine Seite hervorbringen, die präzise aussieht und falsch ist.
Die 30-Sekunden-Version
• Beam ist auf dem Papier schneller pro FLOP, in der Praxis ohne Preisangabe und nicht reproduziert. Kimi K3 wird von einem Drittanbieter bewertet, kostet 3,00 $ pro Million Tokens für Eingaben und 15,00 $ für Ausgaben und ist allgemein verfügbar.
• Bei dem einen Benchmark, auf dem beide gelaufen sind — Terminal-Bench 2.1 —, liegt die ehrliche Lücke bei etwa fünf Punkten, nicht bei acht, sobald die Zahlen jeder Seite aus einer neutralen Testumgebung stammen.
• Die eigentlichen Vorteile von Beam sind struktureller, nicht numerischer Natur: ein Serving-Profil mit 23B aktiven Parametern und eine versprochene Apache-2.0-Lizenz. Keines von beiden ist heute nutzbar.
• Wenn Sie diese Woche ein Modell benötigen, ist das kein Münzwurf. Es ist ein verfügbares Modell und eine Warteliste.
Was Reflection tatsächlich veröffentlicht hat und gegen wen
In Reflections Launch-Post wird eine Scorecard sieben anderen Modellen gegenübergestellt: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max und DeepSeek V4.1 Flash. Jede Zahl in der Tabelle stammt aus Anbieterangaben, keine davon wurde unabhängig reproduziert, und es gibt keine Artificial-Analysis-Seite für Reflection Beam – die Modellseite liefert auf deren Website mit Stand 6. Oktober 2026 einen 404-Fehler. Mehrere Zellen im Original sind mit NR markiert, weil das Modell nicht ausgeführt wurde.
Hier ist der gesamte Beam-vs.-K3-Ausschnitt dieser Tabelle, eine Zeile pro Dimension:
• Terminal-Bench 2.1 — Beam 80,1 vs. Kimi K3 88,3
• SWE-Bench Pro v2-Hard — Beam 77,2 vs. Kimi K3 88,2
• DeepSWE v1.1 — Beam 44,4 vs. Kimi K3 68,0
• SWE Atlas Codebasis-Q&A — Beam 34.6 vs. Kimi K3 68.0
• HLE, ohne Tools — Beam 36,2 vs. Kimi K3 46,9
• GPQA Diamond — Beam 90,5 vs. Kimi K3 93,5
• SciCode — Beam 49,7 vs. Kimi K3 58,7
• MCP Atlas — Beam 78.7 gegen Kimi K3 82.3
• BrowseComp mit Kontextverwaltung — Beam 77.4 vs. Kimi K3 91.2
• DeepSearchQA mit Kontextverwaltung — Beam 80,1 vs. Kimi K3 95,0
Lies diese Liste ehrlich, und die Gestalt des Launches wird sichtbar. Reflection behauptet nirgends, über K3 zu siegen. Es behauptet, nahe an der Spitze einer Stufe zu landen, während es bei vergleichbaren Reasoning-Werten drei- bis viermal weniger Inferenzrechenleistung als GLM 5.2 verbraucht – und die eine Zeile, in der die beiden Modelle dicht beieinanderliegen, Terminal-Bench 2.1, ist die Zeile, in der der Vergleich am wenigsten vertrauenswürdig ist.
Warum die Testumgebung wichtiger ist als die Punktzahl
Ein Benchmark-Name ist ein Label, keine Spezifikation. Terminal-Bench 2.1 bezeichnet eine bestimmte Menge von Aufgaben, die unter einem bestimmten Agenten-Scaffold ausgeführt werden, mit einer bestimmten Retry-Policy, einem bestimmten Token-Budget und einer bestimmten Reasoning-Effort-Einstellung. Zwei Labore können beide ehrlich einen „Terminal-Bench 2.1“-Wert angeben und Zahlen produzieren, die nicht vergleichbar sind, weil der Scaffold und die Effort-Einstellung die Stelle sind, an der der größte Teil der Varianz liegt. Artificial Analysis existiert als Organisation genau deshalb: Es betreibt einen einzigen Harness in einer einzigen Konfiguration über viele Modelle hinweg, sodass sich seine Zahlen voneinander subtrahieren lassen.
Die 80,1, die Reflection für Beam ausgibt, ist also eine Anbieterzahl auf einem Anbieter-Harness, und die 88,3, die es für K3 ausgibt, ist ebenfalls eine Anbieterzahl — der Anbieter ist Reflection, das seinen eigenen Wettbewerber vermisst. Diese zweite Zahl ist die am wenigsten verlässliche in der Zeile: Ein Labor, das die Gewichte eines Rivalen auf seinem eigenen Gerüst laufen lässt, hat keinen Anreiz, sie in der besten Konfiguration des Rivalen laufen zu lassen, und keine Pflicht, die gewählte offenzulegen. Daran ist nichts Unehrliches; es ist schlicht eine Zahl, deren Herkunft das Gewicht nicht stützt, das die Berichterstattung auf sie gelegt hat.
Der eigene Durchlauf von Artificial Analysis führt Kimi K3 mit 85,02 bei Terminal-Bench 2.1, daneben 12,6 bei Terminal-Bench v4.0 – einem anderen und schwierigeren Test –, einen AA Coding Index von 76,2 (Rang 9 der Modelle auf dem Board), einen Intelligence Index von 43,6, GPQA Diamond 93,5, HLE 46,9, SciCode 59,5, tau-banking 45,98 und einen Long-Context Recall von 88,7. Diese Werte sind von K3s Katalogkarte in unserem eigenen System abgelesen, mit Quelle artificialanalysis.ai, wobei der Evaluations-Snapshot auf den 15. Juli 2026 datiert ist. Beam hat eine Zahl im Universum dieser Liste, und sie stammt von Reflection. Diese Abwesenheit dürfte eher vorübergehend als dauerhaft sein: Artificial Analysis hat gesagt, Reflection habe dem Unternehmen Zugang gewährt und es benchmarke das Modell, und die eigene frühe Formulierung von Artificial Analysis – dass Beam „eines der token-effizientesten offenen Modelle sein wird, die wir für sein Intelligenzniveau gesehen haben“ – ist das Signal eines Benchmark-Hauses, das eine Erwartung signalisiert, nicht ein Ergebnis meldet. Bis dieser Score gedruckt wird, sind die Zahlen dieses Artikels nicht subtrahierbar, und wir werden nicht so tun, als wäre es anders.

Was jedes Einzelne kostet und was jedes Einzelne ist
Der Kostenvergleich fällt nicht knapp aus, und es ist wirklich kein Vergleich, weil eine Seite davon leer ist.
• Preis — Kimi K3: 3,00 $ Eingabe / 15,00 $ Ausgabe pro Million Tokens, Cache-Lesevorgänge zu 0,30 $, gegenüber Reflection Beam: kein veröffentlichter Preis, weder im Blog, in der Dokumentation noch in der Modellauflistung von Reflection, wobei die Plattformkonsole hinter einer Registrierungsschranke liegt.
• Kontext — 1.048.576 Tokens auf Kimi K3 vs. 256.000 in der Beam-Beta, mit einer Fußnote in Beams eigener Dokumentation: „Das Kontextfenster kann sich während der Beta ändern.“
• Modalität — Kimi K3 akzeptiert Text und Bilder; Reflection Beam ist Text-in, Text-out, ohne Bild- oder Audiopfad zum Start.
• Verfügbarkeit — Kimi K3 ist ab heute allgemein verfügbar; Reflection Beam ist eine Beta mit Warteliste, deren Gewichte für später im Oktober unter Apache 2.0 zugesagt wurden.
• Unabhängige Bewertungen — K3 hat eine vollständige Zeile in Artificial Analysis; Beam hat keine.
• Serving-Profil — Kimi K3 ist ein großes, eher Dense-artiges Frontier-Modell mit 46,8 Ausgabe-Tokens pro Sekunde in unserer eigenen Playground-Messung über die vergangene Woche; Beams 23B aktive Parameter sind ein echtes architektonisches Argument für niedrigere Latenz und niedrigere Kosten pro Token, aber es gibt keinen öffentlich zugänglichen Endpunkt, an dem man es messen könnte.
Die Effizienzbehauptung verdient noch einen Satz der Sorgfalt, denn sie ist die Schlagzeile des Launches, und sie leistet mehr Arbeit, als sie tragen kann. Reflections „3- bis 4-mal weniger Inferenz-Compute" stammt aus einem Diagramm, das FLOPs als das Doppelte der aktiven Parameteranzahl mal der mittleren Anzahl generierter Tokens annähert. Diese Formel lässt Prompt-Prefill, Attention-Kosten und Serving-Overhead bewusst weg — die Posten der Rechnung, die langkontextige agentische Arbeit dominieren. Sie ist eine Überschlagsrechnung für ein Compute-Verhältnis, keine Messung, kein Dollarbetrag, und sie wurde vom Anbieter erstellt. Behandeln Sie sie als eine Hypothese, die die Gewichte jemand anderen testen lassen werden.
Wo OrcaRouter hier einzuordnen ist
Kimi K3 ist eine unserer Routen. Sie ist mit $3.00 für Input und $15.00 für Output pro Million Tokens gelistet – mit Cache-Reads zu $0.30, was Moonshots Anbieter-Tarif ist, der ohne jeden Aufschlag durchgereicht wird. Wenn Moonshot also seine Preisliste ändert, ändert sich die Zahl auf unserer Seite am selben Tag und nicht erst dann, wenn ein Reseller aktualisiert. Sie ist aufrufbar über einen einzigen OpenAI-kompatiblen Schlüssel zusammen mit über 200 weiteren Modellen, was hier aus einem bestimmten Grund wichtig ist: Die ehrliche Antwort auf „Beam oder K3?" lautet, dass ein Team, das absichert, sich nicht entscheiden sollte. Denn automatisches Failover ist Teil des Routings und nicht etwas, das man selbst baut, und ein Modell wie Beam – Beta, ohne Preis, von keinem Dritten bewertet – ist genau das, was man auf einen Anteil des Traffics setzt statt auf seinen kritischen Pfad. Du routest die Arbeit standardmäßig zu K3, schickst Beam einen Anteil, sobald deine Waitlist-Einladung eintrifft, und lässt das Routing bei einem Fehler auf K3 zurückfallen. Das ist eine Entscheidung, die man über ein unerprobtes Modell treffen kann. Einen Produktionspfad darauf zu wetten, ist es nicht.

Was würde dieses Urteil ändern?
Drei Dinge, in absteigender Reihenfolge ihrer Wichtigkeit.
Ein Preis. Würde Beam unter der K3-Stufe landen, machte das das Effizienzargument konkret statt theoretisch. Zweitens, die Gewichte. Apache 2.0 plus ein technischer Bericht würden es jedem mit ein paar Knoten ermöglichen, bei einer festen Qualitätslatte pro Sekunde pro GPU zu messen — der Test, der eine Compute-Behauptung tatsächlich klärt. Drittens, ein Lauf durch Dritte. Reflection hat Artificial Analysis Zugang gewährt, und daraus wird ein Score erwartet; bis diese Zahl erscheint, geht jede im Umlauf befindliche Beam-versus-K3-Zahl auf ein Dokument zurück, das einer der beiden Anbieter verfasst hat.
Zwei Fragen, die es wert sind, direkt beantwortet zu werden
Ist Reflection Beam besser als Kimi K3?
Nach den heute verfügbaren Belegen: nein – und niemand hat Belege dafür veröffentlicht, dass es so ist. Reflections eigene Tabelle zeigt K3 bei allen zehn oben gemeinsamen Zeilen vorn, bei mehreren davon mit Abständen (SWE Atlas 34,6 vs. 68,0, DeepSearchQA 80,1 vs. 95,0), die nicht knapp sind. Beams Argument sind die Kosten pro Einheit Leistungsfähigkeit, und dieses Argument ist ein vom Anbieter gezeichnetes Diagramm, solange es die Gewichte und einen Preis nicht gibt.
Sollte ich auf Beam's Gewichte warten, bevor ich auf K3 aufbaue?
Nur wenn Self-Hosting eine Anforderung statt einer Präferenz ist, denn das ist die einzige Achse, auf der die beiden kein Ersatz füreinander sind – K3 ist ausschließlich als API verfügbar, während Beam Apache-2.0-Gewichte verspricht. Wenn du eine API nutzt, ist K3 verfügbar, bewertet und bepreist, und Beam ist eine Warteliste. Es gibt keine Version dieser Entscheidung, für die es sich lohnen würde, ein Projekt zu verzögern.

Reflection hat uns ein Datum und ein Diagramm geliefert, und ein Datum ist kein Modell. Das Einzige, was der Launch wirklich belegt, ist, dass ein 501B-Modell, das 23B Parameter aktiviert, so trainiert werden kann, dass es nur wenige Punkte von der offenen Frontier entfernt liegt – was, falls die Gewichte eintreffen und die Zahlen Bestand haben, ein bedeutsames Ergebnis zur Effizienz ist. Es ist noch kein Grund, Arbeit von einem Modell wegzuverlagern, das ein Dritter tatsächlich gemessen hat.
