
Reflection Beam vs. Gemini 3.1 Pro Preview: Einer liest Video, einer liest Text
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 150 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Beginnen wir mit der Asymmetrie, die keine Benchmark-Tabelle in diesem Duell erwähnt. Reflection Beam, angekündigt am 5. Oktober 2026, ist ein Sparse-Mixture-of-Experts-Modell mit 501 Milliarden Parametern, von denen pro Token 23 Milliarden aktiv sind, und es nimmt Text entgegen und gibt Text aus. Sonst nichts. Gemini 3.1 Pro Preview, das multimodale Frontier-Modell des Anbieters seit dem 19. Februar 2026, akzeptiert Text, Bilder, Video, Audio und Dateien, und es ist das einzige Modell in diesem Vergleich, bei dem die Frage „Kann es das sehen, wonach ich fragen möchte?“ für jede Seite eine andere Antwort hat. Alles andere – die Sparsity-Verhältnisse, die Kontextfenster, die Preisstufen – ist Auslegungssache. Jene ist eine Spezifikation.
Es bedeutet auch, dass dies das am wenigsten symmetrische Paar im Set ist – und das nützlichste, weil es zeigt, wofür ein Modellvergleich eigentlich gedacht ist. Wenn Ihre Workload Text ist, sind Beam und Gemini 3.1 Pro zwei Optionen auf einem Spektrum, das von billig-und-unausgereift bis teuer-und-gründlich-bewertet reicht. Wenn Ihre Workload ein Video-Frame enthält, gibt es keinen Vergleich anzustellen.
Was jedes Modell ist
Gemini 3.1 Pro Preview ist Googles Flaggschiff der Preview-Stufe: 1.048.576 Token Kontext, eine maximale Ausgabe von 65.536 Token, fünf Eingabemodalitäten und ein 1-Million-Token-Fenster, das über eine Preisstaffel statt einen Pauschaltarif erreicht wird. Google positioniert es für verbessertes Software-Engineering, verbesserte agentische Zuverlässigkeit und effizientere Token-Nutzung bei komplexen Workflows. Es hat keine offenen Gewichte. Sein Name trägt weiterhin „Preview“, ein Status, den Google für dieses Modell seit Februar beibehält.
Reflection Beam ist Reflections erstes Modell und der Beginn einer Open-Weight-Serie. Fünfhundertundeine Milliarde Gesamtparameter, 23 Milliarden aktive – etwa 4,6 Prozent des Modells sind pro Token aktiv. 23,8 Billionen Pre-Training-Token auf 6.144 GB300-Chips in unter vier Wochen, dann eine Reinforcement-Learning-Kampagne auf 10.500 GB300-Chips über vier Wochen mit mehr als 100 Millionen Rollouts in rund einer Million Umgebungen. Seine API ist OpenAI-kompatibel unter api.reflection.ai/openai/v1 mit Chat Completions und einer Modellliste, sein Kontext umfasst 256.000 Token mit einer Beta-Fußnote, sein reasoning_effort-Parameter hat fünf Stufen und keinen Ausschalter, und seine Gewichte werden für später in diesem Monat unter Apache 2.0 versprochen.
• Modalität — Gemini 3.1 Pro Preview unterstützt Text, Bild, Video, Audio und Dateien; Reflection Beam unterstützt nur Text.
• Kontext und Ausgabe — 1.048.576 Tokens Eingabe und 65.536 Ausgabe für Gemini, gegenüber 256.000 Eingabe und 128.000 Ausgabe für Beam.
• Preis — Gemini 3.1 Pro Preview bei 2,00 $ Eingabe und 12,00 $ Ausgabe pro Million Tokens bis 200.000 Tokens, darüber hinaus steigend auf 4,00 $ und 18,00 $, wobei Cache-Lesevorgänge 0,20 $ kosten; Reflection Beam hat keinen veröffentlichten Preis.
• Tooling-Oberfläche — natives Tool-Calling, strukturierte Ausgaben und Search-Grounding auf der Google-Seite; Tool-Calling und strukturierte Ausgaben auf der Beam-Seite, mit einem Endpunkt, der auf Chat Completions beschränkt ist.
• Gewichte — proprietär für Gemini; Apache 2.0 für Beam versprochen, noch nicht veröffentlicht.
• Unabhängiger Score — Gemini 3.1 Pro Preview verfügt über einen Artificial Analysis Index; Beam hat keine Zeile im Board.
Die Modalitätslücke ist das ganze Argument
Es lohnt sich, konkret zu sein, statt nur auf „multimodal“ anzuspielen, denn die praktischen Konsequenzen sind spezifisch.
Eine Workload, die eine Bildschirmaufzeichnung, ein Produktfoto, einen gescannten Vertrag oder eine Callcenter-Audiodatei verarbeitet, kann von Beam zu keinem Preis, mit keinem Prompt und in keinem Tarif bedient werden. Es gibt keinen Workaround auf der API-Ebene: Beams Dokumentation beschreibt eine Eingabemodalität und eine Ausgabemodalität, und es ist kein Bild- oder Audio-Pfad aufgeführt. Gemini 3.1 Pro Preview verarbeitet alle fünf, was bedeutet, dass es das einzige Modell hier ist, das in einen Workflow eingesetzt werden kann, in dem die Eingabe nicht bereits Text ist.
Der umgekehrte Fall ist ebenfalls erwähnenswert, denn er ist derjenige, bei dem die Leute Fehler machen. Wenn Ihre Eingabe Text ist und Text bleibt, bringen Ihnen die fünf Modalitäten von Gemini nichts, und Sie zahlen den Preis eines multimodalen Modells, um eine Text-Workload auszuführen. Das ist kein Argument für Beam – es ist ein Argument dafür, dass die Modalitätsfrage vor der Benchmark-Frage beantwortet werden sollte, weil sie Optionen kostengünstiger und zuverlässiger ausschließt, als es jeder Score-Vergleich tut.
Zwei Vorschauen, zwei unterschiedliche Bedeutungen
Beide Modellnamen sind mit einem Vorbehalt verbunden, und die Vorbehalte sind nicht gleich, was das Interessanteste an dieser Paarung ist.
„Preview“ bei Gemini 3.1 Pro ist eine Namenskonvention für ein Modell, das seit Februar allgemein aufrufbar ist, mit einem unabhängigen Score, einer veröffentlichten Preisliste einschließlich einer dokumentierten Long-Context-Stufe und einer vollständigen Tool-Oberfläche. In der Praxis bedeutet „Preview“ hier, dass Google sich das Recht vorbehält, es zu ersetzen, nicht dass es schwer zu bekommen oder unbewertet ist.
Beams Beta ist ein echtes Gate. Der Zugang ist eine Warteliste, die Modell-ID wurde am 5. Oktober 2026 erstellt, es gibt keine Preisliste, keinen Score von Drittanbietern, und die Artefakte, mit denen jeder die zentrale Behauptung überprüfen könnte – Gewichte, technischer Bericht, Modellkarte –, werden versprochen statt geliefert. Die Kontextangabe trägt eine Fußnote, die davor warnt, dass sie sich während der Beta ändern kann, eine Absicherung, die kein allgemein verfügbares Modell braucht.
Die Konsequenz ist auf eine Weise asymmetrisch, die für die Beschaffung relevant ist. Ein Team, das Gemini 3.1 Pro Preview einführt, nimmt das Risiko von Modellwechseln in Kauf. Ein Team, das Beam heute einführt, nimmt einen unbekannten Preis, eine unbekannte unabhängige Bewertung und keine Möglichkeit, das Modell selbst zu betreiben, in Kauf. Das sind unterschiedliche Risikokategorien, und der Preis ist diejenige, die am häufigsten den Ausschlag gibt.

Benchmarks und das Zitierproblem
Die Launch-Tabellen von Reflection enthalten weder Gemini 3.1 Pro Preview noch irgendein Google-Modell. Sein Vergleichsset besteht nur aus offenen und halboffenen Modellen: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max und DeepSeek V4.1 Flash. Die beiden Modelle wurden also nie in einer veröffentlichten Tabelle gegeneinander getestet, und die untenstehenden Werte stammen auf beiden Seiten aus unterschiedlichen Test-Harnessen.
• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview verzeichnet 29,7 und belegt in seinem Durchlauf Platz 58 von 147. Beam hat überhaupt keine Indexzeile.
• GPQA Diamond — Gemini 3.1 Pro Preview mit 94,1 laut Artificial Analysis gegenüber den vom Anbieter gemeldeten 90,5 von Beam.
• SciCode — 58,7 für Gemini gegenüber den von Beam angegebenen 49,7.
• Humanity's Last Exam — 47,0 für Gemini gegenüber den vom Anbieter gemeldeten 36,2 von Beam, letzteres ausdrücklich ohne Tools.
• Terminal-Bench v2.1 — 73,8 für Gemini laut Artificial Analysis gegenüber den von Beam gemeldeten 80,1. Dies ist Beams stärkste Zeile im Vergleich, und es ist eine reiche Ernte gegen ein Modell, das seit Februar auf dem Markt ist.
• Langkontext-Wiedererkennung — 82,0 für Gemini gegenüber den vom Anbieter angegebenen 79,3 für Beam bei AA-LCR.
• tau-squared Bench — 95,6 für Gemini, Beams 78,7 auf MCP Atlas und 38,0 auf tau3. Verwandte Evaluierungen der agentischen Werkzeugnutzung, nicht dieselbe, und der Namensunterschied ist wichtig.
Es gibt ein separates Ehrlichkeitsproblem auf der Gemini-Seite dieser Tabelle, das einen eigenen Satz verdient. Unabhängige Indexwerte für Gemini 3.1 Pro Preview wurden in verschiedenen Quellen mit 30, 46, 47,7 und 57 angegeben, und Artificial Analysis liefert zum selben Zeitpunkt unterschiedliche Index-Revisionen auf verschiedenen Modellseiten aus. Die oben genannte Zahl 29,7 stammt von der Seite, die wir am 6. Oktober 2026 gelesen haben, und sie ist die einzige, die wir zitieren werden – doch jeder Artikel, der eine einzelne Gemini-Indexzahl neben einen Wettbewerber stellt, ohne zu sagen, aus welchem Snapshot sie stammt, präsentiert eine schwebende Zahl als feste. Dieselbe Vorsicht gilt umgekehrt für Beam, wo es überhaupt keinen Snapshot gibt.
Preis – und die Stufe, mit der niemand rechnet
Gemini 3.1 Pro Preview kostet 2,00 $ für die Eingabe und 12,00 $ für die Ausgabe pro Million Tokens bis zu 200.000 Tokens; darüber 4,00 $ bzw. 18,00 $. Cache-Lesevorgänge kosten 0,20 $ pro Million und Cache-Schreibvorgänge 0,375 $. Die Tarifgrenze ist der Punkt, den man bei der Planung berücksichtigen sollte: Das Aushängeschild des Modells ist ein Kontextfenster von 1.048.576 Tokens, und sobald eine Anfrage die 200.000-Token-Grenze überschreitet, verdoppelt sich der Eingabetarif und der Ausgabetarif steigt um die Hälfte. Eine auf das Million-Token-Fenster ausgelegte Workload ist daher für den Großteil ihres Verkehrs zum zweiten Tarif bepreist, nicht zum ersten.
Beam hat keine Preisliste, also gibt es keine Stufe zu modellieren und nichts zu vergleichen. Dieses Fehlen ist nicht neutral: Es bedeutet, dass die günstigste vertretbare Aussage über Beams Kosten die ist, dass sie unbekannt sind, und die einzige quantitative Stütze für seine Effizienzpositionierung ist Reflections eigene Grafik, die die erzeugten FLOPs schätzt als das Doppelte der aktiven Parameterzahl mal den mittleren erzeugten Tokens pro Versuch über DeepSWE, HLE und Terminal-Bench 2.1 – mit einer Bildunterschrift, die einräumt, dass Prompt-Prefill, Attention und Serving-Overhead ausgeschlossen sind. Bei den Workloads, bei denen ein Kontext von einer Million Tokens zählt, ist Prefill kein Rundungsfehler, und genau dieser Term fehlt in der Formel.

Werkzeugnutzung, Suche und wo sich die beiden Designs unterscheiden
Die beworbenen Stärken von Gemini 3.1 Pro Preview sind Software-Engineering, agentische Zuverlässigkeit und Token-Effizienz, und seine veröffentlichte Tool-Oberfläche umfasst Function Calling, strukturierte Ausgaben und Search Grounding. Der letzte Punkt ist der, den man beim Vergleich agentischer Stacks beachten sollte: Grounded Search ist eine First-Party-Fähigkeit aufseiten von Google und verändert, was ein Tool-verwendender Agent leisten kann, ohne dass ein externer Retrieval-Dienst angebunden ist.
Beam's Tool-Story ist interessanter, als eine Spezifikationszeile vermuten lässt, und schwerer zu bewerten. Reflection berichtet MCP Atlas mit 78,7, AutomationBench public mit 37,0, tau3 banking mit 38,0, BrowseComp mit Kontextmanagement bei 77,4 und DeepSearchQA mit Kontextmanagement bei 80,1 — und merkt an, dass das Modell während des Reinforcement Learnings organisch lernte, andere Sprachmodelle abzufragen und OCR-APIs aufzurufen, wenn ihm Webzugriff gegeben wurde, obwohl Browsing-Aufgaben in der Trainingsmischung fehlten. Wenn diese Generalisierung Bestand hat, ist das ein echtes Signal für agentischen Transfer. Es ist zugleich, zum jetzigen Zeitpunkt, eine Anbieterbeobachtung aus einem Trainingslauf, ohne unabhängige Überprüfung.
Bei den Tool-Nutzungs-Zeilen, für die beide Seiten Zahlen vorweisen, ist das Bild gemischt statt einseitig. Beams Anbietertabelle führt es bei MCP Atlas vor GLM 5.2 und gleichauf mit GLM 5.2 und Kimi K3 bei tau3 banking, während Geminis tau-squared-Bench-Wert von 95,6 die höchste agentische Kennzahl ist, die eine der beiden Seiten veröffentlicht hat. Verschiedene Suiten, verschiedene Harnesses und keine gemeinsame Evaluierung – das ist das wiederkehrende Problem in diesem Vergleich.
Auswahl und wie man absichert
Die Entscheidungsregel, die sich aus dem Obigen ergibt, ist einfach genug, um sie in einer Zeile zu formulieren: Wenn irgendeine Eingabe kein Text ist, kommt Beam nicht infrage und der Vergleich ist beendet. Wenn jede Eingabe Text ist, stellt sich die Frage, ob Beams nicht belegte Effizienzbehauptung einen unbekannten Preis und keinen unabhängigen Score wert ist, gegenüber einem Modell, das $2.00 und $12.00 kostet, mit einer dokumentierten Staffel und einer vollständigen Tool-Oberfläche.
Gemini 3.1 Pro Preview ist in unserem Katalog, wobei der Listenpreis des Anbieters durchgereicht und nichts aufgeschlagen wird, hinter einem einzigen OpenAI-kompatiblen Schlüssel unter api.orcarouter.ai/v1 neben über 200 weiteren Modellen — und derselbe Schlüssel bedient die Modelle, mit denen Beam beim Preis konkurriert, von GLM 5.3 bei 1,26 $ und 3,96 $ bis DeepSeek V4.1 Flash bei 0,15 $ und 0,60 $, heute Morgen live abgerufen. Weil die Tarifgrenze bei 200.000 Token ein Routing-Problem und kein Modellproblem ist, lässt die Routing-DSL dich das direkt ausdrücken: kurze Anfragen auf der günstigen Tarifstufe halten und die wirklich langen dort festnageln, wo das Fenster der Grund ist, warum du das Modell gewählt hast – in einem einzigen Aufruf statt im Anwendungscode.
Reflection Beam ist keine unserer Routen, und wir werden Sie nicht an jemanden verweisen, der behauptet, es zu haben. Wenn die Apache-2.0-Gewichte diesen Monat wie versprochen erscheinen, wird Self-Hosting zu einer dritten Option für reine Textarbeit, und die Effizienzbehauptung wird auf Ihrer eigenen Hardware testbar.

Was würde die Antwort ändern?
Beams Argumentation gegen Gemini beruht auf denselben zwei Punkten, auf denen jeder Beam-Vergleich beruht, und dieses Duell fügt einen dritten hinzu.
Ein Preis. Ohne einen lässt sich das Effizienzargument nicht in eine Budgetentscheidung umwandeln, und das Modell konkurriert mit einem Diagramm statt mit einer Preisliste.
Eine unabhängige Bewertung. Artificial Analysis erklärte am 5. Oktober, Reflection habe ihm Zugang gewährt und es benchmarke Beam, wobei es frühe Indikatoren als Hinweis darauf beschreibe, dass Beam eines der token-effizientesten offenen Modelle sein werde, die es für sein Intelligenzniveau gesehen habe. Das ist die richtige Quelle, die das Richtige sagt – und dennoch gibt es weiterhin keine Beam-Zeile auf dem Board: Die Modellseiten liefern 404, und das Leaderboard enthält Stand heute Morgen keinen Beam-Eintrag.
Und das, was sich nicht ändert: Beam ist reiner Text. Keine Veröffentlichung von Gewichten, keine Preissenkung und kein Index-Score ändern etwas daran, was bedeutet, dass dieser Vergleich für eine ganze Klasse von Workloads nie zu einem Vergleich werden wird. Wenn in Ihrer Pipeline ein Video vorkommt, lautete die Antwort Gemini 3.1 Pro Preview schon, bevor der erste Benchmark geladen wurde.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
