
Reflection Beam vs Gemini 3.1 Pro Preview: de een leest video, de ander leest tekst
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 150 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Begin met de asymmetrie die geen enkele benchmarktabel in deze vergelijking vermeldt. Reflection Beam, aangekondigd op 5 oktober 2026, is een sparse mixture-of-experts-model met 501 miljard parameters, waarvan 23 miljard parameters actief zijn per token, en het neemt tekst in en geeft tekst terug. Niets anders. Gemini 3.1 Pro Preview, het toonaangevende multimodale model van de leverancier sinds 19 februari 2026, accepteert tekst, afbeeldingen, video, audio en bestanden, en het is het enige model in deze vergelijking waarbij de vraag "kan het het ding zien waar ik naar wil vragen" voor elke kant een ander antwoord heeft. Al het andere — de sparsiteitsratio's, de contextvensters, de prijsniveaus — is een argument. Dat ene is een specificatie.
Het betekent ook dat dit het minst symmetrische paar in de set is, en het meest nuttige, omdat het blootlegt waar een modelvergelijking werkelijk voor dient. Als je werklast tekst is, zijn Beam en Gemini 3.1 Pro twee opties op een spectrum dat loopt van goedkoop-en-ongemeten tot duur-en-grondig-gescoord. Als je werklast een videoframe bevat, valt er niets te vergelijken.
Wat elk model is
Gemini 3.1 Pro Preview is het vlaggenschip van Google in de preview-klasse: 1.048.576 tokens context, een maximale output van 65.536 tokens, vijf invoermodaliteiten en een venster van 1 miljoen tokens dat via een prijsladder wordt bereikt in plaats van een vast tarief. Google positioneert het voor verbeterde software-engineering, verbeterde agentische betrouwbaarheid en efficiënter tokengebruik bij complexe workflows. Het is niet open weights. De naam bevat nog steeds "Preview", een status die Google sinds februari voor dit model heeft.
Reflection Beam is het eerste model van Reflection en het begin van een open-weight-serie. Vijfhonderdeen miljard totale parameters, 23 miljard actief — ongeveer 4,6 procent van het model actief per token. Drieëntwintig komma acht biljoen pre-training-tokens op 6.144 GB300-chips in minder dan vier weken, daarna een reinforcement-learning-campagne op 10.500 GB300-chips gedurende vier weken met meer dan 100 miljoen rollouts in ongeveer een miljoen omgevingen. De API is OpenAI-compatibel op api.reflection.ai/openai/v1 met Chat Completions en een Models-lijst, de context is 256.000 tokens met een bèta-voetnoot, de reasoning_effort-parameter heeft vijf niveaus en geen uitknop, en de gewichten zijn toegezegd voor later deze maand onder Apache 2.0.
• Modaliteit — Gemini 3.1 Pro Preview ondersteunt tekst, afbeelding, video, audio en bestand; Reflection Beam ondersteunt alleen tekst.
• Context en uitvoer — 1.048.576 tokens invoer en 65.536 tokens uitvoer voor Gemini, tegenover 256.000 tokens invoer en 128.000 tokens uitvoer voor Beam.
• Prijs — Gemini 3.1 Pro Preview tegen $2,00 input en $12,00 output per miljoen tokens tot 200.000 tokens, stijgend naar $4,00 en $18,00 daarboven, met cache-reads tegen $0,20; Reflection Beam heeft geen gepubliceerde prijs.
• Tooling-oppervlak — native tool-aanroepen, gestructureerde outputs en zoek-grounding aan de Google-kant; tool-aanroepen en gestructureerde outputs aan de Beam-kant, met een endpoint dat beperkt is tot Chat Completions.
• Gewichten — propriëtair voor Gemini; Apache 2.0 beloofd voor Beam, nog niet vrijgegeven.
• Onafhankelijke score — Gemini 3.1 Pro Preview heeft een Artificial Analysis-index; Beam heeft geen rij op het bord.
De modaliteitskloof is het hele argument
Het loont concreet te zijn in plaats van te schermen met 'multimodaal', want de praktische consequenties zijn specifiek.
Een workload die een schermopname, een productfoto, een gescand contract of een callcenter-audiobestand verwerkt, kan door Beam niet worden bediend, tegen welke prijs dan ook, met welke prompt dan ook, op welk abonnement dan ook. Er is geen workaround op API-niveau: de documentatie van Beam beschrijft één invoermodaliteit en één uitvoermodaliteit, en er wordt geen afbeeldings- of audiopad vermeld. Gemini 3.1 Pro Preview verwerkt alle vijf, wat betekent dat het hier het enige model is dat kan worden ingezet in een workflow waarin de invoer nog geen tekst is.
De omgekeerde situatie is ook het vermelden waard, want dat is precies de kwestie die mensen verkeerd aanpakken. Als je invoer tekst is en tekst blijft, leveren Gemini's vijf modaliteiten je niets op, en betaal je de prijs van een multimodaal model om een tekstuele workload te draaien. Dat is geen pleidooi voor Beam — het is een pleidooi dat de modaliteitsvraag beantwoord moet worden vóór de benchmarkvraag, omdat die vraag opties goedkoper en betrouwbaarder uitsluit dan welke scorevergelijking dan ook.
Twee previews, twee verschillende betekenissen.
Aan beide modelnamen kleeft een voorbehoud, en die voorbehouden zijn niet gelijk, wat het interessantste is aan deze combinatie.
De "Preview" van Gemini 3.1 Pro is een naamgevingsconventie voor een model dat sinds februari algemeen aanroepbaar is, met een onafhankelijke score, een gepubliceerde tariefkaart inclusief een gedocumenteerd long-contextniveau, en een volledig tooloppervlak. In de praktijk betekent "preview" hier dat Google zich het recht voorbehoudt om het te vervangen, niet dat het moeilijk te verkrijgen of ongescoord is.
De bèta van Beam is een echte poort. Toegang is een wachtlijst, het model-ID is aangemaakt op 5 oktober 2026, er is geen tariefkaart, geen score van derden, en de artefacten waarmee iemand de centrale bewering zou kunnen verifiëren — gewichten, technisch rapport, modelkaart — worden beloofd in plaats van opgeleverd. Het contextcijfer bevat een voetnoot met de waarschuwing dat het tijdens de bèta kan veranderen, een voorbehoud dat geen enkel algemeen beschikbaar model nodig heeft.
De consequentie is asymmetrisch op een manier die van belang is voor inkoop. Een team dat Gemini 3.1 Pro Preview adopteert, accepteert het risico op veranderingen in modellen. Een team dat vandaag Beam adopteert, accepteert een onbekende prijs, een onbekende onafhankelijke score en geen mogelijkheid om het model zelf te draaien. Dat zijn verschillende categorieën van risico, en prijs is degene die het vaakst de doorslag geeft.

Benchmarks, en het citeerprobleem
De tabellen bij de lancering van Reflection bevatten geen Gemini 3.1 Pro Preview of welk Google-model dan ook. De vergelijkingsset is uitsluitend open en semi-open: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max en DeepSeek V4.1 Flash. De twee modellen zijn dus nooit in een gepubliceerde tabel tegenover elkaar gezet, en de onderstaande cijfers komen aan beide kanten van verschillende harnesses.
• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview scoort 29,7 en staat op de 58e plaats van de 147 in zijn run. Beam heeft helemaal geen indexrij.
• GPQA Diamond — Gemini 3.1 Pro Preview op 94,1 volgens Artificial Analysis tegenover de door de leverancier gerapporteerde 90,5 van Beam.
• SciCode — 58,7 voor Gemini tegenover de door de leverancier gerapporteerde 49,7 van Beam.
• Humanity's Last Exam — 47,0 voor Gemini tegenover de door de leverancier gerapporteerde 36,2 van Beam, waarbij dat laatste expliciet zonder tools.
• Terminal-Bench v2.1 — 73,8 voor Gemini volgens Artificial Analysis tegenover de door de leverancier gerapporteerde 80,1 van Beam. Dit is de sterkste rij van Beam in de vergelijking, en het is een overwinning op een model dat sinds februari op de markt is.
• Recall bij lange context — 82,0 voor Gemini tegenover de door de leverancier gerapporteerde 79,3 van Beam op AA-LCR.
• tau-squared Bench — 95,6 voor Gemini tegenover de 78,7 van Beam op MCP Atlas en 38,0 op tau3 banking. Gerelateerde evaluaties van agentisch toolgebruik, niet dezelfde, en het verschil in naamgeving doet ertoe.
Er is nog een apart probleem met de eerlijkheid aan de Gemini-kant van deze tabel dat een eigen zin verdient. Onafhankelijke indexscores voor Gemini 3.1 Pro Preview zijn in verschillende bronnen aangehaald met de waarden 30; 46; 47,7 en 57, en Artificial Analysis levert op hetzelfde moment verschillende indexrevisies op verschillende modelpagina's. Het cijfer 29,7 hierboven is dat van de pagina die we op 6 oktober 2026 hebben gelezen, en het is het enige dat we zullen citeren — maar elk artikel dat één enkel Gemini-indexcijfer naast dat van een concurrent zet zonder te vermelden uit welke momentopname het afkomstig is, presenteert een zwevend getal als een vast getal. Dezelfde voorzichtigheid geldt omgekeerd voor Beam, waar er helemaal geen momentopname is.
Prijs, en de tier waar niemand op rekent
Gemini 3.1 Pro Preview kost $2,00 voor invoer en $12,00 voor uitvoer per miljoen tokens tot 200.000 tokens, en $4,00 en $18,00 daarboven. Cache-leesacties kosten $0,20 per miljoen en cache-schrijfacties $0,375. De tariefgrens is het onderdeel waar je rekening mee moet houden in je planning: het belangrijkste verkoopargument van het model is een venster van 1.048.576 tokens, en zodra een verzoek 200.000 tokens overschrijdt, verdubbelt het invoertarief en stijgt het uitvoertarief met de helft. Een workload die rond het venster van een miljoen tokens is ontworpen, is daarom een workload die voor het grootste deel van zijn verkeer tegen het tweede tarief wordt geprijsd, niet tegen het eerste.
Beam heeft geen tariefkaart, dus er is geen niveau om te modelleren en niets om te vergelijken. Die afwezigheid is niet neutraal: ze betekent dat de goedkoopst verdedigbare uitspraak over de kosten van Beam is dat ze onbekend zijn, en de enige kwantitatieve onderbouwing voor de positionering op het gebied van efficiëntie is de eigen grafiek van Reflection, die de gegenereerde FLOPs schat als twee keer het aantal actieve parameters maal het gemiddelde aantal gegenereerde tokens per poging over DeepSWE, HLE en Terminal-Bench 2.1 — met een onderschrift dat toegeeft dat prompt-prefill, attention en serving-overhead buiten beschouwing zijn gelaten. Op de workloads waarop een context van een miljoen tokens van belang is, is prefill geen afrondingsfout, en het is precies de term die de formule weglaat.

Toolgebruik, zoeken en waar de twee ontwerpen verschillen
De geadverteerde sterke punten van Gemini 3.1 Pro Preview zijn software-engineering, agentische betrouwbaarheid en token-efficiëntie, en het gepubliceerde scala aan tools omvat functieaanroepen, gestructureerde outputs en search grounding. Dat laatste punt is het punt om op te letten voor iedereen die agentische stacks vergelijkt: grounded search is een first-party mogelijkheid van Google zelf, en het verandert wat een tool-gebruikende agent kan doen zonder dat er een externe retrievalservice aan te pas komt.
Het toolverhaal van Beam is interessanter dan een specificatielijn doet vermoeden en moeilijker te beoordelen. Reflection rapporteert MCP Atlas op 78,7, AutomationBench publiek op 37,0, tau3 banking op 38,0, BrowseComp met contextbeheer op 77,4 en DeepSearchQA met contextbeheer op 80,1 — en merkt op dat het model tijdens reinforcement learning organisch leerde om andere taalmodellen te bevragen en OCR-API's aan te roepen wanneer het webtoegang kreeg, ondanks dat browsertaken ontbraken in de trainingsmix. Als die generalisatie standhoudt, is het een echt signaal over agentische transfer. Het is op dit moment ook een leveranciersobservatie uit een trainingsrun, zonder onafhankelijke controle.
Op de toolgebruik-rijen waar beide kanten cijfers hebben, is het beeld gemengd in plaats van eenzijdig. Beams leverancierstabel plaatst het voor GLM 5.2 op MCP Atlas en gelijk aan GLM 5.2 en Kimi K3 op tau3 banking, terwijl Gemini's tau-squared Bench-cijfer van 95,6 het hoogste agentische getal is dat een van beide partijen heeft gepubliceerd. Verschillende suites, verschillende harnassen, en geen gedeelde evaluatie — wat het terugkerende probleem in deze vergelijking is.
Kiezen, en hoe u zich kunt indekken
De beslissingsregel die uit het bovenstaande voortvloeit, is eenvoudig genoeg om in één regel te formuleren: als een van de invoeren geen tekst is, is Beam geen optie en is de vergelijking voorbij. Als elke invoer tekst is, wordt de vraag of de niet-toegeschreven efficiëntieclaim van Beam een onbekende prijs en geen onafhankelijke score waard is, afgezet tegen een model dat $2,00 en $12,00 kost, met een gedocumenteerde ladder en een volledig tooloppervlak.
Gemini 3.1 Pro Preview staat in onze catalogus, met het lijsttarief van de provider doorgegeven en niets toegevoegd, achter één OpenAI-compatibele sleutel op api.orcarouter.ai/v1 naast meer dan 200 andere modellen — en dezelfde sleutel bedient de modellen waarmee Beam op prijs concurreert, van GLM 5.3 tegen $1,26 en $3,96 tot DeepSeek V4.1 Flash tegen $0,15 en $0,60, vanmorgen live uitgelezen. Omdat de tiergrens bij 200.000 tokens een routeringsprobleem is en geen modelprobleem, kun je die met de routing-DSL direct uitdrukken: houd korte verzoeken op de goedkope tier en pin de echt lange verzoeken waar het contextvenster de reden is dat je het model koos, in één call in plaats van in applicatiecode.
Reflection Beam is niet een van onze routes, en we zullen je niet doorverwijzen naar iemand die beweert het te hebben. Als de Apache 2.0-gewichten deze maand arriveren zoals beloofd, wordt self-hosting een derde optie voor werk met alleen tekst en wordt de efficiëntieclaim testbaar op je eigen hardware.

Wat zou het antwoord veranderen
De zaak van Beam tegen Gemini berust op dezelfde twee punten waar elke vergelijking met Beam op berust, en deze confrontatie voegt een derde toe.
Een prijs. Zonder die prijs kan het efficiëntieargument niet worden omgezet in een budgetbeslissing, en concurreert het model met een diagram in plaats van met een tariefkaart.
Een onafhankelijke score. Artificial Analysis zei op 5 oktober dat Reflection het toegang had gegeven en dat het Beam aan het benchmarken was, en beschreef vroege indicatoren die erop wijzen dat Beam een van de meest token-efficiënte open modellen zal zijn die het heeft gezien voor zijn intelligentieniveau. Dat is de juiste bron die het juiste zegt, en er staat nog steeds geen Beam-rij op het scorebord — de modelpagina's geven 404 en de ranglijst bevat vanochtend nog geen Beam-vermelding.
En wat niet verandert: Beam is uitsluitend tekst. Geen release van gewichten, geen prijsverlaging en geen indexscore verandert daar iets aan, wat betekent dat deze vergelijking voor een hele categorie workloads nooit echt een vergelijking zal worden. Als er een video in je pipeline zit, was het antwoord Gemini 3.1 Pro Preview al voordat de eerste benchmark geladen was.
