Ett genererat hjältekort för artikeln 'Reflection Beam vs Gemini 3.1 Pro Preview: En läser video, en läser text', med titeln 'Reflection Beam vs Gemini 3.1 Pro Preview' och underrubriken 'En läser video, en läser text' samt tre etiketter med texten 'Endast text vs fem modaliteter', '256K vs 1M kontext' och 'Inget pris vs en graderad taxa'.
Guides & Insights

Reflection Beam vs Gemini 3.1 Pro Preview: En läser video, en läser text

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Börja med den asymmetri som ingen benchmark-tabell i den här jämförelsen nämner. Reflection Beam, som tillkännagavs den 5 oktober 2026, är en sparse mixture-of-experts-modell med 501 miljarder parametrar och 23 miljarder aktiva parametrar per token, och den tar emot text och ger text tillbaka. Inget annat. Gemini 3.1 Pro Preview, leverantörens främsta multimodala modell sedan den 19 februari 2026, tar emot text, bilder, video, ljud och filer, och det är den enda modellen i den här jämförelsen där frågan "kan den se det jag vill fråga om" har ett annat svar för varje sida. Allt annat – sparsitetskvoterna, kontextfönstren, prisnivåerna – är ett argument. Den där är en specifikation.

Det innebär också att detta är det minst symmetriska paret i uppsättningen, och det mest användbara, eftersom det blottlägger vad en modelljämförelse faktiskt är till för. Om din arbetsbelastning består av text är Beam och Gemini 3.1 Pro två alternativ på ett spektrum som sträcker sig från billigt och omätt till dyrt och grundligt poängsatt. Om din arbetsbelastning innehåller en videobildruta finns det ingen jämförelse att göra.

Vad varje modell är

Gemini 3.1 Pro Preview är Googles flaggskepp i förhandsversionsklassen: 1 048 576 tokens i kontext, maximalt 65 536 tokens i utdata, fem indatamodaliteter och ett fönster på 1 miljon tokens som nås via en prisstege i stället för en fast avgift. Google positionerar den för förbättrad mjukvaruutveckling, förbättrad agentisk tillförlitlighet och effektivare tokenanvändning i komplexa arbetsflöden. Den har inte öppna vikter. Namnet innehåller fortfarande "Preview", en status som Google har haft för den här modellen sedan februari.

Reflection Beam är Reflections första modell och början på en serie med öppna vikter. 501 miljarder totala parametrar, 23 miljarder aktiva — cirka 4,6 procent av modellen aktiv per token. 23,8 biljoner förträningstokens på 6 144 GB300-chip på under fyra veckor, sedan en kampanj för förstärkningsinlärning på 10 500 GB300-chip i fyra veckor med fler än 100 miljoner rollouts över ungefär en miljon miljöer. Dess API är OpenAI-kompatibelt på api.reflection.ai/openai/v1 med Chat Completions och en Models-lista, dess kontext är 256 000 tokens med en betafotnot, dess parameter reasoning_effort har fem nivåer och ingen avstängningsbrytare, och dess vikter utlovas senare denna månad under Apache 2.0.

• Modalitet — Gemini 3.1 Pro Preview tar text, bild, video, ljud och fil; Reflection Beam tar endast text.

• Kontext och utdata — 1 048 576 tokens in och 65 536 ut för Gemini, mot 256 000 in och 128 000 ut för Beam.

• Pris — Gemini 3.1 Pro Preview till $2.00 in och $12.00 ut per miljon tokens upp till 200 000 tokens, och stiger till $4.00 och $18.00 däröver, med cacheläsningar på $0.20; Reflection Beam har inget publicerat pris.

• Verktygsyta — inbyggda verktygsanrop, strukturerade utdata och sökförankring på Googles sida; verktygsanrop och strukturerade utdata på Beams sida, med en slutpunkt begränsad till Chat Completions.

• Vikter — proprietära för Gemini; Apache 2.0 utlovat för Beam, ännu inte släppt.

• Oberoende poäng — Gemini 3.1 Pro Preview har ett Artificial Analysis-index; Beam har ingen rad på tavlan.

Modalitetsgapet är hela argumentet.

Det är värt att vara konkret i stället för att tala vagt om "multimodal", eftersom de praktiska konsekvenserna är specifika.

En arbetsbelastning som tar in en skärminspelning, ett produktfoto, ett skannat kontrakt eller en ljudfil från ett callcenter kan inte hanteras av Beam till något pris, med någon prompt, på någon plan. Det finns inget sätt att kringgå detta på API-nivån: Beams dokumentation beskriver en indatamodalitet och en utdatamodalitet, och ingen bild- eller ljudväg listas. Gemini 3.1 Pro Preview hanterar alla fem, vilket innebär att det är den enda modellen här som kan läggas in i ett arbetsflöde där indata inte redan är text.

Det omvända fallet är också värt att nämna, eftersom det är det som folk gör fel på. Om din indata är text och förblir text, ger Geminis fem modaliteter dig ingenting, och du betalar priset för en multimodal modell för att köra en textarbetsbelastning. Det är inte ett argument för Beam – det är ett argument för att modalitetsfrågan bör besvaras före benchmarkfrågan, eftersom den eliminerar alternativ billigare och mer tillförlitligt än någon poängjämförelse gör.

Två förhandsvisningar, två olika betydelser

Båda modellnamnen har ett förbehåll och förbehållen är inte lika, vilket är det mest intressanta med den här kombinationen.

Gemini 3.1 Pro:s "Preview" är en namngivningskonvention för en modell som har varit allmänt anropbar sedan februari, med en oberoende poäng, ett publicerat prisschema inklusive en dokumenterad långkontextnivå och en fullständig verktygsyta. I praktiken betyder "preview" här att Google förbehåller sig rätten att ersätta den, inte att den är svår att få tag på eller inte poängsatt.

Beams beta är en äkta grind. Åtkomsten är en väntelista, modell-ID:t skapades den 5 oktober 2026, det finns ingen prislista, inga poäng från tredje part, och de artefakter som skulle låta någon verifiera det centrala påståendet – vikter, teknisk rapport, modellkort – utlovas snarare än levereras. Kontextsiffran har en fotnot som varnar för att den kan ändras under betan, vilket är en gardering som ingen allmänt tillgänglig modell behöver.

Konsekvensen är asymmetrisk på ett sätt som spelar roll för upphandling. Ett team som inför Gemini 3.1 Pro Preview accepterar risken för modellutbyte. Ett team som inför Beam i dag accepterar ett okänt pris, en okänd oberoende poäng och ingen möjlighet att själva köra modellen. Det är olika kategorier av risk, och priset är det som oftast avgör.

A generated two-column scoreboard titled 'Reflection Beam vs Gemini 3.1 Pro Preview — the scoreboard'. Left column 'Reflection Beam': Input modalities text only; Context 256,000 tokens (beta); Max output 128,000 tokens; Price not published; Availability waitlisted beta; Independent score none yet. Right column 'Gemini 3.1 Pro Preview': Input modalities text, image, video, audio, file; Context 1,048,576 tokens; Max output 65,536 tokens; Price $2.00 / $12.00 to 200K, then $4.00 / $18.00; Availability preview, callable since February 2026; Independent score AA index 29.7. Footer reads 'Beam figures vendor-reported and unaudited. Gemini price is the provider list rate; its index is Artificial Analysis, read 6 October 2026.'

Benchmarks och citeringsproblemet

Reflections lanseringstabeller innehåller inte Gemini 3.1 Pro Preview eller någon Google-modell. Dess jämförelseuppsättning är endast öppen och halvöppen: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max och DeepSeek V4.1 Flash. Så de två modellerna har aldrig körts mot varandra i en publicerad tabell, och siffrorna nedan kommer från olika testramverk på båda sidor.

• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview registrerar 29,7 och rankas som 58:a av 147 i sin körning. Beam har ingen indexrad alls.

• GPQA Diamond — Gemini 3.1 Pro Preview på 94,1 enligt Artificial Analysis mot Beams leverantörsrapporterade 90,5.

• SciCode — 58,7 för Gemini mot Beams leverantörsrapporterade 49,7.

• Humanity's Last Exam — 47,0 för Gemini mot Beams leverantörsrapporterade 36,2, det senare uttryckligen utan verktyg.

• Terminal-Bench v2.1 — 73,8 för Gemini enligt Artificial Analysis mot Beams leverantörsrapporterade 80,1. Detta är Beams starkaste rad i jämförelsen, och det är en skörd mot en modell som har funnits på marknaden sedan februari.

• Återkallelse vid lång kontext — 82,0 för Gemini mot Beams leverantörsrapporterade 79,3 på AA-LCR.

• tau-squared Bench — 95,6 för Gemini mot Beams 78,7 på MCP Atlas och 38,0 på tau3 banking. Relaterade utvärderingar av agentisk verktygsanvändning, inte samma, och namnskillnaden har betydelse.

Det finns ett separat ärlighetsproblem med Gemini-sidan av den här tabellen som förtjänar en egen mening. Oberoende indexpoäng för Gemini 3.1 Pro Preview har angetts till 30, 46, 47,7 och 57 i olika källor, och Artificial Analysis tillhandahåller olika indexrevisioner på olika modellsidor vid samma tidpunkt. Siffran 29,7 ovan är den som finns på sidan vi läste den 6 oktober 2026, och det är den enda vi kommer att citera – men varje artikel som sätter en enda Gemini-indexsiffra bredvid en konkurrent utan att ange vilken ögonblicksbild den kommer från framställer ett flytande tal som ett fast tal. Samma varning gäller omvänt för Beam, där det inte finns någon ögonblicksbild alls.

Pris, och nivån som ingen planerar för

Gemini 3.1 Pro Preview kostar $2,00 in och $12,00 ut per miljon tokens upp till 200 000 tokens, och $4,00 och $18,00 över det. Cacheläsningar kostar $0,20 per miljon och cacheskrivningar $0,375. Nivågränsen är den del som är värd att planera kring: modellens främsta säljargument är ett fönster på 1 048 576 tokens, och i samma stund som en begäran passerar 200 000 tokens fördubblas priset för indata och priset för utdata ökar med hälften. En arbetsbelastning som utformats kring fönstret på en miljon tokens är därför en arbetsbelastning som för merparten av sin trafik prissätts enligt den andra nivån, inte den första.

Beam har ingen prislista, så det finns ingen nivå att modellera och inget att jämföra. Den frånvaron är inte neutral: den innebär att det billigaste försvarbara påståendet om Beams kostnad är att den är okänd, och det enda kvantitativa stödet för dess effektivitetspositionering är Reflections eget diagram, som uppskattar genererade FLOPs som två gånger antalet aktiva parametrar gånger genomsnittligt antal genererade tokens per försök över DeepSWE, HLE och Terminal-Bench 2.1 — med en bildtext som medger att prompt-prefill, attention och serveringsoverhead är uteslutna. I arbetsbelastningar där en kontext på en miljon tokens spelar roll är prefill inte ett avrundningsfel, och det är just den term som formeln utelämnar.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), captured 6 October 2026, showing the model name and id, the INPUT $2.00 and OUTPUT $12.00 pricing tiles, p50 TTFT 10.00 s, p95 TTFT 10.00 s, 13.9M tokens of 7-day traffic, the provenance lines 'Public benchmarks by Google - 2026-02-19' and 'AI Analysis', the summary describing a frontier reasoning model with improved agentic reliability, and a code sample using base_url https://api.orcarouter.ai/v1.

Verktygsanvändning, sökning och var de två designerna skiljer sig åt

Gemini 3.1 Pro Previews annonserade styrkor är mjukvaruutveckling, agentisk tillförlitlighet och token-effektivitet, och dess publicerade verktygsyta omfattar funktionsanrop, strukturerade utdata och sökförankring. Den sista posten är den man bör notera om man jämför agentiska stackar: förankrad sökning är en förstapartsfunktion hos Google, och den förändrar vad en verktygsanvändande agent kan göra utan att en extern hämtningstjänst kopplas in.

Beams verktygsberättelse är mer intressant än en specrad antyder och svårare att utvärdera. Reflection rapporterar MCP Atlas på 78,7, AutomationBench public på 37,0, tau3 banking på 38,0, BrowseComp med kontexthantering på 77,4 och DeepSearchQA med kontexthantering på 80,1 – och noterar att modellen under förstärkningsinlärning organiskt lärde sig att ställa frågor till andra språkmodeller och att anropa OCR-API:er när den gavs webbåtkomst, trots att webbläsningsuppgifter saknades i träningsmixen. Om den generaliseringen håller är det en verklig signal om agentisk överföring. Det är också, i det här läget, en leverantörsobservation från en träningskörning, utan oberoende kontroll.

På raderna för verktygsanvändning där båda sidor har siffror är bilden blandad snarare än ensidig. Beams leverantörstabell placerar den före GLM 5.2 på MCP Atlas och i nivå med GLM 5.2 och Kimi K3 på tau3 banking, medan Geminis siffra på tau-squared Bench, 95.6, är det högsta agentiska tal som någon av sidorna har publicerat. Olika sviter, olika ramverk och ingen gemensam utvärdering – vilket är det återkommande problemet i den här jämförelsen.

Att välja, och hur man hedgar

Beslutsregeln som följer av ovanstående är tillräckligt enkel att formulera i en rad: om någon indata inte är text är Beam inte ett alternativ, och jämförelsen är över. Om all indata är text blir frågan huruvida Beams effektivitetsanspråk utan källa är värt ett okänt pris och ingen oberoende poäng, ställt mot en modell som kostar $2.00 och $12.00 med en dokumenterad prisstege och en fullständig verktygsyta.

Gemini 3.1 Pro Preview finns i vår katalog, med leverantörens listpris vidarebefordrat utan påslag, bakom en OpenAI-kompatibel nyckel på api.orcarouter.ai/v1 tillsammans med 200+ andra modeller – och samma nyckel betjänar de modeller som Beam konkurrerar med på pris, från GLM 5.3 på $1.26 och $3.96 till DeepSeek V4.1 Flash på $0.15 och $0.60, läst live i morse. Eftersom gränsen vid 200 000 tokens är ett routingproblem snarare än ett modellproblem låter routing-DSL:en dig uttrycka det direkt: håll korta förfrågningar på den billiga nivån och fäst de riktigt långa där fönstret är anledningen till att du valde modellen, i ett anrop i stället för i applikationskod.

Reflection Beam är inte en av våra vägar, och vi kommer inte att hänvisa dig till någon som påstår sig ha den. Om Apache 2.0-vikterna kommer den här månaden som utlovat, blir självhostning ett tredje alternativ för textbaserat arbete och effektivitetsanspråket blir testbart på din egen hårdvara.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Vad skulle ändra svaret

Beams argument mot Gemini vilar på samma två punkter som varje Beam-jämförelse vilar på, och den här matchningen tillför en tredje.

Ett pris. Utan ett sådant kan effektivitetsargumentet inte omvandlas till ett budgetbeslut, och modellen konkurrerar med ett diagram snarare än en prislista.

Ett oberoende resultat. Artificial Analysis uppgav den 5 oktober att Reflection hade gett dem åtkomst och att de höll på att benchmarka Beam, och beskrev tidiga indikatorer som att de tyder på att Beam kommer att bli en av de mest tokeneffektiva öppna modeller de har sett för sin intelligensnivå. Det är rätt källa som säger rätt sak, och det finns fortfarande ingen Beam-rad på tavlan — modellsidorna returnerar 404, och i morse fanns det ingen Beam-post på resultattavlan.

Och det som inte förändras: Beam är enbart text. Inget viktsläpp, ingen prissänkning och ingen indexpoäng ändrar på det, vilket innebär att för en hel klass av arbetsbelastningar kommer den här jämförelsen aldrig att bli en jämförelse överhuvudtaget. Om din pipeline innehåller en video var svaret Gemini 3.1 Pro Preview redan innan den första benchmarken hade laddats.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen