
Reflection Beam vs Gemini 3.1 Pro Preview: uno legge i video, uno legge il testo
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 150 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Cominciamo dall'asimmetria che nessuna tabella di benchmark in questo confronto menziona. Reflection Beam, annunciato il 5 ottobre 2026, è un modello sparse mixture-of-experts da 501 miliardi di parametri, con 23 miliardi di parametri attivi per token, e accetta testo in input e restituisce testo in output. Nient'altro. Gemini 3.1 Pro Preview, il modello multimodale di frontiera del fornitore dal 19 febbraio 2026, accetta testo, immagini, video, audio e file, ed è l'unico modello in questo confronto in cui la domanda «riesce a vedere la cosa di cui voglio chiedere» ha una risposta diversa per ciascuna delle due parti. Tutto il resto — i rapporti di sparsità, le finestre di contesto, i livelli di prezzo — è oggetto di discussione. Quella è una specifica.
Significa anche che questa è la coppia meno simmetrica dell'insieme, e la più utile, perché mette in luce a cosa serve davvero un confronto tra modelli. Se il tuo carico di lavoro è testo, Beam e Gemini 3.1 Pro sono due opzioni su uno spettro che va da economico e non misurato a costoso e valutato in modo approfondito. Se il tuo carico di lavoro contiene un fotogramma video, non c'è alcun confronto da fare.
Cosa è ciascun modello
Gemini 3.1 Pro Preview è il fiore all'occhiello di livello preview di Google: 1.048.576 token di contesto, un output massimo di 65.536 token, cinque modalità di input e una finestra da 1 milione di token raggiunta tramite una scala di prezzi anziché una tariffa fissa. Google lo posiziona per un'ingegneria del software potenziata, una maggiore affidabilità agentica e un uso più efficiente dei token su flussi di lavoro complessi. Non è a pesi aperti. Il suo nome porta ancora "Preview", uno status che Google mantiene per questo modello da febbraio.
Reflection Beam è il primo modello di Reflection e l'inizio di una serie open-weight. Cinquecentouno miliardi di parametri totali, 23 miliardi attivi — circa il 4,6% del modello è attivo per token. Ventitré virgola otto trilioni di token di pre-addestramento su 6.144 chip GB300 in meno di quattro settimane, poi una campagna di reinforcement learning su 10.500 chip GB300 per quattro settimane con più di 100 milioni di rollout in circa un milione di ambienti. La sua API è compatibile con OpenAI all'indirizzo api.reflection.ai/openai/v1 con Chat Completions e un elenco Models, il suo contesto è di 256.000 token con una nota a piè di pagina beta, il suo parametro reasoning_effort ha cinque livelli e nessun interruttore di disattivazione, e i suoi pesi sono promessi per la fine di questo mese con licenza Apache 2.0.
• Modalità — Gemini 3.1 Pro Preview accetta testo, immagini, video, audio e file; Reflection Beam accetta solo testo.
• Contesto e output — 1.048.576 token in ingresso e 65.536 in uscita per Gemini, contro i 256.000 in ingresso e 128.000 in uscita per Beam.
• Prezzo — Gemini 3.1 Pro Preview a $2,00 in input e $12,00 in output per milione di token fino a 200.000 token, che salgono a $4,00 e $18,00 oltre tale soglia, con letture dalla cache a $0,20; Reflection Beam non ha un prezzo pubblicato.
• Superficie di tooling — tool calling nativo, output strutturati e grounding della ricerca sul lato Google; tool calling e output strutturati sul lato Beam, con un endpoint limitato a Chat Completions.
• Pesi — proprietari per Gemini; Apache 2.0 promesso per Beam, non ancora rilasciati.
• Punteggio indipendente — Gemini 3.1 Pro Preview dispone di un indice Artificial Analysis; Beam non ha alcuna voce nella classifica.
Il gap di modalità è l'intero argomento
Vale la pena essere concreti invece di limitarsi ad alludere a "multimodale", perché le conseguenze pratiche sono specifiche.
Un carico di lavoro che acquisisce una registrazione dello schermo, una foto di prodotto, un contratto scansionato o un file audio di un call center non può essere servito da Beam a nessun prezzo, con nessun prompt, su nessun piano. Non esiste una soluzione alternativa a livello di API: la documentazione di Beam descrive una sola modalità di input e una sola modalità di output, e non è elencato alcun percorso per immagini o audio. Gemini 3.1 Pro Preview gestisce tutte e cinque, il che significa che è l'unico modello qui che può essere inserito in un flusso di lavoro in cui l'input non è già testo.
Vale la pena enunciare anche il caso inverso, perché è quello in cui le persone sbagliano. Se il tuo input è testo e rimarrà testo, le cinque modalità di Gemini non ti danno nulla, e stai pagando il prezzo di un modello multimodale per eseguire un carico di lavoro testuale. Non è un argomento a favore di Beam — è un argomento secondo cui la questione della modalità dovrebbe essere risolta prima della questione del benchmark, perché elimina opzioni in modo più economico e più affidabile di qualsiasi confronto di punteggi.
Due anteprime, due significati diversi
Entrambi i nomi dei modelli comportano una riserva, e le riserve non sono simili, il che è la cosa più interessante di questo abbinamento.
Il "Preview" di Gemini 3.1 Pro è una convenzione di denominazione per un modello che è generalmente invocabile da febbraio, con un punteggio indipendente, un listino prezzi pubblicato che include un livello documentato per il contesto lungo e una superficie completa di strumenti. In pratica, "preview" qui significa che Google si riserva il diritto di sostituirlo, non che sia difficile da ottenere o privo di punteggio.
La beta di Beam è un vero cancello. L'accesso è una lista d'attesa, l'ID del modello è stato creato il 5 ottobre 2026, non esiste un listino prezzi, nessun punteggio di terze parti, e gli artefatti che permetterebbero a chiunque di verificare l'affermazione centrale — pesi, rapporto tecnico, scheda del modello — sono promessi anziché rilasciati. Il dato sul contesto porta una nota a piè di pagina che avverte che potrebbe cambiare durante la beta, il che è una cautela di cui nessun modello generalmente disponibile ha bisogno.
La conseguenza è asimmetrica in un modo che conta per gli acquisti. Un team che adotta Gemini 3.1 Pro Preview sta accettando il rischio di avvicendamento del modello. Un team che adotta Beam oggi sta accettando un prezzo sconosciuto, un punteggio indipendente sconosciuto e l'impossibilità di eseguire il modello autonomamente. Queste sono categorie di rischio diverse, e il prezzo è quella che decide più spesso.

Benchmark, e il problema delle citazioni
Le tabelle di lancio di Reflection non includono Gemini 3.1 Pro Preview né alcun modello Google. Il suo insieme di confronto è composto solo da modelli aperti e semi-aperti: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max e DeepSeek V4.1 Flash. Quindi i due modelli non sono mai stati messi a confronto tra loro in una tabella pubblicata, e le cifre riportate di seguito provengono da harness diversi da entrambe le parti.
• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview registra 29,7, classificandosi 58º su 147 nella sua esecuzione. Beam non ha alcuna riga nell'indice.
• GPQA Diamond — Gemini 3.1 Pro Preview al 94,1 secondo Artificial Analysis contro il 90,5 dichiarato dal fornitore di Beam.
• SciCode — 58,7 per Gemini rispetto al 49,7 dichiarato dal fornitore di Beam.
• Humanity's Last Exam — 47,0 per Gemini contro il 36,2 dichiarato dal fornitore di Beam, quest'ultimo esplicitamente senza strumenti.
• Terminal-Bench v2.1 — 73,8 per Gemini secondo Artificial Analysis contro l'80,1 dichiarato dal fornitore Beam. Questa è la riga più forte di Beam nel confronto, ed è una mietitura ai danni di un modello che è sul mercato da febbraio.
• Recall su contesto lungo — 82,0 per Gemini rispetto al 79,3 dichiarato dal fornitore di Beam su AA-LCR.
• tau-squared Bench — 95,6 per Gemini contro il 78,7 di Beam su MCP Atlas e 38,0 su tau3 banking. Valutazioni correlate dell'uso agentico degli strumenti, non la stessa, e la differenza di denominazione è importante.
C'è un problema di onestà separato per quanto riguarda il lato Gemini di questa tabella, che merita una frase a sé. Punteggi indipendenti dell'indice per Gemini 3.1 Pro Preview sono stati citati come 30, 46, 47,7 e 57 in fonti diverse, e Artificial Analysis presenta revisioni diverse dell'indice su pagine modello diverse nello stesso momento. Il valore 29,7 di cui sopra è quello presente nella pagina che abbiamo consultato il 6 ottobre 2026, ed è l'unico che citeremo — ma qualsiasi articolo che accosti un singolo numero dell'indice Gemini a un concorrente senza dire da quale istantanea proviene presenta un numero variabile come se fosse fisso. La stessa cautela vale al contrario per Beam, dove non esiste alcuna istantanea.
Prezzo, e il livello per cui nessuno pianifica
Gemini 3.1 Pro Preview costa 2,00 $ in input e 12,00 $ in output per milione di token fino a 200.000 token, e 4,00 $ e 18,00 $ al di sopra. Le letture della cache costano 0,20 $ per milione e le scritture della cache 0,375 $. Il confine tra i livelli è la parte su cui vale la pena pianificare: il principale argomento di vendita del modello è una finestra da 1.048.576 token, e nel momento in cui una richiesta supera i 200.000 token la tariffa di input raddoppia e quella di output aumenta della metà. Un carico di lavoro progettato attorno alla finestra da un milione di token è quindi un carico di lavoro prezzato al secondo livello per la maggior parte del suo traffico, non al primo.
Beam non ha un listino prezzi, quindi non c'è alcun livello da modellare e nulla da confrontare. Questa assenza non è neutrale: significa che l'affermazione più economica e difendibile sul costo di Beam è che è sconosciuto, e l'unico supporto quantitativo per il suo posizionamento di efficienza è il grafico di Reflection stesso, che stima i FLOP generati come due volte il numero di parametri attivi moltiplicato per i token generati medi per tentativo su DeepSWE, HLE e Terminal-Bench 2.1 — con una didascalia che ammette che il prefill del prompt, l'attenzione e l'overhead di serving sono esclusi. Sui carichi di lavoro in cui conta un contesto da un milione di token, il prefill non è un errore di arrotondamento, ed è precisamente il termine che la formula omette.

Uso degli strumenti, ricerca e dove i due design differiscono
Le forze pubblicizzate di Gemini 3.1 Pro Preview sono l'ingegneria del software, l'affidabilità agentica e l'efficienza dei token, e la sua superficie di strumenti pubblicata include il function calling, gli output strutturati e il search grounding. Quest'ultimo elemento è quello da notare per chiunque confronti stack agentici: la ricerca con grounding è una capacità first-party dalla parte di Google, e cambia ciò che un agente che usa strumenti può fare senza un servizio di retrieval esterno collegato.
La storia degli strumenti di Beam è più interessante di quanto una riga di specifiche suggerisca e più difficile da valutare. Reflection riporta MCP Atlas a 78,7, AutomationBench pubblico a 37,0, tau3 banking a 38,0, BrowseComp con gestione del contesto a 77,4 e DeepSearchQA con gestione del contesto a 80,1 — e osserva che durante l'apprendimento per rinforzo il modello ha imparato organicamente a interrogare altri modelli linguistici e a chiamare API OCR quando gli viene dato accesso al web, nonostante le attività di browsing fossero assenti dal mix di addestramento. Se quella generalizzazione regge, è un vero segnale sul trasferimento agentico. A questo punto, però, è anche un'osservazione di un fornitore proveniente da una sessione di addestramento, senza alcuna verifica indipendente.
Sulle righe di utilizzo degli strumenti in cui entrambe le parti hanno numeri, il quadro è misto anziché unilaterale. La tabella del fornitore di Beam lo colloca davanti a GLM 5.2 su MCP Atlas e allo stesso livello di GLM 5.2 e Kimi K3 su tau3 banking, mentre il dato di Gemini di 95.6 su tau-squared Bench è il numero agentico più alto pubblicato da una delle due parti. Suite diverse, harness diversi e nessuna valutazione condivisa — che è il problema ricorrente in questo confronto.
Scegliere, e come coprirsi
La regola decisionale che deriva da quanto sopra è abbastanza semplice da enunciare in una riga: se qualsiasi input non è testo, Beam non è un'opzione e il confronto è concluso. Se ogni input è testo, la domanda diventa se la rivendicazione di efficienza non attribuita di Beam valga un prezzo sconosciuto e nessun punteggio indipendente, contrapposta a un modello che costa $2.00 e $12.00 con una scala documentata e un set completo di strumenti.
Gemini 3.1 Pro Preview è nel nostro catalogo, con la tariffa di listino del fornitore passata così com'è e senza alcun ricarico, dietro un'unica chiave compatibile con OpenAI su api.orcarouter.ai/v1 insieme a più di 200 altri modelli — e la stessa chiave serve i modelli con cui Beam compete sul prezzo, da GLM 5.3 a $1,26 e $3,96 fino a DeepSeek V4.1 Flash a $0,15 e $0,60, rilevati in tempo reale questa mattina. Poiché il confine di fascia a 200.000 token è un problema di routing piuttosto che un problema del modello, il DSL di routing ti consente di esprimerlo direttamente: mantieni le richieste brevi sulla fascia economica e fissa quelle davvero lunghe dove la finestra è il motivo per cui hai scelto il modello, in un'unica chiamata anziché nel codice dell'applicazione.
Reflection Beam non è una delle nostre route, e non ti indirizzeremo verso nessuno che sostenga di averla. Se i pesi Apache 2.0 arrivano questo mese come promesso, il self-hosting diventa una terza opzione per il lavoro solo testuale e l'affermazione sull'efficienza diventa verificabile sul tuo hardware.

Cosa cambierebbe la risposta
La tesi di Beam contro Gemini si basa sugli stessi due elementi su cui si basa ogni confronto con Beam, e questo confronto ne aggiunge un terzo.
Un prezzo. Senza di esso, l'argomentazione sull'efficienza non può essere trasformata in una decisione di budget, e il modello compete su un diagramma invece che su un tariffario.
Un punteggio indipendente. Artificial Analysis ha dichiarato il 5 ottobre che Reflection le aveva concesso l'accesso e che stava sottoponendo Beam a benchmark, descrivendo i primi indicatori come indicativi del fatto che Beam sarà uno dei modelli aperti più efficienti in termini di token che abbia visto per il suo livello di intelligenza. È la fonte giusta che dice la cosa giusta, e non c'è ancora alcuna riga di Beam sulla classifica — le pagine del modello restituiscono 404 e la classifica non riporta alcuna voce di Beam a partire da questa mattina.
E la cosa che non cambia: Beam è solo testo. Nessun rilascio di pesi, nessun taglio di prezzo e nessun punteggio di indice lo altera, il che significa che per un'intera classe di carichi di lavoro questo confronto non diventerà mai un confronto vero e proprio. Se la tua pipeline contiene un video, la risposta era Gemini 3.1 Pro Preview prima ancora che il primo benchmark fosse caricato.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
