
Reflection Beam rilascia un'API in beta, e i pesi sono ancora a due settimane di distanza
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 150 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il primo modello di Reflection si chiama Reflection Beam, e la cosa interessante stamattina non è che esista — è che ne esiste solo la metà. L'azienda ha annunciato Beam il 5 ottobre 2026 come modello sparse mixture-of-experts con 501 miliardi di parametri totali e 23 miliardi attivi per token, e lo stesso giorno ha messo davanti ad esso un endpoint beta compatibile con OpenAI. I pesi sono promessi per la fine di questo mese sotto Apache 2.0, insieme a un rapporto tecnico, una model card e lo stack di serving. Finché non arriveranno, le uniche persone in grado di eseguire Beam-501B-A23B sono quelle a cui Reflection consegna una chiave dalla lista d'attesa, e ogni cifra di performance in circolazione proviene dalle tabelle di un solo laboratorio.
È uno strano punto in cui fermare un lancio, e vale la pena essere precisi su quale metà abbiamo. Reflection ha rilasciato un'anteprima a cui è possibile iscriversi e una serie di tabelle di benchmark che nessuno ha riprodotto. Non ha rilasciato la cosa a cui si riferisce "open-weight" nel titolo.
Cosa è effettivamente in diretta questa mattina
Tutto il contenuto di questa sezione proviene dal post del blog e dalla documentazione di Reflection, consultati il 6 ottobre 2026.
• ID modello — Beam-501B-A23B, creato il 5 ottobre 2026, servito su api.reflection.ai/openai/v1 con Chat Completions e un elenco dei modelli e nient'altro.
• Forma — 501 miliardi di parametri totali, 23 miliardi attivi per token, con un rapporto di attivazione di circa il 4,6 per cento. Per confronto, GLM 5.2 si attesta vicino al 5,4 per cento.
• Contesto — 256.000 token sull'API, con una nota a piè di pagina collegata alla cifra stessa che avverte che la finestra potrebbe cambiare durante la beta. L'output massimo è di 128.000 token.
• Ragionamento — un parametro reasoning_effort con cinque impostazioni: low, medium, high, xhigh e max. Medium è l'impostazione predefinita e il modello ragiona sempre. Non esiste un interruttore per disattivarlo né una modalità senza ragionamento.
• Modalità — testo in input, testo in output. Nessun input di immagini, audio o video al lancio.
• Prezzo — non pubblicato. Il post del blog non ne riporta alcuno, la documentazione non ne riporta alcuno, e la console della piattaforma si trova dietro una barriera di registrazione.
• Accesso — una lista d'attesa. Non esiste un percorso self-service e non ci sono pesi, quindi non c'è download, né quantizzazione, né fine-tuning.
La riga del prezzo è quella che cambia il modo in cui leggi tutto il resto. Quattro dei sette modelli con cui Beam viene confrontato nelle tabelle di Reflection hanno prezzi di listino pubblici che puoi inserire in un foglio di calcolo oggi. Beam no, quindi qualsiasi affermazione sui costi che lo riguardi in questo momento è un'affermazione sul calcolo, non sui dollari.

Il numero da cui dipende il lancio
La proposta di Reflection è l'efficienza inferenziale, ed è insolitamente precisa su cosa significhi: sui benchmark di ragionamento avanzato, Beam ottiene punteggi paragonabili a GLM 5.2 usando da 3 a 4 volte meno calcolo inferenziale. I vantaggi sono descritti come ancora maggiori rispetto ai modelli della famiglia da 2 trilioni di parametri, in cui si colloca Qwen 3.8-Max.
Vale la pena leggere con attenzione il grafico che sta dietro a quell'affermazione, perché è la prova portante dell'intero post. Mette in relazione il punteggio di ragionamento con i FLOP di inferenza stimati su DeepSWE, Humanity's Last Exam e Terminal-Bench 2.1, e stima i FLOP come circa il doppio del numero di parametri attivi moltiplicato per il numero medio di token generati per tentativo. Quella formula esclude deliberatamente il prefill del prompt, le operazioni di attenzione dipendenti dal contesto e l'overhead di servizio — Reflection lo dice nella didascalia. È un confronto coerente tra modelli, non una misurazione della bolletta di qualcuno, ed è anche l'unico supporto quantitativo all'affermazione sull'efficienza, scritto dal laboratorio che ha costruito il modello. Trattalo come un'ipotesi che i pesi permetteranno a qualcun altro di verificare.
Ciò che l'architettura permette di ottenere in pratica è un profilo di serving. Ventitré miliardi di parametri attivi sono un modello che si può ragionevolmente eseguire su un numero relativamente ridotto di GPU a latenza interattiva, il che è un prodotto diverso da un modello denso da 501 miliardi di parametri, anche se il numero sulla scheda è lo stesso. Ecco perché Reflection può parlare di ragionamento vicino alla frontiera senza parlare di un deployment su scala data center — e perché il rilascio dei pesi, quando arriverà, è l'evento che conta più della chiave beta.
Dove Beam si posiziona nelle tabelle di Reflection
Ogni dato riportato di seguito è dichiarato dal fornitore, proviene dalle tabelle nel post di lancio di Reflection e nessuno di essi è stato riprodotto in modo indipendente. Laddove Reflection non ha pubblicato alcun numero per un modello, la cella riporta NR nell'originale. Le colonne di confronto sono di Reflection, non nostre né di terzi.
Sei un motore professionale di localizzazione software. Traduci il messaggio dell'utente in italiano. Il testo contiene marcatori di span numerati come {{1}}...{{/1}}, {{2}}...{{/2}}. Mantieni OGNI byte identico: stesse coppie di apertura/chiusura, stesso numero, stesso annidamento — non aggiungere, eliminare, rinumerare o cambiare mai i marcatori stessi, traduci solo il testo. PUOI spostare uno span {{n}}...{{/n}} dove la costruzione della lingua di destinazione lo richiede. Qualsiasi testo all'interno di un blocco {{KEEP}}...{{KEEP}} deve essere riprodotto ESATTAMENTE così com'è (non tradurlo). Preserva gli URL e i nomi di marchi/prodotti. Restituisci solo il testo tradotto con i marcatori — nessun preambolo, niente virgolette, nessuna spiegazione.
• Terminal-Bench v2.1 — Reflection Beam 80,1 rispetto a GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen 3.8-Max 86,6 e DeepSeek V4.1 Flash 90,6. Beam si colloca al di sotto di ognuno di essi.
• SWE-Bench Verified — Reflection Beam 80,9 contro Inkling 77,6 e Nemotron 3 Ultra 70,7. È qui che Beam appare più forte, ma nota che solo i due modelli più deboli della lista sono stati eseguiti su di esso.
• SWE-Bench Pro v1 — Reflection Beam 65,5 contro Qwen 3.8-Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Reflection Beam 77.2 contro Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9. Un divario di dieci punti dalla vetta della classifica.
• DeepSWE v1.1 — Reflection Beam 44,4 contro DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen 3.8-Max 51,0, GLM 5.2 44,0. Beam si posiziona allo stesso livello della generazione precedente e a trenta punti dal leader.
• SWE Atlas Codebase QnA — Reflection Beam 34.6 rispetto a Kimi K3 68.0 e GLM 5.3 61.0. Tenere a mente un grande repository nell'arco di una lunga interazione è la cosa più difficile di questo elenco, e il 34.6 di Beam non è una differenza di arrotondamento.
Ragionamento e scienza
• AIME 2026 — Reflection Beam 97.8 contro GLM 5.2 99.2 e Inkling 97.1.
• HLE senza strumenti — Reflection Beam 36,2 contro Kimi K3 46,9, Qwen 3.8-Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7. A metà classifica, e davanti solo ai due modelli della generazione precedente.
• GPQA Diamond — Reflection Beam 90,5 contro Kimi K3 93,5, Qwen 3.8-Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9.
• SciCode — Reflection Beam 49,7 contro GLM 5.3 59,0, Kimi K3 58,7, Qwen 3.8-Max 52,1, DeepSeek V4.1 Flash 52,0.
• CriPT AA — Reflection Beam 16.3 contro Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
Strumenti, ricerca e contesto lungo
• MCP Atlas — Reflection Beam 78,7 contro Qwen 3.8-Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8.
• AutomationBench, split pubblico — Reflection Beam 37,0 contro DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen 3.8-Max 39,8, GLM 5.2 26,2.
• tau3 banking — Reflection Beam 38.0 contro Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1.
• BrowseComp con gestione del contesto — Reflection Beam 77,4 contro Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.
• DeepSearchQA con gestione del contesto — Reflection Beam 80.1 contro Kimi K3 95.0.
• AA-LCR — Reflection Beam 79,3 contro Kimi K3 88,7, DeepSeek V4.1 Flash 84,0, Qwen 3.8-Max 80,3, GLM 5.3 79,7, Nemotron 3 Ultra 79,3, GLM 5.2 78,3, Inkling 77,3. Il recall a contesto lungo è l'unica riga delle capacità generali in cui Beam è davvero nella media.
Se si leggono le quattro tabelle insieme, emerge un quadro coerente: Beam batte i due modelli della generazione precedente nella lista di Reflection e perde contro quello attuale, su quasi ogni riga, con margini che vanno da piccoli a squalificanti. Un fornitore che pubblica tabelle che mettono il proprio modello in svantaggio su così tante righe è un buon segno riguardo all'onestà del laboratorio. Non è un segno che il modello sia all'avanguardia.

L'unica voce indipendente finora, e ciò che non dice
L'unica valutazione di terze parti agli atti è Artificial Analysis, che il 5 ottobre ha dichiarato che Reflection le aveva concesso l'accesso e che stava eseguendo benchmark indipendenti su Beam, aggiungendo che i primi indicatori suggeriscono che Beam sarà uno dei modelli aperti più efficienti in termini di token che abbia visto per il suo livello di intelligenza.
Questa è una dichiarazione significativa da parte dell'organizzazione il cui indice è quello che la maggior parte degli acquirenti legge davvero, ed è anche una dichiarazione senza un numero al suo interno. Da questa mattina non c'è alcuna riga Beam nella classifica di Artificial Analysis — le pagine del modello restituiscono 404 e il payload della classifica non contiene alcuna voce Beam — quindi l'affermazione sull'efficienza dei token è, per ora, una promessa da una terza parte che pubblicherà qualcosa. Niente nell'indice è stato ancora ricalcolato su Beam.
L'informativa sull'addestramento, che è la parte più forte della pubblicazione
La sezione di ingegneria del post di Reflection contiene numeri che la maggior parte dei laboratori tiene interni, e vale la pena annotarli perché sono la parte del rilascio che sarà ancora interessante tra un mese.
• Pre-addestramento — 23,8 trilioni di token curati su 6.144 chip NVIDIA GB300 in rack NVL72, completato end-to-end in meno di quattro settimane, con un goodput dichiarato del 92,3 per cento, e nove riavvolgimenti semi-automatici lungo il percorso attribuiti a picchi della norma del gradiente o a sospetta corruzione silenziosa dei dati.
• Apprendimento per rinforzo — 10.500 chip GB300 per quattro settimane, oltre 100 milioni di rollout, un contesto di rollout massimo di 256.000 token, circa 1,3 miliardi di sandbox e circa un milione di ambienti distinti reperiti per attività di coding, agentiche e STEM.
Serving — i nuovi pesi raggiungevano la flotta di inferenza in una mediana di circa 12 secondi, con la distribuzione gerarchica che riduceva del 75 per cento il traffico tra rack e rendeva l'adozione a livello di flotta 2,2× più rapida rispetto a ogni replica che scaricava i pesi da sé.
• Stabilità — gradienti di policy completamente asincroni che restano numericamente stabili quando apprendono da interazioni vecchie di un giorno, più una penalità di lunghezza controllabile per bilanciare la lunghezza del ragionamento rispetto al punteggio senza riaddestramento.
• Dati — circa il 95 per cento dei token grezzi di Internet eliminati tramite parsing, deduplicazione e curatela, con l'affermazione che i filtri convenzionali avrebbero tralasciato circa 1.800 miliardi dei token conservati da Reflection, compreso l'87 per cento dei suoi token curati di codice web.
Due righe meritano una segnalazione. Il post afferma che il midtraining estende il contesto effettivo di Beam a 1 milione di token, mentre la documentazione API elenca un limite di servizio di 256.000 token con una nota a piè di pagina in beta. Si tratta di una capacità lato addestramento e di un limite lato servizio, non di una contraddizione, ma il divario è esattamente ciò che diventa un titolo del tipo "contesto da 1M" se nessuno legge il secondo documento. E la cifra RL di oltre 100 milioni di rollout viene presentata come una delle più grandi esecuzioni del genere da parte di qualsiasi laboratorio aperto, il che è un'affermazione sulla scala, non su ciò che la scala ha prodotto — la curva punteggio-rispetto-ai-rollout è quella del fornitore stesso e si ferma dove il fornitore ha smesso di tracciarla.

Cosa puoi fare con Reflection Beam oggi
Una cosa: iscriviti alla lista d'attesa e, se ottieni una chiave, chiama Beam-501B-A23B tramite l'endpoint di Reflection con un client conforme al formato OpenAI. Non c'è un prezzo pubblicato, quindi non c'è modo di modellare il costo di un carico di lavoro su di esso. Non ci sono pesi, quindi niente self-hosting, niente quantizzazione e niente riproduzione da parte di terzi. Non esiste una riga di benchmark indipendente, quindi l'intero quadro delle prestazioni sopra si basa sulle tabelle di un singolo laboratorio.
Reflection Beam non è una delle nostre route, e non abbiamo intenzione di lasciar intendere che lo sia. Quello che possiamo darvi è il prezzo del segmento in cui sta cercando di entrare, letto in tempo reale dal nostro catalogo questa mattina: GLM 5.2 a 1,40 $ in input e 4,40 $ in output per milione di token, GLM 5.3 a 1,26 e 3,96, Qwen 3.8-Max a 2,00 e 6,00, e DeepSeek V4.1 Flash a 0,15 e 0,60. È un divario di oltre nove volte tra il più economico e il più caro, solo sull'input — ed è per questo che un modello beta senza prezzo di listino è davvero difficile da inserire in una decisione, per quanto possa apparire buono il suo grafico di efficienza.
OrcaRouter gestisce un'unica chiave compatibile con OpenAI su quei quattro e oltre 200 altri modelli, trasferendo il prezzo di listino del fornitore senza aggiungere nulla, così una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno, anziché quando un rivenditore aggiorna una tabella. Il failover automatico fa parte del routing anziché essere qualcosa da costruire attorno a ciascun fornitore, il che significa che un modello non collaudato — senza riproduzione, senza punteggio indipendente e senza prezzo — è esattamente il tipo di cosa che si mette su una quota di traffico invece che sul percorso critico.
Quando l'affermazione diventa verificabile
Tre cose lo decidono, e Reflection ne ha messe due entro il mese.
Il primo sono i pesi. Apache 2.0 più un rapporto tecnico permette a chiunque abbia un paio di nodi di misurare la cosa che conta — token al secondo per GPU a una soglia di qualità fissa, e se 23 miliardi di parametri attivi offrano davvero il punteggio per FLOP che il grafico lascia intendere. Fino ad allora l'argomento sull'efficienza è aritmetica su un tovagliolo, e chiunque lo ripeta non fa che ripetere la didascalia di Reflection.
Il secondo è un prezzo. Un modello senza prezzo di listino non ha posto in un confronto dei costi. Se Beam si colloca sopra la fascia di GLM e DeepSeek, la potenza di calcolo smette di contare per chiunque abbia un budget; se si colloca sotto, il quadro cambia rapidamente.
Il terzo è l'indice. Artificial Analysis ha detto che sta eseguendo benchmark su Beam e non ha pubblicato alcun numero. Quando quella riga apparirà, sarà il primo dato in questa storia che Reflection non ha calcolato.
Se oggi ti serve un coder agentico capace e devi sapere quanto costa, la risposta non è ancora Reflection Beam. Potrebbe esserlo tra tre settimane. Il modello su cui vale la pena scommettere quando si fa un'affermazione di efficienza è quello di cui puoi scaricare i pesi e contare da solo i FLOPs — e su questo test, Reflection ci ha dato una data e una lista d'attesa, non un modello.
Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
