
Reflection Beam, spiegato: 501B parametri, 23B attivi e pesi non ancora rilasciati
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 145 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 128 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 183 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il 5 ottobre 2026 Reflection ha annunciato Reflection Beam, un modello linguistico sparse mixture-of-experts con 501 miliardi di parametri totali che ne attiva 23 miliardi per token, e lo stesso giorno ha reso disponibile un endpoint beta compatibile con OpenAI. Si tratta del 4,6 per cento del modello attivo in qualsiasi momento — un rapporto aggressivo persino secondo gli standard dell'attuale panorama open-weight — ed è il numero su cui si regge l'intero lancio. Reflection afferma che i pesi completi, un rapporto tecnico e una model card arriveranno più avanti questo mese con licenza Apache 2.0. A oggi non sono qui, nessun prezzo è stato pubblicato sui canali proprietari di Reflection, e Artificial Analysis non ha alcuna riga per il modello. Quindi il riassunto onesto del lancio è questo: un'affermazione molto specifica sull'efficienza, fatta dal laboratorio che ha addestrato il modello, con ogni numero a supporto fornito da quel laboratorio.
Le tabelle di confronto di Reflection mettono Reflection Beam contro Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max e DeepSeek V4.1 Flash, il che offre un quadro fedele del livello a cui punta: modelli aperti e semi-aperti forti ma non all'avanguardia, diversi dei quali sono una frazione delle dimensioni di Beam. Beam non batte quel campo sulla capacità grezza, e vi mostreremo esattamente dove perde. Ciò che sostiene di fare è collocarsi vicino alla vetta, spendendo all'incirca tre o quattro volte meno calcolo inferenziale di GLM 5.2 a punteggi di ragionamento comparabili. Questa è la tesi dell'articolo.
Cosa esiste effettivamente oggi
Tutto in questa sezione proviene dalla documentazione di Reflection, consultata il 6 ottobre 2026. L'API è attiva in beta, accessibile tramite lista d'attesa; i pesi non sono ancora disponibili.
• ID modello — Beam-501B-A23B, creato il 5 ottobre 2026.
• Interfaccia — una superficie compatibile con OpenAI su api.reflection.ai/openai/v1, che espone Chat Completions e l'elenco Models, e nient'altro. Niente Completions, niente embeddings, niente batches.
• Contesto — 256.000 token, con una nota a piè di pagina allegata alla cifra stessa: «La finestra di contesto potrebbe cambiare durante la beta». L'output massimo è 128.000 token.
• Ragionamento — un parametro reasoning_effort con cinque valori: low, medium, high, xhigh e max. Il valore predefinito è medium e il modello ragiona sempre indipendentemente dall'impostazione — non esiste un interruttore per disattivarlo.
• Modalità — testo in input, testo in output. Nessun input di immagini o audio al lancio, il che è una vera differenza rispetto a Inkling, il modello che mette la multimodalità al primo posto che Thinking Machines di Mira Murati ha rilasciato a luglio.
• Limite delle conoscenze — 30 giugno 2026.
• Prezzo — non pubblicato. Il post sul blog di Reflection, la sua documentazione e il suo elenco dei modelli lo omettono tutti, e la console della piattaforma si trova dietro una barriera di registrazione.
Quell'ultima riga conta più di quanto sembri. Ogni altro modello nel set di confronto di Beam ha un prezzo di listino pubblico che oggi puoi inserire in un foglio di calcolo. Beam no, il che significa che qualsiasi argomentazione sui costi che lo riguardi in questo momento è un'argomentazione sulla potenza di calcolo, non sui dollari.

Il rapporto 501 a 23 è l'argomento
La sparsità non è una novità; la questione è fino a che punto un laboratorio sia disposto a spingerla. GLM 5.2 utilizza circa 40 miliardi di parametri attivi su un totale riportato nell'ordine dei 744 miliardi — circa il 5,4 per cento. Reflection Beam si attesta al 4,6 per cento su 501 miliardi. Sulla carta si tratta di un ulteriore passo modesto, e Reflection è prudente su ciò che rivendica al riguardo.
Il dato di efficienza nel post di lancio proviene da un grafico costruito sui dati di Artificial Analysis e DataCurve, che mette in relazione il punteggio di ragionamento con i FLOPs di inferenza stimati, dove i FLOPs sono approssimati come due volte il numero di parametri attivi moltiplicato per il numero medio di token generati. Questa formula esclude deliberatamente il prefill del prompt, il costo dell'attenzione e l'overhead di servizio. È un modello a spanne, non una misurazione, e Reflection non lo presenta come tale — ma è anche l'unico supporto quantitativo per l'affermazione "da 3 a 4 volte più economico a parità di punteggio", ed è stato scritto dal fornitore. Trattalo come un'ipotesi che i pesi, quando saranno rilasciati, permetteranno a qualcun altro di testare.
Ciò che l'architettura offre in pratica è un profilo di servizio. Ventitré miliardi di parametri attivi sono un modello che si può eseguire su un numero relativamente ridotto di GPU con latenza interattiva, ed è un prodotto diverso da un modello denso da 501 miliardi di parametri, anche se il conteggio dei parametri sulla scheda è lo stesso. È il motivo per cui Reflection può parlare di ragionamento vicino alla frontiera senza parlare di un'implementazione su scala di data center.
Meno di quattro settimane per il pre-addestramento, e la divulgazione è insolitamente specifica
Il resoconto dell'addestramento è la parte della pubblicazione che si legge come davvero informativa, perché Reflection ha pubblicato numeri che la maggior parte dei laboratori tiene interni.
• Pre-training — 23,8 trilioni di token su 6.144 chip GB300 in rack NVL72, completato in meno di quattro settimane con un goodput dichiarato del 92,3 per cento, con nove riavvolgimenti dai checkpoint lungo il percorso.
• Apprendimento per rinforzo — 10.500 chip GB300 per quattro settimane, più di 100 milioni di rollout, contesto massimo di rollout di 256.000 token, all'incirca 1,3 miliardi di sandbox e circa un milione di ambienti distinti, con una media di 110.000 rollout in esecuzione simultanea.
• Addestramento intermedio — estende il contesto effettivo del modello a 1 milione di token.
• Stabilità — gradienti di policy asincroni che restano stabili con un'obsolescenza su scala di giorni, più una penalità di lunghezza controllabile così che la lunghezza del ragionamento possa essere regolata senza riaddestramento.
Leggi insieme le linee del pre-training e del RL e appare la forma dell'affermazione. La storia dell'efficienza non riguarda solo i parametri attivi in inferenza; riguarda anche la velocità con cui il modello è stato addestrato e quanta parte del calcolo è andata nel RL vincolato all'ambiente invece che in più token. Un milione di ambienti e 1,3 miliardi di sandbox sono una dichiarazione sull'infrastruttura di addestramento per l'uso di strumenti e di tipo agentico, ed è coerente con i benchmark con cui Reflection ha scelto di aprire.
Un numero merita un avvertimento. Il blog dice che il midtraining estende l'effettivo contesto a 1 milione di token; la documentazione API elenca un limite di serving di 256.000 token con una nota beta allegata. Si tratta di una capacità lato addestramento e di un limite lato serving, non una contraddizione — ma il divario è esattamente il tipo di cosa che diventa un titolo "contesto da 1M" se nessuno legge il secondo documento, e chiunque scriva di Beam la prossima settimana dovrebbe leggere il secondo documento.

Benchmark: dove Reflection Beam vince e dove no
Ogni cifra riportata di seguito è dichiarata dal fornitore, proviene dalle tabelle nel post di lancio di Reflection e nessuna di esse è stata riprodotta in modo indipendente. Le colonne di confronto contengono gli stessi numeri che Reflection ha pubblicato per gli altri modelli; dove nell'originale una cella mostra "NR", il modello non è stato eseguito. Non esiste una riga di Artificial Analysis per Beam, quindi nulla di quanto riportato qui è passato attraverso un harness di terze parti.
Programmazione agentica
• Terminal-Bench v2.1 — Beam 80,1 vs GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.
• SWE-Bench Pro v1 — Beam 65,5 contro Qwen3.8 Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Beam 77,2 contro Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9.
• SWE-Bench Verified — Beam 80,9 contro Inkling 77,6, Nemotron 3 Ultra 70,7.
• SWE-Bench Multilingual — Beam 78,0 vs Nemotron 3 Ultra 67,7.
• DeepSWE v1.1 — Beam 44.4 contro DeepSeek V4.1 Flash 74.2, Kimi K3 68.0, GLM 5.3 61.0, Qwen3.8 Max 51.0, GLM 5.2 44.0.
• SWE Atlas Codebase QnA — Beam 34,6 vs Kimi K3 68,0, GLM 5.3 61,0.
Quell'ultima riga è quella su cui soffermarsi. La risposta a domande su repository a lungo orizzonte è il campo in cui un modello deve tenere a mente una codebase attraverso una lunga interazione, e un 34,6 contro 68,0 non è una differenza di arrotondamento. DeepSWE racconta una storia simile: 44,4 mette Beam allo stesso livello di GLM 5.2 e molto indietro rispetto a DeepSeek V4.1 Flash.
Ragionamento Sei un motore professionale di localizzazione software. Traduci il messaggio dell'utente in italiano. Il testo contiene marcatori span numerati come {{1}}...{{/1}}, {{2}}...{{/2}}. Mantieni OGNI marcatore byte per byte: stessi numeri, stesse coppie di apertura/chiusura, stesso conteggio, stesso annidamento — non aggiungere, omettere, rinumerare o riordinare mai i marcatori stessi, traduci solo il testo TRA di essi. PUOI spostare uno span {{n}}...{{/n}} ovunque lo richieda l'ordine delle parole della lingua di destinazione. Qualsiasi testo all'interno di uno span {{KEEP}}...{{/KEEP}} deve essere riprodotto ESATTAMENTE così com'è (non tradurlo). Preserva gli URL e i nomi di marchi/prodotti. Restituisci SOLO il testo tradotto con i suoi marcatori — nessun preambolo, niente virgolette, nessuna spiegazione.
• AIME 2026 — Beam 97,8 vs GLM 5.2 99,2, Inkling 97,1.
• HLE, senza strumenti — Beam 36.2 vs Kimi K3 46.9, Qwen3.8 Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7.
• GPQA Diamond — Beam 90,5 contro Kimi K3 93,5, Qwen3.8 Max 92,6, GLM 5.3 91,7, GLM 5.2 91,2, DeepSeek V4.1 Flash 90,9, Inkling 87,2, Nemotron 3 Ultra 87.
• SciCode — Beam 49.7 vs GLM 5.3 59.0, Kimi K3 58.7, Qwen3.8 Max 52.1, DeepSeek V4.1 Flash 52.0, Inkling 46.1, Nemotron 3 Ultra 44.6.
• CriPT AA — Beam 16.3 vs Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
Il profilo di ragionamento di Beam è nella media, e lo schema è coerente: nettamente davanti ai due modelli della generazione precedente nella lista di Reflection, dietro a quello attuale. GPQA Diamond a 90,5 è un punteggio solido che altri quattro modelli superano.
Uso degli strumenti e ricerca
• MCP Atlas — Beam 78,7 vs Qwen3.8 Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8, Inkling 76,0, Nemotron 3 Ultra 63,1.
• AutomationBench, split pubblico — Beam 37. DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2.
• tau3 banking — Beam 38.0 vs Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6.
• BrowseComp con gestione del contesto — Beam 77,4 vs Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.
• DeepSearchQA con gestione del contesto — Beam 80.1 vs Kimi K3 95.0.
Reflection ha inoltre mostrato nel post due demo di capacità: un tasso di risoluzione del 95,5 per cento sul puzzle "Land or Water", una griglia 180x90 con 16.200 punti che richiede di mantenere uno stato della scacchiera ampio — una cifra che si colloca tra il 92,5 e il 97,8 per cento che Reflection attribuisce a Opus 5 e Fable 5 sullo stesso compito — e un fine-tuning Text2SQL del più piccolo Gemma-4 che ha portato l'accuratezza held-out al 66,5 per cento. Le demo sono curate; mostrano che il modello è in grado di fare una cosa, non con quale frequenza.
Cosa puoi farci oggi e su cosa non dovresti basare i tuoi piani
Oggi, in generale è possibile esattamente una cosa: richiedere l'accesso beta e chiamare Beam-501B-A23B tramite l'endpoint di Reflection con un client in stile OpenAI. Non c'è un prezzo pubblicato, quindi non c'è modo di modellare il costo di un carico di lavoro su di esso. Non ci sono pesi, quindi non c'è self-hosting, né quantizzazione, né fine-tuning, né riproducibilità da parte di terzi. Non esiste una riga di benchmark indipendente, quindi l'intero quadro delle prestazioni sopra si basa sulle tabelle di un solo laboratorio.
Reflection Beam non è una delle nostre route. Non abbiamo intenzione di insinuare il contrario, né di indirizzarvi verso un rivenditore che potrebbe averlo. Quello che possiamo dirvi è quanto costa il set di confronto, perché quattro di quei modelli li instradiamo noi e le cifre qui sotto sono lette in tempo reale dal nostro catalogo stamattina: GLM 5.2 a 1,40 $ in ingresso e 4,40 $ in uscita per milione di token, GLM 5.3 a 1,26 $ e 3,96 $, Qwen3.8 Max a 2,00 $ e 6,00 $, e DeepSeek V4.1 Flash a 0,15 $ e 0,60 $. È una differenza reale — DeepSeek V4.1 Flash costa quasi dieci volte meno in ingresso di GLM 5.2 — ed è il motivo per cui un modello beta senza prezzo è difficile da inserire in una decisione. OrcaRouter funziona con una sola chiave compatibile con OpenAI su questi e oltre 200 altri modelli con il prezzo di listino del fornitore passato così com'è e nulla di aggiunto, il che significa che una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno, invece di quando un rivenditore aggiorna i suoi dati. E poiché il failover automatico fa parte del routing invece di essere qualcosa che devi costruire, un modello nuovo e non collaudato è il tipo di cosa che puoi mettere su una quota di traffico invece che sul tuo percorso critico — che è l'unico modo responsabile di usare qualcosa i cui benchmark nessuno ha ancora riprodotto.

Cosa tenere d'occhio prima di prendere sul serio l'affermazione di efficienza
Tre cose risolveranno la questione, e due di queste sono promesse entro il mese.
Il primo sono i pesi. Apache 2.0 e un rapporto tecnico permetterebbero a chiunque disponga di un paio di nodi di misurare la cosa che conta davvero — token al secondo per GPU a una soglia di qualità fissa, e se 23 miliardi di parametri attivi riescano davvero a fornire il punteggio per FLOP che il grafico lascia intendere. Fino ad allora, l'argomento dell'efficienza è aritmetica su un tovagliolo.
Il secondo è un prezzo. Un modello senza prezzo di listino non ha posto in un confronto dei costi, e se Beam si posiziona al di sopra della fascia di GLM e DeepSeek, la questione della potenza di calcolo smette di contare per chiunque abbia un budget. Se si posiziona al di sotto, il quadro cambia rapidamente.
Il terzo è una terza parte che esegue la suite. Ogni numero sopra riportato proviene dallo stesso documento, e una tabella dichiarata dal fornitore che mette il proprio modello dietro in sette righe su sedici è un buon segno riguardo all'onestà del laboratorio — ma resta comunque un solo laboratorio, un solo harness, un solo insieme di prompt.
Se oggi ti serve un programmatore agentico capace e devi sapere quanto costa, la risposta non è ancora Reflection Beam. Potrebbe esserlo tra tre settimane. Il modello su cui vale la pena scommettere una promessa di efficienza è quello di cui puoi scaricare i pesi e di cui puoi contare i FLOP da solo — e su questa prova, Reflection ci ha dato una data e non un modello.
Confrontati in questo articolo4
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
