
Reflection Beam vs Claude Opus 5.5: Uno che puoi chiamare oggi, uno per cui devi aspettare
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 150 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Reflection Beam e Claude Opus 5.5 non sono ancora davvero rivali, e il motivo è amministrativo più che tecnico. Beam, il primo modello di Reflection, è stato annunciato il 5 ottobre 2026 ed è un modello sparse mixture-of-experts da 501 miliardi di parametri che attiva 23 miliardi di parametri per token — ma è raggiungibile solo tramite una lista d'attesa, i suoi pesi sono promessi per la fine di questo mese con licenza Apache 2.0, e nessun prezzo è stato pubblicato da nessuna parte. Opus 5.5 è stato rilasciato il 22 settembre 2026 come flagship di Anthropic: una finestra da 1 milione di token, input di testo, immagini e file, e un prezzo di listino di $4,00 per milione di token in input e $20,00 per milione in output. Quindi la versione onesta di questo confronto è che uno di questi modelli puoi metterlo in produzione questo pomeriggio con un costo noto, e l'altro no — e tutto il resto qui è una proiezione su ciò che accadrà quando arriveranno i pesi.
La risposta breve
Se la domanda è quale modello su cui costruire questa settimana, è Opus 5.5 senza troppi dibattiti: è disponibile a livello generale, valutato in modo indipendente, multimodale, con un prezzo definito e servito tramite un'API che puoi chiamare in cinque minuti. La tesi di Beam non si fonda sul superare Opus 5.5 — nulla nel materiale di Reflection stesso afferma che lo faccia. Si basa su una proposizione molto più ristretta: che a un dato punteggio di ragionamento, Beam consuma circa un quarto del calcolo di inferenza. Se ciò regge quando qualcuno al di fuori di Reflection lo misura, Beam diventa interessante per lavori ad alto volume in cui la risposta deve essere buona ma non la migliore. In caso contrario, Beam è un modello aperto di fascia media con una lista d'attesa.
Quanto segue separa le parti di questo confronto che oggi sono fatti dalle parti che sono scommesse.
Che cosa è ciascun modello, precisamente
Opus 5.5 è il successore chiuso e ospitato di Claude Opus 5, posizionato da Anthropic per modifiche a più passaggi su grandi basi di codice, revisione del codice e lunghe sessioni autonome. Accetta testo, immagini e file, restituisce testo, offre una finestra di contesto di 1.000.000 di token con fino a 128.000 token di output ed espone il pensiero esteso con uno sforzo di ragionamento configurabile. Non è open weights, e la sua conoscenza è limitata dal cutoff di addestramento di Anthropic piuttosto che da qualcosa che controlli tu.
Reflection Beam è la costruzione opposta. Ha 501 miliardi di parametri totali con 23 miliardi attivi — circa il 4,6 per cento del modello sveglio per token, un rapporto aggressivo persino rispetto al circa 5,4 per cento di GLM 5.2 — ed è stato costruito per essere economico da servire anziché economico da addestrare. È solo testo. Il suo contesto API è di 256.000 token, con una nota che avverte che la cifra potrebbe cambiare durante la beta, e il suo output massimo è di 128.000 token. L'endpoint è compatibile con OpenAI all'indirizzo api.reflection.ai/openai/v1 ed espone Chat Completions più un elenco Models e nient'altro. Il suo parametro reasoning_effort accetta cinque valori, il valore predefinito è medium, e non può essere disattivato.
• Prezzo — Claude Opus 5.5 $4,00 in input e $20,00 in output per milione di token, con letture dalla cache a $0,20 e scritture in cache a $5,00, a fronte di Reflection Beam: non pubblicato sul post del blog, sulla documentazione né nell'elenco dei modelli.
• Disponibilità — Opus 5.5 è generalmente disponibile da oggi; Beam è una lista d'attesa per una beta, con i pesi, il report tecnico e la model card promessi più avanti questo mese.
• Modalità — Opus 5.5 accetta testo, immagini e file; Beam accetta solo testo.
• Contesto — 1,000,000 token rispetto a 256,000, con il numero di Beam che comporta un'avvertenza beta.
• Pesi aperti — no per Opus 5.5, promessi con licenza Apache 2.0 per Beam, non ancora rilasciati.
• Punteggio indipendente — Opus 5.5 ne ha uno; Beam no.

Il prezzo è la parte che non regge il confronto
I $4,00 e i $20,00 di Opus 5.5 sono la tariffa di listino del fornitore e, sul nostro catalogo, vengono riportati invariati senza alcun ricarico. Le letture della cache a $0,20 e le scritture della cache a $5,00 contano enormemente per il carico di lavoro a cui è destinato Opus 5.5: una lunga sessione agentica che rilegge lo stesso codebase da 200.000 token turno dopo turno paga la tariffa della cache su quasi tutto, non quella di input. È una leva reale e spesso sottovalutata, e vale la pena modellarla prima di concludere che un modello frontier sia fuori budget.
Beam non ha un numero comparabile. Non c'è un prezzo di listino con cui confrontarsi, nessun livello di cache da modellare e nessuna tariffa pubblicata per la beta. Reflection non ha detto se Beam sarà venduto per token, misurato per utente o regalato insieme ai pesi. Chiunque oggi citi un costo per milione per Beam se lo sta inventando.
La conseguenza pratica: il confronto dei prezzi non è "Opus 5.5 è caro e Beam costa meno". È "uno dei due ha un prezzo e l'altro ha una data". Per un team che deve decidere oggi, questa asimmetria pesa più dei benchmark.
Benchmark: i due numeri che si sovrappongono, e perché non sono confrontabili
Le tabelle di lancio di Reflection non includono Opus 5.5, né alcun modello chiuso di frontiera. Il suo insieme di confronto è interamente open o semi-open: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max e DeepSeek V4.1 Flash. Quindi qualsiasi tabella Beam contro Opus deve essere assemblata a mano, e assemblarla onestamente significa dichiarare le differenze dell'harness invece di appianarle.
Esistono esattamente due benchmark in cui entrambi i modelli hanno un valore pubblicato, e nessuno dei due abbinamenti è controllato.
• Humanity's Last Exam — Reflection riporta Beam a 36.2 senza strumenti; Artificial Analysis registra Opus 5.5 a 61.4. Due harness diversi, due configurazioni diverse — il valore di Opus 5.5 non è etichettato come senza strumenti — e un divario di venticinque punti che dice meno sui modelli che sull'impostazione.
• SciCode — Reflection riporta Beam a 49,7; Artificial Analysis registra 66,9 per Opus 5.5. Stesso benchmark, stesso problema: una cifra deriva dall'esecuzione del fornitore stesso, l'altra da un harness di terze parti.
Tutto il resto non si sovrappone affatto. La tabella di Beam è costruita su Terminal-Bench v2.1, mentre l'attuale indice di Artificial Analysis utilizza Terminal-Bench 4.0 — una versione diversa della stessa suite, ed è per questo che l'80,1 di Beam e il 59,6 di Opus 5.5 su quella classifica non costituiscono un confronto e non dovrebbero mai essere stampati uno accanto all'altro. Nell'indice vero e proprio, Artificial Analysis colloca Opus 5.5 a 57,6 nella configurazione Max / Default Fallback, quarto posto tra i 147 modelli di quella rilevazione. Beam non ha alcuna riga nell'indice: le pagine del modello restituiscono 404 e la classifica non contiene alcuna voce Beam da stamattina.
L'unica dichiarazione davvero indipendente su Beam resa pubblica è quella di Artificial Analysis, che il 5 ottobre ha detto che Reflection le aveva concesso l'accesso e che stava valutando il modello in modo indipendente — e che i primi indicatori suggeriscono che Beam sarà uno dei modelli aperti più efficienti in termini di token che abbia mai visto per il suo livello di intelligenza. È una frase forte, proveniente dalla fonte giusta, e resta comunque una frase senza un numero. È il numero che deciderà questo confronto.

Dove l'affermazione sull'efficienza fa davvero presa
L'argomento di Reflection non è che Beam sia più intelligente di un modello di frontiera. È che Beam ottiene punteggi paragonabili a GLM 5.2 usando da 3 a 4 volte meno calcolo di inferenza, e che il divario si allarga rispetto ai modelli della famiglia da 2 bilioni di parametri in cui si colloca Qwen 3.8-Max. Il grafico che lo accompagna stima i FLOP generati come il doppio del numero di parametri attivi moltiplicato per il numero medio di token generati per tentativo, e la sua stessa didascalia ammette che questo esclude il prefill del prompt, l'attenzione e l'overhead di serving.
Prendetela alla lettera e il bersaglio interessante non è affatto Opus 5.5 — è la fascia media del mercato. Opus 5.5 compete sulla capacità per attività e vince sui compiti che richiedono giudizio: refactoring a più passaggi, revisione del codice, lavori in cui una risposta sbagliata costa più dei token. Un modello attivo al 4,6 per cento per token compete sul costo per attività e vince dove domina il volume e l'asticella della qualità è «abbastanza buono e verificato a valle». Quelli sono prodotti diversi, e un confronto che mette Beam contro Opus 5.5 su un'unica classifica misura la cosa sbagliata.
C'è un effetto di secondo ordine che vale la pena nominare. Se l'affermazione di efficienza di Beam regge, il suo posto naturale è il tipo di carico di lavoro in cui altrimenti spenderesti i token di un modello di frontiera per un compito per cui è sovraqualificato. Questa è una decisione di instradamento, non una scelta di modello, ed è il motivo per cui qui la questione del prezzo conta più della questione del benchmark: non puoi instradare in base al costo verso un modello che non ha costo.
Eseguendoli fianco a fianco, quando Beam è invocabile
Opus 5.5 è oggi nel nostro catalogo a $4,00 e $20,00 per milione di token, prezzo di listino passato senza aggiungere nulla, e si affianca a oltre 200 altri modelli dietro un'unica chiave compatibile con OpenAI su api.orcarouter.ai/v1. Se volessi fare un A/B di un carico di lavoro tra un modello di frontiera e uno open economico, questa è la forma della configurazione: due ID modello, una chiave, nessun secondo contratto e nessuna modifica al codice — e il failover automatico nel routing significa che un provider che ha un pomeriggio storto non si porta via la tua pipeline.
Beam non può ancora farne parte, e non fingeremo il contrario. Reflection Beam non è una delle nostre rotte, e non ti indirizzeremo verso chiunque potrebbe rivenderlo. Quando i pesi saranno rilasciati con licenza Apache 2.0, potrai ospitarlo da solo e instradare verso il tuo endpoint; fino ad allora l'unica via è la lista d'attesa di Reflection.
Per un carico di lavoro in cui serve davvero un modello di frontiera, il confronto da fare non è con Beam. È con tutto il resto del catalogo: GLM 5.3 a $1.26 e $3.96, Qwen 3.8-Max a $2.00 e $6.00, e DeepSeek V4.1 Flash a $0.15 e $0.60, tutti letti in tempo reale stamattina. È il segmento in cui Beam si collocherà se applica prezzi competitivi, e è un vicinato molto più ostico di quanto lasci intendere il grafico di lancio.

Che cosa cambierebbe questo verdetto?
Tre cose, in ordine di quanto conterebbero.
Una riga di Artificial Analysis per Beam. Non l'annuncio che ne sta arrivando una — la riga. Se l'indice si posiziona vicino al 57,6 di Opus 5.5 mentre l'affermazione sull'efficienza dei token sopravvive al contatto con un harness di terze parti, la fascia media del mercato diventa davvero scomoda e Beam diventa la scelta predefinita per molti lavori ad alto volume. Se si posiziona più vicino al cluster open-weights, nella bassa quarantina, Beam è un modello solido ed economico e niente di più.
Un prezzo. Un modello senza prezzo di listino non può vincere un'argomentazione sui costi, perché non c'è nulla da confrontare. Se Beam si posiziona sotto la fascia di GLM 5.3, la storia dell'efficienza diventa molto rapidamente una storia di budget. Se si posiziona sopra i $0.15 e $0.60 di DeepSeek V4.1 Flash senza un vantaggio in termini di capacità, faticherà a conquistare il lavoro ad alto volume per cui è stato costruito.
I pesi. Finché non esistono, "open-weight" è un'affermazione su una licenza che non è stata concessa, e nessuno può verificare l'aritmetica FLOPs-per-score rispetto a un modello che si possa effettivamente eseguire. Questa è la verifica che Reflection ha invitato a fare e non ha ancora abilitato.
Finché almeno uno di questi non si concretizza, la scelta pratica non è nemmeno in discussione. Opus 5.5 è il modello su cui puoi ragionare, calcolare i costi e fare affidamento per andare in produzione. Beam è il modello che tieni d'occhio.
Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
