Una hero card generata intitolata 'Reflection Beam vs Kimi K3' con il sottotitolo 'Lo stesso nome di benchmark, due harness differenti.' e tre chip statistiche che riportano 'Terminal-Bench 2.1: 80.1 vs 88.3', 'esecuzione indipendente: 85.0' e 'prezzo: non pubblicato vs $3 / $15'. Sotto sono presenti tre icone lineari flat: un portablocco con un segno di spunta, un righello che misura una barra e una lente d'ingrandimento su un grafico a barre. Il logo OrcaRouter è sovrapposto nell'angolo in basso a destra.
Guides & Insights

Reflection Beam vs Kimi K3: lo stesso nome di benchmark, due harness diversi

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Reflection Beam ottiene 80.1 su Terminal-Bench 2.1. Kimi K3 ottiene 88.3. Metti quelle due cifre una accanto all'altra, come ha fatto gran parte della copertura di questa settimana, e concludi che Beam è a circa otto punti dal miglior modello aperto del settore. Ma quei due numeri non provengono dalla stessa stanza. L'80.1 di Beam è dichiarato dal fornitore, preso dalla tabella nel post di lancio di Reflection stessa. L'88.3 di Kimi K3 è anch'esso dichiarato dal fornitore, questa volta dalla tabella di Moonshot — e la tabella di un fornitore riporta il punteggio del concorrente solo quando è stato eseguito sull'harness del fornitore stesso, con il suo set di prompt, alla sua impostazione di effort. Una terza parte, Artificial Analysis, ha nel frattempo eseguito Kimi K3 su un benchmark con lo stesso nome e pubblicato 85.0. Questo è un divario di 4.9 punti, non 8.2 — e la direzione della correzione è del tutto prevedibile, perché il numero che viene eroso è sempre quello che proviene dal laboratorio che ha qualcosa da dimostrare.

Questo è tutto il problema del confronto che il titolo di questo articolo promette, ed è il motivo per cui questo pezzo dedica la sua prima metà alla provenienza invece che ai punteggi. Reflection Beam è un modello sparse mixture-of-experts da 501 miliardi di parametri, con 23 miliardi di parametri attivi per token, annunciato il 5 ottobre 2026 da Reflection AI con un endpoint beta compatibile con OpenAI attivo lo stesso giorno. Kimi K3 è il modello open di punta di Moonshot AI, elencato nel nostro stesso catalogo con una data di rilascio del 15 luglio 2026 e valutato in modo indipendente da Artificial Analysis. Uno dei due è un prodotto già disponibile con un listino prezzi e un'esecuzione di harness di terze parti; l'altro è una beta in lista d'attesa i cui pesi, rapporto tecnico e prezzo non esistono ancora. Confrontarli non è un esercizio simmetrico, e fingere il contrario produrrebbe una pagina che sembra precisa ed è sbagliata.

La versione da 30 secondi

• Beam è più veloce per FLOP sulla carta, non ha un prezzo nella pratica e non è riprodotto. Kimi K3 è valutato da una terza parte, ha un prezzo di $3,00 per l'input e $15,00 per l'output per milione di token, ed è generalmente disponibile.

• Sull'unico benchmark su cui entrambi sono stati eseguiti — Terminal-Bench 2.1 — il divario reale è di circa cinque punti, non otto, quando i numeri di ciascuna parte provengono da un harness neutrale.

• I reali vantaggi di Beam sono strutturali, non numerici: un profilo di serving con 23B parametri attivi e una licenza Apache 2.0 promessa. Nessuno dei due è utilizzabile oggi.

• Se hai bisogno di un modello questa settimana, non è un lancio della monetina. È un modello già disponibile e una lista d'attesa.

Cosa ha effettivamente pubblicato Reflection, e contro chi

Il post di lancio di Reflection mette a confronto una scorecard con altri sette modelli: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max e DeepSeek V4.1 Flash. Ogni cifra nella tabella è dichiarata dal fornitore, nessuna è stata riprodotta in modo indipendente e non esiste una pagina di Artificial Analysis per Reflection Beam — la pagina del modello restituisce un 404 sul loro sito al 6 ottobre 2026. Diverse celle nell'originale sono contrassegnate NR perché il modello non è stato eseguito.

Ecco l'intera sezione Beam contro K3 di quella tabella, una riga per dimensione:

• Terminal-Bench 2.1 — Beam 80,1 vs Kimi K3 88,3

• SWE-Bench Pro v2-Hard — Beam 77,2 contro Kimi K3 88,2

• DeepSWE v1.1 — Beam 44,4 vs Kimi K3 68,0

• Domande e risposte sul codebase di SWE Atlas — Beam 34.6 vs Kimi K3 68.0

• HLE, senza strumenti — Beam 36.2 vs Kimi K3 46.9

• GPQA Diamond — Beam 90,5 contro Kimi K3 93,5

• SciCode — Beam 49,7 vs Kimi K3 58,7

• MCP Atlas — Beam 78.7 contro Kimi K3 82.3

• BrowseComp con gestione del contesto — Beam 77.4 vs Kimi K3 91.2

• DeepSearchQA con gestione del contesto — Beam 80.1 vs Kimi K3 95.0

Leggi quella lista con onestà e la forma del lancio emerge. Reflection non rivendica una vittoria su K3 da nessuna parte. Rivendica di posizionarsi vicino alla cima di un livello spendendo tre o quattro volte meno calcolo di inferenza rispetto a GLM 5.2 con punteggi di ragionamento comparabili — e l'unica riga in cui i due modelli sono vicini, Terminal-Bench 2.1, è la riga in cui il confronto è meno affidabile.

Perché il banco di prova conta più del punteggio

Un nome di benchmark è un'etichetta, non una specifica. Terminal-Bench 2.1 indica un particolare insieme di attività eseguite sotto uno specifico scaffold di agente, con una specifica politica di retry, uno specifico budget di token e una specifica impostazione di reasoning-effort. Due laboratori possono entrambi riportare onestamente un valore "Terminal-Bench 2.1" e produrre numeri non comparabili, perché lo scaffold e l'impostazione dell'effort sono dove risiede la maggior parte della varianza. Artificial Analysis esiste come organizzazione proprio per questo: esegue un unico harness, in un'unica configurazione, su molti modelli, così che i suoi numeri possano essere sottratti l'uno dall'altro.

Quindi l'80.1 che Reflection stampa per Beam è un numero di fornitore su un harness di fornitore, e l'88.3 che stampa per K3 è anche un numero di fornitore — il fornitore è Reflection, che misura il proprio concorrente. Quella seconda cifra è il numero meno affidabile della riga: un laboratorio che esegue i pesi di un rivale sul proprio scaffold non ha alcun incentivo a eseguirli nella configurazione migliore del rivale, né alcun obbligo di divulgare quella che ha scelto. Non c'è nulla di disonesto in questo; è semplicemente un numero la cui provenienza non supporta il peso che la copertura gli ha attribuito.

L'esecuzione di Artificial Analysis stessa ha Kimi K3 a 85.02 su Terminal-Bench 2.1, insieme a un 12.6 su Terminal-Bench v4.0 — un test diverso e più difficile — un AA Coding Index di 76.2 (rank 9 dei modelli nella classifica), un Intelligence Index di 43.6, GPQA Diamond 93.5, HLE 46.9, SciCode 59.5, tau-banking 45.98 e un Long-Context Recall di 88.7. Questi sono letti dalla scheda di catalogo di K3 nel nostro sistema, con fonte artificialanalysis.ai, con l'istantanea di valutazione datata 15 luglio 2026. Beam ha un numero nell'universo di quella lista e proviene da Reflection. Quell'assenza dovrebbe essere temporanea anziché permanente: Artificial Analysis ha detto che Reflection le ha dato accesso e che sta sottoponendo il modello a benchmark, e la sua stessa formulazione iniziale — che Beam "sarà uno dei modelli aperti più token-efficienti che abbiamo visto per il suo livello di intelligenza" — è una società di benchmark che segnala un'aspettativa, non riporta un risultato. Finché quel punteggio non viene pubblicato, i numeri di questo articolo non sono sottraibili, e non abbiamo intenzione di fingere il contrario.

A two-column infographic titled 'Reflection Beam vs Kimi K3 - the scoreboard'. The left column 'Reflection Beam' reads 'Terminal-Bench 2.1: 80.1 vendor', 'Context window: 256K beta', 'Input modality: text only', 'Price per 1M tokens: not published', 'Cache reads: none documented', 'AA Intelligence Index: none'. The right column 'Kimi K3' reads 'Terminal-Bench 2.1: 88.3 vendor, 85.0 independent', 'Context window: 1.05M', 'Input modality: text + image', 'Price per 1M tokens: 3.00 / 15.00', 'Cache reads: 0.30', 'AA Intelligence Index: 43.6'. A footer reads 'Beam figures vendor-reported and unreproduced; K3 figures per Artificial Analysis and MoonshotAI's published rate card.' The OrcaRouter logo is composited in the bottom-right corner.

Quanto costa ciascuno e che cosa è ciascuno

Il confronto dei costi non è nemmeno lontanamente equilibrato, e in realtà non è affatto un confronto, perché una delle sue parti è vuota.

• Prezzo — Kimi K3 $3,00 input / $15,00 output per milione di token, con letture dalla cache a $0,30, rispetto a Reflection Beam: nessun prezzo pubblicato da nessuna parte sul blog, sulla documentazione o sull'elenco dei modelli di Reflection, con la console della piattaforma dietro un muro di registrazione.

• Contesto — 1.048.576 token su Kimi K3 contro 256.000 sulla beta di Beam, con una nota a piè di pagina nella documentazione di Beam stessa che recita "la finestra di contesto potrebbe cambiare durante la beta".

• Modalità — Kimi K3 accetta testo e immagini; Reflection Beam è text-in, text-out, senza alcun percorso per immagini o audio al lancio.

• Disponibilità — Kimi K3 è generalmente disponibile da oggi; Reflection Beam è una beta con lista d'attesa, con i pesi promessi per più avanti in ottobre con licenza Apache 2.0.

• Punteggi indipendenti — K3 ha una riga completa di Artificial Analysis; Beam non ne ha nessuna.

• Profilo di servizio — Kimi K3 è un grande modello frontier tendenzialmente dense a 46,8 token di output al secondo, secondo la nostra misurazione effettuata sul nostro playground nell'ultima settimana; i 23B parametri attivi di Beam sono un autentico argomento architetturale a favore di una latenza inferiore e di un costo per token più basso, ma non esiste un endpoint aperto al pubblico su cui misurarlo.

L'affermazione sull'efficienza merita un'altra frase di cautela, perché è il titolo di lancio e sta facendo più lavoro di quanto possa sopportare. Il "da 3 a 4× meno calcolo per inferenza" di Reflection deriva da un grafico che approssima i FLOP come il doppio del numero di parametri attivi moltiplicato per il numero medio di token generati. Quella formula esclude deliberatamente il prefill del prompt, l'attenzione e l'overhead di servizio — le parti del conto che dominano il lavoro agentico a contesto lungo. È una stima approssimativa di un calcolo-rapporto, non una misurazione, non una cifra in dollari, ed è stata costruita dal fornitore. Trattala come un'ipotesi che i pesi permetteranno a qualcun altro di testare.

Dove si colloca OrcaRouter in questo

Kimi K3 è una delle nostre route. È listato a $3.00 in input e $15.00 in output per milione di token, con le letture della cache a $0.30, che è la tariffa del provider Moonshot passata così com'è senza aggiungere nulla — quindi se Moonshot cambia il suo listino, la cifra sulla nostra pagina cambia lo stesso giorno, non quando un rivenditore decide di aggiornare. È richiamabile da una sola chiave compatibile con OpenAI insieme ad altri oltre 200 modelli, il che qui conta per un motivo specifico: la risposta onesta a "Beam o K3?" è che un team che si copre non dovrebbe scegliere. Poiché il failover automatico fa parte del routing invece di essere qualcosa che costruisci tu, un modello come Beam — beta, senza prezzo, non valutato da alcuna terza parte — è esattamente ciò che metti su una quota di traffico invece che sul tuo percorso critico. Instradi il lavoro su K3 per impostazione predefinita, mandi a Beam una fetta quando arriva il tuo invito dalla lista d'attesa, e lasci che il routing ripieghi su K3 in caso di errore. Questa è una decisione che puoi prendere su un modello non collaudato. Scommettere un percorso di produzione su uno di essi non lo è.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the model name, a 1,048,576-token context, text and image input, tool and reasoning support, and pricing of $3.00 input and $15.00 output per million tokens with an 8.63 s median time to first token.

Che cosa cambierebbe questo verdetto?

Tre cose, in ordine decrescente di quanto contano.

Un prezzo. Se Beam si posizionasse al di sotto del livello K3, l'argomento sull'efficienza diventerebbe concreto invece che teorico. Secondo, i pesi. Apache 2.0 più un rapporto tecnico permetterebbero a chiunque disponga di un paio di nodi di misurare i token al secondo per GPU a una soglia di qualità fissa — il test che di fatto dirime una rivendicazione di calcolo. Terzo, un'esecuzione di benchmark da parte di terzi. Reflection ha concesso ad Artificial Analysis l'accesso e da ciò è atteso un punteggio; finché quel numero non viene pubblicato, ogni cifra Beam-contro-K3 in circolazione risale a un documento scritto da uno dei due fornitori.

Due domande a cui vale la pena rispondere direttamente

Reflection Beam è migliore di Kimi K3?

Alla luce delle prove disponibili oggi, no — e nessuno ha pubblicato prove che lo sia. La tabella di Reflection stessa vede K3 in vantaggio su tutte e dieci le righe condivise sopra, diverse delle quali con margini (SWE Atlas 34.6 vs 68.0, DeepSearchQA 80.1 vs 95.0) tutt'altro che risicati. La tesi di Beam è il costo per unità di capacità, e quella tesi resta un grafico disegnato dal fornitore finché non esistono i pesi e un prezzo.

Dovrei aspettare i pesi di Beam prima di costruire su K3?

Solo se l'auto-hosting è un requisito anziché una preferenza, perché quello è l'unico asse su cui i due non sono sostituti — K3 è solo API mentre Beam promette pesi Apache 2.0. Se stai chiamando un'API, K3 è disponibile, valutato e con un prezzo, mentre Beam è una lista d'attesa. Non esiste una versione di quella decisione per cui valga la pena ritardare un progetto.

A screenshot of the OrcaRouter models index page, showing the filter rail for input modality, context length, input price, status and series alongside a model grid headed '207 models, 16 providers, one API key, one bill' and a three-step panel explaining how to call any model through the OpenAI-compatible endpoint.

Reflection ci ha dato una data e un grafico, e una data non è un modello. L'unica cosa che il lancio stabilisce davvero è che un modello da 501B che attiva 23B parametri può essere addestrato a posizionarsi entro pochi punti dalla frontiera aperta — il che, se i pesi arrivano e i numeri reggono, è un risultato significativo in termini di efficienza. Non è ancora un motivo per spostare il lavoro da un modello che una terza parte ha effettivamente misurato.