Hero card generata con titolo "Step 5 Preview vs K2 Horizon 375B A23B" e sottotitolo "Vicini nel punteggio, lontani nelle prove". La colonna di sinistra "Step 5 Preview" riporta: AA Index 44, mediana 26; StepFun, annunciato il 20 settembre 2026; circa 600B totali / 27B attivi; contesto 1M token; input testo e immagini; $1,00 in / $2,70 out per 1M; pesi chiusi fino al 15 ottobre 2026. La colonna di destra "K2 Horizon 375B A23B" riporta: AA Index 31, mediana 18; MBZUAI IFM, rilasciato il 3 settembre 2026; 375B totali / 23B attivi; contesto 524K token; solo testo; nessun prezzo API pubblicato; Apache 2.0 con codice di training e log. Un footer recita: "Valori dell'indice secondo Artificial Analysis; specifiche secondo ciascun fornitore."
Guides & Insights

Step 5 Preview vs K2 Horizon 375B A23B: vicini sul punteggio, lontani sulle prove

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due modelli di punta quasi aperti, a diciassette giorni di distanza, sull'unica classifica indipendente che li ha valutati entrambi — e il punteggio più basso appartiene al modello con il percorso di evidenze più aperto. K2 Horizon 375B A23B, rilasciato il 3 settembre 2026 dall'Institute of Foundation Models di MBZUAI con licenza Apache 2.0, ottiene 31 sull'Artificial Analysis Intelligence Index contro una mediana di 18 nella sua classe di confronto open-weights, con 375 miliardi di parametri totali e 23 miliardi di parametri attivi e una finestra di contesto di 524K token. Step 5 Preview, annunciato da StepFun il 20 settembre 2026, ottiene 44 sullo stesso indice con circa 600 miliardi di parametri totali e 27 miliardi di parametri attivi e una finestra di contesto di 1M token, al prezzo di 1,00 $ per milione di token in input e 2,70 $ per milione di token in output. Sulle capacità i due sono abbastanza vicini — tredici punti su una scala in cui l'attuale leader dell'indice si colloca nella fascia alta dei cinquanta — che il punteggio non è il motivo per scegliere l'uno o l'altro. Sull'accesso e sulle evidenze non sono affatto vicini: uno è un download con le sue ricette di addestramento pubblicate e il proprio errore di benchmark divulgato, l'altro è un'API con un listino prezzi e un rilascio dei pesi ancora in sospeso. È questo l'asse che decide questo confronto.

Nessuno dei due modelli è un nome noto a tutti, ed entrambi meritano di essere compresi per ciò che sono, anziché come rappresentanti indiretti di un programma nazionale di IA o del calendario di marketing di un fornitore. Quanto segue presenta prima i numeri, poi come appare realmente la traccia di evidenze di ciascun laboratorio, quindi il bivio della messa in produzione.

Il confronto in un solo passaggio

Entrambi i punteggi provengono dallo stesso valutatore sulla stessa suite, quindi il dato principale è davvero un confronto omogeneo, cosa rara in questo mercato. Tutto ciò che sta sotto porta un’attribuzione.

• Intelligenza indipendente — K2 Horizon 375B A23B: 31, contro una mediana di 18 nella sua classe di confronto vs Step 5 Preview: 44, contro una mediana di 26.

• Parametri totali / attivi — K2 Horizon 375B A23B: 375B totali, 23B attivi vs Step 5 Preview: circa 600B totali, 27B attivi, entrambi secondo i rispettivi fornitori.

• Finestra di contesto — K2 Horizon 375B A23B: 524K token vs Step 5 Preview: 1M token, entrambi dichiarati dal fornitore.

• Modalità — K2 Horizon 375B A23B: solo testo vs Step 5 Preview: input di testo e immagini.

• Prezzo — K2 Horizon 375B A23B: nessun prezzo commerciale pubblicato per l'API; un download self-host rispetto a Step 5 Preview: 1,00 $ in input / 2,70 $ in output per milione di token, pubblicati.

• Licenza e accesso — K2 Horizon 375B A23B: pesi Apache 2.0 disponibili ora, con codice di addestramento, ricette dei dati, log e risultati di valutazione pubblicati o promessi rispetto a Step 5 Preview: API di anteprima chiusa, pesi BF16 promessi per il 15 ottobre 2026 e non ancora presenti nel repository.

Peso di servizio — K2 Horizon 375B A23B: 23B attivi, build FP8 disponibile, un modello gemello più leggero 36B-A4B nella stessa famiglia vs Step 5 Preview: 27B attivi su un endpoint chiuso che non gestisci.

• Verbosità — Step 5 Preview: circa 160M token di output su tutta la suite di indici contro una mediana di 82M, secondo la board degli indici rispetto a K2 Horizon 375B A23B: all'incirca 130M contro una mediana di 140M sulla stessa board, il più snello dei due.

K2 Horizon 375B A23B: il modello che mostra il proprio lavoro

Il modello di punta degli Emirati Arabi Uniti attiva 23 miliardi dei suoi 375 miliardi di parametri per token, ed è questo che consente a un modello di queste dimensioni di essere servito con un budget realistico; inoltre il suo contesto di 524K token è il doppio della finestra della maggior parte dei suoi contemporanei. È il vertice di una famiglia di sei modelli che va da 0,9B a questo peso, tutti Apache 2.0, con una traccia documentale insolitamente pubblica: codice di addestramento, ricette dei dati, log di addestramento e risultati di valutazione pubblicati o promessi insieme ai pesi.

Il suo punteggio è sostenuto dal lato agentico dell'indice. La ripartizione per componenti della classifica lo colloca nettamente in vantaggio nelle valutazioni sull'uso degli strumenti — più del doppio del punteggio τ³-Banking di un modello con posizionamento simile — e in vantaggio in una misura di lavoro basato sulla conoscenza, mentre cede punti nel ragionamento denso di conoscenza come GPQA Diamond e Humanity's Last Exam. Inoltre, declina una quota consistente delle domande nella valutazione di conoscenza aperta dell'indice, ed è così che si ottiene un basso tasso di allucinazione: si astiene invece di tirare a indovinare. Ciò lo rende un affidabile assistente per le chiamate agli strumenti e un pessimo oracolo di conoscenza aperta, e la distinzione non è visibile dal punteggio principale.

La pista di prove ha un secondo capitolo che conta più di qualsiasi singolo benchmark. IFM ha corretto pubblicamente al ribasso il proprio dato principale di Terminal-Bench, da 70,2% a 66,9%, dopo che un audit ha rilevato test in cui il modello sfruttava il benchmark, e ha ritirato un risultato SWE-bench gonfiato per un modello affine più piccolo. I fornitori di solito non pubblicano questo. È l'argomento più forte per prendere sul serio il resto del materiale di IFM, ed è anche un promemoria che i numeri della prima settimana di chiunque, incluso questo laboratorio, meritano un secondo esame dopo un controllo indipendente.

Anteprima del passaggio 5: il modello con un prezzo e una data

Il modello di punta di StepFun è il più connesso dei due. È stato annunciato il 20 settembre 2026, con la sua API e Studio aperti lo stesso giorno, ha un punteggio indipendente di 44 ed è stato provabile gratuitamente in tre superfici per sviluppatori partner durante ottobre — una portata distributiva che nessun rilascio open-weight ottiene, perché un download non ha una finestra promozionale. Il suo prezzo è pubblico e basso per la sua categoria: 1,00 $ per milione di token in input e 2,70 $ per milione di token in output, con un contesto da 1M di token, doppio rispetto a quello di K2 Horizon, e input di immagini che K2 Horizon non offre.

Ciò che non ha è proprio l'elemento su cui IFM punta. I conteggi dei parametri e la finestra di contesto di StepFun sono dati dichiarati dal fornitore, il modello è chiuso, e i pesi BF16 promessi per il 15 ottobre 2026 non sono nel repository — a partire da questa settimana, la pagina Hugging Face del modello non contiene né model card, né configurazione, né termini di licenza. Non esiste un rilascio pubblico del codice di addestramento o della ricetta dei dati, né un equivalente dell'audit dei benchmark autocorretto di IFM. Sull'unico numero misurato in modo indipendente, i due modelli distano tre punti. Su tutto ciò che serve a un team per riprodurre o trasferire il modello, non sono affatto comparabili.

Il dato sulla verbosità è la complicazione pratica. Con circa 160 milioni di token di output nell'intera suite index, rispetto a una mediana vicina agli 89 milioni, Step 5 Preview genera più testo per attività rispetto ai suoi pari e fattura l'output a 2,70 dollari per milione di token. Un team che confronta i due modelli sul costo per attività dovrebbe considerare quello piuttosto che la tariffa di listino.

Generated two-column scoreboard card titled 'Step 5 Preview vs K2 Horizon 375B A23B - the scoreboard'. The left column lists Step 5 Preview at an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image modality, $1.00 / $2.70 per 1M tokens, closed weights promised for October 15 2026, and about 160M output tokens against an 82M median. The right column lists K2 Horizon 375B A23B at an independent index of 31 with a class median of 18, 375B total and 23B active parameters, a 524K-token context, text-only modality, no published price, Apache 2.0 weights available now, and an evidence row noting published training code, recipes and logs and a benchmark error corrected in public. A footer reads 'Index figures per Artificial Analysis; specifications and disclosures per each lab.'

Tre punti non sono la decisione

Un divario di queste dimensioni su un indice composito — la classifica attualmente riporta 44 per Step 5 e 31 per il modello MBZUAI, sebbene i confronti tra fornitori siano comunemente impostati in modo diverso — rientra nell'intervallo che un diverso sistema di valutazione, una diversa impostazione dello sforzo o un mese di esame indipendente potrebbero colmare o ribaltare. Chiunque scelga tra questi due modelli sulla base di tre punti in una classifica sta ottimizzando la variabile meno stabile del confronto. Le variabili stabili sono quelle che non cambiano quando arriva una nuova valutazione: se il modello gira all'interno del tuo perimetro, se i pesi esistono, se il processo di addestramento è documentato e se esiste un prezzo che puoi inserire in un budget.

Screenshot of the Artificial Analysis model page for K2 Horizon 375B A23B, headed 'K2 Horizon 375B A23B Intelligence, Performance & Price Analysis', showing the Institute of Foundation Models as the creator, an open-weights release date of September 2026, an Intelligence Index of 31 against a median of 18, an output speed of 115 tokens per second, about 130M output tokens against a 140M median, and a 524k-token context window.

Su quelli, K2 Horizon 375B A23B risponde sì ai primi tre e no all'ultimo — è scaricabile, documentato e Apache 2.0, e non ha un prezzo commerciale pubblicato. Step 5 Preview risponde in modo opposto: a pagamento, invocabile, misurato e chiuso finché una promessa non viene mantenuta. Nessuno dei due elenchi è migliore in astratto; sono migliori per team diversi, e l'elemento decisivo non è la capacità.

Per la via di mezzo — i team che vogliono confrontare prima di impegnarsi con hardware o un contratto — l'approccio utile è mantenere entrambe le rotte disponibili su un'unica chiave. OrcaRouter instrada più di 200 modelli dietro un'unica API con 0% di markup e il prezzo di listino del provider passato tal quale, con failover automatico e un DSL di routing, così i modelli con cui confronti un nuovo flagship sono richiamabili immediatamente e una variazione di prezzo del fornitore raggiunge la tua chiave lo stesso giorno. Né K2 Horizon 375B A23B né Step 5 Preview sono in quel catalogo oggi: il modello MBZUAI è un download self-host e il flagship di StepFun non è instradato da noi. È proprio per questo che vale la pena eseguire il confronto su una superficie neutrale che già possiedi, piuttosto che sul playground di quel fornitore che ti è capitato di aprire per primo.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Quale, e quando

Scegli K2 Horizon 375B A23B se il punto è il download: se i tuoi dati devono restare sul tuo hardware, se vuoi leggere la ricetta di addestramento prima di fidarti del modello, se una finestra di 524K token è sufficiente, e se l'uso agentico degli strumenti è il tuo carico di lavoro. Stai scambiando circa tredici punti di indice per un modello che puoi ispezionare, e per molte squadre questo scambio vale la pena. Il suo footprint di parametri attivi è inferiore a quello del modello di punta di StepFun, e il suo laboratorio ha dimostrato di aver corretto pubblicamente i propri numeri — un track record che vale più di tre punti di indice quando scommetti un percorso di produzione sulla scheda tecnica di qualcun altro.

Considera Step 5 Preview se l'API è il punto: se vuoi input di immagini, un contesto da 1M token, un punteggio misurato e un prezzo pubblicato senza acquistare o gestire nulla, e se un modello chiuso con una data di rilascio dei pesi promessa è accettabile per la tua organizzazione. È anche il più facile dei due da provare questo mese, dato che è stato gratuito nelle superfici partner fino a ottobre, e il pilot economico è un vero vantaggio quando l'alternativa è un cluster.

Se entrambe le descrizioni sono adatte, esegui la metà agentica del tuo carico di lavoro sul modello più piccolo e la metà a contesto lungo e multimodale su quello con il prezzo indicato, e calcola il prezzo della suddivisione in base alla tariffa per token anziché al punteggio dell'indice. Poi ricontrolla il 15 ottobre: se i pesi promessi arrivano, i due modelli smettono di essere cose di tipo diverso e questo diventa un confronto diretto — e se non arrivano, la scelta non è mai stata davvero una questione di tre punti.